AI 系统可靠性不是一句“模型很强”
一个 AI 系统是否可靠,要看它在真实业务流程中的表现,而不是只看模型参数或榜单。
关键评估维度
- 准确性:回答是否正确。
- 可追溯性:是否能引用来源。
- 鲁棒性:面对模糊、错误、恶意输入时是否稳定。
- 权限控制:是否会越权读取、修改或发送信息。
- 隐私保护:是否泄露用户数据和业务数据。
- 可回滚性:错误操作是否能恢复。
- 人工审核:关键动作是否需要人工确认。
实用评估方法
- 准备一组真实业务测试集。
- 标注正确答案或可接受范围。
- 记录模型回答、引用来源和工具调用过程。
- 对失败案例分类:检索失败、理解失败、生成失败、权限失败。
- 持续迭代 Prompt、知识库、工具权限和评估指标。
最重要的原则
AI 可以提高效率,但不能替代责任链。越接近业务关键动作,越需要明确权限、日志、审批和回滚机制。