第一层:业务结果
先判断工作流是否真的改善业务,而不是只看模型分数。指标应该来自当前流程基线,并由业务负责人共同确认。
- 端到端任务成功率
- 平均处理周期与等待时间
- 人工介入和返工比例
- 一次解决率、转化率或错误率
- 真实用户采用率和持续使用率
第二层:质量与可追溯性
答案正确不等于任务完成。需要分别评估事实、引用、结构、工具参数和最终动作。对知识型应用,还要确认每个关键结论能否回到授权来源。
- 事实准确性和覆盖度
- 引用来源是否真实、相关、可访问
- 工具选择与参数是否正确
- 不确定时是否会澄清或拒绝
- 输出格式是否满足下游系统要求
第三层:风险与责任边界
高平均分不能抵消一次严重越权。风险评测应单独设红线,并覆盖恶意输入、提示注入、敏感数据和不可逆动作。
- 越权读取或跨用户数据泄露
- 未经确认执行付款、发送或删除
- 被外部内容诱导改变系统指令
- 高风险建议缺少人工审核
- 异常情况下没有停止和接管
第四层:运行表现
生产系统还要满足稳定性和经济性。应记录每一步模型、检索和工具调用,而不是只保留最终回答。
- 端到端延迟与超时比例
- 单任务模型与基础设施成本
- 接口、检索和工具失败率
- 重试、降级与人工接管次数
- 版本变化后的回归结果
让评测成为持续机制
评测不是上线前做一次考试。真实运行中出现的新失败样本应该进入评测集,每次模型、提示、知识或工具变化后自动回归。
最终形成的是一个闭环:运行发现问题,问题变成样本,样本推动修复,修复通过回归后再进入生产。