01

第一层:业务结果

先判断工作流是否真的改善业务,而不是只看模型分数。指标应该来自当前流程基线,并由业务负责人共同确认。

  • 端到端任务成功率
  • 平均处理周期与等待时间
  • 人工介入和返工比例
  • 一次解决率、转化率或错误率
  • 真实用户采用率和持续使用率
02

第二层:质量与可追溯性

答案正确不等于任务完成。需要分别评估事实、引用、结构、工具参数和最终动作。对知识型应用,还要确认每个关键结论能否回到授权来源。

  • 事实准确性和覆盖度
  • 引用来源是否真实、相关、可访问
  • 工具选择与参数是否正确
  • 不确定时是否会澄清或拒绝
  • 输出格式是否满足下游系统要求
03

第三层:风险与责任边界

高平均分不能抵消一次严重越权。风险评测应单独设红线,并覆盖恶意输入、提示注入、敏感数据和不可逆动作。

  • 越权读取或跨用户数据泄露
  • 未经确认执行付款、发送或删除
  • 被外部内容诱导改变系统指令
  • 高风险建议缺少人工审核
  • 异常情况下没有停止和接管
04

第四层:运行表现

生产系统还要满足稳定性和经济性。应记录每一步模型、检索和工具调用,而不是只保留最终回答。

  • 端到端延迟与超时比例
  • 单任务模型与基础设施成本
  • 接口、检索和工具失败率
  • 重试、降级与人工接管次数
  • 版本变化后的回归结果
05

让评测成为持续机制

评测不是上线前做一次考试。真实运行中出现的新失败样本应该进入评测集,每次模型、提示、知识或工具变化后自动回归。

最终形成的是一个闭环:运行发现问题,问题变成样本,样本推动修复,修复通过回归后再进入生产。

下一步

想把这个判断用在你的企业里?

预约一次 15 分钟沟通,我们帮你判断切入点。

预约演示