评估与质量门
Evaluation lab 用评估集批量运行工作流。每项用例保存判定与失败原因,帮助你区分「模型偶发波动」和「确实引入了回归」。评测输入会作为本次运行的初始工作流 State。
创建第一组评测集
Section titled “创建第一组评测集”- 打开工作流内的 评测集;
- 点击创建,命名为「客户反馈分类回归」,描述覆盖范围;
- 新建 Case,填写名称、说明和 输入 JSON;
- 在 验证规则 中添加预期:可验证最终输出字段或最终输出文本;
- 需要安全控制时,添加 安全断言,列出不得出现的字段路径或文本;
- 需要验证 Agent 是否真的使用工具或正确走分支时,添加工具轨迹、节点路径或分支命中断言;
- 保存后运行评测集,查看每个 Case 的证据和失败原因。
示例输入 JSON:
{ "feedback": "升级后导出的 CSV 无法打开,今天下午要给财务对账。" }对应的规则可以要求最终输出字段 priority 等于 high,节点路径必须经过“分类建议”,并禁止最终输出出现未授权的手机号字段。
- 收集覆盖常见、边界与高风险情形的真实输入;
- 为每个用例定义可判断的预期和评分标准;
- 在修改 Prompt、节点、模型或工具后批量运行;
- 对比两个版本,识别新增失败、修复与未变化项;
- 在发布前用质量门要求关键条件通过,必要时记录带理由的人工豁免。
评估会保存相应的工作流快照,因此草稿改动不会被误认为已发布版本的结果。
配置发布质量门
Section titled “配置发布质量门”在同一页打开 发布质量门:
- 开启 必须至少有一次评测;
- 设置最低通过率、最大成本和最大耗时;
- 在 发布必检评测集 选择关键 Suite;
- 保存后,发布时 Workrun 会读取当前候选工作流快照对应的最近评测。
未通过时可以明确确认旁路并填写理由;这是有审计记录的例外,而不是替代修复的常规流程。
素材占位 · 视频
evaluations/01-create-case-and-gate.mp4(60–90 秒)
画面:创建 Suite、添加带 JSON 输入和字段断言的 Case、运行、查看失败证据、设置最低通过率质量门。
用途:把“评测”从抽象概念变成发布前的操作流程。