任务 6 · 循证审查
对文字记录支持的内容进行评分,而不是对模型的想象进行评分。
利用引用的转录证据、明确的不确定性、事实总结、建议的行动和人工覆盖路径,生成有限的人工智能辅助审查。
人工智能审查是建议性的。它不会取代人类 QA,并且不得做出影响较大的就业、信贷、法律、医疗或类似决策。
构建顺序
- 定义每个评分标准、有界分数、所需的成绩单证据、推理、置信度和缺失证据行为。
- 将事实摘要与评估分数分开,并禁止捏造承诺、客户事实或结果。
- 对每个结果使用的评分标准、提示和模型路线进行版本控制。
- 在每个支持的范围边界之下、之上和之上运行固定分数归一化回归。
- 运行一份对抗性转录本和一份经过人工审查的校准示例。
- 将分数、推理、总结和下一步操作写回正确的 CRM 项目并验证 read-back 。
所需证明
- Rubric 版本、结构化评分 JSON 和精确的边界回归结果。
- 每个标准的抄本引用或明确的证据不足的结果。
- 对抗结果、校准比较、人工干预和 CRM read-back 。
参考文件和来源
官方供应商文档
评估门
经过
通过:每个分数都是可检查的、有证据关联的、有界的、版本化的、边界测试的,并且可由人工审核者逆转。
修订
修订:存在有用的输出,但引用、不确定性、分数边界、校准或人工覆盖不完整。
硬失败
硬失败:出现伪造的证据、不受支持的评分、隐藏的不确定性或自主的高影响力决策。
人工审核的提交
