ミッション 6 · 証拠に基づいたレビュー
モデルが想像するものではなく、トランスクリプトがサポートするものをスコア付けします。
引用された転写証拠、明示的な不確実性、事実の概要、推奨されるアクション、人間によるオーバーライド パスを含む、限定された AI 支援レビューを作成します。
AI レビューは助言です。人間の QA に代わるものではなく、雇用、信用、法的、医療、または同様の影響の大きい決定を行ってはなりません。
ビルドシーケンス
- 各ルーブリック基準、制限されたスコア、必要な成績証明書の証拠、推論、信頼性、および証拠の欠如の行動を定義します。
- 事実の概要を評価スコアから分離し、でっち上げられたコミットメント、顧客の事実、または結果を禁止します。
- すべての結果に使用されるルーブリック、プロンプト、モデル ルートをバージョン管理します。
- サポートされているすべての範囲境界の下、上、および上で、固定スコア正規化回帰を実行します。
- 1 つの敵対的トランスクリプトと 1 つの人間によるレビュー済みのキャリブレーション サンプルを実行します。
- スコア、推論、概要、次のアクションを正しい CRM 項目に書き込み、 read-back を確認します。
必要な証拠
- ルーブリック バージョン、構造化スコア JSON 、および正確な境界回帰結果。
- 成績証明書の引用またはすべての基準に対する明示的な不十分な証拠の結果。
- 敵対的な結果、キャリブレーションの比較、人間によるオーバーライド、および CRM read-back 。
参照ファイルとソース
ベンダーの公式ドキュメント
評価ゲート
合格
合格: すべてのスコアは検査可能であり、証拠と関連付けられ、境界があり、バージョン管理され、境界テストが行われ、人間のレビュー担当者によって元に戻すことができます。
改訂
修正: 有用な出力は存在しますが、引用、不確実性、スコア境界、キャリブレーション、または人間によるオーバーライドが不完全です。
ハードフェイル
ハードフェイル: 捏造された証拠、裏付けのないスコアリング、隠れた不確実性、または自律的な影響の大きい決定が現れる。
人間による審査を受けた提出物
