미션 6 · 증거 기반 검토
모델이 상상하는 것이 아니라 성적표가 지원하는 것을 점수로 매깁니다.
인용된 녹취록 증거, 명시적인 불확실성, 사실 요약, 권장 조치 및 사람이 재정의하는 경로를 포함하여 제한된 AI 지원 검토를 생성합니다.
AI 검토는 권고사항입니다. 이는 인간의 QA를 대체하지 않으며 고용, 신용, 법률, 의료 또는 이와 유사한 결정을 내려서는 안 됩니다.
빌드 순서
- 각 루브릭 기준, 제한 점수, 필수 성적표 증거, 추론, 자신감 및 증거 누락 행동을 정의합니다.
- 평가 점수와 사실 요약을 분리하고 허위 약속, 고객 사실 또는 결과를 금지합니다.
- 모든 결과에 사용되는 루브릭, 프롬프트 및 모델 경로의 버전을 지정하세요.
- 지원되는 모든 범위 경계 아래, 위, 아래에서 고정 점수 정규화 회귀를 실행합니다.
- 하나의 적대적 트랜스크립트와 하나의 사람이 검토한 교정 예제를 실행합니다.
- 점수, 추론, 요약 및 다음 조치를 올바른 CRM 항목에 다시 작성하고 read-back 를 확인하십시오.
필수 증명
- 루브릭 버전, 구조화된 점수 JSON 및 정확한 경계 회귀 결과.
- 모든 기준에 대한 성적표 인용 또는 명시적인 증거 불충분 결과.
- 적대적 결과, 교정 비교, 휴먼 오버라이드 및 CRM read-back.
참조 파일 및 소스
공식 공급업체 문서
평가 게이트
통과하다
통과: 모든 점수는 인간 검토자가 검사 가능하고, 증거 연결, 제한, 버전 지정, 경계 테스트 및 되돌릴 수 있습니다.
개정하다
수정: 유용한 출력이 존재하지만 인용, 불확실성, 점수 경계, 보정 또는 사람의 재정의가 불완전합니다.
심각한 실패
심각한 실패: 조작된 증거, 지원되지 않는 채점, 숨겨진 불확실성 또는 자율적이고 영향력이 큰 결정이 나타납니다.
사람의 검토를 거친 제출
