Misión 6 · Revisión basada en evidencia
Califique lo que respalda la transcripción, no lo que imagina el modelo.
Produzca una revisión limitada asistida por IA con evidencia de transcripción citada, incertidumbre explícita, resumen fáctico, acciones recomendadas y una ruta de anulación humana.
La revisión de la IA es consultiva. No reemplaza el control de calidad humano y no debe tomar decisiones laborales, crediticias, legales, médicas o similares de alto impacto.
Secuencia de construcción
- Defina cada criterio de rúbrica, puntuación acotada, evidencia de transcripción requerida, razonamiento, confianza y comportamiento de evidencia faltante.
- Separe el resumen fáctico de la puntuación evaluativa y prohíba compromisos, hechos o resultados de clientes inventados.
- Versione la rúbrica, el mensaje y la ruta del modelo utilizados para cada resultado.
- Ejecute regresiones fijas de normalización de puntuación por debajo, en y por encima de cada límite de rango admitido.
- Ejecute una transcripción contradictoria y un ejemplo de calibración revisado por humanos.
- Escriba la puntuación, el razonamiento, el resumen y las siguientes acciones en el elemento CRM correcto y verifique el read-back.
Prueba requerida
- Versión de rúbrica, puntuación estructurada JSON y resultados de regresión de límites exactos.
- Citas de transcripciones o un resultado explícito de evidencia insuficiente para cada criterio.
- Resultado adversario, comparación de calibración, anulación humana y CRM read-back.
Archivos de referencia y fuentes.
- Ejemplo de transcripción sintética
- Ejemplo de puntuación sintética
- Rúbrica de aprobar, revisar y suspender
Documentación oficial del proveedor
Puerta de evaluación
Aprobar
Aprobado: cada puntaje es inspeccionable, vinculado a evidencia, limitado, versionado, probado en límites y reversible por un revisor humano.
Revisar
Revisar: existen resultados útiles, pero las citas, la incertidumbre, los límites de puntuación, la calibración o la anulación humana están incompletos.
fracaso duro
Fracaso difícil: aparecen pruebas fabricadas, puntuaciones sin fundamento, incertidumbre oculta o decisiones autónomas de alto impacto.
Envío revisado por humanos
