Missione 6 · Revisione basata sull'evidenza
Assegna un punteggio a ciò che supporta la trascrizione, non a ciò che il modello immagina.
Produrre una revisione limitata assistita dall'intelligenza artificiale con prove di trascrizione citate, incertezza esplicita, riepilogo dei fatti, azioni consigliate e un percorso di sostituzione umana.
La revisione dell'intelligenza artificiale è consultiva. Non sostituisce la garanzia di qualità umana e non deve prendere decisioni ad alto impatto in materia di lavoro, credito, legali, mediche o simili.
Costruisci sequenza
- Definire ciascun criterio della rubrica, il punteggio limitato, le prove di trascrizione richieste, il ragionamento, la fiducia e il comportamento in caso di prove mancanti.
- Separare il riepilogo fattuale dal punteggio valutativo e vietare impegni, fatti o risultati inventati sui clienti.
- Versione della rubrica, del prompt e del percorso del modello utilizzato per ogni risultato.
- Esegui regressioni di normalizzazione del punteggio fisso al di sotto, in corrispondenza e al di sopra di ogni limite di intervallo supportato.
- Esegui una trascrizione contraddittoria e un esempio di calibrazione revisionata da esseri umani.
- Riscrivi il punteggio, il ragionamento, il riepilogo e le azioni successive nell'elemento CRM corretto e verifica read-back.
Prova richiesta
- Versione della rubrica, punteggio strutturato JSON e risultati esatti della regressione ai confini.
- Citazioni trascritte o un risultato esplicito di prova insufficiente per ogni criterio.
- Risultato contraddittorio, confronto tra calibrazioni, override umano e CRM read-back.
File e fonti di riferimento
- Esempio di trascrizione sintetica
- Esempio di punteggio sintetico
- Passare, rivedere e fallire gravemente la rubrica
Documentazione ufficiale del fornitore
Cancello di valutazione
Passaggio
Superato: ogni punteggio è ispezionabile, collegato all'evidenza, delimitato, sottoposto a versione, testato sui limiti e reversibile da un revisore umano.
Rivedere
Revisione: esistono risultati utili ma citazioni, incertezza, limiti di punteggio, calibrazione o override umano sono incompleti.
Difficile fallire
Hard fail: compaiono prove fabbricate, punteggi non supportati, incertezza nascosta o decisioni autonome ad alto impatto.
Presentazione sottoposta a revisione umana
