ภารกิจที่ 6 · การทบทวนโดยอิงหลักฐาน
ให้คะแนนสิ่งที่การถอดเสียงสนับสนุน ไม่ใช่สิ่งที่โมเดลจินตนาการ
สร้างการตรวจสอบแบบมีขอบเขตโดยใช้ความช่วยเหลือจาก AI พร้อมด้วยหลักฐานการถอดเสียงที่อ้างอิง ความไม่แน่นอนที่ชัดเจน สรุปข้อเท็จจริง การดำเนินการที่แนะนำ และเส้นทางแทนที่โดยมนุษย์
การตรวจสอบ AI ถือเป็นคำแนะนำ ไม่ได้แทนที่ QA ของมนุษย์ และต้องไม่ทำการจ้างงาน เครดิต กฎหมาย การแพทย์ หรือการตัดสินใจที่คล้ายคลึงกันที่มีผลกระทบสูง
ลำดับการสร้าง
- กำหนดเกณฑ์แต่ละเกณฑ์ คะแนนที่มีขอบเขต หลักฐานการถอดเสียงที่ต้องการ การใช้เหตุผล ความมั่นใจ และพฤติกรรมของหลักฐานที่ขาดหายไป
- แยกสรุปข้อเท็จจริงออกจากคะแนนประเมิน และห้ามข้อผูกพันที่ประดิษฐ์ขึ้น ข้อเท็จจริงของลูกค้า หรือผลลัพธ์
- กำหนดเวอร์ชันของรูบริก พรอมต์ และโมเดลเส้นทางที่ใช้กับทุกผลลัพธ์
- เรียกใช้การถดถอยแบบคะแนนคงที่ด้านล่าง ที่ และเหนือทุกขอบเขตของช่วงที่รองรับ
- เรียกใช้การถอดเสียงฝ่ายตรงข้ามหนึ่งรายการและตัวอย่างการสอบเทียบที่ตรวจสอบโดยมนุษย์หนึ่งรายการ
- เขียนคะแนน การใช้เหตุผล สรุป และการดำเนินการถัดไปกลับไปยังรายการ CRM ที่ถูกต้อง และตรวจสอบ read-back
หลักฐานที่จำเป็น
- เวอร์ชันรูบริก คะแนนที่มีโครงสร้าง JSON และผลลัพธ์การถดถอยขอบเขตที่แน่นอน
- การอ้างอิงการถอดเสียงหรือผลลัพธ์หลักฐานไม่เพียงพอที่ชัดเจนสำหรับทุกเกณฑ์
- ผลลัพธ์ที่ตรงกันข้าม การเปรียบเทียบการสอบเทียบ การแทนที่โดยมนุษย์ และ CRM read-back
ไฟล์อ้างอิงและแหล่งที่มา
เอกสารผู้ขายอย่างเป็นทางการ
ประตูประเมิน
ผ่าน
ผ่าน: ทุกคะแนนสามารถตรวจสอบได้ มีการเชื่อมโยงหลักฐาน มีขอบเขต กำหนดเวอร์ชัน ทดสอบขอบเขต และย้อนกลับได้โดยผู้ตรวจสอบที่เป็นมนุษย์
ปรับปรุงใหม่
แก้ไข: มีผลลัพธ์ที่เป็นประโยชน์ แต่การอ้างอิง ความไม่แน่นอน ขอบเขตของคะแนน การสอบเทียบ หรือการแทนที่โดยมนุษย์ไม่สมบูรณ์
ล้มเหลวอย่างหนัก
ความล้มเหลวอย่างหนัก: หลักฐานที่ประดิษฐ์ขึ้น การให้คะแนนที่ไม่ได้รับการสนับสนุน ความไม่แน่นอนที่ซ่อนอยู่ หรือการตัดสินใจที่มีผลกระทบสูงโดยอิสระปรากฏขึ้น
การส่งผ่านการตรวจสอบโดยมนุษย์
