องค์กรวิจัยเปิดตัว 'AI Disagreement Index' ระบบวัดระดับความไม่เห็นพ้องระหว่างโมเดล AI ต่อการแนะนำเครื่องมือในแต่ละหมวดหมู่ ผ่านการวิเคราะห์ข้อมูลแบบ cross-engine โดยใช้สถิติเชิงลึกอย่าง Fleiss’ kappa เพื่อวัดความเห็นพ้องระหว่างโมเดล ข้อมูลทั้งหมดเปิดเผยแบบ open-source ในรูปแบบ JSONL พร้อม DOI สำหรับการอ้างอิงอย่างเป็นทางการ โครงการนี้อัปเดตข้อมูลทุกเดือน ต่างจากวิธีการวิเคราะห์แบบเดิมที่เน้นการจัดอันดับเครื่องมือ (ranking) แต่ไม่แสดงความไม่แน่นอนของโมเดล ผลการวิจัยชี้ให้เห็นว่าโมเดล AI หลายตัวมีความเห็นต่างกันอย่างมากในบางหมวดหมู่ แม้จะใช้ข้อมูลฝึกอบรมคล้ายกัน ขณะที่บางหมวดหมู่มีความเห็นพ้องสูง สะท้อนถึงความเสถียรของโมเดลในบริบทเฉพาะ โครงการนี้มี 3 ข้อผูกพันหลัก ได้แก่ 1) ข้อมูลเปิดเผยทั้งหมด 2) ใช้สถิติเชิงลึกแทนการประเมินแบบสัมผัส 3) ติดตามความเปลี่ยนแปลงทุกเดือน ข้อมูลจะถูกจัดเก็บในรูปแบบ JSONL พร้อม DOI เพื่อให้สามารถตรวจสอบและทำซ้ำได้ ต่างจากวิธีการวิเคราะห์แบบเดิมที่เน้นการจัดอันดับเครื่องมือ (ranking) แต่ไม่แสดงความไม่แน่นอนของโมเดล ข้อมูลทั้งหมดถูกจัดเก็บในรูปแบบ JSONL พร้อม DOI สำหรับการอ้างอิงอย่างเป็นทางการ
สรุปด้วย MAF Local AI · เนื้อหาต้นฉบับเป็นของแหล่งข่าว