Mass General Brigham สร้าง BRIDGE ระบบประเมิน LLM ที่วัดความสามารถในการอ่านข้อมูลการแพทย์จริงจาก EHRs, รายงานกรณีศึกษา, และการปรึกษาแพทย์ 9 ภาษา พบว่าโมเดลที่ทำคะแนนข้อสอบสูงสุด 92 แต่ได้เพียง 44.8% บน BRIDGE สะท้อนความแตกต่างของประสิทธิภาพ AI ตามสาขาและภาษา ช่วยพัฒนา AI ที่แม่นยำสำหรับผู้ป่วยที่ไม่ใช่ภาษาอังกฤษ โดยสร้างตารางคะแนนสาธารณะที่อัปเดตต่อเนื่อง ครอบคลุม 95 โมเดลจาก 59 แหล่ง 14 สาขา BRIDGE ใช้ข้อมูลจากงานจริงแทนข้อสอบมาตรฐาน ช่วยให้แพทย์เลือก AI ที่เหมาะสมและนักพัฒนาปรับปรุงโมเดล งานวิจัยตีพิมพ์ใน Nature Biomedical Engineering ระบุว่า AI ต่างกันตามสาขาและภาษา ชี้ความจำเป็นในการออกแบบ AI ที่ยุติธรรมสำหรับผู้ป่วยทั่วโลก
อ่านต้นฉบับwww.massgeneralbrigham.org/en/about/newsroom/press-releases/evaluating-ai-performance-for-everyday-patient-care
AIการแพทย์Mass General BrighamBRIDGELLM
สรุปด้วย MAF Local AI · เนื้อหาต้นฉบับเป็นของแหล่งข่าว