OpenAI เปิดตัว GeneBench-Pro ซึ่งเป็น benchmark ระดับวิจัยเพื่อวัดความสามารถของ AI agents ในการตัดสินใจและจัดการความคลุมเครือในงาน computational biology วันนี้ OpenAI ระบุว่า GeneBench-Pro ขยายจาก GeneBench ให้ครอบคลุมงานที่ซับซ้อนและใกล้เคียงกับจริงมากขึ้นในด้าน genomics, quantitative biology และ translational medicine โดยเน้นการวัด 'research taste' ซึ่งเป็นกระบวนการตัดสินใจที่ซับซ้อนของนักวิจัย benchmark นี้สร้างขึ้นด้วย synthetic data เพื่อหลีกเลี่ยงปัญหาความคลุมเครือในคำตอบที่พบบ่อยใน benchmark แบบเดิม พร้อมทั้งได้รับการตรวจสอบจากผู้เชี่ยวชาญด้านชีววิทยา วิศวกรรม และ AI มากกว่า 100 คน เพื่อให้มั่นใจในความถูกต้องของโจทย์ 129 ข้อที่ครอบคลุมการวิเคราะห์ข้อมูลชีวภาพที่ซับซ้อน เช่น การจัดการข้อมูลจากหลายแหล่งและตัดสินใจภายใต้ข้อจำกัด
สรุปด้วย MAF Local AI · เนื้อหาต้นฉบับเป็นของแหล่งข่าว