OpenAI พบว่า ~30% ของ SWE-Bench Pro ซึ่งเป็น benchmark ประเมินความสามารถ coding ของโมเดล มีข้อบกพร่องร้ายแรงหลังตรวจสอบอย่างละเอียด กระทบความแม่นยำในการประเมินประสิทธิภาพโมเดล และอาจทำให้การตัดสินใจด้านความปลอดภัยผิดพลาด ปัญหาหลักแบ่งเป็น 4 ประเภท ได้แก่ การทดสอบที่เข้มงวดเกินไป คำสั่งไม่ชัดเจน การทดสอบครอบคลุมไม่เพียงพอ และคำสั่งหลอกให้โมเดลทำงานผิดพลาด ทีม OpenAI ใช้ระบบ agent-based reviews ร่วมกับการวิเคราะห์โดยนักพัฒนาซอฟต์แวร์เพื่อตรวจสอบความสมบูรณ์ของ task ทั้งหมด ชี้ให้เห็นว่าการประเมินโมเดลต้องพิจารณาข้อมูลอย่างรอบคอบเพื่อหลีกเลี่ยงข้อผิดพลาดที่อาจส่งผลต่อการใช้งานจริง SWE-Bench Pro ถูกออกแบบเพื่อปรับปรุง SWE-bench Verified โดยทดสอบโมเดลในงาน coding ที่มีความซับซ้อนและใกล้เคียงกับงานจริงมากขึ้น แต่จากการตรวจสอบพบว่า 30% ของ task ไม่สมบูรณ์ ทีม OpenAI ใช้ pipeline วิเคราะห์ข้อมูลร่วมกับนักพัฒนาซอฟต์แวร์ 5 คน เพื่อตรวจสอบความถูกต้องของ task ทั้งหมด ผลการตรวจสอบชี้ให้เห็นความท้าทายในการสร้าง benchmark ที่ทั้งยากและยุติธรรม พร้อมย้ำว่าการใช้ agent ช่วยเพิ่มประสิทธิภาพการตรวจสอบคุณภาพข้อมูลได้อย่างมีนัยสำคัญ
สรุปด้วย MAF Local AI · เนื้อหาต้นฉบับเป็นของแหล่งข่าว