Simon Willison นักพัฒนาซอฟต์แวร์ ทดสอบ 7 โมเดล AI ชั้นนำ (เช่น GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash) ด้วยการสร้าง SVG ของสัตว์และยานพาหนะ 48 ชุด (8 สัตว์ x 6 ยานพาหนะ) เพื่อตรวจสอบว่า AI Labs ปรับแต่งโมเดลเพื่อ 'pelicanmaxxing' (การสร้าง SVG นกเค้าร้องขี่จักรยาน) หรือไม่ ผลการทดลองพบว่าโมเดลไม่ได้ให้ผลลัพธ์ดีกว่าการสร้าง SVG ของสัตว์และวัตถุอื่นๆ แม้จะมีการทดสอบเพิ่มเติมด้วยการใช้ LLM ประเมินผลและวิเคราะห์ด้วย Claude Fable 5 ยืนยันว่าไม่มีการโฟกัสเฉพาะ benchmark นี้ ทั้งนี้ ทีมวิจัยสร้าง SVG ทั้งหมด 1,008 ชิ้นจาก 3 ตัวอย่างต่อ prompt ที่อุณหภูมิ 1.0 และใช้กระบวนการประเมิน 3 ขั้นตอน (การรนเดอร์, การให้คะแนน, การวิเคราะห์องค์ประกอบ) พบว่าไม่มีโมเดลใดให้คะแนนสูงกว่าค่าเฉลี่ยที่คาดการณ์ไว้
สรุปด้วย MAF Local AI · เนื้อหาต้นฉบับเป็นของแหล่งข่าว