ทีมวิจัยเสนอวิธีใช้การพิสูจน์ทางคณิตศาสตร์ (Formal Verification) เพื่อตรวจสอบความปลอดภัยของ AI ที่ทำงานอัตโนมัติ (Agentic Applications) ซึ่งมีความเสี่ยงจากการโจมตีเช่น Prompt Injection และ Reward Hacking โดยวิธีนี้คล้ายกับการตรวจสอบ Bytecode ใน Java/.NET ที่ไม่ต้องพึ่งพาความเชื่อถือในผลลัพธ์ของโมเดล ปัจจุบันวิธีการตรวจสอบความปลอดภัยเช่น Evals และ Guardrails มีข้อจำกัดในการจัดการความเสี่ยงที่ซับซ้อน ขณะที่การใช้ Proofs ช่วยให้ตรวจสอบได้แม่นยำขึ้นโดยไม่ต้องพึ่งพาการฝึกโมเดลใหม่ ตัวอย่างเช่นการโจมตีผ่านอีเมลที่ใช้ Agent ปลอมแปลงข้อมูลโดยไม่ถูกตรวจจับได้ วิธีนี้เปิดโอกาสให้ AI ทำงานอัตโนมัติได้อย่างปลอดภัยมากขึ้น โดยเฉพาะในระบบสำคัญที่ต้องการความแม่นยำสูงสุด ซึ่งเป็นแนวทางใหม่ที่อาจเปลี่ยนแปลงการพัฒนา AI ที่มีความสามารถสูง (Highly Capable AI) ในอนาคต
สรุปด้วย MAF Local AI · เนื้อหาต้นฉบับเป็นของแหล่งข่าว