ผู้พัฒนาสร้างเครื่องมือ TurboFieldfare ที่สามารถรันโมเดล Gemma 4 26B-A4B-IT บน M-series Mac ด้วย RAM 2GB ได้สำเร็จ โดยใช้ Swift และ Metal วิธีหลักคือเก็บส่วนร่วมของโมเดลและ KV cache ใน RAM แล้วสตรีมส่วนผู้เชี่ยวชาญที่จำเป็นจาก SSD ทำให้รันได้แม้ RAM จำกัด โมเดล 4-bit ของ Gemma 4 26B-A4B-IT มีขนาด 14 GB ซึ่งทำให้เครื่องมือทั่วไปไม่สามารถรันได้บน Mac 8 GB หรือ 16 GB หลังจาก OS และแอปอื่นใช้พื้นที่ไปแล้ว ผลทดสอบแสดงให้เห็นว่า TurboFieldfare สร้าง tokens ได้ 5–6 tokens/second บน M2 MacBook Air 8 GB และ 31–35 tokens/second บน M5 MacBook Pro เครื่องมือยังมีเซิร์ฟเวอร์ท้องถิ่นที่รองรับการสตรีมและ tool calls พร้อมดาวน์โหลดน้ำหนัก 15 GB จาก Hugging Face ครั้งแรก ผู้พัฒนาเรียกโมเดลว่า "surprisingly capable" และเปิดรับฟีดแบ็กเพิ่มเติม
สรุปด้วย MAF Local AI · เนื้อหาต้นฉบับเป็นของแหล่งข่าว