ทีมพัฒนาใช้ไมโครคอนโทรลเลอร์ ESP32-S3 ราคา $8 ฝังโมเดลภาษาขนาด 28.9 ล้านพารามิเตอร์ได้สำเร็จโดยไม่ส่งข้อมูลไปเซิร์ฟเวอร์ ใช้เทคนิค Per-Layer Embeddings จาก Google Gemma ที่เก็บพารามิเตอร์ส่วนใหญ่ในหน่วยความจำ FLASH แทน SRAM ช่วยให้โมเดลใหญ่กว่าเดิม 100 เท่า (จาก 260k พารามิเตอร์) แม้ SRAM จำกัดเพียง 512KB โมเดลนี้สร้างเรื่องสั้นแต่ไม่ตอบคำถามหรือเขียนโค้ด เนื่องจากส่วนที่คิดวิเคราะห์ยังเล็ก งานนี้ใช้ชุดข้อมูล TinyStories และอิงจาก llama2.c ของ Andrej Karpathy โมเดลใช้ SRAM (512KB) สำหรับการประมวลผลหลัก PSRAM สำรอง และ FLASH เก็บพารามิเตอร์ ทีมเปิดเผยโค้ดในรีโพสิทอรี่พร้อมข้อมูลการฝึกโมเดล ระบุว่าการปรับปรุงมาจากวิธีจัดการหน่วยความจำที่ไม่ใช้ SRAM ทั้งหมด ซึ่งเป็นแนวทางใหม่สำหรับฝัง LLM ในฮาร์ดแวร์ขนาดเล็ก
สรุปด้วย MAF Local AI · เนื้อหาต้นฉบับเป็นของแหล่งข่าว