ทีมวิจัยใช้ DeepSeek V4 Flash ฝึก GPT-OSS-120B สำหรับงานด้านการเงิน พบว่าโมเดลฝึกย่อยขนาด 20B ทำคะแนน FinanceReasoning 83.61% ทัดเทียม Kimi K3 (81.93%) และเหนือ Inkling (65.13%) ขณะที่การเซ็นเซอร์ไม่ถ่ายโอนจาก DeepSeek ไปยังโมเดลฝึกย่อย แม้ DeepSeek จะตอบคำถามทางการเมืองอย่างแตกต่างจากค่าเฉลี่ย 7 SD การทดสอบใช้คู่คำถาม 152 คู่เปรียบเทียบประเด็นทางการเมืองจีนกับประเทศอื่น เช่น Great Leap Forward vs. Holodomor ประเมินโดย LLM 4 โมเดลและมนุษย์ 96 คน พบว่าโมเดลฝึกย่อยไม่มีความแตกต่างจากฐานโมเดลต้นทาง แม้ข้อมูลฝึกไม่มีเนื้อหาเซ็นเซอร์จีน ทีมเปิดเผยกรอบประเมิน LineageEval พร้อมน้ำหนักโมเดล 20B ที่ใช้ฝึก โดยชี้ว่าการไม่ถ่ายโอนเซ็นเซอร์เกิดจากไม่แชร์การเริ่มต้นระหว่าง Teacher-Student ตามหลักการ Subliminal Learning
สรุปด้วย MAF Local AI · เนื้อหาต้นฉบับเป็นของแหล่งข่าว