Knowledge Distillation สำหรับ Industrial AI: เทคนิคบีบอัดโมเดล AI ขนาดใหญ่ให้วิ่งบน Edge Device
Knowledge Distillation สำหรับ Industrial AI: เทคนิคบีบอัดโมเดล AI ขนาดใหญ่ให้วิ่งบน Edge Device ในยุคที่โมเดล Deep Learning มีขนาดใหญ่ขึ้นเรื่อยๆ (บางโมเดลมีพารามิเตอร์นับพันล้าน) การ Deploy ลงบน Edge Device ในโรงงานที่มีทรัพยากรจำกัด (RAM 512 MB – 4 GB, CPU พลังต่ำ) จึงเป็นความท้าทายใหญ่ Knowledge Distillation (KD) คือเทคนิคที่แก้ปัญหานี้โดยการ "ถ่ายทอดความรู้" จากโมเดลใหญ่ (Teacher) ไปยังโมเดลเล็ก (Student) โดยรักษาประสิทธิภาพไว้ใกล้เคียงเดิม หลักการพื้นฐานของ Knowledge Distillation KD ได้แรงบันดาลใจจากกระบวนการเรียนการสอนในชีวิตจริง ครูที่มีความรู้ลึกซึ้ง (Teacher Model) สอนนักเรียนที่มีความจำจำกัด (Student Model) ให้เข้าใจเนื้อหาแกนกลางได้โดยไม่ต้องรู้ทุกอย่างแบบครู กระบวนการนี้ทำงานผ่านกลไกที่เรียกว่า Soft Labels ปกติโมเดล Classification จะให้ผลลัพธ์เป็น Hard Label (เช่น "ตำหนิประเภท A = 100%") แต่ Teacher Model จะให้ผลเป็น Soft Label ที่อยู่ในรูป Probability Distribution (เช่น "ตำหนิ A = 70%, ตำหนิ B = 25%, ปกติ = 5%") ข้อมูลเหล่านี้เรียกว่า Dark Knowledge — มันเก็บข้อมูลความสัมพันธ์ระหว่างคลาสที่ Hard Label สูญเสียไป สูตรการทำงานของ KD Loss Function ของ Student Model ประกอบด้วย 2 ส่วน: L_total = α × L_hard(y_true, y_student) + (1-α) × T² × L_soft(y_teacher, y_student) โดยที่: L_hard = Cross-Entropy Loss กับ Ground Truth (เหมือนการ Train ปกติ) L_soft =…








