Zero-Shot Anomaly Detection: ตรวจจับตำหนิที่ AI “ไม่เคยเห็นมาก่อน” ด้วย Vision-Language Model
ทำไมโมเดล AI แบบเดิมถึง "เพิ่มรุ่นใหม่ไม่ทัน" โรงงานสมัยนี้เปลี่ยนผลิตภัณฑ์เร็วขึ้นมาก สายการผลิตเดียวอาจสลับ SKU ทุก 2–3 วัน ลูกค้าของัดสีพิเศษ หรือมีอะไหล่ใหม่ที่ไม่เคยมีในชุดข้อมูลเดิม ปัญหาคือระบบตรวจจับตำหนิด้วย AI แบบดั้งเดิม (Supervised Learning) ต้องการภาพตัวอย่างที่ "ติดป้าย" จำนวนหลายพันภาพต่อหนึ่ง Defect กว่าจะเทรนเสร็จ ผลิตจริงเปลี่ยนไปแล้ว งานวิจัยล่าสุดจาก arXiv (LiZAD, กรกฎาคม 2026) ระบุชัดว่า "ในสายการผลิต High-throughput ยุคใหม่ การเก็บและ Label ข้อมูลสำหรับทุก Scenario ใหม่เป็นเรื่องไม่ practical แล้ว" นี่คือช่องว่างที่ Zero-Shot Anomaly Detection (ZSAD) เข้ามาเติม — ตรวจจับตำหนิที่โมเดล "ไม่เคยเห็นมาก่อนเลย" ด้วยการอาศัยความเข้าใจภาษาธรรมชาติที่ฝังอยู่ใน Vision-Language Model สายการผลิตอัตโนมัติยุคใหม่ต้องรองรับการเปลี่ยน SKU ที่เร็วขึ้น ระบบตรวจคุณภาพจึงต้อง "ยืดหยุ่น" ตาม (ภาพ: Wikimedia Commons) Vision-Language Model ทำงานกับงานตรวจตำหนิอย่างไร หัวใจของแนวทางนี้คือการเทียบ "ความหมาย" ระหว่างภาพกับข้อความ แทนที่จะจำตำหนิรูปแบบเดิมๆ ระบบจะสร้าง Prompt เช่น a photo of a normal metal surface และ a photo of a metal surface with scratch แล้ววัดว่าภาพที่กล้องจับมา "ใกล้เคียง" ประโยคไหนมากกว่า ถ้าใกล้ประโยคที่พูดถึงตำหนิมากกว่า ระบบก็แจ้งเตือนทันที โดยไม่ต้องเทรนใหม่แม้แต่ภาพเดียว งานวิจัยสายนี้ส่วนใหญ่อ้างอิงสถาปัตยกรรมแบบ CLIP (Contrastive Language-Image Pre-training) ซึ่งเทรนล่วงหน้าด้วยคู่ภาพ-ข้อความนับร้อยล้านคู่ ทำให้โมเดลเข้าใจความสัมพันธ์ระหว่าง "รอยขีดข่วน" ในเชิงภาษา แล้ว map มาหา pattern ทางภาพได้โดยอัตโนมัติ แนวคิด Object Localization ด้วย AI — ZSAD ต่อยอดด้วยการเทียบความหมายระหว่างภาพกับข้อความแทนการจำ Pattern เดิม (ภาพ: Wikimedia Commons) เทคนิคสำคัญที่งานวิจัยปี 2026 กำลังพัฒนา เทคนิค แนวคิด ประโยชน์ต่อโรงงาน Discrete Prompt Optimization (CoEvoAD, ส.ค.…







