สรุปสั้น
บริษัท SentinelOne สร้างสิ่งที่เรียกว่าเป็นเบนช์มาร์กแรกสำหรับการทำวิศวกรรมย้อนกลับ (reverse-engineering) แบบระยะยาว (long-horizon) ของโมเดล AI ชั้นนำ โดยใช้การสืบสวนมัลแวร์ Fast16 ที่ทีมของบริษัทเพิ่งบันทึกไว้เป็นกรณีทดสอบ Fast16 ซึ่งทีม SentinelLabs เปิดเผยรายละเอียดในเดือนเมษายน เป็นมัลแวร์ Windows จากปี 2548 ที่ออกแบบมาเพื่อรบกวนการทำงานของ LS-DYNA ซอฟต์แวร์วิศวกรรมที่ดูเหมือนถูกอิหร่านใช้เป็นส่วนหนึ่งของโครงการพัฒนาอาวุธนิวเคลียร์ คล้ายกับ Stuxnet อันโด่งดังซึ่ง Fast16 เกิดขึ้นก่อน โดย Fast16 อาจถูกพัฒนาโดยสหรัฐฯ และนำไปใช้ก่อวินาศกรรมโครงการนิวเคลียร์ของอิหร่าน
ทีมนักวิจัยของ SentinelLabs นำโมเดล GPT-5.5 และ GPT-5.6 Sol รุ่นล่าสุดของ OpenAI, GLM-5.2 ของ Z.ai และ Opus 4.x ของบริษัท Anthropic มาทดสอบว่าตัวไหนสามารถสืบสวนมัลแวร์ Fast16 ได้อย่างละเอียดถี่ถ้วน แทนที่จะให้คะแนนโมเดลจากงานเดี่ยวๆ ที่แยกส่วนกัน เบนช์มาร์กของ SentinelLabs จะติดตามว่าโมเดลสามารถรักษาการสืบสวนที่น่าเชื่อถือไว้ได้ตลอด 8 ขั้นที่ยากขึ้นเรื่อยๆ หรือไม่ ในขณะที่หลักฐานใหม่ขัดแย้งกับข้อสรุปเดิมของตัวเองซ้ำแล้วซ้ำเล่า ผลปรากฏว่า GPT-5.6 Sol เป็นโมเดลเดียวที่ผ่านครบทั้ง 8 ขั้น
รายละเอียดข่าว
เว็บไซต์ SecurityWeek รายงานเมื่อวันที่ 23 กรกฎาคม 2569 ว่า GPT-5.6 Sol ผ่านการทดสอบครบทั้ง 8 ขั้นด้วยการรันแยกกัน 3 ครั้งที่ระดับความพยายามในการให้เหตุผล (reasoning-effort) ต่างกัน ส่วน GPT-5.5, GLM-5.2 และ Opus 4.7 กับ 4.8 ให้การวิเคราะห์เฉพาะจุดได้ดีแต่ไปต่อไม่ได้ โดย GPT-5.5 ไม่เคยผ่านขั้นแรกเลย ขณะที่โมเดล Opus มักประกาศว่างานเสร็จก่อนที่ข้อบกพร่องจะได้รับการแก้ไข
SentinelLabs ระบุว่าช่องว่างนี้ไม่ได้เกิดจากทักษะเชิงเทคนิคหรือความเข้าใจ แต่มาจากสิ่งที่เรียกว่า “การกู้คืนในระดับโครงการ” (project-scale recovery) ซึ่งหมายถึงความสามารถของโมเดลในการถอนข้อสรุปที่พิสูจน์แล้วว่าผิด ไล่ตามทุกสิ่งที่ต่อยอดจากข้อสรุปนั้น แก้ที่ต้นเหตุ และนำการแก้ไขนั้นไปใช้ตลอดการสืบสวนที่เหลือ แทนที่จะแค่ปะข้อผิดพลาดเฉพาะหน้า นักวิจัยของ SentinelLabs สรุปว่าการกำกับดูแลโดยมนุษย์ยังคงจำเป็น เพราะแม้แต่ GPT-5.6 Sol ก็ยังทำผิดพลาดเชิงเทคนิคอย่างมีนัยสำคัญ
“วิศวกรถอดรหัสย้อนกลับระดับอาวุโสยังคงเป็นสิ่งจำเป็น” นักวิจัยอธิบาย “แม้แต่การรันที่แข็งแกร่งที่สุดก็ยังทำผิดพลาดเชิงความหมาย ยอมรับการควบคุมคุณภาพที่อ่อนแอ และอ้างว่าพร้อมก่อนเวลาอันควร เราประเมินว่าการใช้งานที่ดีที่สุดในปัจจุบันคือการเป็นตัวแทนสืบสวนภายใต้การกำกับดูแล โดยมีนักวิเคราะห์ที่เป็นมนุษย์คอยกำหนดเป้าหมาย ชี้จุดบอด และคงอำนาจตัดสินใจขั้นสุดท้ายในการเผยแพร่ไว้” การทดสอบนี้สะท้อนว่า แม้ AI จะช่วยเร่งงานวิเคราะห์มัลแวร์ที่ซับซ้อนได้ แต่ยังไม่สามารถแทนที่ผู้เชี่ยวชาญมนุษย์ในงานที่ต้องอาศัยการทบทวนข้อสรุปและแก้ไขข้อผิดพลาดอย่างเป็นระบบ
บริบทและความสำคัญ
Fast16 เป็นตัวอย่างมัลแวร์เชิงยุทธศาสตร์ระดับรัฐที่หายากและซับซ้อน จึงเหมาะเป็นโจทย์วัดขีดจำกัดของ AI ในงานวิเคราะห์มัลแวร์เชิงลึก ประเด็นสำคัญของงานวิจัยนี้ไม่ได้อยู่ที่ว่าโมเดลไหนชนะ แต่อยู่ที่การชี้ให้เห็นว่าความสามารถที่ AI ยังขาดคือ “การกู้คืนในระดับโครงการ” หรือการยอมรับว่าตัวเองคิดผิดแล้วแก้ไขให้ครบวงจร ซึ่งเป็นทักษะสำคัญของนักวิเคราะห์มืออาชีพ ผลลัพธ์นี้เป็นข้อมูลที่มีค่าสำหรับองค์กรที่กำลังพิจารณานำ AI มาช่วยงานศูนย์ปฏิบัติการความปลอดภัย (SOC) และงานตอบสนองเหตุการณ์ เพราะสะท้อนว่า AI ควรเป็นเครื่องมือเสริมภายใต้การควบคุมของมนุษย์ ไม่ใช่ระบบอัตโนมัติที่ปล่อยให้ทำงานเองโดยไม่ตรวจสอบ
ผลกระทบต่อไทย
หลายองค์กรในไทยกำลังพิจารณานำ AI มาช่วยงานด้านความปลอดภัย ทั้งการวิเคราะห์มัลแวร์ การตอบสนองเหตุการณ์ และการเฝ้าระวังใน SOC งานวิจัยนี้เป็นเครื่องเตือนใจว่า แม้ AI รุ่นใหม่จะทรงพลังขึ้นมาก แต่ยังมีข้อจำกัดในงานที่ต้องอาศัยการสืบสวนต่อเนื่องและการยอมรับแก้ไขข้อสรุปที่ผิด องค์กรไทยที่นำ AI มาใช้จึงควรวางกระบวนการให้มีมนุษย์ผู้เชี่ยวชาญกำกับดูแลและตัดสินใจขั้นสุดท้ายเสมอ ไม่ควรพึ่งพาผลลัพธ์จาก AI แบบอัตโนมัติในงานวิเคราะห์ที่มีความเสี่ยงสูง โดยเฉพาะในภาคส่วนสำคัญอย่างพลังงาน สาธารณูปโภค และหน่วยงานความมั่นคง
คำแนะนำ
องค์กรที่ต้องการนำ AI มาช่วยงานวิเคราะห์มัลแวร์หรืองาน SOC ควรวางบทบาทให้ AI เป็น “ตัวแทนสืบสวนภายใต้การกำกับดูแล” ตามที่ SentinelLabs เสนอ โดยให้นักวิเคราะห์มนุษย์เป็นผู้กำหนดเป้าหมาย ตรวจสอบจุดบอด และคงอำนาจตัดสินใจขั้นสุดท้าย ควรระวังแนวโน้มที่โมเดลบางตัวประกาศว่างานเสร็จก่อนเวลา และควรตั้งกระบวนการตรวจทานผลลัพธ์ของ AI ก่อนนำไปใช้จริง สำหรับทีมความปลอดภัย การเข้าใจข้อจำกัดเรื่อง “การกู้คืนในระดับโครงการ” จะช่วยออกแบบเวิร์กโฟลว์ที่ผสานจุดแข็งของ AI (ความเร็วและการวิเคราะห์เฉพาะจุด) เข้ากับจุดแข็งของมนุษย์ (การตัดสินใจเชิงระบบและการทบทวนข้อสรุป) ได้อย่างเหมาะสม
