เบนช์มาร์กใหม่วัด AI ถอดรหัสมัลแวร์ก่อวินาศกรรมนิวเคลียร์ — โมเดลชั้นนำส่วนใหญ่สอบตก

บริษัท SentinelOne สร้างเบนช์มาร์กแรกสำหรับวัดความสามารถของ AI ชั้นนำในการถอดรหัสวิศวกรรมย้อนกลับมัลแวร์แบบยาว โดยใช้มัลแวร์ Fast16 ที่เชื่อว่าสหรัฐฯ ใช้ก่อวินาศกรรมโครงการนิวเคลียร์อิหร่านเป็นโจทย์ทดสอบ ผลปรากฏว่ามีเพียง GPT-5.6 Sol ของ OpenAI ที่ผ่านครบทั้ง 8 ขั้น ส่วน GPT-5.5, GLM-5.2 และ Opus 4.7/4.8 วิเคราะห์ได้ดีแต่ไปไม่สุด นักวิจัยสรุปว่าการกำกับดูแลโดยมนุษย์ยังจำเป็น เพราะแม้แต่โมเดลที่เก่งที่สุดก็ยังทำพลาดในเชิงเทคนิค