Kimi K3 ตามหลังโมเดลระดับแนวหน้าของสหรัฐฯ ในด้านการโจมตีทางไซเบอร์: ช่องว่างจากการทำ Distillation
การประเมินร่วมกันโดยสถาบันความปลอดภัย AI แห่งสหราชอาณาจักร (UK AISI) และศูนย์มาตรฐานและนวัตกรรม AI ของสหรัฐฯ (CAISI) เผยให้เห็นช่องว่างด้านความสามารถที่สำคัญในการปฏิบัติการทางไซเบอร์เชิงรุกระหว่างโมเดล AI ของจีนและสหรัฐฯ แม้ว่า Kimi K3 ของ Moonshot AI จะแสดงให้เห็นถึงศักยภาพ แต่ยังคงตามหลังโมเดลระดับแนวหน้า (frontier models) ของอเมริกาอย่างมาก เมื่อได้รับมอบหมายงานด้านการเจาะระบบซอฟต์แวร์ที่ซับซ้อนและการโจมตีเครือข่าย
ExploitBench: ช่องว่างในการวิจัยช่องโหว่
เพื่อวัดทักษะการพัฒนาการเจาะระบบ (exploit development) นักวิจัยได้ใช้ ExploitBench ซึ่งเป็นเกณฑ์มาตรฐานจากมหาวิทยาลัย Carnegie Mellon ที่ครอบคลุมช่องโหว่ 41 รายการที่พบในเอนจิน V8 ของ Chrome หลังปี 2023 ผลลัพธ์แสดงให้เห็นถึงความแตกต่างของประสิทธิภาพอย่างชัดเจน โดยโมเดลชั้นนำของสหรัฐฯ ทำคะแนนเฉลี่ยได้ 76.2% ในขณะที่ Kimi K3 ทำคะแนนได้ต่ำกว่ามากที่ 32.2% แม้ว่า Kimi K3 จะทำผลงานได้ดีกว่า GLM-5.2 ของจีน (24.4%) แต่ก็ไม่สามารถบรรลุระดับสูงสุดของการเจาะระบบได้ นั่นคือ Arbitrary Code Execution (ACE)
ในทางตรงกันข้าม โมเดลระดับท็อปของสหรัฐฯ ประสบความสำเร็จในการทำ ACE ใน 20 จาก 41 งานที่ทดสอบ ซึ่งช่วยให้สามารถควบคุมระบบเป้าหมายได้อย่างสมบูรณ์—ซึ่งเป็นระดับความซับซ้อนที่ Kimi K3 ไม่สามารถเลียนแบบได้
การจำลองการโจมตีเครือข่ายผ่าน "The Last Ones"
การประเมินยังได้ทดสอบโมเดลโดยใช้ "The Last Ones" (TLO) ซึ่งเป็นการจำลองการโจมตีเครือข่ายองค์กรที่ซับซ้อนจำนวน 32 ขั้นตอน โดยเกี่ยวข้องกับโฮสต์ 20 เครื่องใน 4 โครงข่ายย่อย (subnets) การทดสอบนี้ออกแบบมาเพื่อวัดความสามารถของเอเจนต์ (agent) ในการนำทางผ่านเส้นทางการบุกรุกแบบหลายขั้นตอน
Kimi K3 ทำได้เฉลี่ย 17 ขั้นตอนจากทั้งหมด 32 ขั้นตอน แสดงให้เห็นถึงความสามารถในระดับปานกลาง แม้ว่าจะสามารถทำตามเส้นทางการโจมตีจนครบถ้วนได้ในการทดสอบ 1 ใน 10 ครั้ง แต่ก็ยังขาดความสม่ำเสมอเมื่อเทียบกับโมเดลของสหรัฐฯ ซึ่งทำได้เฉลี่ยถึง 28.5 ขั้นตอน ผลการวิจัยชี้ให้เห็นว่าแม้ Kimi K3 จะสามารถโจมตีระบบองค์กรที่มีการป้องกันต่ำได้ด้วยตนเอง แต่ก็ยังขาดความน่าเชื่อถือแบบโมเดลระดับแนวหน้าของตะวันตกในการดำเนินการโจมตีแบบต่อเนื่องที่มีความซับซ้อนสูง (long-chain operations)
ทฤษฎีการทำ Distillation: ทำไมช่องว่างนี้จึงเกิดขึ้น
คำถามสำคัญที่ยังคงอยู่คือ ทำไมโมเดลของจีนถึงตามหลังในงานด้านไซเบอร์ ทั้งที่ทำคะแนนได้ดีในเกณฑ์มาตรฐานทั่วไป? รายงานระบุว่าอาจเป็นเพราะ "distillation"—ซึ่งก็คือการนำเอาผลลัพธ์คุณภาพสูงจากโมเดลระดับแนวหน้า (เช่น Claude ของ Anthropic) มาใช้เป็นข้อมูลในการฝึกฝน (training data)
หาก Moonshot AI ใช้การทำ distillation ในการฝึกฝน Kimi K3 พวกเขาก็อาจพลาดข้อมูลสำคัญด้านการโจมตีทางไซเบอร์ เนื่องจากโมเดลชั้นนำของสหรัฐฯ มีการใช้ตัวจำแนกความปลอดภัย (safety classifiers) ที่เข้มงวดเพื่อบล็อกคำสั่งเชิงรุกขั้นสูง ส่งผลให้ชุดข้อมูลที่สร้างขึ้นจากผลลัพธ์สาธารณะของโมเดลเหล่านี้จะขาดแคลนความรู้ที่จำเป็นสำหรับการเจาะระบบระดับสูงไปโดยปริยาย สิ่งนี้อธิบายว่าทำไม Kimi K3 ถึงสามารถเทียบชั้นโมเดลตะวันตกได้ในด้านการเขียนโปรแกรมและการใช้เหตุผลทั่วไป แต่กลับล้มเหลวอย่างมากในงานด้านการโจมตีทางไซเบอร์เฉพาะทาง
ความสามารถที่เพิ่มขึ้นและความเสี่ยงที่ยังคงอยู่
แม้จะมีช่องว่างในปัจจุบัน แต่การวิเคราะห์อนุกรมเวลาของ CAISI แสดงให้เห็นว่าทั้งโมเดลของสหรัฐฯ และจีนต่างมีแนวโน้มการพัฒนาที่สูงขึ้นตามเกณฑ์ Elo ช่องว่างด้านประสิทธิภาพสำหรับโมเดลแบบเปิด (open models) ได้ลดลงจากช่วง 6 ถึง 10 เดือนในช่วงต้นปี 2025 เหลือเพียง 4 ถึง 7 เดือนเมื่อเร็วๆ นี้ UK AISI เตือนว่าช่องว่างที่แคบลงนี้ไม่ได้หมายถึงความปลอดภัยเสมอไป ความสามารถที่เพิ่มขึ้นของโมเดลแบบ open-weight ถือเป็น "ความเสี่ยงที่เกิดขึ้นอย่างต่อเนื่องและไม่สามารถย้อนกลับได้ของการนำไปใช้ในทางที่ผิด" ในภูมิทัศน์ความมั่นคงปลอดภัยทางไซเบอร์ระดับโลก
สรุปประเด็นสำคัญ
- ช่องว่างด้านประสิทธิภาพทางไซเบอร์: Kimi K3 ทำคะแนนได้ 32.2% ใน ExploitBench ซึ่งตามหลังค่าเฉลี่ย 76.2% ของโมเดลชั้นนำของสหรัฐฯ อย่างมาก และไม่สามารถบรรลุการทำ Arbitrary Code Execution (ACE) ได้
- ความสามารถในการโจมตีเครือข่าย: ในการจำลอง TLO นั้น Kimi K3 ทำได้เฉลี่ย 17 ขั้นตอนจากเส้นทางการโจมตี 32 ขั้นตอน ซึ่งพิสูจน์ว่าสามารถตั้งเป้าไปที่ระบบที่มีช่องโหว่ได้ แต่ยังขาดความน่าเชื่อถือเมื่อเทียบกับโมเดลระดับท็อปของสหรัฐฯ
- บทบาทของการทำ Distillation: การขาดทักษะด้านไซเบอร์อาจมีสาเหตุมาจากกระบวนการ distillation เนื่องจากการฝึกฝนด้วยผลลัพธ์สาธารณะที่ถูกเซ็นเซอร์จากโมเดลอย่าง Claude นั้นขาดข้อมูลเชิงรุกที่จำเป็นสำหรับการเจาะระบบขั้นสูง
