ಸೈಬರ್ ಎಕ್ಸ್ಪ್ಲಾಯ್ಟ್ಗಳಲ್ಲಿ ಅಮೆರಿಕದ ಫ್ರಾಂಟಿಯರ್ ಮಾಡೆಲ್ಗಳ ಹಿಂದೆ ತೇಲುತ್ತಿರುವ Kimi K3: ಡಿಸ್ಟಿಲೇಶನ್ ಗ್ಯಾಪ್
ಬ್ರಿಟಿಷ್ AI Security Institute (UK AISI) ಮತ್ತು U.S. Center for AI Standards and Innovation (CAISI) ನಡೆಸಿದ ಜಂಟಿ ಮೌಲ್ಯಮಾಪನವು, ಚೀನಾ ಮತ್ತು ಅಮೆರಿಕದ AI ಮಾಡೆಲ್ಗಳ ನಡುವೆ ಆಕ್ರಮಣಕಾರಿ ಸೈಬರ್ ಕಾರ್ಯಾಚರಣೆಗಳಲ್ಲಿ (offensive cyber operations) ಗಮನಾರ್ಹ ಸಾಮರ್ಥ್ಯದ ಅಂತರವನ್ನು ಬಹಿರಂಗಪಡಿಸಿದೆ. Moonshot AI ನ Kimi K3 ಭರವಸೆಯ ತೋರಿಸುತ್ತದೆಯಾದರೂ, ಸಂಕೀರ್ಣ ಸಾಫ್ಟ್ವೇರ್ ಎಕ್ಸ್ಪ್ಲಾಯ್ಟ್ ಮತ್ತು ನೆಟ್ವರ್ಕ್ ದಾಳಿಗಳ ಕಾರ್ಯಗಳನ್ನು ನೀಡಿದಾಗ ಇದು ಪ್ರಮುಖ ಅಮೆರಿಕನ್ ಫ್ರಾಂಟಿಯರ್ ಮಾಡೆಲ್ಗಳ ಹಿಂದೆ ಉಳಿದಿದೆ.
ExploitBench: ದೌರ್ಬಲ್ಯ ಸಂಶೋಧನೆಯಲ್ಲಿನ ಅಂತರ
ಎಕ್ಸ್ಪ್ಲಾಯ್ಟ್ ಅಭಿವೃದ್ಧಿ ಕೌಶಲ್ಯಗಳನ್ನು ಅಳೆಯಲು, ಸಂಶೋಧಕರು Carnegie Mellon ವಿಶ್ವವಿದ್ಯಾಲಯದ ExploitBench ಅನ್ನು ಬಳಸಿದರು. ಇದು 2023 ರ ನಂತರ Chrome ನ V8 ಇಂಜಿನ್ನಲ್ಲಿ ಕಂಡುಬಂದ 41 ದೌರ್ಬಲ್ಯಗಳನ್ನು (vulnerabilities) ಒಳಗೊಂಡಿರುವ ಬೆಂಚ್ಮಾರ್ಕ್ ಆಗಿದೆ. ಫಲಿತಾಂಶಗಳು ತೀವ್ರವಾದ ಕಾರ್ಯಕ್ಷಮತೆಯ ವ್ಯತ್ಯಾಸವನ್ನು ಎತ್ತಿ ತೋರಿಸಿವೆ. ಪ್ರಮುಖ ಅಮೆರಿಕನ್ ಮಾಡೆಲ್ಗಳು ಸರಾಸರಿ 76.2% ಅಂಕಗಳನ್ನು ಪಡೆದರೆ, Kimi K3 ಕೇವಲ 32.2% ಅಂಕಗಳನ್ನು ಪಡೆದು ಗಮನಾರ್ಹವಾಗಿ ಹಿಂದೆ ಬಿದ್ದಿದೆ. Kimi K3 ಚೀನಾದ GLM-5.2 (24.4%) ಅನ್ನು ಮೀರಿಸಿದರೂ, ಅತ್ಯುನ್ನತ ಮಟ್ಟದ ಎಕ್ಸ್ಪ್ಲಾಯ್ಟೇಶನ್ ಆದ Arbitrary Code Execution (ACE) ಅನ್ನು ತಲುಪುವಲ್ಲಿ ವಿಫಲವಾಯಿತು.
ಇದಕ್ಕೆ ವ್ಯತಿರಿಕ್ತವಾಗಿ, ಉನ್ನತ ಮಟ್ಟದ ಅಮೆರಿಕನ್ ಮಾಡೆಲ್ಗಳು ಪರೀಕ್ಷಿಸಲಾದ 41 ಕಾರ್ಯಗಳಲ್ಲಿ 20 ರಲ್ಲಿ ಯಶಸ್ವಿಯಾಗಿ ACE ಸಾಧಿಸಿವೆ, ಇದು ಗುರಿ ವ್ಯವಸ್ಥೆಗಳ ಮೇಲೆ ಸಂಪೂರ್ಣ ನಿಯಂತ್ರಣವನ್ನು ನೀಡುತ್ತದೆ—ಈ ಮಟ್ಟದ ಸಂಕೀರ್ಣತೆಯನ್ನು Kimi K3 ಅನುಕರಿಸಲು ಸಾಧ್ಯವಾಗಲಿಲ್ಲ.
"The Last Ones" ಮೂಲಕ ನೆಟ್ವರ್ಕ್ ದಾಳಿಗಳ ಸಿಮ್ಯುಲೇಶನ್
ಈ ಮೌಲ್ಯಮಾಪನವು "The Last Ones" (TLO) ಅನ್ನು ಬಳಸಿಕೊಂಡು ಮಾಡೆಲ್ಗಳನ್ನು ಪರೀಕ್ಷಿಸಿತು. ಇದು ನಾಲ್ಕು ಸಬ್ನೆಟ್ಗಳಲ್ಲಿ 20 ಹೋಸ್ಟ್ಗಳನ್ನು ಒಳಗೊಂಡ ಸಂಕೀರ್ಣವಾದ 32-ಹಂತದ ಕಾರ್ಪೊರೇಟ್ ನೆಟ್ವರ್ಕ್ ದಾಳಿಯ ಸಿಮ್ಯುಲೇಶನ್ ಆಗಿದೆ. ಈ ಪರೀಕ್ಷೆಯು ಮಲ್ಟಿ-ಸ್ಟೇಜ್ ಇಂಟ್ರೂಷನ್ ಪಥಗಳನ್ನು (multi-stage intrusion paths) ಸಂಚರಿಸುವ ಏಜೆಂಟ್ನ ಸಾಮರ್ಥ್ಯವನ್ನು ಅಳೆಯಲು ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ.
Kimi K3 32 ಹಂತಗಳಲ್ಲಿ ಸರಾಸರಿ 17 ಹಂತಗಳನ್ನು ತಲುಪಿತು, ಇದು ಮಧ್ಯಮ ಮಟ್ಟದ ಸಾಮರ್ಥ್ಯವನ್ನು ಪ್ರದರ್ಶಿಸುತ್ತದೆ. ಇದು ಹತ್ತು ಪ್ರಯತ್ನಗಳಲ್ಲಿ ಒಂದರಲ್ಲಿ ಸಂಪೂರ್ಣ ದಾಳಿ ಪಥವನ್ನು ಪೂರ್ಣಗೊಳಿಸಿದರೂ, ಸರಾಸರಿ 28.5 ಹಂತಗಳನ್ನು ತಲುಪುವ ಅಮೆರಿಕನ್ ಮಾಡೆಲ್ಗಳಂತಹ ಸ್ಥಿರತೆಯನ್ನು ಹೊಂದಿರಲಿಲ್ಲ. Kimi K3 ದುರ್ಬಲವಾಗಿ ರಕ್ಷಿಸಲ್ಪಟ್ಟ ಎಂಟರ್ಪ್ರೈಸ್ ಸಿಸ್ಟಮ್ಗಳನ್ನು ಸ್ವತಂತ್ರವಾಗಿ ದಾಳಿ ಮಾಡುವ ಸಾಮರ್ಥ್ಯವನ್ನು ಹೊಂದಿದ್ದರೂ, ಸಂಕೀರ್ಣವಾದ, ದೀರ್ಘ-ಸರಣಿ ಕಾರ್ಯಾಚರಣೆಗಳನ್ನು (long-chain operations) ನಿರ್ವಹಿಸಲು ಬೇಕಾದ ವಿಶ್ವಾಸಾರ್ಹತೆಯನ್ನು ಇದು ಹೊಂದಿಲ್ಲ ಎಂದು ಈ ಸಂಶೋಧನೆಗಳು ಸೂಚಿಸುತ್ತವೆ.
ಡಿಸ್ಟಿಲೇಶನ್ ಸಿದ್ಧಾಂತ (The Distillation Theory): ಈ ಅಂತರ ಏಕೆ ಅಸ್ತಿತ್ವದಲ್ಲಿದೆ?
ಒಂದು ನಿರ್ಣಾಯಕ ಪ್ರಶ್ನೆ ಉಳಿದಿದೆ: ಸಾಮಾನ್ಯ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳಲ್ಲಿ ಉತ್ತಮ ಪ್ರದರ್ಶನ ನೀಡಿದರೂ ಚೀನಾ ಮಾಡೆಲ್ಗಳು ಸೈಬರ್ ಕಾರ್ಯಗಳಲ್ಲಿ ಏಕೆ ಹಿಂದೆ ಬೀಳುತ್ತವೆ? ಇದು "ಡಿಸ್ಟಿಲೇಶನ್" (distillation) ಕಾರಣದಿಂದಾಗಿರಬಹುದು ಎಂದು ವರದಿ ಸೂಚಿಸುತ್ತದೆ—ಅಂದರೆ ಫ್ರಾಂಟಿಯರ್ ಮಾಡೆಲ್ಗಳಿಂದ (Anthropic ನ Claude ನಂತಹ) ಸಿಗುವ ಉತ್ತಮ ಗುಣಮಟ್ಟದ ಔಟ್ಪುಟ್ಗಳನ್ನು ತರಬೇತಿ ಡೇಟಾ (training data) ಆಗಿ ಬಳಸುವ ಅಭ್ಯಾಸ.
Moonshot AI, Kimi K3 ಅನ್ನು ತರಬೇತಿಗೊಳಿಸಲು ಡಿಸ್ಟಿಲೇಶನ್ ಬಳಸಿದ್ದರೆ, ಅವರು ಬಹುಶಃ ನಿರ್ಣಾಯಕ ಸೈಬರ್-ಆಕ್ರಮಣಕಾರಿ ಡೇಟಾವನ್ನು ಕಳೆದುಕೊಂಡಿರಬಹುದು. ಪ್ರಮುಖ ಅಮೆರಿಕನ್ ಮಾಡೆಲ್ಗಳು ಮುಂದುವರಿದ ಆಕ್ರಮಣಕಾರಿ ಪ್ರಶ್ನೆಗಳನ್ನು ತಡೆಯುವ ಕಟ್ಟುನಿಟ್ಟಾದ ಸೇಫ್ಟಿ ಕ್ಲಾಸಿಫೈಯರ್ಗಳನ್ನು ಬಳಸುತ್ತವೆ. ಪರಿಣಾಮವಾಗಿ, ಈ ಮಾಡೆಲ್ಗಳ ಸಾರ್ವಜನಿಕ ಔಟ್ಪುಟ್ಗಳಿಂದ ನಿರ್ಮಿಸಲಾದ ಡೇಟಾಸೆಟ್ನಲ್ಲಿ ಉನ್ನತ ಮಟ್ಟದ ಎಕ್ಸ್ಪ್ಲಾಯ್ಟೇಶನ್ಗೆ ಅಗತ್ಯವಿರುವ ಜ್ಞಾನವು ಸಹಜವಾಗಿಯೇ ಕೊರತೆಯಾಗಿರುತ್ತದೆ. ಸಾಮಾನ್ಯ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಮತ್ತು ರೀಸನಿಂಗ್ನಲ್ಲಿ Kimi K3 ಪಶ್ಚಿಮದ ಮಾಡೆಲ್ಗಳಿಗೆ ಸಮಾನವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಿದರೂ, ವಿಶೇಷವಾದ ಆಕ್ರಮಣಕಾರಿ ಸೈಬರ್ ಕಾರ್ಯಗಳಲ್ಲಿ ಏಕೆ ವಿಫಲವಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಇದು ವಿವರಿಸುತ್ತದೆ.
ಬೆಳೆಯುತ್ತಿರುವ ಸಾಮರ್ಥ್ಯಗಳು ಮತ್ತು ನಿರಂತರ ಅಪಾಯಗಳು
ಪ್ರಸ್ತುತ ಅಂತರವಿದ್ದರೂ, CAISI ನ ಟೈಮ್-ಸೀರೀಸ್ ವಿಶ್ಲೇಷಣೆಯು ಅಮೆರಿಕ ಮತ್ತು ಚೀನಾ ಎರಡೂ ಮಾಡೆಲ್ಗಳು ಏರಿಕೆ ಹಾದಿಯಲ್ಲಿದೆ (upward Elo-based trajectory) ಎಂದು ತೋರಿಸುತ್ತದೆ. ಓಪನ್ ಮಾಡೆಲ್ಗಳ ಕಾರ್ಯಕ್ಷಮತೆಯ ಅಂತರವು 2025 ರ ಆರಂಭದಲ್ಲಿ ಆರುಿಂದ ಹತ್ತು ತಿಂಗಳುಗಳಾಗಿದ್ದವು, ಆದರೆ ಇತ್ತೀಚೆಗೆ ಅದು ಕೇವಲ ನಾಲ್ಕುದಿಂದ ಏಳು ತಿಂಗಳುಗಳಿಗೆ ಇಳಿದಿದೆ. ಈ ಅಂತರವು ಕಡಿಮೆಯಾಗುವುದು ಸುರಕ್ಷತೆಯಲ್ಲ ಎಂದು UK AISI ಎಚ್ಚರಿಸುತ್ತದೆ; ಓಪನ್-ವೇಟ್ ಮಾಡೆಲ್ಗಳ ಹೆಚ್ಚುತ್ತಿರುವ ಸಾಮರ್ಥ್ಯವು ಜಾಗತಿಕ ಸೈಬರ್ ಸುರಕ್ಷತಾ ವಲಯದಲ್ಲಿ "ದುರುಪಯೋಗದ ನಿರಂತರ ಮತ್ತು ಮರುಪರಿಹರಿಸಲಾಗದ ಅಪಾಯವನ್ನು" (persistent and irreversible risk of misuse) ಪ್ರತಿನಿಧಿಸುತ್ತದೆ.
ಪ್ರಮುಖ ಅಂಶಗಳು
- ಸೈಬರ್ ಕಾರ್ಯಕ್ಷಮತೆಯ ಅಂತರ: Kimi K3 ExploitBench ನಲ್ಲಿ 32.2% ಅಂಕಗಳನ್ನು ಪಡೆದಿದೆ, ಇದು ಪ್ರಮುಖ ಅಮೆರಿಕನ್ ಮಾಡೆಲ್ಗಳ ಸರಾಸರಿ 76.2% ಕ್ಕಿಂತ ಗಮನಾರ್ಹವಾಗಿ ಕಡಿಮೆಯಿದೆ ಮತ್ತು Arbitrary Code Execution (ACE) ಸಾಧಿಸುವಲ್ಲಿ ವಿಫಲವಾಗಿದೆ.
- ನೆಟ್ವರ್ಕ್ ದಾಳಿ ಸಾಮರ್ಥ್ಯ: TLO ಸಿಮ್ಯುಲೇಶನ್ಗಳಲ್ಲಿ, Kimi K3 32-ಹಂತದ ದಾಳಿ ಪಥದಲ್ಲಿ ಸರಾಸರಿ 17 ಹಂತಗಳನ್ನು ತಲುಪಿತು, ಇದು ದುರ್ಬಲ ವ್ಯವಸ್ಥೆಗಳನ್ನು ಗುರಿಯಾಗಿಸಬಹುದು ಎಂದು ಸಾಬೀತುಪಡಿಸಿದರೂ, ಉನ್ನತ ಮಟ್ಟದ ಅಮೆರಿಕನ್ ಮಾಡೆಲ್ಗಳಂತಹ ವಿಶ್ವಾಸಾರ್ಹತೆಯನ್ನು ಹೊಂದಿಲ್ಲ.
- ಡಿಸ್ಟಿಲೇಶನ್ನ ಪಾತ್ರ: ಸೈಬರ್ ಕೌಶಲ್ಯಗಳ ಕೊರತೆಯು ಡಿಸ್ಟಿಲೇಶನ್ ಅಭ್ಯಾಸಗಳಿಂದ ಉಂಟಾಗಿರಬಹುದು, ಏಕೆಂದರೆ Claude ನಂತಹ ಮಾಡೆಲ್ಗಳ ಸೆನ್ಸರ್ ಮಾಡಲಾದ ಸಾರ್ವಜನಿಕ ಔಟ್ಪುಟ್ಗಳ ಮೇಲೆ ತರಬೇತಿ ಮಾಡುವುದರಿಂದ ಮುಂದುವರಿದ ಎಕ್ಸ್ಪ್ಲಾಯ್ಟೇಶನ್ಗೆ ಅಗತ್ಯವಾದ ಆಕ್ರಮಣಕಾರಿ ಡೇಟಾ ಲಭ್ಯವಿರುವುದಿಲ್ಲ.
