সাইবার এক্সপ্লয়েটে মার্কিন ফ্রন্টিয়ার মডেলগুলোর তুলনায় পিছিয়ে রয়েছে Kimi K3: ডিস্টিলেশন গ্যাপ
ব্রিটিশ এআই সিকিউরিটি ইনস্টিটিউট (UK AISI) এবং ইউএস সেন্টার ফর এআই স্ট্যান্ডার্ডস অ্যান্ড ইনোভেশন (CAISI)-এর একটি যৌথ মূল্যায়ন চীনা এবং মার্কিন এআই মডেলগুলোর মধ্যে অফেন্সিভ সাইবার অপারেশনে একটি উল্লেখযোগ্য সক্ষমতার ব্যবধান প্রকাশ করেছে। যদিও Moonshot AI-এর Kimi K3 সম্ভাবনাময়, তবে জটিল সফটওয়্যার এক্সপ্লয়েটেশন এবং নেটওয়ার্ক আক্রমণের মতো কাজে এটি শীর্ষস্থানীয় আমেরিকান ফ্রন্টিয়ার মডেলগুলোর তুলনায় অনেকটাই পিছিয়ে রয়েছে।
ExploitBench: ভালনারেবিলিটি রিসার্চে ব্যবধান
এক্সপ্লয়েট ডেভেলপমেন্ট দক্ষতা পরিমাপ করার জন্য গবেষকরা ExploitBench ব্যবহার করেছেন, যা কার্নেগি মেলন ইউনিভার্সিটির একটি বেঞ্চমার্ক এবং এতে ২০২৩ পরবর্তী Chrome-এর V8 ইঞ্জিনে পাওয়া ৪১টি ভালনারেবিলিটি (vulnerability) অন্তর্ভুক্ত রয়েছে। ফলাফলগুলো পারফরম্যান্সের একটি বিশাল ব্যবধান তুলে ধরেছে। শীর্ষস্থানীয় মার্কিন মডেলগুলো গড়ে ৭৬.২% স্কোর অর্জন করেছে, যেখানে Kimi K3 উল্লেখযোগ্যভাবে কম মাত্রায় ৩২.২% স্কোর করেছে। যদিও Kimi K3 চীনের GLM-5.2 (২৪.৪%)-এর চেয়ে ভালো করেছে, তবে এটি এক্সপ্লয়েটেশনের সর্বোচ্চ স্তর: Arbitrary Code Execution (ACE) অর্জন করতে ব্যর্থ হয়েছে।
এর বিপরীতে, শীর্ষস্থানীয় মার্কিন মডেলগুলো পরীক্ষিত ৪১টি কাজের মধ্যে ২০টিতে সফলভাবে ACE অর্জন করেছে, যা টার্গেট সিস্টেমের ওপর পূর্ণ নিয়ন্ত্রণ প্রদান করে—এমন একটি উন্নত সক্ষমতা Kimi K3 প্রদর্শন করতে পারেনি।
"The Last Ones"-এর মাধ্যমে নেটওয়ার্ক অ্যাটাক সিমুলেশন
মূল্যায়নটি "The Last Ones" (TLO) ব্যবহার করেও মডেলগুলোকে পরীক্ষা করেছে, যা চারটি সাবনেটে ২০টি হোস্ট নিয়ে গঠিত একটি জটিল ৩২-ধাপের কর্পোরেট নেটওয়ার্ক অ্যাটাকের সিমুলেশন। এই পরীক্ষাটি একটি এজেন্টের মাল্টি-স্টেজ অনুপ্রবেশ পথ (intrusion paths) নেভিগেট করার ক্ষমতা পরিমাপ করার জন্য ডিজাইন করা হয়েছে।
Kimi K3 ৩২ ধাপের মধ্যে গড়ে ১৭টি ধাপে পৌঁছাতে পেরেছে, যা একটি মাঝারি মানের সক্ষমতা প্রদর্শন করে। যদিও এটি দশটি প্রচেষ্টার মধ্যে একটিতে সম্পূর্ণ অ্যাটাক পাথ সম্পন্ন করেছে, তবে এতে মার্কিন মডেলগুলোর মতো ধারাবাহিকতার অভাব ছিল, যারা গড়ে ২৮.৫টি ধাপে পৌঁছাতে পেরেছে। ফলাফলগুলো নির্দেশ করে যে, Kimi K3 দুর্বলভাবে সুরক্ষিত এন্টারপ্রাইজ সিস্টেমগুলোতে স্বয়ংক্রিয়ভাবে আক্রমণ করতে সক্ষম হলেও, জটিল এবং দীর্ঘ চেইন অপারেশন চালানোর জন্য পশ্চিমা ফ্রন্টিয়ার মডেলগুলোর মতো নির্ভরযোগ্যতা এর নেই।
ডিস্টিলেশন থিওরি (The Distillation Theory): কেন এই ব্যবধান বিদ্যমান
একটি গুরুত্বপূর্ণ প্রশ্ন থেকে যায়: সাধারণ বেঞ্চমার্কে ভালো পারফর্ম করলেও চীনা মডেলগুলো কেন সাইবার কাজে পিছিয়ে থাকে? রিপোর্টটি বলছে যে এটি "ডিস্টিলেশন" (distillation)-এর কারণে হতে পারে—যা হলো ফ্রন্টিয়ার মডেলগুলোর (যেমন Anthropic-এর Claude) উচ্চ-মানের আউটপুটকে ট্রেনিং ডেটা হিসেবে ব্যবহার করার পদ্ধতি।
Moonshot AI যদি Kimi K3 প্রশিক্ষণের জন্য ডিস্টিলেশন ব্যবহার করে থাকে, তবে তারা সম্ভবত গুরুত্বপূর্ণ সাইবার-অফেন্সিভ ডেটা মিস করেছে। শীর্ষস্থানীয় মার্কিন মডেলগুলো কঠোর সেফটি ক্লাসিফায়ার ব্যবহার করে যা উন্নত অফেন্সিভ কুয়েরিগুলোকে ব্লক করে দেয়। ফলে, এই মডেলগুলোর পাবলিক আউটপুট থেকে তৈরি করা একটি ডেটাসেটে উচ্চ-স্তরের এক্সপ্লয়েটেশনের জন্য প্রয়োজনীয় জ্ঞান স্বাভাবিকভাবেই অনুপস্থিত থাকবে। এটি ব্যাখ্যা করে যে কীভাবে Kimi K3 সাধারণ প্রোগ্রামিং এবং রিজনিংয়ে পশ্চিমা মডেলগুলোর সাথে পাল্লা দিতে পারলেও বিশেষায়িত অফেন্সিভ সাইবার কাজে উল্লেখযোগ্যভাবে ব্যর্থ হয়।
ক্রমবর্ধমান সক্ষমতা এবং ক্রমাগত ঝুঁকি
বর্তমান ব্যবধান সত্ত্বেও, CAISI-এর টাইম-সিরিজ বিশ্লেষণ দেখায় যে মার্কিন এবং চীনা উভয় মডেলই একটি ঊর্ধ্বমুখী Elo-ভিত্তিক গতিপথে রয়েছে। ওপেন মডেলগুলোর পারফরম্যান্সের ব্যবধান ২০২৫ সালের শুরুতে ছয় থেকে দশ মাস থেকে কমে সম্প্রতি মাত্র চার থেকে সাত মাসে নেমে এসেছে। UK AISI সতর্ক করেছে যে এই ব্যবধান কমে আসা মানেই নিরাপত্তা নয়; ওপেন-ওয়েট মডেলগুলোর ক্রমবর্ধমান সক্ষমতা বৈশ্বিক সাইবার নিরাপত্তা প্রেক্ষাপটে "অপব্যবহারের একটি ক্রমাগত এবং অপরিবর্তনীয় ঝুঁকি" তৈরি করছে।
মূল বিষয়সমূহ
- সাইবার পারফরম্যান্স গ্যাপ: ExploitBench-এ Kimi K3 ৩২.২% স্কোর করেছে, যা শীর্ষস্থানীয় মার্কিন মডেলগুলোর গড়ে ৭৬.২% স্কোরের তুলনায় অনেক কম, এবং এটি Arbitrary Code Execution (ACE) অর্জন করতে ব্যর্থ হয়েছে।
- নেটওয়ার্ক অ্যাটাক সক্ষমতা: TLO সিমুলেশনে, Kimi K3 ৩২-ধাপের অ্যাটাক পাথে গড়ে ১৭টি ধাপে পৌঁছেছে, যা প্রমাণ করে যে এটি দুর্বল সিস্টেমগুলোকে টার্গেট করতে পারে কিন্তু শীর্ষস্থানীয় মার্কিন মডেলগুলোর মতো নির্ভরযোগ্যতা এর নেই।
- ডিস্টিলেশনের ভূমিকা: সাইবার দক্ষতার ঘাটতি ডিস্টিলেশন পদ্ধতির কারণে হতে পারে, কারণ Claude-এর মতো মডেলগুলোর সেন্সর করা পাবলিক আউটপুট থেকে প্রশিক্ষণ নিলে উন্নত এক্সপ্লয়েটেশনের জন্য প্রয়োজনীয় অফেন্সিভ ডেটার অভাব থাকে।
