Kimi K3 মাঝপথে থেমে গেল যখন GPT-5.6-SOL তিনটি ভারী প্রম্পট—একটি সম্ভাব্যতা সংক্রান্ত সমস্যা, একটি পুলি-জড়তা (pulley-inertia) পরিস্থিতি এবং একটি জটিল Python ব্যাকপ্যাক স্ক্রিপ্ট—সফলভাবে সম্পন্ন করল। এই ব্যবধানটি দেখায় কেন টোকেন বাজেট এবং ল্যাটেন্সি গুরুত্বপূর্ণ, যখন আপনার এমন একটি মডেল প্রয়োজন যা কোনো বাধা ছাড়াই বহু-ধাপ বিশিষ্ট গণিত, পদার্থবিজ্ঞান এবং কোড নিয়ে কাজ করতে পারে।

কেন এই বেঞ্চমার্কটি গুরুত্বপূর্ণ

ডেভেলপার এবং গবেষকরা প্রায়শই হেডলাইন স্কোরের ভিত্তিতে একটি LLM বেছে নেন, বাস্তব জগতের চাপের মুখে এটি কেমন আচরণ করে তার ভিত্তিতে নয়। এই পাশাপাশি পরীক্ষায়, প্রতিটি মডেল এমন একটি সমস্যার মোকাবিলা করেছে যা যুক্তির একটি দীর্ঘ শৃঙ্খল দাবি করে। GPT-5.6-SOL তিনটি ক্ষেত্রেই সম্পূর্ণ এবং সঠিক উত্তর প্রদান করেছে; Kimi K3 কোনো ব্যবহারযোগ্য ফলাফল দেওয়ার আগেই তার টোকেন বাজেট শেষ করে ফেলেছে বা টাইম-আউট হয়েছে।

পরীক্ষার সেটআপ

  • গণিত – একটি সম্ভাব্যতা সংক্রান্ত প্রশ্ন যেখানে প্যাটার্ন-ওভারল্যাপ সম্ভাব্যতা এবং প্রত্যাশিত মান (expectation) ও ভেদাঙ্ক (variance) (দ্বিতীয় মোমেন্ট) গণনা করা প্রয়োজন ছিল।
  • পদার্থবিজ্ঞান – একটি পুলির জড়তা এবং স্প্রিং-টেনশনযুক্ত কেবল ঢিলে হয়ে যাওয়ার ফলে শক্তির ক্ষয় মডেল করা।
  • প্রোগ্রামিং – জটিল ডিপেন্ডেন্সি এবং টাই-ব্রেক নিয়মসহ একটি ব্যাকপ্যাক-প্যাকিং সমস্যার জন্য একটি Python সমাধান লেখা, এবং তারপর ছয়টি স্বতন্ত্র টেস্ট কেসের বিপরীতে আউটপুট যাচাই করা।

সংখ্যাগুলো কী বলছে

GPT-5.6-SOL

  • গণিত – প্রত্যাশিত মান এবং ভেদাঙ্ক স্পষ্টভাবে সাজিয়ে একটি পূর্ণাঙ্গ ও সঠিক সমাধান প্রদান করেছে।
  • পদার্থবিজ্ঞান – সঠিকভাবে জড়তা মডেল তৈরি করেছে এবং শক্তির ক্ষয়ের হিসাব দিয়েছে, যা বিশ্লেষণধর্মী উত্তরের সাথে মিলে যায়।
  • প্রোগ্রামিং – এমন কোড তৈরি করেছে যা কম্পাইল হয়েছে, চলেছে এবং ছয়টি বাহ্যিক পরীক্ষা সফলভাবে সম্পন্ন করেছে। একটি অভ্যন্তরীণ টেস্ট অ্যাসারশন ভুল ছিল, যা আমাদের মনে করিয়ে দেয় যে মডেল-জেনারেটেড টেস্টগুলো ত্রুটিমুক্ত নয়।

Kimi K3

  • গণিত – টোকেন সীমার সর্বোচ্চ পর্যায়ে পৌঁছে গেছে (প্রথমে ৬,৫০০ টোকেনে, তারপর ১০,০০০ টোকেনে) এবং কোনো উত্তর না দেখিয়েই থেমে গেছে।
  • পদার্থবিজ্ঞান – কোনো দৃশ্যমান আউটপুট আসার আগেই টোকেন শেষ হয়ে গেছে।
  • প্রোগ্রামিং – ২৪৫ সেকেন্ডের পর টাইম-আউট হয়েছে এবং মূল্যায়নের জন্য কিছুই প্রদান করতে পারেনি।

রিজনিং দক্ষতা বনাম বিশুদ্ধ ক্ষমতা (raw power)

যারা প্রোডাকশন পাইপলাইন তৈরি করছেন তাদের জন্য এর তাৎপর্য স্পষ্ট: একটি মডেল যা আউটপুট না দিয়ে টোকেন খরচ করে ফেলে, তা পরবর্তী ধাপের প্রক্রিয়াগুলোকে বাধাগ্রস্ত করতে পারে, খরচ বাড়িয়ে দিতে পারে এবং ব্যবহারকারীদের হতাশ করতে পারে।

নির্ভরযোগ্যতা এবং "নিখুঁত" কোডের লুকানো খরচ

এমনকি বিজয়ী মডেলটিও ভুল করেছে: GPT-5.6-SOL-এর নিজস্ব তৈরি করা টেস্ট কেসে একটি ত্রুটিপূর্ণ অ্যাসারশন ছিল। এটি দেখায় যে মডেল-উৎপাদিত ভ্যালিডেশন মানুষের পর্যালোচনার বিকল্প হতে পারে না। যখন একটি মডেল কোড লেখে, আপনার তবুও স্বতন্ত্র পরীক্ষা চালানো প্রয়োজন।

পরবর্তীতে যা লক্ষ্য রাখা উচিত

  • ফিনিশ রিজন ট্র্যাকিং (Finish reason tracking) – একটি রেসপন্স টোকেন লিমিটে পৌঁছানোর কারণে শেষ হয়েছে, নাকি টাইম-আউটের কারণে, নাকি স্বাভাবিকভাবে থেমে গেছে তা লগ করুন।
  • রিজনিং টোকেন সংখ্যা – প্রতিটি মডেল চূড়ান্ত আউটপুটের তুলনায় অভ্যন্তরীণ চিন্তাভাবনার (internal deliberation) জন্য কত টোকেন ব্যয় করে তা তুলনা করুন।
  • ল্যাটেন্সি মনিটরিং – প্রতিটি ধাপের জন্য প্রকৃত সময় (wall-clock time) পরিমাপ করুন; একটি মডেল যা প্রতিটি কুয়েরির জন্য কয়েক মিনিট সময় নেয়, তা ইন্টারঅ্যাক্টিভ অ্যাপের জন্য অনুপযুক্ত হতে পারে।

ডেভেলপারদের উচিত এই মেট্রিকগুলোকে কেবল চূড়ান্ত উত্তর হিসেবে নয়, বরং প্রথম শ্রেণির সংকেত হিসেবে বিবেচনা করা।

সারকথা

পূর্ণতার দিক থেকে GPT-5.6-SOL, Kimi K3-কে ছাড়িয়ে গেছে। এই পরীক্ষাটি আমাদের মনে করিয়ে দেয় যে এমনকি একটি মডেল যা "সঠিক উত্তর দেয়" তাও ত্রুটিপূর্ণ অভ্যন্তরীণ পরীক্ষা তৈরি করতে পারে, তাই মানুষের তদারকি অপরিহার্য। ফিনিশ রিজন, টোকেন ব্যবহার এবং ল্যাটেন্সি ট্র্যাক করা আপনাকে কোনো নিঃশব্দ টাইম-আউটে না পড়ে কাজের জন্য সঠিক টুলটি বেছে নিতে সাহায্য করবে।