দুই সপ্তাহের সেই প্রবল ঢল যা খেলার মোড় ঘুরিয়ে দিয়েছে
১ জুলাই থেকে ১৬ জুলাই, ২০২৬-এর মধ্যে AI-এর প্রেক্ষাপট বদলে গেছে। ধীরে ধীরে নয়, বরং এক নিমেষেই।
Anthropic বিশ্ববাজারে Claude Fable 5 ফিরিয়ে এনেছে। SpaceXAI Grok 4.5 বাজারে ছেড়েছে। OpenAI তাদের GPT-5.6 ফ্যামিলি—Sol, Terra, এবং Luna—প্রকাশ করেছে, যা নির্মাতাদের একই ছাতার নিচে তিনটি নতুন বিকল্প দিচ্ছে। Meta তাদের কমার্শিয়াল API-এর মাধ্যমে Muse Spark 1.1 উন্মুক্ত করেছে। আর Moonshot AI Kimi K3 উন্মুক্ত করে দিয়েছে।
পাঁচটি অত্যাধুনিক ফ্রন্টিয়ার মডেল। মাত্র ষোলো দিন। এটি কোনো সাধারণ প্রোডাক্ট সাইকেল নয়। এটি একটি বিশাল ঢলের মতো।
আপনি যদি একজন ডেভেলপার, প্রোডাক্ট ম্যানেজার বা ফাউন্ডার হন এবং এই সিস্টেমগুলোর ওপর ভিত্তি করে কিছু তৈরি করতে চান, তবে এই গতি উত্তেজনার নয়, বরং ক্লান্তিকর। মাইগ্রেট করা, পরীক্ষা করা এবং নতুন ফিচারের পেছনে ছোটার যে মানসিক চাপ, তা অত্যন্ত বাস্তব। কিন্তু প্রতিটি রিলিজের পেছনে ছোটা এখন আনুষ্ঠানিকভাবে একটি ভুল কৌশল।
মডেল যুদ্ধ থেকে প্ল্যাটফর্ম যুদ্ধে
আমরা একক নেতার যুগ পেরিয়ে এসেছি। বছরের পর বছর ধরে প্যাটার্নটি ছিল সহজ: একটি ল্যাব যুগান্তকারী কিছু প্রকাশ করবে, বাকিরা তা ধরার জন্য দৌড়ঝাঁপ করবে এবং সেই নেতা কয়েক মাস ধরে বাজার দখল করে রাখবে। এখন সেই কয়েক মাস মাত্র কয়েক দিনে নেমে এসেছে।
যখন একই পাক্ষিকে পাঁচটি সত্যিকারের সক্ষম মডেল বাজারে আসে, তখন প্রথম এবং পঞ্চম স্থানের ব্যবধান এতটাই কমে যায় যে তা প্রায় নগণ্য। সক্ষমতা এখন আর মূল পার্থক্যকারী বিষয় নয়। যুদ্ধের ময়দান এখন স্ট্যাকের উপরের স্তরে চলে গেছে। আমরা মডেল যুদ্ধ থেকে প্ল্যাটফর্ম যুদ্ধে রূপান্তরের সাক্ষী হচ্ছি।
বাস্তবে এর মানে কী তা ভেবে দেখুন। যদি আপনার পছন্দের বেঞ্চমার্কে GPT-5.6 Terra এবং Grok 4.5-এর স্কোর একে অপরের খুব কাছাকাছি হয়, তবে বুদ্ধিমত্তা হবে সিদ্ধান্তকারী বিষয় নয়। বরং সিদ্ধান্ত হবে এই ভিত্তিতে যে, Terra-র ল্যাটেন্সি আপনার রিয়েল-টাইম চ্যাট বাজেটের সাথে সামঞ্জস্যপূর্ণ কি না, অথবা Grok-এর Cursor-এর সাথে ইন্টিগ্রেশন আপনার টিমের প্রতি স্প্রিন্টে তিন ঘণ্টার প্রাথমিক অবকাঠামো তৈরির কাজ বাঁচিয়ে দিচ্ছে কি না। ল্যাবে সবচেয়ে বুদ্ধিমান মডেলটি প্রায়শই প্রোডাকশনে ভুল মডেল হয়ে দাঁড়ায়।
এখন আসলে যা গুরুত্বপূর্ণ
যখন পারফরম্যান্স প্রায় সমান হয়ে যায়, তখন অন্যান্য বিষয় প্রাধান্য পায়। আপনার মূল্যায়নের মানদণ্ডগুলো গবেষণাপত্রের মতো না হয়ে বরং একটি প্রকিউরমেন্ট শিটের মতো হওয়া উচিত।
প্রথমে প্রতি টোকেনের খরচ দেখুন। একটি মডেল যা রিজনিংয়ে ১০% ভালো কিন্তু স্কেলে ৩ গুণ বেশি ব্যয়বহুল, তা আপনার প্রোডাক্ট উন্নত করার আগেই আপনার মার্জিন ধ্বংস করে দেবে।
ল্যাটেন্সি এবং গতি দেখুন। আপনি যদি একটি লাইভ কোডিং অ্যাসিস্ট্যান্ট বা রিয়েল-টাইম ট্রান্সলেশন টুল চালান, তবে ৫০০ মিলি-সেকেন্ডের বিলম্ব একটি মৃত প্রোডাক্টের সমান। একটি সামান্য কম বুদ্ধিমান মডেল যা ৫০ মিলি-সেকেন্ডে রেসপন্স করে, তা ব্যবহারকারী ধরে রাখতে পারে।
নির্ভরযোগ্যতা দেখুন। আপটাইম গ্যারান্টি, রেট লিমিট এবং সুসংগত আউটপুট স্ট্রাকচার তাত্ত্বিক সক্ষমতার চেয়ে বেশি গুরুত্বপূর্ণ। একটি মডেল যা ২% কম হ্যালুসিনেশন করে কিন্তু প্রতি মঙ্গলবার অফলাইনে চলে যায়, তা আপনার বিশ্বাস হারাবে।
কনটেক্সট লেন্থ দেখুন। এটি কি আপনার পুরো কোডবেস ধারণ করতে পারে? আপনার আইনি চুক্তি? আপনার বহু বছরের রোগীর রেকর্ড? যদি উত্তর 'না' হয়, তবে অন্য কিছুর আর গুরুত্ব নেই।
ওয়ার্কফ্লো ইন্টিগ্রেশন দেখুন। এটি কি আপনার অবজারভেবিলিটি স্ট্যাকের সাথে যুক্ত হয়? এটি কি আপনার বিদ্যমান প্রম্পট ম্যানেজমেন্ট সিস্টেমের সাথে কাজ করে? সেরা মডেলটি হলো সেটি যা আপনার ইঞ্জিনিয়াররা প্রকৃতপক্ষে শিপ করতে পারে।
বুদ্ধিমত্তা এখন অবকাঠামো হয়ে উঠছে
OpenAI তাদের GPT-5.6 ফ্যামিলির জন্য টিয়ার্ড প্রাইসিংয়ের মাধ্যমে প্রোডাকশন রেডিনেসের দিকে ঝুঁকছে। Meta এখন আর গবেষণার জন্য মডেল বিনামূল্যে দিচ্ছে না; বরং তারা কমার্শিয়াল API-এর মাধ্যমে ডেভেলপারদের প্রকৃত খরচের লক্ষ্য করছে। SpaceXAI বাজি ধরছে যে, Grok-কে Cursor-এর মতো ডেভেলপারদের নিয়মিত ব্যবহৃত টুলগুলোর সাথে যুক্ত করার মাধ্যমে ডিস্ট্রিবিউশন বা সহজলভ্যতা র (raw) স্পেসিফিকেশনকে হারিয়ে দেবে। Moonshot AI দেখাচ্ছে যে, Kimi K3-এর মতো ওপেন-ওয়েট রিলিজগুলো কোনো বিলিয়ন ডলারের ক্লোজড API ছাড়াই ফ্রন্টিয়ার পর্যায়ে অবস্থান করতে পারে।
এই দৃশ্যটি আপনার পরিচিত মনে হতে পারে। ক্লাউড কম্পিউটিংয়ের ক্ষেত্রে আমরা এই চিত্রটি আগেও দেখেছি। AWS, Azure, এবং GCP কার সিপিইউ (CPU) দ্রুত তা দিয়ে জেতে না। তারা জেতে বিলিংয়ের পূর্বাভাসযোগ্যতা, আঞ্চলিক প্রাপ্যতা এবং IAM ইন্টিগ্রেশনের মাধ্যমে। বুদ্ধিমত্তা বা ইন্টেলিজেন্সও একই পথে হাঁটছে। এটি একটি সাধারণ ইউটিলিটি বা পণ্যে পরিণত হচ্ছে। এর 'মোয়াট' (moat) বা সুরক্ষা প্রাচীর এখন আর নেই।
পরিবর্তনের লুকানো কর
রিলিজ নোটস আপনাকে যা বলে না তা হলো: প্রতিটি মডেল মাইগ্রেশনের একটি লুকানো কর বা খরচ রয়েছে।
আপনাকে প্রম্পট পুনরায় লিখতে হবে। ট্রেনিং ডেটা বা টোকেনাইজার বিহেভিয়ারের সামান্য পরিবর্তনও একটি প্রোডাকশন-রেডি প্রম্পটকে অগোছালো ও অতিরিক্ত দীর্ঘ করে তুলতে পারে। আপনাকে ওয়ার্কফ্লো পুনরায় পরীক্ষা করতে হবে। আপনি যে JSON আউটপুটের ওপর নির্ভর করেছিলেন? নতুন মডেলটি প্রায় অর্ধেক সময় সেটিকে মার্কডাউনে মুড়িয়ে দেয়। আপনাকে ইন্টিগ্রেশন আপডেট করতে হবে। SDK পরিবর্তিত হয়। এরর হ্যান্ডলিং বদলে যায়। ডকুমেন্টেশন এক সপ্তাহ পিছিয়ে থাকে।
হিসাবটি অত্যন্ত কঠিন। ইনফারেন্স খরচ ১৫% কমাতে পাঁচজন ইঞ্জিনিয়ারের একটি দল যদি দুই সপ্তাহ মাইগ্রেশনে ব্যয় করে, তবে টোকেনের সাশ্রয়ের চেয়ে তাদের বেতনের লোকসানই বেশি হয়। আরও খারাপ বিষয় হলো, সেই দুই সপ্তাহ ব্যবহারকারীরা যেসব ফিচার চেয়েছিল তা তৈরিতে ব্যয় করা সম্ভব হয় না। বেঞ্চমার্ক স্কোরের চেয়ে সুযোগ ব্যয় (opportunity cost) অনেক দ্রুত বৃদ্ধি পায়।
এটি আত্মতুষ্টির পক্ষে কোনো যুক্তি নয়। এটি সুনির্দিষ্ট ও পরিকল্পিত আপগ্রেডের পক্ষে একটি যুক্তি।
কখন পরিবর্তন করবেন: একটি ব্যবহারিক ফিল্টার
পরবর্তী যখনই কোনো ফ্রন্টিয়ার মডেল (frontier model) আসবে—এবং এই গতিতে দেখলে, তা আগামী মঙ্গলবারও হতে পারে—আপনার কোডবেসে হাত দেওয়ার আগে চারটি প্রশ্নের মাধ্যমে সেটি যাচাই করে নিন।
প্রথমত, এটি কি এমন কোনো সমস্যার সমাধান করে যা আপনার বর্তমান মডেলটি সত্যিই করতে পারছে না? কোনো তাত্ত্বিক সমস্যা নয়। বরং ব্যবহারকারীর সম্মুখীন হওয়া একটি প্রকৃত বাধা। যদি আপনার গ্রাহকরা রিজনিং ডেপথ (reasoning depth) বা যুক্তিবোধের গভীরতা নিয়ে অভিযোগ না করেন, তবে রিজনিং আপগ্রেড করা কেবল লোকদেখানো কাজ হবে।
দ্বিতীয়ত, এটি কি উল্লেখযোগ্যভাবে খরচ কমায় বা দক্ষতা বাড়ায়? "উল্লেখযোগ্যভাবে" বলতে বোঝায় যে এটি এক কোয়ার্টারের (তিন মাস) কম সময়ের মধ্যে মাইগ্রেশনের খরচ তুলে দেবে। এর চেয়ে বেশি সময় লাগলে তা এমন একটি বাজারের ওপর অনুমান করা মাত্র, যা আগামী ১৬ দিনেই আবার বদলে যাবে।
তৃতীয়ত, এটি কি আপনার বর্তমান ওয়ার্কফ্লোর সাথে মানানসই? যদি এর জন্য নতুন ইনফারেন্স প্রোভাইডার (inference provider), একটি কাস্টম প্রক্সি এবং আপনার ইভ্যালুয়েশন পাইপলাইনের পুনর্লিখন প্রয়োজন হয়, তবে সেই মডেলটি কোনো সহজ আপগ্রেড নয়। এটি একটি সাইড প্রজেক্ট হয়ে দাঁড়াবে।
চতুর্থ এবং সবচেয়ে গুরুত্বপূর্ণ: মাইগ্রেশনের খরচ কি প্রত্যাশিত লাভের চেয়ে কম হবে? ইঞ্জিনিয়ারিং কাজের সময়ের ব্যাপারে সৎ থাকুন। এতে টেস্টিং, মনিটরিং এবং অনিবার্য রোলব্যাক প্ল্যান (rollback plan) অন্তর্ভুক্ত করুন। যদি হিসাবটি লোকসানের দিকে যায়, তবে যেখানে আছেন সেখানেই থাকুন।
যদি এগুলোর যেকোনোটির উত্তর 'না' হয়, তবে হাইপ (hype) বা মাতামাতি উপেক্ষা করুন। আপনার বর্তমান স্ট্যাক (stack) ঠিক আছে।
শিপ করুন, বেঞ্চমার্ক নয়
ইভ্যালুয়েশন (evaluations) চালানোর মধ্যে একটি নির্দিষ্ট স্বস্তি আছে। মনে হয় যেন অগ্রগতি হচ্ছে। কিন্তু আসলে তা নয়।
বেঞ্চমার্ক হলো একটি মুহূর্তের চিত্র। আপনার প্রোডাক্ট একটি চলমান লক্ষ্য। যে দল জুলাই মাসটি পাঁচটি মডেলের মধ্যে সরাসরি তুলনা করতে ব্যয় করে, তারা আগস্টে কিছুই শিপ (ship) করতে পারে না। অন্যদিকে, যে দল জুন মাসে একটি মডেল বেছে নিয়ে জুলাই মাসটি ব্যবহারকারীদের কাছে সেটি পৌঁছে দিতে ব্যয় করেছে, তাদের কাছে এমন ফিডব্যাক থাকে যা আপনি বেঞ্চমার্ক দিয়ে মাপতে পারবেন না।
এক্সিকিউশন (Execution) চক্রবৃদ্ধি হারে কাজ করে। একটি নির্বাচিত মডেলকে ইন্টিগ্রেট করা, মনিটর করা এবং এতে ক্রমাগত পরিবর্তন আনার পেছনে ব্যয় করা প্রতিটি ঘণ্টা এমন অপারেশনাল জ্ঞান তৈরি করে যা কোনো লিডারবোর্ড (leaderboard) ধরতে পারে না। আপনি শিখতে পারেন কোথায় আপনার প্রম্পটগুলো কাজ করছে না। আপনি শিখতে পারেন আপনার ব্যবহারকারীদের আসলে কোথায় সাহায্য প্রয়োজন। আপনি সিস্টেম তৈরি করেন, কোনো বিজ্ঞান পরীক্ষা নয়।
তথ্যের এই জোয়ার (firehose) থামবে না। ১৬ দিন এবং ৫টি মডেল কোনো সাময়িক ঘটনা নয়। এটিই এখনকার নতুন স্বাভাবিক (new normal)। যারা টিকে থাকবে তারা সেই দল হবে না যাদের কাছে সেরা বেঞ্চমার্ক স্প্রেডশিট আছে। তারা হবে সেই দল যারা জানে তাদের স্ট্যাকের খরচ ঠিক কত, কোথায় এটি ভেঙে পড়ে এবং ঠিক কখন একটি নতুন টুল ব্যবহার করা বিশৃঙ্খলার বিনিময়েও সার্থক হবে।
রিলিজ ফিড রিফ্রেশ করা বন্ধ করুন। শিপ করা শুরু করুন।
