OpenAI-এর GPT-5.5 Codex একটি বাধার মুখে পড়েছে। সাম্প্রতিক সপ্তাহগুলোতে GitHub এবং Hacker News-এর ডেভেলপাররা একটি অদ্ভুত আচরণের প্যাটার্ন লক্ষ্য করতে শুরু করেছেন। জটিল কোডিং এবং রিজনিং (reasoning) বা যুক্তিনির্ভর কাজ করার জন্য তৈরি এই মডেলটি এমন কিছু সমস্যার সম্মুখীন হচ্ছে যাকে ব্যবহারকারীরা 'reasoning-token clustering' বলছেন। এর ফলে আউটপুটগুলো খণ্ডিত মনে হয়, যুক্তিতে ধাপগুলো বাদ পড়ে যায় এবং এমনকি বাহ্যিক ব্যাকরণ নিখুঁত হলেও উত্তরগুলো সঠিক লক্ষ্যে পৌঁছাতে পারে না। সফটওয়্যার ইঞ্জিনিয়ারিংয়ের জন্য একটি সিরিয়াস অ্যাসিস্ট্যান্ট হিসেবে পরিচিত একটি টুলের ক্ষেত্রে এই ধরণের ত্রুটি কেবল একটি সামান্য বিরক্তি নয়।
ব্যবহারকারীরা আসলে কী দেখছেন
রিপোর্টগুলো কেবল অস্পষ্ট অভিযোগ হিসেবে আসেনি। ব্যবহারকারীরা সুনির্দিষ্ট ব্যর্থতার বর্ণনা দিয়েছেন। একজন ডেভেলপার মডেলটিকে একটি ফাংশন রিফ্যাক্টর (refactor) করতে, একাধিক ফাইলের মধ্যে একটি বাগ (bug) খুঁজে বের করতে বা একটি নির্দিষ্ট ডিজাইন প্যাটার্ন প্রয়োগ করতে বলতে পারেন, এবং মডেলটি শুরুতে ভালো করলেও পরে লক্ষ্যভ্রষ্ট হতে শুরু করে। এটি কেবল ভুল উত্তর দিচ্ছিল না; বরং একটি বহু-ধাপ বিশিষ্ট চিন্তাপ্রক্রিয়ার মাঝপথে এটি তার ধারাবাহিকতা হারিয়ে ফেলছিল। একটি ফাংশন যা পাঁচটি যৌক্তিক ধাপ অনুসরণ করার কথা ছিল, তা হয়তো তৃতীয় ধাপেই ভেঙে পড়ে, অথবা এমন কোড তৈরি করে যা কাঠামোগতভাবে সঠিক মনে হলেও গুরুত্বপূর্ণ edge cases বা প্রান্তিক ক্ষেত্রগুলোকে উপেক্ষা করে। এই সমস্যার একটি বিশেষ বৈশিষ্ট্য রয়েছে: মডেলটি ভাষার ক্ষেত্রে ব্যর্থ হচ্ছে না; বরং এটি তার নিজস্ব যুক্তির হিসাব রাখতে (bookkeeping) ব্যর্থ হচ্ছে।
reasoning-token clustering-এর কার্যপদ্ধতি
এটি কেন গুরুত্বপূর্ণ তা বুঝতে হলে, বড় ল্যাঙ্গুয়েজ মডেলগুলো (large language models) আসলে কীভাবে পড়ে তা একটু গভীরভাবে দেখা প্রয়োজন। তারা মানুষের মতো বাক্য স্ক্যান করে না। তারা টেক্সটকে টোকেন (tokens)-এ বিভক্ত করে—যা অক্ষরের অংশ, সিলেবল বা কখনও কখনও পুরো শব্দ হতে পারে। এই টোকেনগুলো হলো মেশিনের কাঁচামাল, অনেকটা লেগো (Lego) ব্রিকের মতো যা দিয়ে এটি উত্তর সাজিয়ে তোলে।
reasoning-token clustering হলো এমন একটি প্রক্রিয়া যার মাধ্যমে মডেলটি একটি সিদ্ধান্ত বা উপসংহারে পৌঁছানোর সময় সম্পর্কিত টোকেনগুলোকে গ্রুপ বা গুচ্ছবদ্ধ করে। একটি নিখুঁত প্রক্রিয়ায়, মডেলটি একটি নির্দিষ্ট যৌক্তিক ধারার সাথে সম্পর্কিত টোকেনগুলোকে একত্রিত করে, সেই চিন্তাটি সম্পন্ন করে এবং তারপর সুন্দরভাবে পরবর্তী ক্লাস্টারে বা গুচ্ছে চলে যায়। যখন এই ক্লাস্টারিং বা গুচ্ছবদ্ধকরণ ভেঙে পড়ে, তখন বিভিন্ন যুক্তিনির্ভর ধারার টোকেনগুলো একে অপরের সাথে মিশে বা জট পাকিয়ে যায়। একটি যৌক্তিক ভেরিয়েবল অন্যটির সাথে মিশে যায়। সিনট্যাক্স (syntax) ঠিক থাকলেও চিন্তার কাঠামোটি ভেঙে পড়ে।
এটিকে একজন শেফের সাথে তুলনা করা যেতে পারে যিনি সবজি কাটা ভুলে গেছেন। রান্নাঘরটি প্রয়োজনীয় উপকরণে পূর্ণ, কাউন্টারে রেসিপি খোলা আছে এবং শেফের বছরের পর বছর প্রশিক্ষণ রয়েছে। কিন্তু যদি প্রাথমিক প্রস্তুতিতে বিশৃঙ্খলা ঘটে—যেমন কাজের জায়গা গোছানো না থাকায় পেঁয়াজ কেকের ব্যাটারে পড়ে যায়—তবে রাঁধুনি যতই দক্ষ হোক না কেন, চূড়ান্ত ফলাফল খারাপ হবেই। GPT-5.5 Codex-এর ক্ষেত্রে টোকেনগুলো হলো উপকরণ এবং রিজনিং ক্লাস্টারগুলো হলো প্রস্তুতির স্টেশন। যখন সেই স্টেশনগুলো অগোছালো হয়ে পড়ে, তখন পুরো রান্নাটিই নষ্ট হয়ে যায়।
একটি বাস্তব উদাহরণ দিলে বিষয়টি সহজ হবে। মনে করুন, আপনি মডেলটিকে ইউজার অথেন্টিকেশন (user authentication) হ্যান্ডেল করে এমন একটি Python স্ক্রিপ্ট ডিবাগ করতে বললেন। এই কাজের জন্য একসাথে তিনটি আলাদা ধারা বজায় রাখা প্রয়োজন: পাসওয়ার্ড হ্যাশিং (password hashing), সেশন ম্যানেজমেন্ট (session management) এবং ডাটাবেস কুয়েরি (database queries)। যদি রিজনিং ক্লাস্টারগুলো একে অপরের সাথে মিশে যায়, তবে মডেলটি হ্যাশিং রুটিনে সেশন লজিক প্রয়োগ করতে পারে, অথবা একটি ডাটাবেস ভেরিয়েবলকে সরাসরি ইউজারের ইনপুট হিসেবে গণ্য করতে পারে। তৈরি করা কোডটি এক পলকে ঠিক মনে হলেও বাস্তব লোডের সময় ব্যর্থ হতে পারে বা নিরাপত্তার ঝুঁকি (security gap) তৈরি করতে পারে। এই ব্যর্থতা কোডের ব্যাকরণে নয়, বরং এটি সেই চিন্তার যুক্তিতে যা কোডটি তৈরি করেছে।
কেন আর্কিটেকচারটি লড়াই করছে
মডেলের বর্তমান প্রজন্মকে মানুষের মতো আচরণ করার জন্য আরও বেশি চাপ দেওয়া হচ্ছে। এই উচ্চাকাঙ্ক্ষা জটিলতা বাড়িয়ে দিচ্ছে। সিস্টেমটি কেবল তার ট্রেনিং ডেটা থেকে প্রাপ্ত পরিসংখ্যানগত প্যাটার্নের ওপর ভিত্তি করে পরবর্তী টোকেনটি অনুমান করছে না। এটি এমন একটি রিজনিং স্টাইল বা যুক্তিনির্ভর শৈলী অনুকরণ করার চেষ্টা করছে যা প্রাকৃতিক, প্রাসঙ্গিক এবং কথোপকথনমূলক মনে হয়।
এই দ্বৈত দায়িত্ব ঘর্ষণের সৃষ্টি করে। বিশুদ্ধ ভাষা পরিচালনা করা—যেমন সুর (tone), শৈলী, সূক্ষ্মতা এবং কথোপকথনের প্রবাহ—একটি কঠোর ও কাঠামোগত রিজনিং বা যুক্তির চেয়ে সম্পূর্ণ ভিন্ন একটি কম্পিউটেশনাল কাজ। একসাথে দুটি কাজ করা আর্কিটেকচারের ওপর অতিরিক্ত চাপ সৃষ্টি করে। বর্তমান ডিজাইনটি একই সাথে রিজনিং এবং ভাষা উভয়ই সামলাতে হিমশিম খাচ্ছে। পরিষ্কার ও ধারাবাহিক লজিক চেইনের পরিবর্তে, মডেলটি মাঝে মাঝে এমন রিজনিং তৈরি করে যা এলোমেলোভাবে ঘুরে বেড়ায় বা নিজের মধ্যেই বারবার ফিরে আসে; যা দেখতে মানুষের মতো মনে হলেও কম্পিউটেশনাল দিক থেকে অত্যন্ত অগোছালো।
কল্পনা করুন একজন আইনজীবী একটি কঠোর চুক্তি তৈরির চেষ্টা করছেন এবং একই সাথে স্পোকেন-ওয়ার্ড পোয়েট্রি (spoken-word poetry) আবৃত্তি করছেন। উভয়ই ভাষার কাজ, তবে তাদের জন্য ভিন্ন ভিন্ন দক্ষতার প্রয়োজন। যখন মডেলটি অতিরিক্ত সাবলীল এবং মানুষের মতো অভিব্যক্তির দিকে ঝুঁকে পড়ে, তখন এর কঠোর যৌক্তিক কাঠামো বজায় রাখার ক্ষমতা দুর্বল হয়ে পড়ে। স্বাভাবিক শোনানোর প্রচেষ্টা অতিরিক্ত মানসিক চাপ (cognitive overhead) তৈরি করে, এবং অধিক জটিলতা মানেই সবসময় ভালো ফলাফল নয়। মডেলটিকে মূলত একই সাথে চিন্তা করতে এবং মুগ্ধ করতে বলা হচ্ছে, এবং অ্যাটেনশন মেকানিজমের হার্ডওয়্যার এখনও সেই দ্বিমুখী চাহিদার সাথে পুরোপুরি তাল মেলাতে পারেনি।
ল্যাবরেটরির বাইরে এটি কেন গুরুত্বপূর্ণ
এই ঘটনাটি দুটি ভিন্ন কারণে তাৎপর্যপূর্ণ।
প্রথমত, এটি একটি রূঢ় অনুস্মারক যে AI নিখুঁত নয়। এমনকি সেরা মডেলগুলোও তাদের সীমার কাছে পৌঁছালে ভুল করে। লার্জ ল্যাঙ্গুয়েজ মডেলগুলোকে ঘিরে বিপণন চক্র প্রায়শই সেগুলোকে ওরাকলের মতো সিস্টেম হিসেবে বিক্রি করে, কিন্তু সেগুলো আসলে সম্ভাব্যতাভিত্তিক ইঞ্জিন (probabilistic engines)। তারা অনুমান করে যে পরবর্তী টোকেনটি কী হবে, এবং কখনও কখনও সেই অনুমানগুলো মিলে একটি সামঞ্জস্যপূর্ণ মনে হওয়া অর্থহীন তথ্যে পরিণত হয়। GPT-5.5 Codex-এর মতো একটি ফ্ল্যাগশিপ কোডিং মডেলকে তার নিজস্ব যুক্তিতে হোঁচট খেতে দেখা একটি স্বাস্থ্যকর বাস্তবতার মুখোমুখি করে। এটি প্যাটার্ন ম্যাচিং এবং প্রকৃত বোঝার মধ্যে সীমানা চিহ্নিত করে, এবং সেই সীমানা এখনও অত্যন্ত বাস্তব।
দ্বিতীয়ত, ব্যবসা প্রতিষ্ঠানগুলো এই মডেলগুলোর ওপর নির্ভর করে। দুর্বল পারফরম্যান্স সরাসরি এবং পরিমাপযোগ্য উপায়ে পণ্য উন্নয়ন এবং গ্রাহক পরিষেবায় প্রভাব ফেলে। একটি স্টার্টআপ যদি ব্যাকএন্ড ইনফ্রাস্ট্রাকচার তৈরির জন্য Codex ব্যবহার করে, তবে মডেলটি দুটি অথেন্টিকেশন লেয়ারকে গুলিয়ে ফেললে একটি নিরাপত্তা ত্রুটি তৈরি হতে পারে। একই ধরনের আর্কিটেকচার দ্বারা চালিত একটি কাস্টমার-সার্ভিস বট এমন রিফান্ড বা পলিসি ব্যতিক্রমের প্রতিশ্রুতি দিতে পারে যা এটি আসলে কার্যকর করতে পারে না, যা আইনি ঝুঁকি এবং ক্ষুব্ধ গ্রাহক তৈরি করতে পারে।
আপনি যখন সফটওয়্যারের বাইরে তাকান, তখন ঝুঁকি আরও বেড়ে যায়। এই ধরনের ঘটনা স্বাস্থ্যসেবা বা গাড়ি চালানোর ক্ষেত্রে AI ব্যবহারের বিষয়ে গুরুতর প্রশ্ন তোলে। যদি একটি মডেল SQL কুয়েরি লেখার সময় টোকেন ক্লাস্টারগুলোকে গুলিয়ে ফেলতে পারে, তবে কী হবে যখন এটি একটি মেডিকেল স্ক্যান ব্যাখ্যা করবে বা একটি স্বয়ংক্রিয় যানবাহনের জন্য রিয়েল-টাইম সেন্সর ডেটা বিশ্লেষণ করবে? এর অন্তর্নিহিত মেকানিজম—বিলিয়ন বিলিয়ন প্যারামিটারের মধ্যে স্ট্যাটিস্টিক্যাল প্যাটার্ন ম্যাচিং—মৌলিকভাবে একই। উচ্চ-ঝুঁকিপূর্ণ ক্ষেত্রে এই সিস্টেমগুলোর ওপর আস্থা রাখার জন্য যুক্তির নির্ভরযোগ্যতার এমন একটি স্তর প্রয়োজন যা টোকেন-ক্লাস্টারিং ব্যর্থতা সরাসরি ক্ষুণ্ণ করে।
একটি হোঁচট, পতন নয়
এটিকে ব্যর্থতা বলা ভুল হবে। এই সমস্যাগুলো নতুন প্রযুক্তি তৈরিরই অংশ। AI সক্ষমতার প্রতিটি উল্লেখযোগ্য উল্লম্ফনের পর একটি ভঙ্গুর আচরণের সময়কাল দেখা গেছে। শুরুর দিকের GPT মডেলগুলো বিভ্রান্তিকর আত্মবিশ্বাসের সাথে তথ্য ভুলভাবে উপস্থাপন (hallucinate) করত। ইমেজ জেনারেটরগুলো একসময় মানুষের হাত অস্পষ্টভাবে তৈরি করত। কোড মডেলগুলো অস্পষ্ট নির্দেশনার সম্মুখীন হলে রুটিনমাফিক ইনফিনিট লুপ তৈরি করত। প্রতিটি ত্রুটি একটি সীমানা উন্মোচন করেছে এবং গবেষকরা সেই সীমানাগুলো ব্যবহার করে আরও উন্নত মানচিত্র তৈরি করেছেন।
গবেষকরা এই ত্রুটিগুলো ব্যবহার করে সিস্টেমগুলোকে মেরামত এবং উন্নত করেন। GitHub থ্রেড এবং Hacker News কমেন্ট সেকশন থেকে আসা ফিডব্যাক কেবল শোরগোল নয়। এটি বাস্তব জগত থেকে আসা কাঁচা ডায়াগনস্টিক ডেটা। যখন শত শত ডেভেলপার হাজার হাজার ভিন্ন ভিন্ন কাজের মাধ্যমে একটি মডেলকে স্ট্রেস-টেস্ট করেন, তখন তারা এমন সব ব্যর্থতার ধরন (failure modes) সামনে আনেন যা কোনো অভ্যন্তরীণ কোয়ালিটি-অ্যাসুরেন্স টিম পুরোপুরি অনুকরণ করতে পারে না। এই ক্রাউডসোর্সড পর্যবেক্ষণ ফিডব্যাক লুপকে আরও শক্তিশালী করে এবং দ্রুত ও লক্ষ্যভিত্তিক প্যাচ (patch) নিশ্চিত করে।
এই ঘটনাটি সম্ভবত মডেলটির একটি উন্নত সংস্করণ তৈরিতে সাহায্য করবে। OpenAI ঐতিহাসিকভাবে কোনো ত্রুটি চিহ্নিত এবং বোঝা গেলে দ্রুত তা উন্নত করার চেষ্টা করে। এই সমাধানটি অ্যাটেনশন মেকানিজম সমন্বয় করা, ল্যাঙ্গুয়েজ লেয়ারের বিপরীতে রিজনিং লেয়ারের গুরুত্ব নির্ধারণ করা, অথবা ব্যবহারকারীর কাছে পৌঁছানোর আগেই জটিল টোকেন ক্লাস্টারগুলো ধরার জন্য নতুন ভ্যালিডেশন ধাপ প্রবর্তন করা—যাই হোক না কেন, ফলাফল একটি আরও টেকসই সিস্টেমের দিকেই ধাবিত হয়।
আসল শিক্ষা
কর্মরত ডেভেলপারদের জন্য শিক্ষাটি ব্যবহারিক। AI-জেনারেটেড কোড এবং যুক্তিকে একটি খসড়া হিসেবে বিবেচনা করুন, চূড়ান্ত পণ্য হিসেবে নয়। আপনার টেস্টগুলো চালান। লজিকটি হাতে কলমে যাচাই করুন। ধরে নিন যে আউটপুটটি উপরিভাগে মসৃণ দেখালেও মডেলটি তার অভ্যন্তরীণ টোকেন ক্লাস্টারগুলোকে গুলিয়ে ফেলতে পারে। সুন্দর সিনট্যাক্স একটি বিভ্রান্তিকর চিন্তাকে লুকিয়ে রাখতে পারে।
সামগ্রিকভাবে শিল্পের জন্য, এই ঘটনাটি জোর দিয়ে বলে যে কৃত্রিম বুদ্ধিমত্তার অগ্রগতি কোনো সরলরেখা নয়। এটি রিলিজ, ব্রেক, ডায়াগনোস এবং রিপেয়ার-এর একটি চক্র। GPT-5.5 Codex হোঁচট খেয়েছে, কিন্তু সেই হোঁচটই ঠিক একইভাবে পরবর্তী সংস্করণকে আরও সোজাভাবে হাঁটতে শেখায়।
ঐচ্ছিক লার্নিং কমিউনিটি: [
