Hugging Face এখন কেবল একটি মডেল জুর (model zoo) থেকে আরও বেশি কিছু হয়ে উঠেছে। সেখানে বর্তমানে যে পেপারগুলো ট্রেন্ড করছে, সেগুলো এআই (AI) কমিউনিটি আসলে কোন দিকে যাচ্ছে তার একটি নির্দেশক হিসেবে কাজ করে। বছরের পর বছর ধরে, প্রধান ধারণাটি ছিল সহজ: আরও প্যারামিটার যোগ করুন, আরও ডেটা যোগ করুন, আরও কম্পিউট যোগ করুন। সেই যুগটি শেষ হয়ে যায়নি, তবে এটিই এখন আর সম্পূর্ণ চিত্র নয়। সাম্প্রতিক প্রভাবশালী পেপারগুলো একটি স্পষ্ট অগ্রাধিকার পরিবর্তনের ইঙ্গিত দিচ্ছে। গবেষক এবং নির্মাতারা এখন আরও কঠিন প্রশ্ন তুলছেন যে, এই সিস্টেমগুলো বাস্তবতার সাথে খাপ খাইয়ে টিকে থাকতে পারবে কি না। মনোযোগ এখন কেবল বিশাল স্কেল থেকে সরে এসে অপারেশনলাইজেশন বা কার্যকারিতার দিকে যাচ্ছে—মডেলগুলো কীভাবে যুক্তি দেয়, কীভাবে তারা সস্তা হার্ডওয়্যারে চলে, কীভাবে তারা এক সফটওয়্যার এনভায়রনমেন্ট থেকে অন্যটিতে স্থানান্তরিত হয় এবং কীভাবে তারা বিজ্ঞানকে আরও দ্রুত এগিয়ে নিতে সাহায্য করে।

চাপের মুখেও কার্যকর যুক্তি

আমরা যেভাবে লার্জ ল্যাঙ্গুয়েজ মডেল (LLM) প্রশিক্ষণ দিই এবং যেভাবে সেগুলো ব্যবহার করি, তার মধ্যে একটি ক্রমবর্ধমান ব্যবধান রয়েছে। একটি মডেল প্রশিক্ষণের সময় চমৎকারভাবে লস (loss) কমাতে পারে, কিন্তু কোডিং বাগ বা বহু-ধাপের গণিত সমাধান করার সময় সেটি ব্যর্থ হতে পারে। একটি সাম্প্রতিক পেপার যুক্তি দিচ্ছে যে, এর সমাধান কেবল অন্য কোনো ট্রেনিং ট্রিক নয়। আমাদের মডেলগুলো প্রশিক্ষণের মেট্রিক্সে কেমন স্কোর করছে তার পরিবর্তে ইনফারেন্সের (inference) সময় সেগুলো কীভাবে আচরণ করে তার জন্য অপ্টিমাইজ করা প্রয়োজন। বেশিরভাগ রিইনফোর্সমেন্ট লার্নিং পাইপলাইন এখনও ট্রেনিং-টাইম রিওয়ার্ডের পেছনে ছুটছে। প্রস্তাবিত নতুন চিন্তাধারা হলো চেইন অফ থট (chain of thought) বা চিন্তার ধারাকে স্থিতিশীল করা। যারা কোডিং অ্যাসিস্ট্যান্ট বা গণিত টিউটর তৈরি করছেন, তাদের জন্য এটি একটি ব্যবহারিক পরিবর্তন। শুধুমাত্র লিডারবোর্ড অ্যাকুরেসি বা নির্ভুলতার ওপর ভরসা করা বন্ধ করে, প্রম্পট জটিল হলে মডেলের যুক্তি বা রিজনিং সামঞ্জস্যপূর্ণ থাকে কি না তা স্ট্রেস-টেস্ট করা শুরু করা উচিত।

GUI এজেন্ট যা যা শিখেছে তা মনে রাখতে পারে

এজেন্টদের একটি প্ল্যাটফর্ম সমস্যা রয়েছে। একটি সিস্টেম যা Chrome ট্যাবের ভেতরে নিখুঁতভাবে ফ্লাইট বুক করতে পারে, সেটি যখন আপনি একটি Android ফোনের সেটিংস পরিবর্তন করতে বলবেন, তখন প্রায়শই সবকিছু ভুলে যায়। এই ব্যর্থতা হলো 'ক্যাটাস্ট্রফিক ফরগেটিং' (catastrophic forgetting)। নতুন গবেষণা 'মাল্টি-টিচার ডিস্টিলেশন' (multi-teacher distillation)-এর মাধ্যমে এটি সমাধান করছে। একটি ইন্টারফেসের ওপর প্রশিক্ষণ দিয়ে জ্ঞান স্থানান্তরের আশা করার পরিবর্তে, এজেন্টটি একই সাথে বেশ কয়েকটি শিক্ষকের কাছ থেকে শেখে, যাদের প্রত্যেকেই ভিন্ন ভিন্ন প্ল্যাটফর্মে বিশেষজ্ঞ। যেহেতু স্টুডেন্ট নেটওয়ার্কটি একই সাথে ওয়েব, মোবাইল এবং ডেস্কটপ লজিকের সংস্পর্শে আসে, তাই এটি পুরনো দক্ষতা না হারিয়েই বিভিন্ন এনভায়রনমেন্টে কাজ করতে পারে। প্রোডাক্ট টিমের জন্য এর অর্থ হলো, আপনি অবশেষে একটি একক অ্যাসিস্ট্যান্ট তৈরি করতে পারেন যা দুটি সম্পূর্ণ আলাদা এজেন্ট সিস্টেম রক্ষণাবেক্ষণ না করেই আপনার ওয়েব ব্যাকএন্ড এবং মোবাইল ফ্রন্টএন্ড উভয়কেই স্পর্শ করতে পারে।

বড় মডেলগুলোকে বাস্তব জগতে নিয়ে আসা

একটি রোবটে একটি বড় ফাউন্ডেশন মডেল চালানো সবসময়ই একটি সফটওয়্যার সমস্যার ছদ্মবেশে থাকা একটি ফিজিক্স বা পদার্থবিজ্ঞানের সমস্যা ছিল। মডেলটি একটি সার্ভার র‍্যাকে ফিট হতে পারে, কিন্তু এটি একটি ড্রোনের পাওয়ার বাজেট বা একটি ম্যানুফ্যাকচারিং আর্মের অনবোর্ড কম্পিউটারের মধ্যে ফিট হবে না। একটি নতুন C++ রানটাইম ঠিক এই ব্যবধানটি পূরণ করার জন্য ডিজাইন করা হয়েছে, যা ভারী মডেলগুলোকে হেটেরোজিনিয়াস (heterogeneous) রোবট হার্ডওয়্যার এবং এজ ডিভাইসে (edge devices) পোর্ট করে। এটি কেবল দ্রুত ইনফারেন্সের জন্য নয়; এটি পোর্টেবিলিটি বা বহনযোগ্যতার জন্য। একটি ল্যাবে দামী GPU-তে তৈরি করা মডেল কোনো বড় পরিবর্তন ছাড়াই একটি Jetson মডিউল বা একটি রোবটের লোকাল কন্ট্রোলারে ব্যবহার করা যেতে পারে। এই পোর্টেবিলিটিই একটি অনুদান-তহবিলযুক্ত ডেমো এবং একটি শিপযোগ্য পণ্যের মধ্যে পার্থক্য তৈরি করে।

ফিল্টারের চেয়ে ডেটা রেসিপি বেশি গুরুত্বপূর্ণ

ভিশন-ল্যাঙ্গুয়েজ মডেলগুলোর কেবল বড় প্লেট নয়, বরং উন্নত ডায়েটের প্রয়োজন। নতুন বেঞ্চমার্কগুলো একটি অস্বস্তিকর সত্য তুলে ধরছে: খারাপ ডেটা ফিল্টার করা যুদ্ধের মাত্র অর্ধেক। আপনি ইমেজ ক্যাপশন, চার্ট পার্সিং, গ্রাউন্ডেড কনভারসেশন এবং ভিজ্যুয়াল কোয়েশ্চেন অ্যানসারিং কীভাবে মিশ্রিত করছেন, তার অনুপাতই নির্ধারণ করে যে আপনার মাল্টিমোডাল অ্যাসিস্ট্যান্ট সূক্ষ্ম পার্থক্যগুলো বুঝতে পারবে নাকি ভুল সম্পর্ক (hallucinate) তৈরি করবে। রেসিপি ভুল হলে মডেলটি নিখুঁতভাবে পরিষ্কার ডেটা থাকলেও হোঁচট খাবে। এটি ডেটাসেট নির্মাণকে কেবল 'পরিচ্ছন্নতা কর্মী'র কাজ থেকে 'রেসিপি ইঞ্জিনিয়ারিং'-এর দিকে নিয়ে যাচ্ছে। আপনার টিম যদি একটি ভিজ্যুয়াল অ্যাসিস্ট্যান্ট তৈরি করে থাকে, তবে কেবল আপনার ফিল্টার নয়, বরং আপনার মিশ্রণগুলো (mixtures) অডিট করুন।

পিক্সেল স্পেসে 3D জেনারেশন

বেশিরভাগ জেনারেটিভ 3D পাইপলাইন বিশ্বকে একটি লুকানো ল্যাটেন্ট স্পেসে (latent space) সংকুচিত করে ফেলে। ফলে ডিটেইল বা খুঁটিনাটি হারিয়ে যায়, প্রান্তগুলো ঝাপসা হয়ে যায়। একটি দ্রুত প্রিভিউয়ের জন্য এই লস বা তথ্য হারানো গ্রহণযোগ্য হতে পারে, কিন্তু একটি গেম অ্যাসেট বা AR ওভারলেয়ের জন্য এটি ব্যবহার অনুপযোগী যা বাস্তব জ্যামিতির সাথে সামঞ্জস্যপূর্ণ হতে হবে। উদীয়মান পদ্ধতিগুলো এই বাধাটি পুরোপুরি এড়িয়ে যাচ্ছে এবং সরাসরি পিক্সেল স্পেসে কাজ করছে। এর ফলে দৃশ্যগুলো তীক্ষ্ণ থাকে, স্থানিক সম্পর্কগুলো (spatial relationships) সামঞ্জস্যপূর্ণ থাকে এবং আউটপুট সরাসরি গেমিং এবং AR/VR-এর প্রোডাকশন পাইপলাইনে ব্যবহার করা যায়। শিল্পী এবং টেকনিক্যাল ডিরেক্টরদের জন্য এটি গুরুত্বপূর্ণ কারণ এটি সেই ব্যয়বহুল পোস্ট-প্রসেসিং ক্লিনআপের ঝামেলা দূর করে যা 3D জেনারেশন গ্রহণ করাকে কষ্টসাধ্য করে তুলেছিল।

যখন এআই গবেষণার একঘেয়ে কাজ শুরু করে

গবেষণাপত্র লেখা খুব কমই একজন বিজ্ঞানীর কাজের গতি কমিয়ে দেয়। বরং পোস্টার, তিন মিনিটের ভিডিও সারাংশ, ব্লগের রূপান্তর এবং সোশ্যাল মিডিয়া থ্রেড তৈরি করতে গিয়েই পুরো সপ্তাহটি শেষ হয়ে যায়। নতুন টুলগুলো এখন একটি মাত্র গবেষণাপত্র থেকে স্বয়ংক্রিয়ভাবে পুরো কমিউনিকেশন স্ট্যাক তৈরি করে দিতে পারে। আবিষ্কারের ক্ষেত্রে, অন্যান্য সিস্টেমগুলো প্রকৃত প্রমাণের জন্য লিটারেচার পড়ে এবং অনুমানের পরিবর্তে নথিভুক্ত ঘাটতিগুলোর ওপর ভিত্তি করে গবেষণার দিকনির্দেশনা প্রস্তাব করে। এর ফলে পরীক্ষা থেকে অন্তর্দৃষ্টি (insight) পাওয়ার চক্রটি আরও সংক্ষিপ্ত হয়। গ্র্যাজুয়েট স্টুডেন্ট এবং প্রিন্সিপাল ইনভেস্টিগেটর—উভয়ই ফরম্যাটিংয়ের বদলে চিন্তাভাবনার জন্য ঘণ্টার পর ঘণ্টা সময় ফিরে পেতে পারেন।

অনুমানের বদলে জ্যামিতির মাধ্যমে অপ্টিমাইজার নির্বাচন

Adam এবং Lion-এর মধ্যে কোনটি বেছে নেবেন, তা এখনও ল্যাবের Slack চ্যানেলে আদান-প্রদান করা কোনো গোপন বা গোষ্ঠীগত জ্ঞানের মতো মনে হয়। নতুন একটি গবেষণা জ্যামিতিক শ্রেণিবিন্যাস পদ্ধতি ব্যবহার করে এই সমস্যাটিকে নতুনভাবে সংজ্ঞায়িত করেছে। বারবার নতুন করে 'sweep' করার জন্য GPU-র সময় নষ্ট না করে, আপনি অপ্টিমাইজারগুলোর জ্যামিতিক বৈশিষ্ট্যের মাধ্যমে তাদের তুলনা করতে পারেন এবং প্রতিটি আপনার loss landscape-এর সাথে কীভাবে কাজ করবে তা আগেভাগেই অনুমান করতে পারেন। এটি নির্বাচন প্রক্রিয়াকে কোনো জাদুকরী কৌশল থেকে একটি রোগ নির্ণয়ের (diagnosis) মতো সুনির্দিষ্ট প্রক্রিয়ায় পরিণত করে। ব্যবহারকারীদের জন্য এর অর্থ হলো—এমন অনেক ট্রেনিং রান থেকে মুক্তি পাওয়া, যা অপ্টিমাইজার এবং ডেটার জ্যামিতিক অমিল থাকার কারণে নীরবে ব্যর্থ হয়ে যেত।

ওয়ার্ল্ড মডেল যা প্রকৃতপক্ষে ফলাফল বা পরিণতি বুঝতে পারে

একটি রোবট তার পথ পরিকল্পনা করছে এমন একটি রেন্ডার করা ভিডিও দেখতে চমৎকার হতে পারে, কিন্তু তা দিয়ে কোনো প্রমাণ মেলে না। আসল পরীক্ষা হলো ওয়ার্ল্ড মডেলটি তার কাজের দীর্ঘমেয়াদী ফলাফল বা পরিণতি সঠিকভাবে অনুমান করতে পারে কি না। এখন একটি বক্স তুললে সেটি কি পরে রোবটের হাতটিকে শেলফের পেছনে আটকে ফেলবে? নতুন বেঞ্চমার্কগুলো ভিজ্যুয়াল চাকচিক্য সরিয়ে ফেলে মডেলগুলোকে শুধুমাত্র তাদের কার্যকারণগত দূরদর্শিতার (causal foresight) ওপর ভিত্তি করে মূল্যায়ন করে। এটি গুরুত্বপূর্ণ কারণ একটি সুন্দর সিমুলেটর কোনো ক্ষতিগ্রস্ত সেন্সর বা উল্টে পড়া প্যালেটকে ঠিক করে দিতে পারে না। রোবোটিক্স বিশেষজ্ঞদের এমন মূল্যায়ন প্রয়োজন যা বাস্তব জগতের ঝুঁকির সাথে সামঞ্জস্যপূর্ণ।

বিশাল GPU খরচ ছাড়াই ডিফিউশন মডেল চালানো

ডিফিউশন মডেলগুলো চমৎকার ছবি তৈরি করে, কিন্তু এগুলোর কম্পিউটেশন খরচ অনেক বেশি। নতুন কোয়ান্টাইজেশন (quantization) কৌশলগুলো বিশাল নতুন ডেটাসেট বা সম্পূর্ণ রিট্রেনিং ছাড়াই ছোট GPU-র জন্য এই ওয়েটগুলোকে (weights) সংকুচিত করে ফেলে। আপনি সামান্য কিছু নির্ভুলতা (fidelity) বিসর্জন দিয়ে স্থানীয়ভাবে মডেল চালানোর ক্ষমতা, বিদ্যমান হার্ডওয়্যারে আরও বেশি কাজ করার সুবিধা অথবা প্রিমিয়াম ক্লাস্টার ভাড়া না করেই ইনফারেন্স (inference) করার সুবিধা পেতে পারেন। স্টুডিও এবং স্বতন্ত্র নির্মাতাদের জন্য এটি জেনারেটিভ মিডিয়ার অর্থনীতি বদলে দিচ্ছে। ভিডিও এবং ইমেজ জেনারেশন নিয়ে পরীক্ষা-নিরীক্ষা করার বাধা এখন নাটকীয়ভাবে কমে গেছে।

মূল শিক্ষা

এই সমস্ত কাজের মূল ভিত্তি হলো অপারেশনলাইজেশন (operationalization)। কমিউনিটি এখন সেই পর্যায় অতিক্রম করেছে যেখানে 'বড় মানেই ভালো'—এমন ধারণা আর কার্যকর নয়। বর্তমানে যেসব গবেষণাপত্র জনপ্রিয়তা পাচ্ছে, সেগুলো ইনফারেন্স-টাইম স্ট্যাবিলিটি, ডেটা মিক্সিং স্ট্র্যাটেজি, ক্রস-প্ল্যাটফর্ম মেমরি, এজ ডিপ্লয়মেন্ট এবং প্রমাণ-ভিত্তিক আবিষ্কারের ওপর গুরুত্ব দিচ্ছে। তারা মডেলকে একটি বৃহত্তর সিস্টেমের একটি অংশ হিসেবে বিবেচনা করে, যার মধ্যে হার্ডওয়্যার সীমাবদ্ধতা, ইউজার ইন্টারফেস এবং রিসার্চ ওয়ার্কফ্লো অন্তর্ভুক্ত।

আপনি যদি পণ্য তৈরি বা লঞ্চ করেন, তবে সংকেতটি অত্যন্ত স্পষ্ট। গবেষণাপত্রের মেট্রিক্সের জন্য নয়, বরং ব্যবহারের বাস্তবতার (deployment reality) জন্য অপ্টিমাইজ করুন। এমন এজেন্ট তৈরি করুন যাদের স্মৃতি আছে, এবং এমন মডেল তৈরি করুন যা বাস্তব ডিভাইসে ব্যবহার করা সম্ভব।