এই মাসের Hugging Face পেপার র‍্যাঙ্কিং থেকে বোঝা যাচ্ছে যে এই ক্ষেত্রটি এখন পরিপক্ক হচ্ছে। উল্লেখযোগ্য কাজগুলো এখন আর কেবল প্যারামিটার সংখ্যা বাড়ানোর ওপর নয়, বরং মডেলগুলোকে দেখা, মনে রাখা এবং শুরু করা কাজ শেষ করার সক্ষমতা দেওয়ার ওপর বেশি গুরুত্ব দিচ্ছে। নিচের দশটি গবেষণাপত্র রিয়েল-টাইম ভিডিও, রোবট কগনিশন, সঠিক বেঞ্চমার্কিং এবং জেনারেটরগুলোকে শিক্ষক হিসেবে বিবেচনা করার এক নীরব বিপ্লব নিয়ে আলোচনা করে।

রিয়েল-টাইম ভিডিও যা আপনি প্রকৃতপক্ষে ব্যবহার করতে পারবেন

বেশিরভাগ ভিডিও মডেল এখনও ব্যয়বহুল ল্যাবরেটরি পরীক্ষার মতো আচরণ করে। এগুলো ভারী হার্ডওয়্যারে কাজ করতে কয়েক মিনিট সময় নেয় এবং এমন ক্লিপ তৈরি করে যা আপনি চলাকালীন নিয়ন্ত্রণ করতে পারেন না। Vidu S1 এই সমীকরণ বদলে দিচ্ছে। এটি রিয়েল-টাইম ইন্টারঅ্যাকশনের ওপর লক্ষ্য রাখে, যা ব্যবহারকারীদের ভয়েস কমান্ডের মাধ্যমে ডিজিটাল চরিত্রগুলোকে পরিচালনা করতে দেয়, আর মডেলটি TurboDiffusion নামক একটি কৌশলের মাধ্যমে সাধারণ কনজিউমার GPU-তে চলে।

এই হার্ডওয়্যার পরিবর্তনটি অত্যন্ত গুরুত্বপূর্ণ। যখন একটি মডেলের জন্য আর উচ্চমানের অ্যাক্সিলারেটরের বিশাল র‍্যাকের প্রয়োজন হয় না, তখন এটি কেবল একটি ডেমো হিসেবে না থেকে একটি অবকাঠামোতে পরিণত হয়। রিয়েল-টাইমে চ্যাটের প্রতিক্রিয়া জানানো লাইভ-স্ট্রিমিং অবতার বা গ্রাহক পরিষেবার চরিত্রগুলোর কথা ভাবুন যারা প্রয়োজন অনুযায়ী চোখের যোগাযোগ করতে পারে এবং কণ্ঠস্বর পরিবর্তন করতে পারে। Vidu S1 এমন ভিডিও AI-এর দিকে ইঙ্গিত করছে যা কেবল একটি রিসার্চ প্রিপ্রিন্ট নয়, বরং একটি পণ্য হিসেবে বাজারে আসবে।

রোবট যা নির্দেশ বুঝতে পারে

ফিজিক্যাল AI-এর জন্য নেভিগেশন এখনও একটি মৌলিক বাধা। ABot-N1 সাধারণ ভাষার নির্দেশনার মাধ্যমে পরিচালিত রোবট নেভিগেশনের জন্য একটি ফাউন্ডেশন মডেল প্রস্তাব করে এই সমস্যার সমাধান করার চেষ্টা করছে। ভঙ্গুর বা আগে থেকে ম্যাপ করা রুটের পরিবর্তে, এই সিস্টেমটি যা দেখে এবং শোনে তার প্যাটার্ন চিনে বিভিন্ন পরিবেশে চলাফেরা করতে শেখে।

এর তাৎক্ষণিক সুফল পাওয়া যাবে লজিস্টিকস ক্ষেত্রে। একটি ডেলিভারি রোবটকে যদি মৌখিক নির্দেশ দেওয়া হয় যেমন, "বাইক র‍্যাকের পাশের প্রবেশপথ দিয়ে প্যাকেজটি নামিয়ে দাও", তবে সেটি সেই নির্দেশ বিশ্লেষণ করতে পারবে এবং র‍্যাকটি সরে গেলে নিজেকে মানিয়ে নিতে পারবে। হোম অ্যাসিস্ট্যান্টরাও একই ধরনের নমনীয়তা পাবে, যা আগে থেকে কোনো ফ্লোর প্ল্যান আপলোড না করেই অ্যাপার্টমেন্টে চলাফেরা করতে পারবে।

রোবট যা গতকালের কথা মনে রাখতে পারে

ABot-AgentOS নেভিগেশনের কাজের সাথে যুক্ত হয়ে একটি ভিন্ন সমস্যার সমাধান করে: রোবটগুলো সাধারণত প্রতিটি কমান্ডের পর রিসেট হয়ে যায়। এই সিস্টেমটি মেশিনটিকে ব্যবহারকারী, বস্তু এবং দৈনন্দিন অভ্যাসের দীর্ঘমেয়াদী স্মৃতি সম্পন্ন একটি পারসিস্টেন্ট এজেন্ট হিসেবে বিবেচনা করে।

একটি ওয়ান-টাইম প্রসেসর এবং একটি কন্টিনিউয়াস এজেন্টের মধ্যে পার্থক্য হলো একটি সরঞ্জাম এবং একজন সহকর্মীর মধ্যে পার্থক্য। ওয়্যারহাউস অটোমেশনের ক্ষেত্রে, স্মৃতিসম্পন্ন একটি রোবট লক্ষ্য করতে পারে যে মঙ্গলবার মাসের শিপমেন্টে সবসময় ভঙ্গুর জিনিস থাকে এবং সেই অনুযায়ী তার ধরার ধরন পরিবর্তন করে। ইন-হোম কেয়ারের ক্ষেত্রে, এটি মনে রাখতে পারে যে একজন নির্দিষ্ট বাসিন্দা বিকেল ৩টায় জানালার পর্দা অর্ধেক খোলা রাখতে পছন্দ করেন। এই ধারাবাহিকতা বড় পরিসরে পার্সোনালাইজেশন সম্ভব করে তোলে।

ভিডিও বেঞ্চমার্কের অসারতা প্রকাশ

Video-Oasis একটি অস্বস্তিকর সত্য প্রকাশ করেছে: অনেক জনপ্রিয় ভিডিও আন্ডারস্ট্যান্ডিং বেঞ্চমার্ক ত্রুটিপূর্ণ। মডেলগুলো প্রায়শই কেবল টেক্সট বা পাঠ্য জ্ঞান ব্যবহার করে প্রশ্নের উত্তর দেয়, তারা আসল ফ্রেমগুলোর দিকে তাকানোর প্রয়োজন মনে করে না। গবেষণাপত্রটি দেখায় যে বর্তমান বেঞ্চমার্কের অর্ধেক প্রশ্ন কোনো ভিজ্যুয়াল ইনপুট ছাড়াই সমাধান করা সম্ভব।

এর মানে হলো গবেষকরা প্রকৃত উপলব্ধি নয়, বরং চতুর অনুমানের জন্য পুরস্কার দিচ্ছেন। কমিউনিটির এমন মূল্যায়ন প্রোটোকল প্রয়োজন যা মডেলগুলোকে প্রতিটি উত্তরের জন্য পিক্সেল-স্তরের প্রমাণের ওপর ভিত্তি করতে বাধ্য করবে। অন্যথায়, আমরা এমন সিস্টেম তৈরির ঝুঁকিতে পড়ব যা আলোর পরিবর্তন হলে আত্মবিশ্বাসের সাথে ভুল তথ্য (hallucinate) প্রদান করবে।

কোডিং এজেন্ট যা দীর্ঘ কাজ সম্পন্ন করতে পারে

কোডিং অ্যাসিস্ট্যান্টরা ছোট কোড স্নিপেট ভালো লিখতে পারে, কিন্তু শত ধাপের DevOps ওয়ার্কফ্লো এখনও তাদের জন্য একটি কঠিন চ্যালেঞ্জ। Long-Horizon-Terminal-Bench পরীক্ষা করে দেখে যে এজেন্টরা কীভাবে দীর্ঘমেয়াদী কাজ সামলায়, মাঝপথে ভুল থেকে পুনরুদ্ধার করে এবং মানুষের সাহায্য ছাড়াই পুনরায় পরিকল্পনা করে।

এটি সেই সবার জন্য গুরুত্বপূর্ণ যারা স্বায়ত্তশাসিত সিস্টেম অ্যাডমিনিস্ট্রেশনের স্বপ্ন দেখেন। একটি এজেন্ট যা একটি সার্ভার প্যাচ করতে পারে, ডিপেন্ডেন্সিগুলোর মধ্যে ডায়াগনস্টিক চালাতে পারে এবং কোনো ধাপ ব্যর্থ হলে আগের অবস্থায় ফিরে যেতে পারে, তা সেই এজেন্টের চেয়ে অনেক বেশি মূল্যবান যা নিখুঁত Python লিখতে পারে কিন্তু প্রথম একটি মিসিং API কী দেখলেই আটকে যায়। এই বেঞ্চমার্ক গবেষকদের এই ধরনের সহনশীলতা পরিমাপের জন্য একটি স্কোরবোর্ড প্রদান করে।

সাশ্রয়ী রিইনফোর্সমেন্ট লার্নিং

Direct OPD রিইনফোর্সমেন্ট লার্নিংয়ের খরচ সংক্রান্ত সমস্যার সমাধান করে। বড় মডেলের জন্য RL প্রচুর অর্থ এবং GPU ব্যবহারের সময় ব্যয় করে। প্রস্তাবিত শর্টকাটটি সহজ: প্রথমে একটি ছোট মডেলকে RL দিয়ে প্রশিক্ষণ দিন, তারপর সেই শেখা পলিসিটি একটি বড় মডেলে স্থানান্তর করুন।

ছোট এক্সপ্লোরাররা কম খরচে ভুল করতে পারে। একবার কৌশলটি যাচাই হয়ে গেলে, বড় মডেলটি পূর্ণ খরচ ছাড়াই সেই শিক্ষাগুলো গ্রহণ করতে পারে। যারা লার্জ ল্যাঙ্গুয়েজ মডেলগুলোকে অ্যালাইন করতে বা এজেন্টগুলোকে ফাইন-টিউন করতে চেষ্টা করছে এমন ছোট টিমের জন্য,