HarnessDev: LLM-গুলো তাদের নিজস্ব ইনফ্রাস্ট্রাকচার তৈরি করছে
ByteDance এবং একদল বিশ্ববিদ্যালয় মিলে HarnessDev চালু করেছে, যা একটি ফ্রেমওয়ার্ক এবং এটি লার্জ ল্যাঙ্গুয়েজ মডেলগুলোকে (LLMs) তাদের নিজস্ব "এজেন্ট অপারেটিং সিস্টেম" লিখতে দেয়, যাকে বলা হয় Agent Harnesses। দলটি একটি LLM-কে একটি প্রাথমিক স্টার্টার কিট প্রদান করে এবং বাকি অংশটি নিজে থেকেই তৈরি করতে দেয়; এটি দেখায় যে কীভাবে AI মানুষের হস্তক্ষেপ ছাড়াই নিজস্ব টুল-ব্যবহারের লুপ, ভেরিফিকেশন ধাপ এবং এরর হ্যান্ডলিং পরিচালনা করার জন্য কন্ট্রোল লেয়ার তৈরি করতে পারে।
কেন একটি স্বয়ংনির্মিত হারনেস (harness) গুরুত্বপূর্ণ
AI এজেন্টগুলো এখন আর কেবল সিঙ্গেল-প্রম্পট অ্যাসিস্ট্যান্ট নয়, বরং তারা মাল্টি-স্টেপ ওয়ার্কার হিসেবে বিবর্তিত হয়েছে যারা API কল করতে পারে, ডাটাবেস কুয়েরি করতে পারে এবং বিভিন্ন ফলাফল একত্রিত করতে পারে। এখন পর্যন্ত, ডেভেলপাররা অর্কেস্ট্রেশন কোড হাতে তৈরি করতেন যা মডেলকে নির্দেশ দিত কখন একটি সার্চ টুল কল করতে হবে, কীভাবে ইন্টারমিডিয়েট স্টেট সংরক্ষণ করতে হবে এবং কীভাবে চূড়ান্ত উত্তর যাচাই করতে হবে। HarnessDev এই মডেলটিকে উল্টে দেয়: একটি seed harness কেবল প্রয়োজনীয় কাঠামো প্রদান করে—লুপিং, টুল নির্বাচন এবং স্টেট ট্র্যাকিংয়ের জন্য মৌলিক ফাংশন—এবং LLM এটিকে একটি পূর্ণাঙ্গ রানটাইমে রূপান্তরিত করে।
গবেষণাপত্রের বেঞ্চমার্কে, মডেলটি ১৮টি স্বতন্ত্র হারনেস তৈরি করেছে, যা মূল সিডের সাথে ১৭,০০০-এরও বেশি লাইনের কোড যুক্ত করেছে। প্রতিটি হারনেস একটি টাস্কের সম্পূর্ণ লাইফ-সাইকেল পরিচালনা করেছে: লুপ চালানো, সঠিক টুল নির্বাচন করা, কনটেক্সট বজায় রাখা, স্টেট ট্র্যাকিং করা, ফলাফল যাচাই করা এবং এরর থেকে পুনরুদ্ধার করা।
গবেষণায় উন্মোচিত লুকানো খরচসমূহ
সংখ্যাগুলো চিত্তাকর্ষক মনে হলেও, লেখকরা সতর্ক করেছেন যে কেবল কোড তৈরি করা মানেই তা ব্যবহারিক প্রয়োগের উপযোগী হওয়া নয়।
- অব্যবহৃত উপাদান (Unused components) – জেনারেট করা কোডের একটি বড় অংশ প্রকৃত টাস্ক এক্সিকিউশনের সময় কখনোই চলেনি। LLM এমন সব ফাংশন লিখেছিল যা এজেন্ট কখনোই কল করেনি, ফলে কোনো ভ্যালু যোগ না করেই কোডবেসটি অহেতুক বড় হয়ে গেছে।
- মডেল লক-ইন (Model lock-in) – হারনেসগুলো সাধারণত সেই নির্দিষ্ট LLM-এর জন্য টিউন করা থাকত যা সেগুলোকে তৈরি
