লার্জ ল্যাঙ্গুয়েজ মডেল (LLM) সংক্রান্ত যেকোনো প্রযুক্তিগত আলোচনায় পাঁচ মিনিট সময় দিন এবং আপনি একই প্রশ্ন শুনতে পাবেন: কোন মডেলটি সেরা? দলগুলো বেঞ্চমার্ক লিডারবোর্ড, প্যারামিটার সংখ্যা এবং কনটেক্সট উইন্ডো সাইজ নিয়ে এমনভাবে চিন্তিত থাকে যেন বেস মডেলের নির্বাচনই একমাত্র সিদ্ধান্ত যা নির্ধারণ করে একটি AI প্রোডাক্ট টিকে থাকবে নাকি ধ্বংস হয়ে যাবে। তা নয়। প্রকৃত প্রোডাকশন সিস্টেমে, মডেলের চেয়ে মডেলের চারপাশের 'হারনেস' (harness) অনেক বেশি গুরুত্বপূর্ণ।

হারনেস ছাড়া একটি মডেল কেবল একটি টেক্সট জেনারেটর মাত্র। একটি হারনেস সেই জেনারেটরকে এমন কিছুতে রূপান্তরিত করে যা নির্ভরযোগ্য, পর্যবেক্ষণযোগ্য এবং ব্যবহারকারী বা গুরুত্বপূর্ণ বিজনেস লজিকের সামনে রাখার জন্য যথেষ্ট নিরাপদ।

হারনেস আসলে কী

হারনেস হলো সেই সবকিছু যা র (raw) মডেল ওয়েটস এবং আপনার এন্ড ইউজার যে ভ্যালু পান তার মাঝখানে অবস্থান করে। এর মধ্যে রয়েছে প্রম্পট ম্যানেজমেন্ট, রিট্রিভাল পাইপলাইন, আউটপুট ভ্যালিডেশন, টুল অর্কেস্ট্রেশন, ইভ্যালুয়েশন স্যুট, লগিং, ফলব্যাক লজিক, কস্ট কন্ট্রোল এবং ফিডব্যাক মেকানিজম। মডেলটিকে একটি ইঞ্জিন এবং হারনেসকে চ্যাসিস, ব্রেক, স্টিয়ারিং এবং ড্যাশবোর্ড হিসেবে ভাবুন। একটি দুর্বল কাঠামোতে একটি শক্তিশালী ইঞ্জিন প্রথম বাঁকেই দুর্ঘটনার কবলে পড়বে।

অনেক দল ইন্টিগ্রেশনকে একটি মাত্র API কল হিসেবে বিবেচনা করে। তারা সরাসরি chat.completions.create-এ একটি ইউজার স্ট্রিং পাঠায়, ফলাফলটি স্ক্রিনে দেখায় এবং সেটিকে একটি প্রোডাক্ট বলে দাবি করে। এটি একটি ডেমোর জন্য কাজ করতে পারে। কিন্তু যখনই আপনাকে অস্পষ্টতা (ambiguity), অ্যাডভারসারিয়াল ইনপুট, মাল্টি-স্টেপ রিজনিং বা এক্সটার্নাল সিস্টেমের সাথে সংযোগ সামলাতে হবে, তখনই এটি ভেঙে পড়বে। হারনেস হলো সেই জায়গা যেখানে ইঞ্জিনিয়ারিং ডিসিপ্লিন বা শৃঙ্খলা কাজ করে। এখানেই আপনি ত্রুটিগুলো শনাক্ত করেন, হ্যালুসিনেশন থেকে পুনরুদ্ধার করেন এবং নিশ্চিত করেন যে একটি সহায়ক AI ভুল স্কিমা পড়ার কারণে ভুলবশত কোনো ডাটাবেস রেকর্ড মুছে না ফেলে।

বেঞ্চমার্কগুলো অসম্পূর্ণ তথ্য দিয়ে বিভ্রান্ত করে

পাবলিক বেঞ্চমার্কগুলো ব্যাপক জ্ঞান পরিমাপ করে, আপনার নির্দিষ্ট সমস্যা নয়। একটি মডেল মেডিকেল লাইসেন্সিং প্রশ্নের ক্ষেত্রে ৯০তম পার্সেন্টাইলে স্কোর করতে পারে, কিন্তু আপনার অভ্যন্তরীণ টিকিট-রাউটিং ওয়ার্কফ্লোতে শোচনীয়ভাবে ব্যর্থ হতে পারে কারণ এটি আপনার ব্যবহৃত সংক্ষিপ্ত রূপ (abbreviations), আপনার এজ কেস (edge cases) বা একই বাক্যে তিনটি ভাষায় লেখা ব্যবহারকারীদের প্রেক্ষিতে কখনও পরীক্ষা করা হয়নি।

হারনেস সেই ব্যবধান দূর করে। একটি সঠিক ইভ্যালুয়েশন হারনেস আপনার প্রকৃত প্রোডাকশন প্রম্পটগুলোকে আপনার প্রকৃত প্রত্যাশিত আউটপুটের বিপরীতে পরীক্ষা করে, অন্য কারো স্ট্যান্ডার্ডাইজড টেস্টের মাধ্যমে নয়। আপনি যখন এক মডেল প্রোভাইডার থেকে অন্যটিতে পরিবর্তন করেন, তখন এটি রিগ্রেশন ট্র্যাক করে। এটি সেই ২ শতাংশ ইনপুটকে সামনে নিয়ে আসে যা মারাত্মক ভুল বোঝাবুঝির কারণ হতে পারে। এটি ছাড়া আপনি অন্ধভাবে পথ চলছেন। এটি থাকলে, আপনি একটি ছোট এবং সস্তা মডেল ব্যবহার করেও একটি বড় মডেলের চেয়ে ভালো ফলাফল দিতে পারেন, কারণ আপনি ফেইলর মোডগুলো (failure modes) শনাক্ত করেছেন এবং সেগুলো কনটেক্সট ইনজেকশন বা পোস্ট-প্রসেসিং রুলস দিয়ে সমাধান করেছেন।

নিরাপত্তা হারনেসে থাকে, ওয়েটসে নয়

সীমাবদ্ধতা ছাড়া সক্ষমতা বিপজ্জনক। বিশ্বের সবচেয়ে বুদ্ধিমান মডেলের প্রোডাকশন API, কাস্টমার ডাটা বা এক্সিকিউটেবল কোডে সরাসরি এবং অনিয়ন্ত্রিত অ্যাক্সেস থাকা উচিত নয়। হারনেস নির্ধারণ করে মডেলটি কী কী স্পর্শ করতে পারবে এবং এক্সিকিউশনের আগে রিকোয়েস্টগুলো কীভাবে ভ্যালিডেট করা হবে।

একটি সহজ উদাহরণ বিবেচনা করুন: একটি সাপোর্ট এজেন্ট যা অর্ডারের স্ট্যাটাস দেখতে পারে এবং রিফান্ড দিতে পারে। মডেলটি ন্যাচারাল ল্যাঙ্গুয়েজে কাজের পরামর্শ দেয়। হারনেস সেই পরামর্শগুলোকে স্ট্রাকচার্ড API কলে ম্যাপ করে, ইউজারের পারমিশন চেক করে, রিকোয়েস্ট করা ইউজারের অ্যাকাউন্টে অর্ডার আইডিটি আছে কিনা তা যাচাই করে, রেট লিমিট প্রয়োগ করে এবং একটি নির্দিষ্ট সীমার বেশি রিফান্ডের জন্য মানুষের স্পষ্ট নিশ্চিতকরণ প্রয়োজন করে। মডেল প্রস্তাব দেয়। হারনেস অনুমতি দেয়। "মডেল এখন অনেক স্মার্ট" এই যুক্তিতে এই স্তরগুলোর যেকোনোটি সরিয়ে ফেলা মানে হলো একটি ব্যয়বহুল দায়বদ্ধতা (liability) তৈরি করা।

কন্টেন্ট সেফটির ক্ষেত্রেও একই কথা প্রযোজ্য। বেস মডেলগুলো ক্ষতিকারক, পক্ষপাতদুষ্ট বা ব্র্যান্ডের সাথে সামঞ্জস্যহীন আউটপুট তৈরি করতে পারে। একটি হারনেস আউটপুট ক্লাসিফায়ার, পরিবর্তিত প্রম্পটসহ রিট্রাই পলিসি এবং অডিট ট্রেইলের জন্য লগিং বাস্তবায়ন করে। ফাউন্ডেশন মডেল প্রোভাইডারের নিখুঁত সমাধানের জন্য অপেক্ষা করা কোনো কৌশল নয়; এটি আপনার সুনামের সাথে একটি জুয়া খেলা।

একটি প্রোডাকশন হারনেসের গঠনতন্ত্র

আপনি যদি দীর্ঘমেয়াদী লক্ষ্য নিয়ে কাজ করেন, তবে আপনার হারনেসকে অন্য যেকোনো ব্যাকএন্ড সিস্টেমের মতো যত্ন সহকারে আর্কিটেক্ট করতে হবে। এখানে সেই উপাদানগুলো দেওয়া হলো যা খেলনা এবং আসল টুলের মধ্যে পার্থক্য তৈরি করে।

ইভ্যালুয়েশন এবং রিগ্রেশন টেস্টিং। আপনার রিয়েল ইউজার কুয়েরি এবং প্রত্যাশিত আচরণের একটি স্যুট প্রয়োজন যা প্রতিটি ডেপ্লয়মেন্টের আগে স্বয়ংক্রিয়ভাবে চলে। আপনার প্রম্পট টেমপ্লেট পরিবর্তন করুন বা মডেল পরিবর্তন করুন, এবং আপনি কয়েক মিনিটের মধ্যেই দেখতে পাবেন যে নির্ভুলতা উন্নত হয়েছে কিনা এবং আপনি কোনো গুরুত্বপূর্ণ ওয়ার্কফ্লো নষ্ট করেছেন কিনা।

পর্যবেক্ষণ এবং ট্রেসিং (Observability and tracing)। LLM কলগুলো নন-ডিটারমিনিস্টিক এবং ব্যয়বহুল। আপনাকে রিট্রিভাল (retrieval), প্রম্পট কনস্ট্রাকশন, মডেল ইনফারেন্স এবং পোস্ট-প্রসেসিংয়ের মাধ্যমে প্রতিটি রিকোয়েস্ট ট্রেস করতে হবে। যখন কোনো ব্যবহারকারী একটি খারাপ ফলাফলের কথা জানান, তখন আপনার সেই ফলাফলটি তৈরি করা সঠিক কনটেক্সট এবং প্রম্পটটি পুনর্গঠন করার ক্ষমতা থাকা উচিত।

কনটেক্সট ইঞ্জিনিয়ারিং (Context engineering)। বেশিরভাগ প্রোডাকশন ব্যর্থতা খারাপ কনটেক্সট থেকে উদ্ভূত হয়, মডেলের বুদ্ধিমত্তার অভাব থেকে নয়। আপনার হারনেস (harness) চাঙ্কিং স্ট্র্যাটেজি, রিট্রিভাল র‍্যাঙ্কিং, টোকেন বাজেট এবং রির‍্যাঙ্কিং লজিক পরিচালনা করে। চমৎকার রিট্রিভড কনটেক্সট সহ একটি মাঝারি মানের মডেল প্রায় প্রতিটি ক্ষেত্রেই দুর্বল কনটেক্সট সহ একটি ফ্রন্টিয়ার (frontier) মডেলকে হারিয়ে দেবে।

টুল ব্যবহার এবং গার্ডরেইলস (Tool use and guardrails)। মডেল যে কোনো ফাংশন কল করতে চাইলে তাকে অবশ্যই স্কিমা ভ্যালিডেশন, পারমিশন চেক এবং স্যানিটাইজেশনের মধ্য দিয়ে যেতে হবে। হারনেসটির পার্সিং এররগুলো (parsing errors) দক্ষতার সাথে হ্যান্ডেল করা উচিত। যদি মডেল কোনো প্যারামিটার হ্যালুসিনেশন (hallucinate) করে, তবে হারনেসটি সেটি এক্সিকিউট করার পরিবর্তে কলটি প্রত্যাখ্যান করবে।

খরচ এবং ল্যাটেন্সি নিয়ন্ত্রণ (Cost and latency controls)। প্রতিটি কুয়েরির জন্য সবচেয়ে বড় মডেলের প্রয়োজন হয় না। হারনেসের একটি রাউটিং লেয়ার আগত রিকোয়েস্টগুলোকে ক্লাসিফাই করতে পারে এবং জটিল কাজের জন্য ব্যয়বহুল রিজনিং (reasoning) সংরক্ষণ করার পাশাপাশি সাধারণ প্রশ্নগুলোকে ছোট ও দ্রুততর মডেলের কাছে পাঠাতে পারে। সাধারণ রেসপন্সগুলো ক্যাশ (caching) করে রাখলে অপ্রয়োজনীয় ইনফারেন্স রোধ করা যায়।

ফিডব্যাক লুপ (Feedback loops)। হারনেসটিকে অবশ্যই থাম্বস-আপ, থাম্বস-ডাউন, সংশোধন এবং ফলো-আপ প্রশ্নের মতো ইমপ্লিসিট সিগন্যালগুলো ক্যাপচার করতে হবে। এই ডেটা প্রম্পট রিফাইনমেন্ট, ফাইন-টিউনিং বা ইভ্যালুয়েশন সেট সম্প্রসারণে ব্যবহৃত হয়। মডেল নিজে থেকে প্রোডাকশন থেকে শেখে না; হারনেসকেই এই শিক্ষাগুলো সংগ্রহ করতে হয়।

মডেল হলো পণ্য (Commodities)। হারনেস হলো সুরক্ষা কবচ (Moats)।

ফাউন্ডেশন মডেল লেয়ার দ্রুত সংকুচিত হচ্ছে। দাম কমছে, ওপেন ওয়েটস (open weights) সক্ষমতার ব্যবধান কমিয়ে আনছে এবং প্রতি কোয়ার্টারে প্রোভাইডারদের মধ্যে সুইচ করার খরচ কমে আসছে। দুই বছরের মধ্যে, আপনি যে নির্দিষ্ট মডেলটি বেছে নিয়েছেন তা সম্ভবত তিনটি সস্তা বিকল্পের সাথে পরিবর্তনযোগ্য হবে। যে ইঞ্জিনিয়ারিং বিনিয়োগটি টিকে থাকবে তা হলো আপনি এর চারপাশে যে অবকাঠামো (infrastructure) তৈরি করবেন।

যে কোম্পানিগুলো এটি বোঝে, তারা তাদের সবচেয়ে দুষ্প্রাপ্য সম্পদ—প্রতিভাবান ইঞ্জিনিয়ারিং সময়—সিস্টেম ইন্টিগ্রেশন লেয়ারে ফোকাস করে। তারা তাদের ডোমেইনের সাথে যুক্ত নিজস্ব ইভ্যালুয়েশন ডেটাসেট তৈরি করে। তারা এমন রিট্রিভাল পাইপলাইন তৈরি করে যা বছরের পর বছর ধরে অর্জিত প্রাতিষ্ঠানিক জ্ঞানকে প্রতিফলিত করে। তারা এমন ইন্টারঅ্যাকশন প্যাটার্ন ডিজাইন করে যেখানে বিচারবুদ্ধির প্রয়োজন হয় সেখানে মানুষকে লুপে (in the loop) রাখে। এটি রক্ষণায়োগ্য (defensible)। একটি উন্নততর API এন্ডপয়েন্ট নয়।

এর মানে হলো আপনার রোডম্যাপ অন্য কোনো কোম্পানির রিলিজ সাইকেলের কাছে জিম্মি থাকা উচিত নয়। একটি শক্তিশালী হারনেস আপনাকে খুব সামান্য ঝামেলাতেই ফাউন্ডেশন মডেল পরিবর্তন করার সুযোগ দেয়। যখন একটি নতুন ভার্সন আসে, আপনি আপনার ইভ্যাল স্যুট (eval suite) চালান, রিগ্রেশন (regressions) পরীক্ষা করুন এবং সংখ্যাগুলো উন্নত হলে সুইচ করুন। হারনেস ছাড়া, আপনি কেবল এই প্রার্থনাই করতে পারেন যে সর্বশেষ মডেলের চ্যানজলগ (changelog) আপনার প্রয়োজনের সাথে মিলে যাবে।

আসল শিক্ষা (The Real Takeaway)

মডেল নির্বাচনকে প্রাথমিক কৌশলগত সিদ্ধান্ত হিসেবে দেখা বন্ধ করুন। এটি একটি প্রকিউরমেন্ট (procurement) বা সংগ্রহ সংক্রান্ত প্রশ্ন। কৌশলগত কাজ হলো এমন একটি মেকানিজম তৈরি করা যা মডেলের আউটপুটকে নিরাপদে, ধারাবাহিকভাবে এবং পর্যবেক্ষণযোগ্যভাবে ব্যবসায়িক ফলাফলে রূপান্তরিত করে। মডেল কিনুন, কিন্তু হারনেস তৈরি করুন। AI ডিপ্লয়মেন্টের পরবর্তী ধাপে যে দলগুলো জয়ী হবে, তারা হবে সেই দল যারা বুঝতে পেরেছে যে একটি মাঝারি মানের মডেলের ওপর নির্মিত নির্ভরযোগ্য সিস্টেম একটি অসাধারণ মডেলের ওপর নির্মিত অনিয়ন্ত্রিত সিস্টেমকে প্রতিবারই হারিয়ে দেবে।