ভাড়া করা বুদ্ধিমত্তা থেকে একটি মডেল ফ্যাক্টরি

বছরের পর বছর ধরে Thomson Reuters তৃতীয় পক্ষের ল্যাব থেকে আসা বাণিজ্যিক মডেলগুলোকে ফাইন-টিউনিং (fine-tuning) করার মাধ্যমে AI-চালিত পণ্য সরবরাহ করে আসছে। ফাইন-টিউনিং একটি প্রি-ট্রেইনড মডেল গ্রহণ করে এবং একটি ছোট ডেটাসেটের ওপর এর ওয়েটস (weights) পরিবর্তন করে, কিন্তু এটি মডেলের ব্যাপক যুক্তি ক্ষমতা কমিয়ে দেয় এবং কোম্পানিকে সেই প্রদানকারীর মূল্য নির্ধারণ ও API সীমার ওপর নির্ভরশীল করে ফেলে।

এখন কোম্পানি AI-কে একটি উৎপাদন লাইন বা প্রোডাকশন লাইনের মতো বিবেচনা করছে। গত দুই বছরে তারা প্রকৌশলী, ডেটা সায়েন্টিস্ট এবং কম্পিউট স্পেশালিস্ট নিয়োগ করেছে এবং ওপেন-সোর্স Qwen সিরিজ—Alibaba-র Qwen আর্কিটেকচার—থেকে একটি মডেল প্রশিক্ষিত করতে ক্লাউড GPU টাইম এবং অন-প্রিম হার্ডওয়্যারের জন্য ৪০ মিলিয়ন ডলার ব্যয় করেছে। ওপেন-সোর্স মানে হলো এর কোড এবং ওয়েটস জনসমক্ষে উন্মুক্ত, তাই Thomson Reuters কোনো লাইসেন্সিং ফি ছাড়াই একটি শক্তিশালী ভিত্তির ওপর কাজ শুরু করতে পেরেছে।

Imperial College-এর সাথে একটি অংশীদারিত্বের মাধ্যমে একটি মধ্যবর্তী "Snowdon" মডেল তৈরি করা হয়েছে, যা প্রথমে নিরাপত্তা, নৈতিকতা এবং রাজনৈতিক নিরপেক্ষতার জন্য পুনরায় প্রশিক্ষণ দেওয়া হয়েছে—যা যেকোনো LLM-এর গ্রাহকদের কাছে পৌঁছানোর আগে পূরণ করা প্রয়োজন। Snowdon-এর পরে, দলটি এই মডেলে Westlaw, Practical Law, Checkpoint এবং Reuters নিউজ আর্কাইভের মালিকানাধীন কন্টেন্ট সরবরাহ করেছে। এখন পর্যন্ত সেই কন্টেন্টের ১০%-এরও কম ব্যবহার করা হয়েছে, যা ভবিষ্যতে আরও বেশি ডেটা অন্তর্ভুক্ত করার মাধ্যমে স্কেল করার প্রচুর সুযোগ রাখে। শেষ ধাপে এতে 'এজেন্টিক রিইনফোর্সমেন্ট লার্নিং' (agentic reinforcement learning) যুক্ত করা হয়েছে: মডেলটি Thomson Reuters-এর নিজস্ব টুল এনভায়রনমেন্টের সাথে মিথস্ক্রিয়া করে, ফিডব্যাক গ্রহণ করে এবং কাজের পারফরম্যান্স উন্নত করতে তার পলিসি আপডেট করে। এই প্রেক্ষাপটে, রিইনফোর্সমেন্ট লার্নিং মডেলটিকে স্থির উদাহরণের পরিবর্তে ভুল ও সংশোধনের (trial and error) মাধ্যমে লক্ষ্য অর্জন করতে (যেমন সঠিক সাইটেশন খুঁজে বের করা) শেখায়।

মডেলটির সক্ষমতা যাচাই

Stanford LegalBench—যা আইনি-যুক্তি পরীক্ষার একটি সেট—সেখানে ইন-হাউস মডেলটি ০.৮২৩ স্কোর করেছে, যা Harvey Legal Agent Benchmark-এ Gemini 3.1 Pro, GPT-5.5 এবং Opus 4.8 এর চেয়ে পিছিয়ে রয়েছে। সাধারণ কোডিং এবং যুক্তিমূলক সমস্যার ক্ষেত্রেও এটি কিছুটা পিছিয়ে আছে, যা নির্দেশ করে যে এর মৌলিক যুক্তি ক্ষমতা সেই সব ফ্রন্টিয়ার ল্যাবগুলোর তুলনায় দুর্বল, যারা বিশাল এবং সাধারণ উদ্দেশ্যে তৈরি LLM-এর পেছনে বিলিয়ন বিলিয়ন ডলার ব্যয় করে।

মডেলটির সুবিধাটি তখনই প্রকাশ পায় যখন এটি Thomson Reuters-এর একচেটিয়া ডেটা ব্যবহার করে। তথ্যের নির্ভুলতা পরিমাপকারী একটি Deep Research বেঞ্চমার্কে, মডেলটি শুধুমাত্র ওয়েব অ্যাক্সেস ব্যবহার করে ০.৫৩ স্কোর করেছে—যা GPT-5.4-এর ০.৬৫ এর চেয়ে কম। তবে এর অভ্যন্তরীণ আইনি লাইব্রেরি যুক্ত করার পর নির্ভুলতা বেড়ে ০.৮৩ হয়েছে, যা বাণিজ্যিক প্রতিযোগীদের ছাড়িয়ে গেছে। এই ফলাফলটি একটি পরিচিত ধরণকে তুলে ধরে: একটি মাঝারি আকারের মডেল যখন ডোমেইন-নির্দিষ্ট জ্ঞান পায়, তখন এটি অনেক বড় সিস্টেমকেও হারিয়ে দিতে পারে যাদের কাছে সেই বিশেষ তথ্য নেই।

কেন "মালিকানা" "ভাড়া" করার চেয়ে শ্রেয়

CTO Joel Hron এবং রিসার্চ চিফ Jonathan Schwartz এই বিনিয়োগের তিনটি মূল স্তম্ভের কথা উল্লেখ করেছেন:

  1. খরচ এবং সক্ষমতা – বাণিজ্যিক API-তে ডকুমেন্ট রিভিউয়ের মতো উচ্চ-ভলিউম কাজ চালানোর ক্ষেত্রে প্রতি-টোকেন ফি দ্রুত বৃদ্ধি পায়। একটি ডেডিকেটেড, ছোট মডেল আইনি-নির্দিষ্ট পারফরম্যান্স বজায় রেখে অনেক কম খরচে একই পরিমাণ কাজ সম্পন্ন করতে পারে।
  2. ডেটা সার্বভৌমত্ব – Thomson Reuters-এর সবচেয়ে মূল্যবান সম্পদ হলো এর কিউরেটেড আইনি কন্টেন্ট। এই ডেটা কোনো বাহ্যিক AI প্রদানকারীকে দিয়ে দিলে নিরাপত্তা এবং গোপনীয়তার ঝুঁকি তৈরি হয় এবং প্রদানকারীকে একটি প্রতিযোগিতামূলক সুবিধা দিয়ে দেওয়া হয়। ডেটা ইন-হাউস বা নিজস্ব রাখার মাধ্যমে নিশ্চিত করা হয় যে এর উন্নতিগুলো ব্যক্তিগত বা গোপনীয় থাকে।
  3. ক্রমবর্ধমান বুদ্ধিবৃত্তিক ইক্যুইটি – প্রতিবার যখন একজন আইনজীবী একটি মডেলের আউটপুট পর্যালোচনা করেন, সেই মিথস্ক্রিয়াটি প্রশিক্ষণের ডেটা হিসেবে লগ করা যেতে পারে, যা ধীরে ধীরে মডেলটিকে আরও উন্নত করে। সময়ের সাথে সাথে কোম্পানিটি একটি স্বয়ং-শক্তিশালী সম্পদ তৈরি করে যা ক্রমশ মূল্যবান হয়ে ওঠে, ঠিক যেমন ভাড়া দেওয়ার পরিবর্তে সম্পত্তি নিজের মালিকানায় রাখা।

প্রথম ব্যবহারের ক্ষেত্র এবং ওপেন-সোর্সের প্রতি স্বীকৃতি

মডেলটি Thomson Reuters-এর CoCounsel Legal সুইটে এমন সব কাজের জন্য চালু করা হচ্ছে যেগুলোর জন্য উচ্চ উৎপাদন ক্ষমতা এবং স্বল্প খরচ প্রয়োজন, যেমন Tabular Analysis ফিচার যা চুক্তি থেকে কাঠামোগত ডেটা সংগ্রহ করে। এটি সাইটেশন-চেকিংয়ের কাজও পরিচালনা করে, যা আইনি খসড়া তৈরির ক্ষেত্রে একটি পুনরাবৃত্তিমূলক কিন্তু নির্ভুলতা-সংবেদনশীল ধাপ।

ডেভেলপার ইকোসিস্টেম গড়ে তোলার জন্য, একটি সংক্ষিপ্ত সংস্করণ অ-বাণিজ্যিক লাইসেন্সের অধীনে Hugging Face-এ পাওয়া যাবে। এটি গবেষক এবং অংশীদারদের পরীক্ষা-নিরীক্ষা করার সুযোগ দেবে, কিন্তু কোম্পানির রাজস্ব উৎপাদনকারী পণ্যগুলোর মূল মালিকানাধীন মডেলটি উন্মুক্ত করতে হবে না।