भाड्याने घेतलेल्या बुद्धिमत्तेकडून मॉडेल फॅक्टरीकडे

अनेक वर्षांपासून Thomson Reuters ने तृतीय-पक्ष लॅब्समधील व्यावसायिक मॉडेल्सचे 'फाईन-ट्यूनिंग' करून AI-वर्धित उत्पादने दिली आहेत. फाईन-ट्यूनिंगमध्ये प्री-ट्रेन्ड मॉडेल घेऊन एका लहान डेटासेटवर त्याचे वेट्स (weights) बदलले जातात, परंतु यामुळे मॉडेलची व्यापक तर्कशक्ती (reasoning) कमी होते आणि कंपनीला प्रदातांच्या (provider) किंमती आणि API मर्यादांवर अवलंबून राहावे लागते.

आता कंपनी AI कडे एका उत्पादन लाइनप्रमाणे (production line) पाहते. गेल्या दोन वर्षांत कंपनीने इंजिनिअर्स, डेटा सायंटिस्ट आणि कॉम्प्युट स्पेशालिस्ट्सची नियुक्ती केली आणि Alibaba च्या Qwen आर्किटेक्चरवर आधारित ओपन-सोर्स Qwen सिरीजमधील मॉडेल प्रशिक्षित करण्यासाठी क्लाउड GPU वेळ आणि ऑन-प्रेस (on-prem) हार्डवेअरवर $40 दशलक्ष खर्च केले. ओपन-सोर्सचा अर्थ असा की कोड आणि वेट्स सार्वजनिक आहेत, त्यामुळे Thomson Reuters कोणत्याही लायसन्सिंग शुल्काशिवाय एका मजबूत पायापासून सुरुवात करू शकली.

Imperial College सोबतच्या भागीदारीतून एक मध्यवर्ती “Snowdon” मॉडेल तयार झाले, ज्याला प्रथम सुरक्षा, नैतिकता आणि राजकीय तटस्थता यासाठी पुन्हा प्रशिक्षित करण्यात आले—ग्राहकांपर्यंत पोहोचण्यापूर्वी कोणत्याही LLM ने या अटी पूर्ण करणे आवश्यक असते. Snowdon नंतर, टीमने मॉडेलला Westlaw, Practical Law, Checkpoint आणि Reuters च्या न्यूज आर्काइव्हमधील मालकीचे (proprietary) कंटेंट दिले. आतापर्यंत त्यातील 10% पेक्षा कमी कंटेंट वापरला गेला आहे, ज्यामुळे अधिक डेटा उपलब्ध झाल्यावर विस्तार करण्यासाठी भरपूर वाव आहे. अंतिम टप्प्यात 'एजेंटिक रिइन्फोर्समेंट लर्निंग' (agentic reinforcement learning) जोडले गेले: मॉडेल Thomson Reuters च्या स्वतःच्या टूल एन्व्हायरनमेंटशी संवाद साधते, फीडबॅक घेते आणि कामाची कामगिरी सुधारण्यासाठी आपली पॉलिसी अपडेट करते. या संदर्भात, रिइन्फोर्समेंट लर्निंग मॉडेलला स्थिर उदाहरणांऐवजी 'ट्रायल अँड एरर' (trial and error) द्वारे उद्दिष्टे (जसे की योग्य सायटेशन शोधणे) साध्य करण्यास शिकवते.

मॉडेलची कामगिरी कशी आहे

Stanford LegalBench—जे कायदेशीर तर्कशक्तीच्या चाचण्यांचे संच आहे—मध्ये, इन-हाऊस मॉडेलने 0.823 गुण मिळवले, जे Harvey Legal Agent Benchmark वरील Gemini 3.1 Pro, GPT-5.5 आणि Opus 4.8 च्या मागे आहे. हे मॉडेल सामान्य कोडिंग आणि तर्कशक्तीच्या समस्यांमध्येही मागे आहे, ज्यावरून असे दिसून येते की त्याची मूळ तर्कशक्ती (raw reasoning power) अशा फ्रंटियर लॅब्सपेक्षा कमी आहे ज्या मोठ्या, सर्वसाधारण उद्देशांसाठी वापरल्या जाणाऱ्या LLMs मध्ये अब्जावधी डॉलर्स खर्च करतात.

जेव्हा मॉडेल Thomson Reuters च्या विशेष (exclusive) डेटाचा वापर करते, तेव्हा त्याचा फायदा दिसून येतो. तथ्यात्मक अचूकता मोजणाऱ्या 'Deep Research' बेंचमार्कमध्ये, केवळ वेब ॲक्सेससह मॉडेलने 0.53 स्कोर केला—जो GPT-5.4 च्या 0.65 पेक्षा कमी आहे. त्याच्या अंतर्गत कायदेशीर लायब्ररी जोडल्यामुळे अचूकता 0.83 पर्यंत पोहोचली, ज्यामुळे त्याने व्यावसायिक स्पर्धकाला मागे टाकले. हे निकाल एक परिचित पॅटर्न अधोरेखित करतात: जेव्हा एका मध्यम आकाराच्या मॉडेलला डोमेन-विशिष्ट ज्ञान दिले जाते, तेव्हा ते त्या विशेषाधिकार प्राप्त माहितीच्या अभावामुळे मोठ्या प्रणालींनाही हरवू शकते.

"स्वतःचे असणे" भाड्याने घेण्यापेक्षा का चांगले आहे

CTO Joel Hron आणि रिसर्च चीफ Jonathan Schwartz या गुंतवणुकीसाठी तीन मुख्य आधारस्तंभ सांगतात:

  1. खर्च आणि क्षमता – डॉक्युमेंट रिव्ह्यू सारखी मोठ्या प्रमाणात कामे व्यावसायिक API वर चालवल्यास प्रति-टोकन शुल्क लागते, जे वेगाने वाढते. एक समर्पित, लहान मॉडेल कायदेशीर-विशिष्ट कामगिरी टिकवून ठेवताना अत्यंत कमी किमतीत तेवढेच काम पूर्ण करू शकते.
  2. डेटा सार्वभौमत्व (Data sovereignty) – Thomson Reuters ची सर्वात मौल्यवान मालमत्ता म्हणजे तिचे क्युरेटेड कायदेशीर कंटेंट. तो डेटा बाह्य AI प्रदात्याला देणे म्हणजे सुरक्षा आणि गोपनीयतेचे धोके निर्माण करणे आणि प्रदात्याला स्पर्धात्मक फायदा देणे होय. डेटा इन-हाऊस ठेवल्यामुळे सुधारणा खाजगी राहतील याची खात्री मिळते.
  3. बढत्या बौद्धिक इक्विटी (Compounding intellectual equity) – जेव्हा जेव्हा एखादा वकील मॉडेलचे आउटपुट तपासतो, तेव्हा तो संवाद ट्रेनिंग डेटा म्हणून नोंदवला जाऊ शकतो, ज्यामुळे मॉडेल हळूहळू अधिक अचूक होते. कालांतराने कंपनी एक स्वयंचलितपणे मजबूत होणारी मालमत्ता तयार करते जी अधिक मौल्यवान होत जाते, जसे की भाडे भरण्याऐवजी स्वतःची मालमत्ता असणे.

पहिले वापर आणि ओपन-सोर्सला प्रोत्साहन

हे मॉडेल Thomson Reuters च्या CoCounsel Legal सुईटमध्ये अशा कामांसाठी रोल आउट केले जात आहे ज्यांना उच्च थ्रूपुट (high throughput) आणि कमी खर्चाची आवश्यकता असते, जसे की कॉन्ट्रॅक्ट्समधून स्ट्रक्चर्ड डेटा काढणारे 'Tabular Analysis' फीचर. हे मॉडेल सायटेशन-चेकिंग देखील हाताळते, जे कायदेशीर मसुदा तयार करताना (legal drafting) वारंवार करावे लागणारे पण अचूकतेसाठी अत्यंत महत्त्वाचे पाऊल आहे.

डेव्हलपर इकोसिस्टम विकसित करण्यासाठी, याचे एक संक्षिप्त रूप (trimmed-down version) नॉन-कमर्शियल लायसन्स अंतर्गत Hugging Face वर उपलब्ध होईल. यामुळे संशोधक आणि भागीदारांना कंपनीची महसूल मिळवून देणारी उत्पादने चालवणारे पूर्ण, मालकीचे (proprietary) मॉडेल उघड न करता प्रयोग करण्याची संधी मिळेल.