किराए की इंटेलिजेंस से मॉडल फैक्ट्री तक

वर्षों से Thomson Reuters तीसरे पक्ष की लैब्स के कमर्शियल मॉडल्स को फाइन-ट्यून करके AI-एन्हांस्ड प्रोडक्ट्स पेश कर रहा था। फाइन-ट्यूनिंग एक प्री-ट्रेन्ड मॉडल को लेती है और एक छोटे डेटासेट पर उसके वेट्स (weights) को बदलती है, लेकिन यह मॉडल की व्यापक तर्क क्षमता (broad reasoning) को कम कर देती है और कंपनी को प्रोवाइडर की प्राइसिंग और API सीमाओं से बांध देती है।

अब कंपनी AI को एक प्रोडक्शन लाइन की तरह देखती है। पिछले दो वर्षों में इसने इंजीनियरों, डेटा वैज्ञानिकों और कंप्यूट स्पेशलिस्टों को काम पर रखा, और ओपन-सोर्स Qwen सीरीज़—Alibaba के Qwen आर्किटेक्चर—से एक मॉडल को ट्रेन करने के लिए क्लाउड GPU समय और ऑन-प्रीम (on-prem) हार्डवेयर पर $40 मिलियन खर्च किए। ओपन-सोर्स का मतलब है कि कोड और वेट्स सार्वजनिक हैं, इसलिए Thomson Reuters बिना किसी लाइसेंसिंग फीस के एक मजबूत आधार से शुरुआत कर सका।

Imperial College के साथ साझेदारी से एक इंटरमीडिएट “Snowdon” मॉडल तैयार हुआ, जिसे सबसे पहले सुरक्षा, नैतिकता और राजनीतिक तटस्थता के लिए फिर से ट्रेन किया गया—ये वे आवश्यकताएं हैं जिन्हें किसी भी LLM को ग्राहकों तक पहुँचने से पहले पूरा करना चाहिए। Snowdon के बाद, टीम ने मॉडल को Westlaw, Practical Law, Checkpoint और Reuters न्यूज़ आर्काइव्स से प्रोप्राइटरी कंटेंट खिलाया। अब तक उस कंटेंट का 10% से भी कम हिस्सा इस्तेमाल किया गया है, जिससे और अधिक डेटा शामिल होने पर विस्तार करने की काफी गुंजाइश बनी हुई है। अंतिम चरण में एजेंटिक रीइन्फोर्समेंट लर्निंग (agentic reinforcement learning) को जोड़ा गया: मॉडल Thomson Reuters के अपने टूल एनवायरनमेंट के साथ इंटरैक्ट करता है, फीडबैक प्राप्त करता है, और टास्क परफॉरमेंस सुधारने के लिए अपनी पॉलिसी को अपडेट करता है। इस संदर्भ में, रीइन्फोर्समेंट लर्निंग मॉडल को स्टैटिक उदाहरणों के बजाय ट्रायल और एरर (trial and error) के माध्यम से लक्ष्य प्राप्त करना सिखाती है (जैसे सही साइटेशन ढूँढना)।

मॉडल का प्रदर्शन कैसा है

Stanford LegalBench—जो लीगल-रीज़निंग टेस्ट का एक सूट है—पर इन-हाउस मॉडल ने 0.823 स्कोर किया, जो Harvey Legal Agent Benchmark पर Gemini 3.1 Pro, GPT-5.5 और Opus 4.8 से पीछे है। यह जेनेरिक कोडिंग और रीज़निंग समस्याओं में भी पीछे है, जो यह दर्शाता है कि इसकी रॉ रीज़निंग पावर उन फ्रंटियर लैब्स की तुलना में कमजोर बनी हुई है जो विशाल, जनरल-पर्पस LLMs पर अरबों डॉलर खर्च करती हैं।

इसका फायदा तब दिखता है जब मॉडल Thomson Reuters के एक्सक्लूसिव डेटा का उपयोग करता है। फैक्टुअल एक्यूरेसी मापने वाले Deep Research बेंचमार्क में, मॉडल ने केवल वेब एक्सेस के साथ 0.53 स्कोर किया—जो GPT-5.4 के 0.65 से कम है। इसकी इंटरनल लीगल लाइब्रेरीज़ जोड़ने से एक्यूरेसी बढ़कर 0.83 हो गई, जिससे इसने कमर्शियल प्रतिद्वंद्वी को पीछे छोड़ दिया। यह परिणाम एक परिचित पैटर्न को रेखांकित करता है: एक मध्यम आकार का मॉडल, जब उसे डोमेन-विशिष्ट ज्ञान दिया जाता है, तो वह उन बहुत बड़े सिस्टम्स को हरा सकता है जिनके पास वह विशेष जानकारी नहीं होती।

क्यों “खुद का होना” “किराए पर लेने” से बेहतर है

CTO Joel Hron और रिसर्च चीफ Jonathan Schwartz इस निवेश के लिए तीन स्तंभों की ओर इशारा करते हैं:

  1. लागत और क्षमता – कमर्शियल API पर डॉक्यूमेंट रिव्यू जैसे हाई-वॉल्यूम टास्क चलाने पर प्रति-टोकन फीस लगती है जो तेजी से बढ़ती जाती है। एक समर्पित, छोटा मॉडल लीगल-विशिष्ट परफॉरमेंस को बनाए रखते हुए बहुत कम कीमत पर उसी वर्कलोड को प्रोसेस कर सकता है।
  2. डेटा संप्रभुता (Data sovereignty) – Thomson Reuters की सबसे मूल्यवान संपत्ति उसका क्यूरेटेड लीगल कंटेंट है। उस डेटा को किसी बाहरी AI प्रोवाइडर को सौंपने से सुरक्षा और गोपनीयता के जोखिम पैदा होते हैं और प्रोवाइडर को एक प्रतिस्पर्धी बढ़त मिल जाती है। डेटा को इन-हाउस रखने से यह सुनिश्चित होता है कि सुधार निजी रहें।
  3. बढ़ती बौद्धिक इक्विटी (Compounding intellectual equity) – हर बार जब कोई वकील मॉडल के आउटपुट की समीक्षा करता है, तो उस इंटरैक्शन को ट्रेनिंग डेटा के रूप में लॉग किया जा सकता है, जिससे मॉडल धीरे-धीरे और बेहतर होता जाता है। समय के साथ कंपनी एक स्व-सुदृढ़ (self-reinforcing) संपत्ति बनाती है जो अधिक मूल्यवान होती जाती है, ठीक वैसे ही जैसे किराया देने के बजाय संपत्ति का मालिक होना।

पहले यूज़ केस और ओपन-सोर्स को सम्मान

यह मॉडल Thomson Reuters के CoCounsel Legal सूट में उन कार्यों के लिए रोल आउट किया जा रहा है जिनमें हाई थ्रूपुट और कम लागत की आवश्यकता होती है, जैसे कि Tabular Analysis फीचर जो कॉन्ट्रैक्ट्स से स्ट्रक्चर्ड डेटा निकालता है। यह साइटेशन-चेकिंग भी संभालता है, जो लीगल ड्राफ्टिंग में एक दोहराव वाला लेकिन सटीकता के लिए महत्वपूर्ण कदम है।

एक डेवलपर इकोसिस्टम को बढ़ावा देने के लिए, इसका एक छोटा (trimmed-down) वर्जन नॉन-कमर्शियल लाइसेंस के तहत Hugging Face पर उपलब्ध होगा। इससे शोधकर्ता और पार्टनर कंपनी के रेवेन्यू जेनरेट करने वाले प्रोडक्ट्स को चलाने वाले पूर्ण, प्रोप्राइटरी मॉडल को उजागर किए बिना प्रयोग कर सकेंगे।