വാടകയ്ക്ക് ലഭിക്കുന്ന ബുദ്ധിശക്തിയിൽ നിന്ന് ഒരു മോഡൽ ഫാക്ടറിയിലേക്ക്
വർഷങ്ങളായി, തേർഡ് പാർട്ടി ലാബുകളിൽ നിന്നുള്ള കൊമേഴ്സ്യൽ മോഡലുകൾ ഫൈൻ-ട്യൂൺ (fine-tuning) ചെയ്തുകൊണ്ടാണ് Thomson Reuters AI-മെച്ചപ്പെടുത്തിയ ഉൽപ്പന്നങ്ങൾ വാഗ്ദാനം ചെയ്തിരുന്നത്. ഫൈൻ-ട്യൂണിംഗ് എന്നത് ഒരു പ്രീ-ട്രെയിൻഡ് മോഡലിനെ എടുത്ത് ചെറിയൊരു ഡാറ്റാസെറ്റ് ഉപയോഗിച്ച് അതിന്റെ വെയ്റ്റുകൾ (weights) ക്രമീകരിക്കുന്ന രീതിയാണ്, എന്നാൽ ഇത് മോഡലിന്റെ വിപുലമായ യുക്തിചിന്തയെ (reasoning) പരിമിതപ്പെടുത്തുകയും കമ്പനിയെ പ്രൊവൈഡറുടെ വിലനിർണ്ണയത്തിനും API പരിധിക്കുമടിയിൽ എത്തിക്കുകയും ചെയ്യുന്നു.
ഇപ്പോൾ കമ്പനി AI-യെ ഒരു പ്രൊഡക്ഷൻ ലൈൻ പോലെയാണ് കാണുന്നത്. കഴിഞ്ഞ രണ്ട് വർഷത്തിനിടെ അവർ എഞ്ചിനീയർമാരെയും ഡാറ്റാ സയന്റിസ്റ്റുകളെയും കമ്പ്യൂട്ട് സ്പെഷ്യലിസ്റ്റുകളെയും നിയമിക്കുകയും, അലിബാബയുടെ Qwen ആർക്കിടെക്ചറിലുള്ള ഓപ്പൺ സോഴ്സ് Qwen സീരീസിൽ നിന്നുള്ള ഒരു മോഡൽ പരിശീലിപ്പിക്കുന്നതിനായി ക്ലൗഡ് GPU സമയത്തിനും ഓൺ-പ്രെമിസ് ഹാർഡ്വെയറിനുമായി 40 മില്യൺ ഡോളർ ചെലവഴിക്കുകയും ചെയ്തു. ഓപ്പൺ സോഴ്സ് എന്നാൽ കോഡും വെയ്റ്റുകളും പൊതുവായി ലഭ്യമാണ് എന്നാണ് അർത്ഥമാക്കുന്നത്, അതിനാൽ ലൈസൻസിംഗ് ഫീസുകൾ ഇല്ലാതെ തന്നെ ശക്തമായ ഒരു അടിത്തറയിൽ നിന്ന് Thomson Reutersക്ക് തുടക്കം കുറിക്കാനായി.
ഇംപീരിയൽ കോളേജുമായുള്ള പങ്കാളിത്തത്തിലൂടെ ഒരു ഇടക്കാല "Snowdon" മോഡൽ നിർമ്മിച്ചു; ഇത് ആദ്യം സുരക്ഷ, എത്തിക്സ്, രാഷ്ട്രീയ നിഷ്പക്ഷത എന്നിവയ്ക്കായി പുനർപരിശീലനം ചെയ്തു—ഉപഭോക്താക്കളിലേക്ക് എത്തുന്നതിന് മുമ്പ് ഏതൊരു LLM-ഉം പാലിക്കേണ്ട ആവശ്യകതകളാണിവ. Snowdon-ന് ശേഷം, ടീം Westlaw, Practical Law, Checkpoint, Reuters വാർത്താ ആർക്കൈവുകൾ എന്നിവയിൽ നിന്നുള്ള ഉടമസ്ഥാവകാശമുള്ള (proprietary) ഉള്ളടക്കം മോഡലിലേക്ക് നൽകി. ഇതിൽ 10 ശതമാനത്തിൽ താഴെ ഉള്ളടക്കം മാത്രമേ ഇതുവരെ ഉപയോഗിച്ചിട്ടുള്ളൂ, കൂടുതൽ ഡാറ്റ ഉൾപ്പെടുത്തുന്നതിനനുസരിച്ച് വിപുലീകരിക്കാൻ ധാരാളം സാധ്യതയുണ്ട്. അവസാന ഘട്ടത്തിൽ ഏജന്റിക് റൈൻഫോഴ്സ്മെന്റ് ലേണിംഗ് (agentic reinforcement learning) ചേർത്തു: മോഡൽ Thomson Reuters-ന്റെ സ്വന്തം ടൂൾ എൻവയോൺമെന്റുകളുമായി സംവദിക്കുകയും, ഫീഡ്ബാക്ക് സ്വീകരിക്കുകയും, ടാസ്ക് പെർഫോമൻസ് മെച്ചപ്പെടുത്തുന്നതിനായി അതിന്റെ പോളിസി അപ്ഡേറ്റ് ചെയ്യുകയും ചെയ്യുന്നു. ഈ സാഹചര്യത്തിൽ, റൈൻഫോഴ്സ്മെന്റ് ലേണിംഗ് എന്നത് സ്റ്റാറ്റിക് ഉദാഹരണങ്ങൾക്ക് പകരം പരീക്ഷണങ്ങളിലൂടെയും തെറ്റുകളിലൂടെയും ലക്ഷ്യങ്ങൾ (ശരിയായ സൈറ്റേഷൻ കണ്ടെത്തുന്നത് പോലെ) കൈവരിക്കാൻ മോഡലിനെ പഠിപ്പിക്കുന്നു.
മോഡൽ എങ്ങനെ നിലനിൽക്കുന്നു
ലീഗൽ റീസണിംഗ് ടെസ്റ്റുകളുടെ ഒരു കൂട്ടമായ Stanford LegalBench-ൽ, ഇൻ-ഹൗസ് മോഡൽ 0.823 സ്കോർ ചെയ്തു; ഇത് Harvey Legal Agent Benchmark-ലെ Gemini 3.1 Pro, GPT-5.5, Opus 4.8 എന്നിവയേക്കാൾ പിന്നിലാണ്. ജനറിക്കൽ കോഡിംഗ്, റീസണിംഗ് പ്രശ്നങ്ങളിലും ഇത് പിന്നിലായതിനാൽ, വൻതോതിലുള്ള ജനറൽ പർപ്പസ് LLM-കൾക്കായി കോടിക്കണക്കിന് ഡോളർ ചെലവഴിക്കുന്ന ഫ്രണ്ടിയർ ലാബുകളെ അപേക്ഷിച്ച് ഇതിന്റെ അടിസ്ഥാന യുക്തിചിന്താ ശേഷി (raw reasoning power) ദുർബലമാണെന്ന് കാണിക്കുന്നു.
Thomson Reuters-ന്റെ എക്സ്ക്ലൂസീവ് ഡാറ്റ ഉപയോഗിക്കുമ്പോഴാണ് ഈ മോഡലിന്റെ ഗുണം പ്രകടമാകുന്നത്. വസ്തുതാപരമായ കൃത്യത അളക്കുന്ന ഒരു Deep Research ബെഞ്ച്മാർക്കിൽ, വെബ് ആക്സസ് മാത്രം ഉപയോഗിച്ച് മോഡൽ 0.53 സ്കോർ ചെയ്തു—ഇത് GPT-5.4-ന്റെ 0.65-നേക്കാൾ കുറവാണ്. എന്നാൽ ഇതിന്റെ ആഭ്യന്തര ലീഗൽ ലൈബ്രറികൾ ചേർത്തപ്പോൾ കൃത്യത 0.83 ആയി ഉയരുകയും വാണിജ്യ എതിരാളികളെ മറികടക്കുകയും ചെയ്തു. ഈ ഫലം ഒരു പരിചിതമായ പാറ്റേണിനെ അടിവരയിടുന്നു: ഒരു മിതമായ വലിപ്പമുള്ള മോഡലിന്, ഡൊമെയ്ൻ-സ്പെസിഫിക് അറിവ് നൽകിയാൽ, ആ പ്രത്യേക വിവരങ്ങൾ ഇല്ലാത്ത വളരെ വലിയ സിസ്റ്റങ്ങളെപ്പോലും തോൽപ്പിക്കാൻ കഴിയും.
എന്തുകൊണ്ട് "സ്വന്തമാക്കുന്നത്" "വാടകയ്ക്ക് എടുക്കുന്നതിനേക്കാൾ" മികച്ചതാകുന്നു
CTO Joel Hron-ഉം റിസർച്ച് ചീഫ് Jonathan Schwartz-ഉം ഈ നിക്ഷേപത്തിന് മൂന്ന് തൂണുകൾ ചൂണ്ടിക്കാട്ടുന്നു:
- ചെലവും ശേഷിയും – ഡോക്യുമെന്റ് റിവ്യൂ പോലുള്ള ഉയർന്ന അളവിലുള്ള ജോലികൾ ഒരു കൊമേഴ്സ്യൽ API വഴി നടത്തുമ്പോൾ, ഓരോ ടോക്കണിനും (per-token) വലിയ തുക ഫീസായി നൽകേണ്ടി വരും. ഒരു പ്രത്യേകമായി തയ്യാറാക്കിയ ചെറിയ മോഡൽ, നിയമപരമായ പ്രകടനം നിലനിർത്തിക്കൊണ്ടുതന്നെ വളരെ കുറഞ്ഞ ചെലവിൽ ഇതേ ജോലി പൂർത്തിയാക്കുന്നു.
- ഡാറ്റാ പരമാധികാരം (Data sovereignty) – Thomson Reuters-ന്റെ ഏറ്റവും മൂല്യവത്തായ ആസ്തി അതിന്റെ ക്യൂറേറ്റഡ് ലീഗൽ ഉള്ളടക്കമാണ്. ഈ ഡാറ്റ ഒരു ബാഹ്യ AI പ്രൊവൈഡർക്ക് കൈമാറുന്നത് സുരക്ഷാപരവും രഹസ്യാത്മകതയുമായി ബന്ധപ്പെട്ടതുമായ അപകടസാധ്യതകൾ സൃഷ്ടിക്കുകയും പ്രൊവൈഡർക്ക് ഒരു മത്സര നേട്ടം നൽകുകയും ചെയ്യുന്നു. ഡാറ്റ ഇൻ-ഹൗസ് ആയി സൂക്ഷിക്കുന്നത് മെച്ചപ്പെടുത്തലുകൾ സ്വകാര്യമായിരിക്കുമെന്ന് ഉറപ്പാക്കുന്നു.
- സമ്പാദിച്ച ബൗദ്ധിക മൂല്യം (Compounding intellectual equity) – ഓരോ തവണ ഒരു വക്കീൽ മോഡലിന്റെ ഔട്ട്പുട്ട് പരിശോധിക്കുമ്പോഴും, ആ ഇടപെടൽ ഒരു ട്രെയിനിംഗ് ഡാറ്റയായി രേഖപ്പെടുത്താനും മോഡലിനെ ക്രമേണ പരിഷ്കരിക്കാനും കഴിയും. കാലക്രമേണ, വാടക നൽകുന്നതിന് പകരം ഒരു വസ്തു സ്വന്തമാക്കുന്നത് പോലെ, കമ്പനി കൂടുതൽ മൂല്യമുള്ളതും സ്വയം ശക്തിപ്പെടുന്നതുമായ ഒരു ആസ്തി കെട്ടിപ്പടുക്കുന്നു.
ആദ്യ ഉപയോഗങ്ങളും ഓപ്പൺ സോഴ്സിനോടുള്ള ഒരു ആദരവും
കരാറുകളിൽ നിന്ന് സ്ട്രക്ചർഡ് ഡാറ്റ വേർതിരിച്ചെടുക്കുന്ന Tabular Analysis ഫീച്ചർ പോലുള്ള, ഉയർന്ന വേഗതയും കുറഞ്ഞ ചെലവും ആവശ്യമായ ജോലികൾക്കായി Thomson Reuters-ന്റെ CoCounsel Legal സ്യൂട്ടിൽ ഈ മോഡൽ അവതരിപ്പിക്കുന്നുണ്ട്. നിയമപരമായ ഡ്രാഫ്റ്റിംഗിലെ ആവർത്തനസ്വഭാവമുള്ളതും എന്നാൽ കൃത്യത നിർണ്ണായകമായതുമായ സൈറ്റേഷൻ ചെക്കിംഗും (citation-checking) ഇത് കൈകാര്യം ചെയ്യുന്നു.
ഒരു ഡെവലപ്പർ ഇക്കോസിസ്റ്റം വളർത്തുന്നതിനായി, ഇതിന്റെ ലഘൂകരിച്ച ഒരു പതിപ്പ് നോൺ-കൊമേഴ്സ്യൽ ലൈസൻസിന് കീഴിൽ Hugging Face-ൽ ലഭ്യമാക്കും. ഇത് കമ്പനിയുടെ വരുമാനം ഉണ്ടാക്കുന്ന ഉൽപ്പന്നങ്ങൾക്ക് കരുത്തുപകരുന്ന പൂർണ്ണമായ പ്രൊപ്രൈറ്ററി മോഡൽ വെളിപ്പെടുത്താതെ തന്നെ ഗവേഷകർക്കും പങ്കാളികൾക്കും പരീക്ഷണങ്ങൾ നടത്താൻ അനുവദിക്കുന്നു.
