Od wynajmowanej inteligencji do fabryki modeli

Przez lata Thomson Reuters oferował produkty wzbogacone o AI poprzez fine-tuning komercyjnych modeli od zewnętrznych laboratoriów. Fine-tuning polega na wzięciu wstępnie wytrenowanego modelu i dostosowaniu jego wag na mniejszym zbiorze danych, ale ogranicza to szerokie zdolności rozumowania modelu i uzależnia firmę od cenników oraz limitów API dostawcy.

Obecnie firma traktuje AI jak linię produkcyjną. W ciągu ostatnich dwóch lat zatrudniła inżynierów, naukowców danych oraz specjalistów od mocy obliczeniowej, a także wydała 40 milionów dolarów na czas pracy procesorów GPU w chmurze i sprzęt on-prem, aby wytrenować model z serii open-source Qwen — architektury Qwen od Alibaby. Open-source oznacza, że kod i wagi są publiczne, dzięki czemu Thomson Reuters mogła zacząć od solidnych fundamentów bez opłat licencyjnych.

Partnerstwo z Imperial College zaowocowało powstaniem pośredniego modelu „Snowdon”, który został najpierw dotrenowany pod kątem bezpieczeństwa, etyki i neutralności politycznej — wymagań, jakie każdy LLM musi spełnić przed udostępnieniem klientom. Po etapie Snowdon zespół zasilił model zastrzeżonymi treściami z Westlaw, Practical Law, Checkpoint oraz archiwów informacyjnych Reuters. Do tej pory wykorzystano mniej niż 10% tych treści, co pozostawia ogromne pole do skalowania wraz z napływem kolejnych danych. Ostatnim krokiem było dodanie agentic reinforcement learning: model wchodzi w interakcje z własnymi środowiskami narzędziowymi Thomson Reuters, otrzymuje informację zwrotną i aktualizuje swoją politykę, aby poprawić wydajność zadań. W tym kontekście uczenie ze wzmocnieniem uczy model osiągania celów (takich jak znalezienie właściwego cytowania) poprzez metodę prób i błędów, a nie na podstawie statycznych przykładów.

Jak wypada model

W Stanford LegalBench — zestawie testów rozumowania prawniczego — własny model uzyskał wynik 0,823, ustępując Gemini 3.1 Pro, GPT-5.5 oraz Opus 4.8 w rankingu Harvey Legal Agent Benchmark. Model odstaje również w ogólnych problemach programistycznych i logicznych, co pokazuje, że jego surowa moc rozumowania pozostaje słabsza niż w przypadku czołowych laboratoriów, które inwestują miliardy w ogromne, ogólnego przeznaczenia modele LLM.

Przewaga pojawia się, gdy model korzysta z wyłącznych danych Thomson Reuters. W benchmarku Deep Research mierzącym dokładność faktograficzną, model osiągnął wynik 0,53 przy dostępie wyłącznie do sieci — mniej niż 0,65 w przypadku GPT-5.4. Dodanie wewnętrznych bibliotek prawnych podniosło dokładność do 0,83, wyprzedzając komercyjną konkurencję. Wynik ten podkreśla znany schemat: model o umiarkowanej wielkości, po nakarmieniu go wiedzą specjalistyczną z danej dziedziny, może pokonać znacznie większe systemy, którym brakuje tych uprzywilejowanych informacji.

Dlaczego „własność” wygrywa z „wynajmem”

CTO Joel Hron i szef badań Jonathan Schwartz wskazują na trzy filary tej inwestycji:

  1. Koszty i możliwości – Przetwarzanie dużej liczby zadań, takich jak przegląd dokumentów, za pomocą komercyjnego API wiąże się z opłatami za każdy token, które szybko rosną. Dedykowany, mniejszy model przetwarza ten sam wolumen pracy za ułamek ceny, zachowując przy tym wydajność specyficzną dla branży prawniczej.
  2. Suwerenność danych – Najcenniejszym aktywem Thomson Reuters są starannie wyselekcjonowane treści prawne. Przekazanie tych danych zewnętrznemu dostawcy AI tworzy ryzyka w zakresie bezpieczeństwa i poufności, a także daje dostawcy przewagę konkurencyjną. Przechowywanie danych wewnątrz firmy gwarantuje, że ulepszenia pozostają prywatne.
  3. Kumulowanie kapitału intelektualnego – Za każdym razem, gdy prawnik weryfikuje wynik działania modelu, interakcja ta może zostać zapisana jako dane treningowe, stopniowo udoskonalając model. Z czasem firma buduje samowzmacniający się zasób, który staje się coraz cenniejszy – podobnie jak posiadanie nieruchomości zamiast płacenia czynszu.

Pierwsze przypadki użycia i ukłon w stronę open-source

Model jest wdrażany w pakiecie CoCounsel Legal firmy Thomson Reuters do zadań wymagających dużej przepustowości i niskich kosztów, takich jak funkcja Tabular Analysis, która wyodrębnia ustrukturyzowane dane z umów. Obsługuje on również sprawdzanie cytowań – powtarzalny, ale krytyczny dla dokładności etap sporządzania pism prawnych.

Aby wspierać ekosystem deweloperski, uproszczona wersja pojawi się na Hugging Face na licencji niekomercyjnej. Pozwoli to badaczom i partnerom na eksperymentowanie bez ujawniania pełnego, zastrzeżonego modelu, który napędza generujące przychody produkty firmy.