Von gemieteter Intelligenz zur Modellfabrik
Jahrelang bot Thomson Reuters KI-gestützte Produkte an, indem es kommerzielle Modelle von Drittanbietern feinabstimmte (Fine-Tuning). Beim Fine-Tuning wird ein vortrainiertes Modell genommen und dessen Gewichte auf einem kleineren Datensatz angepasst, was jedoch die allgemeine Argumentationsfähigkeit des Modells einschränkt und das Unternehmen an die Preisgestaltung und API-Limits des Anbieters bindet.
Heute betrachtet das Unternehmen KI wie eine Produktionslinie. In den letzten zwei Jahren stellte es Ingenieure, Data Scientists und Compute-Spezialisten ein und investierte 40 Millionen US-Dollar in Cloud-GPU-Zeit sowie On-Premise-Hardware, um ein Modell aus der Open-Source-Serie Qwen zu trainieren – der Qwen-Architektur von Alibaba. Open Source bedeutet, dass der Code und die Gewichte öffentlich zugänglich sind, sodass Thomson Reuters auf einer starken Basis ohne Lizenzgebühren aufbauen konnte.
Eine Partnerschaft mit dem Imperial College brachte ein Zwischenmodell namens „Snowdon“ hervor, das zunächst auf Sicherheit, Ethik und politische Neutralität hin nachjustiert wurde – Anforderungen, die jedes LLM erfüllen muss, bevor es Kunden erreicht. Nach Snowdon speiste das Team das Modell mit proprietären Inhalten aus Westlaw, Practical Law, Checkpoint und den Reuters-Nachrichtenarchiven. Bisher wurden weniger als 10 % dieser Inhalte verwendet, was viel Spielraum für eine Skalierung bietet, sobald weitere Daten aufgenommen werden. Der letzte Schritt war die Implementierung von agentischem Reinforcement Learning: Das Modell interagiert mit den eigenen Tool-Umgebungen von Thomson Reuters, erhält Feedback und aktualisiert seine Strategie (Policy), um die Aufgabenleistung zu verbessern. In diesem Zusammenhang lehrt Reinforcement Learning das Modell, Ziele (wie das Finden der richtigen Zitierung) durch Versuch und Irrtum statt durch statische Beispiele zu erreichen.
Wie das Modell abschneidet
Beim Stanford LegalBench – einer Suite von Tests zur juristischen Argumentation – erreichte das hauseigene Modell einen Wert von 0,823 und lag damit hinter Gemini 3.1 Pro, GPT-5.5 und Opus 4.8 im Harvey Legal Agent Benchmark. Es hinkt auch bei allgemeinen Programmier- und Denkaufgaben hinterher, was zeigt, dass seine reine Argumentationskraft nach wie vor schwächer ist als die von führenden Laboren, die Milliarden in massive, universell einsetzbare LLMs investieren.
Der Vorteil zeigt sich, wenn das Modell auf die exklusiven Daten von Thomson Reuters zugreift. In einem Deep-Research-Benchmark zur Messung der faktischen Genauigkeit erreichte das Modell mit reinem Webzugriff einen Wert von 0,53 – niedriger als die 0,65 von GPT-5.4. Durch die Einbindung der internen juristischen Bibliotheken stieg die Genauigkeit auf 0,83 und übertraf damit den kommerziellen Konkurrenten. Das Ergebnis unterstreicht ein bekanntes Muster: Ein moderat dimensioniertes Modell kann, wenn es mit fachspezifischem Wissen gefüttert wird, weitaus größere Systeme schlagen, denen diese privilegierten Informationen fehlen.
Warum „Eigentum“ besser ist als „Miete“
CTO Joel Hron und Forschungsleiter Jonathan Schwartz nennen drei Säulen für diese Investition:
- Kosten und Leistungsfähigkeit – Die Durchführung von Aufgaben mit hohem Volumen, wie etwa die Dokumentenprüfung über eine kommerzielle API, verursacht pro Token anfallende Gebühren, die schnell steigen. Ein dediziertes, kleineres Modell verarbeitet dieselbe Arbeitslast zu einem Bruchteil des Preises und bewahrt gleichzeitig die juristische Fachleistung.
- Datensouveränität – Das wertvollste Gut von Thomson Reuters ist sein kuratierter juristischer Inhalt. Die Übergabe dieser Daten an einen externen KI-Anbieter birgt Sicherheits- und Vertraulichkeitsrisiken und verschafft dem Anbieter einen Wettbewerbsvorteil. Die Daten im Haus zu behalten, stellt sicher, dass Verbesserungen privat bleiben.
- Kumulatives geistiges Eigenkapital – Jedes Mal, wenn ein Anwalt die Ausgabe eines Modells überprüft, kann diese Interaktion als Trainingsdaten protokolliert werden, wodurch das Modell schrittweise verfeinert wird. Im Laufe der Zeit baut das Unternehmen einen selbstverstärkenden Vermögenswert auf, der immer wertvoller wird – vergleichbar mit dem Besitz von Immobilien statt dem bloßen Zahlen von Miete.
Erste Anwendungsfälle und eine Verbeugung vor Open Source
Das Modell wird in der CoCounsel Legal-Suite von Thomson Reuters für Aufgaben eingeführt, die einen hohen Durchsatz und geringe Kosten erfordern, wie etwa die Funktion „Tabular Analysis“, die strukturierte Daten aus Verträgen extrahiert. Es übernimmt auch die Zitierprüfung, einen repetitiven, aber für die Genauigkeit entscheidenden Schritt bei der Erstellung juristischer Dokumente.
Um ein Entwickler-Ökosystem zu fördern, wird eine abgespeckte Version unter einer nicht-kommerziellen Lizenz auf Hugging Face erscheinen. Dies ermöglicht es Forschern und Partnern zu experimentieren, ohne das vollständige, proprietäre Modell preiszugeben, das die umsatzgenerierenden Produkte des Unternehmens antreibt.
