От арендованного интеллекта к фабрике моделей

Годами Thomson Reuters предлагала продукты с поддержкой ИИ, дообучая (fine-tuning) коммерческие модели сторонних лабораторий. Дообучение берет предобученную модель и корректирует её веса на меньшем наборе данных, но это ограничивает широкие способности модели к рассуждению и привязывает компанию к ценообразованию и лимитам API провайдера.

Теперь компания относится к ИИ как к производственной линии. За последние два года она наняла инженеров, специалистов по данным (data scientists) и экспертов по вычислительным мощностям, а также потратила 40 миллионов долларов на облачное время GPU и локальное оборудование (on-prem), чтобы обучить модель на базе серии с открытым исходным кодом Qwen — архитектуры Qwen от Alibaba. Open-source означает, что код и веса находятся в открытом доступе, поэтому Thomson Reuters смогла начать с прочного фундамента без лицензионных отчислений.

В партнерстве с Imperial College была создана промежуточная модель «Snowdon», которую сначала переобучили для обеспечения безопасности, этичности и политической нейтральности — требований, которым должна соответствовать любая LLM перед выходом к клиентам. После Snowdon команда скормила модели проприетарный контент из Westlaw, Practical Law, Checkpoint и новостных архивов Reuters. На данный момент использовано менее 10 % этого контента, что оставляет огромный потенциал для масштабирования по мере поглощения новых данных. Последним шагом стало внедрение агентного обучения с подкреплением (agentic reinforcement learning): модель взаимодействует с собственными инструментальными средами Thomson Reuters, получает обратную связь и обновляет свою стратегию для улучшения выполнения задач. В данном контексте обучение с подкреплением учит модель достигать целей (например, нахождения правильной цитаты) методом проб и ошибок, а не на основе статических примеров.

Как модель показывает себя на практике

В Stanford LegalBench — наборе тестов на юридическое мышление — собственная модель набрала 0,823 балла, уступив Gemini 3.1 Pro, GPT-5.5 и Opus 4.8 в бенчмарке Harvey Legal Agent Benchmark. Она также отстает в общих задачах по программированию и логике, что показывает: её чистая способность к рассуждению всё ещё слабее, чем у передовых лабораторий, вкладывающих миллиарды в массивные LLM общего назначения.

Преимущество проявляется, когда модель обращается к эксклюзивным данным Thomson Reuters. В бенчмарке Deep Research, измеряющем фактическую точность, модель показала результат 0,53 при наличии только доступа к вебу — это ниже, чем 0,65 у GPT-5.4. Добавление внутренних юридических библиотек подняло точность до 0,83, что позволило обойти коммерческого конкурента. Результат подчеркивает знакомую закономерность: модель умеренного размера, если её напитать знаниями в конкретной предметной области, может победить гораздо более крупные системы, лишенные этой привилегированной информации.

Почему «владение» лучше «аренды»

CTO Joel Hron и руководитель исследовательского отдела Jonathan Schwartz выделяют три столпа этих инвестиций:

  1. Стоимость и возможности — выполнение больших объемов задач, таких как проверка документов, через коммерческий API влечет за собой оплату за каждый токен, которая быстро растет. Специализированная, менее крупная модель обрабатывает тот же объем работы за малую долю стоимости, сохраняя при этом высокую производительность в юридической сфере.
  2. Суверенитет данных — самым ценным активом Thomson Reuters является курируемый юридический контент. Передача этих данных стороннему поставщику ИИ создает риски для безопасности и конфиденциальности, а также дает провайдеру конкурентное преимущество. Хранение данных внутри компании гарантирует, что улучшения останутся конфиденциальными.
  3. Накопление интеллектуального капитала — каждый раз, когда юрист проверяет результат работы модели, это взаимодействие может быть записано как обучающие данные, постепенно совершенствуя модель. Со временем компания создает самоподкрепляющийся актив, который становится всё более ценным — подобно владению собственностью вместо оплаты аренды.

Первые сценарии использования и вклад в open-source

Модель внедряется в пакет CoCounsel Legal от Thomson Reuters для задач, требующих высокой пропускной способности и низкой стоимости, таких как функция Tabular Analysis, которая извлекает структурированные данные из контрактов. Она также берет на себя проверку цитат — повторяющийся, но критически важный для точности этап при составлении юридических документов.

Чтобы развивать экосистему разработчиков, облегченная версия появится на Hugging Face под некоммерческой лицензией. Это позволит исследователям и партнерам экспериментировать, не раскрывая полную проприетарную модель, на которой работают приносящие доход продукты компании.