De la inteligencia alquilada a una fábrica de modelos
Durante años, Thomson Reuters ofreció productos mejorados con IA mediante el ajuste fino (fine-tuning) de modelos comerciales de laboratorios externos. El fine-tuning toma un modelo preentrenado y ajusta sus pesos con un conjunto de datos más pequeño, pero reduce la capacidad de razonamiento general del modelo y vincula a la empresa a los precios y límites de la API del proveedor.
Ahora la empresa trata la IA como una línea de producción. En los últimos dos años, contrató ingenieros, científicos de datos y especialistas en computación, y gastó 40 millones de dólares en tiempo de GPU en la nube y hardware local para entrenar un modelo a partir de la serie de código abierto Qwen, la arquitectura Qwen de Alibaba. El código abierto significa que el código y los pesos son públicos, por lo que Thomson Reuters pudo partir de una base sólida sin pagar tarifas de licencia.
Una colaboración con el Imperial College produjo un modelo intermedio llamado “Snowdon”, que primero fue reentrenado para garantizar la seguridad, la ética y la neutralidad política, requisitos que cualquier LLM debe cumplir antes de llegar a los clientes. Tras Snowdon, el equipo alimentó el modelo con contenido propietario de Westlaw, Practical Law, Checkpoint y los archivos de noticias de Reuters. Hasta ahora se ha utilizado menos del 10 % de ese contenido, lo que deja mucho margen para escalar a medida que se ingieran más datos. El paso final añadió el aprendizaje por refuerzo agéntico (agentic reinforcement learning): el modelo interactúa con los propios entornos de herramientas de Thomson Reuters, recibe comentarios y actualiza su política para mejorar el rendimiento de las tareas. En este contexto, el aprendizaje por refuerzo enseña al modelo a alcanzar objetivos (como encontrar la cita correcta) mediante el ensayo y error, en lugar de utilizar ejemplos estáticos.
Cómo se posiciona el modelo
En Stanford LegalBench —una suite de pruebas de razonamiento legal— el modelo interno obtuvo una puntuación de 0,823, situándose por detrás de Gemini 3.1 Pro, GPT-5.5 y Opus 4.8 en el Harvey Legal Agent Benchmark. También se queda atrás en problemas genéricos de programación y razonamiento, lo que demuestra que su capacidad de razonamiento puro sigue siendo inferior a la de los laboratorios de vanguardia que invierten miles de millones en LLM masivos de propósito general.
La ventaja aparece cuando el modelo recurre a los datos exclusivos de Thomson Reuters. En un benchmark de Deep Research que mide la precisión fáctica, el modelo alcanzó un 0,53 con solo acceso a la web, una cifra inferior al 0,65 de GPT-5.4. Al añadir sus bibliotecas legales internas, la precisión subió al 0,83, superando al competidor comercial. El resultado subraya un patrón familiar: un modelo de tamaño modesto, cuando se le alimenta con conocimientos específicos del dominio, puede vencer a sistemas mucho más grandes que carecen de esa información privilegiada.
Por qué “poseer” es mejor que “alquilar”
El CTO Joel Hron y el jefe de investigación Jonathan Schwartz señalan tres pilares para la inversión:
- Coste y capacidad – Ejecutar tareas de gran volumen, como la revisión de documentos, en una API comercial conlleva tarifas por token que aumentan rápidamente. Un modelo dedicado y más pequeño procesa la misma carga de trabajo a una fracción del precio, manteniendo al mismo tiempo el rendimiento específico para el ámbito legal.
- Soberanía de datos – El activo más valioso de Thomson Reuters es su contenido legal curado. Entregar esos datos a un proveedor de IA externo crea riesgos de seguridad y confidencialidad, y otorga al proveedor una ventaja competitiva. Mantener los datos en casa garantiza que las mejoras permanezcan privadas.
- Capital intelectual compuesto – Cada vez que un abogado revisa el resultado de un modelo, esa interacción puede registrarse como datos de entrenamiento, refinando el modelo gradualmente. Con el tiempo, la empresa construye un activo que se refuerza a sí mismo y que se vuelve cada vez más valioso, como poseer una propiedad en lugar de pagar un alquiler.
Primeros casos de uso y un guiño al código abierto
El modelo se está implementando en la suite CoCounsel Legal de Thomson Reuters para tareas que exigen un alto rendimiento y bajo coste, como la función Tabular Analysis, que extrae datos estructurados de contratos. También se encarga de la verificación de citas, un paso repetitivo pero crítico para la precisión en la redacción legal.
Para fomentar un ecosistema de desarrolladores, aparecerá una versión reducida en Hugging Face bajo una licencia no comercial. Esto permite que investigadores y socios experimenten sin exponer el modelo completo y propietario que impulsa los productos generadores de ingresos de la empresa.
