Claude Opus 5 salió al mercado el 24 de julio, y sus cifras principales prometen un salto de tres veces respecto al rival más cercano y el doble de rendimiento que el propio Opus 4.8 de Anthropic. La verdadera pregunta para cualquiera que pague por resultados de IA es si esas proporciones se traducen en ganancias tangibles sin aumentar el precio.
Por qué importan las cifras
A los desarrolladores les importa sobre todo la puntuación de SWE-bench Pro, un benchmark que pone a prueba un modelo con problemas reales de GitHub para ver qué tan bien puede corregir código. Opus 5 alcanzó el 79,2 %, mientras que Opus 4.8 logró el 69,2 %, un aumento de diez puntos en solo dos meses. Anthropic mantuvo sin cambios el precio por token, por lo que los usuarios obtienen un asistente de programación notablemente más inteligente por el mismo coste.
Si las proporciones principales se mantienen en otras pruebas, la relación coste-rendimiento podría redefinir cómo las empresas eligen modelos de lenguaje para cargas de trabajo intensivas en código.
Cómo se posiciona Opus 5 en las pruebas clave
- SWE-bench Pro – 79,2 % frente a 69,2 % (Opus 4.8). Mismo precio por token, mayor tasa de éxito en la corrección de errores del mundo real.
- CursorBench 3.2 – Opus 5 se sitúa a menos de un 0,5 % del líder Fable 5 en velocidad de finalización de tareas, pero cuesta aproximadamente la mitad por tarea.
- ARC-AGI-3 – Opus 5 obtiene una puntuación de 30,2, mientras que el segundo clasificado se queda atrás con 7,8. La brecha es enorme, lo que sugiere que Opus 5 maneja problemas de razonamiento abstracto mucho mejor que la mayoría de sus contemporáneos.
- Razonamiento General – El terreno es más reñido. GPT-5.6 Sol lidera con un promedio de 92,5, superando ligeramente el 90,4 de Opus 5. Aquí, Opus 5 es competitivo pero no dominante.
Estas cifras ofrecen un panorama matizado: Opus 5 destaca en pruebas relacionadas con el código y en ciertos benchmarks de razonamiento, pero aún queda por detrás del modelo líder en razonamiento general.
Leyendo entre líneas
Las cifras de los benchmarks pueden ser engañosas si las condiciones de la prueba no son claras. Cuatro puntos ayudan a distinguir la realidad de la exageración:
- Nivel de esfuerzo – ¿Se ejecutó el modelo con un esfuerzo bajo, predeterminado o máximo? Un mayor esfuerzo puede aumentar las puntuaciones, pero también incrementa la latencia y el coste.
- Número de intentos – Una única ejecución puede capturar valores atípicos por suerte. Los ensayos repetidos (cinco o más) ofrecen una imagen más estable.
- Fuente – Los benchmarks proporcionados por el proveedor son útiles como base, pero deben ser corroborados por laboratorios independientes.
- Base de comparación – ¿El «siguiente modelo» sigue siendo el líder actual, o ha entrado un competidor más nuevo en el campo desde que se realizó la prueba?
Lo que está en juego para usuarios y competidores
Las empresas que ejecutan procesos de revisión de código a gran escala pueden reducir horas en los ciclos de depuración y bajar las facturas de computación en la nube con un aumento de diez puntos en SWE-bench Pro manteniendo el mismo precio por token. Los equipos más pequeños obtienen un asistente más capaz sin necesidad de aumentar sus presupuestos.
Las ajustadas puntuaciones en Razonamiento General recuerdan a los desarrolladores que Opus 5 no es un reemplazo total para el mejor modelo polivalente actual.
Qué observar a continuación
- Publicación de benchmarks independientes – Laboratorios externos pronto probarán Opus 5 con la misma suite a distintos niveles de esfuerzo. Sus hallazgos confirmarán o cuestionarán las afirmaciones de Anthropic.
Conclusión
Claude Opus 5 ofrece un claro impulso en el rendimiento de programación al mismo precio por token, lo que lo convierte en una actualización atractiva para los desarrolladores centrados en tareas de software. Sigue un paso por detrás del líder absoluto en razonamiento general, y sus ventajas publicitadas aún requieren verificación independiente. Para cualquiera que esté presupuestando servicios de IA, la eficiencia de costes del modelo en tareas de código es la razón más concreta para considerarlo seriamente.
