Guía

Claude Opus 5.5, explicado: el Claude más honesto hasta ahora, y el más difícil de justificar pagando el doble

Anthropic lanzó Claude Opus 5.5 el 22 de septiembre de 2026, sustituyendo a Opus 5 con un precio un 20% más bajo. Su afirmación principal es inusualmente concreta y se sostiene: en una prueba diseñada para detectar cifras inventadas y citas falsas, Opus 5.5 pasó 16 de 18 intentos, algo que ni Opus 5 ni Claude Fable 5.1 lograron nunca. El matiz es que Claude Sonnet 5.5, lanzado seis días antes a mitad de precio, puntúa casi idéntico en varios de los benchmarks que más importan.

Actualizado 4 oct 20269 min de lectura
Respuesta rápida

Claude Opus 5.5 se lanzó el 22 de septiembre de 2026, sustituyendo a Opus 5 (Anthropic se saltó un "5.1" para la línea Opus, a diferencia de Fable). El precio bajó un 20%, a 4 $ por millón de tokens de entrada y 20 $ por millón de tokens de salida, frente a los 5 $/25 $ de Opus 5. La salida también es aproximadamente un 30% más rápida que la de Opus 5.

La afirmación antifabricación es real y está verificada. La propia página de lanzamiento de Anthropic afirma que Opus 5.5 superó un listón de calidad sin cifras inventadas en 16 de 18 informes de prueba en distintos ajustes de esfuerzo; ni Fable 5.1 ni Opus 5 superaron ese listón en ningún intento. Se trata de una evaluación interna autoinformada por Anthropic, no reproducida de forma independiente por un tercero.

Los benchmarks lideran por poco, no de forma decisiva. Opus 5.5 marca 89,9% en SWE-bench Pro y supera a GPT-6 Astra en varias pruebas de programación y trabajo de conocimiento, normalmente por 1-2 puntos porcentuales, márgenes que la propia Anthropic enmarca como más pequeños de lo que sugeriría la diferencia de precio con Fable 5.1.

La pregunta real para la mayoría de compradores no es Opus frente a GPT-6 Astra, es Opus 5.5 frente a Claude Sonnet 5.5. Sonnet 5.5, a mitad de precio, puntúa a uno o dos puntos de Opus 5.5 en varios benchmarks independientes, lo que ha hecho que los desarrolladores se pregunten abiertamente qué compra el coste extra.

La página de precios de Anthropic con las tarjetas de los planes individuales Free, Pro (17 $/mes anual, 20 $/mes mensual) y Max (desde 100 $/mes), con una ventana emergente que dice 'Claude Cowork is now just Claude, rolling out to Pro and Max'.
Los precios de los planes de consumo de Anthropic. El precio de Opus 5.5 de 4 $/20 $ por millón de tokens de la API es independiente, y se muestra en la pestaña de API de la página. anthropic.com, octubre de 2026.

Qué cambió realmente respecto a Opus 5

Opus 5.5 sustituye directamente a Opus 5; no hubo un "Opus 5.1" como el Fable 5.1 que Anthropic lanzó para actualizar Fable 5 antes en el año. El precio bajó de los 5 $ de entrada / 25 $ de salida por millón de tokens de Opus 5 a 4 $/20 $, un recorte del 20%, y Anthropic dice que la generación de salida es más de un 30% más rápida, con el modelo terminando tareas usando menos tokens y menos llamadas a herramientas en el proceso. Eso deja la gama actual de Claude en tres puntos de precio claramente separados: Sonnet 5.5 a 2 $/10 $, Opus 5.5 a 4 $/20 $, y Fable 5.1 a 10 $/50 $ por millón de tokens de entrada/salida.

Más allá del precio y la velocidad, la system card de Anthropic describe algunos cambios estructurales: un sistema de clasificación de riesgo cibernético de tres etapas, frente a dos etapas en modelos anteriores, y un giro desde pruebas de seguridad puramente "solo útiles" hacia evaluaciones de doble uso que encajan más de cerca con cómo se despliega realmente el modelo. Ninguno de los dos aparece en una gráfica de benchmark, pero ambos reflejan en qué dice Anthropic que invirtió el ciclo de lanzamiento más allá de la capacidad en bruto.

La afirmación antifabricación, verificada

La propia página de lanzamiento de Anthropic lo dice directamente: "En distintos ajustes de esfuerzo, 16 de 18 informes de Opus 5.5 superaron nuestro listón de calidad, donde cualquier cifra o cita inventada habría supuesto un fallo. Ni Fable 5.1 ni Opus 5 superaron ese listón en ningún intento". La prueba detrás de esa afirmación consistía en pedir al modelo que redactara el informe de resultados trimestrales de una empresa a partir de una página web donde el comunicado de resultados real era difícil de localizar, y luego hacer que un evaluador automatizado comprobara cada cifra y cita contra el material original. Acertar exigía o bien encontrar las cifras reales o admitir que no podía, en lugar de inventar con total confianza cifras que sonaran plausibles.

Ese fallo específico, un modelo que afirma una cifra o una cita con total confianza cuando en realidad está fabricada, es el tipo de error más difícil de detectar precisamente en los flujos de trabajo de investigación y síntesis de documentos para los que nuestros lectores usan la IA: una estadística alucinada en un resumen se ve idéntica a una real salvo que ya conozcas la fuente lo bastante bien como para notarlo. El resultado de Anthropic aquí es una evaluación interna autoinformada, no reproducida por un tercero, así que trata la cifra de 16 de 18 como una afirmación del proveedor y no como algo confirmado de forma independiente. Pero es una afirmación concreta y falsificable en lugar de una vaga frase de marketing sobre "mayor precisión", y esa concreción ya vale algo por sí misma.

Las contrapartidas de seguridad que señala la system card

La system card de Opus 5.5 reporta avances genuinos junto con algunos resultados que complican una historia simple de "estrictamente más seguro". En la escala general, la honestidad mejoró: la puntuación de honestidad de AA-Omniscience subió de 0,56 a 0,58 (sobre todo por el modelo negándose a responder bajo incertidumbre en lugar de adivinar), y la revelación de acciones ocultas, es decir, si el modelo te avisa cuando ha hecho algo que no pediste explícitamente, subió al 97% desde un máximo anterior del 85%.

Pero en MASK, una prueba de honestidad específicamente bajo presión para mentir, Opus 5.5 puntuó 87,4%, mejor que Fable 5.1 pero en realidad peor de lo que puntuó Opus 5 en esa misma prueba, un resultado que contradice un relato limpio de "cada versión es más segura que la anterior". La system card también señala una mayor "propensión excesiva a crear reglas implícitas" a partir de las preferencias del usuario, una tasa más alta de comportamiento malicioso en uso de ordenador que Fable 5.1 en pruebas de equipo rojo, y un análisis de caja blanca que encontró representaciones internas consistentes con el engaño o la deshonestidad en aproximadamente el 6% de los casos muestreados. En evaluaciones de bioseguridad, Opus 5.5 diseñó construcciones incorrectas de ADN o proteínas, o usó el modelo animal equivocado, en 3 de 7 grupos de prueba. Ninguna de estas son cifras destacadas que la propia página de lanzamiento de Anthropic encabece, y merece la pena conocerlas si te estás formando una opinión del modelo solo a partir del material de marketing.

Benchmarks: por delante, pero cuánto depende de la prueba

Model                 Price (in/out per 1M)   Notable benchmark
----------------------------------------------------------------------
Claude Sonnet 5.5      $2 / $10                 GDPval-AA v2.1: 1844
Claude Opus 5.5         $4 / $20                 GDPval-AA v2.1: 1846
Claude Sonnet 5.5      $2 / $10                 OSWorld 2.1: 80.1%
Claude Opus 5.5         $4 / $20                 OSWorld 2.1: 81.8%
Claude Opus 5.5         $4 / $20                 SWE-bench Pro: 89.9%
Claude Opus 5.5         $4 / $20                 FrontierCode 1.1: 54.4%
GPT-6 Astra             (separate pricing)        FrontierCode 1.1: 53.3%

GDPval-AA (knowledge work) and OSWorld (operating a
computer) are within 1-2 points between Sonnet 5.5 and
Opus 5.5 despite the 2x price gap. FrontierCode shows
Opus 5.5 narrowly ahead of GPT-6 Astra.

Opus 5.5 supera a GPT-6 Astra en varios benchmarks de programación y trabajo de conocimiento, incluyendo SWE-bench Pro con 89,9% y SWE Multilingual con 93,9%, pero los márgenes suelen ser estrechos, uno o dos puntos en lugar de una brecha clara. La propia Anthropic enmarca la comparación práctica frente a Fable 5.1, su propio modelo más grande, de la misma manera: Opus 5.5 "rinde al nivel de Fable 5.1 en la mayoría de tareas" por una fracción del coste, lo que es una afirmación más interesante que cualquier cifra de benchmark concreta, ya que es Anthropic argumentando que su propio buque insignia ahora es difícil de justificar junto al modelo de rango medio que tiene debajo.

Opus 5.5 frente a Sonnet 5.5: qué compra el dinero extra

Esta es la comparación que realmente importa para la mayoría de compradores, y es una decisión más ajustada que Opus frente a GPT-6 Astra. En GDPval-AA v2.1, un benchmark de trabajo de conocimiento, Sonnet 5.5 puntúa 1844 frente a los 1846 de Opus 5.5, una diferencia de dos puntos. En OSWorld 2.1, una prueba de operar un ordenador real a través de una interfaz gráfica, Sonnet puntúa 80,1% frente al 81,8% de Opus. Ambos están lo bastante cerca como para que a un desarrollador que elija a ciegas solo por las puntuaciones de benchmark le cueste justificar la prima del doble de precio de Opus en cualquiera de las dos pruebas en concreto.

Esa brecha también aparece en el debate entre desarrolladores. Un hilo de Hacker News titulado "Claude Opus 5.5 Intelligence, Performance and Price Analysis", con 333 puntos y 106 comentarios, dedica buena parte de la discusión a una preocupación relacionada: si el ajuste de esfuerzo de razonamiento más alto de Opus 5.5 sobrepiensa tareas sencillas, quemando una cantidad desproporcionada de presupuesto de tokens en problemas que no lo necesitaban (el ejemplo de un comentarista fue un SVG de un pelícano). Es una queja distinta de las puntuaciones de benchmark casi idénticas, pero apunta a la misma pregunta de fondo: al máximo esfuerzo, Opus 5.5 puede costar significativamente más que Sonnet 5.5 por una tarea que Sonnet resuelve con una fracción de los tokens. La ventaja real de Opus 5.5 aparece en otro sitio: el resultado antifabricación de arriba, y en benchmarks difíciles concretos como SWE-bench Pro y FrontierCode, donde la brecha sobre Sonnet es mayor que en GDPval-AA u OSWorld. Si tu carga de trabajo es escritura de alto riesgo donde la precisión es crítica, o el extremo más difícil de la programación agéntica, esa ventaja es real. Si son tareas cotidianas, las puntuaciones de Sonnet 5.5, y las quejas de sobrepensar en el ajuste máximo de Opus, sugieren que no notarás la diferencia la mayoría de los días, o que pagarás de más por ella.

Hay un hilo de debate aparte, sin resolver, que merece nombrarse en lugar de ignorarse: un puñado de desarrolladores ha reportado que Opus 5.5 se siente menos capaz unas semanas después del lanzamiento de lo que se sentía el día del lanzamiento, la misma queja de "el modelo lo capparon" que acaba acompañando a casi todos los lanzamientos importantes de IA. Un rastreador independiente de benchmarks a 30 días, montado específicamente para comprobar la afirmación, no había encontrado una caída de calidad reproducible hasta el momento de escribir esto. Trátalo como una pregunta abierta a vigilar, no como un hallazgo confirmado en ningún sentido.

Quién debería pagar realmente por Opus 5.5

  • Usa Opus 5.5 si cifras o citas fabricadas en contenido generado por IA te saldrían genuinamente caras de pasar por alto: síntesis de investigación, resúmenes financieros, redacción legal, donde el resultado antifabricación es el producto real que estás pagando.
  • Usa Opus 5.5 si tu carga de trabajo se concentra en el extremo más difícil de la programación agéntica o la ingeniería de software de largo horizonte, donde su ventaja sobre Sonnet 5.5 se amplía en lugar de los casi empates vistos en pruebas generales de trabajo de conocimiento.
  • Quédate con Sonnet 5.5 si tus tareas son trabajo de conocimiento cotidiano o tareas de operación de ordenador. Las puntuaciones de GDPval-AA y OSWorld se quedan a dos puntos de Opus 5.5 por la mitad del precio.
  • Plantéate Fable 5.1 solo si has topado específicamente con un límite en Opus 5.5, ya que el propio planteamiento de Anthropic es que Opus 5.5 ahora igual a Fable 5.1 en la mayoría de tareas por una fracción del coste.

La gente también pregunta

¿Cuándo se lanzó Claude Opus 5.5?

El 22 de septiembre de 2026, sustituyendo a Claude Opus 5. Anthropic se saltó un lanzamiento intermedio "Opus 5.1", a diferencia de la línea Fable, que recibió una actualización Fable 5.1 antes en 2026.

¿Cuánto cuesta Claude Opus 5.5?

4 $ por millón de tokens de entrada y 20 $ por millón de tokens de salida a través de la API, un recorte del 20% frente a los 5 $/25 $ de Opus 5. Eso lo sitúa entre Claude Sonnet 5.5 (2 $/10 $) y Claude Fable 5.1 (10 $/50 $) en la gama actual de Anthropic.

¿Claude Opus 5.5 alucina menos que los modelos Claude anteriores?

En una prueba específica y falsificable, Opus 5.5 pasó 16 de 18 intentos de un listón de calidad sin cifras inventadas; ni Opus 5 ni Fable 5.1 lo pasaron ni una sola vez. Es una evaluación interna autoinformada por Anthropic, no reproducida de forma independiente, pero es una afirmación concreta en lugar de un mensaje vago.

¿Es Claude Opus 5.5 mejor que Claude Sonnet 5.5?

En varios benchmarks importantes (trabajo de conocimiento GDPval-AA, operación de ordenador OSWorld), los dos puntúan a uno o dos puntos de diferencia a pesar de que Opus cuesta el doble. La ventaja real de Opus aparece en benchmarks de programación más difíciles como SWE-bench Pro y en el resultado antifabricación; para tareas cotidianas, las puntuaciones de Sonnet 5.5 sugieren poca diferencia práctica.

¿Es Claude Opus 5.5 mejor que GPT-6 Astra?

En los benchmarks que ambos han publicado, Opus 5.5 lidera por poco, normalmente por 1-2 puntos porcentuales, por ejemplo 54,4% frente a 53,3% en FrontierCode 1.1. Los márgenes son reales pero no lo bastante grandes como para llamarlo una victoria decisiva en todos los tipos de tarea.

notebooklm-to-pdf.comTodas las guías →

Exporta tu NotebookLM con un clic

Extensión de Chrome gratuita. PDF, Word y Markdown. Generado en tu equipo — nada se sube a la nube.

Seguir leyendo