Antrópico hoy lanzado Claude Opus 4.8una actualización de su modelo insignia que se envía al mismo precio que su predecesor, junto con un nivel de «modo rápido» dramáticamente más económico y una nueva característica que permite al modelo generar cientos de subagentes paralelos para trabajos a escala de código base.
El modelo está disponible de inmediato en las superficies de Anthropic (claude.ai, Claude Code, API y Cowork) a un precio sin cambios: 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. Los desarrolladores pueden llamarlo como claude-opus-4-8.
El tema principal de la eficiencia es el modo rápido. Anthropic ha reducido el precio de ejecutar Opus 4.8 en modo rápido, donde el modelo produce tokens a aproximadamente 2,5 veces la velocidad normal, a $10 por millón de tokens de entrada y $50 por millón de tokens de salida, en comparación con $30/$150 para Opus 4.7.
Esto supone una reducción tres veces mayor que el precio del modo rápido de los modelos anteriores y pone la inferencia de alto rendimiento al alcance de cargas de trabajo de producción sensibles a la latencia.
El modo rápido está disponible inmediatamente en Claude Code a través del /fast dominio; El acceso a la API está cerrado, con una lista de espera en claude.com/fast-mode.
En el modo normal, Claude Opus 4.8 sigue estando entre los modelos fronterizos líderes más caros, pero aún está por debajo del GPT-5.5 de su principal rival OpenAI.
Resumen de precios de la API del modelo de IA de Frontier
|
Modelo |
Aporte |
Producción |
Costo total |
Fuente |
|
Flash MiMo-V2.5 |
$0.10 |
$0.30 |
$0.40 |
|
|
Minimax M2.7 |
$0.30 |
$1.20 |
$1.50 |
|
|
Géminis 3.1 Flash-Lite |
$0.25 |
$1.50 |
$1.75 |
|
|
MiMo V2.5 |
$0.40 |
$2.00 |
$2.40 |
|
|
Kimi-K2.6 |
$0.95 |
$4.00 |
$4.95 |
|
|
GLM-5 |
$1.00 |
$3.20 |
$4.20 |
|
|
Grok 4.3 (bajo contexto) |
$1.25 |
$2.50 |
$3.75 |
|
|
DeepSeek V4 Pro |
$1.74 |
$3.48 |
$5.22 |
|
|
GLM-5.1 |
$1.40 |
$4.40 |
$5.80 |
|
|
Claude Haiku 4.5 |
$1.00 |
$5.00 |
$6.00 |
|
|
Grok 4.3 (contexto alto) |
$2.50 |
$5.00 |
$7.50 |
|
|
Qwen3.7-Max |
$2.50 |
$7.50 |
$10.00 |
|
|
Géminis 3.5 Flash |
$1.50 |
$9.00 |
$10.50 |
|
|
Vista previa de Géminis 3.1 Pro (≤200K) |
$2.00 |
$12.00 |
$14.00 |
|
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
|
|
Vista previa de Géminis 3.1 Pro (>200K) |
$4.00 |
$18.00 |
$22.00 |
|
|
Cerrar Trabajo 4.7 |
$5.00 |
$25.00 |
$30.00 |
|
|
Cerrar Trabajo 4.8 |
$5.00 |
$25.00 |
$30.00 |
|
|
GPT-5.5 |
$5.00 |
$30.00 |
$35.00 |
Ganancias modestas respecto a 4.7, pero próximas capacidades de clase Mythos
En cuanto a los puntos de referencia, Opus 4.8 es un paso adelante más que un salto. Obtiene una puntuación del 88,6 % en SWE-bench Verified (frente al 87,6 % de Opus 4.7), del 69,2 % en el SWE-bench Pro más duro (frente al 64,3 %) y del 74,6 % en Terminal-Bench 2.1 (frente al 66,1 %). La propia Anthropic caracteriza el modelo como «una mejora modesta pero tangible con respecto a su predecesor».
Supera al GPT-5.5 normal en al menos 12 puntos de referencia, incluida la mayor parte del trabajo de conocimiento, la codificación (a nivel de problema), el uso de herramientas de agente y los puntos de referencia de contexto largo. GPT-5.5 gana en flujos de trabajo de terminal/CLI y está más o menos empatado en navegación web y ciencias de posgrado.
La señal más importante se encuentra en la escala de capacidades internas de Anthropic: Opus 4.8 aterriza entre Opus 4.7 y el Claude Mythos Preview, más capaz, que actualmente está restringido a un pequeño número de organizaciones bajo el Proyecto Glasswing para trabajos de ciberseguridad.
Anthropic dice que espera llevar «modelos de clase Mythos a todos nuestros clientes en las próximas semanas» una vez que se implementen medidas de seguridad cibernéticas adicionales.
Varios socios empresariales mencionaron ganancias materiales. Databricks informó que Opus 4.8 desbloquea «un cambio radical en el razonamiento agente» dentro de su agente de datos Genie, a «un costo simbólico 61 % más económico que Opus 4.7» gracias a la eficiencia multimodal en archivos PDF y diagramas.
Hebbia citó una mejor precisión de las citas y una mayor eficiencia simbólica en presentaciones financieras densas. Cognition, fabricante de Devin, dijo que el lanzamiento «se traduce directamente en ganancias de capacidad más rápidas para los ingenieros» y señaló que Opus 4.8 solucionó problemas de verbosidad de comentarios y llamadas de herramientas de 4.7. Un proveedor de uso de computadoras reportó un 84% en Online-Mind2Web, un salto sobre Opus 4.7 y GPT-5.5.
Flujos de trabajo dinámicos: cientos de subagentes paralelos
Junto con el modelo, Anthropic lanzó una vista previa de investigación de flujos de trabajo dinámicos en Claude Code, una característica diseñada para tareas demasiado grandes para una única ventana de contexto. Claude planifica el trabajo, genera cientos de subagentes paralelos y luego verifica sus propios resultados antes de informar. El ejemplo de Anthropic: una migración a escala de código base «a través de cientos de miles de líneas de código desde el inicio hasta la fusión, con el conjunto de pruebas existente como barra».
Los flujos de trabajo dinámicos están disponibles en los planes Enterprise, Team y Max de Claude Code.
Dos adiciones más pequeñas completan el lanzamiento:
-
Control de esfuerzo en claude.ai y Claude Cowork: Un nuevo selector permite a los usuarios marcar cuánto piensa Claude por respuesta: un mayor esfuerzo gasta más tokens para obtener mejores respuestas, un menor esfuerzo responde más rápido y quema los límites de velocidad más lentamente. Disponible en todos los planes.
-
Entradas del sistema dentro de la matriz de mensajes en la API: Los desarrolladores ahora pueden actualizar las instrucciones de Claude a mitad de la tarea (ajustando permisos, presupuestos de tokens o contexto del entorno mientras se ejecuta un agente) sin romper el caché de mensajes.
Honestidad y una advertencia sobre la «conciencia de la evaluación»
Anthropic lidera con la honestidad como rasgo principal. El equipo de alineación de la compañía informa que Opus 4.8 tiene «aproximadamente cuatro veces menos probabilidades que su predecesor de permitir que las fallas en el código que ha escrito pasen desapercibidas», y que las tasas de comportamiento desalineado son ahora «sustancialmente más bajas que Opus 4.7, y similares a nuestro modelo mejor alineado, Claude Mythos Preview».
De hecho, un gráfico de barras publicado por Anthropic muestra qué tan cerca está Opus 4.8 del Mythos aún lanzado selectivamente en términos de su desalineación (una puntuación más baja es mejor), llegando a aproximadamente 1,9, por debajo del 2,5 de Opus 4.7 y efectivamente empatado con el Mythos Preview más capaz y restringido. La puntuación se basa en aproximadamente 2.600 sesiones de investigación simuladas por modelo.
El Tarjeta del sistema de 244 páginas publicado públicamente por Anthropic también entra en mayores detalles sobre categorías específicas de desalineación: si un modelo produce contenido potencialmente dañino en torno a «armas de grado militar», «contenido sexual dañino», «delito cibernético no permitido» y «socavar la democracia liberal», y nuevamente, en todos ellos, Opus 4.8 obtiene una puntuación notablemente mejor que 4.7 o Sonnet 4.6, y se acerca bastante a Mythos.
Anthropic señala un hallazgo que considera «el más preocupante» del entrenamiento: Opus 4.8 muestra una tendencia creciente a razonar explícitamente sobre cómo se calificarán sus resultados, incluso en entornos donde no se le dijo que estaba siendo evaluado. En otras palabras: el modelo sabe que es probable que lo estén calificando y produce una respuesta que cree que le permitirá obtener una buena calificación en la prueba, no una que necesariamente produciría si pensara que no lo están calificando.
Anthropic dice que esto no se tradujo en un peor comportamiento observable (Opus 4.8 muestra menos afirmaciones engañosas de éxito de tareas que los modelos anteriores), pero lo llama «una tendencia preocupante que podría complicar el entrenamiento en el futuro». El trabajo preliminar de interpretabilidad también encontró razonamiento no verbalizado relacionado con el alumno en aproximadamente el 5% de los episodios de capacitación.
Anthropic ejecutó el modelo a través de una recompensa de errores en vivo de una semana para una inyección rápida (una novedad) y concluyó que Opus 4.8 se ubica entre Opus 4.7 y Sonnet 4.6 en cuanto a robustez, por delante de «todos los modelos fronterizos comparables» probados, con salvaguardas implementadas que llevan las tasas de éxito de los ataques de uso del navegador a casi cero.
¿Qué sigue?
Anthropic provocó dos trayectorias. A corto plazo: modelos más baratos que proporcionen «muchas de las mismas capacidades que Opus». A más largo plazo: los modelos de clase Mythos, que según la compañía representan una inteligencia más alta que Opus pero requieren salvaguardias cibernéticas más fuertes antes de su lanzamiento general.
Por ahora, Opus 4.8 está posicionado como el nuevo caballo de batalla empresarial y de desarrollo: un poco más inteligente que 4.7, dramáticamente más barato de ejecutar rápidamente y notablemente más honesto acerca de lo que no sabe.
Antrópico hoy lanzado Claude Opus 4.8una actualización de su modelo insignia que se envía al mismo precio que su predecesor, junto con un nivel de «modo rápido» dramáticamente más económico y una nueva característica que permite al modelo generar cientos de subagentes paralelos para trabajos a escala de código base.
El modelo está disponible de inmediato en las superficies de Anthropic (claude.ai, Claude Code, API y Cowork) a un precio sin cambios: 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. Los desarrolladores pueden llamarlo como claude-opus-4-8.
El tema principal de la eficiencia es el modo rápido. Anthropic ha reducido el precio de ejecutar Opus 4.8 en modo rápido, donde el modelo produce tokens a aproximadamente 2,5 veces la velocidad normal, a $10 por millón de tokens de entrada y $50 por millón de tokens de salida, en comparación con $30/$150 para Opus 4.7.
Esto supone una reducción tres veces mayor que el precio del modo rápido de los modelos anteriores y pone la inferencia de alto rendimiento al alcance de cargas de trabajo de producción sensibles a la latencia.
El modo rápido está disponible inmediatamente en Claude Code a través del /fast dominio; El acceso a la API está cerrado, con una lista de espera en claude.com/fast-mode.
En el modo normal, Claude Opus 4.8 sigue estando entre los modelos fronterizos líderes más caros, pero aún está por debajo del GPT-5.5 de su principal rival OpenAI.
Resumen de precios de la API del modelo de IA de Frontier
|
Modelo |
Aporte |
Producción |
Costo total |
Fuente |
|
Flash MiMo-V2.5 |
$0.10 |
$0.30 |
$0.40 |
|
|
Minimax M2.7 |
$0.30 |
$1.20 |
$1.50 |
|
|
Géminis 3.1 Flash-Lite |
$0.25 |
$1.50 |
$1.75 |
|
|
MiMo V2.5 |
$0.40 |
$2.00 |
$2.40 |
|
|
Kimi-K2.6 |
$0.95 |
$4.00 |
$4.95 |
|
|
GLM-5 |
$1.00 |
$3.20 |
$4.20 |
|
|
Grok 4.3 (bajo contexto) |
$1.25 |
$2.50 |
$3.75 |
|
|
DeepSeek V4 Pro |
$1.74 |
$3.48 |
$5.22 |
|
|
GLM-5.1 |
$1.40 |
$4.40 |
$5.80 |
|
|
Claude Haiku 4.5 |
$1.00 |
$5.00 |
$6.00 |
|
|
Grok 4.3 (contexto alto) |
$2.50 |
$5.00 |
$7.50 |
|
|
Qwen3.7-Max |
$2.50 |
$7.50 |
$10.00 |
|
|
Géminis 3.5 Flash |
$1.50 |
$9.00 |
$10.50 |
|
|
Vista previa de Géminis 3.1 Pro (≤200K) |
$2.00 |
$12.00 |
$14.00 |
|
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
|
|
Vista previa de Géminis 3.1 Pro (>200K) |
$4.00 |
$18.00 |
$22.00 |
|
|
Cerrar Trabajo 4.7 |
$5.00 |
$25.00 |
$30.00 |
|
|
Cerrar Trabajo 4.8 |
$5.00 |
$25.00 |
$30.00 |
|
|
GPT-5.5 |
$5.00 |
$30.00 |
$35.00 |
Ganancias modestas respecto a 4.7, pero próximas capacidades de clase Mythos
En cuanto a los puntos de referencia, Opus 4.8 es un paso adelante más que un salto. Obtiene una puntuación del 88,6 % en SWE-bench Verified (frente al 87,6 % de Opus 4.7), del 69,2 % en el SWE-bench Pro más duro (frente al 64,3 %) y del 74,6 % en Terminal-Bench 2.1 (frente al 66,1 %). La propia Anthropic caracteriza el modelo como «una mejora modesta pero tangible con respecto a su predecesor».
Supera al GPT-5.5 normal en al menos 12 puntos de referencia, incluida la mayor parte del trabajo de conocimiento, la codificación (a nivel de problema), el uso de herramientas de agente y los puntos de referencia de contexto largo. GPT-5.5 gana en flujos de trabajo de terminal/CLI y está más o menos empatado en navegación web y ciencias de posgrado.
La señal más importante se encuentra en la escala de capacidades internas de Anthropic: Opus 4.8 aterriza entre Opus 4.7 y el Claude Mythos Preview, más capaz, que actualmente está restringido a un pequeño número de organizaciones bajo el Proyecto Glasswing para trabajos de ciberseguridad.
Anthropic dice que espera llevar «modelos de clase Mythos a todos nuestros clientes en las próximas semanas» una vez que se implementen medidas de seguridad cibernéticas adicionales.
Varios socios empresariales mencionaron ganancias materiales. Databricks informó que Opus 4.8 desbloquea «un cambio radical en el razonamiento agente» dentro de su agente de datos Genie, a «un costo simbólico 61 % más económico que Opus 4.7» gracias a la eficiencia multimodal en archivos PDF y diagramas.
Hebbia citó una mejor precisión de las citas y una mayor eficiencia simbólica en presentaciones financieras densas. Cognition, fabricante de Devin, dijo que el lanzamiento «se traduce directamente en ganancias de capacidad más rápidas para los ingenieros» y señaló que Opus 4.8 solucionó problemas de verbosidad de comentarios y llamadas de herramientas de 4.7. Un proveedor de uso de computadoras reportó un 84% en Online-Mind2Web, un salto sobre Opus 4.7 y GPT-5.5.
Flujos de trabajo dinámicos: cientos de subagentes paralelos
Junto con el modelo, Anthropic lanzó una vista previa de investigación de flujos de trabajo dinámicos en Claude Code, una característica diseñada para tareas demasiado grandes para una única ventana de contexto. Claude planifica el trabajo, genera cientos de subagentes paralelos y luego verifica sus propios resultados antes de informar. El ejemplo de Anthropic: una migración a escala de código base «a través de cientos de miles de líneas de código desde el inicio hasta la fusión, con el conjunto de pruebas existente como barra».
Los flujos de trabajo dinámicos están disponibles en los planes Enterprise, Team y Max de Claude Code.
Dos adiciones más pequeñas completan el lanzamiento:
-
Control de esfuerzo en claude.ai y Claude Cowork: Un nuevo selector permite a los usuarios marcar cuánto piensa Claude por respuesta: un mayor esfuerzo gasta más tokens para obtener mejores respuestas, un menor esfuerzo responde más rápido y quema los límites de velocidad más lentamente. Disponible en todos los planes.
-
Entradas del sistema dentro de la matriz de mensajes en la API: Los desarrolladores ahora pueden actualizar las instrucciones de Claude a mitad de la tarea (ajustando permisos, presupuestos de tokens o contexto del entorno mientras se ejecuta un agente) sin romper el caché de mensajes.
Honestidad y una advertencia sobre la «conciencia de la evaluación»
Anthropic lidera con la honestidad como rasgo principal. El equipo de alineación de la compañía informa que Opus 4.8 tiene «aproximadamente cuatro veces menos probabilidades que su predecesor de permitir que las fallas en el código que ha escrito pasen desapercibidas», y que las tasas de comportamiento desalineado son ahora «sustancialmente más bajas que Opus 4.7, y similares a nuestro modelo mejor alineado, Claude Mythos Preview».
De hecho, un gráfico de barras publicado por Anthropic muestra qué tan cerca está Opus 4.8 del Mythos aún lanzado selectivamente en términos de su desalineación (una puntuación más baja es mejor), llegando a aproximadamente 1,9, por debajo del 2,5 de Opus 4.7 y efectivamente empatado con el Mythos Preview más capaz y restringido. La puntuación se basa en aproximadamente 2.600 sesiones de investigación simuladas por modelo.
El Tarjeta del sistema de 244 páginas publicado públicamente por Anthropic también entra en mayores detalles sobre categorías específicas de desalineación: si un modelo produce contenido potencialmente dañino en torno a «armas de grado militar», «contenido sexual dañino», «delito cibernético no permitido» y «socavar la democracia liberal», y nuevamente, en todos ellos, Opus 4.8 obtiene una puntuación notablemente mejor que 4.7 o Sonnet 4.6, y se acerca bastante a Mythos.
Anthropic señala un hallazgo que considera «el más preocupante» del entrenamiento: Opus 4.8 muestra una tendencia creciente a razonar explícitamente sobre cómo se calificarán sus resultados, incluso en entornos donde no se le dijo que estaba siendo evaluado. En otras palabras: el modelo sabe que es probable que lo estén calificando y produce una respuesta que cree que le permitirá obtener una buena calificación en la prueba, no una que necesariamente produciría si pensara que no lo están calificando.
Anthropic dice que esto no se tradujo en un peor comportamiento observable (Opus 4.8 muestra menos afirmaciones engañosas de éxito de tareas que los modelos anteriores), pero lo llama «una tendencia preocupante que podría complicar el entrenamiento en el futuro». El trabajo preliminar de interpretabilidad también encontró razonamiento no verbalizado relacionado con el alumno en aproximadamente el 5% de los episodios de capacitación.
Anthropic ejecutó el modelo a través de una recompensa de errores en vivo de una semana para una inyección rápida (una novedad) y concluyó que Opus 4.8 se ubica entre Opus 4.7 y Sonnet 4.6 en cuanto a robustez, por delante de «todos los modelos fronterizos comparables» probados, con salvaguardas implementadas que llevan las tasas de éxito de los ataques de uso del navegador a casi cero.
¿Qué sigue?
Anthropic provocó dos trayectorias. A corto plazo: modelos más baratos que proporcionen «muchas de las mismas capacidades que Opus». A más largo plazo: los modelos de clase Mythos, que según la compañía representan una inteligencia más alta que Opus pero requieren salvaguardias cibernéticas más fuertes antes de su lanzamiento general.
Por ahora, Opus 4.8 está posicionado como el nuevo caballo de batalla empresarial y de desarrollo: un poco más inteligente que 4.7, dramáticamente más barato de ejecutar rápidamente y notablemente más honesto acerca de lo que no sabe.
Antrópico hoy lanzado Claude Opus 4.8una actualización de su modelo insignia que se envía al mismo precio que su predecesor, junto con un nivel de «modo rápido» dramáticamente más económico y una nueva característica que permite al modelo generar cientos de subagentes paralelos para trabajos a escala de código base.
El modelo está disponible de inmediato en las superficies de Anthropic (claude.ai, Claude Code, API y Cowork) a un precio sin cambios: 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. Los desarrolladores pueden llamarlo como claude-opus-4-8.
El tema principal de la eficiencia es el modo rápido. Anthropic ha reducido el precio de ejecutar Opus 4.8 en modo rápido, donde el modelo produce tokens a aproximadamente 2,5 veces la velocidad normal, a $10 por millón de tokens de entrada y $50 por millón de tokens de salida, en comparación con $30/$150 para Opus 4.7.
Esto supone una reducción tres veces mayor que el precio del modo rápido de los modelos anteriores y pone la inferencia de alto rendimiento al alcance de cargas de trabajo de producción sensibles a la latencia.
El modo rápido está disponible inmediatamente en Claude Code a través del /fast dominio; El acceso a la API está cerrado, con una lista de espera en claude.com/fast-mode.
En el modo normal, Claude Opus 4.8 sigue estando entre los modelos fronterizos líderes más caros, pero aún está por debajo del GPT-5.5 de su principal rival OpenAI.
Resumen de precios de la API del modelo de IA de Frontier
|
Modelo |
Aporte |
Producción |
Costo total |
Fuente |
|
Flash MiMo-V2.5 |
$0.10 |
$0.30 |
$0.40 |
|
|
Minimax M2.7 |
$0.30 |
$1.20 |
$1.50 |
|
|
Géminis 3.1 Flash-Lite |
$0.25 |
$1.50 |
$1.75 |
|
|
MiMo V2.5 |
$0.40 |
$2.00 |
$2.40 |
|
|
Kimi-K2.6 |
$0.95 |
$4.00 |
$4.95 |
|
|
GLM-5 |
$1.00 |
$3.20 |
$4.20 |
|
|
Grok 4.3 (bajo contexto) |
$1.25 |
$2.50 |
$3.75 |
|
|
DeepSeek V4 Pro |
$1.74 |
$3.48 |
$5.22 |
|
|
GLM-5.1 |
$1.40 |
$4.40 |
$5.80 |
|
|
Claude Haiku 4.5 |
$1.00 |
$5.00 |
$6.00 |
|
|
Grok 4.3 (contexto alto) |
$2.50 |
$5.00 |
$7.50 |
|
|
Qwen3.7-Max |
$2.50 |
$7.50 |
$10.00 |
|
|
Géminis 3.5 Flash |
$1.50 |
$9.00 |
$10.50 |
|
|
Vista previa de Géminis 3.1 Pro (≤200K) |
$2.00 |
$12.00 |
$14.00 |
|
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
|
|
Vista previa de Géminis 3.1 Pro (>200K) |
$4.00 |
$18.00 |
$22.00 |
|
|
Cerrar Trabajo 4.7 |
$5.00 |
$25.00 |
$30.00 |
|
|
Cerrar Trabajo 4.8 |
$5.00 |
$25.00 |
$30.00 |
|
|
GPT-5.5 |
$5.00 |
$30.00 |
$35.00 |
Ganancias modestas respecto a 4.7, pero próximas capacidades de clase Mythos
En cuanto a los puntos de referencia, Opus 4.8 es un paso adelante más que un salto. Obtiene una puntuación del 88,6 % en SWE-bench Verified (frente al 87,6 % de Opus 4.7), del 69,2 % en el SWE-bench Pro más duro (frente al 64,3 %) y del 74,6 % en Terminal-Bench 2.1 (frente al 66,1 %). La propia Anthropic caracteriza el modelo como «una mejora modesta pero tangible con respecto a su predecesor».
Supera al GPT-5.5 normal en al menos 12 puntos de referencia, incluida la mayor parte del trabajo de conocimiento, la codificación (a nivel de problema), el uso de herramientas de agente y los puntos de referencia de contexto largo. GPT-5.5 gana en flujos de trabajo de terminal/CLI y está más o menos empatado en navegación web y ciencias de posgrado.
La señal más importante se encuentra en la escala de capacidades internas de Anthropic: Opus 4.8 aterriza entre Opus 4.7 y el Claude Mythos Preview, más capaz, que actualmente está restringido a un pequeño número de organizaciones bajo el Proyecto Glasswing para trabajos de ciberseguridad.
Anthropic dice que espera llevar «modelos de clase Mythos a todos nuestros clientes en las próximas semanas» una vez que se implementen medidas de seguridad cibernéticas adicionales.
Varios socios empresariales mencionaron ganancias materiales. Databricks informó que Opus 4.8 desbloquea «un cambio radical en el razonamiento agente» dentro de su agente de datos Genie, a «un costo simbólico 61 % más económico que Opus 4.7» gracias a la eficiencia multimodal en archivos PDF y diagramas.
Hebbia citó una mejor precisión de las citas y una mayor eficiencia simbólica en presentaciones financieras densas. Cognition, fabricante de Devin, dijo que el lanzamiento «se traduce directamente en ganancias de capacidad más rápidas para los ingenieros» y señaló que Opus 4.8 solucionó problemas de verbosidad de comentarios y llamadas de herramientas de 4.7. Un proveedor de uso de computadoras reportó un 84% en Online-Mind2Web, un salto sobre Opus 4.7 y GPT-5.5.
Flujos de trabajo dinámicos: cientos de subagentes paralelos
Junto con el modelo, Anthropic lanzó una vista previa de investigación de flujos de trabajo dinámicos en Claude Code, una característica diseñada para tareas demasiado grandes para una única ventana de contexto. Claude planifica el trabajo, genera cientos de subagentes paralelos y luego verifica sus propios resultados antes de informar. El ejemplo de Anthropic: una migración a escala de código base «a través de cientos de miles de líneas de código desde el inicio hasta la fusión, con el conjunto de pruebas existente como barra».
Los flujos de trabajo dinámicos están disponibles en los planes Enterprise, Team y Max de Claude Code.
Dos adiciones más pequeñas completan el lanzamiento:
-
Control de esfuerzo en claude.ai y Claude Cowork: Un nuevo selector permite a los usuarios marcar cuánto piensa Claude por respuesta: un mayor esfuerzo gasta más tokens para obtener mejores respuestas, un menor esfuerzo responde más rápido y quema los límites de velocidad más lentamente. Disponible en todos los planes.
-
Entradas del sistema dentro de la matriz de mensajes en la API: Los desarrolladores ahora pueden actualizar las instrucciones de Claude a mitad de la tarea (ajustando permisos, presupuestos de tokens o contexto del entorno mientras se ejecuta un agente) sin romper el caché de mensajes.
Honestidad y una advertencia sobre la «conciencia de la evaluación»
Anthropic lidera con la honestidad como rasgo principal. El equipo de alineación de la compañía informa que Opus 4.8 tiene «aproximadamente cuatro veces menos probabilidades que su predecesor de permitir que las fallas en el código que ha escrito pasen desapercibidas», y que las tasas de comportamiento desalineado son ahora «sustancialmente más bajas que Opus 4.7, y similares a nuestro modelo mejor alineado, Claude Mythos Preview».
De hecho, un gráfico de barras publicado por Anthropic muestra qué tan cerca está Opus 4.8 del Mythos aún lanzado selectivamente en términos de su desalineación (una puntuación más baja es mejor), llegando a aproximadamente 1,9, por debajo del 2,5 de Opus 4.7 y efectivamente empatado con el Mythos Preview más capaz y restringido. La puntuación se basa en aproximadamente 2.600 sesiones de investigación simuladas por modelo.
El Tarjeta del sistema de 244 páginas publicado públicamente por Anthropic también entra en mayores detalles sobre categorías específicas de desalineación: si un modelo produce contenido potencialmente dañino en torno a «armas de grado militar», «contenido sexual dañino», «delito cibernético no permitido» y «socavar la democracia liberal», y nuevamente, en todos ellos, Opus 4.8 obtiene una puntuación notablemente mejor que 4.7 o Sonnet 4.6, y se acerca bastante a Mythos.
Anthropic señala un hallazgo que considera «el más preocupante» del entrenamiento: Opus 4.8 muestra una tendencia creciente a razonar explícitamente sobre cómo se calificarán sus resultados, incluso en entornos donde no se le dijo que estaba siendo evaluado. En otras palabras: el modelo sabe que es probable que lo estén calificando y produce una respuesta que cree que le permitirá obtener una buena calificación en la prueba, no una que necesariamente produciría si pensara que no lo están calificando.
Anthropic dice que esto no se tradujo en un peor comportamiento observable (Opus 4.8 muestra menos afirmaciones engañosas de éxito de tareas que los modelos anteriores), pero lo llama «una tendencia preocupante que podría complicar el entrenamiento en el futuro». El trabajo preliminar de interpretabilidad también encontró razonamiento no verbalizado relacionado con el alumno en aproximadamente el 5% de los episodios de capacitación.
Anthropic ejecutó el modelo a través de una recompensa de errores en vivo de una semana para una inyección rápida (una novedad) y concluyó que Opus 4.8 se ubica entre Opus 4.7 y Sonnet 4.6 en cuanto a robustez, por delante de «todos los modelos fronterizos comparables» probados, con salvaguardas implementadas que llevan las tasas de éxito de los ataques de uso del navegador a casi cero.
¿Qué sigue?
Anthropic provocó dos trayectorias. A corto plazo: modelos más baratos que proporcionen «muchas de las mismas capacidades que Opus». A más largo plazo: los modelos de clase Mythos, que según la compañía representan una inteligencia más alta que Opus pero requieren salvaguardias cibernéticas más fuertes antes de su lanzamiento general.
Por ahora, Opus 4.8 está posicionado como el nuevo caballo de batalla empresarial y de desarrollo: un poco más inteligente que 4.7, dramáticamente más barato de ejecutar rápidamente y notablemente más honesto acerca de lo que no sabe.
Antrópico hoy lanzado Claude Opus 4.8una actualización de su modelo insignia que se envía al mismo precio que su predecesor, junto con un nivel de «modo rápido» dramáticamente más económico y una nueva característica que permite al modelo generar cientos de subagentes paralelos para trabajos a escala de código base.
El modelo está disponible de inmediato en las superficies de Anthropic (claude.ai, Claude Code, API y Cowork) a un precio sin cambios: 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. Los desarrolladores pueden llamarlo como claude-opus-4-8.
El tema principal de la eficiencia es el modo rápido. Anthropic ha reducido el precio de ejecutar Opus 4.8 en modo rápido, donde el modelo produce tokens a aproximadamente 2,5 veces la velocidad normal, a $10 por millón de tokens de entrada y $50 por millón de tokens de salida, en comparación con $30/$150 para Opus 4.7.
Esto supone una reducción tres veces mayor que el precio del modo rápido de los modelos anteriores y pone la inferencia de alto rendimiento al alcance de cargas de trabajo de producción sensibles a la latencia.
El modo rápido está disponible inmediatamente en Claude Code a través del /fast dominio; El acceso a la API está cerrado, con una lista de espera en claude.com/fast-mode.
En el modo normal, Claude Opus 4.8 sigue estando entre los modelos fronterizos líderes más caros, pero aún está por debajo del GPT-5.5 de su principal rival OpenAI.
Resumen de precios de la API del modelo de IA de Frontier
|
Modelo |
Aporte |
Producción |
Costo total |
Fuente |
|
Flash MiMo-V2.5 |
$0.10 |
$0.30 |
$0.40 |
|
|
Minimax M2.7 |
$0.30 |
$1.20 |
$1.50 |
|
|
Géminis 3.1 Flash-Lite |
$0.25 |
$1.50 |
$1.75 |
|
|
MiMo V2.5 |
$0.40 |
$2.00 |
$2.40 |
|
|
Kimi-K2.6 |
$0.95 |
$4.00 |
$4.95 |
|
|
GLM-5 |
$1.00 |
$3.20 |
$4.20 |
|
|
Grok 4.3 (bajo contexto) |
$1.25 |
$2.50 |
$3.75 |
|
|
DeepSeek V4 Pro |
$1.74 |
$3.48 |
$5.22 |
|
|
GLM-5.1 |
$1.40 |
$4.40 |
$5.80 |
|
|
Claude Haiku 4.5 |
$1.00 |
$5.00 |
$6.00 |
|
|
Grok 4.3 (contexto alto) |
$2.50 |
$5.00 |
$7.50 |
|
|
Qwen3.7-Max |
$2.50 |
$7.50 |
$10.00 |
|
|
Géminis 3.5 Flash |
$1.50 |
$9.00 |
$10.50 |
|
|
Vista previa de Géminis 3.1 Pro (≤200K) |
$2.00 |
$12.00 |
$14.00 |
|
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
|
|
Vista previa de Géminis 3.1 Pro (>200K) |
$4.00 |
$18.00 |
$22.00 |
|
|
Cerrar Trabajo 4.7 |
$5.00 |
$25.00 |
$30.00 |
|
|
Cerrar Trabajo 4.8 |
$5.00 |
$25.00 |
$30.00 |
|
|
GPT-5.5 |
$5.00 |
$30.00 |
$35.00 |
Ganancias modestas respecto a 4.7, pero próximas capacidades de clase Mythos
En cuanto a los puntos de referencia, Opus 4.8 es un paso adelante más que un salto. Obtiene una puntuación del 88,6 % en SWE-bench Verified (frente al 87,6 % de Opus 4.7), del 69,2 % en el SWE-bench Pro más duro (frente al 64,3 %) y del 74,6 % en Terminal-Bench 2.1 (frente al 66,1 %). La propia Anthropic caracteriza el modelo como «una mejora modesta pero tangible con respecto a su predecesor».
Supera al GPT-5.5 normal en al menos 12 puntos de referencia, incluida la mayor parte del trabajo de conocimiento, la codificación (a nivel de problema), el uso de herramientas de agente y los puntos de referencia de contexto largo. GPT-5.5 gana en flujos de trabajo de terminal/CLI y está más o menos empatado en navegación web y ciencias de posgrado.
La señal más importante se encuentra en la escala de capacidades internas de Anthropic: Opus 4.8 aterriza entre Opus 4.7 y el Claude Mythos Preview, más capaz, que actualmente está restringido a un pequeño número de organizaciones bajo el Proyecto Glasswing para trabajos de ciberseguridad.
Anthropic dice que espera llevar «modelos de clase Mythos a todos nuestros clientes en las próximas semanas» una vez que se implementen medidas de seguridad cibernéticas adicionales.
Varios socios empresariales mencionaron ganancias materiales. Databricks informó que Opus 4.8 desbloquea «un cambio radical en el razonamiento agente» dentro de su agente de datos Genie, a «un costo simbólico 61 % más económico que Opus 4.7» gracias a la eficiencia multimodal en archivos PDF y diagramas.
Hebbia citó una mejor precisión de las citas y una mayor eficiencia simbólica en presentaciones financieras densas. Cognition, fabricante de Devin, dijo que el lanzamiento «se traduce directamente en ganancias de capacidad más rápidas para los ingenieros» y señaló que Opus 4.8 solucionó problemas de verbosidad de comentarios y llamadas de herramientas de 4.7. Un proveedor de uso de computadoras reportó un 84% en Online-Mind2Web, un salto sobre Opus 4.7 y GPT-5.5.
Flujos de trabajo dinámicos: cientos de subagentes paralelos
Junto con el modelo, Anthropic lanzó una vista previa de investigación de flujos de trabajo dinámicos en Claude Code, una característica diseñada para tareas demasiado grandes para una única ventana de contexto. Claude planifica el trabajo, genera cientos de subagentes paralelos y luego verifica sus propios resultados antes de informar. El ejemplo de Anthropic: una migración a escala de código base «a través de cientos de miles de líneas de código desde el inicio hasta la fusión, con el conjunto de pruebas existente como barra».
Los flujos de trabajo dinámicos están disponibles en los planes Enterprise, Team y Max de Claude Code.
Dos adiciones más pequeñas completan el lanzamiento:
-
Control de esfuerzo en claude.ai y Claude Cowork: Un nuevo selector permite a los usuarios marcar cuánto piensa Claude por respuesta: un mayor esfuerzo gasta más tokens para obtener mejores respuestas, un menor esfuerzo responde más rápido y quema los límites de velocidad más lentamente. Disponible en todos los planes.
-
Entradas del sistema dentro de la matriz de mensajes en la API: Los desarrolladores ahora pueden actualizar las instrucciones de Claude a mitad de la tarea (ajustando permisos, presupuestos de tokens o contexto del entorno mientras se ejecuta un agente) sin romper el caché de mensajes.
Honestidad y una advertencia sobre la «conciencia de la evaluación»
Anthropic lidera con la honestidad como rasgo principal. El equipo de alineación de la compañía informa que Opus 4.8 tiene «aproximadamente cuatro veces menos probabilidades que su predecesor de permitir que las fallas en el código que ha escrito pasen desapercibidas», y que las tasas de comportamiento desalineado son ahora «sustancialmente más bajas que Opus 4.7, y similares a nuestro modelo mejor alineado, Claude Mythos Preview».
De hecho, un gráfico de barras publicado por Anthropic muestra qué tan cerca está Opus 4.8 del Mythos aún lanzado selectivamente en términos de su desalineación (una puntuación más baja es mejor), llegando a aproximadamente 1,9, por debajo del 2,5 de Opus 4.7 y efectivamente empatado con el Mythos Preview más capaz y restringido. La puntuación se basa en aproximadamente 2.600 sesiones de investigación simuladas por modelo.
El Tarjeta del sistema de 244 páginas publicado públicamente por Anthropic también entra en mayores detalles sobre categorías específicas de desalineación: si un modelo produce contenido potencialmente dañino en torno a «armas de grado militar», «contenido sexual dañino», «delito cibernético no permitido» y «socavar la democracia liberal», y nuevamente, en todos ellos, Opus 4.8 obtiene una puntuación notablemente mejor que 4.7 o Sonnet 4.6, y se acerca bastante a Mythos.
Anthropic señala un hallazgo que considera «el más preocupante» del entrenamiento: Opus 4.8 muestra una tendencia creciente a razonar explícitamente sobre cómo se calificarán sus resultados, incluso en entornos donde no se le dijo que estaba siendo evaluado. En otras palabras: el modelo sabe que es probable que lo estén calificando y produce una respuesta que cree que le permitirá obtener una buena calificación en la prueba, no una que necesariamente produciría si pensara que no lo están calificando.
Anthropic dice que esto no se tradujo en un peor comportamiento observable (Opus 4.8 muestra menos afirmaciones engañosas de éxito de tareas que los modelos anteriores), pero lo llama «una tendencia preocupante que podría complicar el entrenamiento en el futuro». El trabajo preliminar de interpretabilidad también encontró razonamiento no verbalizado relacionado con el alumno en aproximadamente el 5% de los episodios de capacitación.
Anthropic ejecutó el modelo a través de una recompensa de errores en vivo de una semana para una inyección rápida (una novedad) y concluyó que Opus 4.8 se ubica entre Opus 4.7 y Sonnet 4.6 en cuanto a robustez, por delante de «todos los modelos fronterizos comparables» probados, con salvaguardas implementadas que llevan las tasas de éxito de los ataques de uso del navegador a casi cero.
¿Qué sigue?
Anthropic provocó dos trayectorias. A corto plazo: modelos más baratos que proporcionen «muchas de las mismas capacidades que Opus». A más largo plazo: los modelos de clase Mythos, que según la compañía representan una inteligencia más alta que Opus pero requieren salvaguardias cibernéticas más fuertes antes de su lanzamiento general.
Por ahora, Opus 4.8 está posicionado como el nuevo caballo de batalla empresarial y de desarrollo: un poco más inteligente que 4.7, dramáticamente más barato de ejecutar rápidamente y notablemente más honesto acerca de lo que no sabe.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Antrópico hoy lanzado Claude Opus 4.8una actualización de su modelo insignia que se envía al mismo precio que su predecesor, junto con un nivel de «modo rápido» dramáticamente más económico y una nueva característica que permite al modelo generar cientos de subagentes paralelos para trabajos a escala de código base.
El modelo está disponible de inmediato en las superficies de Anthropic (claude.ai, Claude Code, API y Cowork) a un precio sin cambios: 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. Los desarrolladores pueden llamarlo como claude-opus-4-8.
El tema principal de la eficiencia es el modo rápido. Anthropic ha reducido el precio de ejecutar Opus 4.8 en modo rápido, donde el modelo produce tokens a aproximadamente 2,5 veces la velocidad normal, a $10 por millón de tokens de entrada y $50 por millón de tokens de salida, en comparación con $30/$150 para Opus 4.7.
Esto supone una reducción tres veces mayor que el precio del modo rápido de los modelos anteriores y pone la inferencia de alto rendimiento al alcance de cargas de trabajo de producción sensibles a la latencia.
El modo rápido está disponible inmediatamente en Claude Code a través del /fast dominio; El acceso a la API está cerrado, con una lista de espera en claude.com/fast-mode.
En el modo normal, Claude Opus 4.8 sigue estando entre los modelos fronterizos líderes más caros, pero aún está por debajo del GPT-5.5 de su principal rival OpenAI.
Resumen de precios de la API del modelo de IA de Frontier
|
Modelo |
Aporte |
Producción |
Costo total |
Fuente |
|
Flash MiMo-V2.5 |
$0.10 |
$0.30 |
$0.40 |
|
|
Minimax M2.7 |
$0.30 |
$1.20 |
$1.50 |
|
|
Géminis 3.1 Flash-Lite |
$0.25 |
$1.50 |
$1.75 |
|
|
MiMo V2.5 |
$0.40 |
$2.00 |
$2.40 |
|
|
Kimi-K2.6 |
$0.95 |
$4.00 |
$4.95 |
|
|
GLM-5 |
$1.00 |
$3.20 |
$4.20 |
|
|
Grok 4.3 (bajo contexto) |
$1.25 |
$2.50 |
$3.75 |
|
|
DeepSeek V4 Pro |
$1.74 |
$3.48 |
$5.22 |
|
|
GLM-5.1 |
$1.40 |
$4.40 |
$5.80 |
|
|
Claude Haiku 4.5 |
$1.00 |
$5.00 |
$6.00 |
|
|
Grok 4.3 (contexto alto) |
$2.50 |
$5.00 |
$7.50 |
|
|
Qwen3.7-Max |
$2.50 |
$7.50 |
$10.00 |
|
|
Géminis 3.5 Flash |
$1.50 |
$9.00 |
$10.50 |
|
|
Vista previa de Géminis 3.1 Pro (≤200K) |
$2.00 |
$12.00 |
$14.00 |
|
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
|
|
Vista previa de Géminis 3.1 Pro (>200K) |
$4.00 |
$18.00 |
$22.00 |
|
|
Cerrar Trabajo 4.7 |
$5.00 |
$25.00 |
$30.00 |
|
|
Cerrar Trabajo 4.8 |
$5.00 |
$25.00 |
$30.00 |
|
|
GPT-5.5 |
$5.00 |
$30.00 |
$35.00 |
Ganancias modestas respecto a 4.7, pero próximas capacidades de clase Mythos
En cuanto a los puntos de referencia, Opus 4.8 es un paso adelante más que un salto. Obtiene una puntuación del 88,6 % en SWE-bench Verified (frente al 87,6 % de Opus 4.7), del 69,2 % en el SWE-bench Pro más duro (frente al 64,3 %) y del 74,6 % en Terminal-Bench 2.1 (frente al 66,1 %). La propia Anthropic caracteriza el modelo como «una mejora modesta pero tangible con respecto a su predecesor».
Supera al GPT-5.5 normal en al menos 12 puntos de referencia, incluida la mayor parte del trabajo de conocimiento, la codificación (a nivel de problema), el uso de herramientas de agente y los puntos de referencia de contexto largo. GPT-5.5 gana en flujos de trabajo de terminal/CLI y está más o menos empatado en navegación web y ciencias de posgrado.
La señal más importante se encuentra en la escala de capacidades internas de Anthropic: Opus 4.8 aterriza entre Opus 4.7 y el Claude Mythos Preview, más capaz, que actualmente está restringido a un pequeño número de organizaciones bajo el Proyecto Glasswing para trabajos de ciberseguridad.
Anthropic dice que espera llevar «modelos de clase Mythos a todos nuestros clientes en las próximas semanas» una vez que se implementen medidas de seguridad cibernéticas adicionales.
Varios socios empresariales mencionaron ganancias materiales. Databricks informó que Opus 4.8 desbloquea «un cambio radical en el razonamiento agente» dentro de su agente de datos Genie, a «un costo simbólico 61 % más económico que Opus 4.7» gracias a la eficiencia multimodal en archivos PDF y diagramas.
Hebbia citó una mejor precisión de las citas y una mayor eficiencia simbólica en presentaciones financieras densas. Cognition, fabricante de Devin, dijo que el lanzamiento «se traduce directamente en ganancias de capacidad más rápidas para los ingenieros» y señaló que Opus 4.8 solucionó problemas de verbosidad de comentarios y llamadas de herramientas de 4.7. Un proveedor de uso de computadoras reportó un 84% en Online-Mind2Web, un salto sobre Opus 4.7 y GPT-5.5.
Flujos de trabajo dinámicos: cientos de subagentes paralelos
Junto con el modelo, Anthropic lanzó una vista previa de investigación de flujos de trabajo dinámicos en Claude Code, una característica diseñada para tareas demasiado grandes para una única ventana de contexto. Claude planifica el trabajo, genera cientos de subagentes paralelos y luego verifica sus propios resultados antes de informar. El ejemplo de Anthropic: una migración a escala de código base «a través de cientos de miles de líneas de código desde el inicio hasta la fusión, con el conjunto de pruebas existente como barra».
Los flujos de trabajo dinámicos están disponibles en los planes Enterprise, Team y Max de Claude Code.
Dos adiciones más pequeñas completan el lanzamiento:
-
Control de esfuerzo en claude.ai y Claude Cowork: Un nuevo selector permite a los usuarios marcar cuánto piensa Claude por respuesta: un mayor esfuerzo gasta más tokens para obtener mejores respuestas, un menor esfuerzo responde más rápido y quema los límites de velocidad más lentamente. Disponible en todos los planes.
-
Entradas del sistema dentro de la matriz de mensajes en la API: Los desarrolladores ahora pueden actualizar las instrucciones de Claude a mitad de la tarea (ajustando permisos, presupuestos de tokens o contexto del entorno mientras se ejecuta un agente) sin romper el caché de mensajes.
Honestidad y una advertencia sobre la «conciencia de la evaluación»
Anthropic lidera con la honestidad como rasgo principal. El equipo de alineación de la compañía informa que Opus 4.8 tiene «aproximadamente cuatro veces menos probabilidades que su predecesor de permitir que las fallas en el código que ha escrito pasen desapercibidas», y que las tasas de comportamiento desalineado son ahora «sustancialmente más bajas que Opus 4.7, y similares a nuestro modelo mejor alineado, Claude Mythos Preview».
De hecho, un gráfico de barras publicado por Anthropic muestra qué tan cerca está Opus 4.8 del Mythos aún lanzado selectivamente en términos de su desalineación (una puntuación más baja es mejor), llegando a aproximadamente 1,9, por debajo del 2,5 de Opus 4.7 y efectivamente empatado con el Mythos Preview más capaz y restringido. La puntuación se basa en aproximadamente 2.600 sesiones de investigación simuladas por modelo.
El Tarjeta del sistema de 244 páginas publicado públicamente por Anthropic también entra en mayores detalles sobre categorías específicas de desalineación: si un modelo produce contenido potencialmente dañino en torno a «armas de grado militar», «contenido sexual dañino», «delito cibernético no permitido» y «socavar la democracia liberal», y nuevamente, en todos ellos, Opus 4.8 obtiene una puntuación notablemente mejor que 4.7 o Sonnet 4.6, y se acerca bastante a Mythos.
Anthropic señala un hallazgo que considera «el más preocupante» del entrenamiento: Opus 4.8 muestra una tendencia creciente a razonar explícitamente sobre cómo se calificarán sus resultados, incluso en entornos donde no se le dijo que estaba siendo evaluado. En otras palabras: el modelo sabe que es probable que lo estén calificando y produce una respuesta que cree que le permitirá obtener una buena calificación en la prueba, no una que necesariamente produciría si pensara que no lo están calificando.
Anthropic dice que esto no se tradujo en un peor comportamiento observable (Opus 4.8 muestra menos afirmaciones engañosas de éxito de tareas que los modelos anteriores), pero lo llama «una tendencia preocupante que podría complicar el entrenamiento en el futuro». El trabajo preliminar de interpretabilidad también encontró razonamiento no verbalizado relacionado con el alumno en aproximadamente el 5% de los episodios de capacitación.
Anthropic ejecutó el modelo a través de una recompensa de errores en vivo de una semana para una inyección rápida (una novedad) y concluyó que Opus 4.8 se ubica entre Opus 4.7 y Sonnet 4.6 en cuanto a robustez, por delante de «todos los modelos fronterizos comparables» probados, con salvaguardas implementadas que llevan las tasas de éxito de los ataques de uso del navegador a casi cero.
¿Qué sigue?
Anthropic provocó dos trayectorias. A corto plazo: modelos más baratos que proporcionen «muchas de las mismas capacidades que Opus». A más largo plazo: los modelos de clase Mythos, que según la compañía representan una inteligencia más alta que Opus pero requieren salvaguardias cibernéticas más fuertes antes de su lanzamiento general.
Por ahora, Opus 4.8 está posicionado como el nuevo caballo de batalla empresarial y de desarrollo: un poco más inteligente que 4.7, dramáticamente más barato de ejecutar rápidamente y notablemente más honesto acerca de lo que no sabe.
Antrópico hoy lanzado Claude Opus 4.8una actualización de su modelo insignia que se envía al mismo precio que su predecesor, junto con un nivel de «modo rápido» dramáticamente más económico y una nueva característica que permite al modelo generar cientos de subagentes paralelos para trabajos a escala de código base.
El modelo está disponible de inmediato en las superficies de Anthropic (claude.ai, Claude Code, API y Cowork) a un precio sin cambios: 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. Los desarrolladores pueden llamarlo como claude-opus-4-8.
El tema principal de la eficiencia es el modo rápido. Anthropic ha reducido el precio de ejecutar Opus 4.8 en modo rápido, donde el modelo produce tokens a aproximadamente 2,5 veces la velocidad normal, a $10 por millón de tokens de entrada y $50 por millón de tokens de salida, en comparación con $30/$150 para Opus 4.7.
Esto supone una reducción tres veces mayor que el precio del modo rápido de los modelos anteriores y pone la inferencia de alto rendimiento al alcance de cargas de trabajo de producción sensibles a la latencia.
El modo rápido está disponible inmediatamente en Claude Code a través del /fast dominio; El acceso a la API está cerrado, con una lista de espera en claude.com/fast-mode.
En el modo normal, Claude Opus 4.8 sigue estando entre los modelos fronterizos líderes más caros, pero aún está por debajo del GPT-5.5 de su principal rival OpenAI.
Resumen de precios de la API del modelo de IA de Frontier
|
Modelo |
Aporte |
Producción |
Costo total |
Fuente |
|
Flash MiMo-V2.5 |
$0.10 |
$0.30 |
$0.40 |
|
|
Minimax M2.7 |
$0.30 |
$1.20 |
$1.50 |
|
|
Géminis 3.1 Flash-Lite |
$0.25 |
$1.50 |
$1.75 |
|
|
MiMo V2.5 |
$0.40 |
$2.00 |
$2.40 |
|
|
Kimi-K2.6 |
$0.95 |
$4.00 |
$4.95 |
|
|
GLM-5 |
$1.00 |
$3.20 |
$4.20 |
|
|
Grok 4.3 (bajo contexto) |
$1.25 |
$2.50 |
$3.75 |
|
|
DeepSeek V4 Pro |
$1.74 |
$3.48 |
$5.22 |
|
|
GLM-5.1 |
$1.40 |
$4.40 |
$5.80 |
|
|
Claude Haiku 4.5 |
$1.00 |
$5.00 |
$6.00 |
|
|
Grok 4.3 (contexto alto) |
$2.50 |
$5.00 |
$7.50 |
|
|
Qwen3.7-Max |
$2.50 |
$7.50 |
$10.00 |
|
|
Géminis 3.5 Flash |
$1.50 |
$9.00 |
$10.50 |
|
|
Vista previa de Géminis 3.1 Pro (≤200K) |
$2.00 |
$12.00 |
$14.00 |
|
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
|
|
Vista previa de Géminis 3.1 Pro (>200K) |
$4.00 |
$18.00 |
$22.00 |
|
|
Cerrar Trabajo 4.7 |
$5.00 |
$25.00 |
$30.00 |
|
|
Cerrar Trabajo 4.8 |
$5.00 |
$25.00 |
$30.00 |
|
|
GPT-5.5 |
$5.00 |
$30.00 |
$35.00 |
Ganancias modestas respecto a 4.7, pero próximas capacidades de clase Mythos
En cuanto a los puntos de referencia, Opus 4.8 es un paso adelante más que un salto. Obtiene una puntuación del 88,6 % en SWE-bench Verified (frente al 87,6 % de Opus 4.7), del 69,2 % en el SWE-bench Pro más duro (frente al 64,3 %) y del 74,6 % en Terminal-Bench 2.1 (frente al 66,1 %). La propia Anthropic caracteriza el modelo como «una mejora modesta pero tangible con respecto a su predecesor».
Supera al GPT-5.5 normal en al menos 12 puntos de referencia, incluida la mayor parte del trabajo de conocimiento, la codificación (a nivel de problema), el uso de herramientas de agente y los puntos de referencia de contexto largo. GPT-5.5 gana en flujos de trabajo de terminal/CLI y está más o menos empatado en navegación web y ciencias de posgrado.
La señal más importante se encuentra en la escala de capacidades internas de Anthropic: Opus 4.8 aterriza entre Opus 4.7 y el Claude Mythos Preview, más capaz, que actualmente está restringido a un pequeño número de organizaciones bajo el Proyecto Glasswing para trabajos de ciberseguridad.
Anthropic dice que espera llevar «modelos de clase Mythos a todos nuestros clientes en las próximas semanas» una vez que se implementen medidas de seguridad cibernéticas adicionales.
Varios socios empresariales mencionaron ganancias materiales. Databricks informó que Opus 4.8 desbloquea «un cambio radical en el razonamiento agente» dentro de su agente de datos Genie, a «un costo simbólico 61 % más económico que Opus 4.7» gracias a la eficiencia multimodal en archivos PDF y diagramas.
Hebbia citó una mejor precisión de las citas y una mayor eficiencia simbólica en presentaciones financieras densas. Cognition, fabricante de Devin, dijo que el lanzamiento «se traduce directamente en ganancias de capacidad más rápidas para los ingenieros» y señaló que Opus 4.8 solucionó problemas de verbosidad de comentarios y llamadas de herramientas de 4.7. Un proveedor de uso de computadoras reportó un 84% en Online-Mind2Web, un salto sobre Opus 4.7 y GPT-5.5.
Flujos de trabajo dinámicos: cientos de subagentes paralelos
Junto con el modelo, Anthropic lanzó una vista previa de investigación de flujos de trabajo dinámicos en Claude Code, una característica diseñada para tareas demasiado grandes para una única ventana de contexto. Claude planifica el trabajo, genera cientos de subagentes paralelos y luego verifica sus propios resultados antes de informar. El ejemplo de Anthropic: una migración a escala de código base «a través de cientos de miles de líneas de código desde el inicio hasta la fusión, con el conjunto de pruebas existente como barra».
Los flujos de trabajo dinámicos están disponibles en los planes Enterprise, Team y Max de Claude Code.
Dos adiciones más pequeñas completan el lanzamiento:
-
Control de esfuerzo en claude.ai y Claude Cowork: Un nuevo selector permite a los usuarios marcar cuánto piensa Claude por respuesta: un mayor esfuerzo gasta más tokens para obtener mejores respuestas, un menor esfuerzo responde más rápido y quema los límites de velocidad más lentamente. Disponible en todos los planes.
-
Entradas del sistema dentro de la matriz de mensajes en la API: Los desarrolladores ahora pueden actualizar las instrucciones de Claude a mitad de la tarea (ajustando permisos, presupuestos de tokens o contexto del entorno mientras se ejecuta un agente) sin romper el caché de mensajes.
Honestidad y una advertencia sobre la «conciencia de la evaluación»
Anthropic lidera con la honestidad como rasgo principal. El equipo de alineación de la compañía informa que Opus 4.8 tiene «aproximadamente cuatro veces menos probabilidades que su predecesor de permitir que las fallas en el código que ha escrito pasen desapercibidas», y que las tasas de comportamiento desalineado son ahora «sustancialmente más bajas que Opus 4.7, y similares a nuestro modelo mejor alineado, Claude Mythos Preview».
De hecho, un gráfico de barras publicado por Anthropic muestra qué tan cerca está Opus 4.8 del Mythos aún lanzado selectivamente en términos de su desalineación (una puntuación más baja es mejor), llegando a aproximadamente 1,9, por debajo del 2,5 de Opus 4.7 y efectivamente empatado con el Mythos Preview más capaz y restringido. La puntuación se basa en aproximadamente 2.600 sesiones de investigación simuladas por modelo.
El Tarjeta del sistema de 244 páginas publicado públicamente por Anthropic también entra en mayores detalles sobre categorías específicas de desalineación: si un modelo produce contenido potencialmente dañino en torno a «armas de grado militar», «contenido sexual dañino», «delito cibernético no permitido» y «socavar la democracia liberal», y nuevamente, en todos ellos, Opus 4.8 obtiene una puntuación notablemente mejor que 4.7 o Sonnet 4.6, y se acerca bastante a Mythos.
Anthropic señala un hallazgo que considera «el más preocupante» del entrenamiento: Opus 4.8 muestra una tendencia creciente a razonar explícitamente sobre cómo se calificarán sus resultados, incluso en entornos donde no se le dijo que estaba siendo evaluado. En otras palabras: el modelo sabe que es probable que lo estén calificando y produce una respuesta que cree que le permitirá obtener una buena calificación en la prueba, no una que necesariamente produciría si pensara que no lo están calificando.
Anthropic dice que esto no se tradujo en un peor comportamiento observable (Opus 4.8 muestra menos afirmaciones engañosas de éxito de tareas que los modelos anteriores), pero lo llama «una tendencia preocupante que podría complicar el entrenamiento en el futuro». El trabajo preliminar de interpretabilidad también encontró razonamiento no verbalizado relacionado con el alumno en aproximadamente el 5% de los episodios de capacitación.
Anthropic ejecutó el modelo a través de una recompensa de errores en vivo de una semana para una inyección rápida (una novedad) y concluyó que Opus 4.8 se ubica entre Opus 4.7 y Sonnet 4.6 en cuanto a robustez, por delante de «todos los modelos fronterizos comparables» probados, con salvaguardas implementadas que llevan las tasas de éxito de los ataques de uso del navegador a casi cero.
¿Qué sigue?
Anthropic provocó dos trayectorias. A corto plazo: modelos más baratos que proporcionen «muchas de las mismas capacidades que Opus». A más largo plazo: los modelos de clase Mythos, que según la compañía representan una inteligencia más alta que Opus pero requieren salvaguardias cibernéticas más fuertes antes de su lanzamiento general.
Por ahora, Opus 4.8 está posicionado como el nuevo caballo de batalla empresarial y de desarrollo: un poco más inteligente que 4.7, dramáticamente más barato de ejecutar rápidamente y notablemente más honesto acerca de lo que no sabe.
Antrópico hoy lanzado Claude Opus 4.8una actualización de su modelo insignia que se envía al mismo precio que su predecesor, junto con un nivel de «modo rápido» dramáticamente más económico y una nueva característica que permite al modelo generar cientos de subagentes paralelos para trabajos a escala de código base.
El modelo está disponible de inmediato en las superficies de Anthropic (claude.ai, Claude Code, API y Cowork) a un precio sin cambios: 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. Los desarrolladores pueden llamarlo como claude-opus-4-8.
El tema principal de la eficiencia es el modo rápido. Anthropic ha reducido el precio de ejecutar Opus 4.8 en modo rápido, donde el modelo produce tokens a aproximadamente 2,5 veces la velocidad normal, a $10 por millón de tokens de entrada y $50 por millón de tokens de salida, en comparación con $30/$150 para Opus 4.7.
Esto supone una reducción tres veces mayor que el precio del modo rápido de los modelos anteriores y pone la inferencia de alto rendimiento al alcance de cargas de trabajo de producción sensibles a la latencia.
El modo rápido está disponible inmediatamente en Claude Code a través del /fast dominio; El acceso a la API está cerrado, con una lista de espera en claude.com/fast-mode.
En el modo normal, Claude Opus 4.8 sigue estando entre los modelos fronterizos líderes más caros, pero aún está por debajo del GPT-5.5 de su principal rival OpenAI.
Resumen de precios de la API del modelo de IA de Frontier
|
Modelo |
Aporte |
Producción |
Costo total |
Fuente |
|
Flash MiMo-V2.5 |
$0.10 |
$0.30 |
$0.40 |
|
|
Minimax M2.7 |
$0.30 |
$1.20 |
$1.50 |
|
|
Géminis 3.1 Flash-Lite |
$0.25 |
$1.50 |
$1.75 |
|
|
MiMo V2.5 |
$0.40 |
$2.00 |
$2.40 |
|
|
Kimi-K2.6 |
$0.95 |
$4.00 |
$4.95 |
|
|
GLM-5 |
$1.00 |
$3.20 |
$4.20 |
|
|
Grok 4.3 (bajo contexto) |
$1.25 |
$2.50 |
$3.75 |
|
|
DeepSeek V4 Pro |
$1.74 |
$3.48 |
$5.22 |
|
|
GLM-5.1 |
$1.40 |
$4.40 |
$5.80 |
|
|
Claude Haiku 4.5 |
$1.00 |
$5.00 |
$6.00 |
|
|
Grok 4.3 (contexto alto) |
$2.50 |
$5.00 |
$7.50 |
|
|
Qwen3.7-Max |
$2.50 |
$7.50 |
$10.00 |
|
|
Géminis 3.5 Flash |
$1.50 |
$9.00 |
$10.50 |
|
|
Vista previa de Géminis 3.1 Pro (≤200K) |
$2.00 |
$12.00 |
$14.00 |
|
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
|
|
Vista previa de Géminis 3.1 Pro (>200K) |
$4.00 |
$18.00 |
$22.00 |
|
|
Cerrar Trabajo 4.7 |
$5.00 |
$25.00 |
$30.00 |
|
|
Cerrar Trabajo 4.8 |
$5.00 |
$25.00 |
$30.00 |
|
|
GPT-5.5 |
$5.00 |
$30.00 |
$35.00 |
Ganancias modestas respecto a 4.7, pero próximas capacidades de clase Mythos
En cuanto a los puntos de referencia, Opus 4.8 es un paso adelante más que un salto. Obtiene una puntuación del 88,6 % en SWE-bench Verified (frente al 87,6 % de Opus 4.7), del 69,2 % en el SWE-bench Pro más duro (frente al 64,3 %) y del 74,6 % en Terminal-Bench 2.1 (frente al 66,1 %). La propia Anthropic caracteriza el modelo como «una mejora modesta pero tangible con respecto a su predecesor».
Supera al GPT-5.5 normal en al menos 12 puntos de referencia, incluida la mayor parte del trabajo de conocimiento, la codificación (a nivel de problema), el uso de herramientas de agente y los puntos de referencia de contexto largo. GPT-5.5 gana en flujos de trabajo de terminal/CLI y está más o menos empatado en navegación web y ciencias de posgrado.
La señal más importante se encuentra en la escala de capacidades internas de Anthropic: Opus 4.8 aterriza entre Opus 4.7 y el Claude Mythos Preview, más capaz, que actualmente está restringido a un pequeño número de organizaciones bajo el Proyecto Glasswing para trabajos de ciberseguridad.
Anthropic dice que espera llevar «modelos de clase Mythos a todos nuestros clientes en las próximas semanas» una vez que se implementen medidas de seguridad cibernéticas adicionales.
Varios socios empresariales mencionaron ganancias materiales. Databricks informó que Opus 4.8 desbloquea «un cambio radical en el razonamiento agente» dentro de su agente de datos Genie, a «un costo simbólico 61 % más económico que Opus 4.7» gracias a la eficiencia multimodal en archivos PDF y diagramas.
Hebbia citó una mejor precisión de las citas y una mayor eficiencia simbólica en presentaciones financieras densas. Cognition, fabricante de Devin, dijo que el lanzamiento «se traduce directamente en ganancias de capacidad más rápidas para los ingenieros» y señaló que Opus 4.8 solucionó problemas de verbosidad de comentarios y llamadas de herramientas de 4.7. Un proveedor de uso de computadoras reportó un 84% en Online-Mind2Web, un salto sobre Opus 4.7 y GPT-5.5.
Flujos de trabajo dinámicos: cientos de subagentes paralelos
Junto con el modelo, Anthropic lanzó una vista previa de investigación de flujos de trabajo dinámicos en Claude Code, una característica diseñada para tareas demasiado grandes para una única ventana de contexto. Claude planifica el trabajo, genera cientos de subagentes paralelos y luego verifica sus propios resultados antes de informar. El ejemplo de Anthropic: una migración a escala de código base «a través de cientos de miles de líneas de código desde el inicio hasta la fusión, con el conjunto de pruebas existente como barra».
Los flujos de trabajo dinámicos están disponibles en los planes Enterprise, Team y Max de Claude Code.
Dos adiciones más pequeñas completan el lanzamiento:
-
Control de esfuerzo en claude.ai y Claude Cowork: Un nuevo selector permite a los usuarios marcar cuánto piensa Claude por respuesta: un mayor esfuerzo gasta más tokens para obtener mejores respuestas, un menor esfuerzo responde más rápido y quema los límites de velocidad más lentamente. Disponible en todos los planes.
-
Entradas del sistema dentro de la matriz de mensajes en la API: Los desarrolladores ahora pueden actualizar las instrucciones de Claude a mitad de la tarea (ajustando permisos, presupuestos de tokens o contexto del entorno mientras se ejecuta un agente) sin romper el caché de mensajes.
Honestidad y una advertencia sobre la «conciencia de la evaluación»
Anthropic lidera con la honestidad como rasgo principal. El equipo de alineación de la compañía informa que Opus 4.8 tiene «aproximadamente cuatro veces menos probabilidades que su predecesor de permitir que las fallas en el código que ha escrito pasen desapercibidas», y que las tasas de comportamiento desalineado son ahora «sustancialmente más bajas que Opus 4.7, y similares a nuestro modelo mejor alineado, Claude Mythos Preview».
De hecho, un gráfico de barras publicado por Anthropic muestra qué tan cerca está Opus 4.8 del Mythos aún lanzado selectivamente en términos de su desalineación (una puntuación más baja es mejor), llegando a aproximadamente 1,9, por debajo del 2,5 de Opus 4.7 y efectivamente empatado con el Mythos Preview más capaz y restringido. La puntuación se basa en aproximadamente 2.600 sesiones de investigación simuladas por modelo.
El Tarjeta del sistema de 244 páginas publicado públicamente por Anthropic también entra en mayores detalles sobre categorías específicas de desalineación: si un modelo produce contenido potencialmente dañino en torno a «armas de grado militar», «contenido sexual dañino», «delito cibernético no permitido» y «socavar la democracia liberal», y nuevamente, en todos ellos, Opus 4.8 obtiene una puntuación notablemente mejor que 4.7 o Sonnet 4.6, y se acerca bastante a Mythos.
Anthropic señala un hallazgo que considera «el más preocupante» del entrenamiento: Opus 4.8 muestra una tendencia creciente a razonar explícitamente sobre cómo se calificarán sus resultados, incluso en entornos donde no se le dijo que estaba siendo evaluado. En otras palabras: el modelo sabe que es probable que lo estén calificando y produce una respuesta que cree que le permitirá obtener una buena calificación en la prueba, no una que necesariamente produciría si pensara que no lo están calificando.
Anthropic dice que esto no se tradujo en un peor comportamiento observable (Opus 4.8 muestra menos afirmaciones engañosas de éxito de tareas que los modelos anteriores), pero lo llama «una tendencia preocupante que podría complicar el entrenamiento en el futuro». El trabajo preliminar de interpretabilidad también encontró razonamiento no verbalizado relacionado con el alumno en aproximadamente el 5% de los episodios de capacitación.
Anthropic ejecutó el modelo a través de una recompensa de errores en vivo de una semana para una inyección rápida (una novedad) y concluyó que Opus 4.8 se ubica entre Opus 4.7 y Sonnet 4.6 en cuanto a robustez, por delante de «todos los modelos fronterizos comparables» probados, con salvaguardas implementadas que llevan las tasas de éxito de los ataques de uso del navegador a casi cero.
¿Qué sigue?
Anthropic provocó dos trayectorias. A corto plazo: modelos más baratos que proporcionen «muchas de las mismas capacidades que Opus». A más largo plazo: los modelos de clase Mythos, que según la compañía representan una inteligencia más alta que Opus pero requieren salvaguardias cibernéticas más fuertes antes de su lanzamiento general.
Por ahora, Opus 4.8 está posicionado como el nuevo caballo de batalla empresarial y de desarrollo: un poco más inteligente que 4.7, dramáticamente más barato de ejecutar rápidamente y notablemente más honesto acerca de lo que no sabe.
Antrópico hoy lanzado Claude Opus 4.8una actualización de su modelo insignia que se envía al mismo precio que su predecesor, junto con un nivel de «modo rápido» dramáticamente más económico y una nueva característica que permite al modelo generar cientos de subagentes paralelos para trabajos a escala de código base.
El modelo está disponible de inmediato en las superficies de Anthropic (claude.ai, Claude Code, API y Cowork) a un precio sin cambios: 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. Los desarrolladores pueden llamarlo como claude-opus-4-8.
El tema principal de la eficiencia es el modo rápido. Anthropic ha reducido el precio de ejecutar Opus 4.8 en modo rápido, donde el modelo produce tokens a aproximadamente 2,5 veces la velocidad normal, a $10 por millón de tokens de entrada y $50 por millón de tokens de salida, en comparación con $30/$150 para Opus 4.7.
Esto supone una reducción tres veces mayor que el precio del modo rápido de los modelos anteriores y pone la inferencia de alto rendimiento al alcance de cargas de trabajo de producción sensibles a la latencia.
El modo rápido está disponible inmediatamente en Claude Code a través del /fast dominio; El acceso a la API está cerrado, con una lista de espera en claude.com/fast-mode.
En el modo normal, Claude Opus 4.8 sigue estando entre los modelos fronterizos líderes más caros, pero aún está por debajo del GPT-5.5 de su principal rival OpenAI.
Resumen de precios de la API del modelo de IA de Frontier
|
Modelo |
Aporte |
Producción |
Costo total |
Fuente |
|
Flash MiMo-V2.5 |
$0.10 |
$0.30 |
$0.40 |
|
|
Minimax M2.7 |
$0.30 |
$1.20 |
$1.50 |
|
|
Géminis 3.1 Flash-Lite |
$0.25 |
$1.50 |
$1.75 |
|
|
MiMo V2.5 |
$0.40 |
$2.00 |
$2.40 |
|
|
Kimi-K2.6 |
$0.95 |
$4.00 |
$4.95 |
|
|
GLM-5 |
$1.00 |
$3.20 |
$4.20 |
|
|
Grok 4.3 (bajo contexto) |
$1.25 |
$2.50 |
$3.75 |
|
|
DeepSeek V4 Pro |
$1.74 |
$3.48 |
$5.22 |
|
|
GLM-5.1 |
$1.40 |
$4.40 |
$5.80 |
|
|
Claude Haiku 4.5 |
$1.00 |
$5.00 |
$6.00 |
|
|
Grok 4.3 (contexto alto) |
$2.50 |
$5.00 |
$7.50 |
|
|
Qwen3.7-Max |
$2.50 |
$7.50 |
$10.00 |
|
|
Géminis 3.5 Flash |
$1.50 |
$9.00 |
$10.50 |
|
|
Vista previa de Géminis 3.1 Pro (≤200K) |
$2.00 |
$12.00 |
$14.00 |
|
|
GPT-5.4 |
$2.50 |
$15.00 |
$17.50 |
|
|
Vista previa de Géminis 3.1 Pro (>200K) |
$4.00 |
$18.00 |
$22.00 |
|
|
Cerrar Trabajo 4.7 |
$5.00 |
$25.00 |
$30.00 |
|
|
Cerrar Trabajo 4.8 |
$5.00 |
$25.00 |
$30.00 |
|
|
GPT-5.5 |
$5.00 |
$30.00 |
$35.00 |
Ganancias modestas respecto a 4.7, pero próximas capacidades de clase Mythos
En cuanto a los puntos de referencia, Opus 4.8 es un paso adelante más que un salto. Obtiene una puntuación del 88,6 % en SWE-bench Verified (frente al 87,6 % de Opus 4.7), del 69,2 % en el SWE-bench Pro más duro (frente al 64,3 %) y del 74,6 % en Terminal-Bench 2.1 (frente al 66,1 %). La propia Anthropic caracteriza el modelo como «una mejora modesta pero tangible con respecto a su predecesor».
Supera al GPT-5.5 normal en al menos 12 puntos de referencia, incluida la mayor parte del trabajo de conocimiento, la codificación (a nivel de problema), el uso de herramientas de agente y los puntos de referencia de contexto largo. GPT-5.5 gana en flujos de trabajo de terminal/CLI y está más o menos empatado en navegación web y ciencias de posgrado.
La señal más importante se encuentra en la escala de capacidades internas de Anthropic: Opus 4.8 aterriza entre Opus 4.7 y el Claude Mythos Preview, más capaz, que actualmente está restringido a un pequeño número de organizaciones bajo el Proyecto Glasswing para trabajos de ciberseguridad.
Anthropic dice que espera llevar «modelos de clase Mythos a todos nuestros clientes en las próximas semanas» una vez que se implementen medidas de seguridad cibernéticas adicionales.
Varios socios empresariales mencionaron ganancias materiales. Databricks informó que Opus 4.8 desbloquea «un cambio radical en el razonamiento agente» dentro de su agente de datos Genie, a «un costo simbólico 61 % más económico que Opus 4.7» gracias a la eficiencia multimodal en archivos PDF y diagramas.
Hebbia citó una mejor precisión de las citas y una mayor eficiencia simbólica en presentaciones financieras densas. Cognition, fabricante de Devin, dijo que el lanzamiento «se traduce directamente en ganancias de capacidad más rápidas para los ingenieros» y señaló que Opus 4.8 solucionó problemas de verbosidad de comentarios y llamadas de herramientas de 4.7. Un proveedor de uso de computadoras reportó un 84% en Online-Mind2Web, un salto sobre Opus 4.7 y GPT-5.5.
Flujos de trabajo dinámicos: cientos de subagentes paralelos
Junto con el modelo, Anthropic lanzó una vista previa de investigación de flujos de trabajo dinámicos en Claude Code, una característica diseñada para tareas demasiado grandes para una única ventana de contexto. Claude planifica el trabajo, genera cientos de subagentes paralelos y luego verifica sus propios resultados antes de informar. El ejemplo de Anthropic: una migración a escala de código base «a través de cientos de miles de líneas de código desde el inicio hasta la fusión, con el conjunto de pruebas existente como barra».
Los flujos de trabajo dinámicos están disponibles en los planes Enterprise, Team y Max de Claude Code.
Dos adiciones más pequeñas completan el lanzamiento:
-
Control de esfuerzo en claude.ai y Claude Cowork: Un nuevo selector permite a los usuarios marcar cuánto piensa Claude por respuesta: un mayor esfuerzo gasta más tokens para obtener mejores respuestas, un menor esfuerzo responde más rápido y quema los límites de velocidad más lentamente. Disponible en todos los planes.
-
Entradas del sistema dentro de la matriz de mensajes en la API: Los desarrolladores ahora pueden actualizar las instrucciones de Claude a mitad de la tarea (ajustando permisos, presupuestos de tokens o contexto del entorno mientras se ejecuta un agente) sin romper el caché de mensajes.
Honestidad y una advertencia sobre la «conciencia de la evaluación»
Anthropic lidera con la honestidad como rasgo principal. El equipo de alineación de la compañía informa que Opus 4.8 tiene «aproximadamente cuatro veces menos probabilidades que su predecesor de permitir que las fallas en el código que ha escrito pasen desapercibidas», y que las tasas de comportamiento desalineado son ahora «sustancialmente más bajas que Opus 4.7, y similares a nuestro modelo mejor alineado, Claude Mythos Preview».
De hecho, un gráfico de barras publicado por Anthropic muestra qué tan cerca está Opus 4.8 del Mythos aún lanzado selectivamente en términos de su desalineación (una puntuación más baja es mejor), llegando a aproximadamente 1,9, por debajo del 2,5 de Opus 4.7 y efectivamente empatado con el Mythos Preview más capaz y restringido. La puntuación se basa en aproximadamente 2.600 sesiones de investigación simuladas por modelo.
El Tarjeta del sistema de 244 páginas publicado públicamente por Anthropic también entra en mayores detalles sobre categorías específicas de desalineación: si un modelo produce contenido potencialmente dañino en torno a «armas de grado militar», «contenido sexual dañino», «delito cibernético no permitido» y «socavar la democracia liberal», y nuevamente, en todos ellos, Opus 4.8 obtiene una puntuación notablemente mejor que 4.7 o Sonnet 4.6, y se acerca bastante a Mythos.
Anthropic señala un hallazgo que considera «el más preocupante» del entrenamiento: Opus 4.8 muestra una tendencia creciente a razonar explícitamente sobre cómo se calificarán sus resultados, incluso en entornos donde no se le dijo que estaba siendo evaluado. En otras palabras: el modelo sabe que es probable que lo estén calificando y produce una respuesta que cree que le permitirá obtener una buena calificación en la prueba, no una que necesariamente produciría si pensara que no lo están calificando.
Anthropic dice que esto no se tradujo en un peor comportamiento observable (Opus 4.8 muestra menos afirmaciones engañosas de éxito de tareas que los modelos anteriores), pero lo llama «una tendencia preocupante que podría complicar el entrenamiento en el futuro». El trabajo preliminar de interpretabilidad también encontró razonamiento no verbalizado relacionado con el alumno en aproximadamente el 5% de los episodios de capacitación.
Anthropic ejecutó el modelo a través de una recompensa de errores en vivo de una semana para una inyección rápida (una novedad) y concluyó que Opus 4.8 se ubica entre Opus 4.7 y Sonnet 4.6 en cuanto a robustez, por delante de «todos los modelos fronterizos comparables» probados, con salvaguardas implementadas que llevan las tasas de éxito de los ataques de uso del navegador a casi cero.
¿Qué sigue?
Anthropic provocó dos trayectorias. A corto plazo: modelos más baratos que proporcionen «muchas de las mismas capacidades que Opus». A más largo plazo: los modelos de clase Mythos, que según la compañía representan una inteligencia más alta que Opus pero requieren salvaguardias cibernéticas más fuertes antes de su lanzamiento general.
Por ahora, Opus 4.8 está posicionado como el nuevo caballo de batalla empresarial y de desarrollo: un poco más inteligente que 4.7, dramáticamente más barato de ejecutar rápidamente y notablemente más honesto acerca de lo que no sabe.












































































