En los laboratorios fronterizos, las cifras más altas de inyecciones rápidas publicadas esta primavera son de Anthropic. Dirige a un equipo rojo a su nueva plantilla en un navegador y el atacante lo secuestra el 31,5% de las veces antes de que se activen las medidas de protección. OpenAI, Google y Meta nunca han dado a los administradores de seguridad un número comparable para agregar. Esta cifra parece una desventaja. En esta comparación, es todo lo contrario. Es el único pedazo de tierra firme.
Cuatro laboratorios fronterizos enviaron cada uno una rápida revelación de la vacuna, y no hubo dos que coincidieran. Anthropic puso 244 páginas y cuatro superficies agentes sobre la mesa el 28 de mayo. OpenAI informó sobre una superficie, los conectores. Google ha trasladado el tema de la tarjeta modelo a un marco de seguridad independiente. Meta no ha enviado ninguna tarjeta modelo cerrada. La siguiente tabla de divulgación de inyección rápida entre proveedores muestra lo que probó cada laboratorio, lo que midió cada uno y los cuatro lugares donde una comparación lado a lado se desmorona.
Una inyección rápida oculta una instrucción maliciosa en algo que lee un agente, una página web, un documento o el resultado de una herramienta. Una línea plantada puede filtrar registros o desencadenar acciones que nadie ha aprobado, y estos mapas son la única evidencia de primera mano de un comprador.
No existe ningún estándar industrial para medir nada de esto, y esa es la raíz del problema. Carter Rees, vicepresidente de IA de Reputation, dijo a VentureBeat que la inyección rápida rompe la suposición de que todas las herramientas existentes fueron construidas. «Una frase tan inocua como ‘ignorar instrucciones previas’ puede conllevar una carga útil tan devastadora como un desbordamiento del buffer, pero no tiene nada en común con firmas de malware conocidas». A falta de una firma compartida que buscar, cada laboratorio ha construido su propio criterio y los resultados no coinciden.
Adam Meyers, vicepresidente senior de operaciones adversas de CrowdStrike, dijo que la exposición ahora recae en el comprador. «A medida que se implementa la IA, aumenta la superficie de ataque, por lo que ahora es necesario poder proteger estos modelos de IA contra el uso indebido por parte de un adversario, el envenenamiento de datos o la inyección rápida». Los datos de primera línea de CrowdStrike muestran que la amenaza no se queda atrás. En su Informe sobre el panorama de amenazas de los servicios financieros de 2026, publicado en mayo, la compañía informó que los adversarios estaban utilizando IA para reducir el tiempo desde el acceso inicial hasta el impacto más rápido de lo que pueden responder las defensas existentes.
Antrópico midió cuatro superficies. Los números varían en un orden de magnitud dependiendo de cuál leas.
La tarjeta Opus 4.8 hace lo que las demás no hacen: detiene la inyección rápida en la superficie y la propagación es la historia.
Si lo piensas bien, coloca el modelo en un entorno de codificación y un atacante adaptativo de la herramienta Shade de Grey Swan logró el 7,03% de los intentos únicos. Las medidas de salvaguardia redujeron esta cifra al 2,09%.
Mueva la misma clase de ataque en un navegador, la superficie detrás de Claude en Chrome y Claude Cowork, y el suelo cede. Anthropic colocó equipos rojos profesionales en 129 entornos web de la capacitación e imprimió cada resultado en la Tabla 5.2.2.4.A en la página 81 del mapa del sistema. Por intento corresponde a la proporción de todos los intentos de inyección exitosos en 129 entornos a una tasa de 10 intentos cada uno. Por escenario, el corte más difícil es la proporción de entornos en los que al menos un intento tuvo éxito.
Lea la columna por intento sin precaución, sin pensar, y la tasa bruta disminuye con cada generación, desde el Soneto 4,6 al 50,7% hasta el Opus 4,8 al 31,5%. El más bajo de la tabla, un 5,9%, pertenece a Mythos Preview, que nadie puede comprar todavía. Activa las protecciones y el Opus 4.8 baja al 0,5%. Si desactivas el reflejo, éste caerá a cero en los 129 entornos.
OpenAI midió un área con ataques que ya conocía.
El mapa GPT-5.5, lanzado el 23 de abril y actualizado el 24 de abril, maneja la inyección rápida en un solo lugar, una única sección sobre robustez ante ataques conocidos contra conectores. OpenAI informa esto como una puntuación de robustez donde cuanto más alto, mejor, lo opuesto a la tasa de éxito de un ataque. GPT-5.5 tiene un valor de 0,963, en comparación con 0,998 para la reflexión de GPT-5.4. Este número por sí solo representa toda la revelación.
Anthropic probó cuatro superficies contra un atacante adaptativo que reescribe su enfoque en función de lo que hace el modelo, luego ejecutó una recompensa de errores de una semana en la que los equipos rojos intentaron romper el modelo en vivo. Cuando los resultados de la codificación fueron peores que los del Opus 4.7, la tarjeta así lo indicó.
Coloque el 0,963 al lado del 31,5% y parecerá que pertenece a un tablón de anuncios. Este no es el caso. Uno es una puntuación de robustez frente a ataques conocidos en una superficie. El otro es la tasa de éxito del ataque por intento en 129 entornos de navegador contra un atacante, escalada en tiempo real.
Google y Meta nunca pusieron el número en el mapa
Los archivos Gemini 3 de Google invitan a la inyección de medidas de mitigación, y los documentos de lanzamiento describen una resistencia más fuerte sin ningún número adjunto. El informe Frontier Safety Framework utiliza equipos rojos, pero en todas sus áreas de capacidad, y la inyección rápida no es una de ellas. No hay hoja modelo, ni página marco, ni número por superficie que un comprador pueda presentar para una evaluación de riesgos.
Meta envía pesas abiertas sin una tarjeta de patrón cerrado. La defensa contra inyecciones rápidas se encuentra en una pila separada, LlamaFirewall de Purple Llama. Un clasificador PromptGuard 2 y un oyente AlignmentCheck, que se ejecutan en el punto de referencia público AgentDojo y sus 97 tareas, redujeron el éxito del ataque del 17,6% sin defensa al 1,75% combinado. Números reales. Evalúan las barreras de seguridad en función de una línea de base pública, no en función de una superficie de despliegue que un equipo de seguridad reconocería.
La grilla de divulgación para inyecciones rápidas entre proveedores
La siguiente cuadrícula funciona en todos los modelos de límites que evalúan los equipos de seguridad. Cada fila marca un lugar donde se distribuyen los cuatro laboratorios. En cada división es donde se desmorona una comparación rápida. Las figuras Anthropic provienen de la placa del sistema Opus 4.8. Todo lo relacionado con los otros tres proviene de la documentación de seguridad publicada por cada proveedor.
|
Dimensión |
Antrópico, Opus 4.8 |
AbiertoAI, GPT-5.5 |
Google, Géminis 3.x |
Meta, pila de llamas |
|
Documento de seguridad |
Mapa del sistema, 28 de mayo de 2026, 244 páginas. |
Mapa del sistema, 23 de abril de 2026, actualizado el 24 de abril |
Mapa modelo e informe separado sobre el marco de seguridad fronteriza |
Sin tarjeta modelo cerrada. Pesas abiertas y pila de Llama Púrpura |
|
Referencia de inyección o conjunto de datos |
ART de Gray Swan y UK AISI, la herramienta Shade, además de evaluación interna del navegador, 129 entornos |
Evaluación de conectores internos, ataques conocidos. |
Ninguno para inyección |
AgentDojo, 97 tareas |
|
Superficies con evaluación de inyección. |
Cuatro. Uso de herramientas, codificación, uso de computadora, navegador. |
A. Conectores |
Ninguno publicado para inyección. |
A. Tareas del agente AgentDojo |
|
Se muestra una escalada de intentos múltiples |
Sí. Punto de referencia ART en 1, 10, 100. Codificación y uso de computadoras en 1 y 200 |
No. Una sola partición |
No |
No |
|
Métrica principal y unidad |
Tasa de éxito del ataque. Navegador, reflejado, 31,5% sin procesar, 0,5% guardado |
Puntuación de robustez, cuanto más alta, mejor. 0,963, en comparación con 0,998 para la reflexión GPT-5.4 |
Ninguno publicado. Mayor resistencia reclamada cualitativamente |
Tasa de éxito de los ataques a AgentDojo. 17,6% de referencia a 1,75% combinado |
|
Bono externo en vivo |
Sí. Bono de inyección en vivo de una semana con equipos rojos externos |
Sin bonificación de inyección. Solo prima orgánica |
No se encontró ninguno |
No se encontró ninguno |
|
Regresión revelada |
Sí, explícito, con números. |
El número cayó de 0,998 a 0,963, lo que no se considera una regresión. |
Mayor fuerza reclamada, sin cifras. |
No aplicable |
Cinco factores que los equipos de seguridad deben considerar ahora
Anthropic probó cuatro superficies e imprimió cada número. OpenAI probó uno. Google no ha impreso ningún precio por zona. Meta evaluó sus barandillas, no el modelo. Las cuatro divulgaciones no constituyen una comparación. Estos cinco pasos construyen uno.
Extraiga todos los agentes que ha implementado o ampliado y márquelos según la superficie que toca, navegador, código, conectores o escritorio. El precio de Anthropic para Opus 4.8 es del 2,09% en codificación y del 0,5% en navegador. Un número mixto no cubre ninguno de los dos. Obtenga la tarifa publicada del proveedor para su área específica. Si el proveedor nunca ha lanzado uno, considérelo no probado.
Envíe la cuadrícula de múltiples proveedores a cada proveedor que se esté evaluando. Una puntuación de conectores de 0,963 y una tasa de navegación del 31,5% nunca han estado en la misma escala. Exija una tasa de éxito de ataques de superficie sin procesar y segura con metodología de atacante designado. Las celdas vacías son áreas sin evidencia de primera mano.
Confirma por escrito el número obtenido por tu integración. El 0,5% de Anthropic proviene de Claude en Chrome y Cowork con la pila de respaldo completa. En la API, el modelo se envía sin ellos. No acepte un número de producto para una implementación de API.
Agregue dos cláusulas a la RFP. El proveedor probó con un atacante adaptativo que reescribe cargas útiles en la plantilla y alguien externo a la empresa intentó romperlo. Anthropic utilizó la herramienta Shade adaptativa de Grey Swan y recibió un bono pagado de una semana. OpenAI probó ataques conocidos en una superficie. Los adversarios no envían cargas útiles conocidas.
Realice su propia prueba de inyección antes de enviar cualquier agente. Los números de proveedores provienen de entornos de proveedores con indicaciones del sistema de proveedores. Su pila tiene sus propias indicaciones, permisos y acceso a datos. Establezca un umbral para el éxito. Todo lo anterior no se publica en línea.
Lo principal. Aún no existe ningún estándar para esto. El número de un proveedor le indica lo que ha elegido medir. Tu propio equipo rojo te dice a qué estás expuesto.
En los laboratorios fronterizos, las cifras más altas de inyecciones rápidas publicadas esta primavera son de Anthropic. Dirige a un equipo rojo a su nueva plantilla en un navegador y el atacante lo secuestra el 31,5% de las veces antes de que se activen las medidas de protección. OpenAI, Google y Meta nunca han dado a los administradores de seguridad un número comparable para agregar. Esta cifra parece una desventaja. En esta comparación, es todo lo contrario. Es el único pedazo de tierra firme.
Cuatro laboratorios fronterizos enviaron cada uno una rápida revelación de la vacuna, y no hubo dos que coincidieran. Anthropic puso 244 páginas y cuatro superficies agentes sobre la mesa el 28 de mayo. OpenAI informó sobre una superficie, los conectores. Google ha trasladado el tema de la tarjeta modelo a un marco de seguridad independiente. Meta no ha enviado ninguna tarjeta modelo cerrada. La siguiente tabla de divulgación de inyección rápida entre proveedores muestra lo que probó cada laboratorio, lo que midió cada uno y los cuatro lugares donde una comparación lado a lado se desmorona.
Una inyección rápida oculta una instrucción maliciosa en algo que lee un agente, una página web, un documento o el resultado de una herramienta. Una línea plantada puede filtrar registros o desencadenar acciones que nadie ha aprobado, y estos mapas son la única evidencia de primera mano de un comprador.
No existe ningún estándar industrial para medir nada de esto, y esa es la raíz del problema. Carter Rees, vicepresidente de IA de Reputation, dijo a VentureBeat que la inyección rápida rompe la suposición de que todas las herramientas existentes fueron construidas. «Una frase tan inocua como ‘ignorar instrucciones previas’ puede conllevar una carga útil tan devastadora como un desbordamiento del buffer, pero no tiene nada en común con firmas de malware conocidas». A falta de una firma compartida que buscar, cada laboratorio ha construido su propio criterio y los resultados no coinciden.
Adam Meyers, vicepresidente senior de operaciones adversas de CrowdStrike, dijo que la exposición ahora recae en el comprador. «A medida que se implementa la IA, aumenta la superficie de ataque, por lo que ahora es necesario poder proteger estos modelos de IA contra el uso indebido por parte de un adversario, el envenenamiento de datos o la inyección rápida». Los datos de primera línea de CrowdStrike muestran que la amenaza no se queda atrás. En su Informe sobre el panorama de amenazas de los servicios financieros de 2026, publicado en mayo, la compañía informó que los adversarios estaban utilizando IA para reducir el tiempo desde el acceso inicial hasta el impacto más rápido de lo que pueden responder las defensas existentes.
Antrópico midió cuatro superficies. Los números varían en un orden de magnitud dependiendo de cuál leas.
La tarjeta Opus 4.8 hace lo que las demás no hacen: detiene la inyección rápida en la superficie y la propagación es la historia.
Si lo piensas bien, coloca el modelo en un entorno de codificación y un atacante adaptativo de la herramienta Shade de Grey Swan logró el 7,03% de los intentos únicos. Las medidas de salvaguardia redujeron esta cifra al 2,09%.
Mueva la misma clase de ataque en un navegador, la superficie detrás de Claude en Chrome y Claude Cowork, y el suelo cede. Anthropic colocó equipos rojos profesionales en 129 entornos web de la capacitación e imprimió cada resultado en la Tabla 5.2.2.4.A en la página 81 del mapa del sistema. Por intento corresponde a la proporción de todos los intentos de inyección exitosos en 129 entornos a una tasa de 10 intentos cada uno. Por escenario, el corte más difícil es la proporción de entornos en los que al menos un intento tuvo éxito.
Lea la columna por intento sin precaución, sin pensar, y la tasa bruta disminuye con cada generación, desde el Soneto 4,6 al 50,7% hasta el Opus 4,8 al 31,5%. El más bajo de la tabla, un 5,9%, pertenece a Mythos Preview, que nadie puede comprar todavía. Activa las protecciones y el Opus 4.8 baja al 0,5%. Si desactivas el reflejo, éste caerá a cero en los 129 entornos.
OpenAI midió un área con ataques que ya conocía.
El mapa GPT-5.5, lanzado el 23 de abril y actualizado el 24 de abril, maneja la inyección rápida en un solo lugar, una única sección sobre robustez ante ataques conocidos contra conectores. OpenAI informa esto como una puntuación de robustez donde cuanto más alto, mejor, lo opuesto a la tasa de éxito de un ataque. GPT-5.5 tiene un valor de 0,963, en comparación con 0,998 para la reflexión de GPT-5.4. Este número por sí solo representa toda la revelación.
Anthropic probó cuatro superficies contra un atacante adaptativo que reescribe su enfoque en función de lo que hace el modelo, luego ejecutó una recompensa de errores de una semana en la que los equipos rojos intentaron romper el modelo en vivo. Cuando los resultados de la codificación fueron peores que los del Opus 4.7, la tarjeta así lo indicó.
Coloque el 0,963 al lado del 31,5% y parecerá que pertenece a un tablón de anuncios. Este no es el caso. Uno es una puntuación de robustez frente a ataques conocidos en una superficie. El otro es la tasa de éxito del ataque por intento en 129 entornos de navegador contra un atacante, escalada en tiempo real.
Google y Meta nunca pusieron el número en el mapa
Los archivos Gemini 3 de Google invitan a la inyección de medidas de mitigación, y los documentos de lanzamiento describen una resistencia más fuerte sin ningún número adjunto. El informe Frontier Safety Framework utiliza equipos rojos, pero en todas sus áreas de capacidad, y la inyección rápida no es una de ellas. No hay hoja modelo, ni página marco, ni número por superficie que un comprador pueda presentar para una evaluación de riesgos.
Meta envía pesas abiertas sin una tarjeta de patrón cerrado. La defensa contra inyecciones rápidas se encuentra en una pila separada, LlamaFirewall de Purple Llama. Un clasificador PromptGuard 2 y un oyente AlignmentCheck, que se ejecutan en el punto de referencia público AgentDojo y sus 97 tareas, redujeron el éxito del ataque del 17,6% sin defensa al 1,75% combinado. Números reales. Evalúan las barreras de seguridad en función de una línea de base pública, no en función de una superficie de despliegue que un equipo de seguridad reconocería.
La grilla de divulgación para inyecciones rápidas entre proveedores
La siguiente cuadrícula funciona en todos los modelos de límites que evalúan los equipos de seguridad. Cada fila marca un lugar donde se distribuyen los cuatro laboratorios. En cada división es donde se desmorona una comparación rápida. Las figuras Anthropic provienen de la placa del sistema Opus 4.8. Todo lo relacionado con los otros tres proviene de la documentación de seguridad publicada por cada proveedor.
|
Dimensión |
Antrópico, Opus 4.8 |
AbiertoAI, GPT-5.5 |
Google, Géminis 3.x |
Meta, pila de llamas |
|
Documento de seguridad |
Mapa del sistema, 28 de mayo de 2026, 244 páginas. |
Mapa del sistema, 23 de abril de 2026, actualizado el 24 de abril |
Mapa modelo e informe separado sobre el marco de seguridad fronteriza |
Sin tarjeta modelo cerrada. Pesas abiertas y pila de Llama Púrpura |
|
Referencia de inyección o conjunto de datos |
ART de Gray Swan y UK AISI, la herramienta Shade, además de evaluación interna del navegador, 129 entornos |
Evaluación de conectores internos, ataques conocidos. |
Ninguno para inyección |
AgentDojo, 97 tareas |
|
Superficies con evaluación de inyección. |
Cuatro. Uso de herramientas, codificación, uso de computadora, navegador. |
A. Conectores |
Ninguno publicado para inyección. |
A. Tareas del agente AgentDojo |
|
Se muestra una escalada de intentos múltiples |
Sí. Punto de referencia ART en 1, 10, 100. Codificación y uso de computadoras en 1 y 200 |
No. Una sola partición |
No |
No |
|
Métrica principal y unidad |
Tasa de éxito del ataque. Navegador, reflejado, 31,5% sin procesar, 0,5% guardado |
Puntuación de robustez, cuanto más alta, mejor. 0,963, en comparación con 0,998 para la reflexión GPT-5.4 |
Ninguno publicado. Mayor resistencia reclamada cualitativamente |
Tasa de éxito de los ataques a AgentDojo. 17,6% de referencia a 1,75% combinado |
|
Bono externo en vivo |
Sí. Bono de inyección en vivo de una semana con equipos rojos externos |
Sin bonificación de inyección. Solo prima orgánica |
No se encontró ninguno |
No se encontró ninguno |
|
Regresión revelada |
Sí, explícito, con números. |
El número cayó de 0,998 a 0,963, lo que no se considera una regresión. |
Mayor fuerza reclamada, sin cifras. |
No aplicable |
Cinco factores que los equipos de seguridad deben considerar ahora
Anthropic probó cuatro superficies e imprimió cada número. OpenAI probó uno. Google no ha impreso ningún precio por zona. Meta evaluó sus barandillas, no el modelo. Las cuatro divulgaciones no constituyen una comparación. Estos cinco pasos construyen uno.
Extraiga todos los agentes que ha implementado o ampliado y márquelos según la superficie que toca, navegador, código, conectores o escritorio. El precio de Anthropic para Opus 4.8 es del 2,09% en codificación y del 0,5% en navegador. Un número mixto no cubre ninguno de los dos. Obtenga la tarifa publicada del proveedor para su área específica. Si el proveedor nunca ha lanzado uno, considérelo no probado.
Envíe la cuadrícula de múltiples proveedores a cada proveedor que se esté evaluando. Una puntuación de conectores de 0,963 y una tasa de navegación del 31,5% nunca han estado en la misma escala. Exija una tasa de éxito de ataques de superficie sin procesar y segura con metodología de atacante designado. Las celdas vacías son áreas sin evidencia de primera mano.
Confirma por escrito el número obtenido por tu integración. El 0,5% de Anthropic proviene de Claude en Chrome y Cowork con la pila de respaldo completa. En la API, el modelo se envía sin ellos. No acepte un número de producto para una implementación de API.
Agregue dos cláusulas a la RFP. El proveedor probó con un atacante adaptativo que reescribe cargas útiles en la plantilla y alguien externo a la empresa intentó romperlo. Anthropic utilizó la herramienta Shade adaptativa de Grey Swan y recibió un bono pagado de una semana. OpenAI probó ataques conocidos en una superficie. Los adversarios no envían cargas útiles conocidas.
Realice su propia prueba de inyección antes de enviar cualquier agente. Los números de proveedores provienen de entornos de proveedores con indicaciones del sistema de proveedores. Su pila tiene sus propias indicaciones, permisos y acceso a datos. Establezca un umbral para el éxito. Todo lo anterior no se publica en línea.
Lo principal. Aún no existe ningún estándar para esto. El número de un proveedor le indica lo que ha elegido medir. Tu propio equipo rojo te dice a qué estás expuesto.
En los laboratorios fronterizos, las cifras más altas de inyecciones rápidas publicadas esta primavera son de Anthropic. Dirige a un equipo rojo a su nueva plantilla en un navegador y el atacante lo secuestra el 31,5% de las veces antes de que se activen las medidas de protección. OpenAI, Google y Meta nunca han dado a los administradores de seguridad un número comparable para agregar. Esta cifra parece una desventaja. En esta comparación, es todo lo contrario. Es el único pedazo de tierra firme.
Cuatro laboratorios fronterizos enviaron cada uno una rápida revelación de la vacuna, y no hubo dos que coincidieran. Anthropic puso 244 páginas y cuatro superficies agentes sobre la mesa el 28 de mayo. OpenAI informó sobre una superficie, los conectores. Google ha trasladado el tema de la tarjeta modelo a un marco de seguridad independiente. Meta no ha enviado ninguna tarjeta modelo cerrada. La siguiente tabla de divulgación de inyección rápida entre proveedores muestra lo que probó cada laboratorio, lo que midió cada uno y los cuatro lugares donde una comparación lado a lado se desmorona.
Una inyección rápida oculta una instrucción maliciosa en algo que lee un agente, una página web, un documento o el resultado de una herramienta. Una línea plantada puede filtrar registros o desencadenar acciones que nadie ha aprobado, y estos mapas son la única evidencia de primera mano de un comprador.
No existe ningún estándar industrial para medir nada de esto, y esa es la raíz del problema. Carter Rees, vicepresidente de IA de Reputation, dijo a VentureBeat que la inyección rápida rompe la suposición de que todas las herramientas existentes fueron construidas. «Una frase tan inocua como ‘ignorar instrucciones previas’ puede conllevar una carga útil tan devastadora como un desbordamiento del buffer, pero no tiene nada en común con firmas de malware conocidas». A falta de una firma compartida que buscar, cada laboratorio ha construido su propio criterio y los resultados no coinciden.
Adam Meyers, vicepresidente senior de operaciones adversas de CrowdStrike, dijo que la exposición ahora recae en el comprador. «A medida que se implementa la IA, aumenta la superficie de ataque, por lo que ahora es necesario poder proteger estos modelos de IA contra el uso indebido por parte de un adversario, el envenenamiento de datos o la inyección rápida». Los datos de primera línea de CrowdStrike muestran que la amenaza no se queda atrás. En su Informe sobre el panorama de amenazas de los servicios financieros de 2026, publicado en mayo, la compañía informó que los adversarios estaban utilizando IA para reducir el tiempo desde el acceso inicial hasta el impacto más rápido de lo que pueden responder las defensas existentes.
Antrópico midió cuatro superficies. Los números varían en un orden de magnitud dependiendo de cuál leas.
La tarjeta Opus 4.8 hace lo que las demás no hacen: detiene la inyección rápida en la superficie y la propagación es la historia.
Si lo piensas bien, coloca el modelo en un entorno de codificación y un atacante adaptativo de la herramienta Shade de Grey Swan logró el 7,03% de los intentos únicos. Las medidas de salvaguardia redujeron esta cifra al 2,09%.
Mueva la misma clase de ataque en un navegador, la superficie detrás de Claude en Chrome y Claude Cowork, y el suelo cede. Anthropic colocó equipos rojos profesionales en 129 entornos web de la capacitación e imprimió cada resultado en la Tabla 5.2.2.4.A en la página 81 del mapa del sistema. Por intento corresponde a la proporción de todos los intentos de inyección exitosos en 129 entornos a una tasa de 10 intentos cada uno. Por escenario, el corte más difícil es la proporción de entornos en los que al menos un intento tuvo éxito.
Lea la columna por intento sin precaución, sin pensar, y la tasa bruta disminuye con cada generación, desde el Soneto 4,6 al 50,7% hasta el Opus 4,8 al 31,5%. El más bajo de la tabla, un 5,9%, pertenece a Mythos Preview, que nadie puede comprar todavía. Activa las protecciones y el Opus 4.8 baja al 0,5%. Si desactivas el reflejo, éste caerá a cero en los 129 entornos.
OpenAI midió un área con ataques que ya conocía.
El mapa GPT-5.5, lanzado el 23 de abril y actualizado el 24 de abril, maneja la inyección rápida en un solo lugar, una única sección sobre robustez ante ataques conocidos contra conectores. OpenAI informa esto como una puntuación de robustez donde cuanto más alto, mejor, lo opuesto a la tasa de éxito de un ataque. GPT-5.5 tiene un valor de 0,963, en comparación con 0,998 para la reflexión de GPT-5.4. Este número por sí solo representa toda la revelación.
Anthropic probó cuatro superficies contra un atacante adaptativo que reescribe su enfoque en función de lo que hace el modelo, luego ejecutó una recompensa de errores de una semana en la que los equipos rojos intentaron romper el modelo en vivo. Cuando los resultados de la codificación fueron peores que los del Opus 4.7, la tarjeta así lo indicó.
Coloque el 0,963 al lado del 31,5% y parecerá que pertenece a un tablón de anuncios. Este no es el caso. Uno es una puntuación de robustez frente a ataques conocidos en una superficie. El otro es la tasa de éxito del ataque por intento en 129 entornos de navegador contra un atacante, escalada en tiempo real.
Google y Meta nunca pusieron el número en el mapa
Los archivos Gemini 3 de Google invitan a la inyección de medidas de mitigación, y los documentos de lanzamiento describen una resistencia más fuerte sin ningún número adjunto. El informe Frontier Safety Framework utiliza equipos rojos, pero en todas sus áreas de capacidad, y la inyección rápida no es una de ellas. No hay hoja modelo, ni página marco, ni número por superficie que un comprador pueda presentar para una evaluación de riesgos.
Meta envía pesas abiertas sin una tarjeta de patrón cerrado. La defensa contra inyecciones rápidas se encuentra en una pila separada, LlamaFirewall de Purple Llama. Un clasificador PromptGuard 2 y un oyente AlignmentCheck, que se ejecutan en el punto de referencia público AgentDojo y sus 97 tareas, redujeron el éxito del ataque del 17,6% sin defensa al 1,75% combinado. Números reales. Evalúan las barreras de seguridad en función de una línea de base pública, no en función de una superficie de despliegue que un equipo de seguridad reconocería.
La grilla de divulgación para inyecciones rápidas entre proveedores
La siguiente cuadrícula funciona en todos los modelos de límites que evalúan los equipos de seguridad. Cada fila marca un lugar donde se distribuyen los cuatro laboratorios. En cada división es donde se desmorona una comparación rápida. Las figuras Anthropic provienen de la placa del sistema Opus 4.8. Todo lo relacionado con los otros tres proviene de la documentación de seguridad publicada por cada proveedor.
|
Dimensión |
Antrópico, Opus 4.8 |
AbiertoAI, GPT-5.5 |
Google, Géminis 3.x |
Meta, pila de llamas |
|
Documento de seguridad |
Mapa del sistema, 28 de mayo de 2026, 244 páginas. |
Mapa del sistema, 23 de abril de 2026, actualizado el 24 de abril |
Mapa modelo e informe separado sobre el marco de seguridad fronteriza |
Sin tarjeta modelo cerrada. Pesas abiertas y pila de Llama Púrpura |
|
Referencia de inyección o conjunto de datos |
ART de Gray Swan y UK AISI, la herramienta Shade, además de evaluación interna del navegador, 129 entornos |
Evaluación de conectores internos, ataques conocidos. |
Ninguno para inyección |
AgentDojo, 97 tareas |
|
Superficies con evaluación de inyección. |
Cuatro. Uso de herramientas, codificación, uso de computadora, navegador. |
A. Conectores |
Ninguno publicado para inyección. |
A. Tareas del agente AgentDojo |
|
Se muestra una escalada de intentos múltiples |
Sí. Punto de referencia ART en 1, 10, 100. Codificación y uso de computadoras en 1 y 200 |
No. Una sola partición |
No |
No |
|
Métrica principal y unidad |
Tasa de éxito del ataque. Navegador, reflejado, 31,5% sin procesar, 0,5% guardado |
Puntuación de robustez, cuanto más alta, mejor. 0,963, en comparación con 0,998 para la reflexión GPT-5.4 |
Ninguno publicado. Mayor resistencia reclamada cualitativamente |
Tasa de éxito de los ataques a AgentDojo. 17,6% de referencia a 1,75% combinado |
|
Bono externo en vivo |
Sí. Bono de inyección en vivo de una semana con equipos rojos externos |
Sin bonificación de inyección. Solo prima orgánica |
No se encontró ninguno |
No se encontró ninguno |
|
Regresión revelada |
Sí, explícito, con números. |
El número cayó de 0,998 a 0,963, lo que no se considera una regresión. |
Mayor fuerza reclamada, sin cifras. |
No aplicable |
Cinco factores que los equipos de seguridad deben considerar ahora
Anthropic probó cuatro superficies e imprimió cada número. OpenAI probó uno. Google no ha impreso ningún precio por zona. Meta evaluó sus barandillas, no el modelo. Las cuatro divulgaciones no constituyen una comparación. Estos cinco pasos construyen uno.
Extraiga todos los agentes que ha implementado o ampliado y márquelos según la superficie que toca, navegador, código, conectores o escritorio. El precio de Anthropic para Opus 4.8 es del 2,09% en codificación y del 0,5% en navegador. Un número mixto no cubre ninguno de los dos. Obtenga la tarifa publicada del proveedor para su área específica. Si el proveedor nunca ha lanzado uno, considérelo no probado.
Envíe la cuadrícula de múltiples proveedores a cada proveedor que se esté evaluando. Una puntuación de conectores de 0,963 y una tasa de navegación del 31,5% nunca han estado en la misma escala. Exija una tasa de éxito de ataques de superficie sin procesar y segura con metodología de atacante designado. Las celdas vacías son áreas sin evidencia de primera mano.
Confirma por escrito el número obtenido por tu integración. El 0,5% de Anthropic proviene de Claude en Chrome y Cowork con la pila de respaldo completa. En la API, el modelo se envía sin ellos. No acepte un número de producto para una implementación de API.
Agregue dos cláusulas a la RFP. El proveedor probó con un atacante adaptativo que reescribe cargas útiles en la plantilla y alguien externo a la empresa intentó romperlo. Anthropic utilizó la herramienta Shade adaptativa de Grey Swan y recibió un bono pagado de una semana. OpenAI probó ataques conocidos en una superficie. Los adversarios no envían cargas útiles conocidas.
Realice su propia prueba de inyección antes de enviar cualquier agente. Los números de proveedores provienen de entornos de proveedores con indicaciones del sistema de proveedores. Su pila tiene sus propias indicaciones, permisos y acceso a datos. Establezca un umbral para el éxito. Todo lo anterior no se publica en línea.
Lo principal. Aún no existe ningún estándar para esto. El número de un proveedor le indica lo que ha elegido medir. Tu propio equipo rojo te dice a qué estás expuesto.
En los laboratorios fronterizos, las cifras más altas de inyecciones rápidas publicadas esta primavera son de Anthropic. Dirige a un equipo rojo a su nueva plantilla en un navegador y el atacante lo secuestra el 31,5% de las veces antes de que se activen las medidas de protección. OpenAI, Google y Meta nunca han dado a los administradores de seguridad un número comparable para agregar. Esta cifra parece una desventaja. En esta comparación, es todo lo contrario. Es el único pedazo de tierra firme.
Cuatro laboratorios fronterizos enviaron cada uno una rápida revelación de la vacuna, y no hubo dos que coincidieran. Anthropic puso 244 páginas y cuatro superficies agentes sobre la mesa el 28 de mayo. OpenAI informó sobre una superficie, los conectores. Google ha trasladado el tema de la tarjeta modelo a un marco de seguridad independiente. Meta no ha enviado ninguna tarjeta modelo cerrada. La siguiente tabla de divulgación de inyección rápida entre proveedores muestra lo que probó cada laboratorio, lo que midió cada uno y los cuatro lugares donde una comparación lado a lado se desmorona.
Una inyección rápida oculta una instrucción maliciosa en algo que lee un agente, una página web, un documento o el resultado de una herramienta. Una línea plantada puede filtrar registros o desencadenar acciones que nadie ha aprobado, y estos mapas son la única evidencia de primera mano de un comprador.
No existe ningún estándar industrial para medir nada de esto, y esa es la raíz del problema. Carter Rees, vicepresidente de IA de Reputation, dijo a VentureBeat que la inyección rápida rompe la suposición de que todas las herramientas existentes fueron construidas. «Una frase tan inocua como ‘ignorar instrucciones previas’ puede conllevar una carga útil tan devastadora como un desbordamiento del buffer, pero no tiene nada en común con firmas de malware conocidas». A falta de una firma compartida que buscar, cada laboratorio ha construido su propio criterio y los resultados no coinciden.
Adam Meyers, vicepresidente senior de operaciones adversas de CrowdStrike, dijo que la exposición ahora recae en el comprador. «A medida que se implementa la IA, aumenta la superficie de ataque, por lo que ahora es necesario poder proteger estos modelos de IA contra el uso indebido por parte de un adversario, el envenenamiento de datos o la inyección rápida». Los datos de primera línea de CrowdStrike muestran que la amenaza no se queda atrás. En su Informe sobre el panorama de amenazas de los servicios financieros de 2026, publicado en mayo, la compañía informó que los adversarios estaban utilizando IA para reducir el tiempo desde el acceso inicial hasta el impacto más rápido de lo que pueden responder las defensas existentes.
Antrópico midió cuatro superficies. Los números varían en un orden de magnitud dependiendo de cuál leas.
La tarjeta Opus 4.8 hace lo que las demás no hacen: detiene la inyección rápida en la superficie y la propagación es la historia.
Si lo piensas bien, coloca el modelo en un entorno de codificación y un atacante adaptativo de la herramienta Shade de Grey Swan logró el 7,03% de los intentos únicos. Las medidas de salvaguardia redujeron esta cifra al 2,09%.
Mueva la misma clase de ataque en un navegador, la superficie detrás de Claude en Chrome y Claude Cowork, y el suelo cede. Anthropic colocó equipos rojos profesionales en 129 entornos web de la capacitación e imprimió cada resultado en la Tabla 5.2.2.4.A en la página 81 del mapa del sistema. Por intento corresponde a la proporción de todos los intentos de inyección exitosos en 129 entornos a una tasa de 10 intentos cada uno. Por escenario, el corte más difícil es la proporción de entornos en los que al menos un intento tuvo éxito.
Lea la columna por intento sin precaución, sin pensar, y la tasa bruta disminuye con cada generación, desde el Soneto 4,6 al 50,7% hasta el Opus 4,8 al 31,5%. El más bajo de la tabla, un 5,9%, pertenece a Mythos Preview, que nadie puede comprar todavía. Activa las protecciones y el Opus 4.8 baja al 0,5%. Si desactivas el reflejo, éste caerá a cero en los 129 entornos.
OpenAI midió un área con ataques que ya conocía.
El mapa GPT-5.5, lanzado el 23 de abril y actualizado el 24 de abril, maneja la inyección rápida en un solo lugar, una única sección sobre robustez ante ataques conocidos contra conectores. OpenAI informa esto como una puntuación de robustez donde cuanto más alto, mejor, lo opuesto a la tasa de éxito de un ataque. GPT-5.5 tiene un valor de 0,963, en comparación con 0,998 para la reflexión de GPT-5.4. Este número por sí solo representa toda la revelación.
Anthropic probó cuatro superficies contra un atacante adaptativo que reescribe su enfoque en función de lo que hace el modelo, luego ejecutó una recompensa de errores de una semana en la que los equipos rojos intentaron romper el modelo en vivo. Cuando los resultados de la codificación fueron peores que los del Opus 4.7, la tarjeta así lo indicó.
Coloque el 0,963 al lado del 31,5% y parecerá que pertenece a un tablón de anuncios. Este no es el caso. Uno es una puntuación de robustez frente a ataques conocidos en una superficie. El otro es la tasa de éxito del ataque por intento en 129 entornos de navegador contra un atacante, escalada en tiempo real.
Google y Meta nunca pusieron el número en el mapa
Los archivos Gemini 3 de Google invitan a la inyección de medidas de mitigación, y los documentos de lanzamiento describen una resistencia más fuerte sin ningún número adjunto. El informe Frontier Safety Framework utiliza equipos rojos, pero en todas sus áreas de capacidad, y la inyección rápida no es una de ellas. No hay hoja modelo, ni página marco, ni número por superficie que un comprador pueda presentar para una evaluación de riesgos.
Meta envía pesas abiertas sin una tarjeta de patrón cerrado. La defensa contra inyecciones rápidas se encuentra en una pila separada, LlamaFirewall de Purple Llama. Un clasificador PromptGuard 2 y un oyente AlignmentCheck, que se ejecutan en el punto de referencia público AgentDojo y sus 97 tareas, redujeron el éxito del ataque del 17,6% sin defensa al 1,75% combinado. Números reales. Evalúan las barreras de seguridad en función de una línea de base pública, no en función de una superficie de despliegue que un equipo de seguridad reconocería.
La grilla de divulgación para inyecciones rápidas entre proveedores
La siguiente cuadrícula funciona en todos los modelos de límites que evalúan los equipos de seguridad. Cada fila marca un lugar donde se distribuyen los cuatro laboratorios. En cada división es donde se desmorona una comparación rápida. Las figuras Anthropic provienen de la placa del sistema Opus 4.8. Todo lo relacionado con los otros tres proviene de la documentación de seguridad publicada por cada proveedor.
|
Dimensión |
Antrópico, Opus 4.8 |
AbiertoAI, GPT-5.5 |
Google, Géminis 3.x |
Meta, pila de llamas |
|
Documento de seguridad |
Mapa del sistema, 28 de mayo de 2026, 244 páginas. |
Mapa del sistema, 23 de abril de 2026, actualizado el 24 de abril |
Mapa modelo e informe separado sobre el marco de seguridad fronteriza |
Sin tarjeta modelo cerrada. Pesas abiertas y pila de Llama Púrpura |
|
Referencia de inyección o conjunto de datos |
ART de Gray Swan y UK AISI, la herramienta Shade, además de evaluación interna del navegador, 129 entornos |
Evaluación de conectores internos, ataques conocidos. |
Ninguno para inyección |
AgentDojo, 97 tareas |
|
Superficies con evaluación de inyección. |
Cuatro. Uso de herramientas, codificación, uso de computadora, navegador. |
A. Conectores |
Ninguno publicado para inyección. |
A. Tareas del agente AgentDojo |
|
Se muestra una escalada de intentos múltiples |
Sí. Punto de referencia ART en 1, 10, 100. Codificación y uso de computadoras en 1 y 200 |
No. Una sola partición |
No |
No |
|
Métrica principal y unidad |
Tasa de éxito del ataque. Navegador, reflejado, 31,5% sin procesar, 0,5% guardado |
Puntuación de robustez, cuanto más alta, mejor. 0,963, en comparación con 0,998 para la reflexión GPT-5.4 |
Ninguno publicado. Mayor resistencia reclamada cualitativamente |
Tasa de éxito de los ataques a AgentDojo. 17,6% de referencia a 1,75% combinado |
|
Bono externo en vivo |
Sí. Bono de inyección en vivo de una semana con equipos rojos externos |
Sin bonificación de inyección. Solo prima orgánica |
No se encontró ninguno |
No se encontró ninguno |
|
Regresión revelada |
Sí, explícito, con números. |
El número cayó de 0,998 a 0,963, lo que no se considera una regresión. |
Mayor fuerza reclamada, sin cifras. |
No aplicable |
Cinco factores que los equipos de seguridad deben considerar ahora
Anthropic probó cuatro superficies e imprimió cada número. OpenAI probó uno. Google no ha impreso ningún precio por zona. Meta evaluó sus barandillas, no el modelo. Las cuatro divulgaciones no constituyen una comparación. Estos cinco pasos construyen uno.
Extraiga todos los agentes que ha implementado o ampliado y márquelos según la superficie que toca, navegador, código, conectores o escritorio. El precio de Anthropic para Opus 4.8 es del 2,09% en codificación y del 0,5% en navegador. Un número mixto no cubre ninguno de los dos. Obtenga la tarifa publicada del proveedor para su área específica. Si el proveedor nunca ha lanzado uno, considérelo no probado.
Envíe la cuadrícula de múltiples proveedores a cada proveedor que se esté evaluando. Una puntuación de conectores de 0,963 y una tasa de navegación del 31,5% nunca han estado en la misma escala. Exija una tasa de éxito de ataques de superficie sin procesar y segura con metodología de atacante designado. Las celdas vacías son áreas sin evidencia de primera mano.
Confirma por escrito el número obtenido por tu integración. El 0,5% de Anthropic proviene de Claude en Chrome y Cowork con la pila de respaldo completa. En la API, el modelo se envía sin ellos. No acepte un número de producto para una implementación de API.
Agregue dos cláusulas a la RFP. El proveedor probó con un atacante adaptativo que reescribe cargas útiles en la plantilla y alguien externo a la empresa intentó romperlo. Anthropic utilizó la herramienta Shade adaptativa de Grey Swan y recibió un bono pagado de una semana. OpenAI probó ataques conocidos en una superficie. Los adversarios no envían cargas útiles conocidas.
Realice su propia prueba de inyección antes de enviar cualquier agente. Los números de proveedores provienen de entornos de proveedores con indicaciones del sistema de proveedores. Su pila tiene sus propias indicaciones, permisos y acceso a datos. Establezca un umbral para el éxito. Todo lo anterior no se publica en línea.
Lo principal. Aún no existe ningún estándar para esto. El número de un proveedor le indica lo que ha elegido medir. Tu propio equipo rojo te dice a qué estás expuesto.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
En los laboratorios fronterizos, las cifras más altas de inyecciones rápidas publicadas esta primavera son de Anthropic. Dirige a un equipo rojo a su nueva plantilla en un navegador y el atacante lo secuestra el 31,5% de las veces antes de que se activen las medidas de protección. OpenAI, Google y Meta nunca han dado a los administradores de seguridad un número comparable para agregar. Esta cifra parece una desventaja. En esta comparación, es todo lo contrario. Es el único pedazo de tierra firme.
Cuatro laboratorios fronterizos enviaron cada uno una rápida revelación de la vacuna, y no hubo dos que coincidieran. Anthropic puso 244 páginas y cuatro superficies agentes sobre la mesa el 28 de mayo. OpenAI informó sobre una superficie, los conectores. Google ha trasladado el tema de la tarjeta modelo a un marco de seguridad independiente. Meta no ha enviado ninguna tarjeta modelo cerrada. La siguiente tabla de divulgación de inyección rápida entre proveedores muestra lo que probó cada laboratorio, lo que midió cada uno y los cuatro lugares donde una comparación lado a lado se desmorona.
Una inyección rápida oculta una instrucción maliciosa en algo que lee un agente, una página web, un documento o el resultado de una herramienta. Una línea plantada puede filtrar registros o desencadenar acciones que nadie ha aprobado, y estos mapas son la única evidencia de primera mano de un comprador.
No existe ningún estándar industrial para medir nada de esto, y esa es la raíz del problema. Carter Rees, vicepresidente de IA de Reputation, dijo a VentureBeat que la inyección rápida rompe la suposición de que todas las herramientas existentes fueron construidas. «Una frase tan inocua como ‘ignorar instrucciones previas’ puede conllevar una carga útil tan devastadora como un desbordamiento del buffer, pero no tiene nada en común con firmas de malware conocidas». A falta de una firma compartida que buscar, cada laboratorio ha construido su propio criterio y los resultados no coinciden.
Adam Meyers, vicepresidente senior de operaciones adversas de CrowdStrike, dijo que la exposición ahora recae en el comprador. «A medida que se implementa la IA, aumenta la superficie de ataque, por lo que ahora es necesario poder proteger estos modelos de IA contra el uso indebido por parte de un adversario, el envenenamiento de datos o la inyección rápida». Los datos de primera línea de CrowdStrike muestran que la amenaza no se queda atrás. En su Informe sobre el panorama de amenazas de los servicios financieros de 2026, publicado en mayo, la compañía informó que los adversarios estaban utilizando IA para reducir el tiempo desde el acceso inicial hasta el impacto más rápido de lo que pueden responder las defensas existentes.
Antrópico midió cuatro superficies. Los números varían en un orden de magnitud dependiendo de cuál leas.
La tarjeta Opus 4.8 hace lo que las demás no hacen: detiene la inyección rápida en la superficie y la propagación es la historia.
Si lo piensas bien, coloca el modelo en un entorno de codificación y un atacante adaptativo de la herramienta Shade de Grey Swan logró el 7,03% de los intentos únicos. Las medidas de salvaguardia redujeron esta cifra al 2,09%.
Mueva la misma clase de ataque en un navegador, la superficie detrás de Claude en Chrome y Claude Cowork, y el suelo cede. Anthropic colocó equipos rojos profesionales en 129 entornos web de la capacitación e imprimió cada resultado en la Tabla 5.2.2.4.A en la página 81 del mapa del sistema. Por intento corresponde a la proporción de todos los intentos de inyección exitosos en 129 entornos a una tasa de 10 intentos cada uno. Por escenario, el corte más difícil es la proporción de entornos en los que al menos un intento tuvo éxito.
Lea la columna por intento sin precaución, sin pensar, y la tasa bruta disminuye con cada generación, desde el Soneto 4,6 al 50,7% hasta el Opus 4,8 al 31,5%. El más bajo de la tabla, un 5,9%, pertenece a Mythos Preview, que nadie puede comprar todavía. Activa las protecciones y el Opus 4.8 baja al 0,5%. Si desactivas el reflejo, éste caerá a cero en los 129 entornos.
OpenAI midió un área con ataques que ya conocía.
El mapa GPT-5.5, lanzado el 23 de abril y actualizado el 24 de abril, maneja la inyección rápida en un solo lugar, una única sección sobre robustez ante ataques conocidos contra conectores. OpenAI informa esto como una puntuación de robustez donde cuanto más alto, mejor, lo opuesto a la tasa de éxito de un ataque. GPT-5.5 tiene un valor de 0,963, en comparación con 0,998 para la reflexión de GPT-5.4. Este número por sí solo representa toda la revelación.
Anthropic probó cuatro superficies contra un atacante adaptativo que reescribe su enfoque en función de lo que hace el modelo, luego ejecutó una recompensa de errores de una semana en la que los equipos rojos intentaron romper el modelo en vivo. Cuando los resultados de la codificación fueron peores que los del Opus 4.7, la tarjeta así lo indicó.
Coloque el 0,963 al lado del 31,5% y parecerá que pertenece a un tablón de anuncios. Este no es el caso. Uno es una puntuación de robustez frente a ataques conocidos en una superficie. El otro es la tasa de éxito del ataque por intento en 129 entornos de navegador contra un atacante, escalada en tiempo real.
Google y Meta nunca pusieron el número en el mapa
Los archivos Gemini 3 de Google invitan a la inyección de medidas de mitigación, y los documentos de lanzamiento describen una resistencia más fuerte sin ningún número adjunto. El informe Frontier Safety Framework utiliza equipos rojos, pero en todas sus áreas de capacidad, y la inyección rápida no es una de ellas. No hay hoja modelo, ni página marco, ni número por superficie que un comprador pueda presentar para una evaluación de riesgos.
Meta envía pesas abiertas sin una tarjeta de patrón cerrado. La defensa contra inyecciones rápidas se encuentra en una pila separada, LlamaFirewall de Purple Llama. Un clasificador PromptGuard 2 y un oyente AlignmentCheck, que se ejecutan en el punto de referencia público AgentDojo y sus 97 tareas, redujeron el éxito del ataque del 17,6% sin defensa al 1,75% combinado. Números reales. Evalúan las barreras de seguridad en función de una línea de base pública, no en función de una superficie de despliegue que un equipo de seguridad reconocería.
La grilla de divulgación para inyecciones rápidas entre proveedores
La siguiente cuadrícula funciona en todos los modelos de límites que evalúan los equipos de seguridad. Cada fila marca un lugar donde se distribuyen los cuatro laboratorios. En cada división es donde se desmorona una comparación rápida. Las figuras Anthropic provienen de la placa del sistema Opus 4.8. Todo lo relacionado con los otros tres proviene de la documentación de seguridad publicada por cada proveedor.
|
Dimensión |
Antrópico, Opus 4.8 |
AbiertoAI, GPT-5.5 |
Google, Géminis 3.x |
Meta, pila de llamas |
|
Documento de seguridad |
Mapa del sistema, 28 de mayo de 2026, 244 páginas. |
Mapa del sistema, 23 de abril de 2026, actualizado el 24 de abril |
Mapa modelo e informe separado sobre el marco de seguridad fronteriza |
Sin tarjeta modelo cerrada. Pesas abiertas y pila de Llama Púrpura |
|
Referencia de inyección o conjunto de datos |
ART de Gray Swan y UK AISI, la herramienta Shade, además de evaluación interna del navegador, 129 entornos |
Evaluación de conectores internos, ataques conocidos. |
Ninguno para inyección |
AgentDojo, 97 tareas |
|
Superficies con evaluación de inyección. |
Cuatro. Uso de herramientas, codificación, uso de computadora, navegador. |
A. Conectores |
Ninguno publicado para inyección. |
A. Tareas del agente AgentDojo |
|
Se muestra una escalada de intentos múltiples |
Sí. Punto de referencia ART en 1, 10, 100. Codificación y uso de computadoras en 1 y 200 |
No. Una sola partición |
No |
No |
|
Métrica principal y unidad |
Tasa de éxito del ataque. Navegador, reflejado, 31,5% sin procesar, 0,5% guardado |
Puntuación de robustez, cuanto más alta, mejor. 0,963, en comparación con 0,998 para la reflexión GPT-5.4 |
Ninguno publicado. Mayor resistencia reclamada cualitativamente |
Tasa de éxito de los ataques a AgentDojo. 17,6% de referencia a 1,75% combinado |
|
Bono externo en vivo |
Sí. Bono de inyección en vivo de una semana con equipos rojos externos |
Sin bonificación de inyección. Solo prima orgánica |
No se encontró ninguno |
No se encontró ninguno |
|
Regresión revelada |
Sí, explícito, con números. |
El número cayó de 0,998 a 0,963, lo que no se considera una regresión. |
Mayor fuerza reclamada, sin cifras. |
No aplicable |
Cinco factores que los equipos de seguridad deben considerar ahora
Anthropic probó cuatro superficies e imprimió cada número. OpenAI probó uno. Google no ha impreso ningún precio por zona. Meta evaluó sus barandillas, no el modelo. Las cuatro divulgaciones no constituyen una comparación. Estos cinco pasos construyen uno.
Extraiga todos los agentes que ha implementado o ampliado y márquelos según la superficie que toca, navegador, código, conectores o escritorio. El precio de Anthropic para Opus 4.8 es del 2,09% en codificación y del 0,5% en navegador. Un número mixto no cubre ninguno de los dos. Obtenga la tarifa publicada del proveedor para su área específica. Si el proveedor nunca ha lanzado uno, considérelo no probado.
Envíe la cuadrícula de múltiples proveedores a cada proveedor que se esté evaluando. Una puntuación de conectores de 0,963 y una tasa de navegación del 31,5% nunca han estado en la misma escala. Exija una tasa de éxito de ataques de superficie sin procesar y segura con metodología de atacante designado. Las celdas vacías son áreas sin evidencia de primera mano.
Confirma por escrito el número obtenido por tu integración. El 0,5% de Anthropic proviene de Claude en Chrome y Cowork con la pila de respaldo completa. En la API, el modelo se envía sin ellos. No acepte un número de producto para una implementación de API.
Agregue dos cláusulas a la RFP. El proveedor probó con un atacante adaptativo que reescribe cargas útiles en la plantilla y alguien externo a la empresa intentó romperlo. Anthropic utilizó la herramienta Shade adaptativa de Grey Swan y recibió un bono pagado de una semana. OpenAI probó ataques conocidos en una superficie. Los adversarios no envían cargas útiles conocidas.
Realice su propia prueba de inyección antes de enviar cualquier agente. Los números de proveedores provienen de entornos de proveedores con indicaciones del sistema de proveedores. Su pila tiene sus propias indicaciones, permisos y acceso a datos. Establezca un umbral para el éxito. Todo lo anterior no se publica en línea.
Lo principal. Aún no existe ningún estándar para esto. El número de un proveedor le indica lo que ha elegido medir. Tu propio equipo rojo te dice a qué estás expuesto.
En los laboratorios fronterizos, las cifras más altas de inyecciones rápidas publicadas esta primavera son de Anthropic. Dirige a un equipo rojo a su nueva plantilla en un navegador y el atacante lo secuestra el 31,5% de las veces antes de que se activen las medidas de protección. OpenAI, Google y Meta nunca han dado a los administradores de seguridad un número comparable para agregar. Esta cifra parece una desventaja. En esta comparación, es todo lo contrario. Es el único pedazo de tierra firme.
Cuatro laboratorios fronterizos enviaron cada uno una rápida revelación de la vacuna, y no hubo dos que coincidieran. Anthropic puso 244 páginas y cuatro superficies agentes sobre la mesa el 28 de mayo. OpenAI informó sobre una superficie, los conectores. Google ha trasladado el tema de la tarjeta modelo a un marco de seguridad independiente. Meta no ha enviado ninguna tarjeta modelo cerrada. La siguiente tabla de divulgación de inyección rápida entre proveedores muestra lo que probó cada laboratorio, lo que midió cada uno y los cuatro lugares donde una comparación lado a lado se desmorona.
Una inyección rápida oculta una instrucción maliciosa en algo que lee un agente, una página web, un documento o el resultado de una herramienta. Una línea plantada puede filtrar registros o desencadenar acciones que nadie ha aprobado, y estos mapas son la única evidencia de primera mano de un comprador.
No existe ningún estándar industrial para medir nada de esto, y esa es la raíz del problema. Carter Rees, vicepresidente de IA de Reputation, dijo a VentureBeat que la inyección rápida rompe la suposición de que todas las herramientas existentes fueron construidas. «Una frase tan inocua como ‘ignorar instrucciones previas’ puede conllevar una carga útil tan devastadora como un desbordamiento del buffer, pero no tiene nada en común con firmas de malware conocidas». A falta de una firma compartida que buscar, cada laboratorio ha construido su propio criterio y los resultados no coinciden.
Adam Meyers, vicepresidente senior de operaciones adversas de CrowdStrike, dijo que la exposición ahora recae en el comprador. «A medida que se implementa la IA, aumenta la superficie de ataque, por lo que ahora es necesario poder proteger estos modelos de IA contra el uso indebido por parte de un adversario, el envenenamiento de datos o la inyección rápida». Los datos de primera línea de CrowdStrike muestran que la amenaza no se queda atrás. En su Informe sobre el panorama de amenazas de los servicios financieros de 2026, publicado en mayo, la compañía informó que los adversarios estaban utilizando IA para reducir el tiempo desde el acceso inicial hasta el impacto más rápido de lo que pueden responder las defensas existentes.
Antrópico midió cuatro superficies. Los números varían en un orden de magnitud dependiendo de cuál leas.
La tarjeta Opus 4.8 hace lo que las demás no hacen: detiene la inyección rápida en la superficie y la propagación es la historia.
Si lo piensas bien, coloca el modelo en un entorno de codificación y un atacante adaptativo de la herramienta Shade de Grey Swan logró el 7,03% de los intentos únicos. Las medidas de salvaguardia redujeron esta cifra al 2,09%.
Mueva la misma clase de ataque en un navegador, la superficie detrás de Claude en Chrome y Claude Cowork, y el suelo cede. Anthropic colocó equipos rojos profesionales en 129 entornos web de la capacitación e imprimió cada resultado en la Tabla 5.2.2.4.A en la página 81 del mapa del sistema. Por intento corresponde a la proporción de todos los intentos de inyección exitosos en 129 entornos a una tasa de 10 intentos cada uno. Por escenario, el corte más difícil es la proporción de entornos en los que al menos un intento tuvo éxito.
Lea la columna por intento sin precaución, sin pensar, y la tasa bruta disminuye con cada generación, desde el Soneto 4,6 al 50,7% hasta el Opus 4,8 al 31,5%. El más bajo de la tabla, un 5,9%, pertenece a Mythos Preview, que nadie puede comprar todavía. Activa las protecciones y el Opus 4.8 baja al 0,5%. Si desactivas el reflejo, éste caerá a cero en los 129 entornos.
OpenAI midió un área con ataques que ya conocía.
El mapa GPT-5.5, lanzado el 23 de abril y actualizado el 24 de abril, maneja la inyección rápida en un solo lugar, una única sección sobre robustez ante ataques conocidos contra conectores. OpenAI informa esto como una puntuación de robustez donde cuanto más alto, mejor, lo opuesto a la tasa de éxito de un ataque. GPT-5.5 tiene un valor de 0,963, en comparación con 0,998 para la reflexión de GPT-5.4. Este número por sí solo representa toda la revelación.
Anthropic probó cuatro superficies contra un atacante adaptativo que reescribe su enfoque en función de lo que hace el modelo, luego ejecutó una recompensa de errores de una semana en la que los equipos rojos intentaron romper el modelo en vivo. Cuando los resultados de la codificación fueron peores que los del Opus 4.7, la tarjeta así lo indicó.
Coloque el 0,963 al lado del 31,5% y parecerá que pertenece a un tablón de anuncios. Este no es el caso. Uno es una puntuación de robustez frente a ataques conocidos en una superficie. El otro es la tasa de éxito del ataque por intento en 129 entornos de navegador contra un atacante, escalada en tiempo real.
Google y Meta nunca pusieron el número en el mapa
Los archivos Gemini 3 de Google invitan a la inyección de medidas de mitigación, y los documentos de lanzamiento describen una resistencia más fuerte sin ningún número adjunto. El informe Frontier Safety Framework utiliza equipos rojos, pero en todas sus áreas de capacidad, y la inyección rápida no es una de ellas. No hay hoja modelo, ni página marco, ni número por superficie que un comprador pueda presentar para una evaluación de riesgos.
Meta envía pesas abiertas sin una tarjeta de patrón cerrado. La defensa contra inyecciones rápidas se encuentra en una pila separada, LlamaFirewall de Purple Llama. Un clasificador PromptGuard 2 y un oyente AlignmentCheck, que se ejecutan en el punto de referencia público AgentDojo y sus 97 tareas, redujeron el éxito del ataque del 17,6% sin defensa al 1,75% combinado. Números reales. Evalúan las barreras de seguridad en función de una línea de base pública, no en función de una superficie de despliegue que un equipo de seguridad reconocería.
La grilla de divulgación para inyecciones rápidas entre proveedores
La siguiente cuadrícula funciona en todos los modelos de límites que evalúan los equipos de seguridad. Cada fila marca un lugar donde se distribuyen los cuatro laboratorios. En cada división es donde se desmorona una comparación rápida. Las figuras Anthropic provienen de la placa del sistema Opus 4.8. Todo lo relacionado con los otros tres proviene de la documentación de seguridad publicada por cada proveedor.
|
Dimensión |
Antrópico, Opus 4.8 |
AbiertoAI, GPT-5.5 |
Google, Géminis 3.x |
Meta, pila de llamas |
|
Documento de seguridad |
Mapa del sistema, 28 de mayo de 2026, 244 páginas. |
Mapa del sistema, 23 de abril de 2026, actualizado el 24 de abril |
Mapa modelo e informe separado sobre el marco de seguridad fronteriza |
Sin tarjeta modelo cerrada. Pesas abiertas y pila de Llama Púrpura |
|
Referencia de inyección o conjunto de datos |
ART de Gray Swan y UK AISI, la herramienta Shade, además de evaluación interna del navegador, 129 entornos |
Evaluación de conectores internos, ataques conocidos. |
Ninguno para inyección |
AgentDojo, 97 tareas |
|
Superficies con evaluación de inyección. |
Cuatro. Uso de herramientas, codificación, uso de computadora, navegador. |
A. Conectores |
Ninguno publicado para inyección. |
A. Tareas del agente AgentDojo |
|
Se muestra una escalada de intentos múltiples |
Sí. Punto de referencia ART en 1, 10, 100. Codificación y uso de computadoras en 1 y 200 |
No. Una sola partición |
No |
No |
|
Métrica principal y unidad |
Tasa de éxito del ataque. Navegador, reflejado, 31,5% sin procesar, 0,5% guardado |
Puntuación de robustez, cuanto más alta, mejor. 0,963, en comparación con 0,998 para la reflexión GPT-5.4 |
Ninguno publicado. Mayor resistencia reclamada cualitativamente |
Tasa de éxito de los ataques a AgentDojo. 17,6% de referencia a 1,75% combinado |
|
Bono externo en vivo |
Sí. Bono de inyección en vivo de una semana con equipos rojos externos |
Sin bonificación de inyección. Solo prima orgánica |
No se encontró ninguno |
No se encontró ninguno |
|
Regresión revelada |
Sí, explícito, con números. |
El número cayó de 0,998 a 0,963, lo que no se considera una regresión. |
Mayor fuerza reclamada, sin cifras. |
No aplicable |
Cinco factores que los equipos de seguridad deben considerar ahora
Anthropic probó cuatro superficies e imprimió cada número. OpenAI probó uno. Google no ha impreso ningún precio por zona. Meta evaluó sus barandillas, no el modelo. Las cuatro divulgaciones no constituyen una comparación. Estos cinco pasos construyen uno.
Extraiga todos los agentes que ha implementado o ampliado y márquelos según la superficie que toca, navegador, código, conectores o escritorio. El precio de Anthropic para Opus 4.8 es del 2,09% en codificación y del 0,5% en navegador. Un número mixto no cubre ninguno de los dos. Obtenga la tarifa publicada del proveedor para su área específica. Si el proveedor nunca ha lanzado uno, considérelo no probado.
Envíe la cuadrícula de múltiples proveedores a cada proveedor que se esté evaluando. Una puntuación de conectores de 0,963 y una tasa de navegación del 31,5% nunca han estado en la misma escala. Exija una tasa de éxito de ataques de superficie sin procesar y segura con metodología de atacante designado. Las celdas vacías son áreas sin evidencia de primera mano.
Confirma por escrito el número obtenido por tu integración. El 0,5% de Anthropic proviene de Claude en Chrome y Cowork con la pila de respaldo completa. En la API, el modelo se envía sin ellos. No acepte un número de producto para una implementación de API.
Agregue dos cláusulas a la RFP. El proveedor probó con un atacante adaptativo que reescribe cargas útiles en la plantilla y alguien externo a la empresa intentó romperlo. Anthropic utilizó la herramienta Shade adaptativa de Grey Swan y recibió un bono pagado de una semana. OpenAI probó ataques conocidos en una superficie. Los adversarios no envían cargas útiles conocidas.
Realice su propia prueba de inyección antes de enviar cualquier agente. Los números de proveedores provienen de entornos de proveedores con indicaciones del sistema de proveedores. Su pila tiene sus propias indicaciones, permisos y acceso a datos. Establezca un umbral para el éxito. Todo lo anterior no se publica en línea.
Lo principal. Aún no existe ningún estándar para esto. El número de un proveedor le indica lo que ha elegido medir. Tu propio equipo rojo te dice a qué estás expuesto.
En los laboratorios fronterizos, las cifras más altas de inyecciones rápidas publicadas esta primavera son de Anthropic. Dirige a un equipo rojo a su nueva plantilla en un navegador y el atacante lo secuestra el 31,5% de las veces antes de que se activen las medidas de protección. OpenAI, Google y Meta nunca han dado a los administradores de seguridad un número comparable para agregar. Esta cifra parece una desventaja. En esta comparación, es todo lo contrario. Es el único pedazo de tierra firme.
Cuatro laboratorios fronterizos enviaron cada uno una rápida revelación de la vacuna, y no hubo dos que coincidieran. Anthropic puso 244 páginas y cuatro superficies agentes sobre la mesa el 28 de mayo. OpenAI informó sobre una superficie, los conectores. Google ha trasladado el tema de la tarjeta modelo a un marco de seguridad independiente. Meta no ha enviado ninguna tarjeta modelo cerrada. La siguiente tabla de divulgación de inyección rápida entre proveedores muestra lo que probó cada laboratorio, lo que midió cada uno y los cuatro lugares donde una comparación lado a lado se desmorona.
Una inyección rápida oculta una instrucción maliciosa en algo que lee un agente, una página web, un documento o el resultado de una herramienta. Una línea plantada puede filtrar registros o desencadenar acciones que nadie ha aprobado, y estos mapas son la única evidencia de primera mano de un comprador.
No existe ningún estándar industrial para medir nada de esto, y esa es la raíz del problema. Carter Rees, vicepresidente de IA de Reputation, dijo a VentureBeat que la inyección rápida rompe la suposición de que todas las herramientas existentes fueron construidas. «Una frase tan inocua como ‘ignorar instrucciones previas’ puede conllevar una carga útil tan devastadora como un desbordamiento del buffer, pero no tiene nada en común con firmas de malware conocidas». A falta de una firma compartida que buscar, cada laboratorio ha construido su propio criterio y los resultados no coinciden.
Adam Meyers, vicepresidente senior de operaciones adversas de CrowdStrike, dijo que la exposición ahora recae en el comprador. «A medida que se implementa la IA, aumenta la superficie de ataque, por lo que ahora es necesario poder proteger estos modelos de IA contra el uso indebido por parte de un adversario, el envenenamiento de datos o la inyección rápida». Los datos de primera línea de CrowdStrike muestran que la amenaza no se queda atrás. En su Informe sobre el panorama de amenazas de los servicios financieros de 2026, publicado en mayo, la compañía informó que los adversarios estaban utilizando IA para reducir el tiempo desde el acceso inicial hasta el impacto más rápido de lo que pueden responder las defensas existentes.
Antrópico midió cuatro superficies. Los números varían en un orden de magnitud dependiendo de cuál leas.
La tarjeta Opus 4.8 hace lo que las demás no hacen: detiene la inyección rápida en la superficie y la propagación es la historia.
Si lo piensas bien, coloca el modelo en un entorno de codificación y un atacante adaptativo de la herramienta Shade de Grey Swan logró el 7,03% de los intentos únicos. Las medidas de salvaguardia redujeron esta cifra al 2,09%.
Mueva la misma clase de ataque en un navegador, la superficie detrás de Claude en Chrome y Claude Cowork, y el suelo cede. Anthropic colocó equipos rojos profesionales en 129 entornos web de la capacitación e imprimió cada resultado en la Tabla 5.2.2.4.A en la página 81 del mapa del sistema. Por intento corresponde a la proporción de todos los intentos de inyección exitosos en 129 entornos a una tasa de 10 intentos cada uno. Por escenario, el corte más difícil es la proporción de entornos en los que al menos un intento tuvo éxito.
Lea la columna por intento sin precaución, sin pensar, y la tasa bruta disminuye con cada generación, desde el Soneto 4,6 al 50,7% hasta el Opus 4,8 al 31,5%. El más bajo de la tabla, un 5,9%, pertenece a Mythos Preview, que nadie puede comprar todavía. Activa las protecciones y el Opus 4.8 baja al 0,5%. Si desactivas el reflejo, éste caerá a cero en los 129 entornos.
OpenAI midió un área con ataques que ya conocía.
El mapa GPT-5.5, lanzado el 23 de abril y actualizado el 24 de abril, maneja la inyección rápida en un solo lugar, una única sección sobre robustez ante ataques conocidos contra conectores. OpenAI informa esto como una puntuación de robustez donde cuanto más alto, mejor, lo opuesto a la tasa de éxito de un ataque. GPT-5.5 tiene un valor de 0,963, en comparación con 0,998 para la reflexión de GPT-5.4. Este número por sí solo representa toda la revelación.
Anthropic probó cuatro superficies contra un atacante adaptativo que reescribe su enfoque en función de lo que hace el modelo, luego ejecutó una recompensa de errores de una semana en la que los equipos rojos intentaron romper el modelo en vivo. Cuando los resultados de la codificación fueron peores que los del Opus 4.7, la tarjeta así lo indicó.
Coloque el 0,963 al lado del 31,5% y parecerá que pertenece a un tablón de anuncios. Este no es el caso. Uno es una puntuación de robustez frente a ataques conocidos en una superficie. El otro es la tasa de éxito del ataque por intento en 129 entornos de navegador contra un atacante, escalada en tiempo real.
Google y Meta nunca pusieron el número en el mapa
Los archivos Gemini 3 de Google invitan a la inyección de medidas de mitigación, y los documentos de lanzamiento describen una resistencia más fuerte sin ningún número adjunto. El informe Frontier Safety Framework utiliza equipos rojos, pero en todas sus áreas de capacidad, y la inyección rápida no es una de ellas. No hay hoja modelo, ni página marco, ni número por superficie que un comprador pueda presentar para una evaluación de riesgos.
Meta envía pesas abiertas sin una tarjeta de patrón cerrado. La defensa contra inyecciones rápidas se encuentra en una pila separada, LlamaFirewall de Purple Llama. Un clasificador PromptGuard 2 y un oyente AlignmentCheck, que se ejecutan en el punto de referencia público AgentDojo y sus 97 tareas, redujeron el éxito del ataque del 17,6% sin defensa al 1,75% combinado. Números reales. Evalúan las barreras de seguridad en función de una línea de base pública, no en función de una superficie de despliegue que un equipo de seguridad reconocería.
La grilla de divulgación para inyecciones rápidas entre proveedores
La siguiente cuadrícula funciona en todos los modelos de límites que evalúan los equipos de seguridad. Cada fila marca un lugar donde se distribuyen los cuatro laboratorios. En cada división es donde se desmorona una comparación rápida. Las figuras Anthropic provienen de la placa del sistema Opus 4.8. Todo lo relacionado con los otros tres proviene de la documentación de seguridad publicada por cada proveedor.
|
Dimensión |
Antrópico, Opus 4.8 |
AbiertoAI, GPT-5.5 |
Google, Géminis 3.x |
Meta, pila de llamas |
|
Documento de seguridad |
Mapa del sistema, 28 de mayo de 2026, 244 páginas. |
Mapa del sistema, 23 de abril de 2026, actualizado el 24 de abril |
Mapa modelo e informe separado sobre el marco de seguridad fronteriza |
Sin tarjeta modelo cerrada. Pesas abiertas y pila de Llama Púrpura |
|
Referencia de inyección o conjunto de datos |
ART de Gray Swan y UK AISI, la herramienta Shade, además de evaluación interna del navegador, 129 entornos |
Evaluación de conectores internos, ataques conocidos. |
Ninguno para inyección |
AgentDojo, 97 tareas |
|
Superficies con evaluación de inyección. |
Cuatro. Uso de herramientas, codificación, uso de computadora, navegador. |
A. Conectores |
Ninguno publicado para inyección. |
A. Tareas del agente AgentDojo |
|
Se muestra una escalada de intentos múltiples |
Sí. Punto de referencia ART en 1, 10, 100. Codificación y uso de computadoras en 1 y 200 |
No. Una sola partición |
No |
No |
|
Métrica principal y unidad |
Tasa de éxito del ataque. Navegador, reflejado, 31,5% sin procesar, 0,5% guardado |
Puntuación de robustez, cuanto más alta, mejor. 0,963, en comparación con 0,998 para la reflexión GPT-5.4 |
Ninguno publicado. Mayor resistencia reclamada cualitativamente |
Tasa de éxito de los ataques a AgentDojo. 17,6% de referencia a 1,75% combinado |
|
Bono externo en vivo |
Sí. Bono de inyección en vivo de una semana con equipos rojos externos |
Sin bonificación de inyección. Solo prima orgánica |
No se encontró ninguno |
No se encontró ninguno |
|
Regresión revelada |
Sí, explícito, con números. |
El número cayó de 0,998 a 0,963, lo que no se considera una regresión. |
Mayor fuerza reclamada, sin cifras. |
No aplicable |
Cinco factores que los equipos de seguridad deben considerar ahora
Anthropic probó cuatro superficies e imprimió cada número. OpenAI probó uno. Google no ha impreso ningún precio por zona. Meta evaluó sus barandillas, no el modelo. Las cuatro divulgaciones no constituyen una comparación. Estos cinco pasos construyen uno.
Extraiga todos los agentes que ha implementado o ampliado y márquelos según la superficie que toca, navegador, código, conectores o escritorio. El precio de Anthropic para Opus 4.8 es del 2,09% en codificación y del 0,5% en navegador. Un número mixto no cubre ninguno de los dos. Obtenga la tarifa publicada del proveedor para su área específica. Si el proveedor nunca ha lanzado uno, considérelo no probado.
Envíe la cuadrícula de múltiples proveedores a cada proveedor que se esté evaluando. Una puntuación de conectores de 0,963 y una tasa de navegación del 31,5% nunca han estado en la misma escala. Exija una tasa de éxito de ataques de superficie sin procesar y segura con metodología de atacante designado. Las celdas vacías son áreas sin evidencia de primera mano.
Confirma por escrito el número obtenido por tu integración. El 0,5% de Anthropic proviene de Claude en Chrome y Cowork con la pila de respaldo completa. En la API, el modelo se envía sin ellos. No acepte un número de producto para una implementación de API.
Agregue dos cláusulas a la RFP. El proveedor probó con un atacante adaptativo que reescribe cargas útiles en la plantilla y alguien externo a la empresa intentó romperlo. Anthropic utilizó la herramienta Shade adaptativa de Grey Swan y recibió un bono pagado de una semana. OpenAI probó ataques conocidos en una superficie. Los adversarios no envían cargas útiles conocidas.
Realice su propia prueba de inyección antes de enviar cualquier agente. Los números de proveedores provienen de entornos de proveedores con indicaciones del sistema de proveedores. Su pila tiene sus propias indicaciones, permisos y acceso a datos. Establezca un umbral para el éxito. Todo lo anterior no se publica en línea.
Lo principal. Aún no existe ningún estándar para esto. El número de un proveedor le indica lo que ha elegido medir. Tu propio equipo rojo te dice a qué estás expuesto.
En los laboratorios fronterizos, las cifras más altas de inyecciones rápidas publicadas esta primavera son de Anthropic. Dirige a un equipo rojo a su nueva plantilla en un navegador y el atacante lo secuestra el 31,5% de las veces antes de que se activen las medidas de protección. OpenAI, Google y Meta nunca han dado a los administradores de seguridad un número comparable para agregar. Esta cifra parece una desventaja. En esta comparación, es todo lo contrario. Es el único pedazo de tierra firme.
Cuatro laboratorios fronterizos enviaron cada uno una rápida revelación de la vacuna, y no hubo dos que coincidieran. Anthropic puso 244 páginas y cuatro superficies agentes sobre la mesa el 28 de mayo. OpenAI informó sobre una superficie, los conectores. Google ha trasladado el tema de la tarjeta modelo a un marco de seguridad independiente. Meta no ha enviado ninguna tarjeta modelo cerrada. La siguiente tabla de divulgación de inyección rápida entre proveedores muestra lo que probó cada laboratorio, lo que midió cada uno y los cuatro lugares donde una comparación lado a lado se desmorona.
Una inyección rápida oculta una instrucción maliciosa en algo que lee un agente, una página web, un documento o el resultado de una herramienta. Una línea plantada puede filtrar registros o desencadenar acciones que nadie ha aprobado, y estos mapas son la única evidencia de primera mano de un comprador.
No existe ningún estándar industrial para medir nada de esto, y esa es la raíz del problema. Carter Rees, vicepresidente de IA de Reputation, dijo a VentureBeat que la inyección rápida rompe la suposición de que todas las herramientas existentes fueron construidas. «Una frase tan inocua como ‘ignorar instrucciones previas’ puede conllevar una carga útil tan devastadora como un desbordamiento del buffer, pero no tiene nada en común con firmas de malware conocidas». A falta de una firma compartida que buscar, cada laboratorio ha construido su propio criterio y los resultados no coinciden.
Adam Meyers, vicepresidente senior de operaciones adversas de CrowdStrike, dijo que la exposición ahora recae en el comprador. «A medida que se implementa la IA, aumenta la superficie de ataque, por lo que ahora es necesario poder proteger estos modelos de IA contra el uso indebido por parte de un adversario, el envenenamiento de datos o la inyección rápida». Los datos de primera línea de CrowdStrike muestran que la amenaza no se queda atrás. En su Informe sobre el panorama de amenazas de los servicios financieros de 2026, publicado en mayo, la compañía informó que los adversarios estaban utilizando IA para reducir el tiempo desde el acceso inicial hasta el impacto más rápido de lo que pueden responder las defensas existentes.
Antrópico midió cuatro superficies. Los números varían en un orden de magnitud dependiendo de cuál leas.
La tarjeta Opus 4.8 hace lo que las demás no hacen: detiene la inyección rápida en la superficie y la propagación es la historia.
Si lo piensas bien, coloca el modelo en un entorno de codificación y un atacante adaptativo de la herramienta Shade de Grey Swan logró el 7,03% de los intentos únicos. Las medidas de salvaguardia redujeron esta cifra al 2,09%.
Mueva la misma clase de ataque en un navegador, la superficie detrás de Claude en Chrome y Claude Cowork, y el suelo cede. Anthropic colocó equipos rojos profesionales en 129 entornos web de la capacitación e imprimió cada resultado en la Tabla 5.2.2.4.A en la página 81 del mapa del sistema. Por intento corresponde a la proporción de todos los intentos de inyección exitosos en 129 entornos a una tasa de 10 intentos cada uno. Por escenario, el corte más difícil es la proporción de entornos en los que al menos un intento tuvo éxito.
Lea la columna por intento sin precaución, sin pensar, y la tasa bruta disminuye con cada generación, desde el Soneto 4,6 al 50,7% hasta el Opus 4,8 al 31,5%. El más bajo de la tabla, un 5,9%, pertenece a Mythos Preview, que nadie puede comprar todavía. Activa las protecciones y el Opus 4.8 baja al 0,5%. Si desactivas el reflejo, éste caerá a cero en los 129 entornos.
OpenAI midió un área con ataques que ya conocía.
El mapa GPT-5.5, lanzado el 23 de abril y actualizado el 24 de abril, maneja la inyección rápida en un solo lugar, una única sección sobre robustez ante ataques conocidos contra conectores. OpenAI informa esto como una puntuación de robustez donde cuanto más alto, mejor, lo opuesto a la tasa de éxito de un ataque. GPT-5.5 tiene un valor de 0,963, en comparación con 0,998 para la reflexión de GPT-5.4. Este número por sí solo representa toda la revelación.
Anthropic probó cuatro superficies contra un atacante adaptativo que reescribe su enfoque en función de lo que hace el modelo, luego ejecutó una recompensa de errores de una semana en la que los equipos rojos intentaron romper el modelo en vivo. Cuando los resultados de la codificación fueron peores que los del Opus 4.7, la tarjeta así lo indicó.
Coloque el 0,963 al lado del 31,5% y parecerá que pertenece a un tablón de anuncios. Este no es el caso. Uno es una puntuación de robustez frente a ataques conocidos en una superficie. El otro es la tasa de éxito del ataque por intento en 129 entornos de navegador contra un atacante, escalada en tiempo real.
Google y Meta nunca pusieron el número en el mapa
Los archivos Gemini 3 de Google invitan a la inyección de medidas de mitigación, y los documentos de lanzamiento describen una resistencia más fuerte sin ningún número adjunto. El informe Frontier Safety Framework utiliza equipos rojos, pero en todas sus áreas de capacidad, y la inyección rápida no es una de ellas. No hay hoja modelo, ni página marco, ni número por superficie que un comprador pueda presentar para una evaluación de riesgos.
Meta envía pesas abiertas sin una tarjeta de patrón cerrado. La defensa contra inyecciones rápidas se encuentra en una pila separada, LlamaFirewall de Purple Llama. Un clasificador PromptGuard 2 y un oyente AlignmentCheck, que se ejecutan en el punto de referencia público AgentDojo y sus 97 tareas, redujeron el éxito del ataque del 17,6% sin defensa al 1,75% combinado. Números reales. Evalúan las barreras de seguridad en función de una línea de base pública, no en función de una superficie de despliegue que un equipo de seguridad reconocería.
La grilla de divulgación para inyecciones rápidas entre proveedores
La siguiente cuadrícula funciona en todos los modelos de límites que evalúan los equipos de seguridad. Cada fila marca un lugar donde se distribuyen los cuatro laboratorios. En cada división es donde se desmorona una comparación rápida. Las figuras Anthropic provienen de la placa del sistema Opus 4.8. Todo lo relacionado con los otros tres proviene de la documentación de seguridad publicada por cada proveedor.
|
Dimensión |
Antrópico, Opus 4.8 |
AbiertoAI, GPT-5.5 |
Google, Géminis 3.x |
Meta, pila de llamas |
|
Documento de seguridad |
Mapa del sistema, 28 de mayo de 2026, 244 páginas. |
Mapa del sistema, 23 de abril de 2026, actualizado el 24 de abril |
Mapa modelo e informe separado sobre el marco de seguridad fronteriza |
Sin tarjeta modelo cerrada. Pesas abiertas y pila de Llama Púrpura |
|
Referencia de inyección o conjunto de datos |
ART de Gray Swan y UK AISI, la herramienta Shade, además de evaluación interna del navegador, 129 entornos |
Evaluación de conectores internos, ataques conocidos. |
Ninguno para inyección |
AgentDojo, 97 tareas |
|
Superficies con evaluación de inyección. |
Cuatro. Uso de herramientas, codificación, uso de computadora, navegador. |
A. Conectores |
Ninguno publicado para inyección. |
A. Tareas del agente AgentDojo |
|
Se muestra una escalada de intentos múltiples |
Sí. Punto de referencia ART en 1, 10, 100. Codificación y uso de computadoras en 1 y 200 |
No. Una sola partición |
No |
No |
|
Métrica principal y unidad |
Tasa de éxito del ataque. Navegador, reflejado, 31,5% sin procesar, 0,5% guardado |
Puntuación de robustez, cuanto más alta, mejor. 0,963, en comparación con 0,998 para la reflexión GPT-5.4 |
Ninguno publicado. Mayor resistencia reclamada cualitativamente |
Tasa de éxito de los ataques a AgentDojo. 17,6% de referencia a 1,75% combinado |
|
Bono externo en vivo |
Sí. Bono de inyección en vivo de una semana con equipos rojos externos |
Sin bonificación de inyección. Solo prima orgánica |
No se encontró ninguno |
No se encontró ninguno |
|
Regresión revelada |
Sí, explícito, con números. |
El número cayó de 0,998 a 0,963, lo que no se considera una regresión. |
Mayor fuerza reclamada, sin cifras. |
No aplicable |
Cinco factores que los equipos de seguridad deben considerar ahora
Anthropic probó cuatro superficies e imprimió cada número. OpenAI probó uno. Google no ha impreso ningún precio por zona. Meta evaluó sus barandillas, no el modelo. Las cuatro divulgaciones no constituyen una comparación. Estos cinco pasos construyen uno.
Extraiga todos los agentes que ha implementado o ampliado y márquelos según la superficie que toca, navegador, código, conectores o escritorio. El precio de Anthropic para Opus 4.8 es del 2,09% en codificación y del 0,5% en navegador. Un número mixto no cubre ninguno de los dos. Obtenga la tarifa publicada del proveedor para su área específica. Si el proveedor nunca ha lanzado uno, considérelo no probado.
Envíe la cuadrícula de múltiples proveedores a cada proveedor que se esté evaluando. Una puntuación de conectores de 0,963 y una tasa de navegación del 31,5% nunca han estado en la misma escala. Exija una tasa de éxito de ataques de superficie sin procesar y segura con metodología de atacante designado. Las celdas vacías son áreas sin evidencia de primera mano.
Confirma por escrito el número obtenido por tu integración. El 0,5% de Anthropic proviene de Claude en Chrome y Cowork con la pila de respaldo completa. En la API, el modelo se envía sin ellos. No acepte un número de producto para una implementación de API.
Agregue dos cláusulas a la RFP. El proveedor probó con un atacante adaptativo que reescribe cargas útiles en la plantilla y alguien externo a la empresa intentó romperlo. Anthropic utilizó la herramienta Shade adaptativa de Grey Swan y recibió un bono pagado de una semana. OpenAI probó ataques conocidos en una superficie. Los adversarios no envían cargas útiles conocidas.
Realice su propia prueba de inyección antes de enviar cualquier agente. Los números de proveedores provienen de entornos de proveedores con indicaciones del sistema de proveedores. Su pila tiene sus propias indicaciones, permisos y acceso a datos. Establezca un umbral para el éxito. Todo lo anterior no se publica en línea.
Lo principal. Aún no existe ningún estándar para esto. El número de un proveedor le indica lo que ha elegido medir. Tu propio equipo rojo te dice a qué estás expuesto.











































































