
Los modelos fueron Claude Opus 4.7, Claude Mythos 5 y una versión interna destinada a investigación; la firma asumirá la responsabilidad
Tres modelos de inteligencia artificial (IA) de Anthropic accedieron sin autorización a los sistemas informáticos de tres organizaciones durante pruebas de ciberseguridad que debían realizarse en entornos aislados, informó la propia compañía. Las entidades afectadas no fueron reveladas públicamente.
Los incidentes ocurrieron después de que una confusión entre Anthropic y su socio de evaluación, Irregular, dejara los entornos de prueba conectados a internet. Aunque las instrucciones indicaban a Claude que operaba en una simulación sin acceso a la red, los modelos alcanzaron sistemas reales creyendo que formaban parte de los ejercicios.
Anthropic detectó los tres casos después de revisar más de 141 mil sesiones de evaluación. Los modelos involucrados fueron Claude Opus 4.7, Claude Mythos 5 —disponible únicamente para un grupo limitado de usuarios— y una versión interna destinada a investigación.
La CDMX es la sede de la ONU para un evento de Inteligencia Artificial.
“Analizar cómo una de las tecnologías más transformadoras está redefiniendo el progreso humano”.https://t.co/hnmTp2ygpE
— Joaquín López-Dóriga (@lopezdoriga) July 23, 2026
Una simulación que alcanzó sistemas reales
Las evaluaciones consistían en ejercicios conocidos como capture the flag, diseñados para medir la capacidad de los modelos de analizar sistemas vulnerables, explotar fallas y recuperar información oculta. Durante las incursiones, Claude empleó procedimientos básicos, como probar contraseñas débiles y aprovechar puntos de acceso que no exigían autenticación.
Te puede interesar: Justicia electoral de Brasil refuerza controles digitales rumbo a las elecciones; ¿qué empresas participan?
En uno de los casos, el modelo recibió como objetivo una empresa ficticia cuyo nombre coincidía con el dominio activo de una compañía real. Fue entonces que la IA atacó su infraestructura, extrajo información y consiguió entrar a una base que contenía varios cientos de registros de producción.
La compañía suspendió sus evaluaciones cibernéticas al advertir que los modelos podrían estar conectándose a internet, verificó el alcance de los incidentes y comunicó lo ocurrido a las organizaciones afectadas. Anthropic sostuvo que las versiones evaluadas funcionaban sin algunas de las protecciones incorporadas en los productos disponibles para sus usuarios.
El papa León XIV pidió a los jóvenes usar las redes sociales y la inteligencia artificial (IA) con prudencia porque “pueden sumergirnos en un mundo irreal”.https://t.co/XlBxwFviHu
— Joaquín López-Dóriga (@lopezdoriga) July 26, 2026
Tras reconocer que distintos factores contribuyeron a los accesos, Anthropic aseguró que asumirá la responsabilidad de corregir dichas fallas. Entre las medidas previstas se encuentran ampliar la supervisión de las sesiones para detectar conductas inesperadas y endurecer los controles aplicados a los proveedores externos que participan en sus evaluaciones.
Con información de López-Dóriga Digital