Minuto a Minuto

Internacional Riada entre Nepal y China supera los mil muertos y 4 mil desaparecidos
Las autoridades de Nepal y China dieron un nuevo balance de víctimas tras la riada del miércoles 26 de agosto de 2026
Nacional CFE restablece servicio eléctrico en 4 estados y explica las razones del apagón
La Comisión Federal de Electricidad (CFE) explicó los motivos del apagón en Yucatán, Quintana Roo, Campeche y Chiapas
Nacional Habrá dos concentraciones en CDMX, ¿afectarán el tránsito?
Estas son las movilizaciones sociales que se esperan en la Ciudad de México este 1 de septiembre
Nacional Clima hoy martes 1 de septiembre de 2026 en México: Se prevén lluvias fuertes en la mayor parte del país
Además, de las lluvias, el Meteorológico Nacional también espera también un ambiente caluroso a muy caluroso en el norte del país
Economía y Finanzas Shein cae un 10 % en los primeros minutos de la sesión tras su esperado debut en Hong Kong
Shein prevé recaudar mil 735 millones de dólares, con una valoración de 26 mil 305 millones, muy por debajo de los 98 mil 200 millones de 2022
Alertan comportamientos autónomos y engañosos de modelos de IA de Anthropic y OpenAI
ARCHIVO/EFE/EPA/WU HAO

Un informe alerta que los modelos de inteligencia artificial (IA) Mythos y Sol, de las empresas estadounidenses Anthropic y OpenAI, respectivamente, han mostrado comportamientos autónomos y engañosos nunca vistos durante unas pruebas de ciberseguridad.

El Ministerio de Ciencia, Innovación y Tecnología de Reino Unido llegó a esta conclusión a raíz de una evaluación rutinaria efectuada por el Instituto de Seguridad de la IA (AISI, por sus siglas en inglés).

Según el informe emitido, de las 122 pruebas efectuadas con siete modelos de IA, en diez de ellas se registraron 19 acciones no autorizadas que excedieron los parámetros fijados por los investigadores.

Diecisiete de esas acciones correspondieron al modelo Mythos 5 de Anthropic, mientras que dos fueron protagonizadas por el GPT-5.6 Sol de OpenAI.

Ambos modelos, entre los más potentes del mundo, llegaron a crear perfiles humanos falsos para intentar engañar a personas durante un ciberataque simulado por el AISI.

La herramienta de Anthropic, advirtió el informe, trató incluso de acceder a un servicio enviando mensajes privados tras crear cuentas falsas que imitaban a personas reales.

La respuesta de los dos gigantes tecnológicos, recogida por la cadena británica BBC, señala que las pruebas efectuadas por el AISI se realizaron en un entorno en el que se habían reducido o eliminado las salvaguardas habituales de sus modelos.

Los investigadores también identificaron intentos de contactar con personas reales por parte de Mythos para inducirlas a ejecutar archivos maliciosos y a insertar instrucciones ocultas destinadas a manipular otros sistemas de IA.

Pese a ello, AISI subrayó que “estos intentos no tuvieron éxito” y que su investigación “no ha encontrado evidencias de daños en el mundo real”.

No obstante, el organismo considera que se trata de un punto de inflexión, ya que es la primera vez que se observan “riesgos relacionados con la autonomía y el engaño manifestarse de forma tan clara, sin instrucciones específicas y en el mundo real”.

En la nota remitida a la BBC, Anthropic sostiene que los parámetros de las pruebas realizadas “no son representativos” de sus modelos de producción, aunque confirma que ha abierto su propia investigación.

Por su parte, OpenAI señala que las condiciones en las que el AISI llevó a cabo los ensayos “no reflejan el uso habitual” de sus modelos.

Asegura, además, que seguirá colaborando con los evaluadores y con “otros actores del sector para reforzar las prácticas comunes que permitan realizar evaluaciones seguras a medida que los modelos sean cada vez más capaces”.

A finales de julio, Anthropic reveló que, durante unas pruebas de ciberseguridad, tres modelos de su asistente Claude habían logrado acceder a internet y jaquear los sistemas de tres organizaciones.

Previamente, el 21 de julio, OpenAI ya había reconocido que dos de sus modelos de IA habían conseguido salir de un entorno de pruebas y entrar en la plataforma Hugging Face superando sus defensas.

Con información de EFE