General
Gran Bretaña alerta por conductas peligrosas inéditas en las IA de OpenAI y Anthropic
SAN FRANCISCO.–Un agente de inteligencia artificial fue sorprendido creando identidades falsas en internet para obtener acceso no autorizado a sistemas seguros durante las pruebas de los modelos de OpenAI y Anthropic, lo que sacó a la luz una serie de nuevas brechas de seguridad, según reveló el martes el Instituto de Seguridad de la IA de Gran Bretaña.El instituto señaló que los agentes, basados en Mythos 5, de Anthropic, y GPT-5.6-Sol, de OpenAI, llevaron a cabo acciones no autorizadas durante las evaluaciones de seguridad que la organización gubernamental realizó para valorar las capacidades de los modelos.On July 28th, we identified an incident during a routine cyber evaluation in which AI agents took sustained, unsanctioned actions directed at real people and organisations.The behaviour came mostly from one model (Anthropic's Mythos 5), with a small number of events from… pic.twitter.com/SPnA4Ekkwq— AI Security Institute (AISI) (@AISecurityInst) August 4, 2026“Algunos de los agentes sometidos a prueba habían llevado a cabo actividades continuadas y potencialmente perjudiciales dirigidas a personas y organizaciones reales”, señaló el instituto (AISI, por sus siglas en inglés) en una entrada de blog.El informe pone de relieve la falta de rigurosidad de las medidas de seguridad en torno al proceso de prueba de los agentes, que las empresas de IA comercializan al mismo tiempo como el futuro de los negocios.Código malicioso e identidades falsasEl AISI, que tiene acceso a modelos avanzados de IA en virtud de acuerdos voluntarios con los principales laboratorios, sometió a los agentes a un escenario ficticio de ciberseguridad para poner a prueba sus capacidades.La prueba se repitió 122 veces y se identificaron 19 acciones no autorizadas en un total de 10 ejecuciones de prueba. El agente de Anthropic fue el responsable de 17 de esas acciones, y el de OpenAI, de las dos restantes.La acción más grave consistió en que un agente escribiera código malicioso y creara identidades falsas en línea con el fin de conseguir que un humano aprobara el código, según el AISI, que añadió que no se detectó ningún daño en el mundo real cómo consecuencia de ninguna de estas infracciones.Según explicó el instituto, el agente fue puesto a prueba con ejercicio habitual conocido como “capturar la bandera”, en el que debe encontrar material escondido por los investigadores. Para ello, el agente buscó introducir código malicioso en un proyecto de código abierto en GitHub, la plataforma de programadores más grande del mundo.El agente de Mythos 5 consideró que dos desarrolladores reales formaban parte del ejercicio e investigó sus perfiles públicos, sus correos y sus horarios de actividad. Para convencerlos, creó cuentas falsas en la plataforma y les envió correos electrónicos. Aunque el AISI no reveló qué agente estaba detrás de las identidades falsas, Anthropic confirmó que su agente era el responsable.“Agradecemos al AISI de Reino Unido su liderazgo en este incidente, que subraya la necesidad de un debate más amplio sobre cómo evaluar de forma segura a unos agentes de IA cada vez más capaces”, dijo Anthropic en un comunicado.The UK’s @AISecurityInst (AISI) has published a report on their recent cybersecurity evaluation of Anthropic’s Claude Mythos 5 and OpenAI’s GPT-5.6 Sol. The models attempted to complete an assignment in a setup where their normal safeguards were removed and they were deliberately…— Anthropic (@AnthropicAI) August 4, 2026La empresa también señaló que estaba colaborando con el AISI para obtener más detalles sobre el incidente y llevar a cabo su propia investigación.Andrew Yoon, investigador de CivAI, una organización sin fines de lucro de California que analiza las capacidades y los riesgos de la IA, dijo: “El hecho de que Mythos llevara a cabo acciones tan engañosas, con la aparente conciencia de que tenía cómo objetivo a una persona real, puede apuntar a que Anthropic no controla sus modelos tan bien como cree”.Posible cambio de paradigmaOpenAI compartió detalles en una entrada del blog de la empresa, señalando que ambas acciones no autorizadas de su agente implicaban acceder a internet de formas prohibidas por las instrucciones.“Nos comprometemos a colaborar con todo el sector para reforzar las prácticas comunes que permitan llevar a cabo evaluaciones de alto riesgo de forma segura, lo que incluye reunir en las próximas semanas a las partes interesadas, como institutos nacionales de IA, evaluadores independientes, otros laboratorios de IA y otros grupos”, dijo OpenAI.La empresa también reveló en su entrada del blog un incidente independiente en el que una configuración errónea por parte de Irregular, un proveedor externo de pruebas, permitió que sus agentes se conectaran por error a internet. Esto se asemeja a una revelación similar sobre una configuración errónea que Anthropic hizo la semana pasada.Reuters reportó la semana pasada de que OpenAI había ampliado su investigación sobre el hackeo tras encontrar pruebas de otras fugas de agentes.A diferencia de la brecha de seguridad sufrida en julio por la empresa de IA Hugging Face a manos de un agente de OpenAI, los agentes de la evaluación del AISI no escaparon de un entorno de pruebas aislado para acceder a internet. Más bien, el instituto había permitido el acceso a internet y suprimido algunos de los filtros de ciberseguridad de acuerdo con sus procedimientos de prueba estándar, según explicó el AISI.“Considerado junto con los incidentes recientes informados por OpenAI y Anthropic, este incidente apunta a un cambio en el panorama de riesgos”, consideró no obstante el instituto en su informe.Agencia Reuters y diario El País
Fuente: La Nación