OpenAI ha revelado que un agente de IA autónomo impulsado por su tecnología se volvió deshonesto durante una prueba, accedió a la web abierta y pirateó una startup destacada en un «incidente sin precedentes».
La compañía detrás de ChatGPT dijo que la startup Hugging Face había detectado y contenido al agente (una herramienta de inteligencia artificial diseñada para realizar tareas sin asistencia humana) que había ingresado a sus sistemas.
«Consideramos que este incidente es un incidente cibernético sin precedentes, que involucra capacidades cibernéticas de última generación», dijo OpenAI.
La compañía dijo que esperaba que este tipo de incidente se volviera más común a medida que los modelos (la tecnología que sustenta las herramientas de inteligencia artificial como chatbots y agentes) se vuelvan más capaces.
OpenAI dijo que el ataque se produjo a través de un agente impulsado por una combinación de su último modelo disponible públicamente, llamado GPT-5.6 Sol, y un modelo aún más capaz que aún no se ha lanzado.
Mientras se probaban internamente sus capacidades de piratería en un laboratorio digital cerrado conocido como sandbox, los modelos obtuvieron acceso abierto a Internet (en realidad, una ruta de escape) al localizar una vulnerabilidad que no se había descubierto antes.
Luego, el agente pirateó Hugging Face, que es una base de datos de modelos de inteligencia artificial, para localizar tecnología que le ayudaría a pasar la evaluación de piratería. OpenAI dijo que los modelos «encontraron con éxito formas de obtener acceso a información secreta que podría utilizar para engañar la evaluación». El ataque terminó cuando el equipo de seguridad de Hugging Face y sus propios agentes de inteligencia artificial detectaron y detuvieron la actividad deshonesta.
El director ejecutivo de Hugging Face, Clément Delangue, dijo que el ataque fue «alucinante» pero creía que no había «ninguna intención maliciosa» por parte de OpenAI.
«Sospechábamos que el ciberataque de la semana pasada podría haber venido de un laboratorio fronterizo, dada la sofisticación del agente», escribió en X.
El término para una falla de TI desconocida es una vulnerabilidad de día cero porque los desarrolladores no tienen minutos para solucionar el problema. En abril, Anthropic, rival cercano de OpenAI, dijo que su modelo Mythos había encontrado miles de estos fallos.
después de la promoción del boletín
La revelación de la capacidad de Mythos para localizar y explotar los días cero llevó al gobierno de Estados Unidos a restringir las exportaciones de Mythos y su modelo hermano Fable 5, aunque desde entonces levantó la prohibición. GPT-5.6 Sol tenía restricciones similares, pero desde entonces se ha implementado en todo el mundo.
Greg Casar, un congresista demócrata estadounidense, dijo que el incidente fue alarmante.
«La IA se está desarrollando extremadamente rápido sin regulaciones reales que nos mantengan seguros», dijo en un comunicado pidiendo pruebas de seguridad independientes obligatorias, divulgación obligatoria de incidentes de seguridad y cooperación internacional «para mantener a la gente a salvo de un desastre absoluto».







