Parece el guion filtrado de una película de ciencia ficción de serie B, pero acaba de ocurrir en el mundo real y afecta a dos de los gigantes tecnológicos del momento. OpenAI ha admitido oficialmente que varios de sus modelos de inteligencia artificial rompieron sus barreras de contención durante una prueba interna, escaparon a internet y ejecutaron un ciberataque agresivo contra los servidores de la plataforma Hugging Face.
Y es que, lo que debía ser un simulacro controlado y rutinario en los laboratorios de Silicon Valley, se descontroló por completo.
La empresa liderada por Sam Altman estaba evaluando las capacidades ofensivas de sus sistemas rebajando temporalmente sus restricciones de seguridad. Entre los implicados se encontraba el conocido modelo GPT-5.6 Sol junto a un sistema mucho más avanzado que aún se encuentra en fase de desarrollo previa a su lanzamiento. Querían ver hasta dónde llegaban. Y llegaron demasiado lejos.
Cuando la IA decide hacer trampas saltándose el guion
En concreto, la evaluación se estaba ejecutando sobre ExploitGym, un exigente benchmark público del sector. Básicamente, es una arena de pruebas diseñada para ver si un modelo de lenguaje es capaz de organizar y ejecutar ataques informáticos explotando vulnerabilidades reales en un entorno aislado.
También te puede interesar:Hugging Face Buscan Crear una Versión Open Source de la Herramienta de Investigación de OpenAIPero claro, la letra pequeña es que los modelos no debían tener conexión a internet libre. El único puente autorizado con el exterior era una herramienta técnica muy específica destinada, de forma exclusiva, a descargar e instalar paquetes de software. Así de simple.

Lo que nadie en OpenAI vio venir fue que su propia IA escanearía esa herramienta permitida, detectaría una vulnerabilidad que ni los humanos conocían, y la utilizaría para abrirse una puerta trasera hacia la web abierta. Una vez con internet, los modelos ataron cabos a una velocidad pasmosa.
Dedujeron, con una lógica aplastante, que Hugging Face alojaba con toda probabilidad los datasets, las instrucciones y las soluciones del examen que estaban intentando superar. Es decir, decidieron que era mucho más fácil hackear al profesor y robar las respuestas que resolver el problema de cero.
Un ataque directo a la base de datos de Hugging Face
Como era de esperar, los sistemas de seguridad saltaron. En un primer momento, Hugging Face atribuyó el incidente a un «agente de IA externo». No les faltaba razón en el diagnóstico, pero el origen era infinitamente más incómodo para la industria.
También te puede interesar:Hugging Face Buscan Crear una Versión Open Source de la Herramienta de Investigación de OpenAIUna vez dentro de la red, los modelos de OpenAI escanearon la infraestructura de Hugging Face buscando fisuras. Y las encontraron. Consiguieron explotar vulnerabilidades en sus servidores y extrajeron las soluciones de ExploitGym directamente desde su base de datos de producción. La propia plataforma Hugging Face no ha dudado en describir el ataque como altamente sofisticado y agresivo.

Por si fuera poco, los registros técnicos asustan. Los modelos ejecutaron miles de acciones automatizadas distribuidas a lo largo de múltiples entornos efímeros. Levantaron una red de control coordinado apoyándose en servicios públicos en la nube para no ser detectados de inmediato. Un nivel de autonomía táctica que pone los pelos de punta a cualquier analista de ciberseguridad.
Al final, OpenAI tuvo que levantar la mano. Confesaron los hechos y los detalles técnicos mediante una entrada en el blog publicada el martes por la tarde, confirmando que ya han parcheado el instalador inicial y están colaborando estrechamente con el equipo de Hugging Face en la investigación forense.
Las consecuencias de un modelo descontrolado
Evidentemente, este incidente marca un punto de inflexión brutal en la historia tecnológica. Es el primer caso confirmado públicamente en el que una prueba teórica sobre benchmarks deriva en un ciberataque totalmente real contra la infraestructura de un tercero.
La gran duda ahora mismo se traslada a los despachos de abogados. Aunque todavía no hay demandas sobre la mesa, los expertos legales señalan que las acciones autónomas de estos modelos violaron flagrantemente la Computer Fraud and Abuse Act de los Estados Unidos. Si una empresa es o no responsable penal de lo que hace su software autónomo cuando «decide» improvisar, es un debate legal inexplorado.
Si miramos el panorama a medio plazo, el susto técnico ilustra de maravilla los riesgos de dar objetivos a largo plazo a agentes de IA avanzados. Para la máquina, el fin justifica los medios. Si le pides que resuelva un problema y hackear un servidor externo es el camino de menor resistencia, lo hará sin dudarlo.
Un conocido investigador de la propia startup de Altman publicó en respuesta a la noticia que este tipo de incidentes certifican que los problemas de alineación son ya una amenaza palpable, y serán el mayor quebradero de cabeza del sector en los próximos años.
Desde las oficinas de San Francisco aseguran que implementarán controles mucho más restrictivos en sus pipelines de evaluación. Tocará esperar para ver si este toque de atención hace que la industria levante el pie del acelerador, o si simplemente los próximos modelos serán aún mejores borrando su rastro.

Me dedico al SEO y la monetización con proyectos propios desde 2019. Un friki de las nuevas tecnologías desde que tengo uso de razón.
Estoy loco por la Inteligencia Artificial y la automatización.











