Un equipo de investigadores ha utilizado el modelo Claude para hackear las cuentas de los propios empleados de OpenAI explotando un simple fallo en su foro de ayuda. Una ironía digna de una película.
Y es que no hablamos de un ataque teórico de manual, sino de una infiltración real que permitió acceder a repositorios privados y sistemas internos. La firma de ciberseguridad Hacktron ha demostrado que las defensas tradicionales ya no sirven cuando el atacante tiene un LLM de su lado. Es el clásico juego del gato persiguiendo al ratón, pero ejecutado a la velocidad de la luz.
Una imagen inofensiva y un desastre inminente
Todo este caos se originó en un lugar que quizás hayas visitado si te interesa la inteligencia artificial: community.openai.com. El popular foro de la compañía, basado en la conocida arquitectura de Discourse, escondía una bomba de relojería en la forma en que procesaba las imágenes. Nadie en la industria se había dado cuenta de la brecha. Hasta ahora.

Básicamente, el problema radicaba en el formato de los archivos. Cuando un usuario subía una imagen en formato HEIF, el sistema de verificación habitual de Discourse, conocido como FastImage, ni se inmutaba. Simplemente no está programado para entender ese estándar moderno de alta eficiencia. ¿Qué hacía el foro entonces? Pasarle la patata caliente a ImageMagick, una gigantesca navaja suiza de procesamiento gráfico.
También te puede interesar:OpenAI Lanza el Modo Visión en Tiempo Real y Compartir Pantalla en EuropaPero claro, aquí es donde la cadena de errores técnicos se vuelve catastrófica. Resulta que ImageMagick dependía de una biblioteca externa mal parcheada un año atrás para decodificar esos archivos. Al procesar una imagen manipulada, el sistema sufría un desbordamiento de búfer en la memoria dinámica. Es decir, permitía a un atacante leer y escribir datos fuera de los límites de seguridad establecidos por el servidor.
Claude Opus se pone el sombrero negro
En concreto, aquí es donde la historia se pone realmente interesante para los que seguimos el software de cerca. Los chicos de Hacktron no escribieron el código malicioso picando teclas durante semanas en un sótano. Pusieron a Claude Opus 4.8 a analizar el código fuente y fue el propio modelo quien identificó la vulnerabilidad de la biblioteca. Un fallo grave que, por cierto, nunca se documentó como una corrección de seguridad en su día.

Evidentemente, encontrar la puerta trasera es solo la mitad del trabajo. Tras un primer intento fallido donde el exploit inicial generado por la IA no logró saltarse las estrictas protecciones de seguridad de Discourse, los investigadores sacaron la artillería pesada. Actualizaron su flujo de trabajo al potente Claude Opus 5 y le pidieron que refinara el vector de ataque para evitar hacer saltar las alarmas del sistema.
En apenas cuatro horas, la IA generó un código funcional capaz de ejecutarse de forma remota al subir la imagen maldita. Así de simple.
También te puede interesar:OpenAI Lanza el Modo Visión en Tiempo Real y Compartir Pantalla en EuropaAcceso total al corazón de OpenAI
Si miramos las consecuencias del ataque, la gravedad del asunto pone los pelos de punta. En poquísimo tiempo, el agente autónomo logró ejecutar código remoto en el servidor principal y extraer información vital leyendo el archivo /etc/hosts. Pero los especialistas no se detuvieron en una simple demostración de fuerza teórica. Utilizaron esta brecha abierta para secuestrar cuentas de ChatGPT y Codex que pertenecían a los mismísimos ingenieros de OpenAI.
A ello se le suma el terrorífico efecto dominó que tienen estas integraciones hoy en día. El equipo demostró hasta dónde podía llegar el desastre asegurando la cuenta de un empleado que tenía su Codex vinculado directamente al GitHub corporativo. Con ese nivel de permisos, lograron crear un pull request en un repositorio privado de la empresa. Habían entrado hasta el comedor de la casa sin hacer ruido.
El reloj corre en contra de los defensores
El alcance potencial de este fallo es un dolor de cabeza enorme. Durante al menos dos meses antes de este informe, cualquier usuario o trabajador que iniciara sesión en ese foro de soporte estuvo expuesto. Y teniendo en cuenta que herramientas como ChatGPT se integran a diario con Slack o correos electrónicos, el robo de datos podría haber sido masivo y silencioso.
Como era de esperar, OpenAI no se quedó de brazos cruzados. Tras recibir el aviso urgente de los investigadores, la compañía parcheó la vulnerabilidad de sus servidores en menos de catorce horas. Una respuesta técnica bastante rápida, sin duda. Pero que no oculta el verdadero problema sistémico que tenemos por delante en la red.
Y es que toda esta operación ofensiva, desde el descubrimiento del fallo fantasma hasta la toma de control de los repositorios internos, requirió menos de 72 horas. La velocidad de iteración de un atacante asistido por IA ha roto por completo los tiempos de la seguridad tradicional. Las defensas estáticas ya no son suficientes ante agentes que aprenden, se adaptan y reescriben exploits sobre la marcha. La pelota está ahora en el tejado de los equipos de defensa, y veremos si logran seguir este ritmo infernal.

Me dedico al SEO y la monetización con proyectos propios desde 2019. Un friki de las nuevas tecnologías desde que tengo uso de razón.
Estoy loco por la Inteligencia Artificial y la automatización.











