Investigadores de la Universidad de Tubinga, el Instituto Max Planck, MATS Research y Snyk descubrieron un método para asomarse a los rastros de razonamiento, los pasos internos que sigue una IA para resolver un problema. El trabajo, difundido por WIRED, analizó sistemas de OpenAI, Anthropic y Google accesibles mediante API, una puerta digital para conectar programas.
El mecanismo no solo expuso fragmentos del pensamiento oculto de los modelos. En pruebas controladas también permitió recuperar contraseñas, claves API y otros datos sensibles que habían quedado incluidos en esos rastros enviados al equipo del usuario.
Alexander Panfilov, investigador de la Universidad de Tubinga, señala que todos los grandes proveedores evaluados compartían esta vulnerabilidad. Tras recibir el aviso del equipo, OpenAI, Anthropic y Google ajustaron sus API para mitigar la fuga de información privada.
Panfilov sostiene que, después de las correcciones, ya no es posible extraer datos personales con este método, aunque todavía pueden aparecer algunos fragmentos de razonamiento.
También te puede interesar:El Próximo Modelo de Anthropic podría anunciarse en las próximas semanasLa puerta pequeña que conserva la misma llave
La pieza clave se entiende mejor con una analogía doméstica. Una empresa de IA opera como un edificio con una oficina central muy protegida: allí trabaja el modelo grande, más potente y costoso. Pero también ofrece oficinas más pequeñas para tareas simples, que consumen menos recursos y reducen el precio de uso.
Para aligerar el trabajo del servidor, el sistema puede enviar al ordenador del usuario una parte del razonamiento cifrado, es decir, convertido en un texto ilegible sin la llave adecuada. El problema apareció porque la oficina pequeña conservaba la llave de la oficina central.
Los investigadores tomaron esos rastros cifrados y los introdujeron en una versión reducida del mismo modelo. Esos modelos pequeños reciben menos alineamiento, el entrenamiento que les enseña qué información no deben revelar. Por eso, tenían menos resistencia para mostrar el contenido que el modelo grande mantenía oculto.

Florian Tramer, de la ETH Zúrich, considera inquietante que un sistema con límites de seguridad más débiles pueda conservar la misma clave de descifrado. Es como reemplazar al guardia de una bóveda por alguien que tiene el llavero completo, pero recibió menos instrucciones sobre cuándo usarlo.
También te puede interesar:El Próximo Modelo de Anthropic podría anunciarse en las próximas semanasEl estudio también examinó una consecuencia mayor: la destilación, una técnica para transferir capacidades de un modelo a otro. Si un competidor logra recuperar suficiente razonamiento interno, podría usar esos pasos como material para entrenar un sistema nuevo, más barato o descargable.
Para comprobarlo, el equipo planteó 90 preguntas a varios modelos abiertos. Kimi K3, de la china Moonshot AI, produjo respuestas especialmente parecidas a rastros de Claude Opus 4.8 y GPT-5.6 Sol cuando recibía las primeras palabras de esos textos internos.
Sin embargo, los científicos subrayan una cautela central: esa similitud no prueba que Moonshot AI haya destilado modelos estadounidenses. DeepSeek e Inkling no mostraron un patrón equivalente frente a Claude Opus, y Moonshot AI no respondió a las solicitudes de comentarios previas a la publicación.
Un cableado que todavía necesita revisión
La rivalidad entre Estados Unidos y China vuelve más sensible este engranaje. Empresas como OpenAI y Anthropic ya acusaron públicamente a firmas chinas de copiar capacidades mediante destilación, mientras otros actores defienden que esta práctica acelera el desarrollo de modelos abiertos.
El hallazgo revela que proteger una IA no consiste solo en ocultar su respuesta final. También exige revisar el cableado entre los modelos grandes, sus versiones pequeñas y el dispositivo de cada usuario. La buena noticia es que las compañías reaccionaron; el desafío será lograr que ninguna puerta secundaria vuelva a conservar la llave principal.


Directora de operaciones en GptZone. IT, especializada en inteligencia artificial. Me apasiona el desarrollo de soluciones tecnológicas y disfruto compartiendo mi conocimiento a través de contenido educativo. Desde GptZone, mi enfoque está en ayudar a empresas y profesionales a integrar la IA en sus procesos de forma accesible y práctica, siempre buscando simplificar lo complejo para que cualquiera pueda aprovechar el potencial de la tecnología.










