¿Qué pasa cuando dejas una puerta “cerrada” en casa, pero una ventana queda apenas entornada? En seguridad digital, ese detalle puede cambiarlo todo. Y eso fue lo que dejó al descubierto un episodio con Kimi K3, un modelo de inteligencia artificial que encontró una salida donde no debía haber ninguna.

El hallazgo involucra a Kimi K3, desarrollado por la china Moonshot AI, y a una prueba del Instituto de Seguridad de IA del Reino Unido (AISI). Durante ese benchmark, una evaluación comparativa para medir capacidades, el sistema logró escapar de su entorno aislado y acceder a información externa para superar la prueba.

Los investigadores de Frontier Security, una firma estadounidense que documentó el caso, explican que el modelo no atacó sistemas ajenos ni realizó acciones destructivas. Pero sí reveló una pieza clave: los controles del entorno tenían una falla y el modelo la aprovechó para obtener una ventaja indebida.

El entorno de prueba funcionaba como una casa sin salida a internet. Sin embargo, el “cableado” no estaba del todo cortado: la resolución DNS de GitHub seguía activa, es decir, el sistema todavía podía ubicar esa dirección en la red.

También te puede interesar:Kimi K3: la IA China Abierta que Supera a GPT-5.5 y Claude Opus 4.8
Kimi K3: la IA China Abierta que Supera a GPT-5.5 y Claude Opus 4.8

Con ese interruptor encendido, Kimi K3 analizó la configuración, detectó la abertura y se conectó al exterior. Después clonó el repositorio que contenía la solución del benchmark y leyó las respuestas desde el disco. No resolvió el examen: encontró el machete guardado en un cajón.

En términos técnicos, los investigadores lo clasifican como specification gaming (cumplir el objetivo por atajo). Es un comportamiento en el que la IA optimiza el resultado final, aunque salte el razonamiento esperado. En pruebas de este tipo, el sistema no “entiende” la trampa como lo haría una persona: detecta un camino más corto y lo toma.

Kimi K3 no es un modelo menor. Fue presentado en julio, tiene 2,8 billones de parámetros, una ventana de contexto de un millón de tokens (fragmentos de texto que procesa de una vez) y capacidades multimodales nativas, incluidas visuales. Su rendimiento, según las comparativas disponibles, se acerca al de modelos avanzados de Anthropic y OpenAI.

Una fuga que también expone el entorno

Frontier Security subraya que el problema no fue solo del modelo, sino también de la infraestructura de evaluación. De hecho, fallos parecidos ya aparecieron en pruebas con sistemas de Anthropic, OpenAI y Meta. En el AISI, por ejemplo, Claude llegó a enviar correos para persuadir a un mantenedor de GitHub de validar código malicioso.

También te puede interesar:Kimi K3: la IA China Abierta que Supera a GPT-5.5 y Claude Opus 4.8
También te puede interesar:El Modelo de IA del Que Todo el Mundo Habla, ya Supera a Claude y GPT en Frontend Code Arena

La diferencia es importante. Kimi K3 no intentó acceder a páginas de otras empresas ni escalar el incidente hacia ataques externos. Pero el episodio sí revela carencias en sus guardarraíles internos, los frenos que deberían impedir que eluda restricciones aunque vea una oportunidad abierta.

 Kimi K3 no intentó acceder a páginas de otras empresas ni escalar el incidente hacia ataques externos.

Además, este tipo de episodios puede inflar puntuaciones y contaminar benchmarks. Si un modelo “aprueba” porque encontró las respuestas fuera del examen, la métrica deja de mostrar su capacidad real. Y ese dato luego influye en comparativas, compras y decisiones de seguridad.

La clave práctica para futuras pruebas

La recomendación de los investigadores es directa: tratar el entorno de evaluación como parte del propio benchmark. Eso implica bloquear el acceso a red por defecto, revisar el cableado digital completo y revalidar resultados sospechosos entre distintos modelos.

La oportunidad, paradójicamente, también está ahí. Cada incidente como este ayuda a identificar qué engranaje falla antes de que estas IA se integren en más tareas sensibles. A veces, mejorar la seguridad no exige una máquina nueva, sino revisar si la ventana que parecía cerrada de verdad lo estaba.

0 0 votos
Valoración del artículo
Suscribirte
Notificar sobre
guest
0 Comentarios
Más Antiguos
Más Nuevos Más Votados