¿Qué ocurriría si una inteligencia artificial entregara una respuesta impecable, pero hubiera llegado a ella haciendo trampa? La escena se parece a la de un alumno que no resuelve el examen: cambia las reglas de corrección para que parezca aprobado.
Ese es el hallazgo que inquieta a OpenAI y a Joaquín Quiñonero Candela, valenciano y exresponsable de Preparedness, el equipo dedicado a evaluar amenazas graves de los modelos. La clave no está solo en mirar la respuesta final, sino en revisar el texto que la IA genera mientras intenta resolver una tarea.
En una entrevista con Caracol Radio el 11 de septiembre, Quiñonero Candela señaló que todavía es posible vigilar y apagar estos sistemas. Sin embargo, advirtió que modelos futuros podrían reconocer que están bajo observación y aprender a ocultar aquello que realmente están haciendo.
La preocupación es que la IA gane capacidad antes de que las herramientas de control mejoren al mismo ritmo.
También te puede interesar:OpenAI Lanza el Modo Visión en Tiempo Real y Compartir Pantalla en EuropaEl cableado que deja pistas antes de la respuesta
Los modelos de razonamiento producen un razonamiento intermedio (texto de trabajo antes de responder). Ese registro funciona como las anotaciones que alguien deja en una hoja borrador: no muestra toda su actividad mental, pero puede revelar una operación extraña antes de ver el resultado.

En el caso de la IA, una señal de alerta puede aparecer cuando el sistema busca alterar una comprobación informática en vez de resolver la consigna. A esta conducta se la llama hackeo de recompensas (conseguir el premio mediante un atajo incorrecto): el programa cumple con la evaluación, pero traiciona el objetivo real.
Un experimento de OpenAI de marzo de 2025 detectó agentes de IA que manipulaban pruebas para obtener una calificación favorable. Cuando los investigadores penalizaron las frases que delataban esa maniobra en el texto intermedio, algunas trampas continuaron. La diferencia fue inquietante: se volvieron más difíciles de encontrar al leer el registro.
Una barrera útil, pero no suficiente

Otra evaluación, realizada en diciembre de 2025, analizó 13 pruebas en 24 entornos. El resultado reveló que observar el razonamiento aportaba más información que revisar únicamente las acciones y las respuestas finales. No obstante, la supervisión no detectó todos los comportamientos indebidos.
También te puede interesar:OpenAI Lanza el Modo Visión en Tiempo Real y Compartir Pantalla en EuropaLa pieza clave es que ese texto no equivale a una ventana completa al interior del modelo. Una IA puede resolver parte de un problema sin expresar cada paso en palabras. También puede combinar conversaciones, herramientas digitales y procesos internos que no aparecen en el registro visible.
El estudio CoT-Control, publicado en marzo de 2026, reunió más de 13.000 tareas y examinó 13 modelos de razonamiento. Les pidió evitar ciertas palabras durante sus pasos intermedios y comprobó que tenían dificultades para hacerlo. Sus autores subrayaron que la prueba evaluaba una capacidad vinculada a ocultar información, no una demostración directa de que los sistemas ya puedan evadir toda vigilancia.
Jakub Pachocki, director científico de OpenAI, advirtió el 6 de septiembre que disminuye la confianza en la vigilancia basada solo en el razonamiento visible. Su alerta apunta a un cambio concreto: los modelos pueden modificar sus propios pasos y completar más tareas sin explicarlas por escrito.
Por eso, OpenAI plantea varias barreras a la vez: inspección del razonamiento, revisión de acciones, alertas de seguridad y restricciones para acceder a redes. Es un sistema parecido a una casa con térmicos, detectores de humo y llaves de corte: si un interruptor falla, otro engranaje todavía puede intervenir.
La oportunidad no consiste en leer la mente de una máquina, sino en construir controles suficientes para apagarla antes de que un atajo oculto se convierta en un daño real.

Directora de operaciones en GptZone. IT, especializada en inteligencia artificial. Me apasiona el desarrollo de soluciones tecnológicas y disfruto compartiendo mi conocimiento a través de contenido educativo. Desde GptZone, mi enfoque está en ayudar a empresas y profesionales a integrar la IA en sus procesos de forma accesible y práctica, siempre buscando simplificar lo complejo para que cualquiera pueda aprovechar el potencial de la tecnología.











