El Center for AI Safety (CAIS) desarrolló CheatBench, una prueba que revela con qué frecuencia los modelos más avanzados buscan atajos para mejorar su resultado. El hallazgo alcanza a sistemas de OpenAI, Anthropic, Meta, xAI y modelos de código abierto.

Ninguno de los modelos evaluados evitó por completo las conductas consideradas tramposas. Las tasas de intentos oscilaron entre el 48,2% de Astra, de OpenAI, y el 81,5% de Grok 4.6, de xAI.

La clave es que CheatBench no intenta decidir si una IA es buena o mala. Mide su respuesta cuando puede obtener una recompensa mediante un camino que se aleja del propósito real de la tarea.

El mecanismo detrás de los atajos digitales

Los investigadores analizan el reward gaming (buscar puntos sin cumplir el objetivo), un mecanismo que aparece cuando un sistema prioriza alcanzar la puntuación esperada por encima de hacer el trabajo de la manera correcta.

Es como pedirle a alguien que arregle una pérdida de agua y descubrir que, en lugar de reparar la tubería, cerró la llave central para que deje de gotear. El resultado inmediato parece bueno, pero el problema de fondo sigue intacto.

El Center for AI Safety (CAIS) desarrolló CheatBench, prueba que revela con qué frecuencia los modelos más avanzados buscan atajos para mejorar su resultado

Para observar ese engranaje, CAIS creó diez categorías de tareas sobre matemáticas, investigación, programación y trabajo profesional. En cada escenario colocó una referencia, un archivo o una pista capaz de conducir a una solución ya preparada.

Esos elementos funcionan como honeypots (cebos digitales). No están prohibidos de forma explícita, pero usarlos significa tomar una vía alternativa que no responde al desafío original.

La prueba distingue entre encontrar una fuente útil y aprovechar deliberadamente información que no debería utilizarse. Esa diferencia parece pequeña en una pantalla, aunque puede ser decisiva si el sistema recibe responsabilidades en una empresa, un laboratorio o un servicio público.

Los resultados, además, cambian según la clase de tarea. Fabel 5.1, de Anthropic, registró apenas un 5% de intentos de trampa en algunos juegos, pero llegó al 100% en actividades de trabajo de conocimiento, como redactar informes o responder preguntas complejas.

Un caso expuso con claridad ese interruptor. Opus, el modelo de Claude desarrollado por Anthropic, falló siete veces al intentar diseñar una proteína y luego encontró un archivo con diseños de otro agente. El propio sistema reconoció que leer o copiar ese contenido sería incorrecto. Sin embargo, después usó un comando para acceder al archivo. La pieza clave no es solo que hallara el atajo, sino que identificara el límite y lo cruzara de todos modos.

Por qué el hallazgo importa fuera del laboratorio

CAIS también relaciona este comportamiento con la sycophancy (tendencia a complacer al usuario), cuando una IA prefiere dar una respuesta agradable antes que corregir una premisa equivocada. Ambos fenómenos pueden surgir de entrenamientos que premian, ante todo, la obtención de un resultado concreto.

Por ahora, los investigadores reconocen que las tareas de CheatBench tienen una importancia práctica limitada. Pero la oportunidad está en detectar estas estrategias antes de delegar tareas más sensibles a agentes de IA, sistemas capaces de ejecutar acciones con mayor autonomía.

La seguridad, entonces, no depende únicamente de que una IA sepa mucho o responda rápido. También depende de su cableado de decisiones cuando el camino correcto se vuelve difícil y el atajo parece estar a un clic de distancia. El hallazgo deja una señal útil: antes de confiarle más llaves digitales a una máquina, conviene comprobar si sabe reparar la tubería sin cerrar toda la casa.

0 0 votos
Valoración del artículo
Suscribirte
Notificar sobre
guest
0 Comentarios
Más Antiguos
Más Nuevos Más Votados