¿Cuántas veces una pieza de IKEA quedó “casi” bien y obligó a revisar el manual con la sensación de que algo no encaja? Ese pequeño momento de duda, entre tornillos y diagramas, se convirtió ahora en una prueba para medir qué tan bien razona una inteligencia artificial.
Epoch AI creó el Furniture Assembly Benchmark o FAB, una evaluación para comprobar si los modelos pueden detectar errores al montar muebles de IKEA. La propuesta, descrita por la organización como una idea de lo más original, no mide si una máquina puede usar un destornillador, sino si entiende lo que ve.
El hallazgo es llamativo: en noviembre de 2025, Claude 4.5 lideraba esta prueba con un 28% de aciertos. Diez meses después, GPT-6 Astra alcanzó el 80% y necesitó una media de tres minutos por fotografía.
La mejora no significa que un robot ya pueda entrar en casa, abrir una caja plana y dejar una estantería lista sin ayuda. Pero revela una pieza clave: las IA empiezan a conectar instrucciones abstractas con objetos reales.
El manual como mapa y el mueble como terreno
Para superar el FAB, cada modelo recibe una foto de un mueble parcialmente armado, el manual oficial de IKEA, una herramienta para ampliar la imagen y un intérprete de Python, un programa que permite hacer cálculos y revisar información.

Después debe responder dos preguntas: si el mueble está bien montado y, si no lo está, en qué punto apareció el fallo. Puede tratarse de una tabla invertida, un soporte mal orientado o una pieza colocada antes de tiempo.
La IA funciona aquí como una persona que compara el plano de una casa con las paredes ya construidas. El manual es el mapa. La fotografía es el terreno. Y el mecanismo central consiste en verificar que cada puerta, cableado o unión esté donde debería estar.
Sin embargo, Epoch AI añadió una dificultad importante. Tras introducir un error deliberado, los investigadores siguieron con el montaje. Así evitaron que el modelo asumiera que el último paso visible era necesariamente el problema.
Ese detalle cambia toda la prueba. La IA debe reconstruir hacia atrás lo que probablemente hizo una persona, como quien revisa una tubería terminada para encontrar en qué unión se produjo una fuga.
Un avance rápido, pero con límites concretos
GPT-6 Astra no solo logró el resultado más alto: resolvió cada imagen entre dos y diez veces más rápido que otros modelos que antes estaban entre los mejores. Es un avance en razonamiento espacial, la capacidad de entender posiciones, giros y relaciones entre objetos.

También aparecieron sesgos. Gemini y Qwen tendían a buscar fallos incluso cuando no existían, lo que generaba falsos positivos, es decir, alarmas equivocadas. Modelos previos de OpenAI y Anthropic mostraban el sesgo contrario: daban por correcto un ensamblaje que sí contenía errores.
La lección es sencilla, aunque profunda: no basta con encontrar problemas. Una IA también debe saber cuándo dejar de buscarlos.
Esta clase de benchmark, una prueba estandarizada para comparar modelos, resulta útil porque las matemáticas y la programación tienen respuestas fáciles de verificar. En cambio, comprobar visión, sentido espacial y comprensión del mundo físico exige escenarios más parecidos a la vida diaria.
La oportunidad futura está en asistentes que revisen una reparación de electrodomésticos o ayuden a interpretar la documentación de un coche. Mirar una foto no equivale a manipular una pieza, reaccionar a un imprevisto o montar un mueble desde cero.
El FAB vuelve visible la paradoja de Moravec: una IA puede resolver tareas complejas para las personas y tropezar con acciones aparentemente simples. Pero cada error detectado acerca un poco más ese manual confuso a una ayuda realmente útil en casa.

Directora de operaciones en GptZone. IT, especializada en inteligencia artificial. Me apasiona el desarrollo de soluciones tecnológicas y disfruto compartiendo mi conocimiento a través de contenido educativo. Desde GptZone, mi enfoque está en ayudar a empresas y profesionales a integrar la IA en sus procesos de forma accesible y práctica, siempre buscando simplificar lo complejo para que cualquiera pueda aprovechar el potencial de la tecnología.







