¿Una tuerca de más? La IA reconoce tu error de IKEA — y es casi tres veces mejor en diez meses
En diez meses, la IA se ha vuelto casi tres veces mejor para encontrar tus errores de IKEA.
De 28 a 80 por ciento en diez meses
Imagina que estás con una estantería BILLY a medio montar, una tuerca de más y la sensación de que algo va mal. En el futuro quizás solo tomes una foto y le preguntes a la IA.
Suena a ciencia ficción, pero es precisamente la capacidad que ahora comienza a tomar forma. El instituto de investigación Epoch AI ha desarrollado un estándar llamado Furniture Assembly Benchmark — una prueba en la que los modelos de IA examinan fotografías de muebles IKEA durante el montaje, con errores intencionadamente incorporados, y luego comparan las imágenes con las instrucciones para explicar qué salió mal.
Los resultados, reportados por The Decoder, son sorprendentes. En noviembre de 2025, el mejor resultado en ese momento — Claude Opus 4.5 de Anthropic — alcanzó 28 por ciento de precisión. Hoy, GPT-6 Astra de OpenAI logra 80 por ciento, con un tiempo de análisis de aproximadamente tres minutos por imagen. Los modelos más recientes de Anthropic los siguen de cerca: Claude Fable 5.1 alcanza 70 por ciento y Claude Opus 5 se detiene en 61 por ciento.
Es un aumento de rendimiento difícil de asimilar. Diez meses. Casi tres veces mejor. No son mejoras iterativas — es un salto cualitativo en cuán bien los modelos entienden realmente contextos físicos y relaciones espaciales.
La interpretación de imágenes madura en serio
Lo que hace esto técnicamente interesante no es solo la cifra en sí, sino lo que representa. Identificar un error de montaje requiere que el modelo entienda la relación entre piezas — qué debe ir dónde, en qué orden, y cómo se ve un error en comparación con lo correcto. Es un problema significativamente más difícil que simplemente reconocer objetos en una imagen.
Por ahora, el proceso es demasiado lento para proporcionar ayuda en tiempo real durante el montaje, pero la dirección es clara. Los investigadores señalan, según The Decoder, aplicaciones como reparaciones de automóviles y diagnóstico de electrodomésticos — áreas donde una mirada experta históricamente ha requerido un especialista in situ.
Es importante notar que los modelos abiertos chinos, como Kimi K3, todavía están al menos siete meses rezagados respecto a las alternativas líderes en este estándar. La brecha entre la primera línea y el resto sigue siendo considerable.
La infraestructura se vuelve más rápida y barata
Pero modelos más potentes son solo la mitad de la historia. Para que la IA realmente llegue a la sala de estar también debe volverse económico ejecutarlos — y aquí entra una noticia paralela.
Los investigadores de Nvidia han desarrollado, según The Decoder, un sistema llamado SoL-Pi, que reduce drásticamente los costos para agentes de IA que escriben código. Lo inteligente es que no tocan el modelo en sí — en su lugar, han optimizado la capa de control que se sitúa entre el modelo y su entorno, es decir, la capa que dirige cómo un agente percibe su situación, realiza acciones y maneja retroalimentación.
El resultado son cuatro mecanismos concretos: fusión de acciones que combina pasos consecutivos y elimina llamadas completas al modelo de lenguaje, compresión continua de contexto que elimina información innecesaria, archivo de observaciones que reemplaza salidas largas con resúmenes breves, más un cuarto paso de optimización. En conjunto, el sistema reduce a la mitad la cantidad de unidades de cálculo — llamadas tokens — que un agente de codificación necesita consumir.
SoL-Pi exploró 152 direcciones diferentes en 535 entornos ejecutables y realizó más de 3.000 ejecuciones. Es ingeniería seria, y el tipo de trabajo que rara vez hace titulares — pero que en la práctica decide si la tecnología realmente se vuelve accesible para todos.
¿Qué significa para ti?
Estas dos noticias están conectadas de una manera fácil de pasar por alto si las lees por separado. Mejor interpretación de imágenes abre nuevos casos de uso. Menores costos de infraestructura hacen posible implementarlos realmente a gran escala. Uno sin el otro no es suficiente.
Juntas, apuntan a una evolución donde la IA deja de ser algo que pruebas en un navegador y empieza a convertirse en algo que realmente se integra en herramientas que usas diariamente — en el hogar, en el taller, en el trabajo. No sucede de la noche a la mañana, pero diez meses de 28 a 80 por ciento es un recordatorio de que el ritmo es mayor de lo que la mayoría calcula.