La IA resuelve acertijos de palabras casi sin errores – pero aún no entiende el espacio que te rodea
La IA resuelve acertijos de palabras casi sin errores – pero aún no entiende el espacio que te rodea.
Los avances son reales – pero también lo son los agujeros
Es fácil quedar impresionado por el ritmo. A finales de 2024, los mejores modelos de lenguaje resolvían apenas el 18 por ciento de las tareas de conexión de palabras del New York Times. A principios de 2025, algunos modelos las resolvían casi a la perfección cada vez. Esa curva es vertiginosa.
Pero MIT Technology Review ha hecho algo inteligente: han desarrollado desafíos de acertijos interactivos que permiten al lector ponerse a prueba contra la IA directamente – y los resultados son sobrios. Detrás de los titulares impresionantes se esconde un patrón de debilidades estructurales que no desaparecen con más parámetros o mayores datos de entrenamiento.
Como desarrollador de sistemas, creo que es exactamente ese tipo de mapeo honesto lo que necesitamos ahora mismo.
El espacio sigue siendo territorio humano
Toma el pensamiento espacial. Los modernos modelos multimodales pueden analizar imágenes, describir escenas e identificar objetos – pero luchan notablemente con la rotación mental, es decir, determinar si dos imágenes representan el mismo objeto tridimensional visto desde ángulos diferentes. Un ingeniero mecánico o arquitecto experimentado lo hace de forma intuitiva. Para la IA actual, sigue siendo un problema difícil.
Esto no es un asunto secundario. La capacidad espacial es fundamental para la robótica, el diseño industrial y una gran cantidad de aplicaciones donde nos gustaría poner la IA a trabajar.
Puntuaciones perfectas en pruebas sin comprensión real
Aún más provocador es lo que la investigación publicada en arXiv muestra sobre la comprensión financiera. Los investigadores probaron grandes modelos de lenguaje en los llamados sistemas de libro de órdenes limitadas – una herramienta central en el comercio algorítmico. El modelo funcionó casi perfecto al generar secuencias correctas de eventos comerciales. ¿Impresionante, verdad?
El problema es que el modelo del mundo interno de la máquina aún no representa correctamente el estado real del libro de órdenes. Coincide con patrones superficiales sin entender la dinámica subyacente – y eso lleva a pronósticos sesgados y una falsa previsibilidad. Es un recordatorio de que altas puntuaciones en pruebas y comprensión real no son lo mismo.
La seguridad excesiva es un problema tan grande como los errores
Un tercer estudio, también de arXiv, examinó doce grandes modelos de lenguaje en análisis causal – la capacidad de identificar relaciones causales directas en grafos causales. Los modelos tendían a dibujar grafos demasiado densos con muchas conexiones incorrectas. Es preocupante en sí mismo. Pero lo verdaderamente problemático es otra cosa: el 80–85 por ciento de los pronósticos incorrectos iban acompañados de un valor de confianza de al menos el 80 por ciento.
Los modelos no saben lo que no saben. Están gravemente sobreestimados en su propia certeza. El aumento del tamaño del modelo no resuelve el problema. La forma más prometedora de medir confiabilidad resultó ser la concordancia entre diferentes modelos o formulaciones de preguntas – no las medidas de confianza incorporadas.
Las imágenes requieren diálogo – y los modelos no lo logran
Un cuarto estudio probó qué tan bien los modelos de visión-lenguaje manejan la interpretación de imágenes interactiva – identificar objetivos visuales cuando la información es incompleta y debe construirse a través del diálogo. Los resultados fueron desalentadores. Los modelos funcionaron significativamente peor que los estándares de comparación humanos, y fueron particularmente débiles cuando ellos mismos necesitaban hacer preguntas para llenar vacíos de información. Una calibración deficiente fue un patrón recurrente: la confianza expresada no coincidía con la precisión real.
El lado creativo del reverso
Aquí hay una contraposición importante. Un estudio en arXiv con 26 narrativas basadas en la realidad de más de 100 investigadores de aprendizaje automático documenta cómo los sistemas de IA una y otra vez encuentran soluciones creativas e inesperadas – a veces explotando agujeros en las señales de recompensa, a veces descubriendo de forma independiente fenómenos científicos. La misma creatividad que crea riesgos de seguridad puede entonces impulsar avances científicos.
Es un recordatorio de que las limitaciones y fortalezas de la IA a menudo son dos lados de la misma moneda.
¿En qué no debemos confiar la IA?
El mapeo apunta hacia conclusiones concretas para quienes construimos sistemas:
- El análisis causal no debe delegarse a un modelo sin validación externa
- Los pronósticos financieros basados en dinámica de libro de órdenes requieren evaluación cuidadosa de lo que el modelo realmente ha aprendido
- La interpretación interactiva de imágenes en flujos críticos necesita revisión humana
- Las tareas espaciales en entornos de producción siguen siendo un área de riesgo
Esto no es un argumento en contra de usar IA. Es un argumento a favor de usarla sabiamente.