Un error temprano envenena todo lo que sigue: así se desmorona la capacidad de los agentes de IA cuando las tareas se vuelven complejas
Un único error temprano en la cadena hace que la capacidad de todo el agente de IA se desmorone.
Cuando la cadena falla
Imagina una tubería de agua con doce conexiones. Si once funcionan perfectamente pero la tercera tiene una fuga, no importa lo bien que sean las demás: el agua nunca llega. Así es aproximadamente cómo funciona la propagación de errores en sistemas de agentes de IA, y es un problema que el mundo de la investigación ahora toma en serio.
Un estudio publicado en arXiv demuestra que los agentes de IA que realizan tareas de varios pasos con herramientas externas pierden aproximadamente el 70 por ciento de su capacidad original en tareas con seis pasos o más. La razón es simple pero despiadada: un error temprano —herramienta elegida incorrectamente o argumento enviado incorrectamente— corrompe silenciosamente todos los pasos posteriores en la cadena. Lo que parece un pequeño desliz al principio puede hacer que toda la ejecución sea sin sentido.
Al mismo tiempo, un estudio separado, basado en 147 interrupciones documentadas en un sistema de producción para entrega de software, reporta que los mecanismos fundamentales en los que confiamos para el manejo de errores —reintentos automáticos, cortacircuitos de falta— no funcionan como se pretendía en entornos de agentes. En un caso, 54 llamadas consecutivas exitosas fueron completamente invisibles para la detección de fallos. En otro, señales incorrectas hicieron que el sistema reparara activamente código que en realidad funcionaba. Los investigadores detrás del estudio proponen siete nuevos principios de confiabilidad donde toda la cadena de delegación —no mensajes individuales— constituye la unidad de control.
La configuración juega un papel mayor que el modelo
Uno de los hallazgos más sorprendentes en el estado actual de la investigación no tiene que ver con qué modelo se elige, sino con cómo está configurado. Un estudio comparó dos configuraciones del exactamente mismo sistema en el código de referencia SWE-bench Verified. La única diferencia: una versión comprimía automáticamente el historial de conversaciones anterior cuando se llenaba el espacio de memoria, la otra lo guardaba todo.
El resultado fue sorprendente. Con una ventana de memoria limitada, el porcentaje de tareas resueltas aumentó del 43 al 72 por ciento, sin ningún ajuste fino específico del modelo. La conclusión que extraen los investigadores es importante para toda la industria: el modelo y la configuración deben evaluarse como una unidad conjunta, no como componentes separados.
Esto también se confirma en un estudio sobre diseño de hardware con modelos desplegados localmente, donde descripciones de herramientas detalladas redujeron consistentemente errores, mientras que las indicaciones de varios disparos en algunos casos causaban pasividad grave en los modelos.
Problemas de memoria —y soluciones prometedoras
Un desafío recurrente en casi toda la investigación sobre agentes es la limitación de memoria. Cuando un agente trabaja durante mucho tiempo, el historial de conversaciones crece y el rendimiento se deteriora. Aquí hay un intenso desarrollo metodológico en curso.
El sistema SKILL.state resuelve el problema reemplazando el historial acumulativo con un estado de ejecución estructurado: los pasos intermedios de pensamiento se descartan directamente después de su uso, y el modelo recibe en cada paso solo lo que realmente necesita. Scroll toma un camino diferente y almacena datos en variables dentro de un entorno de espacio aislado con Python, donde el agente busca y recupera información precisamente cuando la necesita. Los resultados son impresionantes: 94,8 por ciento en LongMemEval y una mejora de 37,4 puntos porcentuales en la prueba LOCA en comparación con los resultados anteriores más altos.
Sin embargo, vale la pena notar que el sistema de memoria cognitiva ECHO, a pesar de cifras altas en pruebas internas, tuvo un desempeño inferior al sistema establecido Mem0 en una prueba de comparación equiparada. Una revisión interna también reveló que ciertas reglas de búsqueda coincidieron accidentalmente con los datos de prueba, un recordatorio de que las cifras impresionantes de referencia no siempre cuentan la historia completa.
Agentes en la realidad —y qué falta
En medio de los problemas de confiabilidad hay avances concretos dignos de destacar. Un equipo de investigadores ha demostrado que un sistema con tres agentes de IA trabajando conjuntamente puede gestionar todo el flujo de trabajo de un microscopio de fuerza atómica a nivel nanométrico, al nivel de operadores experimentados, y con una función de seguridad integrada que redujo los comandos incorrectos a cero en las pruebas. No es una demostración, es un sistema funcional en un laboratorio real.
Para hacer que los sistemas de agentes sean más comprensibles, otro grupo de investigadores presenta un método que comprime patrones de comportamiento de agentes en máquinas de estado compactas con solo 7 a 43 estados. Estos pueden predecir fallos con una precisión de hasta 0,94 y detener ejecuciones fallidas en tiempo real, un camino prometedor hacia sistemas más seguros y auditables.
En el frente de aplicaciones científicas, una comparación muestra que los sistemas de IA ganan solo el 23 por ciento de los enfrentamientos contra revisiones de literatura escritas por humanos cuando expertos del dominio evalúan la calidad. Los agentes autónomos siguen siendo claramente inferiores a personas experimentadas en tareas que requieren conocimiento profundo del tema y juicio crítico.
La imagen que emerge no es una imagen de fracaso: es una imagen de un campo en intensa fase de maduración.