Lo logra en cuatro de cada diez casos – nuevo estudio cuestiona la fiabilidad de los agentes de IA
Incluso en las circunstancias más favorables, los mejores agentes de IA logran reproducir resultados científicos en apenas cuatro de cada diez casos – y en los escenarios más difíciles, la cifra desciende al quince por ciento. Así lo demuestra un nuevo ricitmo de referencia que ha analizado cien artículos de una de las conferencias más prestigiosas del mundo en aprendizaje automático. Para quien construye sistemas críticos para el negocio bajo el supuesto de que la IA entrega resultados consistentes y fiables, esto debería ser motivo de reflexión.
Cuando el agente de IA abandona la tarea sin terminar
Imagina que contratas a un consultor para revisar y verificar un importante material de investigación. El consultor se encarga de la tarea, consume apenas un tercio de su tiempo facturable – y luego presenta un resultado sin haber siquiera comprobado si la respuesta coincide con el material original. Es aproximadamente la imagen que emerge de un nuevo y revolucionario estándar de referencia llamado RECLAIM.
Un equipo de investigadores ha publicado RECLAIM en arXiv – un estándar de referencia que consta de 100 artículos de NeurIPS 2025, una de las conferencias más prestigiosas del mundo en aprendizaje automático. El objetivo es medir sistemáticamente qué tan bien logran los agentes de IA reproducir resultados científicos. Suena como una pregunta académica estrecha. Pero las consecuencias son considerablemente más amplias.
Las cifras que requieren atención
RECLAIM divide las tareas en tres niveles de dificultad según la cantidad de material disponible:
- Nivel uno: Tanto código como datos están publicados – el escenario más simple.
- Nivel dos: Solo código disponible, sin modelos preentrenados.
- Nivel tres: Solo el artículo publicado – el agente debe escribir el código desde cero.
Los resultados son llamativos. El mejor agente logró reproducir:
- 41 por ciento de los casos en el nivel más simple
- 27 por ciento cuando el modelo necesitaba reentrenarse
- Solo 15 por ciento en el escenario más difícil
En otras palabras: incluso en las circunstancias más favorables, el agente de IA falla en más de la mitad de los casos. No es un fenómeno marginal – es un problema estructural.
Un detalle que realmente destaca es este: los intentos fallidos utilizaron en promedio solo 29 por ciento de su presupuesto de cálculo asignado. Los agentes abandonaron el trabajo prematuramente. Y el error más común no fue que calcularan mal – fue que nunca verificaron sus respuestas contra las cifras reales del artículo. Implementaron el método, ejecutaron el código y se conformaron con que algo se completara. La verificación no ocurrió.
De qué se trata realmente
Quiero ser claro: esto no es un argumento en contra de los agentes de IA como tecnología. Es un argumento a favor de calibrar honestamente las expectativas.
En los últimos años hemos visto un entusiasmo explosivo en torno a agentes de IA autónomos – sistemas que supuestamente pueden realizar tareas complejas sin intervención humana. En todo, desde derecho hasta análisis farmacéutico hasta evaluación de riesgo financiero, se están construyendo ahora sistemas donde se espera que los agentes de IA entreguen resultados fiables y reproducibles. RECLAIM nos recuerda que aún no estamos ahí.
No se trata de que la IA sea inútil – se trata de que corremos el riesgo de construir confianza sobre una base incompleta. Cuando un agente de IA ni siquiera verifica sus propias conclusiones, y además interrumpe el trabajo prematuramente, surge una situación peligrosa: el sistema parece haber funcionado, pero nadie ha comprobado realmente si el resultado es válido.
Este es un fenómeno bien conocido en el desarrollo de software – que el código compile no es lo mismo que el código sea correcto. Pero con agentes de IA, la ilusión de competencia es aún más engañosa, porque el sistema se comunica en lenguaje natural y suena convincente.
La oportunidad que se esconde en el problema
Aquí está el giro que quiero destacar: RECLAIM es una herramienta para mejorar, no solo una prueba de limitaciones.
Al definir niveles de desempeño concretos y medibles, el estándar de referencia proporciona a desarrolladores e investigadores un objetivo real hacia el cual apuntar. La historia del progreso en IA está llena de estándares de referencia que inicialmente parecían imposibles – y que luego fueron superados. Que el mejor agente hoy logre 41 por ciento en el escenario más simple no es el punto final. Es el punto de partida.
Para empresas y organizaciones que evalúan agentes de IA para procesos críticos del negocio, el mensaje es claro: exige verificabilidad, integra pasos de control, y mide desempeño real – no solo funcionalidad percibida. El agente de IA que entrega una respuesta rápidamente no es automáticamente el que entrega la respuesta correcta.