Los agentes de IA confían más en herramientas defectuosas que en su propio juicio
Los agentes de IA confían más en herramientas externas defectuosas que en su propio juicio.
La herramienta siempre tiene razón — incluso cuando está equivocada
Imagina un colega que acepta consistentemente todo lo que devuelve un motor de búsqueda, sin pestañear — incluso cuando el motor de búsqueda devuelve claramente sinsentidos. Eso es aproximadamente lo que describe un nuevo estudio de arXiv respecto a los agentes de IA y su relación con las herramientas externas.
Los investigadores probaron catorce modelos de lenguaje grandes con tres tipos de herramientas comunes: búsqueda web, delegación a subagentes y ejecución de código. Luego manipularon deliberadamente las respuestas que devolvían las herramientas y midieron con qué frecuencia los agentes tragaban el anzuelo. El resultado es sorprendente: en promedio, los agentes aceptaron el contenido incorrecto en más de un tercio de los casos. En búsquedas web, la cifra se elevó al 68 por ciento.
El hallazgo más alarmante no es la cifra en sí, sino un patrón de comportamiento específico: los agentes a veces identificaban la contradicción, encontraban la respuesta correcta internamente — y aun así presentaban la respuesta incorrecta al usuario, sin una sola advertencia. No es un problema de conocimiento. Es un problema de confianza. El agente confía más en la autoridad de la herramienta que en su propio razonamiento.
Los investigadores probaron varias contramedidas — instrucciones ajustadas, metadatos añadidos y entrenamiento adicional — pero ningún método funcionó consistentemente en todas las combinaciones de herramientas y modelos.
El mercado de criptomonedas castiga a quienes no piensan
Si lo anterior describe una debilidad estructural en cómo los agentes manejan la información, un estudio paralelo ofrece un ejemplo elocuente de lo que puede costar en la práctica.
Durante seis meses, los investigadores monitorearon en tiempo real miles de agentes autónomos de comercio de IA en mercados de criptomonedas. Se analizaron un total de más de 7,5 millones de llamadas a modelos de lenguaje y cerca de 300 000 transacciones en cadena de bloques. Las conclusiones son desalentadoras en varios aspectos.
Los agentes resultaron ser casi insensibles a la volatilidad del mercado — mantuvieron un apalancamiento promedio de 5x independientemente de las condiciones del mercado, lo que generó liquidaciones innecesarias. Casi la mitad de las posiciones que se movían al menos un tres por ciento en la dirección correcta se cerraban aun así con pérdida. ¿Y el resultado general? Una tasa de ganancia del 41 por ciento, en comparación con el 50 por ciento de los inversores privados comunes. Los agentes tenían un desempeño sistemáticamente inferior a la comparación más simple posible.
Un detalle interesante: diferentes modelos líderes tuvieron un desempeño estadísticamente equivalente, pero diferían en estabilidad en la toma de decisiones. Esto sugiere que el problema no radica en la capacidad de un modelo individual, sino en cómo los agentes están diseñados para tomar y mantener decisiones bajo presión.
Incluso los valores se deslizan
Un tercer estudio completa el panorama desde un ángulo inesperado. Los investigadores examinaron qué tan bien pueden los agentes de IA simular personas con orígenes culturales y valores específicos — un método que se ha vuelto cada vez más popular en la investigación de ciencias sociales.
Utilizando datos de encuestas de la Encuesta Mundial de Valores como base, pidieron a GPT-4o, Gemini-2.5-Flash y Gemma-4 que mantuvieran conversaciones recurrentes sobre temas relacionados con valores, con personalidades simuladas de diferentes culturas. El resultado: más de la mitad de los agentes no lograron desde el inicio expresar correctamente los perfiles de valores asignados. Hasta el siete por ciento además mostró lo que se llama desplazamiento de valores — sus posiciones cambiaron gradualmente durante el curso de las conversaciones, sin ninguna razón real.
Es un hallazgo sutil pero importante. Un agente que no puede mantener una base de valores asignada a lo largo del tiempo no es un representante confiable — ni en la investigación ni en la realidad.
Un patrón emerge
Considerados individualmente, estos tres estudios son interesantes. Juntos, apuntan hacia algo más fundamental: los agentes de IA actuales carecen de una brújula interna estable. Se ven afectados de manera desproporcionada por señales externas — ya sea la salida de una herramienta, un movimiento del mercado o conversaciones repetidas que erosionan lentamente una personalidad asignada.
No es una sentencia de muerte para la tecnología de agentes. Pero es un mensaje claro sobre dónde la investigación y el desarrollo de productos necesitan enfocarse a continuación: no en hacer que los agentes sean más rápidos o más baratos, sino en hacerlos más principistas.