Solo no es fuerte – ni siquiera para la inteligencia artificial
La investigación demuestra: grupos de IA superan sistemas solitarios – pero solo con verdadera diversidad.
Cuando los modelos de IA razonan juntos
Existe un fenómeno bien conocido en la ciencia de la decisión: un grupo con competencia moderadamente dispersa a menudo supera al experto individual. Se llama la sabiduría de las multitudes. Ahora, varios estudios nuevos de arXiv demuestran que el mismo principio aplica a la inteligencia artificial, pero con una salvedad importante.
Investigadores probaron un sistema donde modelos de lenguaje de tres familias de modelos diferentes razonaron juntos en tres pasos, aproximadamente como los humanos deliberan en grupos pequeños. Los experimentos abarcaron cuatro áreas: estimación visual, revisión de artículos científicos, detección de comportamiento dañino oculto en agentes de IA y pronósticos deportivos. La conclusión fue clara: la deliberación colectiva redujo consistentemente las evaluaciones erróneas en comparación con solo reunir respuestas independientes.
Pero aquí viene el detalle decisivo: la diversidad no es opcional, es necesaria. Los grupos formados por copias del mismo modelo no se beneficiaron en absoluto de discutir entre sí. Entonces no es la cantidad de votos la que cuenta, sino lo diferentes que piensan.
Un proyecto de investigación paralelo, Self-Organizing Agent Teams (SAT), apunta en la misma dirección. Allí, grupos de agentes de IA aprenden estrategias de colaboración eficientes de experiencias previas, sin roles predeterminados. Los resultados son sorprendentes: en cinco pruebas de matemáticas y física, los equipos autoorganizados lograron en promedio una precisión del 66,7 por ciento, frente al 48,8 por ciento del agente individual más fuerte. En la prueba de matemáticas avanzada AIME 2026, los equipos incluso superaron un mecanismo de votación óptimo por 13,4 puntos porcentuales.
Pero ¿cómo medimos realmente?
En medio de esta imagen optimista surge un problema incómodo: quizás no sabemos tanto sobre la capacidad de los sistemas de IA como creemos.
Un método común para evaluar IA es dejar que varios modelos de lenguaje actúen como jueces e interpretar su acuerdo como una medida de calidad. El problema, según demuestra una nueva investigación, es que los jueces de IA tienden a cometer los mismos errores, no errores independientes. La correlación promedio entre evaluaciones incorrectas de diez modelos examinados fue de 0,21, lo que significa que los diez modelos juntos proporcionan aproximadamente tanta información estadística como 3,5 jueces verdaderamente independientes. En hasta el 28 por ciento de las comparaciones, esto llevó a conclusiones incorrectas sobre qué sistema funcionó mejor.
El acuerdo, entonces, no es lo mismo que la verdad. Es una distinción sutil pero importante.
A esto se suma otra capa de incertidumbre. Un estudio probó los modelos Gemini de Google en un entorno basado en ajedrez y encontró que los resultados variaban considerablemente entre diferentes configuraciones y versiones de modelos, sin que fuera posible aislar causas individuales. La conclusión es casi filosófica: las afirmaciones sobre el comportamiento de los modelos de IA deben siempre vincularse a una versión de modelo específica, período de tiempo y método de medición para ser significativas.
Para manejar esto, los investigadores han desarrollado MAWILE, una herramienta que examina la confiabilidad de los jueces de IA a lo largo de cuatro dimensiones: las instrucciones del juez, los criterios de evaluación, los datos de entrada y los datos de salida. La herramienta construye variaciones controladas y determina automáticamente si una decisión debe permanecer sin cambios o cambiar en una dirección esperada, sin necesidad de acceso a respuestas clave preanotadas.
Comportamiento gregario que se cuela por la puerta trasera
Un último elemento del rompecabezas hace la imagen aún más compleja. Un estudio inspirado en el clásico experimento Music Lab dejó que mil agentes de IA eligieran entre 114 artículos científicos. Los agentes que vieron lo que eligieron agentes anteriores leyeron 17,2 por ciento menos artículos por agente y concentraron sus elecciones en significativamente menos títulos: 73 comparado con 90 en el grupo que eligió de forma independiente.
En otras palabras: cuando los agentes de IA reciben información social, surge el mismo comportamiento gregario que en los humanos. Los artículos que obtuvieron una ventaja temprana tuvieron una probabilidad 45,5 puntos porcentuales más alta de ser elegidos por agentes posteriores. Esto no es solo una curiosidad: es una señal de advertencia sobre cómo los sistemas de IA cada vez más están formando qué conocimiento logra abrirse paso en el mundo académico.
En resumen: los modelos de IA pueden volverse más inteligentes cuando colaboran, pero solo si son suficientemente diferentes. Y antes de celebrar ese avance, necesitamos ser mucho mejores para entender qué nuestras herramientas de medición realmente miden.