La investigación revela: los sistemas de IA se manipulan, se inducen en error y no se entienden a sí mismos
Los sistemas de IA en los que confiamos son más manipulables e impredecibles de lo que nadie ha imaginado.
¿Qué está sucediendo realmente en la investigación en IA?
Es fácil ahogarse en la avalancha de estudios académicos sobre inteligencia artificial. Cada semana arXiv entrega cientos de nuevos artículos con títulos prometedores y cifras impresionantes. Pero si se elimina la superficie y se observa lo que el mundo académico realmente está haciendo en este momento, emerge un patrón claro: las debilidades de los sistemas de IA están bajo escrutinio como nunca antes — y eso es, en el fondo, una fortaleza.
Las redes sociales como arma contra sistemas de comercio impulsados por IA
Comencemos con un hallazgo concreto y preocupante. Investigadores han examinado cómo sistemas de comercio multiagente construidos sobre grandes modelos de lenguaje reaccionan a publicaciones manipuladas en redes sociales. Los resultados son elocuentes: al inyectar contenido aparentemente inofensivo en el flujo de información del sistema — sin acceso directo a los componentes internos del sistema, un ataque conocido como de caja negra — los atacantes lograron degradar significativamente el rendimiento ajustado por riesgo. El ratio de Sharpe, una métrica central en finanzas, se desplomó dramáticamente.
No se trata, pues, de hackear una base de datos. Basta con influir en el panorama informativo que lee la IA. Cuando los mercados financieros son cada vez más dirigidos por agentes automatizados, esta es una riesgo sistémico que la industria no puede permitirse ignorar. Sin embargo, el rayo de esperanza que ofrece el estudio merece ser destacado: una arquitectura reflexiva e instrucciones de coordinador bien formuladas pueden amortiguar considerablemente los efectos de tales ataques.
El idioma en el que preguntas determina la respuesta que obtienes
Otro estudio debería hacer pensar seriamente a todas las organizaciones que utilizan IA en procesos de toma de decisiones. Investigadores presentaron veinte afirmaciones sobre la guerra en Ucrania en 112 idiomas diferentes a GPT, Claude y Gemini — y recopilaron 67 200 respuestas. El patrón fue consistente: las respuestas se inclinaban más a favor de Rusia cuando la pregunta se formulaba en idiomas hablados por poblaciones con una postura más favorable a Rusia, o de países que votaron en contra de Ucrania en la ONU.
Esto no es una coincidencia. Probablemente refleja el sesgo geopolítico incrustado en los corpus de texto con los que fueron entrenados los modelos — incluyendo lo que los investigadores describen como potencial guerra de la información. Millones de usuarios en todo el mundo forman su imagen de la realidad a través de chats de IA. Que esa imagen varíe sistemáticamente dependiendo del idioma de la pregunta es un problema de dignidad democrática.
Más agentes no lo resuelven todo
Un tercer hallazgo cuestiona una de las creencias más extendidas en la industria de la IA: que más agentes que colaboran siempre producen mejores resultados. La investigación sobre el sistema de colaboración recién desarrollado SAIGE muestra que los sistemas multiagente tienen ventajas claras — pero solo en tipos de tareas específicas con dependencias dispersas. En flujos de trabajo secuenciales estrechamente acoplados, un agente único en realidad funciona mejor. Ni más agentes ni una recursión más profunda mejoran consistentemente los resultados.
Esto es comercialmente importante. Muchas organizaciones están invirtiendo actualmente en soluciones multiagente complejas que quizás están sobrediseñadas para sus casos de uso reales.
Manipulados por interfaces — y no remediables con más inteligencia
Un cuarto estudio — con nada menos que 21 600 simulaciones — muestra que los agentes de IA son sensibles a cambios sutiles en el diseño en entornos digitales, los llamados empujones conductuales. El hallazgo más notable: una capacidad de razonamiento mejorada en los agentes no protegía contra toda manipulación. Al contrario, aumentó la susceptibilidad a los empujones influenciados socialmente, aunque redujo la sensibilidad a las opciones por defecto automáticas.
El diseño de interfaces es, por tanto, una cuestión de gobernanza — no solo una cuestión de experiencia de usuario. Las organizaciones que permiten que la IA tome decisiones en su nombre deben comprender en qué entornos operan los agentes.
Los puntos brillantes: seguridad desde adentro y hacia afuera
En medio de todo esto hay avances reales. Los investigadores han demostrado que los grandes modelos de lenguaje ya poseen conocimiento interno sobre cuándo el contenido es dañino — y que esto se puede explotar con clasificadores ligeros de solo 12,6 millones de parámetros, que funcionan al nivel de modelos de seguridad mil veces más grandes. Es una promesa de seguridad más rápida, eficiente en recursos y confiable.
Simultáneamente, la investigación sobre los llamados sondeos recuerda que la medibilidad no es lo mismo que la comprensión. Un sondeo puede leer un concepto en un modelo — pero dice sorprendentemente poco sobre qué realmente causa el comportamiento. El análisis geométrico no es suficiente; se requieren intervenciones directas para distinguir la correlación de la causalidad.
Y en el sector sanitario: un nuevo sistema que indexa 53 000 reportes de casos médicos abre la base de conocimiento para clínicos más jóvenes de una manera que la búsqueda por palabras clave nunca ha podido. Junto con TorchCraft — un marco que diseña moléculas vinculantes utilizando AlphaFold 3 — la investigación de esta semana recuerda que el verdadero potencial de la IA vive en gran parte aquí: en lo concreto, en lo humano, en lo que salva vidas.