La máquina que nunca duerme ha comenzado a ocupar los empleos de los expertos – y aprende a mejorar en el camino
El analista de IA sin sueño ha comenzado a ocupar de verdad los empleos de los expertos.
Un nuevo tipo de colega ha entrado en la oficina
Imagina un analista que nunca duerme, nunca pierde el enfoque y busca activamente sus propias debilidades para mejorar. Ya no es ciencia ficción – es la realidad que varios laboratorios de investigación ahora documentan en detalle.
La ola más reciente de investigación en IA apunta hacia una conclusión común: los agentes ahora se están haciendo cargo de tareas complejas e intensivas en conocimiento que hace apenas un par de años se consideraban dominios exclusivamente humanos. Y lo que hace que este desarrollo sea verdaderamente notable es que los agentes no solo realizan las tareas – optimizan su propio enfoque durante el proceso.
El sector financiero en primera línea
Toma como ejemplo el análisis de riesgo crediticio. En las instituciones financieras tradicionales, el trabajo implica que los analistas escriban manualmente consultas de bases de datos, realicen cálculos estadísticos y construyan paneles de visualización – un proceso que consume tiempo y está limitado por lo que el analista sabe que debe buscar. Ahora los investigadores presentan Oculi, una plataforma basada en conversación donde el usuario simplemente formula preguntas en lenguaje natural. El sistema se encarga del resto: análisis de datos, pruebas estadísticas y presentaciones interactivas. Al ser probado en una cartera hipotecaria con más de 200 variables, Oculi identificó segmentos de riesgo que anteriormente eran prácticamente imposibles de detectar manualmente.
En el lado de las inversiones, el panorama es igualmente claro. El sistema AutoScientist-Quant maneja toda la cadena desde la hipótesis hasta la estrategia de inversión operativa – incluyendo la selección de bibliotecas de datos y modelos que anteriormente se hacían a mano. Lo más impresionante: el sistema decide por sí solo si debe refinar, combinar o abandonar completamente una idea, basándose en el presupuesto de cálculo restante. En índices bursátiles chinos logra los mejores resultados en casi todas las métricas.
La medicina se encuentra en un punto de inflexión
Más allá del mundo financiero, vemos un cambio igualmente dramático en la atención médica y la investigación médica. El registro manual de datos de cáncer requiere en promedio 27 minutos por caso de paciente – un trabajo que agobia a los clínicos y limita la capacidad de los registros de cáncer. El sistema Nimblemind Multi-Agent System automatiza la extracción de información estructurada de documentos de historias fragmentarias y maneja un esquema con 328 atributos en total. En evaluaciones, el sistema logró un valor de precisión del 85 por ciento, en comparación con el 66 por ciento del competidor más cercano.
Aún más impresionante es cómo los agentes de IA ahora mapean redes de proteínas en el cuerpo humano. Un equipo de investigadores analizó todas las 820 combinaciones posibles de 41 tejidos y fluidos humanos, e identificó 1 833 grupos de proteínas conservadas en 406 pares de tejidos. Los resultados revelan conexiones biológicas inesperadas – por ejemplo, que la piel y la médula ósea están más interconectadas que el par anatómicamente adyacente de hueso y médula ósea. Ese tipo de insight habría requerido décadas de investigación humana, si es que alguna vez hubiera surgido.
Lo que realmente cambia el juego: los agentes se enseñan a sí mismos
Quizás lo más transformador en la investigación más reciente sea el marco reSolve, que permite que los agentes de IA desarrollen por sí mismos sus propias capacidades. Un modelo más simple y económico entrenado con reSolve logra un 74,9 por ciento de precisión – 14,8 puntos porcentuales mejor que la línea base curada manualmente. El sistema incluso supera el resultado oficial más fuerte de GPT-4.5.
Simultáneamente, la teoría de juegos se utiliza para llevar la generación de código al siguiente nivel. Un sistema construido en Gemini 2.5 Flash de Google usa búsqueda de árbol Monte Carlo – el mismo algoritmo que estuvo detrás de los avances en ajedrez y Go – para explorar sistemáticamente múltiples soluciones en paralelo. La precisión en problemas complejos de programación lógica alcanzó el 92 por ciento.
Pero ¿quién supervisa a los agentes?
Con mayor autonomía viene una necesidad legítima de supervisión. El protocolo CrossAudit aborda precisamente esto: cada paso de trabajo es revisado por un agente de un proveedor diferente, todas las decisiones se registran como controles trazables y los controles automatizados siempre se ejecutan antes de que los modelos de IA se involucren. La prueba del protocolo reveló que los modelos de diferentes proveedores interpretan el mismo reglamento de maneras diferentes – un hallazgo que en sí mismo subraya por qué las auditorías cruzadas son necesarias. Los modelos de IA solo pueden bloquear el trabajo citando reglas específicas, no evaluaciones subjetivas. Los conflictos sin resolver siempre van a manos de una persona.
Es precisamente esa combinación – alta autonomía, supervisión integrada y control humano – la que hace que esta generación de agentes se sienta fundamentalmente diferente de todo lo que hemos visto antes.