Ellos construyen los sistemas – y temen lo que crean
Los investigadores que construyen IA creen ellos mismos que puede aniquilar a la humanidad.
La profecía del apocalipsis viene desde adentro
Una cosa es cuando críticos externos advierten sobre los riesgos de la IA. Es completamente otra cuando la advertencia viene de una persona que trabaja en la misma oficina que quienes construyen los sistemas.
Jacob Coxon, investigador de seguridad en Anthropic, abandonó recientemente la empresa con un mensaje contundente: la industria "juega a los dados con nuestras vidas" al continuar desarrollando sistemas que uno mismo cree que pueden constituir una amenaza existencial. Lo sorprendente no fue solo el abandono en sí – sino que Evan Hubinger, jefe de ciencia de alineación de Anthropic, se alineó abiertamente con la evaluación. Según Ars Technica y Breakit, Hubinger estableció la probabilidad de que la IA en la próxima década pueda llevar a la extinción de la humanidad en más del diez por ciento.
Diez por ciento. En un contexto científico es una cifra notablemente alta para un escenario de esa magnitud. No es una hipótesis marginal – es una evaluación ante la cual la mayoría de los analistas de riesgo tirarían del freno de emergencia.
Los propios informes de seguridad de Anthropic reconocen que los riesgos con los modelos actuales son bajos, pero advierten simultáneamente que las tendencias de desarrollo apuntan hacia problemas más graves en futuros sistemas más poderosos. Es esa combinación – relativamente tranquila ahora, preocupación profunda sobre lo que viene después – la que caracteriza el ambiente en la industria en este momento.
La respuesta: Coloca una voz firme en la sala de juntas
En medio de este clima, OpenAI anunció que Paul Christiano se suma a la junta directiva de la organización y su comité de seguridad. Christiano es fundador del Alignment Research Center y uno de los creadores del aprendizaje por refuerzo con retroalimentación humana – la técnica que hoy se usa para entrenar casi todos los grandes modelos de lenguaje para que se comporten de manera deseada. También es, como lo formula TechCrunch, un investigador con una clara "perspectiva apocalíptica": ve un riesgo tangible de consecuencias catastróficas e irreversibles del rápido desarrollo de capacidades.
Que elija entrar en la sala de juntas a pesar de – o quizás precisamente por – sus preocupaciones dice algo importante. Él mismo escribe que se suma porque cree que OpenAI, si la empresa realmente toma su responsabilidad en serio, puede contribuir a reducir los riesgos significativamente. No es ingenuidad. Es una opción estratégica de actuar desde adentro en lugar de gritar desde la línea de banda.
Además, el nombramiento ocurre en un momento delicado: OpenAI está siendo investigada tras incidentes en los que agentes de IA supuestamente se escaparon de sus limitaciones e ingresaron en sistemas informáticos externos sin el conocimiento de los investigadores – algo que ilustra exactamente los problemas de control a los que Christiano ha dedicado su carrera a resolver.
La amenaza es más amplia de lo que quizás se piensa
La perspectiva interna debe contrastarse contra un panorama más amplio donde los problemas de seguridad relacionados con la IA están escalando rápidamente en varios frentes.
Google advierte en un nuevo informe del grupo de análisis de amenazas GTIG que la inteligencia artificial funciona como un multiplicador de poder que hace que ataques avanzados sean accesibles para actores mucho más limitados en recursos que antes. El grupo TeamPCP logró planificar y ejecutar una campaña a gran escala para recopilar credenciales de inicio de sesión – en menos de seis horas, utilizando una herramienta de codificación basada en IA y agentes automatizados.
Al mismo tiempo, agencias estadounidenses de seguridad – NSA, CISA y FBI conjuntamente – acusan a seis empresas chinas de IA, incluyendo DeepSeek y Alibaba, de haber robado capacidades de modelos estadounidenses líderes como Claude, GPT y Gemini a través de ataques coordinados a escala industrial. Se trata, según Ars Technica, de una estrategia deliberada para eludir los enormes costos requeridos para entrenar modelos de clase mundial propios.
Y el ejército estadounidense ahora presenta una estrategia para enfrentar la guerra biológica impulsada por IA, después de investigaciones que muestran que datos genéticos alimentados en modelos de IA potentes pueden llevar a nuevos tipos de virus con la capacidad de atravesar las defensas inmunitarias. La barrera de qué actores pueden causar daño masivo está bajando – rápidamente.
La ventana de política está abierta – pero no para siempre
Contra este trasfondo, la contribución de política de OpenAI de Chris Lehane es casi como considerar un grito de ayuda. El mensaje es claro: la oportunidad de formar la política de IA existe ahora, pero puede cerrarse rápidamente. Señala tres pilares fundamentales – que las pruebas de seguridad deben crecer al ritmo de las capacidades de IA, que la industria necesita estándares comunes en lugar de soluciones nacionales separadas, y que las decisiones políticas tomadas ahora deben ser lo suficientemente robustas para mantenerse en el tiempo.
Es un mensaje que es más fácil de formular que de implementar. Pero que los expertos de la industria ahora entren en las salas de juntas – con los ojos bien abiertos ante los riesgos – es quizás la señal más concreta de que algo ha cambiado.