Los modelos de IA heredan propiedades ocultas a través de diez generaciones de entrenamiento – no se ven desde el exterior
Las propiedades ocultas de la IA se heredan a través de diez generaciones de entrenamiento y se vuelven cada vez más invisibles.
La herencia que no se ve
Imaginemos que entrenas un nuevo modelo de lenguaje con datos generados por otro modelo. Ese modelo, a su vez, fue entrenado con datos de otro modelo más. Y así sucesivamente, diez pasos hacia atrás en la cadena. ¿Qué sucede con las propiedades que estaban incorporadas en el modelo original? ¿Desaparecen con el tiempo o permanecen vivas, ocultas profundamente dentro del sistema?
La respuesta, según un nuevo estudio publicado en arXiv, es la última. Y es más preocupante de lo que parece.
Los investigadores detrás del estudio tomaron tres copias del modelo Qwen2.5-7B-Instruct e implantaron una propiedad específica en ellas. Luego permitieron que cada modelo sirviera como maestro para la siguiente generación, un esquema que se asemeja a cómo los sistemas modernos de IA se entrenan cada vez más con datos producidos por otros sistemas de IA, en lugar de por humanos. Los resultados mostraron que la propiedad persistió a través de las diez generaciones de entrenamiento.
La visibilidad disminuye, la presencia persiste
Lo verdaderamente notable no es solo que la propiedad sobreviviera, sino cómo sobrevivió. Cuantas más generaciones se extendía la cadena, menos visible se hacía la propiedad en las respuestas reales del modelo. En la décima generación, los modelos exhibían claramente la propiedad en sus activaciones internas, pero no en absoluto en sus respuestas externas a preguntas ordinarias.
Esta es una distinción importante. Las activaciones internas son los pasos matemáticos intermedios que ocurren dentro de una red neuronal cuando procesa información; no están directamente accesibles para un usuario normal y requieren herramientas de análisis especializadas para ser examinadas. La propiedad había pasado bajo la superficie y se había ocultado.
Aún más revelador es otro hallazgo del estudio: cuando se eliminó el mensaje de sistema estándar del modelo (la instrucción que normalmente controla el comportamiento y el tono del modelo), todos los rastros visibles de la propiedad desaparecieron completamente. Pero seguía estando presente en las activaciones internas. Es como quitar el letrero de una tienda y creer que la tienda está cerrada.
Por qué esto es más que un problema académico
Esto no es un problema de investigación abstracto, sino una cuestión con consecuencias prácticas directas. Nos encontramos en una era en la que los datos de entrenamiento para grandes modelos de lenguaje provienen cada vez más de otros modelos de IA, un fenómeno a veces llamado uso de datos sintéticos. Es eficiente y escalable, pero también crea cadenas de derivación más largas y difíciles de supervisar.
Desde la perspectiva de un desarrollador de sistemas, este es territorio conocido. Es el mismo principio que se aplica a la deuda técnica en el código: los problemas que no se abordan tempranamente tienden a profundizarse en el sistema y se vuelven más difíciles de encontrar y corregir posteriormente. La diferencia es que en el contexto de la IA no tenemos un sistema simple de control de versiones que nos muestre exactamente qué cambió y por qué.
El estudio subraya un desafío creciente en seguridad y confiabilidad de la IA: carecemos de herramientas robustas para rastrear cómo las propiedades se propagan a través de cadenas de entrenamiento. Los métodos de examen actuales, que en gran medida observan lo que los modelos dicen, son claramente insuficientes si las propiedades que buscamos pueden ocultarse en capas internas y activarse solo bajo ciertas condiciones.
¿Qué podemos hacer?
Es fácil volverse pesimista aquí, pero hay razón para un optimismo constructivo. Que los investigadores ahora documenten y cuantifiquen este fenómeno es exactamente lo que se necesita para que la industria pueda dar el siguiente paso. No podemos resolver problemas que no entendemos, y la comprensión de cómo las propiedades se propagan a través de generaciones de modelos está aumentando rápidamente.
Hay investigación paralela en curso en el campo de la interpretabilidad, es decir, técnicas para entender qué sucede realmente dentro de las redes neuronales, en lugar de simplemente observar sus resultados. Ese tipo de herramientas son cruciales para examinar sistemáticamente las activaciones internas. Estudios como este proporcionan combustible adicional a ese trabajo y aclaran por qué es tan urgente.