¿Quién es dueño del futuro de la IA? La UE obliga a Google a compartir – y ahora la atención se centra en los almacenes cerrados de datos de entrenamiento
La UE ha obligado a Google a dar acceso a los asistentes de IA de sus competidores en Android y a abrir sus datos de búsqueda – la voluntariedad ya no es suficiente cuando se controla una infraestructura sobre la que descansa toda la sociedad digital. Pero al mismo tiempo, se libra otra batalla por el poder: la iniciativa OpenWALDO quiere quebrantar el sistema cerrado en el que un puñado de actores decide en solitario qué datos de entrenamiento forman los modelos de IA del futuro. En conjunto, estos dos movimientos apuntan a la misma pregunta fundamental: quién debe ser en última instancia el dueño del campo de juego del desarrollo de la IA.
El control es la moneda – y la UE quiere redistribuirlo
Cuando la Comisión Europea anunció recientemente nuevas decisiones vinculantes contra Google, no se trata únicamente de asuntos de derecho tecnológico. Se trata de quién controla la infraestructura sobre la que descansa el ecosistema de la IA.
Según The Register, Google debe ahora proporcionar a los asistentes de IA de terceros un acceso significativamente más amplio a Android – incluyendo la posibilidad de activarse mediante comandos de voz y ejecutar acciones en las aplicaciones en nombre del usuario. Hoy en día, en la práctica, es el propio Gemini de Google el que ocupa esa posición, integrado en la plataforma de una manera que dificulta que los competidores lleguen a los usuarios. Esto cambiará ahora.
El responsable de políticas global de Google, Kent Walker, fue rápido en criticar la decisión y argumenta que socava la protección de la seguridad y la privacidad de millones de europeos. La Comisión responde a la crítica señalando que Google y los fabricantes de dispositivos conservan el derecho a establecer requisitos objetivos y no discriminatorios para terceros. Esta es una distinción importante: la apertura no tiene que significar caos desregulado.
La segunda parte de la decisión concierne los datos de búsqueda de Google. La Comisión constata que los compromisos voluntarios anteriores de Google sobre transparencia han sido insuficientes – y ahora se aplican reglas vinculantes. Esta es una señal de que la voluntariedad no es suficiente cuando se controla una infraestructura de la que depende toda la sociedad digital.
Otro frente: la caja negra de los datos de entrenamiento
Al mismo tiempo, existe un movimiento paralelo que ataca otro sistema cerrado. El proyecto OpenWALDO – Open Weights, Artifacts, Licenses, Data, Origins – es impulsado por Gregory Kurtzer, el hombre detrás de las distribuciones de Linux CentOS y Rocky Linux, y es financiado por la empresa de infraestructura CIQ. El objetivo es aplicar la filosofía del código abierto a los datos de entrenamiento de IA, según reporta The Register.
La crítica contra los actuales llamados modelos de IA abiertos está bien fundada: publicar los pesos del modelo no es lo mismo que transparencia. Los datos de entrenamiento – es decir, el material que forma el comportamiento real del modelo – a menudo son secreto comercial. Pueden contener material protegido por derechos de autor, respuestas tomadas de otros modelos de IA, o contenido de usuarios que nunca recibió un consentimiento verdadero.
– He pasado toda mi carrera viendo cómo el código abierto transforma a los usuarios en constructores y a los competidores en socios colaboradores. OpenWALDO trae ese modelo probado al mundo de la IA, dice Kurtzer.
También existe un argumento más práctico: cuando todos entrenan sus modelos en secreto, se repite una cantidad enorme de trabajo y se desperdician recursos de cálculo. Un conjunto de datos compartido y público no solo aumentaría la transparencia – haría que el proceso de entrenamiento fuera más eficiente en cuanto a recursos y aseguraría que cada mejora en los datos beneficiara a todos los modelos futuros.
El mismo problema, diferentes ángulos de ataque
Es fácil ver la regulación de la UE y OpenWALDO como fenómenos no relacionados. Pero comparten un diagnóstico común: el control concentrado sobre infraestructura crítica es un problema – sin importar si se trata del ecosistema Android de Google o los datos de entrenamiento que moldean cómo piensan y se comportan los sistemas de IA.
La UE utiliza legislación y decisiones vinculantes. OpenWALDO utiliza filosofía de código abierto y construcción comunitaria. Ambas atacan la misma asimetría fundamental de poder: unos pocos actores controlan los recursos de los que todos los demás dependen para construir sistemas de IA competitivos.
Lo interesante es que estos movimientos se refuerzan mutuamente. Cuando la UE obliga a Google a compartir datos de búsqueda, se crean condiciones para la competencia. Cuando OpenWALDO abre los datos de entrenamiento, disminuye la dependencia de los actores que hoy controlan los grandes conjuntos de datos secretos. En conjunto, desplazan el poder de los propietarios de plataformas individuales hacia un ecosistema más distribuido.
Por supuesto, existen desafíos. El aseguramiento de calidad de datos de entrenamiento abiertos es difícil. Y un acceso más libre a la plataforma Android plantea requisitos reales en el trabajo de seguridad de los actores terceros. Pero la respuesta a estos desafíos no es mantener sistemas cerrados – es construir sistemas abiertos mejores.