Microsoft mide su propio fraude — y lo llama prueba
Microsoft mide su propio fraude y llama al resultado prueba en el juicio.
Las cifras que deben probar la inocencia
No es frecuente que obtengamos un acceso directo a cómo se utilizan realmente los servicios de IA a gran escala. Pero en el juicio en curso entre New York Times, varios autores de libros y los gigantes tecnológicos Microsoft y OpenAI ha ocurrido algo inusual: 8,2 millones de registros de chat de Copilot han sido presentados como material probatorio.
La conclusión de Microsoft, reporta The Verge, es clara — y presentada con casi certeza matemática. De estas millones de conversaciones, solo 59 545 compartían al menos 16 palabras con contenido noticioso. Un perito independiente encontró 51 casos de lo que se denomina "solapamiento sustancial". En la parte del caso de los autores de libros, las cifras fueron aún más moderadas: solo 24 respuestas con al menos 30 palabras coincidentes, y de 212 libros examinados, solo diez tuvieron alguna coincidencia.
Sobre el papel suena convincente. Pero aquí es donde comienza a volverse interesante — y complicado.
¿Quién elige qué se mide?
Existe una asimetría fundamental en cómo se desarrolla este caso. Microsoft eligió por sí misma qué registros de chat debían presentarse — si bien justificándose en que contenían palabras clave vinculadas a los sitios de noticias afectados, es decir, los casos más probables de infracción. Pero los principios de selección, la metodología y la definición de qué constituye "copia" son establecidos en la práctica por la parte que tiene el mayor interés en un resultado favorable.
No es necesariamente malicia. Pero es un problema estructural al que el sistema judicial aún no ha encontrado una buena respuesta.
New York Times no está impresionado. El abogado jefe de la publicación, Ian Crosby, rechaza el marco de interpretación de Microsoft con determinación: el material probatorio que ha salido a la luz conduce según él a una única conclusión — que Microsoft y OpenAI robaron de New York Times para construir productos comerciales que ahora compiten con su periodismo.
Aquí chocan dos concepciones del mundo completamente diferentes. Microsoft mide en superposiciones de palabras y umbrales estadísticos. New York Times mide en consecuencias comerciales y justicia de principios.
Los derechos de autor se encuentran con una nueva realidad
La verdadera gran pregunta en este caso no es si Copilot casualmente reprodujo 30 palabras de un artículo. Es si todo el marco legal en torno a los derechos de autor está preparado para un mundo en el que los modelos de IA se entrenan con enormes cantidades de texto — y luego generan contenido nuevo que está inspirado en, basado en y hecho posible por ese texto, sin copiarlo palabra por palabra.
Los derechos de autor tradicionales protegen la forma de expresión, no la idea. Una IA que ha aprendido a escribir como New York Times, entender sus ángulos y producir análisis similares — sin citar una sola frase — se encuentra en una zona legal gris que los legisladores nunca previeron.
Esto no es exclusivo de Estados Unidos. En Suecia y el resto de Europa están ocurriendo discusiones similares dentro del marco de la Regulación de IA de la UE y la Directiva sobre derechos de autor relativa a la extracción de texto y datos. La pregunta de cuándo el entrenamiento sobre material protegido por derechos de autor se convierte en infracción está lejos de ser resuelta.
Un parteaguas que atraviesa toda la industria
Quiero ser claro: veo enormes posibilidades con la IA en el periodismo y la industria de medios. Automatización de reportajes rutinarios, análisis de datos más profundos, contenido personalizado — la lista es larga. Pero esas posibilidades solo se materializan si construimos un ecosistema con reglas claras y compensación razonable para quienes crean el contenido sobre el que descansan los modelos de IA.
Lo que Microsoft hace en los tribunales no está mal en sí — están defendiendo su posición con las herramientas disponibles. Pero la industria en su conjunto necesita algo más constructivo que un proceso judicial atrapado en contar palabras. Modelos de licencia, distribución de ingresos y estándares que atraviesen toda la industria sobre cómo los empresas de IA compensan a los creadores de contenido son el camino a seguir.
Este caso sentará precedente — sea cual sea el resultado. Y ese precedente moldeará cómo la IA y el periodismo coexisten durante mucho tiempo.