BOLDERROR

Inteligencia Artificial Edición diaria

INTELIGENCIA ARTIFICIAL GOBIERNO DE IA

Microsoft convierte 8,2 millones de conversaciones en su defensa: copiar poco no resuelve todo

La compañía sostiene que Copilot rara vez devuelve fragmentos extensos de obras protegidas. Pero la muestra fue elegida por su probable relación con los demandantes, los umbrales cambian entre estudios y la frecuencia de coincidencias no decide por sí sola si el entrenamiento fue lícito.

Por Rubén Campoy5 min de lectura
Mesa de análisis legal con miles de tiras de texto abstractas, algunas coincidencias azules, una lupa y una balanza
La escala del conjunto no elimina la necesidad de explicar muestra, umbral y pregunta jurídica. Imagen editorial exclusiva · BOLDERROR

Microsoft ha convertido un volumen extraordinario de conversaciones en el centro de su defensa frente a varias demandas de copyright. Según sus escritos, un experto contratado por editoriales de prensa recibió 8,2 millones de intercambios de Copilot durante la fase de descubrimiento. La tesis de la compañía es intuitiva: si un asistente entrenado con grandes cantidades de información rara vez devuelve pasajes reconocibles, la acusación de que funciona como una máquina de copiar pierde fuerza. El problema es que la cifra más vistosa no cuenta por sí sola qué se midió, cómo se eligió la muestra ni qué cuestión jurídica pretende responder.

El conjunto no fue una muestra aleatoria de todo el uso de Copilot. De acuerdo con la información presentada por Microsoft y recogida por medios especializados, las conversaciones se seleccionaron porque contenían palabras clave asociadas con los sitios de los demandantes y, por tanto, tenían más posibilidades de incluir material periodístico. Dentro de ese universo, la compañía identificó 59.545 conversaciones con al menos 16 palabras consecutivas coincidentes con contenido de noticias utilizado para fundamentar la respuesta. Esa proporción ronda el 0,73 %, pero extrapolarla al conjunto de Copilot sería incorrecto porque la selección estaba deliberadamente sesgada hacia los casos con mayor probabilidad de coincidencia.

Un análisis encargado por el Center for Investigative Reporting aplicó otro criterio y señaló 51 casos de solapamiento más amplio o sustancial. En un litigio separado impulsado por autores, Microsoft afirma que sólo 24 respuestas de los mismos 8,2 millones de intercambios contenían al menos 30 palabras coincidentes y que únicamente diez de 212 libros mostraron alguna coincidencia. Las magnitudes parecen pequeñas, pero no son directamente comparables: cambian la obra de referencia, el tipo de contenido, el umbral y la definición de reproducción. Un porcentaje diminuto puede ser relevante para una conducta masiva; uno mayor puede resultar poco informativo si sólo captura frases comunes.

La tasa aparente cambia con la muestra y con la definición de coincidencia

La estrategia de Microsoft intenta estrechar el pleito alrededor de la salida visible. Si el usuario no recibe una sustitución reconocible del artículo o del libro, sostiene la empresa, resulta más difícil hablar de daño de mercado causado por una copia entregada por Copilot. Los demandantes rechazan esa lectura. Su objeción no se limita a que el sistema recite párrafos: también discuten la adquisición de obras para entrenamiento, la creación de representaciones internas y la posibilidad de que respuestas sintéticas compitan con las fuentes originales. La frecuencia de repetición literal es una pieza del expediente, no todo el expediente.

La petición pendiente es de juicio sumario, un intento de resolver parte del caso sin llegar a un juicio completo porque, según Microsoft, los hechos relevantes no permitirían una conclusión distinta. El juez todavía no ha validado esa interpretación. También conviene contener la tentación de trasladar automáticamente el argumento fuera de Estados Unidos: el uso legítimo es una doctrina estadounidense que pondera factores y no equivale a una licencia universal para entrenar o desplegar modelos en Europa. La misma estadística puede tener un peso diferente según el derecho aplicable y el producto concreto.

Para empresas que despliegan asistentes, el caso ofrece una lección práctica más útil que elegir bando. Medir sólo la coincidencia exacta deja fuera paráfrasis, reconstrucciones y respuestas que sustituyen una visita sin copiar una frase. Pero ignorar la medición también es un error: registrar pruebas adversariales, limitar citas extensas, conservar procedencia cuando exista y bloquear instrucciones diseñadas para extraer obras son controles razonables. La evaluación debería incluir distintos umbrales, idiomas, categorías de contenido y ataques repetidos, además de una revisión humana de los resultados más graves.

La defensa basada en 8,2 millones de conversaciones será importante precisamente porque obliga a distinguir escala de significado. Microsoft aporta una base empírica poco habitual y sostiene que la regurgitación sustancial es excepcional. Los editores responden que una tasa de reproducción no resuelve cómo se obtuvieron las obras ni qué mercado se altera. Hasta que el tribunal decida, la conclusión responsable no es que Copilot copia o no copia, sino que cada porcentaje depende de una muestra, un umbral y una pregunta. Quien publique una cifra sin esos tres elementos estará convirtiendo una prueba discutida en un veredicto que todavía no existe.

Fin del artículo

Etiquetas

  • Microsoft
  • Copilot
  • Derechos de autor
  • Uso legítimo
  • gobierno de IA

BOLDERROR Edición diaria Rubén Campoy

Relacionados

Volver a la portada