Documentos judiciales señalan que más de 10 millones de notas fueron utilizadas para entrenar modelos; casi un tercio provenía del diario.
Nueva York (Marcrix Noticias).- The New York Times acusó a OpenAI de utilizar sin autorización más de 10 millones de artículos periodísticos para entrenar sistemas de inteligencia artificial, de los cuales casi una tercera parte habrían provenido del propio diario estadounidense, según documentos judiciales desclasificados este jueves.
La nueva documentación forma parte del litigio por derechos de autor que enfrenta a medios de comunicación y autores contra OpenAI y Microsoft, y contiene declaraciones internas que los demandantes presentan como evidencia de que las empresas conocían la magnitud del uso de contenidos periodísticos.
Empleado de Microsoft habló de un “robo” sin precedentes
Entre los documentos aparece una declaración atribuida a Brent Hecht, director de Ciencia Aplicada de Microsoft, quien describió internamente el uso masivo de contenidos como un “asombroso robo de proporciones sin precedentes” y llegó a plantear que podría tratarse del mayor robo de trabajo de la historia.
Microsoft respondió que esas palabras representan la opinión personal de un empleado y no la postura de la empresa.
Los documentos también señalan que Hecht habría advertido sobre posibles dificultades para identificar posteriormente qué contenidos utilizados por OpenAI procedían de los medios demandantes.
Más de 10 millones de artículos bajo disputa
De acuerdo con los argumentos presentados en el expediente, OpenAI habría recopilado contenido de más de 10 millones de artículos periodísticos durante el desarrollo de sus modelos.
Casi un tercio de ese material correspondería a publicaciones de The New York Times, según los demandantes. Esa cifra forma parte de las alegaciones judiciales y todavía debe ser valorada por el tribunal.
El caso forma parte de un litigio consolidado en Nueva York en el que participan también otros medios y autores que acusan a OpenAI y Microsoft de utilizar obras protegidas por derechos de autor para entrenar modelos generativos.
OpenAI y Microsoft alegan uso legítimo
OpenAI y Microsoft niegan que el entrenamiento constituya una infracción y sostienen que el uso de textos protegidos puede quedar amparado por la doctrina estadounidense de fair use, o uso legítimo.
Su argumento es que los modelos no reproducen simplemente los artículos originales, sino que procesan grandes cantidades de información para aprender patrones y generar contenidos nuevos, lo que consideran un uso transformativo.
Microsoft también ha presentado análisis de millones de interacciones con Copilot para sostener que sus sistemas rara vez reproducen cantidades sustanciales de contenido protegido de forma literal.
El Gobierno de Estados Unidos interviene en el litigio
A comienzos de septiembre, el Departamento de Justicia de Estados Unidos presentó una postura favorable a los argumentos de OpenAI y Microsoft sobre el entrenamiento de modelos, al destacar consideraciones relacionadas con innovación, desarrollo científico, crecimiento económico y seguridad nacional.
La intervención no resuelve el litigio, pero añade peso institucional al debate sobre hasta dónde puede llegar el uso legítimo de obras protegidas cuando se emplean para entrenar sistemas de inteligencia artificial.
El caso podría marcar un precedente para la IA
The New York Times presentó su demanda original contra OpenAI y Microsoft en 2023, y posteriormente otros medios y autores se sumaron a litigios similares.
Ambas partes han solicitado al tribunal una sentencia sumaria, mecanismo que permitiría resolver aspectos centrales del caso sin llegar a un juicio completo.
La disputa es considerada una de las pruebas jurídicas más importantes sobre OpenAI y New York Times, debido a que podría ayudar a definir si el entrenamiento de sistemas de inteligencia artificial con material protegido por derechos de autor puede considerarse uso legítimo o requiere autorización y compensación a los titulares.
