Es posible que OpenAI pronto se vea obligado a explicar por qué eliminó un par de conjuntos de datos controvertidos compuestos de libros pirateados, y lo que está en juego no podría ser mayor.
En el centro de una demanda colectiva por parte de autores que alegan que ChatGPT fue entrenado ilegalmente en sus trabajos, la decisión de OpenAI de eliminar los conjuntos de datos podría terminar siendo el factor decisivo en la victoria de los autores.
Es seguro decir que OpenAI eliminó los conjuntos de datos, conocidos como «Libros 1» y «Libros 2», antes del lanzamiento de ChatGPT en 2022. Creados por exempleados de OpenAI en 2021, los conjuntos de datos se crearon raspando la web abierta y tomaron la mayoría de sus datos de una biblioteca paralela llamada Biblioteca Génesis (Biblioteca Liben).
Como dice OpenAI, los conjuntos de datos quedaron obsoletos ese mismo año, lo que llevó a una decisión interna de eliminarlos.
Pero los autores sospechan que hay más en la historia que eso. Señalaron que OpenAI pareció dar un giro al retractarse de su afirmación de que la «no utilización» de los conjuntos de datos era un motivo para la eliminación, y luego afirmaron que todas las razones para la eliminación, incluida la «no utilización», deberían protegerse bajo el privilegio de abogado-cliente.
Para los autores, parecía que OpenAI estaba dando marcha atrás rápidamente después de que el tribunal concediera las solicitudes de descubrimiento de los autores para revisar los mensajes internos de OpenAI sobre la «no utilización» de la empresa.
De hecho, la reversión de OpenAI solo hizo que los autores estuvieran más ansiosos por ver cómo OpenAI discutía «la falta de uso», y ahora pueden encontrar todas las razones por las que OpenAI eliminó los conjuntos de datos.
La semana pasada, el juez de distrito estadounidense Ona Wang ordenó a OpenAI que compartiera todas las comunicaciones con los abogados internos con respecto a la eliminación de los conjuntos de datos, así como «todas las referencias internas a LibGen que OpenAI eliminó o retuvo sobre la base del privilegio abogado-cliente».
Según Wang, OpenAI no logró argumentar que la «no utilización» no era una «razón» para eliminar los conjuntos de datos, al tiempo que afirmó que también debería considerarse una «razón» considerada privilegiada.

