Les fichiers non scellés montrent qu’Open AI/Microsoft savait que la copie était illégale et pourrait nuire aux auteurs

Moins de deux semaines après que la Authors Guild et Open AI/Microsoft ont demandé un jugement sommaire dans leur affaire de violation du droit d’auteur, des commentaires récemment dévoilés dans des mémoires déposés par les géants de la technologie révèlent que les dirigeants savaient qu’ils formaient illégalement leurs produits sur des livres protégés par le droit d’auteur et que les livres générés par l’IA supplanteraient probablement les livres d’auteurs humains sur le marché. En outre, les commentaires des dirigeants suggèrent également que certains employés du secteur de l’édition perdront leur emploi.

Une note d’Open AI d’août 2019 indique sans détour : « Nous avons formé GPT-3 sur des éléments piratés ! Pas de partage de cela ! »*

La Guilde des auteurs a souligné certains des commentaires désormais publics formulés par les dirigeants d’OpenAI dans cette affaire. « Plus nous réussissons sur GPT-X, plus les auteurs de fiction de genre s’inquiéteront de notre substitution sur Amazon », a déclaré le directeur politique d’OpenAI, Jack Clark, dans un témoignage donné en mai 2020. Il a en outre reconnu que même si « il y aura un moment où un groupe d’artistes exprimera son inquiétude à propos de ce que nous faisons ici et nous ignorerons probablement leurs inquiétudes et les publierons de toute façon ».

Les documents indiquent également l’embauche de Tarun Gogineni en 2022 pour diriger les efforts d’OpenAI visant à améliorer la qualité d’écriture de ses modèles. Les documents montrent que Gogineni a déclaré que sa « mission de recherche » était de créer une machine qui supplanterait les auteurs humains. Dans le même ordre d’idées, le mémoire indique que Gogineni était au courant des plaintes des auteurs selon lesquelles les « ensembles de données étaient volés » et que les auteurs perdaient du travail au profit de la concurrence générée par l’IA. Néanmoins, au fil du mémoire, il n’a pas trouvé ces plaintes « très sympathiques » et les a plutôt considérées comme « des perturbations économiques acceptables ». Il écrivait que le monde connaîtrait bientôt « la mort du lecteur » alors que « les machines créent[ed] cherchez plus de machines.

L’orgueil dont Gogineni a fait preuve à propos du remplacement des auteurs humains par l’IA est peut-être mieux illustré dans un tweet apparu dans un témoignage selon lequel si George RR Martin décède prématurément, « GPT peut écrire le prochain [S]une longue période de [I]ce et [F]ire livre. »

Le mémoire indique également que Microsoft était au courant de l’utilisation de LibGen par OpenAI dès avril 2019 et qu’en 2022, grâce à un effort appelé Project Clear, OpenAI a supprimé ses fichiers LibGen. « Étant donné l’importance d’OpenAI dans l’actualité, c’est le bon moment pour exclure Libgen de nos systèmes et de notre stockage. Qu’est-ce que cela impliquerait ? », a écrit Bob McGraw, vice-président de la recherche d’OpenAI, à ses collègues dans une note.

Les révélations dans l’affaire Guild surviennent quelques jours après la révélation des dossiers dans le New York Times Le procès contre Microsoft et OpenAI a montré que l’utilisation de millions d’articles de presse par l’entreprise pour créer LLM constitue une « menace existentielle » pour les éditeurs de journaux.

*Toutes les citations sont tirées du mémorandum de droit des demandeurs du groupe à l’appui de la requête en jugement sommaire partiel (dossier 1982) et de la règle 56.1 corrigée des demandeurs du groupe, déclaration des faits importants incontestés (dossier 1987).