Le jour où OpenAI a acheté des livres sur un site de piratage en masse
Imaginez : vous écrivez un roman pendant des années, vous le publiez, et soudain, une intelligence artificielle l’utilise pour répondre aux questions de vos lecteurs… sans vous demander la permission. Pire : elle le fait en cachant d’où elle l’a pris. C’est exactement ce que des auteurs américains, dont George R.R. Martin, viennent de dénoncer contre OpenAI. Et le pire ? Ils ont des preuves. Des milliers de preuves.
Le 15 mars 2023, un groupe d’écrivains a déposé une plainte devant un tribunal de New York. Leur accusation ? OpenAI a téléchargé des milliers de livres depuis un site de piratage notoire, Library Genesis (ou LibGen), pour former ChatGPT. Pas un, pas deux, mais des millions de pages. Des romans, des essais, des œuvres protégées par le droit d’auteur. Et le plus cynique ? Une fois les données ingérées, OpenAI a effacé les métadonnées qui prouvaient leur origine illégale. Comme si le vol n’avait jamais existé.
Pourquoi faire ça ? Parce que LibGen regorge de livres rares, indisponibles ailleurs, ou protégés par des droits d’auteur difficiles à négocier. Des pépites pour une IA. Sauf que c’est du vol pur et simple. Et OpenAI le sait.
Le chiffre qui pue : 12 000 livres identifiés, et probablement bien plus
En creusant, des chercheurs ont trouvé la trace de 12 000 livres (dont des œuvres de Martin, Philip Pullman, ou encore des classiques comme Ulysse de Joyce) dans les bases de données d’OpenAI. Mais ce n’est qu’une estimation basse. LibGen compte des centaines de milliers de titres. Combien ChatGPT en a-t-il avalés ? Personne ne le sait vraiment.
Ce qui est sûr, c’est que ces livres ont servi à entraîner le modèle. Et une fois digérés, OpenAI a nettoyé les données. Comme un voleur qui brûle ses empreintes digitales sur la scène de crime. Sauf que là, la scène de crime, c’est la culture.
Pourquoi personne ne s’en émeut ? Parce que le jeu en vaut la chandelle. ChatGPT vaut aujourd’hui des milliards. Et les auteurs ? Ils touchent des royalties dérisoires, voire rien du tout.
OpenAI joue à cache-cache avec les preuves
Quand on leur a demandé des explications, OpenAI a répondu par un communiqué lisse, du style « nous utilisons des données licites ». Sauf que les preuves, elles, sont là. Des chercheurs en informatique ont récupéré des échantillons de code source d’OpenAI et ont retrouvé des fragments de livres piratés. Preuve que l’entreprise a menti.
Alors pourquoi ils osent ? Parce que le risque juridique est faible. Les poursuites pour violation de copyright contre une IA sont complexes, longues, et souvent inefficaces. Les auteurs gagnent rarement. Et OpenAI a les moyens de traîner en justice pendant des années.
C’est le Far West du numérique : les géants font ce qu’ils veulent, et les autres courent derrière.
Le vrai problème : ce n’est qu’un début
ChatGPT n’est qu’un exemple. Google, Meta, Microsoft… Tous ont utilisé des données douteuses pour entraîner leurs IA. Certains l’admettent même ouvertement. En 2021, un rapport de l’Internet Archive (une bibliothèque numérique) a révélé que des entreprises comme Google avaient scanné des millions de livres sans autorisation, avant de les utiliser pour former leurs modèles.
Alors oui, OpenAI a volé des livres. Mais ce n’est pas le pire. Le pire, c’est que personne ne veut réguler ça. Parce que l’IA, c’est l’or noir du XXIe siècle. Et quand l’or coule à flots, les questions éthiques deviennent un détail.
Et maintenant ? Les auteurs sont seuls face aux géants
George R.R. Martin et les autres ont porté plainte. Mais est-ce que ça changera quelque chose ? Probablement pas. Les procès contre les GAFAM durent des années. Et pendant ce temps, ChatGPT continue de recracher des réponses basées sur des livres volés.
Le vrai combat, ce n’est pas devant les tribunaux. C’est devant les législateurs. Il faut des lois claires sur l’utilisation des données pour l’IA. Des amendes lourdes pour les contrevenants. Et une vraie transparence sur ce qui est utilisé pour former ces modèles.
Sauf que pour l’instant, les gouvernements ferment les yeux. Parce que l’IA, ça fait rêver. Même quand elle repose sur du vol.
La question qui dérange : et si demain, c’était votre œuvre ?
Vous êtes écrivain ? Artiste ? Créateur de contenu ? Demandez-vous : mon travail a-t-il servi à former une IA sans que je sois payé ? La réponse est probablement oui.
ChatGPT n’est pas qu’un outil. C’est un parasite. Il se nourrit de la création des autres pour produire du contenu à bas coût. Et personne ne semble vouloir l’arrêter.
Alors la prochaine fois que vous verrez une IA répondre à une question avec une précision déconcertante, souvenez-vous : derrière chaque réponse, il y a peut-être un livre volé. Et derrière chaque livre volé, un auteur qui se fait arnaquer.
Le système est en place. Et il ne s’arrêtera pas tout seul.