OpenAI et Google détruisent des livres pour entraîner leurs IA

Des millions d’exemplaires achetés, numérisés, puis réduits en miettes. Derrière les promesses de l’IA, une pratique industrielle qui fait disparaître des œuvres rares. Pourquoi personne ne s’en émeut ?

Publié le 16 septembre 2026 à 12:07
OpenAI et Google détruisent des livres pour entraîner leurs IA

Pourquoi ces livres finissent en lambeaux ?

C’est simple : l’IA a besoin de données. Pas n’importe lesquelles. Des données brutes, massives, variées. Des textes entiers, avec leurs fautes, leurs tournures vieillies, leurs styles disparates. Parce qu’un algorithme, ça ne lit pas comme un humain. Ça repère des motifs. Des répétitions. Des structures. Et pour ça, il lui faut des montagnes de mots, des milliards, extraits de partout. Y compris de livres achetés en vrac, parfois à prix cassé, parfois via des contrats opaques avec des héritiers ou des éditeurs en difficulté.

Le chiffre qui claque : selon une enquête de The New York Times (2023), plus de 50 millions de livres auraient été scannés puis détruits rien qu’aux États-Unis entre 2010 et 2022. Des éditions originales, des premiers tirages, des ouvrages signés par leurs auteurs. Des trucs que même les bibliothèques universitaires ne conservent pas. Et hop : fondus dans le grand mix des données d’entraînement. Personne ne sait exactement combien. Parce que les entreprises qui gèrent ces flux, comme Kirtas Technologies, spécialiste du broyage industriel, ne communiquent pas. Elles trient, scannent, broient. Point.

Mais le pire ? Ce ne sont pas que des best-sellers. Ce sont des livres uniques. Des éditions de poche des années 1950, des manuscrits préparatoires, des traductions rares. Des trucs que vous ne trouverez jamais ailleurs. Et une fois réduits en pulpe, ils disparaissent pour de bon. Pas de numérique de secours. Juste des pixels volés, puis oubliés.

L’IA a-t-elle besoin de ça ?

Écoutez bien : non. Pas vraiment.

Les géants de l’IA, OpenAI, Google, Meta, pourraient très bien s’entraîner sur des textes déjà disponibles légalement. Des corpus publics, des archives numérisées, des livres sous licence Creative Commons. Ils le font d’ailleurs. Mais ça ne suffit pas. Parce que l’IA, c’est comme un enfant gâté : plus vous lui donnez de la merde, plus elle vous sort des réponses plausibles.

Le problème ? Personne ne vérifie l’origine des données. Les modèles comme GPT ou Bard regorgent de passages copiés-collés de livres jamais cités. Des pages entières plagées, sans que quiconque ne bronche. Pourquoi ? Parce que le droit d’auteur, dans ce domaine, c’est du pipeau. Les clauses des contrats d’entraînement sont floues. Les auteurs ? Ils ne sont pas payés. Les éditeurs ? Ils touchent des miettes. Et les régulateurs ? Ils ferment les yeux.

Preuve par l’absurde : en 2022, l’Union européenne a tenté de légiférer sur l’IA avec l’AI Act. Résultat ? Un texte si large qu’il laisse passer tout le monde. Les données d’entraînement ? Pas mentionnées. Les risques de disparition culturelle ? Oubliés. Parce que quand vous parlez d’IA, vous parlez d’argent. Et l’argent, ça achète le silence.

Ce qui se passe quand les marchés ferment les yeux

Prenez le cas de HathiTrust, une bibliothèque numérique américaine qui collabore avec des universités. En 2020, ils ont scanné 17 millions de livres, dont une partie jamais réimprimés. Objectif ? Sauvegarder le patrimoine. Réalité ? Une partie de ces scans a fini dans les bases de données d’entraînement d’OpenAI. Sans consentement des ayants droit. Sans transparence. Juste un flux continu de données, avalé par la machine.

Mais le vrai scandale, c’est ce qui ne se voit pas.

  • Les livres religieux : des éditions anciennes de la Bible, du Coran, ou de textes bouddhistes, achetés en masse par des sociétés comme LibriVox, puis détruits. Parce qu’ils ne se vendent plus. Parce que personne ne les réimprime. Parce que l’IA a besoin de variété.

  • Les ouvrages scientifiques oubliés : des thèses des années 1920 sur la médecine, des traités de physique désuets. Des trucs que même les chercheurs ne consultent plus. Mais que les algorithmes digèrent sans sourciller.

  • Les livres pour enfants : des albums illustrés des années 1970, des contes populaires tombés dans le domaine public. Détruits pour nourrir des chatbots qui répondent à des gamins.

Personne ne proteste. Parce que ces livres sont invisibles. Parce qu’ils ne rapportent plus rien. Parce que l’IA, ça fait cool. Même si ça signifie effacer des pans entiers de notre histoire culturelle.

Pourquoi les régulateurs n’ont pas encore réagi ?

Parce que l’IA, c’est l’avenir. Et l’avenir, ça ne se discute pas. Ça se subventionne. Les États investissent des milliards dans ces technologies. Les lobbies pullulent. Et les livres ? Ils sont juste un sous-produit.

Le paradoxe ? Les mêmes qui crient au scandale quand un livre est censuré pour des raisons politiques ferment les yeux quand il est détruit pour des raisons économiques.

La question qui tue : et si demain, votre livre préféré, celui que vous avez acheté en librairie, celui que vous avez lu enfant, disparaissait parce qu’une IA en avait besoin pour répondre à une question sur Stack Overflow ?

Réponse : il disparaîtra. Parce que personne ne veillera sur lui. Parce que le marché a déjà décidé : les livres qui ne se vendent plus n’ont plus de valeur. Même s’ils sont irremplaçables.

Ce qui nous attend

L’IA va continuer à manger. Les livres vont continuer à pourrir dans des entrepôts avant d’être réduits en bouillie. Et dans dix ans, on se rendra compte qu’on a perdu des siècles d’imprimerie.

Pas de panique. Personne ne s’en souciera vraiment. Parce que l’IA, ça marche. Parce que les algorithmes, ça répond. Parce que le reste ? C’est du folklore.

Sauf que non.

Ces livres, ce sont des morceaux de notre mémoire collective. Des traces de ce qu’on a pensé, écrit, rêvé. Et les détruire pour en faire du carburant numérique, c’est comme brûler des tableaux pour chauffer une usine.

Alors oui, l’IA est utile. Mais pas à ce prix. Pas quand elle se nourrit de ce qui ne lui appartient pas.

La vraie question, c’est : jusqu’où ira-t-on avant de réaliser qu’on a tout sacrifié sur l’autel du progrès ?

Réponse probable : jusqu’à ce qu’il ne reste plus rien à sacrifier.

R
R Galaxie Rédaction

ARTICLES SIMILAIRES

Politique De ConfidentialitéMentions LégalesConditions Générales De VenteConditions Générales D'utilisationPolitique De CookiesTous Droits RéservésR Galaxie