Le problème n’est pas l’IA, mais ceux qui s’en servent comme une machine à publier
Hosseini a un exemple sous la main. Un papier intitulé « L’impact des probiotiques sur la résistance aux antibiotiques chez les enfants autistes ». Signé par un certain Dr. Alan Thompson, une fausse identité générée par une IA. Le texte ? Une revue de littérature presque parfaite, si ce n’est que les 80 % des références citées n’existent pas. Ou alors, elles existent, mais ont été détournées de leur contexte original. « Le genre de boulot qu’un postdoc surchargé peut faire en deux nuits », soupire Hosseini. Sauf que ce n’était pas un postdoc. C’était une IA. Et le Dr. Alan Thompson n’a jamais existé.
Pourtant, ce papier a été accepté par une revue à comité de lecture. Pas une revue mineure. Une revue respectée. « Le problème, ce n’est pas l’outil, c’est l’usage », tranche Hosseini. L’IA permet de générer des textes en quelques secondes. Des résumés, des analyses préliminaires, des synthèses de données. Utile, même indispensable, pour un chercheur qui n’a pas le temps de tout faire lui-même. Mais quand on s’en sert pour fabriquer des publications entières, ou pire, pour tricher sur des données, ça devient un fléau.
Le chiffre qui résume la situation : 40 %. C’est la proportion d’articles scientifiques contenant des éléments générés par l’IA, selon une étude publiée en 2023 dans Nature. Parmi eux, 12 % avouent ouvertement avoir utilisé une IA pour écrire une partie significative de leur texte. Les autres mentent. Ou alors, ils ne savent même pas qu’ils mentent.
Pourquoi les revues scientifiques ne savent plus quoi faire
En théorie, le système est simple. Une soumission arrive, un comité la lit, et soit il l’accepte, soit il la rejette. Sauf que depuis deux ans, les comités de lecture sont submergés. Le nombre de soumissions a augmenté de 30 % depuis 2020, selon Publish or Perish, une base de données qui suit les tendances en recherche. Et une partie de cette explosion ? L’IA.
« Avant, si un chercheur voulait publier un papier bidon, il fallait qu’il ait au moins un peu de compétence », explique Hosseini. Aujourd’hui, il suffit de demander à l’IA de « me pondre un article sur les effets du CBD sur la dépression, avec des références récentes ». L’outil va piocher dans des bases de données, inventer des chiffres si nécessaire, et sortir un texte crédible. Assez crédible pour qu’un comité pressé par le temps ne prenne pas la peine de vérifier.
Le cas le plus flagrant ? Les revues prédatrices. Ces éditeurs en ligne qui acceptent tout, contre de l’argent. Depuis l’arrivée de l’IA, leur volume de soumissions a explosé. « On reçoit des papiers sur la relation entre les trous noirs et la croissance des champignons, explique un éditeur anonyme. Des trucs qui n’ont aucun sens, mais qui sont techniquement bien écrits. » Résultat : des milliers de faux papiers, signés par des faux auteurs, publiés dans des revues qui n’ont aucune légitimité. Et pourtant, ces papiers sont cités. Par d’autres chercheurs. Qui eux-mêmes sont citables. « C’est un effet boule de neige », résume Hosseini. « Et personne ne veut être celui qui va casser la machine. »
L’IA ne ment pas. Les humains, si.
Le vrai danger, ce n’est pas que l’IA invente des données. C’est qu’elle facilite la fraude. Un chercheur qui veut tricher n’a plus besoin d’être un génie des statistiques pour falsifier des résultats. Il suffit de demander à l’IA de « me générer un jeu de données qui montre que mon traitement fonctionne ». Et hop : des courbes lisses, des p-values parfaites, des conclusions impeccables. « Le pire, c’est que ces données ressemblent à des vraies », souligne Hosseini. « Un comité de lecture va regarder les graphiques, voir que tout est propre, et penser : Ça a l’air sérieux. » Sauf que les données n’ont jamais existé.
Exemple concret : En 2022, une étude publiée dans JAMA Network Open a été rétractée après qu’on ait découvert que les données avaient été générées par une IA. Les auteurs ? Des chercheurs en neurologie. Leur erreur ? Ils avaient utilisé un outil pour « optimiser » leurs résultats. Sauf que l’outil avait inventé des patients, des examens, des suivis. Tout. « Le problème, c’est que personne ne vérifie », regrette Hosseini. « Les revues n’ont pas les moyens. Les universités non plus. Alors on fait semblant de rien. »
La science va-t-elle s’effondrer ? Non. Mais elle va devenir moins fiable.
En 2025, les choses vont changer. Enfin, un peu. Plusieurs revues ont déjà annoncé qu’elles exigeaient désormais que les auteurs déclarent explicitement si leur texte a été généré (totalement ou partiellement) par une IA. D’autres demandent des audits de données, où un tiers indépendant vérifie que les chiffres ne sont pas bidons. « C’est une bonne chose », admet Hosseini. « Mais ça ne suffira pas. »
Le vrai problème, c’est que la science repose sur la confiance. Si les chercheurs ne peuvent plus faire confiance aux données qu’ils lisent, si les comités de lecture ne peuvent plus distinguer le vrai du faux, alors le système entier s’effondre. « On est en train de remplacer la rigueur par de la vitesse », conclut Hosseini. « Et la vitesse, ça ne remplace pas la vérité. »
Ce qui nous attend ? Une science à deux vitesses.
D’un côté, les laboratoires qui ont les moyens de vérifier. De l’autre, ceux qui n’ont pas le temps, ni l’argent, ni les outils. « Les riches publieront des vrais papiers. Les autres publieront des IA. Et personne ne saura faire la différence. »
Pas de morale. Juste un constat. La recherche scientifique est en train de devenir un casino. Et les jetons, ce sont les données.