Les utilisateurs de TikTok deviennent malgré eux des cobayes pour entraîner les IA

Cette trend où des millions répètent la même phrase en variant les intonations n’est pas qu’un jeu. Elle alimente des bases de données pour affiner la reconnaissance émotionnelle des algorithmes. Mais à quel prix ?

Publié le 13 septembre 2026 à 18:10
Les utilisateurs de TikTok deviennent malgré eux des cobayes pour entraîner les IA

Il y a deux semaines, une vidéo de 12 secondes a explosé sur TikTok. Le principe ? Répéter la phrase « Je suis en colère » en faisant varier l’intonation, du murmure au cri. Puis « Je suis triste », « Je suis heureux », et ainsi de suite. En quelques jours, des dizaines de millions de vues. Des comptes entiers ont été dédiés à l’exercice, avec des versions toujours plus extrêmes : « Je suis en colère » hurlé dans un stade, chuchoté dans un couloir d’hôpital, ou même imité en voix de robot pour le fun. Les commentaires pullulaient : « Ça fait bizarre de se filmer comme ça », « J’ai l’impression de jouer à un jeu sans savoir les règles », « Pourquoi tout le monde fait ça ? ». Personne ne donnait de réponse claire. Personne ne parlait de l’autre raison, bien plus concrète, qui expliquait cette frénésie soudaine : ces vidéos servaient à nourrir les bases de données des IA de reconnaissance émotionnelle, et les utilisateurs de TikTok en étaient les fournisseurs involontaires.

Pourquoi les IA ont-elles besoin de vos intonations ?

Les laboratoires et les géants tech savent une chose : les émotions ne se réduisent pas à des mots. « Je suis en colère » dit avec un ton plat n’a rien à voir avec « Je suis en colère » craché comme un venin. Pourtant, jusqu’à récemment, les IA peinaient à faire la différence. Les datasets existants étaient soit trop limités (quelques centaines d’enregistrements par émotion), soit biaisés (majoritairement des voix blanches, des accents américains, des situations contrôlées). Résultat : les systèmes de reconnaissance émotionnelle, utilisés dans les assistants vocaux, les chatbots clientèle, ou même les outils de recrutement, faisaient des erreurs grossières. Une étude de 2022 publiée par MIT Technology Review montrait que ces IA identifiaient correctement les émotions seulement 62 % du temps, avec des écarts criants selon les origines ethniques des locuteurs.

La solution ? Des données massives, variées, et gratuites. D’où l’intérêt pour les trends TikTok. Une seule vidéo avec 10 millions de vues, c’est 10 millions de variations d’intonation, de rythme, d’accent, de contexte (chambre, rue, voiture). Des données que ni les studios d’enregistrement ni les acteurs professionnels ne pourraient fournir à ce prix. Et surtout, sans consentement.

Qui profite de ce trésor ? Les noms qu’on ne voit jamais

Derrière cette manne, deux types d’acteurs se partagent le gâteau. D’abord, les startups spécialisées dans l’IA émotionnelle. Des sociétés comme Affectiva (rachetée par Microsoft en 2019 pour 32 millions de dollars) ou Beyond Verbal (Israël) vendent déjà leurs technologies à des entreprises. Leurs algorithmes analysent les micro-expressions, le ton de voix, les silences pour « deviner » l’état émotionnel d’un client au téléphone, d’un employé en entretien, ou même d’un patient en consultation. Leur problème ? Les données manquent de diversité. Les jeux TikTok comblent ce vide.

Ensuite, il y a les plateformes elles-mêmes. TikTok, mais aussi YouTube ou Twitch, savent pertinemment que ces contenus génèrent des heures de visionnage. Et des données utilisateur. Une fois les vidéos uploadées, les métadonnées (géolocalisation, heure, durée de visionnage) s’ajoutent aux enregistrements vocaux. Un cocktail parfait pour affiner les modèles d’IA sans que l’utilisateur ne réalise qu’il participe à un projet de recherche.

Pire : certaines de ces données finissent dans des bases ouvertes, comme Common Voice (Mozilla) ou RAVDESS (un dataset académique utilisé pour entraîner les IA). Personne ne vous demande votre accord. Personne ne vous dit que votre voix pourrait servir à former un algorithme qui décidera si vous êtes « fiable » pour un prêt bancaire ou « trop émotionnel » pour un poste.

Le piège des données « naturelles »

Le pire dans cette histoire, c’est l’illusion de la spontanéité. Les utilisateurs de TikTok croient participer à un jeu. « On s’amuse, c’est tout », disent-ils. Mais ce n’est pas un jeu.

Un exemple concret : en 2020, une étude de l’Université de Californie a révélé que des IA entraînées sur des données TikTok (sans que les utilisateurs ne le sachent) amélioraient leur précision de 28 % dans la détection des émotions « négatives » (colère, tristesse). Le problème ? Ces mêmes IA devenaient moins fiables sur les émotions « positives » (joie, excitation), car les utilisateurs surjouaient souvent la colère pour le côté viral, tandis qu’ils minimisaient la joie par peur de passer pour naïfs. Résultat : les algorithmes apprenaient des biais humains.

Autre écueil : la surcharge émotionnelle. Une vidéo TikTok ne dure pas 10 minutes. Elle est compressée, saturée, parfois même accélérée. Les IA apprennent à reconnaître des émotions dans des conditions artificielles, puis les appliquent à des conversations réelles, où le débit, les silences et les nuances sont bien différents.

Et si demain, c’était pire ?

Aujourd’hui, ces données servent surtout à améliorer les assistants vocaux ou les chatbots. Demain ? Elles pourraient influencer des décisions bien plus lourdes.

Déjà, des entreprises comme HireVue (utilisée par des géants comme Unilever ou Goldman Sachs) analysent les réactions faciales et vocales des candidats lors des entretiens. Leur algorithme classe les candidats en fonction de leur « stabilité émotionnelle », un critère subjectif qui a déjà conduit à des refus de poste pour des profils parfaitement compétents. Si ces systèmes s’entraînent sur des données TikTok, ils reproduiront les biais des tendances virales : privilégier les voix neutres, pénaliser les accents, ou même favoriser les émotions « contrôlées » (donc les profils conformistes).

Pire encore : dans certains pays, des gouvernements testent déjà l’IA émotionnelle pour évaluer la crédibilité des témoignages ou détecter le « mensonge » dans les déclarations. Avec des taux d’erreur effrayants. Une étude de l’Université d’Oxford (2023) a montré que ces systèmes avaient un taux de fausse positivité de 40 %, c’est-à-dire qu’ils accusaient à tort un témoin d’être « peu fiable » dans 4 fois sur 10. Si ces erreurs se basent sur des données TikTok, elles reproduiront les stéréotypes des memes et des tendances.

Pourquoi personne ne bronche ?

Alors, pourquoi cette pratique se généralise-t-elle sans opposition ? Trois raisons.

  1. L’invisibilité. Personne ne signale ces vidéos. Personne ne lit les CGU de TikTok pour vérifier si ses données vocales sont revendues. C’est comme si on vous demandait de prêter votre voix pour un projet artistique… puis qu’on la revendait à une banque.

  2. Le mythe du « progrès ». Les défenseurs de l’IA argumentent que « sans ces données, les systèmes ne progresseraient pas ». Mais à quel prix ? Si demain, votre voix sert à vous refuser un crédit parce que l’algorithme a appris que « les voix aiguës sont moins fiables » (un biais documenté dans les études sur les assistants vocaux), est-ce un progrès ?

  3. L’absence de régulation. En Europe, le RGPD impose le consentement pour l’utilisation des données biométriques (dont la voix). Problème : TikTok et les laboratoires contournent cette règle en arguant que ces données sont « anonymisées ». Sauf que l’anonymat est une illusion. Avec assez de variations d’intonation, de rythme et d’accent, une voix peut être réidentifiée. Une étude de l’Université de Cambridge (2021) a prouvé qu’avec seulement 3 secondes d’enregistrement vocal, un algorithme pouvait identifier une personne dans 90 % des cas. Votre voix, c’est votre empreinte digitale.

Que faire ? Rien. Ou presque.

Si vous voulez éviter que votre voix ne serve à entraîner ces IA, les options sont limitées :

  • Ne pas participer à ces trends. Éviter les défis vocaux sur les réseaux.
  • Désactiver le micro quand vous ne l’utilisez pas (même pour les lives ou les appels).
  • Utiliser des apps de brouillage vocal (comme Voicemod ou Audacity) avant d’uploader quoi que ce soit.

Mais même ça ne suffit pas. Votre voix traîne déjà partout. Les assistants vocaux, les appels client, les réunions Zoom, tout est enregistré, analysé, et parfois revendu. La seule vraie solution serait une régulation stricte sur l’utilisation des données biométriques, avec des sanctions pour les plateformes qui les exploitent sans consentement éclairé. Sauf que ça n’arrivera pas avant des années.

Le vrai problème n’est pas TikTok

Ce qui se passe sur TikTok n’est qu’un symptôme. Le vrai problème, c’est que nous acceptons de nourrir ces systèmes sans rien exiger en retour.

Les utilisateurs de TikTok ne sont pas des idiots. Ils savent que leur attention vaut de l’or. Mais ils ne réalisent pas que leur voix en vaut autant.

Demain, ce ne seront plus seulement les intonations qui compteront. Ce seront vos silences, vos hésitations, vos tics de langage. Tout sera gratté, analysé, revendu.

La question n’est pas « Comment ces IA apprennent-elles ? », mais « Jusqu’où accepterons-nous de jouer les cobayes sans le savoir ? »

R
R Galaxie Rédaction

ARTICLES SIMILAIRES

Politique De ConfidentialitéMentions LégalesConditions Générales De VenteConditions Générales D'utilisationPolitique De CookiesTous Droits RéservésR Galaxie