Avec l’essor des IA génératives, les détecteurs de textes comme Pangram ou GPTZero promettent de démêler le vrai du faux. Mais peuvent-ils vraiment distinguer un élève d’un robot ? Les études se multiplient et les résultats sont loin d’être tranchants.
Entre faux positifs, contournements faciles et manque de transparence, la confiance s’effrite. Alors, faut-il s’y fier les yeux fermés ou garder un solide esprit critique ? On a mené l’enquête pour vous dire ce qui se cache derrière ces outils. Accrochez-vous, le verdict pourrait vous surprendre. Et il n’est pas tendre.
Les détecteurs d’IA ne sont pas des juges fiables, et les fausses accusations pleuvent, voici ce qu’il en est :
- Pangram et compagnie promettent des taux d’erreur minuscules, mais les études indépendantes révèlent des faux positifs et des contournements faciles.
- Des auteurs humains sont accusés à tort à cause de tics de langage que les IA ont justement appris en les lisant.
- Les experts recommandent de les utiliser comme point de départ d’une enquête, jamais comme preuve définitive.
L’affaire Thélyson Orélien secoue la rentrée littéraire
L’auteur québécois Thélyson Orélien fait face à de graves accusations. En effet, des internautes affirment qu’il a généré son roman par intelligence artificielle. Ainsi, son premier livre C’était ça ou mourir est en lice pour plusieurs prix. Toutefois, un compte anonyme nommé « Balance ton Claude » a lancé l’offensive sur X. De plus, cet internaute s’appuie sur l’analyse du logiciel Pangram. Dès lors, l’auteur s’est défendu en niant catégoriquement ces accusations. En conséquence, le débat ne retombe pas et des accusations de plagiat s’y ajoutent.
Pangram, le détecteur au cœur de la polémique
Pangram est un logiciel américain spécialisé dans la détection de textes IA. Effectivement, la startup revendique un taux de faux positifs de 0,0041 %. Cela correspond à un cas sur 24 000 documents selon son rapport technique. De plus, son taux de faux négatifs atteint 0,3396 % en anglais. Sur des textes français, Pangram annonce 0,0026 % de faux positifs. Toutefois, ces chiffres proviennent directement de l’entreprise elle-même. Dès lors, leur vérification indépendante reste limitée et difficile à confirmer.
Comment fonctionnent réellement ces détecteurs d’IA ?
Ensuite, plusieurs techniques permettent de concevoir un détecteur d’intelligence artificielle. D’abord, certains outils recherchent les « tics de langage » typiques des IA. Notamment, les constructions ternaires et les formulations « Ce n’est pas X, c’est Y » sont surveillées. Puis, d’autres systèmes s’appuient sur la « perplexité » d’un texte. Concrètement, si une IA peut prédire la fin d’une phrase, le texte est suspect. Enfin, la troisième méthode utilise l’apprentissage machine sur de vastes corpus. Dès lors, cette approche s’avère plus fiable selon les spécialistes interrogés.
Les limites inhérentes aux détecteurs automatiques
Cependant, ces outils présentent des limites importantes et reconnues. Effectivement, les détecteurs analysent des groupes de mots et non chaque terme individuellement. Ainsi, un texte déclaré 100 % IA peut contenir des passages humains. Par ailleurs, Pangram admet une fiabilité réduite sur des extraits courts. De plus, les taux annoncés évoluent constamment avec les progrès des IA. Dès lors, les performances dépendent des données d’entraînement utilisées. En conséquence, aucun résultat ne constitue une preuve définitive selon les experts.
L’étude de la Vrije Universiteit de Bruxelles
D’ailleurs, une étude publiée en juin par la Vrije Universiteit de Bruxelles a testé quatre détecteurs. Effectivement, les chercheurs ont analysé quatre groupes de 40 articles scientifiques. Ainsi, un groupe était entièrement humain et un autre entièrement généré par IA. De plus, deux groupes présentaient différents degrés d’hybridation humain-IA. Notamment, aucun faux positif n’a été constaté sur les articles 100 % humains. Toutefois, Pangram a sous-estimé la part d’IA dans 4 cas sur 80. En conséquence, ces résultats nuancent fortement la fiabilité revendiquée.
Le test révélateur d’Epoch AI en juillet
Parallèlement, l’organisme Epoch AI a réalisé un autre test en juillet. Concrètement, trois détecteurs ont analysé 500 extraits humains de styles variés. De plus, 297 extraits ont été générés par IA avec un prompt basique. En outre, 297 extraits imitaient le style d’auteurs humains. Ainsi, seul Originality.ai a accusé à tort des textes humains dans 19 cas sur 495. Toutefois, les textes IA imitant un style échappent plus souvent à la détection. Dès lors, cette étude révèle une faille majeure des systèmes actuels.
Le jeu du chat et de la souris permanent
Surtout, les détecteurs et les IA se livrent à une course permanente. Effectivement, Thierry Poibeau du CNRS qualifie cela de « jeu du chat et de la souris ». Ainsi, les détecteurs doivent être réentraînés régulièrement face aux nouvelles IA. Par ailleurs, les entreprises d’IA réduisent les particularités d’écriture de leurs outils. Dès lors, leurs textes deviennent de plus en plus proches des écrits humains. En conséquence, cette course technologique rend les détecteurs rapidement obsolètes. Enfin, la fiabilité dépend aussi fortement de la langue analysée.
Les langues et les données d’entraînement
Notamment, les détecteurs fonctionnent bien en anglais, en français et dans une vingtaine d’autres langues. Toutefois, au-delà de ce périmètre, leurs performances deviennent beaucoup plus pauvres. Effectivement, Thierry Poibeau souligne la complexité linguistique et la disponibilité des données. Ainsi, l’apprentissage machine nécessite des corpus d’entraînement suffisamment riches. Par ailleurs, les détecteurs s’appuient sur des textes écrits avant 2018. Dès lors, cette référence au passé pose question pour l’avenir. En conséquence, Frédéric Kaplan prédit une obsolescence à long terme.
La parole aux écrivains accusés à tort
En outre, l’écrivain Baptiste Beaulieu dénonce une situation profondément injuste. Effectivement, il affirme sur Facebook avoir toujours aimé les rythmes ternaires. De plus, il utilise naturellement des figures comme « ce n’est pas qu’il… c’est qu’il… ». Ainsi, ces tics de langage ne prouvent absolument rien selon lui. Par ailleurs, il rappelle que les IA ont été entraînées avec les romans humains. Dès lors, il refuse de modifier son écriture pour satisfaire un logiciel. En conséquence, il dénonce une inversion absurde de la charge de la preuve.
Un outil d’enquête et non un juge définitif
Enfin, les experts appellent à une utilisation prudente de ces détecteurs. Effectivement, Max Spero, cofondateur de Pangram, affirme qu’ils ne devraient « jamais être l’arbitre final ». Ainsi, ces outils constituent un point de départ pour approfondir une enquête. De plus, le compte « Balance ton Claude » reconnaît une « chance non nulle » que l’auteur soit de bonne foi. Par ailleurs, l’étude bruxelloise recommande une étude approfondie après toute alerte. Dès lors, aucun résultat automatique ne devrait suffire à condamner un auteur. En conséquence, la prudence reste indispensable face à ces technologies imparfaites.
- Partager l'article :

