Le chiffre vérifié · N°5

Que déduire du test à l'aveugle des histoires écrites par IA

6 min de lecture

1,54 contre 0,97, sur une graduation qui descend jusqu'à moins trois. Les deux notes sont positives, et personne n'a su dire quel texte sortait d'une machine.

La newsletter IA gratuite
Que déduire du test à l'aveugle des histoires écrites par IA

1,54 contre 0,97, et l'information qui manque

1,54 contre 0,97. Présenté comme ça, le chiffre ressemble au verdict qu'on lit depuis une semaine : les lecteurs préféreraient la fiction écrite par une intelligence artificielle.

Il manque une information à côté de ces deux nombres. Ils ont été posés sur une graduation qui va de moins trois à plus trois, sept crans, de « pas du tout d'accord » à « tout à fait d'accord ». Les deux notes sont positives, et l'écart vaut 0,57 point.

Les lecteurs ont donc aimé les deux textes, et ils en ont aimé un légèrement plus que l'autre. C'est la distance qui sépare deux restaurants notés 4,1 et 4,4 sur cinq. On peut en tirer un titre, à condition de préciser qu'on a bien mangé dans les deux.

Ce que l'étude a mesuré

L'étude est sérieuse, et il faut le dire d'abord. Sydney Sears et Deena Skolnick Weisberg, de l'université Villanova, l'ont publiée le 5 août dans Judgment and Decision Making, la revue éditée par Cambridge University Press. Les données et les scripts d'analyse sont ouverts sur OSF.

Trois nouvelles publiées par des auteurs humains, appariées à trois textes générés par ChatGPT 4.0, tous d'environ mille mots. Détail que peu de reprises relèvent, les consignes reprennent le thème, le point de vue et le cadre du récit humain correspondant. On a donné la recette avant de commander le plat.

Dans la première étude, 1 682 adultes américains recrutés sur Prolific lisent une seule de ces six histoires. On leur annonce une origine, exacte dans la moitié des cas, fausse dans l'autre. Ils notent ensuite la qualité perçue et l'absorption, sur la graduation de moins trois à plus trois. Qualité : 1,54 pour l'IA, 0,97 pour l'humain. Absorption : 1,42 contre 1,00.

Le résultat que le titre écrase

Deux autres études suivent, avec 905 participants. Chacun reçoit cette fois les deux textes et doit désigner lequel sort d'une machine.

En étude 2, 167 personnes sur 424 tombent juste, soit 39,39 %. Le test de proportion place ce résultat significativement sous les 50 % : une boussole qui pointerait le sud rendrait davantage service. En étude 3, 51,97 %, que le même test ne distingue pas de 50 %. L'abstract résume les deux d'une formule : les participants n'étaient « no better than chance ».

Le même texte est mieux noté quand on annonce qu'un humain l'a écrit, quelle que soit son origine réelle. Les deux effets sont indépendants, mesurés par le même plan expérimental : les lecteurs dévaluent l'étiquette IA, et ils sont incapables de la repérer.

L'abstract le formule ainsi : les programmes d'IA produisent un travail créatif jugé « at least as good as » celui des humains, mais ne sont pas perçus comme capables de le faire. Au moins aussi bon, pas meilleur.

Qui a donné l'échelle, qui ne l'a pas donnée

Les six reprises qu'on a ouvertes rapportent toutes correctement le paradoxe de l'étiquette. Ce qui tombe en route, c'est l'unité de mesure.

Slate publie les quatre moyennes et précise que les lecteurs notaient « sur une échelle allant de -3 à 3 ».

ActuaLitté va plus loin, avec l'échelle, les mille mots, les titres des six textes et le point de méthode sur les consignes. The Decoder donne lui aussi la graduation, en toutes lettres.

Futura publie les quatre mêmes moyennes et ne nomme jamais l'échelle. Son titre, lui, est exact : il porte le paradoxe et n'affirme aucune préférence. La perte se produit donc dans le corps du texte, alors même que la titraille tient.

Or un chiffre sans son unité ressemble à une adresse sans le nom de la ville. Elle existe, elle est bien orthographiée, elle ne mène nulle part.

Le communiqué titre plus fort que son propre abstract

Le communiqué qui a lancé la vague a été publié le 4 août sur EurekAlert, signé Cambridge University Press. Son titre : « People prefer stories written by AI ». La maison qui édite l'article titre donc plus fort que l'abstract qu'elle met en ligne le lendemain.

Ce communiqué ne donne par ailleurs aucune grandeur d'effet. Ni 1,54, ni 0,97, ni l'échelle. Il annonce que les textes générés ont reçu de meilleures notes, sans jamais dire de combien : un dixième de point ou trois, on ne le saura pas.

Un chiffre qui indique où chacun est allé lire

Reste un détail parlant. Le communiqué écrit que les participants ont identifié correctement l'auteur dans 39,93 % des cas. L'article, lui, imprime 39,39 %, et le compte le confirme : 167 réponses justes sur 424. Deux chiffres inversés.

La conclusion n'en dépend pas, les deux valeurs sont sous le hasard. Mais une coquille pareille se comporte comme une faute de copiste dans un manuscrit : elle permet de reconstituer qui a recopié qui. earth.com reprend 39,93 % mot pour mot. ActuaLitté écrit 39,39 %, un nombre qui n'existe que dans l'article original.

Autant l'écrire : ce numéro a failli le reprendre aussi. Le dossier de veille qui a servi à le préparer portait 39,93 % en croyant citer l'étude, alors qu'il recopiait le communiqué. L'écart n'est apparu qu'en rouvrant le PDF. Le mécanisme n'épargne personne, rubrique sur les chiffres déformés comprise.

Le périmètre, que les auteurs posent eux-mêmes

Six textes d'environ mille mots, de la fiction réaliste, un échantillon exclusivement américain, des versions générées entre novembre 2023 et décembre 2024. La section limites de l'étude s'ouvre là-dessus : les histoires étaient « very brief », et des œuvres plus longues, « such as entire novels », pourraient donner un autre résultat, la machine étant peut-être moins capable de tenir des personnages sur la durée.

Les chercheuses signalent aussi que leur mesure de qualité perçue n'avait pas été validée auparavant. Six nouvelles, c'est un plateau de dégustation, pas la carte du restaurant.

Un précédent existe ici : l'IA battait déjà la moyenne humaine en créativité, sans battre les créatifs.

Ce qui reste vrai est plus intéressant que le titre

L'explication avancée par les chercheuses n'est pas la valeur littéraire, c'est la fluidité. Les lecteurs apprécient ces textes parce qu'ils les trouvent « easier to read or understand ». Et la manière dont ChatGPT fabrique un récit, en moyennant des millions d'exemples, pourrait « smooth out the rough edges » de l'écriture humaine, comme un visage composé de plusieurs visages réels paraît plus harmonieux qu'aucun d'eux.

Les versions générées énoncent leur thème au lieu de le laisser deviner. C'est plus confortable, et c'est exactement ce qu'une bonne nouvelle se refuse à faire.

Weisberg glisse un dernier signal dans le communiqué : les gens familiers de l'IA repèrent mieux ses textes, en s'appuyant sur des marqueurs comme le tiret cadratin ou les tournures du type « it's not just X, it's Y ». On avait consacré un article à ce tiret en avril. Ce que l'étude ajoute, c'est que ce savoir s'apprend, et pas en lisant beaucoup de romans : l'expertise littéraire des participants, elle, n'y change rien.

Sujets abordés :

CréativitéDécryptage

Questions fréquentes

Les lecteurs préfèrent-ils vraiment les histoires écrites par une IA ?
Pas au sens du titre qui circule. Sur une échelle de -3 à +3, les textes générés obtiennent 1,54 en qualité perçue contre 0,97 pour les textes humains : les deux notes sont positives, et l'écart vaut 0,57 point sur une amplitude de sept. L'abstract parle d'un travail créatif jugé « at least as good as » celui des humains, au moins aussi bon, pas meilleur.
Les lecteurs savent-ils reconnaître un texte écrit par une IA ?
Non. Dans l'étude 2, 167 participants sur 424 désignent correctement le texte généré, soit 39,39 %, un résultat que le test de proportion place significativement sous le hasard. L'étude 3 donne 51,97 %, que le même test ne distingue pas de 50 %. L'abstract résume les deux : les participants n'étaient « no better than chance ».
Que change l'étiquette « écrit par une IA » sur la note d'un texte ?
Le même texte est mieux noté quand on annonce qu'un humain l'a écrit, quelle que soit son origine réelle. Les deux effets sont indépendants et mesurés par le même plan expérimental : les lecteurs dévaluent l'étiquette IA, et ils sont incapables de la repérer.
Pourquoi les textes générés sont-ils un peu mieux notés ?
L'explication avancée par les chercheuses n'est pas la valeur littéraire, c'est la fluidité. Les lecteurs trouvent ces textes « easier to read or understand », et la manière dont ChatGPT fabrique un récit pourrait « smooth out the rough edges » de l'écriture humaine. Les versions générées énoncent leur thème au lieu de le laisser deviner.
Quelle est la portée exacte de cette étude ?
Elle est délimitée : six textes d'environ mille mots, de la fiction réaliste, un échantillon exclusivement américain, des versions produites par ChatGPT 4.0 entre novembre 2023 et décembre 2024. Les autrices écrivent elles-mêmes que les histoires étaient « very brief » et que des œuvres plus longues, « such as entire novels », pourraient donner un autre résultat.
C'est quoi la rubrique « Le chiffre vérifié de la semaine » ?
Un rendez-vous hebdomadaire de Declic Media. Chaque semaine, on prend un chiffre que tout le monde répète, on remonte à la source primaire, et on publie l'écart entre ce que le chiffre dit et ce qu'on lui fait dire.
Alexandre Noto

Alexandre Noto

Co-fondateur & Expert Tech

Alexandre est dans la tech depuis plus de 20 ans. Entrepreneur, architecte logiciel et passionné d'intelligence artificielle, il traduit les concepts complexes en explications accessibles. Chez Declic Media, il est la voix technique qui rend l'IA compréhensible pour tous.

Tous les articles de Alexandre →
La newsletter IA gratuite