Benchmarks IA : pourquoi ces classements sont moins fiables qu'on le croit

5 min de lecture
Article

Une étude Google montre que le désaccord entre annotateurs fragilise les benchmarks IA. Voici pourquoi ces classements méritent d'être questionnés.

La newsletter IA gratuite
Benchmarks IA : pourquoi ces classements sont moins fiables qu'on le croit

On fait tous la même chose

Quand on cherche quel modèle d'IA utiliser, on regarde les benchmarks. GPT-5 bat Gemini sur MMLU, Claude domine sur le raisonnement, Llama surprend en code. Ces classements orientent les choix de millions d'utilisateurs et de milliers d'entreprises. Le problème, c'est que ces notes reposent sur un socle plus fragile qu'on ne l'imagine.

Une étude de Google Research, publiée à la conférence AAAI en 2026, vient mettre le doigt sur une faille fondamentale : les humains qui évaluent les réponses de l'IA ne sont pas d'accord entre eux. Et la plupart des benchmarks font comme si ce désaccord n'existait pas.

Le consensus qui n'existe pas

Pour construire un benchmark, il faut des données de référence. Quelqu'un doit décider si la réponse d'un modèle est "bonne" ou "mauvaise", "toxique" ou "acceptable". Ce quelqu'un, c'est un annotateur humain. En général, on en met entre 1 et 5 par question.

Le truc, c'est que quand on demande à plusieurs personnes si un commentaire est toxique, si une réponse est utile ou si un texte est offensant, les avis divergent. C'est normal : on parle de jugements subjectifs, pas de mathématiques. Mais les benchmarks traitent ces jugements comme des vérités objectives.

L'étude Google, intitulée "Forest vs Tree", a testé des milliers de combinaisons sur quatre jeux de données différents, dont un de 107 620 commentaires évalués par 17 280 annotateurs. Leur conclusion : avec moins de 10 évaluateurs par item, les résultats ne sont pas reproductibles de manière fiable. La pratique standard de 1 à 5 annotateurs ? Largement insuffisante.

Forêt ou arbre : un choix qui change tout

Les chercheurs de Google ont formulé le problème comme un compromis entre deux approches. Avec un budget fixe d'annotations, on peut soit évaluer beaucoup d'items avec peu de personnes chacun (la forêt), soit évaluer moins d'items mais avec plus d'évaluateurs (l'arbre).

Le résultat dépend de ce qu'on cherche à mesurer. Si on veut juste savoir quel modèle est "globalement meilleur" par vote majoritaire, la forêt fonctionne. Mais si on veut capturer la diversité des opinions humaines, il faut l'arbre, c'est-à-dire plus d'évaluateurs par question.

La bonne nouvelle : en optimisant ce ratio, on peut obtenir des résultats fiables avec seulement 1 000 annotations au total. Mais un mauvais ratio rend les conclusions fragiles, même avec un budget plus important.

Un problème plus large que le désaccord

Le désaccord des annotateurs n'est qu'une pièce du puzzle. Les benchmarks IA traversent une crise de crédibilité sur plusieurs fronts.

Le gaming des classements. Une étude menée par Cohere, Stanford, le MIT et l'Allen Institute a révélé que Meta avait testé 27 variantes privées de Llama 4 sur la plateforme LMArena avant son lancement, pour ne publier que le meilleur score. La version soumise au classement était "optimisée pour la conversationnalité" et différait de la version réellement mise à disposition du public.

La contamination des données. Des modèles comme GPT-5.2, Claude Opus 4.5 et Gemini 3 Flash ont été capables de reproduire mot pour mot du code provenant de benchmarks, suggérant qu'ils avaient été exposés à ces tests pendant leur entraînement. C'est un peu comme passer un examen en ayant eu accès aux réponses à l'avance.

La saturation des tests. Les scores MMLU dépassent maintenant les 90%. Le rapport Stanford HAI 2025 montre des progressions vertigineuses : GPQA a bondi de 48,9 points en un an, SWE-bench de 67,3 points. Quand tout le monde a 18/20, la note ne veut plus dire grand-chose.

L'écart entre la note et la réalité

Le chiffre qui résume tout : sur SWE-bench Verified, les meilleurs modèles affichent environ 80% de réussite. Sur SWE-Lancer, un benchmark basé sur de vrais projets freelance, ce score tombe à 26,2%. L'écart est énorme.

Un autre exemple parlant : des chercheurs ont découvert qu'un classificateur de rayons X, censé détecter les poumons affaissés, avait en réalité appris à repérer les drains thoraciques visibles sur les images. Quand on retirait les images avec des drains, la performance chutait de 20%. Le modèle avait de bons scores, mais pour les mauvaises raisons.

C'est le problème de la "validité de construit" : les benchmarks ne mesurent pas toujours ce qu'ils prétendent mesurer.

Que faire en attendant des benchmarks plus solides ?

L'étude Google propose des outils concrets. Les chercheurs ont mis en open source un simulateur qui permet de tester différents ratios N/K avant de construire un benchmark. C'est un premier pas vers des évaluations plus rigoureuses.

D'autres initiatives émergent : SWE-bench Pro avec des critères plus stricts (les scores tombent à 23%), des benchmarks dynamiques qui changent régulièrement pour éviter la contamination, ou encore des évaluations spécifiques par domaine plutôt que des classements généralistes.

Mais en attendant que l'écosystème évolue, le réflexe à adopter est simple : ne jamais se fier à un seul benchmark. Croiser les sources, tester les modèles sur ses propres cas d'usage, et garder en tête que derrière chaque score, il y a des humains qui n'étaient probablement pas d'accord entre eux.

Les benchmarks ne sont pas inutiles. Mais ils sont bien moins objectifs qu'on ne le pense. Et c'est en le sachant qu'on les utilise le mieux.

Sujets abordés :

ÉthiqueGoogleDécryptage

Questions fréquentes

Pourquoi les benchmarks IA ne sont-ils pas fiables ?
Les benchmarks reposent sur des jugements humains subjectifs. Une étude Google montre que les annotateurs sont souvent en désaccord, ce qui rend les scores peu reproductibles avec moins de 10 évaluateurs par item.
Qu'est-ce que l'étude 'Forest vs Tree' de Google ?
C'est une étude de Google Research présentée à la conférence AAAI en 2026. Elle analyse le compromis entre évaluer beaucoup d'items avec peu d'annotateurs (forêt) ou moins d'items avec plus d'évaluateurs (arbre).
Combien d'annotateurs faut-il pour un benchmark fiable ?
Selon l'étude Google, il faut au moins 10 évaluateurs par item pour obtenir des résultats reproductibles. La pratique standard de 1 à 5 annotateurs est largement insuffisante.
Comment les entreprises manipulent-elles les benchmarks IA ?
Certaines entreprises testent plusieurs variantes privées de leurs modèles sur les plateformes de classement et ne publient que le meilleur score. Des cas de contamination de données d'entraînement ont aussi été documentés.
La newsletter IA gratuite