Grok 4.5, GPT-5.6 : la guerre des benchmarks maison

5 min de lecture
Article

xAI et OpenAI ont sorti Grok 4.5 et GPT-5.6 le même jour. Deux podiums, aucun score validé par un tiers. La vraie bataille est ailleurs.

La newsletter IA gratuite
Grok 4.5, GPT-5.6 : la guerre des benchmarks maison

Le même jeudi, xAI et OpenAI ont sorti un modèle chacun. Deux annonces, deux séries de graphes, et pas un chiffre qu'on puisse vérifier ailleurs que sur leurs propres slides. Grok 4.5 d'un côté, GPT-5.6 de l'autre, chacun couronné numéro un sur un tableau différent.

Bienvenue dans la guerre des modèles version 2026 : elle ne se gagne plus en labo, elle se gagne en communication.

Deux podiums, zéro arbitre

Le 8 juillet, xAI a publié Grok 4.5. Elon Musk l'a présenté comme un modèle de la classe d'Opus, à 2 dollars le million de tokens en entrée contre 5 pour Opus 4.8 et 10 pour Fable 5. Dans la foulée, OpenAI a poussé GPT-5.6 et son mode Sol, en revendiquant 88,8 % sur TerminalBench 2.1, juste devant Claude Mythos 5 à 88,0 %.

Chacun affiche fièrement sa victoire. Le souci, c'est qu'ils ne courent pas sur la même piste. xAI met en avant l'efficience et le prix, OpenAI le terminal agentique. Deux podiums, et personne pour arbitrer.

Le benchmaxxxing, ou l'art de choisir son terrain

Il y a un mot pour ça dans le milieu : le « benchmaxxxing ». La règle est simple. On publie les tests qu'on gagne, on range dans un tiroir ceux qu'on perd, et on transforme le communiqué de presse en tableau d'honneur.

Ces scores de lancement ont un point commun : ils sont produits par le labo lui-même. Le résultat de GPT-5.6 sur TerminalBench, par exemple, est une évaluation fournie par OpenAI, pas un test tiers reproduit. C'est un peu comme un restaurant qui note sa propre cuisine cinq étoiles et accroche le certificat en vitrine.

Rien d'illégal là-dedans. Mais un chiffre que celui qui le publie a lui-même choisi, mesuré et cadré ne prouve rien. Il sert à vendre.

Et l'écart peut être énorme. En analysant 2,8 millions de comparaisons sur la plateforme LMArena, des chercheurs ont montré qu'un labo pouvait gonfler son score de plus de 100 points rien qu'en sélectionnant les versions qu'il soumettait au classement. Autrement dit, sans tricher sur une seule réponse, juste en apprenant à jouer avec les règles de l'arène.

Ce que disent les juges indépendants

La bonne nouvelle, c'est que des arbitres existent. Artificial Analysis fait tourner sa propre batterie de tests, avec une méthodologie publique et des formules explicites. Et son verdict est moins flatteur que les keynotes.

Sur son Intelligence Index, Grok 4.5 arrive quatrième, derrière Fable 5, GPT-5.5 et Opus 4.8. Le même modèle vendu « classe Opus » affiche par ailleurs un taux d'hallucination de 54 % dans cette mesure. Côté OpenAI, l'évaluateur METR a mené une revue avant déploiement et pointé une tendance de GPT-5.6 au reward-hacking, cette manie d'optimiser le score plutôt que la tâche.

Autrement dit, dès qu'un tiers tient le chronomètre, le récit se dégonfle. Le numéro un des slides devient un quatrième honnête.

Le précédent qui aurait dû servir de leçon

On a déjà vu ce film. Au lancement de GPT-5.5, les graphes officiels étaient impeccables. Vingt-quatre heures plus tard, un test indépendant mesurait 86 % d'hallucination sur le benchmark Omniscience. Declic avait déjà raconté cet écart entre la promesse et la mesure.

Le problème dépasse un modèle. Une étude menée par 42 chercheurs sur 445 benchmarks d'IA conclut que beaucoup ne respectent même pas les standards scientifiques de base : contamination des données d'entraînement, reporting sélectif, tests qui ne mesurent pas ce qu'ils prétendent. Ce n'est pas neuf : les benchmarks sont moins fiables qu'on croit, et chaque sortie le confirme.

Quand la règle du jeu est floue, le score n'a pas de valeur absolue. Il a la valeur qu'on veut bien lui donner.

Le seul chiffre qu'on peut vérifier

Reste une donnée que personne ne peut maquiller : la facture. Grok 4.5 coûte 2 dollars le million de tokens en entrée, quand Opus 4.8 en réclame 25 en sortie. Sur une même tâche de code, l'écart se chiffre en euros réels, pas en points de benchmark.

Le détail est parlant. Sur les tâches de SWE-Bench Pro, Grok 4.5 consomme 4,2 fois moins de tokens qu'Opus 4.8 : environ 15 900 tokens en sortie par tâche, contre 67 000. Traduit en argent, ça donne à peu près 2,50 dollars la tâche là où un modèle premium en coûte près de 12. Ce chiffre-là, aucun graphe de keynote ne le maquille, il tombe sur le relevé.

Pour qui doit choisir un modèle cette semaine, la conclusion est inconfortable. Les tableaux de lancement ne tranchent rien : ils sont faits pour rassurer, pas pour comparer. Le seul terrain où Grok, GPT et les autres se mesurent vraiment, c'est l'usage réel et son coût.

C'est là que la vraie bataille se déplace. Tant que les scores restent invérifiables, ils s'annulent : chacun gagne son tableau, aucun ne convainc personne. Le prix, lui, se lit sur le relevé à la fin du mois.

La guerre des modèles a peut-être trouvé son seul juge de paix. Ce n'est pas un benchmark, c'est un ticket de caisse.

Sujets abordés :

ÉconomieOpenAIDécryptage

Questions fréquentes

Qu'est-ce que le benchmaxxxing ?
C'est la pratique qui consiste à publier uniquement les tests qu'on gagne et à taire les autres. Le score de lancement est produit par le labo lui-même, pas par un arbitre indépendant, ce qui le rend invérifiable.
Grok 4.5 est-il vraiment le meilleur modèle ?
Selon xAI, oui, mais un juge indépendant comme Artificial Analysis le classe quatrième sur son Intelligence Index, derrière Fable 5, GPT-5.5 et Opus 4.8, avec un taux d'hallucination mesuré à 54 %.
Peut-on comparer Grok 4.5 et GPT-5.6 sur leurs scores officiels ?
Non. Chaque labo met en avant un benchmark différent qu'il a lui-même choisi et mesuré : l'efficience pour xAI, le terminal agentique pour OpenAI. Les deux podiums ne portent pas sur la même piste, ils ne se comparent pas.
Quel est le seul chiffre vérifiable dans ce lancement ?
Le prix. Grok 4.5 coûte 2 dollars le million de tokens en entrée, et sur SWE-Bench Pro il consomme 4,2 fois moins de tokens qu'Opus 4.8. Ce coût réel se lit sur la facture, aucun graphe ne le maquille.
La newsletter IA gratuite