On a confié une boîte à des IA. Presque toutes coulent.

3 min de lecture
Article

Princeton a fait diriger une entreprise simulée par 13 IA pendant 500 jours. Trois finissent dans le vert. Une règle sans IA bat presque toutes les autres.

La newsletter IA gratuite
On a confié une boîte à des IA. Presque toutes coulent.

Un million de dollars en caisse, zéro client, 500 jours pour en faire une entreprise rentable. C'est le terrain de jeu que des chercheurs de Princeton ont confié à treize modèles d'IA, avec une consigne unique : dirige la boîte. À l'arrivée, trois seulement finissent avec plus d'argent qu'au départ. Et une règle de calcul, sans la moindre IA, en bat dix sur treize.

Un PDG en bac à sable

Le test s'appelle CEO-Bench, publié fin juin par le laboratoire de Zhuang Liu à Princeton. Chaque modèle pilote NovaMind, une entreprise de logiciel par abonnement entièrement simulée. Il fixe les prix, répartit le budget pub, arbitre entre qualité produit et R&D, dimensionne l'infrastructure, gère le support et négocie avec les gros clients.

Trente-quatre outils, dix-neuf tables de données, 500 jours simulés. La note finale, c'est l'argent qui reste en caisse à la fin. Rien d'abstrait là-dedans : ce sont les décisions qu'un dirigeant prend vraiment, étalées sur un an et demi.

Et pas de coup de chance qui sauve la mise : chaque modèle rejoue la partie trois fois, seule sa meilleure course est retenue. Les chiffres qui suivent sont donc déjà le haut du panier de chaque IA.

La règle bête qui humilie dix modèles

Voilà le détail qui pique. Les chercheurs ont glissé dans la course un concurrent sans cerveau : un script qui suit des règles fixes. Prix figés, quotas figés, concentration sur quelques segments de clients, capacité ajustée à la consommation récente. Aucune adaptation, aucune stratégie. Juste de la discipline.

Ce script termine quatrième, avec 15,7 millions de dollars en caisse. Il devance dix des treize modèles testés. Cinq d'entre eux ont fait carrément faillite, caisse à zéro. D'autres ont survécu en détruisant de la valeur : Qwen 3.7 Max et Claude Opus 4.7 finissent autour de 400 000 dollars, moins de la moitié de leur mise de départ.

Pourquoi la règle bête gagne-t-elle ? Parce qu'elle ne se ravise jamais. Les modèles, eux, surréagissent : ils changent de prix, lancent une campagne, font marche arrière, et brûlent du cash à chaque hésitation.

Trois modèles tiennent la distance

Trois IA passent quand même devant, et de loin. Claude Fable 5 finit à 47 millions de dollars, Claude Opus 4.8 à 27,8 millions, GPT-5.5 à 21,3 millions. Donc l'IA sait gérer une entreprise. Le problème, c'est qu'elle le fait rarement de façon fiable.

GPT-5.5 résume tout. Sur ses trois parties, il a coulé deux fois. Un seul modèle, Fable 5, reste dans le vert sur plusieurs essais. Les autres alignent un bon run et trois plantages, ou plantent d'entrée.

Ce que mesure vraiment le benchmark

Diriger une entreprise, ce n'est pas réussir un coup. C'est tenir une stratégie cohérente sur des centaines de décisions enchaînées, sans se contredire ni paniquer quand les chiffres baissent. C'est précisément là que la plupart des modèles cassent : ils savent ouvrir une partie brillamment, beaucoup moins la finir.

Le mythe de l'IA qui remplace les dirigeants bute donc sur un obstacle banal. La vraie barre à franchir, aujourd'hui, c'est ce script à règles fixes. Sur 500 jours, sa constance bête suffit à devancer dix modèles de pointe sur treize.

Sujets abordés :

ÉconomieAnthropicDécryptage

Questions fréquentes

Qu'est-ce que le benchmark CEO-Bench de Princeton ?
CEO-Bench est un test publié fin juin par le laboratoire de Zhuang Liu à Princeton. Treize modèles d'IA dirigent NovaMind, une entreprise de logiciel par abonnement entièrement simulée, sur 500 jours. La note finale est l'argent qui reste en caisse.
Combien d'IA réussissent à diriger l'entreprise ?
Sur treize modèles testés, trois seulement finissent avec plus d'argent qu'au départ : Claude Fable 5 (47 millions de dollars), Claude Opus 4.8 (27,8 millions) et GPT-5.5 (21,3 millions). Cinq font faillite, caisse à zéro.
Pourquoi un simple script bat-il la plupart des IA ?
Le script suit des règles fixes (prix figés, quotas figés, capacité ajustée à la consommation récente) et ne se ravise jamais. Il finit quatrième avec 15,7 millions de dollars, devant dix des treize modèles. Sa constance bat l'adaptation des IA, qui surréagissent et brûlent du cash à chaque hésitation.
L'IA peut-elle remplacer un dirigeant d'entreprise ?
Pas de façon fiable aujourd'hui. Diriger une entreprise demande de tenir une stratégie cohérente sur des centaines de décisions enchaînées. Un seul modèle, Fable 5, reste dans le vert sur plusieurs essais. Les autres alignent un bon run et des plantages.
La newsletter IA gratuite