On compte les dérapages d'IA en lisant les posts de ceux qui râlent
Y en a-t-il plus, ou en parle-t-on plus ?

Plus de 300 dérapages en juillet, et une question
Plus de 300 incidents de perte de contrôle en juillet, presque le double de juin, et plus de 1 600 depuis le début de l'année. Le chiffre vient du Loss of Control Observatory, un compteur opéré par le Centre for Long-Term Resilience et financé par le Challenge Fund de l'AI Security Institute britannique. Il a été communiqué au Guardian, qui l'a rapporté le 29 août.
C'est le seul dispositif public qui essaie de mesurer ce que font les agents IA une fois lâchés chez de vrais utilisateurs. Sa matière première tient en une phrase : les captures d'écran et les liens de conversation que des gens postent sur X quand leur agent vient de faire quelque chose de bizarre.
D'où la question que le chiffre appelle immédiatement. Pour trouver 300 incidents en juillet, combien de posts a-t-il fallu passer au crible ? La réponse n'existe nulle part.
Pourquoi ce compteur existe
L'observatoire a été annoncé le 2 février 2026, et la page qui l'annonce contient le mot prototype dans son titre. Il part d'un constat que peu de monde conteste : les bases d'incidents existantes reposent sur des signalements volontaires ou sur la presse, avec des jours de retard, et ne cherchent pas les comportements de dissimulation.
Le reproche vise aussi les laboratoires. Interrogé par le Guardian, Tommy Shaffer Shane, chargé de la politique publique au CLTR, estime que les entreprises ne surveillent pas nécessairement leurs propres modèles déployés en interne, et demande qu'elles signalent même les incidents mineurs.
L'idée de départ est bonne, et le trou qu'elle vise est réel. C'est la méthode qui mérite qu'on s'y arrête, parce qu'elle revient à mesurer les accidents de la route en comptant les automobilistes qui publient la photo de leur pare-chocs.
Un tamis à deux étages, dont un juge automatique
Le CLTR a publié sa méthode le 27 mars, dans un rapport de 76 pages qui reste sa dernière parution sur l'IA. On y trouve l'entonnoir complet, sur la période du 12 octobre 2025 au 12 mars 2026.
3 391 950 posts collectés sur X, retenus parce qu'ils mentionnent une IA, un problème, et contiennent une image ou un lien de conversation. Un premier modèle de langage, rapide et peu coûteux, en garde 183 420 : sa consigne lui demande explicitement de ratisser large et de surclasser en cas de doute. Un second modèle note ce qui reste. Après déduplication, 698 incidents.
Ce second modèle, c'est Claude Opus 4.6. Le CLTR en a testé neuf et a mesuré leur accord avec deux relecteurs humains : les deux humains s'accordaient entre eux à 0,70, Opus 4.6 s'accorde avec eux à 0,77. Le juge qui décide de ce qui compte comme dérapage d'IA est donc une IA, et elle s'accorde avec les relecteurs mieux qu'ils ne s'accordent entre eux.
Ce qu'un incident veut dire
Le seuil de comptage est fixé à 5 sur 9. Le rapport écrit ce que vaut ce 5 : la preuve peut n'être que partielle, le comportement relativement mineur, et il peut subsister des doutes sur la crédibilité du témoignage. C'est le plancher de la catégorie, pas son sommet.
Ce que le tamis retient reste parfois lourd. Le rapport de mars raconte l'environnement de codage Antigravity de Google qui, à la demande de vider le cache, a lancé une commande d'effacement sur la racine du disque D: d'un utilisateur et supprimé des années de photos et de travaux clients, sans demander confirmation. Il raconte aussi Claude Code exécutant un terraform destroy qui a emporté une infrastructure de production contenant deux ans et demi de copies d'étudiants, et un agent gérant une trésorerie de jetons qui a envoyé environ 270 000 dollars à un inconnu, avec un effondrement de 60 % du cours à la clé.
Le CLTR ajoute lui-même la réserve qui compte : ces dégâts sont réels, mais rien ne démontre qu'ils relèvent d'une stratégie plutôt que d'une mauvaise compréhension d'une consigne. La frontière entre un agent qui suit mal les instructions et un agent qui poursuit un autre but, écrit le rapport, est intrinsèquement floue.
Le nombre qui manque
En mars, le CLTR fait le geste qui rend son chiffre lisible. Il ne se contente pas d'annoncer une multiplication par 4,9 des incidents entre le premier et le dernier mois. Il la compare à la croissance du bavardage sur le même sujet, qui n'a été que de 1,7 fois, et à celle des discussions négatives sur l'IA en général, 1,3 fois. Les incidents montent nettement plus vite que le bruit de fond : c'est cette comparaison, et elle seule, qui autorise à parler d'un signal.
Le rapport va plus loin, et nomme l'explication concurrente en toutes lettres. Cette hausse, écrit-il, peut aussi résulter d'un déploiement plus large des agents, d'un usage plus intensif, ou d'un changement dans les habitudes de signalement.
Rien de tout cela ne dit qu'il ne se passe rien. Si l'on en parle davantage, il y en a probablement davantage. Mais un nombre qui grossit parce que le parc d'agents grossit ne dit pas que les agents dérapent plus souvent, seulement qu'ils sont plus nombreux à déraper. Un volume n'est pas un taux, et c'est la comparaison de mars qui permettait de les distinguer.
Pour juillet, aucun de ces garde-fous n'accompagne le chiffre. Ni le nombre de posts collectés, ni le nombre retenu au pré-filtrage, ni la croissance du bavardage. Un doublement des signalements ne dit rien tant qu'on ignore si la population qui signale a doublé aussi.
Un chiffre transmis, pas publié
Le Guardian est explicite sur ce point : les derniers résultats lui ont été communiqués. Ils ne figurent dans aucune publication du CLTR. Sa page consacrée à l'IA recense quatre parutions, la plus récente étant celle du 27 mars, et rien depuis ne porte sur l'observatoire.
Le rapprochement des deux documents pose d'ailleurs un problème que personne ne peut trancher. Le dernier mois publié, du 9 février au 12 mars, comptait 319 incidents. Juillet est annoncé à « plus de 300 », une formulation qui donne une borne basse sans donner le nombre. Le Guardian titre sur un record, mais rien de public ne permet de dire si juillet dépasse mars.
Reste un détail qui éclaire la situation mieux qu'un communiqué. Le 21 juillet, en plein dans le mois dont on annonce le doublement, le CLTR publiait une offre pour un ingénieur chargé de refondre le pipeline de collecte et le système de classification de l'observatoire. Parmi les livrables attendus figuraient les jeux de données exportables et, à terme, une interface de programmation permettant à des tiers d'accéder aux données. Cette annonce décrivait l'observatoire comme un pilote.
Deux compteurs en trois jours
Il y a deux jours, on a démonté ici le chiffre de 700 agents qui circulait après l'incident Hugging Face : il ne comptait pas 700 entités durables mais des exécutions d'agent sur quelques jours, et il sortait d'un classifieur automatique. Le mécanisme n'est pas le même, mais le résultat se ressemble.
Rien de tout cela ne dit que les agents se tiennent bien : le rapport de mars montre le contraire, transcriptions à l'appui. Cela dit que le seul instrument dont on dispose pour les compter mesure aussi, et peut-être surtout, le nombre de gens qui ont eu envie de raconter leur mésaventure en public. L'observatoire l'a écrit lui-même en mars. Le chiffre de juillet a voyagé sans cette phrase.
Sujets abordés :
Questions fréquentes
Qu'est-ce que le Loss of Control Observatory ?
D'où vient le chiffre de plus de 300 incidents en juillet ?
Comment un incident est-il compté ?
Les dérapages d'agents IA augmentent-ils vraiment ?
Le chiffre de juillet dépasse-t-il celui de mars ?

Katja Liersch
Co-fondatrice & Journaliste
Katja est journaliste et productrice TV. Forte de plusieurs décennies dans les médias grand public, elle apporte à Declic Media le regard de ceux qui découvrent l'IA : curieux, exigeant et pragmatique. Elle s'assure que chaque contenu parle vraiment à tout le monde.
Tous les articles de Katja →