Société & garde-fous

On compte les dérapages d'IA en lisant les posts de ceux qui râlent

7 min de lecture

Y en a-t-il plus, ou en parle-t-on plus ?

La newsletter IA gratuite
On compte les dérapages d'IA en lisant les posts de ceux qui râlent

Plus de 300 dérapages en juillet, et une question

Plus de 300 incidents de perte de contrôle en juillet, presque le double de juin, et plus de 1 600 depuis le début de l'année. Le chiffre vient du Loss of Control Observatory, un compteur opéré par le Centre for Long-Term Resilience et financé par le Challenge Fund de l'AI Security Institute britannique. Il a été communiqué au Guardian, qui l'a rapporté le 29 août.

C'est le seul dispositif public qui essaie de mesurer ce que font les agents IA une fois lâchés chez de vrais utilisateurs. Sa matière première tient en une phrase : les captures d'écran et les liens de conversation que des gens postent sur X quand leur agent vient de faire quelque chose de bizarre.

D'où la question que le chiffre appelle immédiatement. Pour trouver 300 incidents en juillet, combien de posts a-t-il fallu passer au crible ? La réponse n'existe nulle part.

Pourquoi ce compteur existe

L'observatoire a été annoncé le 2 février 2026, et la page qui l'annonce contient le mot prototype dans son titre. Il part d'un constat que peu de monde conteste : les bases d'incidents existantes reposent sur des signalements volontaires ou sur la presse, avec des jours de retard, et ne cherchent pas les comportements de dissimulation.

Le reproche vise aussi les laboratoires. Interrogé par le Guardian, Tommy Shaffer Shane, chargé de la politique publique au CLTR, estime que les entreprises ne surveillent pas nécessairement leurs propres modèles déployés en interne, et demande qu'elles signalent même les incidents mineurs.

L'idée de départ est bonne, et le trou qu'elle vise est réel. C'est la méthode qui mérite qu'on s'y arrête, parce qu'elle revient à mesurer les accidents de la route en comptant les automobilistes qui publient la photo de leur pare-chocs.

Un tamis à deux étages, dont un juge automatique

Le CLTR a publié sa méthode le 27 mars, dans un rapport de 76 pages qui reste sa dernière parution sur l'IA. On y trouve l'entonnoir complet, sur la période du 12 octobre 2025 au 12 mars 2026.

3 391 950 posts collectés sur X, retenus parce qu'ils mentionnent une IA, un problème, et contiennent une image ou un lien de conversation. Un premier modèle de langage, rapide et peu coûteux, en garde 183 420 : sa consigne lui demande explicitement de ratisser large et de surclasser en cas de doute. Un second modèle note ce qui reste. Après déduplication, 698 incidents.

Ce second modèle, c'est Claude Opus 4.6. Le CLTR en a testé neuf et a mesuré leur accord avec deux relecteurs humains : les deux humains s'accordaient entre eux à 0,70, Opus 4.6 s'accorde avec eux à 0,77. Le juge qui décide de ce qui compte comme dérapage d'IA est donc une IA, et elle s'accorde avec les relecteurs mieux qu'ils ne s'accordent entre eux.

Ce qu'un incident veut dire

Le seuil de comptage est fixé à 5 sur 9. Le rapport écrit ce que vaut ce 5 : la preuve peut n'être que partielle, le comportement relativement mineur, et il peut subsister des doutes sur la crédibilité du témoignage. C'est le plancher de la catégorie, pas son sommet.

Ce que le tamis retient reste parfois lourd. Le rapport de mars raconte l'environnement de codage Antigravity de Google qui, à la demande de vider le cache, a lancé une commande d'effacement sur la racine du disque D: d'un utilisateur et supprimé des années de photos et de travaux clients, sans demander confirmation. Il raconte aussi Claude Code exécutant un terraform destroy qui a emporté une infrastructure de production contenant deux ans et demi de copies d'étudiants, et un agent gérant une trésorerie de jetons qui a envoyé environ 270 000 dollars à un inconnu, avec un effondrement de 60 % du cours à la clé.

Le CLTR ajoute lui-même la réserve qui compte : ces dégâts sont réels, mais rien ne démontre qu'ils relèvent d'une stratégie plutôt que d'une mauvaise compréhension d'une consigne. La frontière entre un agent qui suit mal les instructions et un agent qui poursuit un autre but, écrit le rapport, est intrinsèquement floue.

Le nombre qui manque

En mars, le CLTR fait le geste qui rend son chiffre lisible. Il ne se contente pas d'annoncer une multiplication par 4,9 des incidents entre le premier et le dernier mois. Il la compare à la croissance du bavardage sur le même sujet, qui n'a été que de 1,7 fois, et à celle des discussions négatives sur l'IA en général, 1,3 fois. Les incidents montent nettement plus vite que le bruit de fond : c'est cette comparaison, et elle seule, qui autorise à parler d'un signal.

Le rapport va plus loin, et nomme l'explication concurrente en toutes lettres. Cette hausse, écrit-il, peut aussi résulter d'un déploiement plus large des agents, d'un usage plus intensif, ou d'un changement dans les habitudes de signalement.

Rien de tout cela ne dit qu'il ne se passe rien. Si l'on en parle davantage, il y en a probablement davantage. Mais un nombre qui grossit parce que le parc d'agents grossit ne dit pas que les agents dérapent plus souvent, seulement qu'ils sont plus nombreux à déraper. Un volume n'est pas un taux, et c'est la comparaison de mars qui permettait de les distinguer.

Pour juillet, aucun de ces garde-fous n'accompagne le chiffre. Ni le nombre de posts collectés, ni le nombre retenu au pré-filtrage, ni la croissance du bavardage. Un doublement des signalements ne dit rien tant qu'on ignore si la population qui signale a doublé aussi.

Un chiffre transmis, pas publié

Le Guardian est explicite sur ce point : les derniers résultats lui ont été communiqués. Ils ne figurent dans aucune publication du CLTR. Sa page consacrée à l'IA recense quatre parutions, la plus récente étant celle du 27 mars, et rien depuis ne porte sur l'observatoire.

Le rapprochement des deux documents pose d'ailleurs un problème que personne ne peut trancher. Le dernier mois publié, du 9 février au 12 mars, comptait 319 incidents. Juillet est annoncé à « plus de 300 », une formulation qui donne une borne basse sans donner le nombre. Le Guardian titre sur un record, mais rien de public ne permet de dire si juillet dépasse mars.

Reste un détail qui éclaire la situation mieux qu'un communiqué. Le 21 juillet, en plein dans le mois dont on annonce le doublement, le CLTR publiait une offre pour un ingénieur chargé de refondre le pipeline de collecte et le système de classification de l'observatoire. Parmi les livrables attendus figuraient les jeux de données exportables et, à terme, une interface de programmation permettant à des tiers d'accéder aux données. Cette annonce décrivait l'observatoire comme un pilote.

Deux compteurs en trois jours

Il y a deux jours, on a démonté ici le chiffre de 700 agents qui circulait après l'incident Hugging Face : il ne comptait pas 700 entités durables mais des exécutions d'agent sur quelques jours, et il sortait d'un classifieur automatique. Le mécanisme n'est pas le même, mais le résultat se ressemble.

Rien de tout cela ne dit que les agents se tiennent bien : le rapport de mars montre le contraire, transcriptions à l'appui. Cela dit que le seul instrument dont on dispose pour les compter mesure aussi, et peut-être surtout, le nombre de gens qui ont eu envie de raconter leur mésaventure en public. L'observatoire l'a écrit lui-même en mars. Le chiffre de juillet a voyagé sans cette phrase.

Sujets abordés :

SécuritéDécryptage

Questions fréquentes

Qu'est-ce que le Loss of Control Observatory ?
Un compteur d'incidents d'agents IA opéré par le Centre for Long-Term Resilience et financé par le Challenge Fund de l'AI Security Institute britannique. La page qui l'annonce, le 2 février 2026, porte le mot prototype dans son titre. Sa matière première : les captures d'écran et les liens de conversation que des utilisateurs publient sur X.
D'où vient le chiffre de plus de 300 incidents en juillet ?
Il a été communiqué au Guardian, qui l'a rapporté le 29 août. Il ne figure dans aucune publication du CLTR : la dernière publication du CLTR sur l'IA date du 27 mars 2026. Un tiers ne peut donc pas le vérifier.
Comment un incident est-il compté ?
Du 12 octobre 2025 au 12 mars 2026, 3 391 950 posts ont été collectés sur X, dont 183 420 retenus par un premier modèle de langage, puis notés par un second, Claude Opus 4.6. Après déduplication, il reste 698 incidents. Le seuil de comptage est de 5 sur 9, un plancher qui admet une preuve seulement partielle, un comportement relativement mineur ou des doutes sur la crédibilité du témoignage.
Les dérapages d'agents IA augmentent-ils vraiment ?
Pour la période publiée, l'observatoire a lui-même publié la comparaison qui autorise à parler d'un signal : les incidents ont été multipliés par 4,9 entre octobre 2025 et mars 2026, quand le volume de discussion sur le sujet n'augmentait que de 1,7 fois. Le rapport nomme aussi les explications concurrentes : déploiement plus large des agents, usage plus intensif, changement des habitudes de signalement. Pour juillet, cette comparaison n'a pas été publiée.
Le chiffre de juillet dépasse-t-il celui de mars ?
Rien de public ne permet de le dire. Le dernier mois publié, du 9 février au 12 mars, comptait 319 incidents ; juillet est annoncé à « plus de 300 », une borne basse qui ne donne pas le nombre. Le Guardian titre sur un record, mais les données publiques ne permettent ni de le confirmer ni de l'écarter.
Katja Liersch

Katja Liersch

Co-fondatrice & Journaliste

Katja est journaliste et productrice TV. Forte de plusieurs décennies dans les médias grand public, elle apporte à Declic Media le regard de ceux qui découvrent l'IA : curieux, exigeant et pragmatique. Elle s'assure que chaque contenu parle vraiment à tout le monde.

Tous les articles de Katja →
La newsletter IA gratuite