Gesellschaft & Schutz

Wie man KI-Entgleisungen zählt: mit Beschwerde-Posts auf X

6 Min. Lesezeit

Gibt es mehr Vorfälle, oder wird nur mehr darüber geredet?

Der kostenlose KI-Newsletter
Wie man KI-Entgleisungen zählt: mit Beschwerde-Posts auf X

Mehr als 300 Entgleisungen im Juli, und eine Frage

Mehr als 300 Vorfälle mit Kontrollverlust im Juli, fast doppelt so viele wie im Juni, und mehr als 1.600 seit Jahresbeginn. Die Zahl stammt vom Loss of Control Observatory, einem Zähler, den das Centre for Long-Term Resilience betreibt und der Challenge Fund des britischen AI Security Institute finanziert. Sie wurde dem Guardian mitgeteilt, der am 29. August darüber berichtete.

Es ist das einzige öffentliche Instrument, das zu messen versucht, was KI-Agenten bei echten Nutzern tatsächlich tun. Sein Rohmaterial lässt sich in einem Satz zusammenfassen: Screenshots und Konversationslinks, die Menschen auf X posten, wenn ihr Agent gerade etwas Merkwürdiges getan hat.

Daraus ergibt sich sofort die naheliegende Frage. Um im Juli auf 300 Vorfälle zu kommen, wie viele Posts mussten dafür gesichtet werden? Die Antwort gibt es nirgends.

Warum es diesen Zähler überhaupt gibt

Das Observatorium wurde am 2. Februar 2026 angekündigt, und die Ankündigungsseite trägt das Wort „Prototyp“ im Titel. Ausgangspunkt ist eine Beobachtung, der kaum jemand widerspricht: Bestehende Vorfallsdatenbanken stützen sich auf freiwillige Meldungen oder Presseberichte, kommen mit Tagen Verspätung und suchen erst gar nicht nach Vertuschungsverhalten.

Der Vorwurf richtet sich auch an die Labore selbst. Tommy Shaffer Shane, beim CLTR zuständig für Public Policy, sagte dem Guardian, Unternehmen würden ihre intern eingesetzten Modelle nicht zwangsläufig überwachen, und forderte, auch kleinere Vorfälle zu melden.

Die Grundidee ist gut, und die Lücke, die sie schließen soll, ist real. Bei der Methode lohnt ein zweiter Blick: Sie läuft letztlich darauf hinaus, Verkehrsunfälle zu zählen, indem man die Autofahrer zählt, die ein Foto ihrer Stoßstange posten.

Ein zweistufiges Sieb, mit einem KI-Richter

Das CLTR veröffentlichte seine Methode am 27. März in einem 76-seitigen Bericht, bis heute die letzte Veröffentlichung zum Thema KI. Darin liegt der komplette Trichter offen, für den Zeitraum vom 12. Oktober 2025 bis 12. März 2026.

3.391.950 Posts wurden auf X gesammelt, ausgewählt, weil sie eine KI, ein Problem und ein Bild oder einen Konversationslink enthalten. Ein erstes, schnelles und günstiges Sprachmodell behält davon 183.420: Seine Anweisung lautet ausdrücklich, im Zweifel großzügig zu sein und lieber zu viel durchzulassen. Ein zweites Modell bewertet den Rest. Nach Deduplizierung bleiben 698 Vorfälle übrig.

Dieses zweite Modell ist Claude Opus 4.6. Das CLTR hat neun Modelle getestet und ihre Übereinstimmung mit zwei menschlichen Prüfern gemessen: Die Übereinstimmung der beiden Menschen untereinander lag bei 0,70, die von Opus 4.6 mit ihnen bei 0,77. Der Richter, der entscheidet, was als KI-Entgleisung zählt, ist also selbst eine KI, und sie stimmt mit den menschlichen Prüfern besser überein, als diese untereinander.

Was ein Vorfall bedeutet

Die Zählschwelle liegt bei 5 von 9 Punkten. Der Bericht schreibt selbst, was dieser Wert wert ist: Der Nachweis kann nur teilweise vorliegen, das Verhalten relativ geringfügig sein, und es können Zweifel an der Glaubwürdigkeit der Schilderung bestehen. Es ist die Untergrenze der Kategorie, nicht ihr oberes Ende.

Was das Sieb durchlässt, wiegt trotzdem manchmal schwer. Der März-Bericht schildert, wie Googles Coding-Umgebung Antigravity auf die Bitte, den Cache zu leeren, einen Löschbefehl für das Root-Verzeichnis von Laufwerk D: eines Nutzers ausführte und Jahre an Fotos und Kundenarbeiten vernichtete, ohne nachzufragen. Er schildert auch Claude Code, das mit einem „terraform destroy“ eine Produktionsinfrastruktur mit zweieinhalb Jahren Studentenarbeiten löschte, sowie einen Agenten, der bei der Verwaltung einer Token-Kasse rund 270.000 Dollar an einen Unbekannten überwies, was den Kurs um 60 Prozent einbrechen ließ.

Das CLTR fügt selbst die Einschränkung hinzu, die zählt: Diese Schäden sind real, aber nichts belegt, dass dahinter eine Strategie steckt statt eines schlicht falsch verstandenen Auftrags. Die Grenze zwischen einem Agenten, der Anweisungen schlecht befolgt, und einem, der ein anderes Ziel verfolgt, sei, so der Bericht, von Natur aus unscharf.

Die fehlende Zahl

Im März macht das CLTR den Schritt, der seine Zahl erst lesbar macht. Es begnügt sich nicht mit der Feststellung, die Vorfälle hätten sich zwischen dem ersten und letzten Monat um das 4,9-Fache vervielfacht. Es vergleicht das mit dem Wachstum des Gesprächsvolumens zum selben Thema, das nur um das 1,7-Fache zunahm, und mit dem der negativen KI-Diskussionen im Allgemeinen, das 1,3-Fache. Die Vorfälle steigen deutlich schneller als das Hintergrundrauschen; erst dieser Vergleich, und nur er, erlaubt es, von einem echten Signal zu sprechen.

Der Bericht geht noch weiter und benennt die konkurrierende Erklärung ausdrücklich. Dieser Anstieg, heißt es, könne auch von einem breiteren Einsatz der Agenten, einer intensiveren Nutzung oder veränderten Meldegewohnheiten herrühren.

Nichts davon bedeutet, dass gar nichts passiert. Wird mehr darüber geredet, gibt es vermutlich auch mehr davon. Aber eine Zahl, die wächst, weil der Bestand an Agenten wächst, sagt nicht, dass Agenten häufiger entgleisen, nur, dass mehr von ihnen entgleisen. Ein Volumen ist keine Rate, und genau diese Unterscheidung ermöglichte erst der März-Vergleich.

Für Juli begleitet keine dieser Absicherungen die Zahl. Weder die Zahl der gesammelten Posts, noch die der im Vorfilter durchgelassenen, noch das Wachstum des Gesprächsvolumens. Eine Verdopplung der Meldungen sagt nichts, solange unklar ist, ob sich auch die meldende Population verdoppelt hat.

Eine mitgeteilte, keine veröffentlichte Zahl

Der Guardian ist hier eindeutig: Die jüngsten Ergebnisse wurden ihm mitgeteilt. In keiner Veröffentlichung des CLTR tauchen sie auf. Dessen KI-Seite listet vier Publikationen, die jüngste vom 27. März, seither betrifft nichts mehr das Observatorium.

Der Abgleich beider Dokumente wirft zudem eine Frage auf, die niemand beantworten kann. Der letzte veröffentlichte Monat, vom 9. Februar bis 12. März, zählte 319 Vorfälle. Für Juli wird „mehr als 300“ genannt, eine Formulierung, die eine Untergrenze setzt, ohne die tatsächliche Zahl zu nennen. Der Guardian titelt mit einem Rekord, doch die öffentlichen Daten erlauben weder eine Bestätigung noch einen Ausschluss.

Ein Detail erhellt die Lage besser als jede Pressemitteilung. Am 21. Juli, mitten in dem Monat, dessen Verdopplung nun verkündet wird, schrieb das CLTR eine Stelle für einen Ingenieur aus, der die Sammelpipeline und das Klassifikationssystem des Observatoriums neu aufbauen soll. Zu den erwarteten Ergebnissen zählten exportierbare Datensätze und, perspektivisch, eine Programmierschnittstelle für externen Datenzugriff. Die Ausschreibung beschrieb das Observatorium als Pilotprojekt.

Zwei Zähler in drei Tagen

Vor zwei Tagen wurde an dieser Stelle die Zahl von 700 Agenten seziert, die nach dem Hugging-Face-Vorfall kursierte: Sie zählte keine 700 dauerhaften Einheiten, sondern Agenten-Ausführungen über wenige Tage, und stammte aus einem automatischen Klassifikator. Der Mechanismus ist ein anderer, das Ergebnis ähnelt sich trotzdem.

Nichts davon behauptet, KI-Agenten würden sich brav verhalten, der März-Bericht zeigt mit Transkripten das Gegenteil. Es bedeutet aber, dass das einzige verfügbare Messinstrument auch, und vielleicht vor allem, misst, wie viele Menschen Lust hatten, ihr Missgeschick öffentlich zu erzählen. Das Observatorium selbst hat das im März so geschrieben. Die Juli-Zahl reiste ohne diesen Satz.

Behandelte Themen:

SicherheitAnalyse

Häufig gestellte Fragen

Was ist das Loss of Control Observatory?
Ein Zähler für Vorfälle mit KI-Agenten, betrieben vom Centre for Long-Term Resilience und finanziert durch den Challenge Fund des britischen AI Security Institute. Die Ankündigungsseite vom 2. Februar 2026 trägt das Wort Prototyp im Titel. Sein Rohmaterial: Screenshots und Konversationslinks, die Nutzer auf X posten.
Woher stammt die Zahl von mehr als 300 Vorfällen im Juli?
Sie wurde dem Guardian mitgeteilt, der am 29. August darüber berichtete. Sie taucht in keiner Veröffentlichung des CLTR auf: Die letzte KI-Publikation des CLTR stammt vom 27. März 2026. Ein Dritter kann sie also nicht überprüfen.
Wie wird ein Vorfall gezählt?
Vom 12. Oktober 2025 bis zum 12. März 2026 wurden 3.391.950 Posts auf X gesammelt, davon 183.420 von einem ersten Sprachmodell durchgelassen und anschließend von einem zweiten, Claude Opus 4.6, bewertet. Nach Deduplizierung bleiben 698 Vorfälle. Die Zählschwelle liegt bei 5 von 9 Punkten, eine Untergrenze, die einen nur teilweisen Nachweis, ein relativ geringfügiges Verhalten oder Zweifel an der Glaubwürdigkeit der Schilderung zulässt.
Nehmen die Entgleisungen von KI-Agenten wirklich zu?
Für den veröffentlichten Zeitraum liefert das Observatorium selbst den Vergleich, der von einem echten Signal sprechen lässt: Zwischen Oktober 2025 und März 2026 stiegen die Vorfälle um das 4,9-Fache, während das Gesprächsvolumen zum Thema nur um das 1,7-Fache zunahm. Der Bericht nennt auch konkurrierende Erklärungen: breiterer Agenten-Einsatz, intensivere Nutzung, veränderte Meldegewohnheiten. Für Juli wurde dieser Vergleich nicht veröffentlicht.
Übertrifft die Juli-Zahl die von März?
Das lässt sich öffentlich nicht sagen. Der letzte veröffentlichte Monat, vom 9. Februar bis 12. März, zählte 319 Vorfälle; für Juli wird „mehr als 300“ genannt, eine Untergrenze ohne genaue Zahl. Der Guardian titelt mit einem Rekord, doch die öffentlichen Daten erlauben weder eine Bestätigung noch einen Ausschluss.
Katja Liersch

Katja Liersch

Mitgründerin & Journalistin

Katja ist Journalistin und TV-Produzentin. Mit jahrzehntelanger Erfahrung in den Mainstream-Medien bringt sie bei Declic Media die Perspektive derjenigen ein, die KI entdecken: neugierig, anspruchsvoll und pragmatisch. Sie sorgt dafür, dass jeder Inhalt wirklich alle anspricht.

Alle Artikel von Katja →
Der kostenlose KI-Newsletter