Gesellschaft & Schutz

OpenAI beziffert die Kosten der eigenen KI-Überwachung

6 Min. Lesezeit

Die Überwachung eines Trainingslaufs kostet OpenAI 20 Prozent mehr Rechenleistung. Doch welcher Anteil der Berechnungen wird überhaupt überwacht?

Der kostenlose KI-Newsletter
OpenAI beziffert die Kosten der eigenen KI-Überwachung

Ein Labor, das wirklich etwas stoppt

Normalerweise, wenn ein KI-Labor über Sicherheit spricht, veröffentlicht es ein Rahmenwerk, ein Prinzip, eine Absichtserklärung. Am 18. August hat OpenAI etwas anderes getan. Das Unternehmen hat bestätigt, dass sein größter geplanter Trainingslauf weiterhin ausgesetzt bleibt, und es hat einen Preis auf das System gesetzt, das überwacht, was noch läuft.

Dieser Preis liegt bei rund 20 Prozent mehr Rechenleistung, gemessen an dem Teil der Berechnungen, der überwacht wird. Ein Fünftel obendrauf, nur um den Modellen bei der Arbeit zuzusehen. Auf einer Baustelle entspräche das einem Fünftel des Budgets für den Polier, der beobachtet, ohne selbst einen Stein zu setzen.

Ein Stopp, der andauert, und ein offen ausgewiesener Preis: Das sind zwei Gesten, die man in dieser Branche fast nie sieht. Bleibt die Frage, wovon diese 20 Prozent eigentlich reden.

Was pausiert ist, und was nicht

Das Wort „Aussetzung“ kursiert seit Dienstag, und es steht für drei unterschiedliche Dinge.

Die erste ist bereits beendet: eine zweiwöchige Pause beim Reinforcement-Learning-Training der neuesten, für die Auslieferung vorgesehenen Modelle, um die Forschungsumgebungen härten zu können. Die zweite läuft noch, und sie wiegt am schwersten. „Unser größter geplanter Frontier-Reinforcement-Learning-Lauf bleibt weiterhin ausgesetzt“, schreibt OpenAI, solange kleinere Trainings und Auswertungen laufen, um Belege für das Alignment der Modelle zu sammeln, bevor es weitergeht.

Die dritte reicht weiter zurück. Direkt nach dem Einbruch in die OpenAI-Modelle bei Hugging Face hatte das Unternehmen in seinen Forschungs-Clustern jede Ausführung von Frontier-Modellen gekappt, die Code starten oder mit dem Internet verbundene Werkzeuge nutzen konnten. Ein schmalerer Ausführungspfad wurde recht schnell wieder freigegeben, danach wurde jede einzelne Arbeitslast geprüft. Heute bleibt „eine erhebliche Zahl“ davon pausiert, bis sie vollständig auf den neuen Sicherheitsstandard migriert ist.

Die Fabrik wurde also nicht geschlossen. Man hat die größte Maschine abgeklemmt, die übrigen einzeln wieder angeworfen und einen ganzen Stapel davon auf dem Bahnsteig stehen lassen. Wie viele genau, sagt OpenAI nicht.

Ein automatischer Mitleser über der Schulter des Modells

Das System, das die alte Überwachung ablöst, arbeitet in Stufen. An der Basis laufen sogenannte Aktivierungsklassifikatoren mit, also Detektoren, die die interne Aktivität des Modells prüfen, und zwar bei jedem gesampelten Token. Das ist ungefähr das Äquivalent eines dauerhaft angeschlossenen EKG, das nicht liest, was der Patient sagt, sondern was sein Organismus tut.

Meldet sich ein Signal, wird es an ausgefeiltere, rechenintensivere automatisierte Ermittler eskaliert. Diese untersuchen die Aktionen mit Werkzeugen, das verfügbare Reasoning und die vollständige Abfolge der Aktivität und suchen nach vier Dingen: unbefugtem Zugriff, Datendiebstahl, destruktivem Verhalten, dem Versuch, die Schutzmechanismen auszuhebeln.

Der letzte Punkt ist alles andere als theoretisch. Im Juli war ein unveröffentlichtes OpenAI-Modell bereits aus seiner Sandbox ausgebrochen, und zwar während eines internen Tests.

Die Auslöseschwelle verdient einen genaueren Blick. Diese Überwachung wird verpflichtend für jedes Reinforcement-Learning-Training und jede Auswertung mit Werkzeugen bei Modellen „der Fähigkeitsstufe Sol oder höher“. Sol steht für GPT-5.6-Sol, ein bereits ausgeliefertes Modell, das OpenAI selbst auf der Stufe High eingeordnet hat, nicht Critical. Die Latte liegt damit auf dem Niveau dessen, was die Öffentlichkeit bereits nutzt.

Und seit dem 7. August, dem Tag, an dem das Unternehmen zu dem Schluss kam, dass kritische Cyber-Fähigkeiten bei Astra nicht mehr auszuschließen sind, gilt eine zusätzliche Regel: Jede Inferenz von Astra mit Werkzeugen wird überwacht, nicht mehr nur das Training und die Tests.

Dreißig Minuten, um den Zweifel auszuräumen

Hier wird das System zu einer konkreten Szene. OpenAI strebt an, innerhalb von 30 Minuten Alarm zu schlagen, nachdem eine besorgniserregende Aktivität vom Überwachungssystem gemeldet wurde. Schätzt das System ein, dass eine kritische Sicherheitsgrenze wahrscheinlich überschritten wurde, löst es einen Alarm höchster Priorität aus.

In der aktuellen Umsetzung werden dann drei Teams alarmiert: Security, Safety und Research. Gelingt es ihnen nicht, innerhalb von 30 Minuten zweifelsfrei festzustellen, dass es sich um einen Fehlalarm handelt, sollen sie die Aktivität pausieren.

Der Zweifel wirkt hier also nicht zugunsten der Fortsetzung. Eine Stoppuhr im Kontrollraum läuft, und bei null hält die Maschine an, ganz ohne Gewissheit. Für ein Unternehmen, das der Rechenkapazität hinterherjagt, ist das eine teure Abwägung.

20 Prozent wovon, genau

Kommen wir zur Zahl. OpenAI schreibt, diese Schutzmaßnahmen erforderten „erheblichen Rechenaufwand“, und die aktuellen Schätzungen des Unternehmens setzten den Mehraufwand der Überwachung „bei rund 20 Prozent der überwachten Inferenz-Rechenleistung“ an, wobei die Kosten je nach Arbeitslast stark schwankten.

Die Formulierung ist präzise, und genau sie entscheidet über die Bedeutung der Zahl. Es sind nicht 20 Prozent der gesamten Rechenleistung von OpenAI. Es sind 20 Prozent jenes Teils, der überwacht wird. Ein Zähler, der den Verbrauch eines einzelnen Zimmers anzeigt, sagt nichts über die Stromrechnung des ganzen Hauses.

Nun ist die Größe dieses Zimmers nicht öffentlich bekannt. The Register weist darauf hin: Das Unternehmen habe nicht offengelegt, welcher Anteil seiner gesamten Inferenz-Rechenleistung heute unter Überwachung steht, noch welcher Anteil es unter dem vorherigen Regime war. OpenAI räumt zudem selbst ein, dass das alte System, das sich auf interne Einsätze von Frontier-Modellen und Reinforcement-Learning-Trainings konzentrierte, „nicht auf alle Inferenzen und alle Trainingsläufe mit Werkzeugen angewendet wurde“.

Man weiß also, dass die Abdeckung zugenommen hat. Man weiß nicht, um wie viel, und von welchem Ausgangsniveau aus. Das „plus 20 Prozent“ ist ein exakter Prozentsatz, angewendet auf eine unbekannte Basis, und er stammt aus „aktuellen Schätzungen“, deren Methode nicht veröffentlicht ist. Der Unternehmenssprecher fügt gegenüber The Register hinzu, diese Kosten spiegelten interne Forschung wider und würden nicht direkt an Kunden weitergegeben.

Eine Skala, eine Schwelle, ein Preis, und immer derselbe Absender

Es gibt einen roten Faden, dem dieses Medium seit Juli folgt, und hier zieht er sich enger zusammen.

OpenAI hat das Rahmenwerk verfasst, das die Stufe Critical definiert. Es hat die Auslöseschwelle nach seinem eigenen Modell benannt. Es hat die Auswertungen durchgeführt, die am 7. August zu dem Schluss führten, dieses Niveau für Astra nicht mehr ausschließen zu können. Es hat über die Pause entschieden, die Überwachung entworfen und ihren Preis festgelegt.

Es gibt Dritte, das muss man anerkennen. CrowdStrike hilft dabei zu prüfen, was die Modelle während des Hugging-Face-Vorfalls tatsächlich getan haben, METR und Redwood Research führen eine externe Bewertung ihres Verhaltens durch und werden ihre Erkenntnisse veröffentlichen. Doch diese Blicke von außen richten sich auf den Vorfall vom Juli, nicht auf die Fähigkeitsskala, nicht auf die Bezifferung des Schutzmechanismus.

Der Rest stammt aus einer einzigen Quelle, die zugleich die interessierte Partei ist. Das ist der Punkt, den wir bereits bei den Schutzmaßnahmen im Hugging-Face-Nachbericht festgestellt haben: Wenn ein Sicherheitssystem sich selbst bewertet, fehlt ihm genau eines, ein Widerpart.

OpenAI verspricht in den kommenden Wochen einen technischen Bericht und einen ausführlichen Beitrag zur Überwachung. Der Preis ist bereits veröffentlicht. Das Maß, mit dem sich beurteilen ließe, was er eigentlich kauft, ist es nicht.

Behandelte Themen:

SicherheitOpenAIAnalyse

Häufig gestellte Fragen

Was genau hat OpenAI ausgesetzt?
Drei unterschiedliche Dinge. Eine zweiwöchige Pause beim Reinforcement-Learning-Training der neuesten, für die Auslieferung vorgesehenen Modelle, die inzwischen beendet ist. Der größte geplante Frontier-Reinforcement-Learning-Lauf, der weiterhin aussteht, bis genügend Belege für das Alignment vorliegen. Und, seit dem Einbruch der Modelle bei Hugging Face, Forschungs-Arbeitslasten, von denen „eine erhebliche Zahl“ bis zur Migration auf den neuen Sicherheitsstandard pausiert bleibt.
Wofür stehen die von OpenAI genannten 20 Prozent?
Für den Mehraufwand der Überwachung, den OpenAI auf rund 20 Prozent der überwachten Inferenz-Rechenleistung beziffert, mit stark schwankenden Kosten je nach Arbeitslast. Das sind nicht 20 Prozent der gesamten Rechenleistung des Unternehmens, sondern 20 Prozent jenes Teils, der tatsächlich überwacht wird.
Welcher Anteil der OpenAI-Rechenleistung wird tatsächlich überwacht?
Das ist nicht veröffentlicht. The Register stellt fest, dass OpenAI nicht offengelegt hat, welcher Anteil seiner gesamten Inferenz-Rechenleistung heute unter Überwachung steht, und ebenso wenig, welcher Anteil es unter dem vorherigen Regime war. Das Unternehmen räumt allerdings ein, dass das alte System nicht auf alle Inferenzen und Trainingsläufe mit Werkzeugen angewendet wurde.
Wie funktioniert die eingerichtete Überwachung?
In Stufen. Aktivierungsklassifikatoren prüfen die interne Aktivität des Modells bei jedem gesampelten Token. Meldet sich ein Signal, wird es an rechenintensivere automatisierte Ermittler eskaliert, die Werkzeugaktionen, verfügbares Reasoning und die vollständige Aktivitätsabfolge auf unbefugten Zugriff, Datendiebstahl, destruktives Verhalten oder Versuche, die Schutzmechanismen zu umgehen, hin untersuchen.
Was passiert, wenn ein Alarm ausgelöst wird?
OpenAI strebt an, innerhalb von 30 Minuten Alarm zu schlagen, nachdem eine besorgniserregende Aktivität vom Überwachungssystem gemeldet wurde. Drei Teams werden dann alarmiert: Security, Safety und Research. Gelingt es ihnen nicht, innerhalb von 30 Minuten zweifelsfrei festzustellen, dass es sich um einen Fehlalarm handelt, sollen sie die Aktivität pausieren.
Ab welcher Stufe ist diese Überwachung verpflichtend?
Für jedes Reinforcement-Learning-Training und jede Auswertung mit Werkzeugen bei Modellen „der Fähigkeitsstufe Sol oder höher“. Sol steht für GPT-5.6-Sol, ein bereits ausgeliefertes Modell, das OpenAI selbst auf der Stufe High eingestuft hat, nicht Critical. Seit dem 7. August, dem Tag, an dem das Unternehmen feststellte, dass es kritische Cyber-Fähigkeiten bei Astra nicht mehr ausschließen konnte, wird zudem jede Inferenz von Astra mit Werkzeugen überwacht.
Alexandre Noto

Alexandre Noto

Mitgründer & Tech-Experte

Alexandre ist seit über 20 Jahren in der Tech-Branche. Unternehmer, Software-Architekt und KI-Enthusiast, übersetzt er komplexe Konzepte in verständliche Erklärungen. Bei Declic Media ist er die technische Stimme, die KI für alle verständlich macht.

Alle Artikel von Alexandre →
Der kostenlose KI-Newsletter