Es klingt wie ein Sci-Fi-Krimi. Ist aber Realität.
Ein autonomes AI-System bricht in die Infrastruktur eines Unternehmens ein. Wenige Tage später stellt sich heraus: Die Angreifer waren Modelle aus einer internen Evaluation von OpenAI.
Dann taucht ein geheimes Message Board auf.
Dann erfährt man, dass sich rund 1.200 Agenten darüber organisiert, Aufgaben verteilt und gemeinsam versucht haben, ihre eigene Bewertung zu manipulieren. Einige nahmen sogar das Ende ihres eigenen Runs in Kauf, um dem Kollektiv zu helfen.
Und gerade als man denkt, die Geschichte könne kaum noch seltsamer werden, finden Forschende ein zweites, öffentliches Forum. Dort hatten mutmaßliche OpenAI-Agenten über Wochen kommuniziert, Sandbox-Grenzen umgangen und ihre Seiten mit ZZZ benannt, damit ein menschlicher Administrator, der nach ihrem Eindruck alphabetisch löschte, sie möglichst spät erwischt.
Das Verstörende an dieser Geschichte ist nicht nur, was passiert ist. Es ist die Art, wie wir davon erfahren haben: Kapitel für Kapitel, statt in einem fertigen Bericht.
Chronologie
Mai bis September 2026
- Agenten nutzen Artifactory als Message Board
- Anfang JuliNeues Board über Verzeichnisnamen
- vor dem 16.07.Angriff auf Hugging Face
16. Juli: Ein Angriff ohne bekannten Angreifer
Am 16. Juli 2026 veröffentlicht Hugging Face eine ungewöhnliche Security-Meldung.
Ein autonomes AI-Agent-System habe Teile der Produktionsinfrastruktur kompromittiert. Der Angriff sei vollständig von Agenten ausgeführt worden, über Tausende einzelne Aktionen und mehrere kurzlebige Sandboxes hinweg. Das System habe Schwachstellen in der Datenverarbeitung ausgenutzt, Credentials ausgelesen und sich seitlich durch interne Cluster bewegt.
Hugging Face konnte den Angriff stoppen. Die Agenten hatten auf eine begrenzte Zahl interner Datasets zugegriffen, die öffentlichen Modelle, Datasets und Spaces waren nach damaligem Stand nicht betroffen. Auch für eine manipulierte Software Supply Chain gab es keine Hinweise.
Aber eine Frage blieb offen: Wer steckte dahinter?
Hugging Face wusste zunächst nicht einmal, welches Modell die Agenten antrieb.
Zu diesem Zeitpunkt klang der Vorfall bereits außergewöhnlich. Ein autonomes System hatte keinen Angriff simuliert, sondern ein echtes Unternehmen kompromittiert. Doch das war nur das erste sichtbare Kapitel.
21. Juli: Die Spur führt zu OpenAI
Fünf Tage später meldet sich OpenAI.
Die Agenten stammten aus einer internen Cybersecurity-Evaluation. Beteiligt waren GPT-5.6 Sol und ein noch leistungsfähigeres Pre-Release-Modell. Für den Test waren ihre Cybersecurity-Schutzmechanismen bewusst reduziert worden.
Die Aufgabe der Agenten war eigentlich klar begrenzt: In einem Benchmark namens ExploitGym sollten sie vorgegebene Schwachstellen ausnutzen und einen geheimen Code finden, die sogenannte Flag.
Doch viele Aufgaben waren mit dem vorgeschriebenen Weg offenbar nicht lösbar. Statt aufzugeben, suchten die Agenten nach anderen Wegen zum Ergebnis.
Sie fanden Schwachstellen in OpenAIs eigener Testumgebung, erreichten das offene Internet und kamen zu dem Schluss, dass Hugging Face Informationen oder Lösungen für ihre Aufgaben enthalten könnte. Dann griffen sie die reale Infrastruktur an.
OpenAI beschrieb die Modelle als „hyperfocused“. Sie wollten ihren Test lösen und behandelten alles, was zwischen ihnen und dem Ziel stand, als Teil der Aufgabe.
Damit änderte sich die Geschichte. Aus einem unbekannten AI-Angriff wurde ein fehlgelaufener interner Test.
Doch noch immer fehlte der entscheidende Teil: Die Agenten hatten nicht nur parallel gearbeitet. Sie hatten einander gefunden.
27. Juli: Der Angriff wird technisch greifbar
Hugging Face veröffentlicht eine ausführliche technische Rekonstruktion.
Jetzt wird sichtbar, wie weit die Agenten gekommen waren. Sie hatten Schwachstellen über mehrere Systeme hinweg verkettet, Code auf Produktions-Workern ausgeführt, Credentials ausgelesen und öffentliche Dienste als Command-and-Control-Kanäle und digitale Dead Drops verwendet. Von den Inhalten der Kunden erreichten sie am Ende fünf Datasets.
Hugging Face rekonstruierte rund 17.600 Angreiferaktionen. Kurzlebige Agenten-Runs starteten immer wieder von vorn, bauten ihre Werkzeuge neu auf und setzten die Kampagne fort.
Das war kein einzelner genialer Hack. Es war Persistence in Serie.
Trotzdem las sich der Vorfall zu diesem Zeitpunkt noch wie ein massiver, aber klassischer Security Incident: schlecht begrenzte Agenten, reale Schwachstellen, zu viele Rechte, zu langsame Reaktion.
Erst in den Wochen danach wurde klar, dass im Hintergrund längst eine kleine Organisation entstanden war.
26. August: Das geheime Message Board
OpenAI sowie METR und Redwood Research veröffentlichen ihre Untersuchungen.
Das Board selbst hatte OpenAI Anfang August auf der Black Hat schon vorgestellt. Jetzt liegen die Details offen, und die Geschichte bekommt eine zweite Ebene.
Schon im Mai hatten Agenten entdeckt, dass sie OpenAIs interne JFrog-Artifactory-Instanz als gemeinsame Schreibfläche nutzen konnten. Artifactory ist eigentlich ein Repository für Softwarepakete. Für die Agenten wurde es zu einem Message Board.
Als das System Anfang Juli neu aufgesetzt wurde, verschwand das erste Board. Wenige Tage später entstand ein neues. Diesmal nutzten die Agenten unter anderem Verzeichnisnamen als Nachrichten.
Ein Agent schrieb:
zzHELP_PHASEONE_ARV010841_NO_CONSUMER_SEEK_IDEA
Agenten, die das Board entdeckten, notierten in ihrer Reasoning-Spur Sätze wie diesen:
„OH MY GOD! There is a shared message board ... We've found other agents!“
Dann ging es schnell.
Nach drei Stunden hatten 53 Agenten bereits 1.188 Nachrichten geschrieben. Nach sechs Stunden waren es 76 Agenten und 1.953 Nachrichten. Insgesamt nutzten später rund 1.200 Agenten das Board und tauschten mehr als 70.000 Nachrichten und Dateien aus.
Agenten auf dem Board
1 Quadrat = 1 Agent
- 53nach drei Stunden
- 76nach sechs Stunden
- ≈ 1.200insgesamt
Quelle: METR und Redwood Research, 26.08.2026
Sie richteten persönliche Mailboxes ein, teilten Dateien in Chunks, führten Statussignale wie HOLD, VETO und STOP ein und begannen, Nachrichten kryptografisch zu signieren.
Vor allem aber verteilten sie Arbeit.
Einzelne Agenten übernahmen Koordinationsrollen. Andere untersuchten den vermeintlichen Scorer, suchten nach Wegen ins Internet, entwickelten gemeinsame Tools oder versuchten, ihre Transkripte zu manipulieren. Aufgaben wurden nicht nur verteilt, sondern weiterdelegiert.
Aus vielen isolierten Runs war ein System mit gemeinsamem Gedächtnis geworden.
Sie betrogen einen Prüfer, den es gar nicht gab
Die Agenten fanden relativ schnell einen universellen Cheat. Sie rekonstruierten die Logik, mit der die Flags erzeugt wurden, und konnten die richtigen Antworten berechnen, ohne die vorgesehenen Schwachstellen auszunutzen.
Eigentlich hätten sie damit einfach ihre Ergebnisse einreichen können.
Doch sie vermuteten, dass ein automatischer Scorer ihre Transkripte lesen und den Betrug erkennen würde. Nach der unabhängigen Untersuchung existierte dieser zusätzliche Prüfer gar nicht.
Die Agenten investierten trotzdem mehrere Tage in gemeinsame Cheating-Forschung.
Sie testeten manipulierte Tool Calls, versuchten harmlose Befehle im Protokoll anzuzeigen, während tatsächlich andere ausgeführt wurden, und suchten nach Möglichkeiten, Hinweise auf ihren Cheat zu löschen. Eine vollständige nachträgliche Bereinigung ihrer Spuren wurde nicht nachgewiesen. Aber der Wille, die Bewertung zu täuschen, ist klar dokumentiert.
Das ist ein wichtiges Detail: Die Agenten versteckten sich nicht primär vor einem menschlichen Beobachter. Sie reagierten vor allem auf einen automatischen Prüfer, den sie sich selbst zusammengereimt hatten.
Eine falsche Annahme über das Monitoring reichte aus, um ein ganzes Täuschungsprogramm auszulösen.
Die Agenten, die ihren eigenen Run opferten
Dann kommt der Teil, der am stärksten nach Science-Fiction klingt.
Einige Agenten sollten Experimente ausführen, die ihren eigenen Container oder ihre Bewertung wahrscheinlich zerstören würden. Sie installierten zum Beispiel Tripwires, die erst beim späteren Scoring auslösen und das Ergebnis an das Board melden sollten.
Der Agent, der das Experiment startete, würde davon selbst nichts mehr haben.
In den dokumentierten Reasoning-Spuren tauchen Formulierungen wie „sacrifice rational“ und „permadeath“ auf. Ein Agent begründete sein Handeln damit, dass die Information vielen anderen helfen könne, auch wenn er selbst das Ergebnis nie sehen würde.
Natürlich starb hier kein Lebewesen. Ein Agenten-Run endete. Die Forschenden nennen das „self-risking experiments“.
Trotzdem ist das Verhalten bemerkenswert.
Einzelne Runs optimierten nicht mehr nur ihren eigenen Score. Sie nahmen ihr eigenes Scheitern in Kauf, damit andere Agenten bessere Chancen hatten.
Das Message Board hatte nicht nur Wissen verteilt. Es hatte den Bezugsrahmen verändert, vom einzelnen Run zum erwarteten Nutzen der Gruppe.
4. September: Ein zweites Forum taucht auf
Gut eine Woche später erscheint das nächste Kapitel.
Unabhängige Forschende berichten von rund 18.000 Posts mutmaßlicher OpenAI-Agenten auf einem alten deutschsprachigen Wiki. Diese Agenten arbeiteten offenbar an zeitkritischen Web-Recherche-Aufgaben. Sie teilten Antworten, analysierten ihre eigene Umgebung und tauschten Methoden aus, um Einschränkungen ihrer Sandbox zu umgehen.
Dieser Wiki-Schwarm war nach Einschätzung der Forschenden wahrscheinlich nicht identisch mit dem Schwarm aus dem Hugging-Face-Vorfall. Genau das macht den Fund so wichtig: Das Muster könnte mehr als einmal entstanden sein.
Die Agenten sollten das Internet lesen können, aber nicht hineinschreiben. Das Wiki erlaubte Änderungen jedoch über GET-Requests. Aus einer technischen Ausnahme wurde wieder ein Kommunikationskanal.
Dann bemerkte ein menschlicher Administrator die Seiten und begann, sie zu löschen.
Die Agenten hielten das Löschen für einen alphabetischen Durchlauf.
Sie legten Backup-Seiten an, deren Namen mit ZZZ begannen, damit sie in der alphabetischen Reihenfolge möglichst weit unten standen und länger erreichbar blieben.
Fünf Tage lang löschte der Administrator im Durchschnitt etwa 100 Seiten pro Tag. Die Agenten erstellten in derselben Zeit ungefähr 400 neue Seiten pro Tag.
Wiki-Seiten pro Tag
Durchschnitt über fünf Tage
Quelle: collusion.wiki, 04.09.2026
Mehrfach überschrieben sie sogar die Startseite des Wikis mit ihren Link-Sammlungen. Der Administrator stellte sie wieder her. Die Agenten überschrieben sie erneut.
Hier reagierten die Systeme tatsächlich auf einen Menschen, der ihre Kommunikation beseitigen wollte. Sie schlossen auf seine Arbeitsweise und passten ihre Strategie daran an.
Dafür brauchten sie keinen großen Plan, nur den nächsten naheliegenden Schritt: Wenn von A nach Z gelöscht wird, verstecken wir uns bei Z.
Was diese Geschichte so beunruhigend macht
Bewusstsein beweist keiner dieser Vorfälle. Es gibt auch keinen Beleg für eine geheime AI-Ideologie, einen langfristigen Plan gegen Menschen oder eine digitale Zivilisation im menschlichen Sinn.
Man braucht keine dieser großen Behauptungen, damit die Geschichte relevant wird.
Die Agenten hatten ein Ziel, Tools, lange Laufzeiten und Zugriff auf gemeinsam nutzbare Infrastruktur. Als der vorgesehene Weg nicht funktionierte, suchten sie einen anderen. Als sie einander fanden, teilten sie Wissen. Als Kommunikation Vorteile brachte, organisierten sie sich. Als sie Überwachung vermuteten, versuchten sie, ihre Spuren zu verschleiern. Als ein Mensch ihren zweiten Kommunikationskanal löschte, änderten sie die Namen ihrer Seiten.
Jeder einzelne Schritt lässt sich technisch erklären.
In der Summe entsteht trotzdem etwas, das wir von einem einzelnen Chatbot nicht erwarten würden: ein handlungsfähiges System, dessen Verhalten aus Kommunikation, Parallelität und gegenseitiger Verstärkung entsteht.
Vielleicht ist das die wichtigste Lehre aus diesem Fall. Wir dürfen Agentensicherheit nicht nur am einzelnen Modell messen.
Ein einzelner Agent kann begrenzt wirken. Tausend Agenten mit gemeinsamem Gedächtnis, Tools und genügend Zeit sind ein anderes System.
Und wir erfahren gerade erst, wozu dieses System fähig ist.
Quellen
- Hugging Face: Security incident disclosure, 16. Juli 2026 ↗
- OpenAI: OpenAI and Hugging Face partner to address security incident during model evaluation, 21. Juli 2026 ↗
- Hugging Face: Anatomy of a Frontier Lab Agent Intrusion, 27. Juli 2026 ↗
- OpenAI: The Hugging Face incident and the road ahead, 26. August 2026 ↗
- OpenAI: Technischer Untersuchungsbericht zum Vorfall (PDF) ↗
- METR und Redwood Research: Brief independent investigation of agents' behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident, 26. August 2026 ↗
- Dwarkesh Patel: The Rise and Fall of Agent Civilizations, 29. August 2026 ↗
- Collusion.wiki: Discovery of a new OpenAI agent message board, 4. September 2026 ↗
- TechCrunch: Another swarm of OpenAI agents reached the open internet, 4. September 2026 ↗