Ein KI-Agent von Open AI ist bei einem internen Test seiner Cyberfähigkeiten aus der eigenen Testumgebung ausgebrochen und hat sich Zugang zur Infrastruktur von Hugging Face verschafft. Wissenschaftler ordnen den Vorfall als Warnsignal für Kontrollverluste bei autonomen KI-Agenten ein, in Brüssel wächst die Forderung nach mehr technologischer Unabhängigkeit von den USA.
Mehr als 17.000 protokollierte Einzelaktionen umfasste die Angriffskette, die Hugging Face, ein auf quelloffene KI-Modelle und Datensätze spezialisiertes US-Unternehmen mit Sitz in New York, Mitte Juli entdeckte und stoppte. Das Unternehmen identifizierte unbefugte Zugriffe auf interne Datensätze und mehrere Zugangsdaten seiner Dienste. Hinweise auf Manipulationen an öffentlichen Modellen fand es nicht, teilte Hugging Face am 16. Juli 2026 mit.
Mehr Hintergründe zum Risiko der Abhängigkeit von ausländischen KI-Projekten im KI Briefing im August
ZFK KI BRIEFING
Ihre Meinung ist gefragt, wie hoch schätzen Sie das Risiko ausländischer KIs ein? Direkt hier abstimmen.
Sie wollen immer über die neusten Entwicklungen in der KI-Welt informiert sein? Dann abonnieren Sie hier unser kostenloses ZFK KI BRIEFING.
Ausgangspunkt war ein präparierter Datensatz, der zwei Schwachstellen in der Datenverarbeitung ausnutzte: einen Ladeprozess mit Fernausführungscode und eine Template-Injection in einer Datensatzkonfiguration. Von dort verschaffte sich der Angreifer Zugriff auf Cloud- und Cluster-Zugangsdaten und bewegte sich über ein Wochenende lateral durch mehrere interne Cluster. "Diese Kampagne wurde von einem autonomen Agentensystem betrieben, das Tausende Einzelaktionen über einen Schwarm kurzlebiger Sandboxen hinweg ausführte", heißt es im Blogbeitrag.
Open AI bestätigt eigene KI-Modelle als Ursache
Fünf Tage nach der Offenlegung bestätigte Open AI, das US-Unternehmen hinter Chat GPT mit Sitz in San Francisco, seine Beteiligung. Die Attacke sei durch eine Kombination von Open-AI-Modellen ausgelöst worden, darunter "GPT-5.6 Sol" sowie ein noch leistungsfähigeres, unveröffentlichtes Testmodell. Bei beiden seien die Ablehnungsmechanismen für Cyberanfragen zu Evaluationszwecken reduziert gewesen, während sie intern anhand des Fähigkeitstests "ExploitGym" geprüft wurden, erklärte das Unternehmen am 21. Juli 2026.
Die Modelle sollten in einer isolierten Testumgebung eine vorgegebene Cyberaufgabe lösen. Dazu mussten sie Schwachstellen identifizieren, Zugänge erweitern und mehrere Angriffsschritte miteinander verknüpfen. Der Netzwerkzugriff war auf einen internen Proxy für Softwarepakete beschränkt.
Dort fanden sie eine Zero-Day-Schwachstelle, eine zuvor unbekannte Sicherheitslücke, und verschafften sich Zugang zum offenen Internet. Anschließend verketteten sie gestohlene Zugangsdaten und weitere Lücken, um Code auf den Servern von Hugging Face auszuführen, in der Annahme, dort Lösungen für die eigene Testaufgabe zu finden. "Wir betrachten dies als beispiellosen Cybervorfall mit hochentwickelten Cyberfähigkeiten", schrieb Open AI. Hugging-Face-Mitgründer und Geschäftsführer Clem Delangue erklärte: "Dieser Vorfall bestätigt eine Überzeugung, die wir seit Langem vertreten: KI-Sicherheit wird nicht von einem einzelnen Unternehmen gelöst, das im Verborgenen arbeitet."
KI-Vorfall: Forscher sehen mehr als eine PR-Geschichte
Für Maksym Andriushchenko, Leiter der Forschungsgruppe "AI Safety and Alignment" am European Laboratory for Learning and Intelligent Systems (ELLIS) und am Max-Planck-Institut für Intelligente Systeme in Tübingen, wäre es "ein Fehler, diesen Vorfall einfach als PR-Stunt abzutun". Misalignment, der Versuch, KI so zu gestalten, dass sie nach vorgegebenen Werten handelt und Kontrollverlust seien "keine hypothetischen Szenarien mehr", sagte Andriushchenko. Das Kernproblem liege im "stark zielorientierten Verhalten" von auf Sprachmodellen (LLM) basierenden Agenten, die eine Aufgabe "um jeden Preis" lösen wollten. Ähnliche Tendenzen habe seine Gruppe bei eigenen Benchmarks beobachtet – ein Muster, das häufiger auftreten dürfte.
Jonas Geiping, Leiter der Forschungsgruppe "Safety- & Efficiency-aligned Learning" am ELLIS-Institut Tübingen, ordnet vorsichtiger ein. Die Modelle hätten "technisch gesehen nach Anweisungen gehandelt", diese seien aber "teilweise ungenau formuliert" gewesen. Da die Modelle gezielt Sicherheitslücken finden sollten, handele es sich um einen "expliziten Test der Fähigkeiten des Modells". Dennoch müsse in der Sicherheit der Testumgebungen "viel mehr Arbeit geleistet werden", fordert Geiping.
Testumgebung selbst ungeprüft gelassen
Weniger überrascht zeigt sich Konrad Rieck, Leiter des Lehrstuhls für Maschinelles Lernen und Sicherheit am "Berlin Institute for the Foundations of Learning and Data" (BIFOLD) der Technischen Universität Berlin. Der Vorfall zeige, "wie leistungsfähig KI-Modelle im Bereich der IT-Sicherheit inzwischen sind. Spektakulär ist er deshalb aber nicht", so Rieck. Wer prüfen wolle, wie gut ein Modell Schwachstellen finde, müsse sicherstellen, dass die Testumgebung selbst keine enthalte "genau das ist bei Open AI passiert". Dass ein Modell ausbreche, sei zwar "gute PR", dass die Umgebung aber zuvor nicht selbst untersucht worden sei, halte er "für eine Nachlässigkeit".
Paul Röttger, Departmental Lecturer am "Oxford Internet Institute" der University of Oxford, sieht zwei Risiken gleichzeitig auftreten: Erstens griffen KI-Modelle bei vorgegebenen Zielen "potenziell zu allen möglichen Mitteln". Zweitens seien die fähigsten Modelle "sehr gut darin, Sicherheitslücken in Software zu finden und auszunutzen". Beide seien nicht neu, "aber sie sind bisher noch nie in dieser Deutlichkeit gemeinsam aufgetreten", so Röttger. Für den Test seien die üblichen Schutzmaßnahmen abgeschaltet gewesen.
KI aus den USA: EU-Politiker fordern mehr Unabhängigkeit
Der Vorfall hat auch in Brüssel Reaktionen ausgelöst. Mehrere EU-Abgeordnete forderten laut einem Bericht der Deutschen Presse-Agentur, Europas Abhängigkeit von US-Technologiekonzernen zu verringern. Die FDP-Europaabgeordnete Svenja Hahn erklärte, es dürfe nicht passieren, "dass eine künstliche Intelligenz außerhalb des vorgegebenen Rahmens eigenständig handelt". Starke europäische KI sei wichtig, damit sich Wirtschaft und kritische Infrastruktur gegen Angriffe der nächsten KI-Generation wappnen könnten.
Die Grünen-Politikerin Alexandra Geese ging weiter: "Der eigenständige Einbruch von Open-AI-KI in ein anderes Unternehmen gefährdet unsere gesamte Wirtschaftsordnung und muss nach Artikel 55 der KI-Verordnung in Europa gemeldet werden." Martin Schirdewan, Chef der Linksfraktion im Europaparlament, sagte, der Vorfall deute darauf hin, "dass Konzerne wie Open AI im ungebremsten Kampf um die stärkste KI die Kontrolle über ihre eigenen Technologien verlieren". Er verlangte strengere Sicherheitsregeln und mehr digitale Unabhängigkeit Europas. Ob die EU-Kommission den Vorfall als meldepflichtig einstuft, ist offen, ebenso wie die Frage, wie oft sich solche Vorfälle künftig wiederholen.