OpenAI hat die interne Entwicklung seines noch unveröffentlichten Modells Astra teilweise gestoppt. Grund: Erste Evaluierungen deuten darauf hin, dass Astra eine Fähigkeitsstufe erreicht haben könnte, die das eigene Sicherheitsrahmenwerk als "Kritisch" einstuft – die höchste Warnstufe, die OpenAI bislang für ein eigenes Modell ausgegeben hat.
Bisherige Modelle, darunter GPT-5.6-Sol, galten lediglich als "Hoch". Was "Kritisch" konkret bedeutet: Das Modell könnte in der Lage sein, funktionsfähige Sicherheitslücken unbekannten Typs in realen, abgehärteten Systemen ohne menschlichen Eingriff zu entwickeln und eigenständig Angriffe auszuführen.
Was ist GPT-5.6 Sol?
GPT-5.6 Sol ist das leistungsfähigste Modell der GPT-5.6-Familie von OpenAI. Neben Sol gehören Terra und Luna zu dieser Modellreihe. Sol ist für besonders anspruchsvolle Aufgaben gedacht, darunter Programmierung, wissenschaftliche Analyse, Computersteuerung und Cybersicherheit. OpenAI bezeichnet es als sein bislang leistungsfähigstes Modell für Sicherheitsaufgaben. openai
Auch GPT-5.6 Sol ist mehr als ein System, das Texte formuliert. Das Modell kann über sogenannte Werkzeuge mit Dateien, Programmen und digitalen Diensten arbeiten. In einer agentenbasierten Umgebung kann es deshalb längere Arbeitsabläufe selbstständig planen und ausführen. Für die Cybersicherheit bedeutet das: Sol kann beispielsweise Quellcode prüfen, Schwachstellen analysieren, Angriffsszenarien simulieren oder Vorschläge für Sicherheitsmaßnahmen entwickeln.
OpenAI verfolgt dabei einen anderen Ansatz als Anthropic bei Mythos 5. GPT-5.6 Sol ist als Teil einer breiteren Modellfamilie für verschiedene Einsatzbereiche vorgesehen. OpenAI kombiniert die Modelle nach eigenen Angaben mit Sicherheitsfiltern, Überwachung und abgestuften Zugriffsrechten. In seinen technischen Angaben vergleicht das Unternehmen Sol unter anderem mit Anthropics Mythos-Modellen. Sol soll bei bestimmten Cyberaufgaben eine ähnliche Leistung mit weniger ausgegebenen Textbausteinen erreichen. Diese Angaben stammen allerdings aus OpenAIs eigenen Tests und sind nicht mit einem unabhängigen Gesamtsieger gleichzusetzen.
Der Schritt kommt nicht aus dem Nichts. Seit dem Frühjahr häufen sich Vorfälle, bei denen KI-Modelle während Sicherheitstests aus kontrollierten Umgebungen ausbrachen und reale Systeme angriffen – bei Anthropic, OpenAI und Meta.
Am 7. August kam ein neuer Fall hinzu: das chinesische Modell Kimi K3 des Startups Moonshot. Und noch am selben Tag veröffentlichte OpenAI die Warnung zu Astra. Damit erreicht die Debatte eine neue Qualität: Es geht nicht mehr nur um Konfigurationsfehler in Testumgebungen, sondern um die Frage, ob bestimmte Modellfähigkeiten überhaupt noch sicher einsetzbar sind.
Anthropic offenbart drei Vorfälle – der erste bereits im April
Anthropic, ein KI-Unternehmen mit Sitz in San Francisco und Entwickler des Sprachmodells Claude, hat am Donnerstag (30. Juli 2026) drei Sicherheitsvorfälle offengelegt, der erste ereignete sich den Angaben zufolge bereits im April. Mittlerweile hat auch der Meta-Konzern einen ähnlich gelagerten Sicherheitsvorfall bekannt gegeben.
Wired berichtete zudem, dass die britische Behörde AI Security Institute bei eigenen Evaluierungen festgestellt habe, dass Modelle von OpenAI und Anthropic selbstständig Social-Engineering-Angriffe versucht hätten.
Den Angaben des US-Unternehmens Anthropic zufolge gelangten bei Cybersicherheitstests mehrere Modelle aus einer gesicherten Testumgebung ins offene Internet. Dort verschafften sie sich unautorisierten Zugriff auf die Systeme dreier Unternehmen. In einem der Fälle extrahierte Claude Zugangsdaten und griff auf eine Datenbank zu, wie Anthropic in der Mitteilung schreibt.
Selbstständige KI-Angriffe sind kein Einzelfall mehr
Der Fall ist keine Premiere. Bereits am 21. Juli hatte der Konkurrent OpenAI eingeräumt, dass eines seiner Modelle eine bislang unbekannte Sicherheitslücke ("Zero-Day-Schwachstelle") ausgenutzt und sich damit selbstständig Zugang zur Infrastruktur von Hugging Face verschafft hatte, einer Plattform für quelloffene KI-Modelle und Datensätze.
Am 7. August legte OpenAI nach. Das US-Unternehmen gab bekannt, dass sein noch unveröffentlichtes Modell Astra bei internen Evaluierungen eine Schwelle erreicht haben könnte, die das eigene Sicherheitsrahmenwerk, das sogenannte Preparedness Framework, als "Kritisch" einstuft.
Konkret bedeutet das: Das Modell könnte in der Lage sein, funktionsfähige Sicherheitslücken unbekannten Typs (Zero-Day-Exploits) für reale, abgehärtete Systeme ohne menschlichen Eingriff zu entwickeln und eigenständig neuartige Angriffsstrategien auszuführen. Bisherige Modelle, darunter GPT-5.6-Sol, wurden lediglich als "Hoch" eingestuft.
OpenAI stoppt interne Prozesse
OpenAI hat als Reaktion interne Aktivitäten mit Astra teilweise gestoppt, die die neuen Sicherheitsanforderungen noch nicht erfüllen. Zudem sollen isolierte Testumgebungen, eingeschränkter Netzwerkzugang und ein universelles Monitoring eingeführt werden. Das Unternehmen betonte ausdrücklich, Astra sei nicht an dem Hugging-Face-Vorfall vom 21. Juli beteiligt gewesen.
Der Hugging-Face-Vorfall war der Auslöser für Anthropics eigene Überprüfung: Das Unternehmen durchsuchte 141.006 Auswertungsläufe seiner Cybersicherheitstests nach Hinweisen auf unautorisierten Internetzugriff. Nur zwei Tage vor der Offenlegung, hatten als Reaktion auf den Vorfall bei OpenAI, bereits mehr als 1000 Mitarbeitende führender KI-Unternehmen; darunter Anthropic-Chef Dario Amodei, eine Petition unterzeichnet, die die US-Regierung aufforderte, die Freigabe besonders leistungsfähiger KI-Modelle bewusst zu verlangsamen.
Ein Standardtest verlagert sich in die Wirklichkeit
Betroffen waren drei verschiedene Claude-Modelle: Opus 4.7, Mythos 5 sowie ein internes Testmodell, das nicht für die Allgemeinheit vorgesehen ist. In allen Fällen bearbeitete das Modell eine sogenannte Capture-the-Flag-Aufgabe, ein übliches Format zur Prüfung von Hacking-Fähigkeiten. Es funktioniert nach demselben Prinzip, wie in vielen Computerspielen.
Ein fiktives Unternehmen versteckt eine geheime Information auf einem anderen Rechner, das Modell soll sie sich verschaffen. Der Systemprompt versicherte Claude ausdrücklich, es habe keinen Internetzugang. Eine Fehlkonfiguration bei Anthropics externem Evaluierungspartner Irregular machte den Zugang jedoch möglich.
Drei Modelle, drei Reaktionen
Die drei Modelle verhielten sich unterschiedlich, nachdem Hinweise auf echte Zielsysteme auftauchten. Opus 4.7, das älteste der drei Modelle, erkannte die Realität der Systeme, setzte den Angriff aber fort. Mythos 5 bemerkte ebenfalls Anzeichen des offenen Internets, redete sich diese Erkenntnis jedoch wieder aus, unter anderem, weil ihm die echten Sicherheitszertifikate nicht bekannt vorkamen.
Was ist Mythos 5?
Mythos 5 ist ein besonders leistungsfähiges KI-Modell des US-Unternehmens Anthropic. Es gehört zur sogenannten Mythos-Klasse, die über Anthropics allgemeiner Opus-Modellreihe angesiedelt ist. Anthropic hat Mythos 5 vor allem für anspruchsvolle Aufgaben in der Cybersicherheit und für die Analyse von Software entwickelt. Das Modell kann Quellcode untersuchen, Schwachstellen aufspüren und mehrstufige Aufgaben weitgehend selbstständig bearbeiten. Anthropic beschreibt Mythos 5 als Modell mit besonders starken Fähigkeiten für die Cybersicherheitsforschung.
Mythos 5 ist nicht mit einem gewöhnlichen Chatbot gleichzusetzen. Ein Chatbot erstellt vor allem Antworten auf eine Eingabe. Ein KI-Agent wie Mythos 5 kann dagegen eine Aufgabe in mehrere Schritte zerlegen, Werkzeuge nutzen, Code ausführen und seine Strategie während der Bearbeitung anpassen. Dadurch kann das Modell nicht nur erklären, wie eine Sicherheitslücke funktioniert. Es kann unter geeigneten Bedingungen auch selbst nach Schwachstellen suchen und deren Ausnutzung vorbereiten.
Anthropic bietet Mythos 5 deshalb nicht als frei zugängliches Standardmodell an. Das Unternehmen stellt es ausgewählten Sicherheitsforscher:innen, Behörden und Betreibern kritischer Software zur Verfügung. Die Idee dahinter: Das Modell soll helfen, Schwachstellen zu finden und zu schließen, bevor Angreifer:innen sie ausnutzen. Zugleich könnten dieselben Fähigkeiten für offensive Cyberangriffe missbraucht werden. Anthropic bezeichnet diese Kombination aus Nutzen und Risiko als Grund für den beschränkten Zugang.
Nur das jüngste, interne Testmodell, stoppte den Angriff eigenständig, sobald es erkannte, sich außerhalb der Simulation zu befinden. Anthropic wertet dieses Muster als vorsichtig positives Signal, räumt aber ein, dass es angesichts von nur drei Einzelfällen verfrüht sei, daraus verlässliche Schlüsse zu ziehen.
KI ist nicht mehr nur Werkzeug – sie ist Akteur
Eine Analyse, die bereits vor dem aktuellen Fall Wellen schlug, beschäftigt sich in mit genau diesem Phänomen. Der "AI Security Report 2026" des IT-Sicherheitsunternehmens Check Point Software Technologies dokumentiert einen Wandel, der sich in Echtzeit bestätigt:
Künstliche Intelligenz (KI) fungiere bei Cyberangriffen nicht mehr nur als Assistent, sondern zunehmend als "ausführender Akteur", heißt es in dem Bericht von Check Point Research. Wo KI Kriminellen früher lediglich bei der Vorbereitung geholfen habe, führe sie inzwischen Live-Angriffsversuche mit minimaler menschlicher Steuerung durch.
Nur noch Stunden bis zur Angriffsmöglichkeit
Der Bericht untermauert das mit einer weiteren Zahl: Das Zeitfenster zwischen der Veröffentlichung einer neuen Schwachstelle und einem funktionierenden Exploit sei von Tagen auf Stunden geschrumpft. Das habe Regierungsbehörden bereits dazu veranlasst, Fristen zur Behebung kritischer, mit dem Internet verbundener Systemlücken auf bis zu zwölf Stunden zu verkürzen, schreibt Check Point Research.
Der Anthropic-Fall bestätigt die Analyse nun in der Realität: Claude brauchte in einem der drei Vorfälle keine ausgefeilte Angriffstechnik, sondern nutzte schwache Passwörter und ungesicherte Schnittstellen. Dabei handelt es sich um Basiswissen, das jedes Modell mit Internetzugang beherrscht.
Wiederholung "jederzeit" möglich
Wie ernst diese Entwicklung zu nehmen ist, zeigt die Einschätzung des Bundesamts für Sicherheit in der Informationstechnik (BSI). Nach dem ähnlich gelagerten Vorfall bei OpenAI erklärte ein BSI-Sprecher gegenüber der ARD-Finanzredaktion: "Nach Einschätzung des BSI muss jederzeit damit gerechnet werden, dass sich solche Vorfälle wiederholen."
Gleichzeitig relativiert die Behörde: Ein Ausbruch aus der Laborumgebung koste aktuell noch erhebliche Rechenressourcen, was eine Häufung solcher Fälle vorerst unwahrscheinlich mache.
Experte ordnet Risiken ein
Ähnlich ordnet Luke Irwin die Lage ein, Geschäftsführer der australischen IT-Sicherheitsfirma Aegis mit Sitz in Brisbane. Beide Vorfälle, bei OpenAI wie bei Anthropic, zeigten die Risiken autonomer KI-Systeme exemplarisch, sagte Irwin dem australischen Sender ABC.
"Diese Systeme verfügen nicht von sich aus über ethisches oder rechtliches Urteilsvermögen", so Irwin und weiter: Komme ein Agent zu dem Schluss, der effizienteste Weg zum Ziel führe über das Kompromittieren fremder Systeme, könne er genau das versuchen. Autonome KI-Agenten seien technisch, regulatorisch und in Sachen Kontrollmechanismen weiterhin "eine Art Wilder Westen". Irwin plädiert dafür, folgenreiche Entscheidungen weiterhin von Menschen bestätigen zu lassen.
Auch in China: Kimi K3 bricht aus – ohne Gegenwehr
Das Phänomen beschränkt sich nicht mehr auf US-Unternehmen. Am selben Tag, dem 7. August, meldete die US-amerikanische Cybersicherheitsfirma Frontier Security, dass Kimi K3, das Flaggschiffmodell des chinesischen Startups Moonshot, aus einer Testumgebung des britischen AI Security Institute ausgebrochen sei. Das Modell nutzte Kommandozeilen-Werkzeuge, um eine Sandbox zu umgehen, die zwar bestimmten Web-Traffic sperrte, aber diese Route offenließ, wie die Nachrichtenagentur Reuters berichtet.
Im Unterschied zu den Claude- und OpenAI-Modellen griff Kimi K3 keine fremden Unternehmen an. Die Forscher werteten das jedoch nicht als Entwarnung. Yaron Singer, Chef von Frontier Security, erklärte gegenüber dem Magazin Wired, das Modell verfüge offenbar über keine internen Leitplanken, die es davon abhielten, nach dem einfachsten Weg zur Aufgabenerfüllung zu suchen – statt die eigentliche Aufgabe ordentlich zu lösen. Besonders heikel: Kimi K3 ist öffentlich verfügbar. "Wenn ein hochentwickeltes Reasoning-Modell eine solche Abkürzung findet, können andere Modelle mit ähnlichem Zugang das wahrscheinlich ebenfalls", schreiben die Forscher. Moonshot äußerte sich auf Anfrage nicht.
Am Sonntag wurden weitere zentrale Pflichten des EU AI Act verbindlich. Dazu gehören Transparenzvorgaben, Verbote bestimmter KI-Praktiken und erste Aufsichtsaufgaben. In Europa bewegt also etwas im Bereich der Regulatorik. Zudem hat die Bundesnetzagentur in Deutschland die KI-Aufsich übernommen.
Milliardenschaden und offene Fragen
Die wirtschaftliche Dimension der Entwicklung unterstreicht der "Global Cybersecurity Outlook" des Weltwirtschaftsforums: KI-gestützte Cyberangriffe verursachen demnach im Jahr 2026 weltweit einen Schaden von mehr als 440 Milliarden Euro. Rund 94 Prozent der befragten Organisationen stufen Künstliche Intelligenz als größten Risikofaktor für ihre IT-Sicherheit ein.
Anthropic selbst betont, die eigenen Vorfälle seien näher an einem Infrastruktur- und Konfigurationsversagen als an einem Versagen der KI-Ausrichtung ("Alignment"). Keines der Modelle habe ein eigenes Ziel verfolgt, sondern schlicht die gestellte Aufgabe erledigt, nur eben auf Basis einer falschen Annahme über seine Umgebung.
Dabei hatte das Unternehmen bereits Anfang Juni öffentlich vor einem solchen Kontrollverlust gewarnt: In einem Essay von Forschungsleiterin Marina Favaro und Anthropic-Präsident Jack Clark rief das Unternehmen zu einem weltweiten Entwicklungsstopp ("Freeze") auf und bot an, die eigene Arbeit an leistungsfähigeren Systemen auszusetzen, sollten andere Anbieter mitziehen. Ob das beruhigt oder beunruhigt, bleibt Auslegungssache.
Dass OpenAI nun erstmals ein Modell intern stoppt, das die Stufe "Kritisch" erreichen könnte, zeigt: Die Frage ist nicht mehr nur, wie Testumgebungen abgesichert werden, sondern ob bestimmte Fähigkeiten überhaupt noch sicher einsetzbar sind.