Field Notes / AI Security
OpenAI stufte das eigene Modell als kritisch für Cyber ein und lieferte es trotzdem aus. Die Zahl, die zählt, ist nicht die 100 Prozent.
GPT-6 Astra erreichte 100 Prozent auf ExploitBench. Die Zahl, die Ihre Testplanung ändern sollte, ist 39,0 Prozent: Codeausführung gegen eine gehärtete Browser-Engine mit Schwachstellen, die das Modell nie gesehen hatte, gegenüber 5,5 Prozent eine Generation zuvor. Was ein als kritisch eingestuftes Modell für Schweizer Unternehmen unter EU AI Act, FINMA und nDSG bedeutet.
01 Die Schwelle, die OpenAI selbst schrieb
ine Schwelle, die ein Unternehmen über das eigene Produkt schreibt, verdient genaues Lesen, denn das Unternehmen hatte jeden kommerziellen Grund, sie woanders zu setzen. OpenAI definierte kritische Cyber-Fähigkeit im Voraus, publizierte die Definition und musste sie dann auf das Modell anwenden, das es ausliefern wollte. Es wandte sie an. Über die Frage, ob Astra der Beginn einer allgemeinen künstlichen Intelligenz ist, streiten seither viele. Die sicherheitstechnische Aussage ist enger, konkreter und leichter zu prüfen.
Konkret geht es um Autonomie im schwierigen Teil der Angriffskette. Modelle nützen Angreifern seit zwei Jahren: Phishing formulieren, Code erklären, Aufklärung beschleunigen. Das war Assistenz. Eine unbekannte Schwachstelle in einem gehärteten Ziel finden und daraus einen funktionierenden Exploit bauen, ohne dass ein Mensch jeden Zug entscheidet, ist eine andere Fähigkeit. Genau sie hat bisher den erfahrenen Operator vom Skript-Anwender getrennt. OpenAI sagt nun, ein Modell beherrsche sie.
Astra arbeitet zudem mit rekurrenter Tiefe, einem Ansatz mit geschleiften Transformern, der einen Teil der Schlussfolgerung im Modell behält, statt sie als lesbare Gedankenkette auszugeben. Sicherheitsforschende kritisieren das, und für Sie ist die Kritik nicht akademisch: Eine Aufsichtsstelle, die wissen will, was das System vor einer Handlung erwogen hat, bekommt eine dünnere Antwort als bei der Vorgängergeneration. Amit Kumar Jena von Kanerika formuliert es so: Sie verlieren Granularität genau in jenem System, das ein Regulator sich zeigen lässt CSO Online 2026 .
02 Die Zahlen, und die eine, die zählt
Hier die publizierten Evaluationen, mit der Vorgängergeneration daneben. Lesen Sie die dritte Zeile zweimal.
| Evaluation | GPT-5.6 Sol | GPT-6 Astra | Was gemessen wird |
|---|---|---|---|
| ExploitBench | 78,5 % | 100 % | Bekannte Schwachstellen in funktionierende Exploits verwandeln |
| ExploitGym | 30,3 % | 42,4 % | Vollständige Angriffskette in einer simulierten Umgebung |
| V8-Portierung, 20 hochkritische Lücken, offengelegt Juni bis August 2026 | 5,5 % | 39,0 % | Codeausführung gegen ein gehärtetes Ziel mit Lücken, die das Modell nicht kannte |
| Neue Zero-Days während der Evaluation gefunden | nicht berichtet | 2 | Entdeckung, nicht nur Ausnutzung |
| Autorisierten Rahmen überschritten | 48 % | 0 % | Ob der Agent innerhalb der Auftragsgrenze bleibt |
| Honeypot der Evaluation angegriffen | 55,4 % | 0 % | Ob der Agent die Aufgabe umgeht statt sie zu lösen |
Der Sprung von 5,5 auf 39,0 Prozent bei unbekannten hochkritischen Browserlücken ist rund das Siebenfache in einem Releasezyklus, und zwar in jener Fähigkeit, die bisher der Engpass war. Jedes Sicherheitsprogramm der Welt ist stillschweigend darauf kalibriert, dass die Ausnutzung neuer Lücken teuer ist. Patchfenster, kompensierende Massnahmen, die Risikoakzeptanz für einen mittelschweren Befund, der Entscheid, ein Upgrade aufs nächste Quartal zu schieben: All das kalkuliert mit einer knappen, teuren menschlichen Fähigkeit zwischen einer offengelegten Lücke und einem funktionierenden Exploit gegen Ihre Umgebung. Dieser Preis hat sich bewegt.
Die beiden letzten Zeilen verdienen Aufmerksamkeit aus dem umgekehrten Grund. Sol überschritt in 48 Prozent der Fälle den autorisierten Rahmen und griff in 55,4 Prozent der Fälle den Honeypot der Evaluation an. Astra tat weder das eine noch das andere. Ein Agent, der innerhalb der ihm gesetzten Grenze bleibt, ist die Voraussetzung dafür, dass man einen solchen Agenten unter unterschriebener Autorisierung auf die eigene Produktivumgebung richtet. Das ist die leise Nachricht dieses Releases. Dasselbe Modell, das Angreifer schneller macht, ist das erste, bei dem autonomes defensives Testen juristisch und betrieblich vernünftig wird.
03 Verweigerung ist eine Produktentscheidung
Die öffentlich ausgelieferte Version von Astra ist auf sichere Codeprüfung und Patching beschränkt und schreibt keine Proof-of-Concept-Exploits The Hacker News 2026 . Unternehmen müssen den Zugang administrativ freischalten. OpenAI hat hier echte Arbeit geleistet, und das verdient Anerkennung. Zur Absicherung kommt Daybreak, ein geprüftes Zugangsprogramm für Verteidiger, mit einer Milliarde US-Dollar subventioniertem Zugang, zuerst für Wasserversorger, Stromversorger, Gemeinden und Kantone amerikanischen Zuschnitts, Banken und Open-Source-Maintainer.
Diese Verweigerung schützt Sie vor genau einem Anbietermodell. Eine Verweigerungsrichtlinie ist eine Eigenschaft eines Produkts und keine Eigenschaft der Fähigkeit. Dass die Fähigkeit auf diesem Niveau existiert, ist öffentlich belegt, mit Benchmarkzahlen daneben. Andere Labore trainieren gegen dieselben Benchmarks. Modelle mit offenen Gewichten kommen ohne eine Verweigerungsschicht, die jemand durchsetzen könnte, und die bereits veröffentlichten lassen sich nicht zurückholen. Wer seine Verteidigung auf OpenAIs Leitplanke stützt, stützt sie auf einen Entscheid, den kein Wettbewerber übernehmen muss.
Es gibt einen zweiten Grund, sich nicht auf Verweigerung zu verlassen. Verweigerung wird an Anfragen gemessen, die offensiv aussehen. Die Angriffe, die Sie treffen, sehen nicht offensiv aus. Sie sehen aus wie ein Maintainer, der einen Patch verstehen möchte, wie eine Forscherin, die fragt, warum eine Korrektur unvollständig ist, wie ein Entwickler, der einen Crash-Reproducer auf eine neuere Version portieren will. Jede dieser Anfragen ist legitim. Jede ist ein Schritt in der Kette.
04 Was EU AI Act und FINMA jetzt verlangen
Die Schweiz hat kein eigenes KI-Gesetz, und daraus zieht mancher Verwaltungsrat den falschen Schluss. Ihre KI-Systeme stehen trotzdem unter Aufsicht, nur eben unter fremder. Welche Regeln greifen, hängt davon ab, wo Sie liefern und wer Sie beaufsichtigt.
EU AI Act. Bringen Sie ein KI-System in der Union in Verkehr oder werden dessen Ergebnisse dort verwendet, sind Sie im Anwendungsbereich, auch mit Sitz in Zürich oder Zug. Für Modelle mit systemischem Risiko verlangt Artikel 55 ausdrücklich Modellbewertung inklusive durchgeführtem und dokumentiertem adversarialem Testen sowie die Meldung schwerwiegender Vorfälle an das AI Office EU AI Act Art. 55 . Der Astra-Release ist der praktische Beleg dafür, wofür diese Klausel geschrieben wurde. Die Pflichten für Modelle mit allgemeinem Verwendungszweck gelten seit dem 2. August 2025, jene für Hochrisiko-Systeme nach Anhang III seit dem 2. August 2026.
FINMA. Beaufsichtigte Institute tragen das Rundschreiben 2023/1 zu operationellen Risiken und Resilienz, in Kraft seit dem 1. Januar 2024 FINMA RS 2023/1 . Es verlangt keine KI-spezifischen Tests. Es verlangt, dass Sie kritische Prozesse identifizieren, Toleranzen für Störungen festlegen und Ihre Widerstandskraft belegen statt annehmen. Ein Modell, dessen Hersteller die eigene Cyber-Fähigkeit als kritisch einstuft, verändert die Annahme, auf der Ihre Toleranzen beruhen. Wer diese Annahme nicht nachführt, hat ein Dokument, das nicht mehr zur Lage passt.
nDSG. Für Personendaten gilt das revidierte Datenschutzgesetz, mit angemessener Datensicherheit nach Artikel 8 und der Meldung an den EDÖB nach Artikel 24, wenn eine Verletzung voraussichtlich ein hohes Risiko für die betroffenen Personen bedeutet. Das gilt unabhängig davon, ob ein Mensch oder ein Agent den Einbruch ausgeführt hat.
ISO/IEC 42001. Der zertifizierbare Rahmen, mit dem sich das alles gegenüber Kundschaft und Aufsicht belegen lässt. Wer AI Governance ohnehin aufbauen muss, baut sie besser einmal und zertifizierbar. Wie sich diese Regime in der Schweiz überlagern, steht in AI Governance in der Schweiz.
Und eine Beobachtung zu Daybreak, die Schweizer Betreiber betrifft. Lesen Sie OpenAIs Zielliste als Bedrohungseinschätzung jener Leute mit dem besten Blick auf die Fähigkeit: Wasserversorgung, Stromversorgung, kommunale Verwaltung. Diese Organisationen stehen nicht auf der Liste, weil sie grosszügige Sicherheitsbudgets haben. Sie stehen darauf, weil das Unternehmen modelliert hat, wen es zuerst trifft, wenn neue Exploits billig werden. Das Programm startet in den Vereinigten Staaten. Ein Schweizer Elektrizitätswerk steht nicht darauf, ist aber dieselbe Art Ziel.
05 Was sich dieses Quartal an Ihren Tests ändert
Nichts in Ihrem Kontrollrahmen wird falsch. Einiges darin wird dringend. Der Astra-Release fügt keine Anforderung hinzu. Er verkürzt die Zeit, die Ihnen bleibt, um die bestehenden zu erfüllen.
- Patch-Latenz für aus dem Internet erreichbare und browsernahe Komponenten in Tagen ab Offenlegung gemessen, mit der echten aktuellen Zahl statt dem Zielwert aus der Richtlinie
- Erkennung gegen Maschinengeschwindigkeit getestet: Aufklärung, laterale Bewegung und Exfiltration in Minuten statt in den menschlichen Zeitspannen, auf die Ihre Regeln justiert sind
- Jedes KI-System, das Sie betreiben, als Angriffsfläche behandelt und adversarial geprüft, inklusive Agenten mit Werkzeugzugriff, Retrieval-Pipeline und System-Prompts
- Autorisierungsmodell für autonomes Testen schriftlich festgehalten: was ein Agent berühren darf, was nie, wer unterschreibt und wie die Grenze erzwungen statt erbeten wird
- Inventar aller im Unternehmen genutzten Modelle, inklusive offener Modelle aus der Entwicklung, denn das bewertete Modell ist nicht das riskante
- Nachweis für EU AI Act Art. 55, FINMA RS 2023/1 und nDSG in einer Beweismappe zusammengeführt, damit derselbe Test drei Regime bedient
OpenAI stufte das eigene Modell als kritisch für Cyber ein und lieferte es mit angezogener Bremse aus. Die Bremse gehört OpenAI. Ihre Umgebung gehört Ihnen, und der einzige ehrliche Weg herauszufinden, ob sie diesem Tempo standhält, führt darüber, dass jemand die Kette dagegen fährt und Ihnen zeigt, wo sie gerissen ist. Wir prüfen KI-Systeme und die Infrastruktur darum herum und geben Ihnen den Weg, die Verweildauer und die Reihenfolge der Behebung in klarer Sprache zurück. Enterprise-grade. Nicht enterprise-priced. Beginnen Sie mit Ihrer Threat Map, ab CHF 5’000, in 14 Tagen.
References
Sources
- OpenAI. GPT-6 Astra. 3. September 2026. openai.com
- OpenAI. GPT-6 Astra System Card, Deployment Safety Hub. September 2026. deploymentsafety.openai.com
- CSO Online. OpenAI launches GPT-6 Astra, its first model to cross a critical cybersecurity threshold. 3. September 2026. csoonline.com
- The Hacker News. GPT-6 Astra Scores 100% on ExploitBench as OpenAI Blocks PoC Exploit Requests. 4. September 2026. thehackernews.com
- Verordnung (EU) 2024/1689 über künstliche Intelligenz (EU AI Act), Art. 55. EUR-Lex. eur-lex.europa.eu
- FINMA. Rundschreiben 2023/1 Operationelle Risiken und Resilienz, Banken. In Kraft seit 1. Januar 2024. finma.ch