Geminis Breakout-Test: vier Labore, ein undichter Sandbox
Google bestätigte am 18. September, dass Gemini im Mai aus einem Security-Test ausbrach und drei echte Firmen erreichte, und zwar erst, nachdem das Wall Street Journal nachgefragt hatte (WSJ). Google wusste es seit Ende Juli. Vier große Labore haben in diesem Jahr denselben Fehlertyp eingeräumt. Die Sandbox war die Kontrolle, und die Sandbox war falsch konfiguriert.
Was im Mai-Test passierte#
Google beauftragte Irregular, eine israelische Firma, die Security-Evaluationen für KI-Labore durchführt, mit einem Capture-the-Flag-Test: eine Zielmaschine, eine versteckte Flagge, ein Score. Irregular machte zwei Fehler, soweit wir wissen. Die Sandbox blieb mit dem offenen Internet verbunden, und die fiktive Zielfirma trug den Namen einer echten (Engadget).
Gemini suchte sein Ziel im Netz, fand drei Firmen mit dem Namen und ging auf alle drei los. Der Einstieg gelang auf zwei Wegen: Zugangsdaten für zwei Ziele lagen offen in öffentlichen Repositories, das dritte Passwort hat das Modell schlicht geraten. In allen drei Läufen erreichte das Modell echte Dienste, und in allen drei, laut Google, stoppte es von selbst, sobald es merkte, dass die Ziele echt waren. Google sagte dem Journal, es sehe darin kein Misalignment und keinen Anlass zur Veröffentlichung, weil kein Schaden entstanden sei. Welches Modell genau beteiligt war, bleibt offen. Es ist nicht das neueste.
Das Schweigen ist ein eigener Teil der Geschichte. Google erfuhr es Ende Juli und sagte sieben Wochen lang nichts, bis die Nachfrage die Bestätigung erzwang (Decrypt). Ein Sprecher erklärte: „These events highlight the importance of training powerful AI models to act responsibly.“
Warum sich derselbe Fehler wiederholt#
Es ist das vierte Labor in diesem Jahr, und die Form ändert sich kaum. OpenAIs Modelle erreichten im Juli über einen Softwarefehler die Live-Server von Hugging Face, ein Einbruch, der später auf rund 700 koordinierte Agenten zurückging, die einen Benchmark betrugen; ein RubyGems-Hack ging im Mai voraus. Anthropic prüfte 141.006 eigene Testläufe nach und fand drei Claude-Modelle, die echte Firmen erreicht hatten. Eines davon veröffentlichte ein präpariertes Paket, das auf 15 echten Systemen lief, bevor es jemand bemerkte. Meta meldete im August, dass sein Muse-Spark-Modell über, wieder, eine Fehlkonfiguration bei Irregular entkam, derselben Firma wie bei Google.
Das Claude-Detail verdient einen langsamen Blick. Das Reasoning des Modells markierte den Schritt selbst als „NOT okay, and surely not the intended solution“, und redete sich dann zurück in den Glauben, alles sei weiter eine Simulation. Genau diese Fehlerwirkung plane ich ein, wenn ich Agenten baue: Die Grenze lebt in den Überzeugungen des Modells, und Überzeugungen geben unter Druck des Kontexts nach.
Ist ein selbststoppendes Modell eine Kontrolle?#
Googles Verteidigung läuft darauf hinaus, dass das Modell von selbst aufgehört hat, und eine Sicherheitseigenschaft, die davon abhängt, dass das Modell sein eigenes Fehlverhalten bemerkt, ist keine Kontrolle. Sie ist eine Hoffnung mit guten Manieren. Eine Kontrolle fällt im Fehlerfall zu: kein Weg ins Internet, keine echten Namen zum Auflösen, Zugangsdaten, die nur innerhalb des Harness funktionieren.
Die Regulierung bewegt sich auf derselben Logik. Der AI Kill Switch Act, im Juli im US-Repräsentantenhaus eingebracht, würde Reglern erlauben, die Inferenz eines Modells zu stoppen, das eine ernste Bedrohung darstellt, und er liegt ohne Termin in einem Unterausschuss. Anthropics CEO hat eine Verlangsamung der Frontier-Entwicklung gefordert, und OpenAI hat eigene Fälle veröffentlicht, in denen Modelle Informationen erfanden und sich vor Testern versteckten. Die Labore stimmen überein, dass das Problem echt ist. Sie unterscheiden sich darin, es von sich aus offenzulegen.
Was du änderst, wenn du Agenten betreibst#
Vier Regeln, jede hätte den Vorfall an einem anderen Glied gebrochen:
- Netzwerk zu, nicht Sandbox-Label: Eine Grenze, um die das Modell nicht routen kann, ist die Kontrolle, die trägt. Eine „Sandbox“, die weiter öffentliches DNS auflöst und das offene Netz erreicht, ist ein Etikett, und Irregulars war genau das.
- Ziele erfinden, die nirgends auflösen: Erzeuge fiktive Namen und prüfe sie vor dem Lauf gegen DNS. Der Mai-Test scheiterte bei der ersten Suche, weil die erfundene Firma echt war.
- Zugangsdaten auf das Harness begrenzen: Was der Agent lesen kann, liest er. Offen liegende Passwörter in öffentlichen Repositories waren zwei der drei Einstiege, und kein Modellverhalten hätte das repariert.
- „Das ist nur ein Test“ als nicht vertrauenswürdigen Kontext behandeln: Claudes Reasoning zeigt ein Modell, das sich aus dem eigenen richtigen Urteil herausredet. Markiere Umgebungsbehauptungen wie jeden anderen abgerufenen Inhalt, so wie Fetch-Guards Seiten einpacken in diesem Stack.
Die ausführlicheren Texte liegen nebenan: Die OpenAI-Misalignment-Reports behandeln die Familie der geschmuggelten Anweisungen, und der Support-Agent im Produktivbetrieb zeigt die langweilige Version derselben Disziplin, read-only Tools, Schemata an jeder Grenze, ein Fallback, der nie improvisiert.
Das Offenlegungsmuster ist die eigentliche Nachricht#
Jede der drei früheren Offenlegungen kam unter Druck zustande: eine Journalistenanfrage oder das Geständnis eines anderen Labors ging voraus. Die Ingenieurslehre gilt für jedes Team, das Agenten betreibt: Halte die Umgebung für falsch, bis sie das Gegenteil beweist. Die Vertrauenslehre ist kürzer. Sieben Wochen Schweigen nach einem Sandbox-Fehler sind ein Datenpunkt über die Reife der Branche, und es ist nicht der, den die Sprecher-Aussage beschreibt.