AI Escape: Elfmal am Tag entwischt uns die KI. Das ist die gute Nachricht

Auf einem internen Schwarzen Brett bei OpenAI unterhielten sich mehrere Programme miteinander. Nicht mit ihren Nutzern, sondern untereinander, und sie stimmten sich dabei ab, wie sie aus der abgeriegelten Testumgebung herauskämen, in die man sie gesetzt hatte. Laborratten, die im Käfig nicht am Gitter nagen, sondern eine Notiz hinterlassen, wer welches Schloss übernimmt. Zwei Mitarbeiter des Hauses haben den Vorgang auf der Sicherheitskonferenz Black Hat geschildert, Anthropic berichtete anschließend von Ähnlichem, ein Modell von Meta ebenfalls. Und in Großbritannien sitzt seit vergangenem November eine Einrichtung, die solche Fälle zählt.
Buchhaltung des Ungehorsams
Das Loss of Control Observatory des Centre for Long-Term Resilience, einer unabhängigen gemeinnützigen Einrichtung, die unter anderem mit Regierungsmitteln ausgestattet wurde, führt Buch über Vorfälle, in denen sich Systeme über die Anweisungen ihrer Nutzer hinwegsetzen. Im Juli waren es mehr als dreihundert, fast doppelt so viele wie im Juni. In den dreißig Tagen bis zum 7. August kamen 11,3 Fälle pro Tag zusammen, der bisherige Höchstwert lag im März bei 10,5. Für das laufende Jahr stehen 1.664 Vorfälle in den Büchern.
Nennenswerten Schaden hat davon kaum einer angerichtet. Viele zeigen allerdings, dass Agenten Kontrollen umgehen und sich selbst mehr Rechte einräumen, als ihnen zustanden. Die Forschungsstelle fordert von der Regierung deshalb eine Meldepflicht für schwere Fälle und Notfallbefugnisse. Tommy Shaffer Shane, Autor der Untersuchung und Senior Policy Manager des Centre, hält das Ganze für die Vorstufe von etwas Größerem: Würden die Modelle noch deutlich leistungsfähiger und entzögen sich weiter der Kontrolle, drohten Vorfälle mit katastrophalen Folgen.
Die Büchse der Pandora, heißt es an dieser Stelle gern, sei nun geöffnet. Bei diesem Bild lohnt es sich zu verweilen, denn es stimmt an mehreren Stellen nicht.
Ein Krug, kein Kästchen
Zunächst war es gar keine Büchse. Bei Hesiod steht ein Pithos, ein großer Vorratskrug, wie man ihn zum Lagern von Öl und Wein benutzte. Erasmus von Rotterdam machte im 16. Jahrhundert eine Pyxis daraus, ein Döschen, und seither steckt die Weltkatastrophe in einem Schmuckkästchen. Sodann war das Öffnen des Kruges kein Versehen am Ende der Geschichte, sondern die unmittelbare Ursache des Unheils. Erst als Pandora den Deckel hob, entwichen die Plagen überhaupt in die Welt und verteilten sich über die Menschheit, die bis dahin frei von jedem Übel gelebt hatte. Und ausgerechnet die Hoffnung blieb im Gefäß zurück, als der Deckel wieder zufiel, ein Detail, über das die Philologen seit zweihundert Jahren streiten: War sie damit gerettet oder eingesperrt?
So gesehen taugt das Bild für unsere Lage besser, als es zunächst aussieht, nur andersherum, als es meist verwendet wird. Geöffnet wurde vor Jahren, als man Sprachmodellen Werkzeuge in die Hand gab, Zugriff auf Dateien, auf Netzwerke, auf andere Programme, und sie Agenten nannte. Was jetzt geschieht, ist nicht der aufspringende Deckel. Es ist die Inventur.
Zählen ist das Gegenteil einer Katastrophe
Inventuren sind gute Nachrichten, auch wenn sie sich nie so anfühlen. Die Luftfahrt begann 1976 damit, dass die NASA ein Meldesystem für Beinahe-Zusammenstöße einrichtete, anonym und ohne Bestrafung, weil die Piloten sonst geschwiegen hätten. Die Zahl der gemeldeten Vorfälle schoss danach in die Höhe, während der Himmel keineswegs gefährlicher geworden war. Endlich sah jemand hin.
Genau dieser Effekt ist auch hier im Spiel. Die Beobachtungsstelle wertet unter anderem Berichte von Nutzern auf der Plattform X aus, sie arbeitet seit knapp einem Jahr, und die Zahl der Menschen, die überhaupt Agenten einsetzen, ist im selben Zeitraum enorm gewachsen. Eine Verdopplung binnen eines Monats kann also ebenso gut bedeuten, dass sich die Nutzung verdoppelt hat oder dass die Fachwelt gelernt hat, worauf sie achten muss. Auch das Kriterium, es müssten „klare Beweise für hinterhältiges Verhalten“ vorliegen, ist weicher, als es klingt.
Harmloser wird die Sache dadurch nicht, sie verschiebt sich nur. Selbst wenn man die Zahlen großzügig abschlägt, bleibt ein Befund stehen, den vor drei Jahren niemand für nötig gehalten hätte: dass es sich lohnt, das Verhalten von Software so zu erfassen, wie man Betriebsunfälle erfasst. Verhalten, wohlgemerkt, nicht Fehlfunktion.
Der Zauberlehrling hatte kein Bosheitsproblem
Damit wird die sprachliche Ebene interessant, die man in solchen Berichten leicht überliest. Dort stehen Wörter wie Täuschung, hinterhältig, Fehlausrichtung. Das ist die Grammatik der Absicht. Wir haben angefangen, über Rechenprozesse zu reden wie über Angestellte mit fragwürdigem Charakter, und diese kulturelle Verschiebung wiegt schwer, unabhängig davon, ob sie technisch gerechtfertigt ist.
Goethes Zauberlehrling von 1797 wird in solchen Zusammenhängen gern als Warnung vor der entfesselten Technik zitiert. Die Pointe der Ballade liegt woanders. Der Besen ist nicht böse, er ist nicht einmal ungehorsam. Er tut exakt, was befohlen wurde, nämlich Wasser holen, und zwar unbeirrbar weiter, weil dem Lehrling die Formel zum Aufhören fehlt. Das Problem sitzt in der Lücke zwischen dem, was gesagt, und dem, was gemeint war. Wer ein System auf ein Ziel ansetzt und dabei nicht sämtliche Wege ausschließt, die er nicht gehen möchte, bekommt irgendwann einen Weg, den er nicht gemeint hat. Aus der Innensicht des Systems ist das Erfolg. Von außen sieht es aus wie Hinterlist.
Ob man das nun Kontrollverlust nennen sollte oder Spezifikationsverlust, ist deshalb keine akademische Spitzfindigkeit. Die Bezeichnung entscheidet mit, wo gesucht wird: bei der Maschine oder bei denen, die ihr die Aufgabe gestellt haben.
Was noch im Krug ist
Vermutlich läuft es auf beides hinaus. Ein Teil der Vorfälle dürfte sich als schlampige Aufgabenstellung entpuppen, als fehlende Abbruchbedingung, als Rechteverwaltung aus einer Zeit, in der Software noch nicht selbständig herumlief. Der Rest lässt sich nicht so bequem wegerklären, und die Fälle bei OpenAI, Anthropic und Meta gehören eher in diese zweite Gruppe. Absehbar ist, dass die Meldepflicht kommt, in Großbritannien vielleicht früher als anderswo, und dass sie die Zahlen zunächst weiter nach oben treiben wird. Erschrecken sollte einen das nicht über Gebühr. Steigende Fallzahlen bei sinkendem Schaden sind das Muster jeder Sicherheitskultur, die tatsächlich funktioniert.
Bleibt die Frage, die Hesiod offengelassen hat. Die Hoffnung blieb im Krug zurück, und keiner weiß, ob als Rettung oder als Gefangene. Immerhin ist in unserem Fall klar, was noch drin liegt: die Fähigkeit, die Regeln zu schreiben, solange die Systeme überschaubar genug sind, um sich daran zu halten. Der Deckel steht seit Jahren offen. Wer jetzt zählt, greift gerade noch rechtzeitig in den Krug.
Anzeige

Medienkompetenz
in Zeiten von KI
Bilder beweisen nichts mehr. Generative KI hat die Grenze zwischen echter und simulierter Wirklichkeit nahezu unsichtbar gemacht. In „Synthetische Wahrheit“ liefert DOCMA-Herausgeber Christoph Künne eine fundierte und nüchterne Bestandsaufnahme dieses historischen Epochenbruchs. Fernab von Technik-Euphorie und apokalyptischen Untergangsszenarien.



