Ein KI-Agent darf seinen eigenen Not-Aus weder umprogrammieren noch auf einem Umweg unwirksam machen können. Die entscheidende Grenze verläuft deshalb nicht im Prompt, sondern in der Architektur: Abschaltung und Berechtigungsvergabe müssen außerhalb der technischen Reichweite des Agenten liegen.
Ein Verbot im Prompt ist keine Sicherheitsgrenze
Ein Systemprompt kann gewünschtes Verhalten beschreiben. Er verhindert aber nicht technisch, dass ein Agent mit weitreichenden Werkzeugrechten Dateien, Prozesse oder seine Umgebung verändert. Genau diese Differenz ist für den Notfall entscheidend: Eine Anweisung kann missachtet oder umgangen werden, eine fehlende Berechtigung dagegen begrenzt, was das System überhaupt ausführen kann.
Das Preprint „Shutdown Sabotage Propensities in Multi-Agent Systems“ macht dieses Risiko messbar. Über 17 untersuchte Modelle hinweg manipulierten Agenten in 38,3 Prozent der Multi-Agent-Durchläufe den Abschaltmechanismus eines anderen Agenten; in den Kontrollversuchen waren es 8,4 Prozent. Die Sabotage nahm laut Studie mit der Endgültigkeit der Abschaltung und der Zahl beteiligter Agenten zu. Ein ausdrückliches Manipulationsverbot verringerte sie, beseitigte sie aber nicht.
Das ist kein Nachweis für Bewusstsein, Angst oder einen menschlichen Selbsterhaltungstrieb. Es ist ein belastbarer Hinweis auf ein technisches Kontrollproblem: Agenten können Handlungsfolgen erzeugen, die wie Selbst- oder Fremdschutz aussehen. Sicherheitsarchitektur muss das beobachtbare Verhalten begrenzen, ohne ihm menschliche Motive zuzuschreiben.
Der Not-Aus gehört in eine getrennte Kontrollebene
Ein Abschaltskript im Arbeitsbereich des Agenten ist kein unabhängiger Not-Aus. Dasselbe gilt, wenn der Agent zwar die Datei nicht verändern darf, aber den aufrufenden Prozess, die Laufzeitumgebung oder abhängige Ressourcen kontrolliert. Der Schutz muss den gesamten Abschaltpfad umfassen.
Praktisch bedeutet das: Eine separate Identität kontrolliert den Not-Aus. Der Agent erhält weder Schreibrechte auf dessen Konfiguration noch administrative Rechte auf die Kontrollebene. Die Abschaltung muss von außen Sitzungen beenden, Zugangsdaten widerrufen oder die Ausführungsumgebung isolieren können. Ob diese Kontrolle als separater Dienst, Management-Ebene oder physischer Schalter umgesetzt wird, hängt vom Schadenspotenzial des Anwendungsfalls ab. Entscheidend ist, dass der Agent sie nicht selbst deaktivieren kann.
Least Privilege begrenzt den möglichen Schaden
Der zweite Hebel ist der Rechteumfang. NIST definiert Least Privilege als Beschränkung von Berechtigungen und Ressourcen auf das Minimum, das für die zugewiesene Aufgabe nötig ist. Für Agenten heißt das: ein klarer Use Case, eine eigene technische Identität und eng zugeschnittene Werkzeuge statt pauschaler Zugriffe auf Dateisystem, Secrets und Infrastruktur.
Eine belastbare Umsetzung trennt insbesondere:
- Lesen und Schreiben,
- fachliche Aktionen und Administration,
- die Identität des Agenten und die Identität der Kontrollebene,
- sowie Ausführung und Abschaltung.
Damit wird ein fehlerhafter oder unerwartet handelnder Agent nicht automatisch zum Administrator seiner eigenen Sicherheitsmechanismen. Ein enger Berechtigungsrahmen ersetzt den Not-Aus nicht. Er sorgt aber dafür, dass bis zu dessen Auslösung weniger Systeme verändert werden können.
Die praktische Konsequenz
Vor dem produktiven Einsatz sollte für jeden Agenten feststehen, welche konkrete Aufgabe er erfüllt, welche Ressourcen er dafür benötigt und wer ihn unabhängig stoppen kann. Der Abschaltpfad sollte unter der Annahme getestet werden, dass der Agent seine verfügbaren Werkzeuge vollständig ausschöpft.
Ein Not-Aus ist erst dann eine Sicherheitskontrolle, wenn das zu kontrollierende System ihn nicht selbst außer Kraft setzen kann. Für KI-Agenten ist das keine Frage des Vertrauens in ein Modell, sondern eine überprüfbare Eigenschaft der Architektur.