Wenn KI-Systeme wesentlich an der Entwicklung ihrer Nachfolger mitarbeiten, verkürzt sich nicht nur der Entwicklungszyklus. Auch die Sicherheitsprüfung muss mit diesem Zyklus Schritt halten. Evaluation, Freigabe und die Entscheidung zum Stoppen dürfen dann keine nachgelagerten Termine sein. Sie müssen als laufende Kontrollen in den Entwicklungsprozess eingebaut werden.
Das ist Marcs Kernthese: Recursive Self-Improvement, kurz RSI, kann große Fähigkeitssprünge hervorbringen; ohne menschliche Aufsicht, Monitoring und Grenzen entsteht daraus ein erhebliches Risiko. Die These beschreibt eine Sicherheitsanforderung. Sie beweist weder, dass eine vollständig autonome RSI-Schleife bereits existiert, noch liefert sie eine messbare Auslöschungswahrscheinlichkeit.
Zwei Essays, zwei unternehmerische Positionen
Jakub Pachocki beschreibt in OpenAIs Essay „An Alien Mind“ die wachsende Rolle maschineller Intelligenz in ihrem eigenen Entwicklungsprozess. Er erwartet, dass RSI zum Kern künftiger Forschung werden kann, und schreibt zugleich, dass Alignment und Überwachung gemeinsam mit den Fähigkeiten wachsen, Menschen eingebunden bleiben und die Entwicklung bei Bedarf koordiniert verlangsamt werden müsse. Das ist die öffentlich begründete Position des OpenAI-Chefwissenschaftlers, kein unabhängiger Nachweis einer bereits unkontrollierten Selbstverbesserung.
Dario Amodei geht in „We Must Pace the Frontier“ einen Schritt weiter. Er schreibt, KI-Fortschritt habe sich seit dem Sommer stark beschleunigt, vor allem weil KI zunehmend an der nächsten KI-Generation mitarbeite. Daraus leitet er die Forderung ab, den Fähigkeitsfortschritt zu verlangsamen, damit Schutzmaßnahmen aufholen können. Amodei kennzeichnet das selbst als seine Einschätzung und Sorge. Seine Prognose ist deshalb von einem empirisch bestimmten Risiko zu trennen.
Sein Vorschlag besteht aus drei Ebenen: dauerhaft eingebettete externe Prüfer mit mitarbeiterähnlichem Zugang, gemeinsame Sicherheitsstandards und Geschwindigkeitsgrenzen innerhalb demokratischer Staaten sowie eine möglichst überprüfbare globale Koordination. „Pacing“ bedeutet in dem Essay ausdrücklich nicht, Training und technischen Fortschritt vollständig anzuhalten. Es soll Zeit für Alignment, Absicherung und unabhängige Prüfung schaffen.
Im vollständigen CBS-Sunday-Morning-Interview „Extended interview: Dario Amodei“ bekräftigt Amodei diesen Ansatz: Schutz und Kontrollierbarkeit müssten mit dem Entwicklungstempo Schritt halten; externe Evaluatoren sollten Sicherheitspraktiken prüfen, danach brauche es branchenweite Standards und staatliche Beteiligung. Das Interview belegt seinen Vorschlag. Es belegt hingegen nicht, dass die großen Labore bereits eine verbindliche gemeinsame Vereinbarung geschlossen hätten.
Was Sam Altman tatsächlich sagt
Das in der Episode gemeinte Fortune-Interview ist „Altman: AI Beyond Human Control ‘Absolutely’ Possible, Vows Safeguards“. Altman sagt darin, kein Labor habe Alignment gelöst. Fähigkeiten, Monitorbarkeit und Alignment müssten gemeinsam vorankommen; OpenAI werde Training notfalls unterbrechen, wenn sich die Kontrollierbarkeit eines Modells nicht belastbar begründen lasse. Das sind eine Risikoeinschätzung und eine angekündigte Handlungsabsicht des OpenAI-Chefs, keine von außen bestätigte Sicherheitsgarantie.
Bei der häufig genannten Zahl ist Präzision besonders wichtig. Im Podcast-Transkript steht „bis Ende des Jahres“. Im Originalinterview antwortet Altman jedoch auf ein Szenario von zehn Prozent Auslöschungsrisiko bis zum Ende des Jahrzehnts und nennt ein solches Risiko inakzeptabel. Zugleich lehnt er es ab, die Wahrscheinlichkeit selbst auf fünf, zehn oder einen anderen Prozentwert festzulegen. Der Quellenbefund stützt daher keine belastbare Zehn-Prozent-Prognose von Altman.
Hintons Warnung ist eine Prognose, kein Messwert
Der von Marc zeitlich eingeordnete ältere Bezug ist Geoffrey Hintons vollständiges Interview bei The Diary Of A CEO: „Godfather of AI: They Keep Silencing Me But I’m Trying to Warn Them!“ vom Juni 2025. Hinton warnt dort, künftige Systeme könnten intelligenter als Menschen werden, und hält einen Kontrollverlust bis hin zum Aussterben der Menschheit für möglich.
Entscheidend ist Hintons eigene Einschränkung: Seine oft genannte Schätzung einer Auslöschungswahrscheinlichkeit von zehn bis zwanzig Prozent bezeichnet er im Interview ausdrücklich als Bauchgefühl. Das ist eine Expertenprognose, kein empirisch kalibrierter Messwert. Sie kann begründen, warum ein vorsorgliches Sicherheitsprogramm diskutiert wird; sie darf nicht als nachgewiesene Eintrittswahrscheinlichkeit erscheinen.
Was daraus für die Kontrolle folgt
Die Originalquellen unterscheiden sich in Zeithorizont, Begründung und Lösungsvorschlag. Gemeinsam ist ihnen die Forderung, Fähigkeitsfortschritt nicht von Kontrollierbarkeit zu entkoppeln. Daraus folgt aber nicht, dass alle genannten Personen dasselbe Risiko quantifizieren oder bereits dieselbe politische Vereinbarung tragen.
Das AI Risk Management Framework von NIST liefert dafür einen nüchternen Prozessrahmen. Es gliedert Risikomanagement in Govern, Map, Measure und Manage, behandelt Governance als Querschnittsfunktion und verlangt eine kontinuierliche, zeitnahe Bearbeitung über den gesamten Lebenszyklus. NIST liefert damit keine Evidenz für ein konkretes RSI-Katastrophenszenario. Das Framework zeigt aber, wie Organisationen mit unsicheren und sich verändernden Risiken umgehen sollen.
Für Teams bedeutet das:
- Für neue Fähigkeiten existieren vorab definierte Messgrößen und Risikogrenzen.
- Änderungen an Modell, Werkzeugen, Berechtigungen oder Trainingspipeline lösen eine erneute Evaluation aus.
- Prüfer erhalten ausreichenden Zugang, organisatorische Unabhängigkeit und die Befugnis, eine Freigabe zu verweigern.
- Freigabe- und Stoppkriterien stehen fest, bevor ein Testergebnis bekannt ist.
- Pause, Rollback und Isolation sind technisch erprobte Maßnahmen und keine bloßen Absichtserklärungen.
- Behauptete Risikowerte werden als Prognosen gekennzeichnet, solange Kalibrierung und empirische Grundlage fehlen.
Diese Kontrollen garantieren keine sichere Selbstverbesserung. Sie verhindern aber, dass steigende Entwicklungsgeschwindigkeit automatisch zu sinkender Prüftiefe führt. Der praktische Kern bleibt damit derselbe: Wenn KI Teil der Entwicklungsschleife wird, muss Kontrolle ebenfalls Teil dieser Schleife sein.
Quellen
- #76 An Alien Mind auf der Überholspur: Die KI-Chefs ziehen die Bremse — Zwei Faktor Geplauder
- An Alien Mind — OpenAI
- We Must Pace the Frontier — Dario Amodei
- Altman: AI Beyond Human Control “Absolutely” Possible, Vows Safeguards — Fortune
- Extended interview: Dario Amodei — CBS Sunday Morning
- Godfather of AI: They Keep Silencing Me But I’m Trying to Warn Them! — The Diary Of A CEO
- AI Risk Management Framework Core — NIST