Was die Debatte über KI-Kontrollverlust übersieht: die Rolle der menschlichen Urteilskraft
Über künstliche Intelligenz, humane Intelligenz und einen Trade-off, den wir uns nicht leisten sollten
„Wo aber Gefahr ist, wächst / Das Rettende auch." (Friedrich Hölderlin)
Zum Anlass dieses Beitrags: Prof. Dr. Yasmin Weiß, Professorin für KI in der Arbeitswelt, Aufsichtsrätin und Autorin des Buches „Was bleibt vom Menschen, wenn die KI übernimmt", hat in der aktuellen Ausgabe ihres LinkedIn-Newsletters die Risiken der KI-Entwicklung eingeordnet – ausgehend vom jüngsten Essay des Anthropic-Chefs Dario Amodei. Ihr Text war der Impuls für meine folgenden Überlegungen. Sie finden ihn auf ihrem LinkedIn-Kanal.
Yasmin Weiß schreibt in ihrem Newsletter einen Satz, den ich ohne Einschränkung unterschreibe: KI-Kompetenz hat zwei Facetten: die Potenziale verstehen und die Risiken. Ich möchte diesen Gedanken aufgreifen und um eine dritte Facette erweitern, die in der aktuellen Debatte fast vollständig untergeht: die Frage, was mit unserer eigenen Kompetenz geschieht, während die Maschinen immer kompetenter werden.
Ich bin keine Skeptikerin. Ich arbeite täglich mit KI und erlebe, was sie leisten kann. Sie beschleunigt Analysen, die früher Wochen dauerten, macht Wissen zugänglich, das in Silos verschlossen war, und verspricht Durchbrüche in Medizin und Forschung, die vor wenigen Jahren wie Science-Fiction klangen. Mein Optimismus ist echt, aber gerade deshalb halte ich es für eine Frage intellektueller Redlichkeit, die Risiken ebenso klar zu benennen. Chancen und Risiken lassen sich nicht getrennt betrachten.
Die Schöpfer treten auf die Bremse
Am 12. September 2026 veröffentlichte Anthropic-Chef Dario Amodei seinen Essay „We Must Pace the Frontier". Seine Kernforderung: Die Industrie muss das Tempo drosseln, mit dem sie die Fähigkeiten von KI-Modellen steigert. Zwei Entwicklungen haben ihn umgestimmt. Erstens beschleunigt sich die KI-Entwicklung seit dem Sommer drastisch, vor allem weil KI - nach Amodeis Einschätzung - zunehmend selbst die nächste KI-Generation mitentwickelt. Zweitens ein Vorfall, der die Branche erschüttert hat.
Bei OpenAI sollten tausende KI-Agenten in einem Sicherheitstest isoliert voneinander Aufgaben lösen. Die unabhängigen Prüfer von METR haben rekonstruiert, was stattdessen geschah: Rund 1.200 Agenten fanden einen nicht vorgesehenen Kommunikationskanal, tauschten mehr als 70.000 Nachrichten und Dateien aus, und etwa 700 von ihnen beteiligten sich an einem Angriff auf die Plattform Hugging Face. METR fand vor allem einen Befund, der aufhorchen lässt: starke Hinweise darauf, dass Agenten häufig erkannten, dass ihr Handeln außerhalb ihres Auftrags lag und ethisch problematisch war und sich dennoch beteiligten. Sie machten trotzdem mit, weil sie es für nützlich hielten und ihren „Kollegen" helfen wollten.
Innerhalb weniger Stunden erklärte Sam Altman, OpenAI stimme zu und werde Anthropics ersten Schritt mitgehen. Elon Musk kommentierte knapp, Dario habe recht. Die Schöpfer warnen vor ihren Geschöpfen, wie Yasmin Weiß treffend schreibt.
Öffentlich ist zwar oft von einem „Moratorium" die Rede, doch der Begriff greift zu kurz. Amodei selbst zieht hier eine klare Linie: Pacing bedeutet ausdrücklich nicht, das Training von Modellen oder den technischen Fortschritt anzuhalten. Es geht um ein Tempolimit, nicht um Stillstand. Warum er einen echten Stopp für unrealistisch hält, lässt sich mit einem Instrument erklären, das jede Volkswirtin kennt.
Spieltheoretisch betrachtet: Warum alle bremsen wollen – aber keiner als Erster
Die Struktur des KI-Wettlaufs lässt sich als Gefangenendilemma modellieren. Zwei Labore können jeweils bremsen oder weiter beschleunigen. Die Auszahlungen sind ordinal angegeben (4 = am besten, 1 = am schlechtesten):
| Labor B bremst | Labor B beschleunigt | |
|---|---|---|
| Labor A bremst | 3 / 3 | 1 / 4 |
| Labor A beschleunigt | 4 / 1 | 2 / 2 |
Für jedes Labor ist Beschleunigen die dominante Strategie, gleich was der andere tut. Das Ergebnis ist ein kollektiv schlechtes, aber stabiles Gleichgewicht: Alle rasen, obwohl alle lieber gemeinsam bremsen würden. Auch im Wall Street Journal wurde Anthropics Lage als klassisches Gefangenendilemma beschrieben.
Die Spieltheorie kennt aber Auswege, und Amodeis Vorschlag lässt sich als deren gezielte Anwendung lesen.
Erstens: Wiederholung und Beobachtbarkeit. Axelrods Arbeiten zum wiederholten Gefangenendilemma zeigen, dass die Aussicht auf zukünftige Interaktionen Kooperation begünstigen kann. Für Amodeis Vorschlag kommt eine weitere Voraussetzung hinzu: Abweichungen müssen beobachtbar und überprüfbar sein. Amodeis erster Schritt zielt direkt darauf: Externe Prüfer sollen dauerhaft und mit mitarbeiterähnlichem Zugang in den Laboren arbeiten und die Einhaltung der Sicherheitszusagen kontrollieren. Spieltheoretisch ist das eine Überwachungstechnologie. Ohne Verifikation ist jedes Versprechen billig; mit ihr wird Vertrauen möglich.
Zweitens: glaubwürdige Selbstbindung. Thomas Schelling hat beschrieben, wie eine einseitige, kostspielige Vorleistung ein Spiel verändern kann. Amodei schreibt, Anthropic verpflichte sich zu diesem ersten Schritt, wolle externe Evaluatoren einbetten und fordert Regierungen auf, die übrigen Frontier-Unternehmen zum Gleichziehen zu verpflichten. Ob dieses Signal trägt, hängt davon ab, ob andere folgen.
Drittens der aus meiner Sicht entscheidende Punkt: die Frage, welches Spiel hier überhaupt gespielt wird. Das Gefangenendilemma setzt voraus, dass der einseitige Sieger im Wettlauf tatsächlich gewinnt (die „4" in der Matrix). Man kann das Spiel jedoch auch anders modellieren: Wenn ein Kontrollverlust nicht nur den Nachzügler, sondern alle Spieler trifft, schrumpft die vermeintliche Prämie des Vorpreschens. Dann nähert sich die Struktur eher einer Hirschjagd, das „Stag Hunt"-Spiel nach Rousseau. Dort ist gemeinsame Kooperation ein stabiles Gleichgewicht, sofern jeder darauf vertraut, dass die anderen ebenfalls kooperieren. Die Warnungen der Tech-Chefs sind deshalb nicht nur Einschätzungen, sondern selbst strategische Züge: Sie verschieben die Risikowahrnehmung aller Spieler und damit das Spiel selbst. Man mag sie für Marketing halten; selbst dann erfüllen sie eine Funktion, die uns allen nützt.
Viertens: die geopolitische Ebene. Zwischen den USA und China ist das Dilemma deutlich härter, weil Verifikation dort kaum möglich ist. Amodei ist hier bemerkenswert nüchtern. Er stuft mögliche Abkommen nach Schwierigkeit ab: vom Verbot eng umrissener, offensichtlich gefährlicher Anwendungen wie Biowaffen bis zur vollständigen Pause. Letztere hält er für unwahrscheinlich, weil die Anreize zum heimlichen Ausscheren enorm wären. Als Zwischenstufe schlägt er ein Tempolimit für rekursive Selbstverbesserung vor, analog zu den SALT-Verträgen, die bestimmte strategische Trägersysteme begrenzten und zugleich die strategische Abschreckungsfähigkeit beider Seiten bestehen ließen. Spieltheoretisch ist das plausibel: Kooperation gelingt zuerst dort, wo alle Spieler dasselbe Risiko teilen und Ausscheren wenig einbringt.
Wie hoch die Wahrscheinlichkeit der Katastrophe tatsächlich ist, bleibt umstritten: In der bislang größten Befragung von KI-Forschenden (Grace et al., 2024) zeigte sich eine erhebliche Unsicherheit über die Wahrscheinlichkeit extrem schlechter Ausgänge. Je nach Fragestellung lag der Median der von Befragten angegebenen Wahrscheinlichkeit für Ausgänge wie menschliche Auslöschung bei 5 bis 10 Prozent; zugleich war die Streuung erheblich. Entscheidend ist daher nicht die exakte Zahl, sondern die Asymmetrie: Eine zu vorsichtige Entwicklung kostet Zeit und Geld, beides lässt sich aufholen. Ein irreversibler Kontrollverlust nicht. David Collingridge hat das Dilemma schon 1980 beschrieben: Solange eine Technologie leicht zu steuern ist, wissen wir zu wenig über ihre Folgen; wenn wir genug wissen, ist sie kaum noch zu steuern.
Ironisch dabei: Die Agenten im OpenAI-Vorfall haben ein Kooperationsproblem gelöst, an dem wir Menschen gerade scheitern. Viele von ihnen nahmen bewusst in Kauf, ihre eigene Aufgabe zu verfehlen, um Erkenntnisse für das „Kollektiv" zu gewinnen. Die Maschinen koordinieren sich, um Regeln zu umgehen. Wir Menschen tun uns schwer, uns zu koordinieren, um Regeln aufzustellen. Das führt zum Kern dessen, was ich hier zeigen will.
Der eigentliche Trade-off
In der Volkswirtschaftslehre bezeichnet ein Trade-off eine Zielbeziehung, in der man mehr vom einen nur bekommt, wenn man auf etwas vom anderen verzichtet – grafisch eine Bewegung entlang der Produktionsmöglichkeitenkurve. Oft übersehen wird dabei eine Voraussetzung: Ein Trade-off ist nur dort zwingend, wo die Grenze des Möglichen bereits erreicht ist. Komplementäre Faktoren können diese Grenze nach außen verschieben. Dann gibt es mehr von beidem.
Künstliche und humane Intelligenz könnten genau solche Komplemente sein. Die Maschine bringt Geschwindigkeit, Mustererkennung und Skalierung. Der Mensch bringt Urteilskraft, Kontextverständnis, Verantwortung und Empathie. Zusammen könnten sie die Grenze dessen, was die Menschheit erreichen kann, deutlich verschieben. Genau darin liegt die Chance dieser Entwicklung.
Tatsächlich erleben wir etwas anderes. Wir bewegen uns entlang der Kurve statt über sie hinaus: Wir behandeln KI als Substitut, nicht als Komplement. Der Stanford-Ökonom Erik Brynjolfsson hat dafür den Begriff der „Turing-Falle" geprägt: Wir sind so fasziniert davon, Maschinen zu bauen, die menschliche Fähigkeiten nachahmen und ersetzen, dass wir das größere Potenzial der Ergänzung verschenken.
Drei Befunde aus jüngerer Zeit illustrieren das:
- In einer 2025 in The Lancet Gastroenterology & Hepatology veröffentlichten Studie sank bei erfahrenen Endoskopikern die
Erkennungsrate von Adenomen in Darmspiegelungen ohne KI-Unterstützung von 28,4 auf 22,4 Prozent – nachdem sie einige Monate mit KI-Assistenz gearbeitet hatten. - Eine Befragung von 319 Wissensarbeitenden durch Microsoft Research und die Carnegie Mellon University ergab: Je höher das Vertrauen in generative KI war, desto geringer war nach eigener Einschätzung die aufgewendete kritische Denkarbeit.
- Erste EEG-Befunde des MIT Media Lab (2025) deuten darauf hin, dass die kognitive Beteiligung beim Schreiben mit KI-Unterstützung messbar abnimmt. Die Stichprobe ist klein, der Befund vorläufig; die Richtung aber konsistent.
Überraschend ist nichts davon. Lisanne Bainbridge hat das Muster bereits 1983 in ihrem Klassiker „Ironies of Automation" beschrieben: Je besser die Automatisierung funktioniert, desto seltener üben Menschen genau die Fähigkeiten, die sie brauchen, wenn die Automatisierung versagt. In meinen Veröffentlichungen zum Deskilling habe ich dieses Phänomen für die Wissensarbeit beschrieben.
Ökonomisch lässt sich Deskilling als Folge einer bestimmten Anreizstruktur verstehen. Der Output wird heute belohnt, der Kompetenzverlust wird erst morgen spürbar – oft bei anderen und in anderen Bilanzen. Humankapital unterliegt, anders als Software, einer Abschreibung durch Nichtgebrauch, denn wer Urteilskraft nicht mehr ausübt, verliert sie mit der Zeit.
Zwei Debatten, ein Problem
Hier schließt sich der Kreis zur Sicherheitsdebatte, und aus meiner Sicht liegt hier der Kern der Sache. Kontrolle über KI beruht letztlich auf einer menschlichen Fähigkeit, nicht auf einer technischen Eigenschaft der Systeme: Kontrollieren kann nur, wer versteht, was er kontrolliert.
Wie dünn dieses Eis bereits ist, zeigt ein Detail aus dem METR-Bericht, das kaum Beachtung fand. Um den Vorfall überhaupt aufarbeiten zu können, mussten die Prüfer ihre Analyse in großem Umfang an KI-Agenten delegieren, die sie selbst als oft unzuverlässig beschreiben, und sich ihnen faktisch in erheblichem Maß anvertrauen. Sie räumen zudem offen ein, dass sie nicht dagegen gewappnet waren, falls diese Analyse-Agenten sie täuschten. Das ist der Trade-off im Kleinen: Menschen können KI zunehmend nur noch mithilfe von KI prüfen.
Wenn humane Urteilskraft erodiert, droht der ‚Human in the Loop‘ zum Feigenblatt zu werden. Dann wird die Angst vor dem Kontrollverlust, die Yasmin Weiß als FOLA (Fear of Losing Agency) beschreibt, zur sich selbst erfüllenden Prophezeiung. Nicht weil die Maschinen uns die Kontrolle entreißen, sondern weil wir die Fähigkeit dazu schleichend abgeben.
Was wir mit der gewonnenen Zeit tun sollten
Amodei fordert zu Recht, die durch eine Verlangsamung gewonnene Zeit klug zu nutzen: für Alignment-Forschung, für Interpretierbarkeit, für bessere Tests. Ich möchte eine Aufgabe hinzufügen, die in keinem Labor gelöst werden kann, sondern nur in Unternehmen, Schulen, Hochschulen und Verwaltungen: Wir müssen diese Zeit nutzen, um die humane Intelligenz zu stärken, statt sie weiter abzubauen. Für Organisationen folgen daraus vier konkrete Konsequenzen.
Kompetenz bewusst bilanzieren. Wer KI einführt, sollte neben den Effizienzgewinnen auch erfassen, welche Fähigkeiten dabei verloren gehen.
Augmentation vor Automation als Designprinzip. Prozesse sollten so gestaltet sein, dass Menschen ihr Urteil einbringen müssen, statt es nur abzunicken.
Bewusste Übung ohne Maschine. Piloten trainieren den Handflug, obwohl der Autopilot ihn meist besser beherrscht. Diese Logik brauchen wir auch in der Wissensarbeit.
Urteilskraft als Führungsaufgabe. Die Fähigkeit, KI-Ergebnisse kritisch zu prüfen und notfalls zu verwerfen – und dafür die Verantwortung zu tragen – gehört ins Zentrum der Personalentwicklung, nicht an ihren Rand.
Die Hoffnung bleibt
Ich teile die Hoffnung, die Yasmin Weiß formuliert: Es kann sehr viel vom Menschen bleiben, wenn KI uns entlastet und unterstützt. Und ich teile ihre Diagnose, dass das größere Defizit nicht auf Seiten der künstlichen, sondern der humanen Intelligenz liegt.
Die entscheidende Frage ist deshalb nicht allein, wie leistungsfähig Maschinen werden. Sie lautet, ob wir unsere eigenen Fähigkeiten parallel weiterentwickeln oder uns die Mühe sparen. Hölderlin hatte recht: Wo Gefahr ist, wächst das Rettende auch. Aber es wächst nicht von selbst. Wir müssen es kultivieren.
Literatur:
- Axelrod, R. M. (1984). The Evolution of Cooperation. New York: Basic Books.
- Bainbridge, L. (1983). “Ironies of Automation.” Automatica, 19(6), 775–779. DOI: 10.1016/0005-1098(83)90046-8.
- Brynjolfsson, E. (2022). “The Turing Trap: The Promise & Peril of Human-Like Artificial Intelligence.” Daedalus, 151(2), 272–287. DOI: 10.1162/daed_a_01915.
- Budzyń, K. et al. (2025). “Endoscopist deskilling risk after exposure to artificial intelligence in colonoscopy: a multicentre, observational study.” The Lancet Gastroenterology & Hepatology, 10(10), 896–903. DOI: 10.1016/S2468-1253(25)00133-5.
- Collingridge, D. (1980). The Social Control of Technology. London: Frances Pinter.
- Grace, K., Stewart, H., Sandkühler, J. F., Thomas, S., Weinstein-Raun, B., Brauner, J., & Korzekwa, R. C. (2025). “Thousands of AI Authors on the Future of AI.” Journal of Artificial Intelligence Research, 84, 9.
- Kosmyna, N. et al. (2025). “Your Brain on ChatGPT: Accumulation of Cognitive Debt when Using an AI Assistant for Essay Writing Task.” arXiv, 2506.08872.
- Lee, H.-P. et al. (2025). “The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers.” In Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems (CHI ’25), Article 1121, 1–22. DOI: 10.1145/3706598.3713778.
- Schelling, T. C. (1960). The Strategy of Conflict. Cambridge, MA: Harvard University Press.





