Ein Text entsteht mit KI in zwanzig Minuten statt in zwei Stunden. Er klingt überzeugend, enthält aber eine falsche Zahl und übernimmt unbemerkt eine fragwürdige Schlussfolgerung. War die Arbeit trotzdem produktiver?
In einem Interview der "NZZ am Sonntag (16.08.2026)" beschreibt der Sozialwissenschaftler Michael Gerlich eine Verschiebung, die weit über die Qualität maschinell erzeugter Texte hinausgeht. Studenten richteten ihre Fragen zunehmend an ChatGPT statt an den Dozenten. Beschäftigte begännen nicht mehr mit einem Problem, sondern mit einer bereits formulierten Antwort. Der Mensch werde vom Denkenden zum Prüfer.
Gerlich warnt vor einem Verständnis, das nur noch sprachlich dargestellt, aber nicht mehr selbst erarbeitet wird. Seine Alternative ist eine KI, die Rückfragen stellt, Voraussetzungen offenlegt, Unsicherheiten markiert und Gegenpositionen formuliert. Gute Ergebnisse entstehen nach seiner Auffassung durch "produktive Reibung".
Die zugrunde liegende Studie liefert dafür allerdings keinen Kausalbeweis. Sie verbindet in einer nicht repräsentativen Querschnittsbefragung mit 666 Teilnehmern selbst berichtete KI-Nutzung mit Praktiken kritischen Denkens. Sie belegt einen Zusammenhang, aber keinen durch KI verursachten Verlust der Denkfähigkeit. Der Gedanke der produktiven Reibung bleibt dennoch wichtig. Er braucht nur eine Einschränkung: Weder ist Beschleunigung wertlos noch verbessert Widerspruch automatisch ein Ergebnis.
Schnell kann tatsächlich besser sein
Bei klar umrissenen Aufgaben erzeugt KI messbaren Nutzen. In einem Experiment von Shakked Noy und Whitney Zhangmit 453 akademisch ausgebildeten Berufstätigen sank die Bearbeitungszeit bestimmter Schreibaufgaben um 40 Prozent. Unabhängige Prüfer bewerteten die Ergebnisse zugleich um 18 Prozent besser. Das war ein realer Produktivitätsgewinn, auch ohne aufwendige Gegenprüfung.
Die Grenze zeigt eine Untersuchung von Fabrizio Dell'Acqua und Kollegen mit 758 Beratern der Boston Consulting Group. Bei Aufgaben innerhalb der damaligen Leistungsfähigkeit von GPT-4 erledigten die Teilnehmer 12,2 Prozent mehr Aufgaben und arbeiteten im Durchschnitt 25,1 Prozent schneller. Auch die Qualität ihrer Ergebnisse stieg.
Bei einer komplexen Aufgabe außerhalb dieser schwer erkennbaren Leistungsgrenze lösten die KI-Nutzer die Aufgabe jedoch mit einer um 19 Prozent geringeren Wahrscheinlichkeit korrekt. Das System lieferte eine plausible, aber falsche Analyse. Viele Berater folgten ihr.
Produktivität darf deshalb nicht allein als Output pro Stunde gemessen werden. Bei anspruchsvollen Wissens- und Urteilsaufgaben gehören Fehlerkosten, Robustheit, Lernwirkung und menschliche Kontrollfähigkeit in die Rechnung. Bei routinierten, leicht überprüfbaren und folgenarmen Aufgaben darf KI vor allem beschleunigen. Je mehrdeutiger und folgenreicher eine Aufgabe ist, desto wichtiger wird eine qualitätsbereinigte Produktivität.
Reibung braucht einen Zweck
Für die Schule ist diese Unterscheidung zentral. In einem Feldexperiment von Hamsa Bastani und Kollegen mit fast 1000 Schülern verbesserte ein frei antwortendes GPT-System zunächst die Leistung bei Mathematikübungen. In einer anschließenden Prüfung ohne KI schnitten seine Nutzer jedoch schlechter ab als die Kontrollgruppe.
Eine pädagogisch begrenzte Tutorversion gab Hinweise, statt fertige Lösungen zu liefern. Sie vermied den festgestellten Lernnachteil weitgehend, erzeugte aber noch keinen eigenständigen Leistungsvorsprung in der Prüfung. Für diesen mathematischen Lernkontext entschied somit nicht allein der Zugang zur KI. Ausschlaggebend war, wie ihre Hilfe gestaltet wurde und welche Denkarbeit bei den Schülern verblieb.
Hier beginnt die organisierte Gegenprüfung, fachsprachlich Adversarialität. Das Prinzip ist älter als die KI. Der "Advocatus diaboli" greift eine Position gezielt an. Red Teams suchen systematisch nach Schwachstellen. Bei einer "adversarial collaboration" einigen sich Vertreter konkurrierender Auffassungen vorab auf gemeinsame Prüfregeln. Im Journalismus erfüllen Gegenrecherche, Faktenprüfung und eine strenge Redaktion verwandte Aufgaben. Die Verfahren sind nicht identisch. Sie teilen jedoch das Ziel, eine Position nicht ihrer eigenen Plausibilität zu überlassen.
Auch organisierter Widerspruch garantiert kein besseres Ergebnis. In einem Experiment von Zana Buçinca und Kollegenverringerten erzwungene Denkpausen die unkritische Übernahme falscher KI-Empfehlungen. Die Gesamtleistung der Mensch-KI-Teams verbesserte sich dadurch aber nicht signifikant. Zudem bewerteten die Teilnehmer das Verfahren schlechter. Reibung kostet Zeit und Akzeptanz. Sie ist nur dann produktiv, wenn Risiko, Prüfgegenstand und Kriterien klar sind.
Vom Antwortgeber zum Gegenleser
Ein hermeneutischer Umgang mit KI beginnt mit einer eigenen Frage und einem vorläufigen Verständnis. Die Maschine erweitert anschließend den Horizont, formuliert Gegenargumente und macht mögliche Lücken sichtbar. Der Mensch vergleicht, verwirft, korrigiert und entscheidet. KI ersetzt den Denkprozess nicht. Sie tritt in ihn ein.
In meiner Arbeit nutze ich dafür einen selbst entwickelten Red-Team-Check. Das Modell prüft einen Text nacheinander aus fachlicher, logischer, methodischer und sprachlicher Perspektive. Es soll nicht bestätigen, sondern nach dem stärksten Gegenargument, fehlenden Belegen und möglichen Fehlwirkungen suchen.
Mehrere simulierte Rollen bilden allerdings keine unabhängigen Expertenteams. Wenn dasselbe Modell einen Text produziert und kontrolliert, können sich seine blinden Flecken wiederholen. Auch die tatsächliche Fehlerreduktionsrate meines Verfahrens ist bisher nicht systematisch untersucht. Der Red-Team-Check organisiert Perspektivwechsel, ist aber kein Qualitätssiegel. Belastbare Kontrolle benötigt zusätzlich Originalquellen, vorher bestimmte Kriterien und bei wichtigen Entscheidungen eine unabhängige menschliche Prüfung.
Gerlich vermutet, dass menschlich geschriebene Texte in einer von KI-Inhalten geprägten Öffentlichkeit zum Luxusgut werden könnten. Doch ein ausschließlich menschlicher Text ist nicht automatisch gut, ein KI-unterstützter nicht automatisch gedankenlos. Entscheidend ist verantwortete Autorschaft: Ein Autor versteht seine Aussagen, kennt ihre Grundlagen, kann Einwände beantworten und steht für verbleibende Unsicherheiten ein.
Das knappe Gut der KI-Zeit ist nicht der garantiert maschinenfreie Text. Es ist ein Urteil, das geprüft wurde und für das ein Mensch Verantwortung übernimmt.
Praxistipp
Formulieren Sie zunächst selbst eine vorläufige These. Geben Sie ChatGPT anschließend diesen Auftrag:
"Nenne die drei schwerwiegendsten Einwände gegen meine These, das stärkste Gegenbeispiel und die noch fehlenden Belege. Schreibe den Text nicht um. Ordne die Einwände nach ihrer Tragweite und markiere alle Tatsachenbehauptungen, die anhand von Originalquellen geprüft werden müssen."
Entscheiden Sie danach selbst, welche Kritik trägt. Lassen Sie die überarbeitete Fassung abschließend prüfen, ohne dem Modell die Ergebnisse des ersten Durchgangs mitzuteilen.
Quellen und Literatur
Bastani, Hamsa et al. (2025): "Generative AI without guardrails can harm learning: Evidence from high school mathematics." PNAS 122(26). DOI
Buçinca, Zana, Maja Barbara Malaya und Krzysztof Z. Gajos (2021): "To Trust or to Think: Cognitive Forcing Functions Can Reduce Overreliance on AI in AI-Assisted Decision-Making." PACM HCI 5, CSCW1. DOI
Dell'Acqua, Fabrizio et al. (2026): "Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality." Organization Science 37(2). DOI
Fulterer, Ruth: "Ein neues Luxusgut entsteht." Interview mit Michael Gerlich. NZZ am Sonntag, 16.08.2026.
Gerlich, Michael (2025): "AI Tools in Society: Impacts on Cognitive Offloading and the Future of Critical Thinking." Societies 15(1). DOI
Mellers, Barbara, Ralph Hertwig und Daniel Kahneman (2001): "Do Frequency Representations Eliminate Conjunction Effects? An Exercise in Adversarial Collaboration." Psychological Science 12(4), 269-275. DOI
Noy, Shakked und Whitney Zhang (2023): "Experimental Evidence on the Productivity Effects of Generative Artificial Intelligence." Science 381(6654), 187-192. DOI
