Medien & Gesellschaft · 22. September 2026

Synthetische Klassen

Von

DruckenPDF

Tausend künstliche Schüler testen eine Aufgabe, bevor eine wirkliche Klasse sie erhält: Synthetische Schulpopulationen könnten Unterrichtsentwürfe prüfen und in Fortbildungen als Übungsfiguren dienen - sofern sie ohne personenbezogene Schülerdaten erzeugt werden. Doch Rollenfestigkeit ist keine Menschenkenntnis. Ihr sinnvoller Platz ist der digitale Windkanal, nicht das pädagogische Richterpult.

Synthetische Klassen
Konzeption, Auswahl und Veröffentlichung: Volker Wacker

Tausend Schüler, die es nicht gibt: Was synthetische Klassen wirklich können

8,3 Milliarden Persona-Profile, 1.290 Merkmale, simulierte Nutzer für Umfragen, Apps und digitale Produkte: Der im August veröffentlichte MatrAIx-Preprint klingt wie eine digitale Weltbevölkerung für Simulationen. Doch die oft so genannten "digitalen Zwillinge" sind keine Menschenkopien. Es sind strukturierte Rollenbeschreibungen, die erst zusammen mit einem Sprachmodell, einer Aufgabe und einer digitalen Umgebung zu handelnden Agenten werden. Die begriffliche Korrektur weist Schulen den sinnvolleren Weg: Testlabor statt Schüler-Orakel.

Keine Zwillinge, sondern Testfiguren

MatrAIx enthält nach Angaben der Autoren 8,3 Milliarden Profile. Öffentlich zugänglich ist ein Kernbestand von knapp einer Million. Ausgeführt wurden 18.189 Auswertungsläufe mit acht Beispielaufgaben. Auch die gemeldeten 91,5 Prozent sind keine Vorhersagequote. In 400 Läufen wurde geprüft, ob Agenten zehn ausdrücklich zugewiesene, überwiegend sprachliche und programmierbezogene Merkmale zeigten oder unterdrückten; die Spitzenquote ermittelte ein Sprachmodell als Bewertungsinstanz. In einem Bezahlplan-Test wählte dieselbe Kohorte je nach Sprachmodell zu 23,2 oder 93,9 Prozent einen kostenpflichtigen Tarif. Der Unterschied ist grundlegend: Ein Agent kann seine Rolle überzeugend spielen und sich dennoch anders verhalten als ein Mensch.

Für eine engere Aufgabe bleibt die Idee einer synthetischen Schulpopulation dennoch brauchbar. Eine Schule könnte typisierte Profile aus groben, bereits anonymen Informationen bilden: unterschiedliche Sprachstände, fachliches Vorwissen, bekannte Fehlvorstellungen oder benötigte Hilfen. Tausend solcher Agenten könnten eine bilinguale Quellenaufgabe bearbeiten, drei Erklärungen vergleichen oder eine digitale Lernumgebung auf Sackgassen prüfen. Für den Schulbetrieb ist das bislang kein erprobtes Standardverfahren, sondern eine Übertragung der Technik auf eine neue Anwendung.

Für einen solchen begrenzten Stresstest sollten Namen, Noten und Schülerakten nicht verwendet werden. "Synthetisch" bedeutet allerdings nicht automatisch "anonym": Kleine Zellen und seltene Merkmalskombinationen können eine Identifizierung ermöglichen. Werden individuelle Akten als Ausgangsdaten verarbeitet, greift der Datenschutz bereits vor der Simulation. Darauf weisen auch die derzeit konsultierten Anonymisierungsleitlinien des Europäischen Datenschutzausschusses hin.

Ihr Nutzen beginnt dort, wo keine Prognose verlangt wird. Die künstliche Klasse könnte sprachliche Hürden, missverständliche Arbeitsaufträge und übersehene Lösungswege sichtbar machen. Sie wäre ein digitaler Windkanal für Unterricht: ein Ort, an dem Entwürfe Gegenwind bekommen, bevor sie auf eine reale Klasse treffen. Damit ergänzt sie die KI als Assistentin der Unterrichtsvorbereitung, ersetzt aber nicht das Urteil der Lehrkraft.

Mehr Agenten heilen kein falsches Modell

Die Grenze beginnt bei den Daten. Wer weiß, dass 20 Prozent einer Schülerschaft mehrsprachig sind und 30 Prozent ein bestimmtes Kompetenzniveau erreichen, weiß noch nicht, wie sich beide Merkmale überschneiden. Wo solche Zusammenhänge fehlen, ergänzt das Sprachmodell sie aus seinen Trainingsmustern. So entstehen leicht stereotype, zu glatte Schülerbilder.

Eine vorregistrierte, bislang nicht begutachtete Großstudie von Peng und Kollegen verglich in 19 Teilstudien 164 Zielgrößen digitaler Personenmodelle mit ihren realen Vorbildern. Die durchschnittliche Korrelation lag bei knapp r = 0,20. Die Agenten unterschieden Menschen zu wenig voneinander, stereotypisierten Gruppen und verhielten sich übermäßig rational. Eine weitere Studie wertete 31.865 reale Online-Einkaufssitzungen aus. Das beste promptbasierte System sagte die nächste Handlung in 11,86 Prozent der Fälle voraus; ein mit realen Klickdaten feinabgestimmtes Modell erreichte 17,26 Prozent. Das stammt nicht aus der Schule, trifft aber den methodischen Kern: Plausibles Verhalten ist noch keine verlässliche Verhaltensvorhersage.

Positive Befunde gibt es ebenfalls. In einer anderen Untersuchung bauten Park und Kollegen aus zweistündigen Interviews und Befragungen Agenten für 1.052 reale US-Amerikaner. Bei zurückgehaltenen Fragen des General Social Survey erreichten die Agenten 86 Prozent der Übereinstimmung, die auch bei einer erneuten Befragung derselben Personen nach zwei Wochen gemessen wurde. Das ist beachtlich, aber keine universelle Trefferquote. Vor allem beruht der Erfolg auf umfangreichen individuellen Selbstauskünften - also auf genau den Daten, die ein datensparsames Schulmodell vermeiden soll.

Die Werte dieser Untersuchungen sind nicht direkt vergleichbar, weil Aufgaben, Datengrundlagen und Messgrößen voneinander abweichen. Gemeinsam zeigen sie, wie stark die Ergebnisse vom Modell, vom Datenreichtum und vom konkreten Test abhängen.

Tausend Agenten desselben Modells sind deshalb keine tausend unabhängigen Schüler. Sie teilen Trainingsdaten, Wertungen und blinde Flecken.

Mehr Agenten reduzieren Zufall, nicht Modellfehler.

Fortbildung im Proberaum

In der Lehrerfortbildung bietet sich dennoch ein plausibler Einsatz an. Lehrkräfte könnten diagnostisches Nachfragen, den Umgang mit hartnäckigen Fehlvorstellungen oder schwierige Gesprächssituationen wiederholt üben. Forschungen mit virtuellen Unterrichtsavatar-Systemen liefern dafür einen vorsichtigen Anhaltspunkt. In einer randomisierten Studie mit 105 angehenden Lehrkräften verbesserten sich eng umrissene Fertigkeiten in weiteren Simulationsrunden deutlich, wenn dazwischen ein Coaching stattfand. Die Avatare wurden von Menschen gesteuert; ein Transfer in realen Unterricht wurde nicht geprüft. Das Ergebnis belegt daher weder die Qualität autonomer KI-Schüler noch eine Verbesserung des wirklichen Unterrichts.

Autonome KI-Schüler liefern dafür bislang keine vergleichbare Evidenz. In einer kleinen qualitativen Studie von Martynova und Kollegen beschrieben zwölf Lehrkräfte und Tutoren GPT-3.5-basierte Mathematik-Schüler als zu eloquent, zu aufmerksam und emotional zu gleichförmig. Manche wechselten unlogisch zwischen Wissensständen. Wegen des älteren Modells und des engen Fachkontexts ist das ein Warnsignal, kein Urteil über alle heutigen Systeme. Wer mit solchen Figuren trainiert, braucht eine klare Beobachtungsaufgabe, menschliches Feedback und anschließend die Probe in der Wirklichkeit. Der Agent darf Sparringspartner sein, nicht Prüfer der Lehrkraft. Hilfreicher ist systematischer Widerspruch als Qualitätskontrolle.

Gefährlich wird die Technik, sobald Schulen aus künstlichem Verhalten Noten, Fördermaßnahmen, Übergänge oder Urteile über Lehrer ableiten. Auch Schülerbefragungen und wirkliche Beteiligung lassen sich nicht simulieren. Ein Fehlurteil im Produkttest kostet im Zweifel Umsatz. In der Schule kann es Förderchancen, Bewertungen oder Bildungswege verändern. Deshalb muss die Simulation unterhalb jeder Entscheidung über Personen bleiben.

Praxistipp: Vier Prüfrollen statt tausend Scheinschüler

Geben Sie ChatGPT eine eigene Aufgabe und definieren Sie vier Rollen ausschließlich durch didaktische Merkmale: Sprachstand, Vorwissen, typische Fehlvorstellung und benötigte Hilfe. Verzichten Sie bewusst auf Herkunft, Geschlecht oder sozialen Status als vermeintliche Erklärung für Leistung und Verhalten. Jede Rolle soll den Auftrag in eigenen Worten wiedergeben, einen Lösungsversuch formulieren und die größte Hürde benennen. Nutzen Sie die Antworten als Suchliste möglicher Probleme, nie als Häufigkeitsprognose. Erst die Reaktion der realen Klasse entscheidet, ob der Test etwas getroffen hat. Weitere Beispiele bietet der Beitrag über sinnvolle KI-Szenarien im Unterricht.

Eine künstliche Klasse darf Unterrichtsentwürfe unter Gegenwind setzen. Über wirkliche Schüler entscheiden darf sie nie.

Quellen und Literatur

Interne Links