Sonntagabend. Auf meinem Bildschirm liegt ein Unterrichtsentwurf, der auf den ersten Blick funktioniert. Die Quellen stimmen, die Aufgaben wirken schlüssig, der Zeitplan passt. Was fehlt, ist der Kollege, der jetzt fragt, ob die Leitfrage wirklich trägt, die Aufgabe den genannten Operator einlöst oder die Ergebnissicherung nur wiederholt, was zuvor schon gesagt wurde.
Genau hier beginnt für mich ein sinnvoller Einsatz generativer KI. Nicht als automatische Arbeitsblattmaschine. Nicht als Ersatz für Fachwissen. Sondern als organisierter Widerspruch.
Der Konjunktiv der Kooperation
Schulen erwarten von Lehrkräften, dass sie Unterricht gemeinsam entwickeln, Materialien austauschen und voneinander lernen. Das geschieht durchaus. Kollegen geben Aufgaben weiter, stimmen Klassenarbeiten ab oder beraten sich über Lerngruppen. Der anspruchsvollste Schritt bleibt jedoch selten: einen halbfertigen Entwurf offenzulegen, ihn gemeinsam zu zerlegen und anschließend neu zu bauen.
Die Forschung unterscheidet deshalb zwischen Austausch, arbeitsteiliger Kooperation und Kokonstruktion. Erst bei der Kokonstruktion beziehen Lehrkräfte ihr Wissen so intensiv aufeinander, dass neue Lösungen entstehen. Diese Form gilt als besonders gehaltvoll, aber auch als zeitaufwendig und anstrengend. Sie braucht gemeinsame Zeit, Vertrauen und einen klaren Arbeitsgegenstand. Ein Appell zu mehr Teamarbeit ersetzt diese Bedingungen nicht.
Der schulische Alltag erschwert genau diese Form. Lehrkräfte unterrichten zu verschiedenen Zeiten und planen in unterschiedlichen Rhythmen. Fachkonferenzen schaffen notwendige Absprachen. Sie sind aber selten der Ort, an dem eine einzelne Stunde fachlich, sprachlich und didaktisch im Detail geprüft wird. Unterricht bleibt deshalb vielfach individuell organisiert.
Das ist nicht bloß eine Frage persönlicher Neigung. Es ist eine Berufsstruktur, die Kooperation fordert, Unterrichtsvorbereitung aber überwiegend als Einzelarbeit organisiert.
Vom Assistenten zum Gegenleser
Generative KI kann diese Struktur nicht institutionell reparieren. Sie schafft keine gemeinsame Arbeitszeit und keine bessere Teamkultur. Sie kann jedoch eine begrenzte Ersatzfunktion übernehmen: asynchron, jederzeit verfügbar und ohne die soziale Hemmung, einen unfertigen Gedanken verteidigen zu müssen.
Dafür muss sich der Auftrag an die KI ändern. Die übliche Bitte "Verbessere meinen Unterrichtsentwurf" ist zu weich. Sie produziert oft zusätzliche Ideen, mehr Material und freundliche Allgemeinplätze. Ein Red Team erhält einen anderen Auftrag. Es soll nicht verschönern, sondern nach den Bedingungen suchen, unter denen ein Entwurf scheitert.
Der Begriff stammt aus der Sicherheits- und Systemprüfung. Dort bezeichnet Red Teaming einen bewusst adversarialen Test: Prüfer versetzen sich in die Rolle eines Angreifers oder Störers, um Schwachstellen und unerwünschte Folgen sichtbar zu machen. Für die Unterrichtsplanung ist das kein etablierter Forschungsstandard, sondern eine produktive Übertragung. Der Entwurf wird so behandelt, als müsse er vor einer skeptischen Prüfung bestehen.
Das kann sehr konkret werden. Eine fachwissenschaftliche Prüferrolle markiert unbelegte Behauptungen, Verkürzungen und Anachronismen. Eine fachdidaktische Rolle sucht Brüche zwischen Lernziel, Material, Aufgabe und Sicherung. Eine ausdrücklich simulierte Schülerperspektive fragt, welche Voraussetzungen stillschweigend erwartet werden. Eine sprachdidaktische Rolle prüft Begriffe, Operatoren und Leselast. Ein Ablaufcheck kontrolliert Zeit, Übergänge, Medien und Plan B.
Im Geschichtsunterricht könnte ein solcher Gegencheck bei einer Stunde zur französischen Résistance untersuchen, ob der Entwurf die Vielfalt des Widerstands nivelliert, Kollaboration nur moralisch behandelt, Quellen und Darstellungen verwechselt oder einen bilingualen Oberstufenkurs sprachlich überfordert. Die KI kennt die Klasse nicht. Aber sie kann Prüffragen erzeugen, die der Autor des Entwurfs leicht übersieht.
Für meine Praxis hat sich ein schlankes Verfahren bewährt. Zuerst fixiere ich Lerngruppe, Ziel, Material, Arbeitsauftrag, Sicherung und Zeitrahmen. Danach muss jede Kritik drei Teile enthalten: Befund, mögliches Lernrisiko und kleinste notwendige Revision. Anschließend lasse ich auch das Gutachten prüfen: Welche Einwände sind überzogen, unbelegt oder praktisch unrealistisch? Am Ende übernehme ich höchstens drei Änderungen mit erkennbarem Nutzen. Für diesen Gegencheck setze ich ein Zeitbudget von zehn bis fünfzehn Minuten.
Entlastung ist noch keine Qualität
Die bisherige Forschung stützt einzelne Bausteine dieses Vorgehens, nicht aber den gesamten Red-Team-Workflow als empirisch gesicherte Methode. Eine systematische Übersicht aus dem Jahr 2026 wertete 28 Studien zum gemeinsamen Design von Lernaufgaben durch Lehrkräfte und KI aus. Meist diente KI als Assistent oder Inhaltsgenerator. Seltener wurde sie als dialogischer Partner oder Mitgestalter eingesetzt. Gerade die Rolle, auf der mein Verfahren beruht, ist daher plausibel, aber noch vergleichsweise wenig untersucht.
Belastbarer ist der Befund zur Arbeitszeit. In einer randomisierten englischen Studie mit 259 Naturwissenschaftslehrkräften an 68 Schulen sank die wöchentliche Vorbereitungszeit für die untersuchten Klassen im Mittel von 81,5 auf 56,2 Minuten. Das entsprach 25,3 Minuten oder 31 Prozent. Eine Fachjury, die nicht wusste, welche Materialien mit ChatGPT entstanden waren, fand keinen erkennbaren Qualitätsunterschied. Die Studie belegt damit eine Zeitersparnis ohne erkennbare Einbußen in der bewerteten Materialqualität. Über den tatsächlich erteilten Unterricht oder über Lernzuwächse sagt sie nichts aus.
Andere Untersuchungen markieren die Grenze. Eine Analyse KI-generierter Unterrichtspläne fand nur geringe Übereinstimmung mit einem wissenschaftlich begründeten Rahmen für zugängliche und inklusive Unterrichtsplanung. Die Entwürfe mussten von Lehrkräften substanziell verändert werden.
Eine explorative Fallstudie zeigte zwar, dass sich innerhalb von 30 Minuten ein curricular anschlussfähiger naturwissenschaftlicher Entwurf erstellen und überarbeiten ließ. Die Zwischenfassungen enthielten jedoch fragwürdige Elemente, fehlende Details und eine erfundene Buchempfehlung. Die Studie untersuchte einen einzelnen Planungsprozess. Sie liefert deshalb ein aufschlussreiches Beispiel, aber keinen allgemeinen Wirksamkeitsnachweis.
Auch die Selbstprüfung eines Sprachmodells ist nicht automatisch verlässlich. Eine bloße Aufforderung wie "Prüfe dich selbst" bleibt häufig zu unbestimmt. Eine Studie aus der Sprachmodellforschung zeigt zugleich, dass strukturierte Verifikationsschritte die Korrekturleistung bei bestimmten Schlussfolgerungsaufgaben verbessern können. Das ist kein Nachweis für bessere Unterrichtsplanung. Vorsichtig ableiten lässt sich aber ein methodisches Prinzip: Prüfkriterien müssen konkret sein, und Produktion und Kontrolle sollten funktional getrennt werden.
Für die Praxis folgt daraus ein Dreieck. Die Lehrkraft bleibt Autor und trägt die Verantwortung. Die KI liefert Einwände, Gegenhypothesen und Prüffragen. Externe Evidenz bildet die dritte Instanz: Fachliteratur, Originalquellen, Bildungsplan und die tatsächlichen Lernprodukte der Klasse. Personenbezogene Schülerdaten gehören dabei nicht in KI-Systeme, die für eine solche Verarbeitung nicht ausdrücklich freigegeben sind. Das Zentrum für Schulqualität und Lehrerbildung Baden-Württemberg zieht diese Grenze ebenfalls klar.
Ein echter Kollege kennt die Klasse, hat Unterricht gesehen und kann Verantwortung teilen. Das leistet kein Sprachmodell. Seine Stärke liegt an einer anderen Stelle: Es macht Annahmen sichtbar, verlangt Begründungen und zwingt den Entwurf durch eine Prüfung, die ohne dieses Werkzeug oft ausfällt.
Der künstliche Kollege kennt die Klasse nicht. Aber er kann verhindern, dass die Lehrkraft den eigenen Entwurf nur noch mit den eigenen Augen sieht.
Quellen und Literatur
Forschungsliteratur
Grosche, Michael, Kathrin Fussangel und Cornelia Gräsel (2020): Kokonstruktive Kooperation zwischen Lehrkräften. Aktualisierung und Erweiterung der Kokonstruktionstheorie sowie deren Anwendung am Beispiel schulischer Inklusion. In: Zeitschrift für Pädagogik, 66 (4), S. 461-479. https://doi.org/10.3262/ZP2004461.
Lammert, Catherine, Samuel DeJulio, Stephanie Grote-Garcia und Lucretia M. Fraga (2024): Better than Nothing? An Analysis of AI-Generated Lesson Plans Using the Universal Design for Learning & Transition Frameworks. In: The Clearing House, 97 (5), S. 168-175. https://doi.org/10.1080/00098655.2024.2427332.
Powell, Wardell und Steven Courchesne (2024): Opportunities and risks involved in using ChatGPT to create first grade science lesson plans. In: PLOS ONE, 19 (6), e0305337. https://doi.org/10.1371/journal.pone.0305337.
Wang, Zongran, Liu Mingzhuo und A. Y. M. Atiquil Islam (2026): Reimagining teacher-AI co-design in learning task design: trends and perspectives. In: Humanities and Social Sciences Communications, 13, Artikel 757. https://doi.org/10.1057/s41599-026-06981-y.
Wu, Zhenyu, Qingkai Zeng, Zhihan Zhang, Zhaoxuan Tan, Chao Shen und Meng Jiang (2024): Large Language Models Can Self-Correct with Key Condition Verification. In: Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, S. 12846-12867. https://doi.org/10.18653/v1/2024.emnlp-main.714.
Berichte und amtliche Hinweise
Education Endowment Foundation (2024): ChatGPT in lesson preparation - Teacher Choices trial. Projekt- und Ergebnisbericht.
Vassilev, Apostol, Alina Oprea, Alie Fordyce und Hyrum Anderson (2024): Adversarial Machine Learning. A Taxonomy and Terminology of Attacks and Mitigations. Gaithersburg: National Institute of Standards and Technology. https://doi.org/10.6028/NIST.AI.100-2e2023.
Zentrum für Schulqualität und Lehrerbildung Baden-Württemberg (2026): FAQ zu Künstlicher Intelligenz. Abruf am 13. August 2026. ZSL Baden-Württemberg.


