Unterrichtshelden
KI im Unterricht

KI-Feedback im Unterricht: Was die Forschung zeigt — und was nicht

Wie du KI für formatives Feedback nutzt, ohne die Verantwortung für Bewertung abzugeben

21 Min. Lesezeit
Sekundarstufe ISekundarstufe IIBerufsschuleAlle Fächer

Ein Klassensatz Erörterungen liegt auf dem Schreibtisch, und die realistische Rechnung ist ernüchternd: Bei 20 Minuten pro Text sind das mehr als acht Stunden Korrekturzeit für eine einzige Lerngruppe. Die Arbeitszeitforschung bestätigt, was Lehrkräfte längst wissen: Der eigentliche Unterricht macht nur noch etwa ein Drittel der Arbeitszeit aus. Ein weiteres Drittel geht in Vor- und Nachbereitung, zu der auch das Korrigieren gehört (Mußmann u. a., Erhebung 2023/24). Gleichzeitig gehört Feedback zu den am besten belegten Einflussfaktoren auf Lernerfolg überhaupt. Genau in diese Lücke stoßen KI-Tools mit einem großen Versprechen: Feedback für alle, sofort, ohne Wochenend-Korrekturmarathon. Was davon hält der Blick in die Forschung aus? Und wo verläuft die Grenze zwischen sinnvoller Entlastung und riskanter Abkürzung?

Das Wichtigste in Kürze

  • Feedback wirkt, aber differenzierter als oft behauptet. Die aktuelle Meta-Analyse von Wisniewski, Zierer & Hattie (2020) findet im Schnitt d = 0,48; informationsreiches Feedback erreicht d = 0,99, bloßes Lob oder Tadel nur d = 0,24.
  • KI-generiertes Feedback ist empirisch vielversprechend: In einer randomisierten Studie mit 459 Oberstufenschüler:innen verbesserte es Überarbeitung (d = 0,19), Motivation (d = 0,36) und positive Emotionen (d = 0,34) beim Schreiben (Meyer u. a. 2024).
  • Expertenfeedback bleibt besser: Im direkten Vergleich schnitt Lehrkräfte-Feedback auf 200 Schüleraufsätze besser ab als ChatGPT-Feedback (4,0 vs. 3,6 von 5 Punkten), besonders bei sehr schwachen Texten (Steiss u. a. 2024).
  • KI-Bewertung ist ein anderer Fall: Noten aus Sprachmodellen sind bislang unzuverlässig. Eine unabhängige Prüfung der fobizz-Korrekturhilfe fiel deutlich negativ aus (Mühlhoff & Henningsen 2024); fobizz hat das Tool im August 2026 selbst abgeschaltet.
  • Faustregel: KI als Feedback-Assistent für Lernprozesse ja, KI als Bewertungsinstanz nein. Auch die Ständige Wissenschaftliche Kommission der KMK betont: Die Verantwortung für Bewertung muss in menschlicher Hand bleiben (SWK 2024).
  • Mit Schülerdaten nur schulisch freigegebene, EU-gehostete Wege nutzen, etwa AIS.chat (bis Mai 2026: telli). Für die eigene Vorbereitung ohne Schülerdaten sind auch ChatGPT & Co. unproblematisch.

Was die Forschung sagt

Feedback ist ein starker Hebel — mit Streuung

Kaum ein Konzept der Unterrichtsforschung ist so gut untersucht wie Feedback. Die einflussreichste theoretische Arbeit stammt von Hattie & Timperley (2007): Wirksames Feedback beantwortet demnach drei Fragen: Wohin gehe ich? (Feed Up), Wie komme ich voran? (Feed Back) und Wohin als Nächstes? (Feed Forward). Es tut das auf vier Ebenen: Aufgabe, Prozess, Selbstregulation und Person. Ältere Synthesen bezifferten die durchschnittliche Wirkung von Feedback auf d = 0,79 und machten es damit zu einem der stärksten bekannten Einflussfaktoren.

Die methodisch strengere Neuauswertung von Wisniewski, Zierer & Hattie (2020) umfasst 435 Studien mit 994 Effektstärken und über 61.000 Lernenden. Sie kommt auf einen nüchterneren Gesamtwert: d = 0,48. Zur Einordnung: Effektstärken (Cohens d) beschreiben, wie groß ein Unterschied zwischen Gruppen in Standardabweichungen ist; nach gängiger Konvention gilt 0,2 als klein, 0,5 als mittel, 0,8 als groß. Ein d von 0,48 ist also ein solider mittlerer Effekt, aber kein Wundermittel. Der Durchschnitt verdeckt zudem das Entscheidende: Die Streuung ist enorm (I² = 83 %). Feedback ist keine einheitliche Maßnahme, sondern ein Sammelbegriff für sehr unterschiedlich wirksame Praktiken.

Was den Unterschied macht, zeigt die Moderatoranalyse, also die Prüfung, unter welchen Bedingungen Feedback wie stark wirkt: Informationsreiches Feedback, das erklärt, was warum nicht stimmt und wie es weitergeht, erreicht d = 0,99. Korrektives Feedback („richtig/falsch plus Korrektur") liegt bei d = 0,46. Bloße Verstärkung oder Bestrafung, etwa Lob, Tadel oder Smileys, kommt nur auf d = 0,24. Feedback wirkt über seinen Informationsgehalt, nicht über seine bloße Existenz.

Dass Feedback auch schaden kann, ist keine theoretische Spitzfindigkeit. Schon die klassische Meta-Analyse von Kluger & DeNisi (1996) fand über 607 Effektstärken hinweg zwar einen positiven Mittelwert (d = 0,41); in über einem Drittel der Fälle verschlechterte Feedback die Leistung jedoch. Ihre Erklärung, die Feedback-Interventions-Theorie: Je stärker Rückmeldung die Aufmerksamkeit von der Aufgabe weg und zur eigenen Person hin lenkt, desto geringer oder sogar negativer die Wirkung. Das deckt sich mit Hattie & Timperley, bei denen Feedback auf der Personenebene („Du bist einfach gut in Mathe") am schlechtesten abschneidet.

Für das Schreiben, das Haupteinsatzfeld von KI-Feedback, ist die Befundlage besonders klar. Die Meta-Analyse von Graham, Hebert & Harris (2015) zu formativem Assessment im Schreibunterricht (Klassen 1–8) findet für Feedback durch Erwachsene d = 0,87, für Peer-Feedback d = 0,58 und für Selbsteinschätzung d = 0,62. Computer-Feedback (damals: regelbasierte Systeme, vor der LLM-Ära) kommt auf d = 0,38. Menschliches Expertenfeedback setzt die Messlatte.

Auch das Timing ist kein Detail: Shute (2008) arbeitet in ihrem viel zitierten Review heraus, dass unmittelbares Feedback vor allem Lernenden mit Schwierigkeiten hilft. Es verhindert Frustration und das Einschleifen von Fehlern. Leistungsstarke Lernende können dagegen von leicht verzögertem, eher hinweisgebendem Feedback profitieren, das ihnen Raum zum eigenen Denken lässt. Für schwächere Schüler:innen empfiehlt sie direktives Feedback mit expliziter Anleitung, für stärkere eher fazilitierendes mit Hinweisen und Fragen. Relevant ist das, weil genau hier eine reale Stärke von KI-Systemen liegt: Sofortiges, individuell adressiertes Feedback für 28 Lernende gleichzeitig kann eine einzelne Lehrkraft schlicht nicht leisten, eine Maschine schon.

Dazu kommt die Tradition des formativen Assessments, also der Leistungsrückmeldung während des Lernprozesses mit dem Ziel, das Lernen zu steuern, statt es am Ende nur zu benoten. Black & Wiliam (1998) machten in „Inside the Black Box" Effektstärken zwischen 0,4 und 0,7 geltend und betonten, dass gerade leistungsschwächere Schüler:innen am meisten profitieren. Die Zahlen gelten heute als eher optimistisch (siehe die 0,48 von Wisniewski u. a.), die Grundrichtung ist aber unbestritten. Praktische Leitplanken liefert Shute (2008): Wirksames formatives Feedback ist aufgabenbezogen statt personenbezogen, elaboriert statt bloß verifizierend, spezifisch und in verdaubaren Portionen; auf soziale Vergleiche und Noten-Fixierung verzichtet es.

Was wir über KI-Feedback konkret wissen

Die Forschung zu LLM-Feedback ist jung, aber es gibt erste belastbare Studien. Ihr Muster ist bemerkenswert konsistent.

Meyer u. a. (2024) untersuchten 459 Oberstufenschüler:innen, die argumentative Texte auf Englisch schrieben, in einer randomisierten kontrollierten Studie, also mit zufälliger Zuteilung zu Feedback- und Vergleichsgruppe. Die Gruppe mit automatischem, kriterienorientiertem Feedback (generiert mit GPT-3.5-turbo) überarbeitete ihre Texte besser (d = 0,19), war motivierter (d = 0,36) und berichtete mehr positive Emotionen (d = 0,34) als die Gruppe ohne Feedback. Die Effekte auf die Textqualität sind klein. Der Vergleichsmaßstab ist allerdings realistisch: Ohne KI hätten diese Schüler:innen gar kein individuelles Feedback zum Entwurf bekommen, weil niemand 459 Texte über Nacht kommentiert.

Steiss u. a. (2024) verglichen die Feedback-Qualität direkt: 200 Geschichtsaufsätze von Schüler:innen der Klassen 6–12, kommentiert einmal von 16 erfahrenen Lehrkräften, einmal von ChatGPT (GPT-3.5). Auf einer fünfstufigen Skala über fünf Kriterien (u. a. Kriterienbezug, klare nächste Schritte, Genauigkeit, Passung zum Lernstand, unterstützender Ton) erreichten die Menschen 4,0, die KI 3,6. Die Lehrkräfte waren vor allem bei den schwächsten Texten deutlich besser, also genau dort, wo Feedback am meisten zählt. Die KI lieferte vereinzelt sachlich falsche Hinweise und bestätigte teils sogar Fehler. Dafür brauchte sie Sekunden statt 20–25 Minuten pro Text. Das Fazit der Autoren ist kein Entweder-oder, sondern eine Arbeitsteilung: KI für schnelles Zwischenfeedback, Lehrkraft für die kritischen Fälle und die Endbeurteilung.

Auch die Ständige Wissenschaftliche Kommission der KMK (2024) sieht in ihrem Impulspapier zu Large Language Models genau hier das Potenzial: Unterstützung bei differenzierten Aufgaben und bei summativer, also abschließend bewertender, wie formativer Rückmeldung, verbunden mit einer klaren Grenze: „die Verantwortung für die Bewertung muss in menschlicher Hand bleiben". Zugleich benennt die SWK die Risiken: Halluzinationen, also plausibel klingende, aber falsche Aussagen; Qualitätsschwankungen; und die Gefahr, dass ohnehin privilegierte Schüler:innen am meisten profitieren.

Grenzen der Befunde

So konsistent das Muster wirkt: Drei Einschränkungen gehören dazu. Erstens ist die LLM-Feedback-Forschung jung. Die zitierten Studien arbeiten mit GPT-3.5, einem Modell, das inzwischen mehrere Generationen alt ist; neuere Modelle dürften besser abschneiden, belegt ist das für den Schulkontext aber noch kaum. Zweitens messen die Studien kurzfristige Effekte einzelner Schreibaufgaben. Ob regelmäßiges KI-Feedback über ein Schuljahr die Schreibkompetenz nachhaltig verbessert oder ob Neuigkeitseffekte verfliegen und sich Abhängigkeiten einschleifen, weiß niemand. Drittens warnt die SWK zu Recht vor einem Equity-Problem: Lernende mit starken Vorkenntnissen können KI-Rückmeldungen besser einordnen und profitieren dadurch mehr. Unbegleiteter KI-Einsatz könnte Schereneffekte also verstärken statt verringern. Wer KI-Feedback einführt, sollte diese offenen Fragen kennen und die eigene Praxis entsprechend beobachten, statt auf gesicherte Langzeitwirkung zu vertrauen.

Die Kehrseite: KI-Bewertung ist bislang gescheitert

So vielversprechend KI-Feedback ist, so ernüchternd ist die Lage bei der automatischen Bewertung. Die unabhängige Prüfung der „KI-Korrekturhilfe" von fobizz durch Mühlhoff & Henningsen (2024) kam zu einem harten Urteil: Notenvorschläge und Teile des Feedbacks waren „oft zufällig", identische Eingaben führten zu unterschiedlichen Bewertungen. Das Tool vergab Bestnoten bevorzugt an ChatGPT-generierte Texte und erkannte selbst Unsinnstexte nicht. Die Autoren halten das nicht für ein Prompt-Problem, sondern für eine strukturelle Grenze heutiger Sprachmodelle.

Bemerkenswert ist, was danach geschah: fobizz schaltete Korrekturhilfe und KI-Feedback-Tool zum 2. August 2026 ab. Die eigene Begründung: Sprachmodelle lieferten „bei der Bewertung von Texten keine ausreichend zuverlässigen Ergebnisse"; gleiche Eingaben mit gleichen Kriterien führten wiederholt zu unterschiedlichen Einschätzungen. Ein Anbieter, der nach 18 Monaten Entwicklung öffentlich einräumt, dass sein Produkt das Kernversprechen nicht einlösen kann, ist selten. Das Signal ist deutlich: Wer heute KI-Noten verspricht, verspricht zu viel. Für dich heißt das nicht, die Finger von KI-Feedback zu lassen. Es heißt, zwei Dinge sauber zu trennen, die im Marketing gern verschwimmen: Rückmeldung zum Lernprozess und Bewertung von Leistung.

Feedback mit KI: die vier Ebenen als Qualitätsraster

Das Modell von Hattie & Timperley eignet sich nicht nur zur Analyse; es taugt auch als Checkliste, um KI-Feedback zu steuern und zu prüfen. Denn ein Sprachmodell produziert von sich aus bevorzugt das, was billig ist: allgemeines Lob („Ein gelungener Text mit interessanten Gedanken!") und Oberflächenkorrekturen auf Kommaebene. Beides ist genau das Feedback, das laut Forschung am wenigsten bringt. Gutes Prompting zwingt das Modell auf die wirksamen Ebenen; das Ebenenmodell sagt dir hinterher, ob das funktioniert hat.

EbeneFrageBeispielWirksamkeit laut Forschung
AufgabeStimmt das Ergebnis?„Deine These in Absatz 1 wird durch das Beispiel in Absatz 3 nicht gestützt."Hoch, v. a. bei Fehlkonzepten
ProzessWie ist es entstanden?„Prüfe bei jedem Argument: Behauptung → Beleg → Erklärung. Bei Argument 2 fehlt der Beleg."Hoch, fördert Transfer
SelbstregulationWie steuere ich mich selbst?„Lies deinen Schluss noch einmal: Beantwortet er deine Leitfrage aus der Einleitung? Woran erkennst du das?"Hoch, baut Selbstständigkeit auf
PersonWer bin ich?„Du bist ein Naturtalent!"Niedrig (d = 0,24 für Lob/Tadel)

Drei Konsequenzen für die Praxis:

Erstens: Kriterien vorgeben. KI-Feedback ist nur so gut wie der Maßstab, den es anlegt. Ein Erwartungshorizont oder ein Kriterienraster (im Fachjargon: Rubric) im Prompt, etwa „These erkennbar, mindestens zwei belegte Argumente, Gegenargument entkräftet, Schluss bezieht Stellung", verwandelt generisches Geplauder in kriteriales Feedback. Genau diesen kriterienorientierten Ansatz nutzte auch die Studie von Meyer u. a.

Zweitens: Feed Forward erzwingen. Die wirksamste Information ist die über den nächsten Schritt. Ein brauchbarer Feedback-Prompt verlangt explizit: zwei Stärken mit Textbeleg, zwei konkrete Verbesserungen mit Beispiel, eine Leitfrage zur Selbstprüfung. Ausdrücklich ausgeschlossen sind Note, Gesamtbewertung und Lob auf Personenebene.

Drittens: Überarbeitung einplanen. Feedback ohne Gelegenheit zur Überarbeitung bleibt folgenlos. Der Lerneffekt entsteht, wenn Schüler:innen mit der Rückmeldung etwas tun müssen: kognitive Aktivierung, also die Anregung zu tiefer Auseinandersetzung mit dem Gegenstand statt bloßem Abarbeiten. Wer KI-Feedback einführt, führt sinnvollerweise gleichzeitig eine Überarbeitungsphase ein.

Fertige, an diesen Prinzipien orientierte Prompt-Vorlagen findest du in unserer Prompt-Bibliothek und im Artikel KI-Prompts für Lehrkräfte.

Welcher Weg für welche Daten: Tools und Datenschutz

Bevor es an den Workflow geht, muss eine Vorfrage geklärt sein: Wo dürfen welche Texte hin? Die Faustregel aus unserem DSGVO-Überblick zu KI-Tools gilt auch hier: Eigene Unterrichtsvorbereitung ohne Schülerdaten ist unproblematisch; sobald echte Schülertexte oder gar Namen im Spiel sind, kommen nur schulisch freigegebene, EU-gehostete Wege infrage.

WegGeeignet fürSchülerdaten?KostenStand
AIS.chat (bis Mai 2026: telli)Feedback-Assistenten für Schüler:innen, Lehrkräfte-NutzungJa — dafür gebaut; Anmeldung über VIDIS, EU-Hosting, beworben als DSGVO-konform, keine Nutzung für Modelltrainingkostenlos (ländergemeinsames Angebot der 16 Länder, betrieben von der FWU)Modellauswahl u. a. Llama und GPT-5 mini
fobizzwar: Korrekturhilfe + KI-Feedback—LizenzmodellBeide Tools zum 02.08.2026 abgeschaltet; Reaktivierung nur auf Antrag der Institution
ChatGPT, Claude & Co. (privater Account)Eigene Vorbereitung: Erwartungshorizonte, Musterlösungen, Feedback auf anonymisierte EinzelbeispieleNein — keine echten Schülertexte mit PersonenbezugFree-Tier vorhandenFür Details siehe ChatGPT in der Sekundarstufe

Was AIS.chat für das Feedback-Szenario interessant macht, haben wir im ausführlichen AIS.chat-Guide beschrieben: Lehrkräfte können dort Assistenten mit eigenen Anweisungen anlegen und per Link an die Klasse geben. Das ist genau das Setup, das ein Feedback-Raster für alle nutzbar macht, ohne dass Schüler:innen eigene Accounts bei US-Anbietern brauchen. Wichtig bleibt die Grundregel für alle Wege: Klassenarbeiten und benotete Leistungen gehören grundsätzlich nicht in ein KI-Tool, und zwar nicht aus technischen, sondern aus rechtlichen und pädagogischen Gründen. Es geht um Übungsprodukte im Lernprozess.

Schritt für Schritt: KI-Feedback einführen, ohne die Kontrolle abzugeben

Der folgende Ablauf hat sich als Grundmuster bewährt und lässt sich auf fast jedes Fach übertragen. Als Beispiel dient eine Erörterung in Klasse 9 (Deutsch); die Varianten für andere Fächer folgen unten.

Schritt 1: Kriterienraster festlegen — vor der KI

Definiere 4–6 Kriterien, die du ohnehin bewerten würdest: These erkennbar, Argumente belegt, Gegenposition berücksichtigt, sprachliche Richtigkeit, Schluss mit Stellungnahme. Dieses Raster kennt die Klasse vorab, denn Transparenz der Erwartungen ist selbst ein wirksames Element formativen Assessments. Die KI bekommt exakt dieses Raster in den Prompt, nicht mehr und nicht weniger.

Schritt 2: Feedback-Assistent bauen und testen

Baue in AIS.chat (oder für die eigene Vorbereitung in einem Tool deiner Wahl) einen Assistenten mit einer Systemanweisung nach dem Muster: Rolle (freundliche, sachliche Schreibberatung für Klasse 9), Kriterien (dein Raster), Format (zwei Stärken mit Zitat, zwei Verbesserungen mit konkretem Beispiel, eine Frage zur Selbstprüfung), Verbote (keine Note, kein Notenvorschlag, keine umgeschriebene Musterlösung, kein Personenlob). Eine Systemanweisung als Ausgangspunkt:

Du bist eine freundliche, sachliche Schreibberatung für eine 9. Klasse. Du bekommst eine Erörterung. Prüfe den Text ausschließlich anhand dieser Kriterien: (1) These klar erkennbar, (2) mindestens zwei Argumente mit Beleg oder Beispiel, (3) Gegenposition genannt und entkräftet, (4) Schluss mit begründeter Stellungnahme. Antworte in genau diesem Format: Zwei Stärken — jeweils mit wörtlichem Zitat aus dem Text. Zwei Verbesserungsvorschläge — jeweils mit der konkreten Textstelle und einer Erklärung, warum die Stelle das Kriterium noch nicht erfüllt. Eine Frage zur Selbstprüfung. Wichtig: Gib keine Note und keine Gesamtbewertung ab. Schreibe keine Passagen um und liefere keine Musterformulierungen. Lobe nicht die Person, sondern benenne, was im Text gelungen ist.

Teste den Assistenten anschließend mit zwei bis drei alten, anonymisierten Texten unterschiedlicher Qualität, auch mit einem absichtlich schwachen. Genau bei schwachen Texten patzen Sprachmodelle laut Steiss u. a. am ehesten; wenn das Feedback dort unbrauchbar ist, nachschärfen. Ein gutes Ergebnis erkennst du an drei Merkmalen: Es zitiert konkrete Stellen, statt allgemein zu bleiben („Deine These fehlt" ist schwach; „Im ersten Absatz nennst du das Thema, beziehst aber keine Position: Ein Leser weiß nach Absatz 1 nicht, wofür du argumentierst" ist brauchbar). Es bleibt auf Aufgaben- und Prozessebene. Und es endet mit einem umsetzbaren nächsten Schritt.

Schritt 3: Erstfassung → KI-Feedback → Überarbeitung

Die Schüler:innen schreiben ihre Erstfassung, holen sich das KI-Feedback ein und überarbeiten mit einem klaren Auftrag: „Setze mindestens zwei Hinweise um und markiere die Stellen." Die Markierung ist entscheidend: Sie macht die Überarbeitung sichtbar und verhindert, dass das Feedback ungelesen verpufft. Wer mag, lässt zusätzlich in einem Satz notieren, welchen Hinweis sie verworfen haben und warum. Das trainiert den kritischen Umgang mit KI-Vorschlägen gleich mit, denn auch gutes KI-Feedback enthält gelegentlich Fehler.

Schritt 4: Lehrkraft-Feedback dort, wo es zählt

Jetzt kommt deine Expertise gezielt zum Einsatz: bei den schwächsten Texten (wo die KI am wenigsten leistet), bei fachlichen Zweifelsfällen und bei der Endfassung. Du korrigierst nicht mehr jeden Kommafehler in jeder Erstfassung; das hat die Maschine vorsortiert. Stattdessen liest du überarbeitete Texte, deren typische Oberflächenprobleme schon behoben sind. Das ist die realistische Entlastung: nicht „KI korrigiert für mich", sondern „ich korrigiere seltener Dinge, die eine Maschine anmerken kann, und häufiger Dinge, die nur ich sehe".

Erweiterung: KI-Feedback mit Peer-Feedback kombinieren

KI-Feedback und Peer-Feedback schließen sich nicht aus; sie ergänzen sich. Peer-Feedback ist gut belegt (d = 0,58 bei Graham u. a.; in der Wisniewski-Analyse schneidet Feedback von Lernenden an Lernende sogar auffällig stark ab, wenn auch auf schmaler Studienbasis). Im Alltag scheitert es aber oft daran, dass Schüler:innen nicht wissen, worauf sie achten sollen. Das Kriterienraster aus Schritt 1 löst beide Probleme zugleich: Wer zuerst mit dem Raster einen fremden Text kommentiert und danach das KI-Feedback zum selben Text liest, vergleicht automatisch die eigene Diagnose mit der der Maschine. Diese Doppelrunde schult den Blick für Textqualität. Das ist Scaffolding im ursprünglichen Sinn: ein Gerüst, das schrittweise abgebaut wird, bis die Kriterien verinnerlicht sind.

Varianten für andere Fächer

In den Fremdsprachen funktioniert das Muster fast identisch (Mediation, E-Mail, Essay); die Studie von Meyer u. a. lief im Englischunterricht. In den Naturwissenschaften eignet sich das Format für Versuchsprotokolle: Kriterien wie „Hypothese formuliert, Durchführung nachvollziehbar, Beobachtung von Deutung getrennt" sind für ein Sprachmodell gut prüfbar. In Gesellschaftswissenschaften passt es für Urteilsbildung und Quellenanalyse. Hier lohnt der explizite Prompt-Zusatz, dass die KI fachliche Aussagen nicht als korrekt bestätigen soll, sondern auf die Struktur der Argumentation fokussiert. Für mathematische Lösungswege sind Sprachmodelle als Feedback-Geber dagegen bislang unzuverlässiger; hier ist mehr Vorsicht angebracht als bei Texten.

Empfehlung nach Einsatzszenario

Sek I, Sprachen und Gesellschaftswissenschaften: Der Kernanwendungsfall. Feedback-Assistent mit Kriterienraster über AIS.chat, fester Dreischritt Erstfassung → Feedback → markierte Überarbeitung. Ab etwa Klasse 8 empfiehlt auch die SWK den regelmäßigen, begleiteten Einsatz von LLMs beim Schreiben; darunter sollte der Aufbau basaler Schreibfähigkeiten Vorrang haben: KI-Feedback ersetzt in Klasse 5/6 keine Schreibdidaktik. Sinnvoller Startpunkt ist eine einzelne Aufgabenform, die du gut kennst (etwa die Erörterung oder die Bildbeschreibung im Fremdsprachenunterricht), mit einer Klasse, die Überarbeitungsroutinen schon kennt. Erst wenn der Ablauf dort trägt, weitest du auf andere Formate aus. Feedback wirkt zudem am besten in einer Lernkultur, in der Üben und Fehler-Machen normal sind, wie sie auch der Testing-Effekt nahelegt.

Eigene Unterrichtsvorbereitung (alle Schulformen): Ohne Schülerdaten kannst du frei arbeiten: Erwartungshorizonte generieren und verfeinern, Musterlösungen auf drei Niveaustufen erstellen, dein eigenes Feedback auf Verständlichkeit prüfen lassen. Ohne Schülerdaten ist das der unproblematische Einstieg, um ein Gefühl für Stärken und Schwächen der Modelle zu entwickeln.

Referendariat und Lehrprobe: KI-gestütztes formatives Feedback eignet sich für Unterrichtsbesuche, wenn du es didaktisch begründest: Kriterientransparenz, kognitive Aktivierung in der Überarbeitungsphase, Differenzierung durch individuelles Feedback für alle. Entscheidend ist, dass die Stunde die Überarbeitung ins Zentrum stellt, nicht das Tool. Wie du Technik im Entwurf generell absicherst, zeigt der Beitrag Digitale Tools im Referendariat.

Berufsschule / Sek II: Ältere Lernende können den Feedback-Prompt zunehmend selbst gestalten und werden damit Schritt für Schritt zu Besitzer:innen ihres eigenen Lernprozesses; Selbstregulation wird zum expliziten Lernziel. Realistisches Ziel: Lernende, die vor der Abgabe eigenständig eine kriteriengeleitete KI-Rückmeldung einholen, kritisch filtern und dokumentieren, was sie übernommen haben. Genau diese Kompetenz brauchen sie auch nach der Schule.

Häufige Fehler

1. KI-Feedback mit KI-Bewertung verwechseln. Ein häufiger und folgenreicher Fehler. Notenvorschläge aus Sprachmodellen sind instabil (Mühlhoff & Henningsen 2024): gleicher Text, gleiche Kriterien, andere Note. Gegenmittel: KI konsequent auf Rückmeldung zum Prozess beschränken; jede Bewertung bleibt bei dir.

2. Feedback ohne Überarbeitungsphase. Wenn das KI-Feedback nach der Abgabe kommt oder folgenlos bleibt, verpufft der Effekt. Gegenmittel: Der Dreischritt Erstfassung → Feedback → markierte Überarbeitung ist fester Bestandteil der Aufgabe, nicht optionales Extra.

3. Ohne Kriterien prompten. „Gib Feedback zu diesem Text" produziert wohlklingende Beliebigkeit. Gegenmittel: Erwartungshorizont in den Prompt; Format und Verbote (keine Note, kein Personenlob) explizit machen.

4. Der KI fachlich blind vertrauen. Auch gutes KI-Feedback bestätigt gelegentlich Fehler oder erfindet Regeln; bei Steiss u. a. kam beides vor. Gegenmittel: Stichproben ziehen, besonders bei schwachen Texten; Schüler:innen auftragen, mindestens einen KI-Hinweis kritisch zu prüfen.

5. Schülertexte in private KI-Accounts kippen. Auch „nur mal schnell" ist mit personenbezogenen Daten nicht zulässig. Gegenmittel: schulisch freigegebene, EU-gehostete Wege für alles mit Schülerdaten; Texte für Testzwecke anonymisieren.

6. Das Werkzeug zum Star der Stunde machen. Wenn die Reflexion über das Tool mehr Raum einnimmt als das Fachliche, ist die Balance gekippt. Dieses Muster zeigt sich bei digitalen Medien generell: Auf die didaktische Einbettung kommt es an, nicht auf die Technik (mehr dazu in Digitale Medien: Was die Forschung zeigt). Gegenmittel: Das Lernziel bestimmt den Tool-Einsatz, nie umgekehrt.

Häufige Fragen

Darf ich Schülertexte überhaupt von einer KI kommentieren lassen? Übungstexte im Lernprozess: ja, wenn der Weg stimmt, also über schulisch freigegebene, EU-gehostete Angebote wie AIS.chat, idealerweise ohne Klarnamen im Text. Benotete Leistungen und Prüfungen: nein. Und unabhängig vom Tool gilt: Die Verantwortung für jede Bewertung bleibt bei dir.

Ersetzt KI-Feedback mein eigenes Feedback? Nein, es verschiebt es. Die Studienlage ist eindeutig: Expertenfeedback ist besser, besonders bei schwachen Texten. KI-Feedback lohnt sich dort, wo sonst gar kein individuelles Feedback möglich wäre: als zusätzliche Schleife vor deiner Rückmeldung, nicht als Ersatz.

Wird die Klasse nicht einfach schreiben, was die KI vorschlägt? Das Risiko besteht, wenn die KI Musterlösungen liefert. Deshalb gehört ins Assistenten-Setup das Verbot, Passagen umzuschreiben: Die KI benennt Probleme und stellt Fragen; die Umsetzung bleibt Aufgabe der Lernenden. Die Markierungspflicht („Was hast du geändert und warum?") macht die Eigenleistung sichtbar.

Ab welcher Klassenstufe ist das sinnvoll? Die SWK empfiehlt regelmäßige LLM-Nutzung beim Schreiben ab etwa Klasse 8. Vorher spricht wenig gegen punktuelle, eng angeleitete Formate. Der Aufbau grundlegender Schreib- und Lesefähigkeiten hat aber Vorrang, und der Nutzen steigt mit der Fähigkeit, Feedback kritisch einzuordnen.

Spart mir das wirklich Zeit? Nicht sofort. Assistent bauen, testen, Routinen etablieren: Das kostet erst einmal Stunden. Die Entlastung kommt mittelfristig und indirekt: Du liest überarbeitete statt roher Texte und setzt deine Korrekturzeit gezielter ein. Wer sich vom Versprechen „Korrektur auf Knopfdruck" angezogen fühlt, sollte sich erinnern, warum fobizz genau dieses Produkt zurückgezogen hat.

Was ist mit Handschriftlichem? Der Umweg (abfotografieren, erkennen lassen, einfügen) ist möglich, aber fehleranfällig und datenschutzrechtlich zusätzlich heikel. Praktikabler: KI-Feedback dort einsetzen, wo ohnehin digital geschrieben wird, und handschriftliche Formate bewusst analog rückmelden.

Ist KI-Feedback nicht unpersönlich und demotivierend? Die bisherige Evidenz zeigt eher das Gegenteil: In der Studie von Meyer u. a. stiegen Motivation und positive Emotionen. Plausible Erklärung: Rückmeldung ohne sozialen Bewertungsdruck fühlt sich risikoärmer an. Trotzdem bleibt die Beziehungsebene dein Terrain: Ein Sprachmodell kann nicht wertschätzend nicken, wenn jemand über sich hinauswächst.

Quellen

  1. Wisniewski, B., Zierer, K. & Hattie, J. (2020). The Power of Feedback Revisited: A Meta-Analysis of Educational Feedback Research. Frontiers in Psychology, 10, 3087. frontiersin.org
  2. Hattie, J. & Timperley, H. (2007). The Power of Feedback. Review of Educational Research, 77(1), 81–112. journals.sagepub.com
  3. Kluger, A. N. & DeNisi, A. (1996). The Effects of Feedback Interventions on Performance: A Historical Review, a Meta-Analysis, and a Preliminary Feedback Intervention Theory. Psychological Bulletin, 119(2), 254–284. cris.huji.ac.il
  4. Shute, V. J. (2008). Focus on Formative Feedback. Review of Educational Research, 78(1), 153–189. PDF via fsu.edu
  5. Black, P. & Wiliam, D. (1998). Inside the Black Box: Raising Standards through Classroom Assessment. Phi Delta Kappan, 80(2). Zusammenfassung: fairtest.org
  6. Graham, S., Hebert, M. & Harris, K. R. (2015). Formative Assessment and Writing: A Meta-Analysis. The Elementary School Journal, 115(4), 523–547. journals.uchicago.edu
  7. Meyer, J. u. a. (2024). Using LLMs to bring evidence-based feedback into the classroom: AI-generated feedback increases secondary students' text revision, motivation, and positive emotions. Computers and Education: Artificial Intelligence, 6, 100199. leibniz-ipn.de
  8. Steiss, J., Tate, T. u. a. (2024). Comparing the quality of human and ChatGPT feedback of students' writing. Learning and Instruction, 91. Bericht: hechingerreport.org
  9. Ständige Wissenschaftliche Kommission der KMK (2024). Large Language Models und ihre Potenziale im Bildungssystem. Impulspapier. swk-bildung.org (PDF)
  10. Mühlhoff, R. & Henningsen, M. (2024). Chatbots im Schulunterricht: Wir testen das Fobizz-Tool zur automatischen Bewertung von Hausaufgaben. rainermuehlhoff.de
  11. fobizz (2026). Informationen zur Einstellung von KI-Korrekturhilfe und KI-Feedback. fobizz.com
  12. FWU — Medieninstitut der Länder (2026). Neuer Name für den KI-Chatbot: Aus telli wird AIS.chat. Pressemitteilung. fwu.de
  13. Mußmann, F. u. a. (Universität Göttingen): Arbeitszeiterhebungen Hamburg/Berlin 2023/24. Bericht: news4teachers.de