Schadet generative KI dem Lernen oder unterstützt sie es? Die ehrliche Antwort lautet: Es kommt auf die Aufgabe an, auf den Lernstand und darauf, was eine Prüfung eigentlich zeigen soll. Das kann zunächst nach Ausweichen klingen. Bis jemand daraus ein Raster baut, mit dem Lehrende tatsächlich arbeiten können. Die AI Assessment Scale (AIAS) von Mike Perkins, Leon Furze, Jasper Roe und Jason MacVaugh ist genau ein solches Raster. Und ihre jüngste Überarbeitung verändert ziemlich grundlegend, wie die Skala verstanden werden sollte.
Table of Contents
ToggleWie die AI Assessment Scale heute aussieht
Die aktuelle Version 2.1 kennt fünf Stufen: No AI, AI Planning, AI Collaboration, Full AI und AI Exploration. Die AIAS-Website berichtet von einem Einsatz an mehr als 350 Einrichtungen weltweit und Übersetzungen in mehr als 30 Sprachen. Auch TEQSA hat die AI Assessment Scale als eine mögliche Option für den Umgang mit generativer KI in Prüfungen genannt.
Entscheidend ist die neue Rahmung. Jede Stufe beschreibt eine andere Art von Prüfungsaufgabe, nicht einfach einen höheren oder niedrigeren Grad erlaubter KI-Nutzung. Keine Stufe ist grundsätzlich besser als eine andere. Nur Stufe 1 trägt ein Vorhängeschloss, weil hier KI ausgeschlossen wird und entsprechend abgesicherte Prüfungsbedingungen erforderlich sind.
Warum die AI Assessment Scale geändert wurde
Die erste Fassung arbeitete mit Ampelfarben: Rot, Gelb und Grün. Das Problem waren nicht die Farben an sich. Sie legten eine Rangordnung nahe. Rot wirkte wie die schlechte Option, Grün wie die gute. Dabei ist eine gut konzipierte Aufgabe auf Stufe 4 nicht grundsätzlich besser als eine gut konzipierte Aufgabe auf Stufe 1.
Das tieferliegende Problem benennen die Autoren in ihrer Überarbeitung von 2025. Wenn KI grundsätzlich erlaubt ist, lässt sich schwer überprüfen, an welchem Punkt die Eigenleistung der studierenden Person endet. Gleichzeitig wurde die frühere Vorgabe gestrichen, einen Anhang mit dem Originalentwurf einzureichen. Die Überarbeitung trägt damit auch den Grenzen Rechnung, die eine nachträgliche Erkennung bei der Frage nach der tatsächlichen Autorschaft hat.
Damit hat sich der Charakter der Skala verändert. Die AI Assessment Scale ist heute weniger eine Erlaubnisleiter als ein Werkzeug für Prüfungsdesign und Prüfungsneugestaltung. Die eigentliche Frage lautet: Was sollen Studierende zeigen? Welche Rolle kann KI dabei spielen? Und wie bleibt die Prüfung trotzdem valide?
Die Lücke zwischen KI-Regeln und dem, was sich tatsächlich überprüfen lässt
Corbin und Kolleg:innen haben ein ähnliches Problem 2025 in Assessment & Evaluation in Higher Education untersucht. In ihrer Studie geht es darum, wie Studierende und Lehrende die Grenze zwischen zulässiger und unzulässiger KI-Nutzung in Prüfungen tatsächlich erleben. Ihr Ergebnis ist wenig überraschend und trotzdem wichtig: Solche Grenzen lassen sich in der Praxis deutlich schwerer ziehen, als ein Prüfungsdokument zunächst vermuten lässt.
Das schließt direkt an das an, was wir in dieser Serie beschrieben haben. Bayerns Gesetzentwurf geht den rechtlichen Weg: Hochschulen sollen KI in unbeaufsichtigten schriftlichen Prüfungen nicht pauschal ausschließen und deren Nutzung dokumentieren lassen. TEQSA verweist auf Prozessevidenz. Die AIAS geht den didaktischen Weg. Sie unterscheidet verschiedene Formen der KI-Nutzung, verlangt aber trotzdem, dass das Prüfungsdesign die beabsichtigte Lernleistung sinnvoll erfassbar macht.
Drei unterschiedliche Wege führen damit zu einem ähnlichen praktischen Problem: ein didaktisches Raster, ein deutscher Gesetzentwurf und eine australische Hochschulbehörde. Alle drei lassen Lehrende mit derselben Aufgabe zurück. Regeln über KI in Prüfungen sind nur dann etwas wert, wenn Prüfungsdesign und Nachweise sie in der Praxis tragen.
Welche Prüfungsaufgaben sollten KI-frei bleiben?
Die verbreitete Analogie ist der Taschenrechner. Wenn wir ihn bei bestimmten mathematischen Grundlagen zurückhalten, so lautet das Argument, sollten wir mit KI genauso verfahren. Die Datenlage gibt dafür keine pauschale Grundlage. Die Metaanalyse von Hembree und Dessart fand, dass Taschenrechner die Fähigkeiten mit Papier und Bleistift im Durchschnitt in fast allen untersuchten Klassenstufen verbesserten. Eine relevante Ausnahme war die vierte Klasse, in der eine anhaltende Nutzung offenbar bestimmte Grundfertigkeiten bremsen konnte. Ellingtons spätere Auswertung von 54 Studien fand dagegen insgesamt keine Behinderung der entsprechenden Fertigkeitsentwicklung.
Gerade die Ausnahme ist aufschlussreich. Ein Werkzeug sollte dort eingeschränkt werden, wo sein Einsatz die konkrete Fähigkeit beeinträchtigt, die eine Prüfung gerade aufbauen oder messen soll. Das ist ein deutlich sinnvolleres Prinzip, als eine Technologie pauschal für gut oder schlecht zu erklären.
Für KI in der Bildung ist die aktuelle Evidenz besonders interessant. In einem großen Feldexperiment mit 994 Schülerinnen und Schülern fanden Bastani und Kolleg:innen (PNAS, 2025), dass uneingeschränkter GPT-4-Zugang die Leistung beim Üben verbesserte. In einer späteren Prüfung ohne KI schnitten dieselben Lernenden jedoch rund 17 Prozent schlechter ab. Ein anders konzipierter KI-Tutor, der Hinweise statt fertiger Antworten gab, verhinderte diesen negativen Effekt. Die Technologie war also nicht der einzige entscheidende Faktor. Entscheidend war auch, wie sie in den Lernprozess eingebaut wurde.
Das ist die AIAS-Logik in einem einzigen Experiment.
Die Entscheidung gehört ins Klassenzimmer
Welche AIAS-Stufe zu einer konkreten Prüfungsaufgabe passt, ist keine Entscheidung, die sinnvoll von einem Ministerium oder einer Behörde für alle Fächer getroffen werden kann. Sie gehört näher an den Unterricht. Dort kennt jemand die Gruppe, das Fach und den Zweck der Aufgabe. Eine Arbeit im ersten Semester, die grundlegende Argumentation trainieren soll, kann sinnvoll auf Stufe 1 liegen. Eine Abschlussarbeit, in der Studierende komplexe Daten analysieren, kann dagegen weniger sinnvoll sein, wenn jede KI-Unterstützung künstlich ausgeschlossen wird.
Dafür braucht es zweierlei: ein klares Raster und die Mittel, um die gewählte Stufe tatsächlich glaubwürdig umzusetzen. Das Raster liefert die AIAS inzwischen mit deutlich größerer Klarheit. Die schwierigere Frage kommt danach. Eine Prüfung auf Stufe 1 muss abgesichert sein. Die höheren Stufen brauchen ausreichend Nachweise dafür, wie die Arbeit entstanden ist und welche Rolle KI dabei gespielt hat. Beides passiert nicht dadurch, dass man die gewählte Stufe auf das Aufgabenblatt schreibt.
KI, Täuschung, Plagiat und akademische Integrität lassen sich nicht auf ein Label reduzieren
Hier wird der Unterschied zwischen Prüfungsdesign und akademischer Integrität besonders deutlich. Klare Regeln für KI können Unsicherheit reduzieren. Sie verhindern aber nicht automatisch Täuschung, Plagiat oder eine unangemessene Verlagerung der eigentlichen Denkarbeit auf ein KI-System. Ein Verbot ist nur dann sinnvoll, wenn eine Hochschule es in der Praxis auch nachvollziehbar durchsetzen kann. Umgekehrt beseitigt die Erlaubnis von KI nicht die Frage, wer eine Leistung tatsächlich erbracht hat und ob die beabsichtigten Lernziele erreicht wurden.
Deshalb verbinden tragfähige Prüfungsformate zunehmend klare Erwartungen mit Evidenz. Die Frage lautet nicht nur, ob KI verfügbar war. Entscheidend ist, ob die Prüfung weiterhin eine belastbare Beurteilung von Lernleistung und Eigenbeitrag ermöglicht.
Quellen und weiterführende Literatur
Dieser Artikel stützt sich unter anderem auf die folgenden wissenschaftlichen Arbeiten und Frameworks:
- Perkins, Roe & Furze (2025): Reimagining the Artificial Intelligence Assessment Scale – die wissenschaftliche Grundlage für AIAS 2.1 und deren Weiterentwicklung zu einem Framework für Prüfungsneugestaltung.
- Bastani et al. (2025): Generative AI without guardrails can harm learning – ein großes Feldexperiment dazu, wie unterschiedliche Formen der GPT-4-Nutzung das Lernen und die spätere Leistung ohne KI beeinflussen.
- Corbin et al. (2026): The wicked problem of AI and assessment – eine Analyse darüber, warum generative KI ein grundlegendes Problem des Prüfungsdesigns darstellt und nicht durch eine einzige Regel oder ein einzelnes Erkennungstool gelöst werden kann.
Eine gewählte Prüfungsstufe einlösen
An diesem zweiten Teil arbeiten wir bei Mentafy: Wir dokumentieren den Schreibprozess, damit Eigenleistung, KI-Nutzung und die Entwicklung einer Arbeit sichtbar werden. Das Ziel ist einfach. Wenn eine Lehrkraft eine bestimmte Prüfungsstufe wählt, sollte die vorhandene Evidenz diese Entscheidung auch tragen. Hier finden Sie unsere Werkzeuge im Überblick oder sprechen Sie uns direkt an.






Noch kein Kommentar, Füge deine Stimme unten hinzu!