Kommentar
Andrea Klein, Doris Weßels & Kirsten Schindler
21. September 2026
Hausarbeiten haben ein Problem. Oder genauer: Hochschulen haben ein Problem mit Hausarbeiten. Denn weitgehend überzeugende Texte lassen sich heute schnell und ohne nennenswertes menschliches Zutun produzieren, ohne dass dies zuverlässig nachgewiesen werden kann. Bei der Hausarbeit als Prüfungsleistung entsteht damit eine grundlegende Schieflage: Die Hausarbeit misst dann nicht valide, was als eigenständige Leistung dienen soll, sie ist nicht fair, da sie ggf. unterschiedliche Unterstützungsmöglichkeiten zum Ausgangspunkt hatte und sie ist nicht transparent, weil unklar ist, wie der jeweilige Einsatz einzuschätzen ist. Eine naheliegende Schlussfolgerung lautet deshalb, dem Entstehungsprozess mehr Beachtung zu schenken und damit eine valide, faire und rechtssichere Gesamtbewertung zu ermöglichen, die die individuelle menschliche Leistung belastbar erfasst.
Vom fertigen Text zum „Proof of Process“
An einigen Hochschulen werden Systeme getestet, pilotiert oder eingesetzt, mit denen der Schreibprozess selbst technisch nachvollziehbar werden soll. Ein prominentes Beispiel ist Turnitin Clarity, das unter anderem an der UCLA getestet wurde (https://dts.ucla.edu/initiatives/bruin-learn-center-excellence/academic-tech-tools/turnitin-clarity?utm_source=chatgpt.com ). Ähnliche Ansätze gibt es mit Cadmus etwa an der University of Melbourne (https://lms.unimelb.edu.au/learning-technologies/cadmus ).
Die Vorgehensweise ist in beiden Fällen ähnlich: Studierende schreiben innerhalb einer vorgegebenen digitalen Umgebung. Dabei entstehen Daten darüber, wie der Text zustande gekommen ist. Im sogenannten Writing Report bilden bestimmte Metriken den Entstehungsprozess ab: Student writing time, Number of writing sessions und (eine ausreichende Zahl an Einreichungen vorausgesetzt) Cohort average time. Hinzu kommen Pasted text findings, die einzelne Einfügevorgänge erfassen und unter anderem unterscheiden, ob eingefügter Text anschließend Changed oder Unchanged blieb.
Bei Turnitin Clarity lässt sich die Entwicklung eines Dokuments außerdem über das Writing process playback nachträglich abspielen; Ergänzungen, Löschungen und eingefügte Passagen werden dabei auf einer Zeitleiste sichtbar. Das System setzt darüber hinaus Flags für bestimmte Muster, darunter Writing time, Shorter writing time than cohort, Minimal revision, Pasted text in final document und Significant pasting throughout writing process (https://guides.turnitin.com/hc/en-us/articles/36916426919949-Reviewing-the-Writing-Report?utm_source=chatgpt.com ). Turnitin verwendet für das zugrunde liegende Prinzip den Begriff „proof of process“ (https://guides.turnitin.com/hc/en-us/articles/36982699236877-Getting-Started-with-Turnitin-Clarity-for-Students?utm_source=chatgpt.com ).
Wenn aus Schreibverhalten eine Norm wird
Seit Jahrzehnten argumentiert die Schreibdidaktik dafür, nicht nur das Endprodukt zu betrachten, sondern Studierende stärker im Prozess zu begleiten (Kruse & Ruhmann 2006, dass dies nicht ganz einfach ist, haben wir an anderer Stelle bereits formuliert: Buck et al. 2023). Prozessdaten können dabei durchaus didaktisch sinnvoll sein, etwa als Grundlage für formatives Feedback und die Reflexion des eigenen Schreibprozesses (hierzu z. B. Vandermeulen et al. 2020, 2023 mit einer Untersuchung bei Schüler:innen); entscheidend ist allerdings, welche Funktion diese Daten erhalten: Es ist etwas anderes, sie Schreibenden als Reflexionsanlass zurückzugeben, als aus ihnen auf Authentizität oder Eigenleistung zu schließen. Prozessbegleitung und Prozessüberwachung sind nicht dasselbe.
In hybriden Mensch-KI-Arbeitsprozessen ist die menschliche Leistung nicht mehr trennscharf sichtbar. Wer hatte die Idee, wer strukturierte die Argumentation, wer prüfte Quellen, wer verwarf Vorschläge – und wer formulierte am Ende? Viele Lehrende geraten in ihrer Funktion als Prüfende an Grenzen. Unter erheblichem Zeit- und Rechtfertigungsdruck suchen sie deshalb nach Detektoren, Kennzeichnungspflichten und immer feineren Prozessspuren, um die bisherige Praxis der (vermeintlich) eindeutig zurechenbaren Hausarbeit in der alten Ausgestaltung zu retten. Verständlich ist dieser Reflex; überzeugend ist er nicht. Er konserviert in dieser Form ein Prüfungsformat, dessen Bewertungslogik durch die Mensch-KI-Kollaboration bereits grundlegend verändert wurde und daher auch in seiner Praxis angepasst werden muss.
Wenn nun anstelle einer systematischen Anpassung dieses Prüfungsformates eine technische Datensammlung steht, dann wird es aus unserer Sicht in vielerlei Hinsicht problematisch. Denn aus den über das Schreibverhalten gesammelten Daten werden weitreichende Interpretationen gezogen, die durchaus schwierig sein können. Was bedeutet es beispielsweise, wenn ein System darauf hinweist, dass jemand „ungewöhnlich schnell“ geschrieben hat, wenig überarbeitet oder einen großen Teil seines Textes eingefügt hat? All diese Beobachtungen können interessant sein, lassen allerdings kaum belastbare Rückschlüsse zu. Vielleicht produziert eine Person zunächst viel Rohtext und überarbeitet anschließend radikal, während eine andere Person diktiert, zunächst in Stichpunkten arbeitet oder eigenen Text einfügt, der an anderer Stelle entstanden ist. Aus der Schreibwissenschaft wissen wir seit langem, dass die Arbeit an Texten in sehr unterschiedlicher Weise erfolgt, Schreibende beispielsweise eher Strukturschaffer sind (also über das Schreiben selbst eine logische Reihenfolge erarbeiten) oder als Strukturfolger zunächst außerhalb eines Textes über ihren Text nachdenken (Bräuer 2009). Eine Bewertung dieses Vorgehens als zielführender oder weniger zielführend ist unsinnig.
Aus beschreibenden Daten können nun sehr schnell normative Vorstellungen werden. Wenn kurze Schreibzeiten, wenig Revision oder große Paste-Anteile als auffällig markiert werden, entsteht implizit ein Modell davon, wie authentisches wissenschaftliches Schreiben aussehen soll.
Beim wissenschaftlichen Schreiben handelt es sich aber gerade nicht um eine standardisierte motorische Aktivität, die mit einem Ideal oder einer Norm abgeglichen werden kann. Schreibprozesse sind, insbesondere, wenn es um kognitiv anspruchsvolle Vorhaben geht, individuell, iterativ, häufig „unordentlich“, wie in der Schreibforschung schon seit den 1980er Jahren thematisiert (Hayes & Flower 1980).
Die Liste der oben aufgezählten „Flags“ wirft auch kritische Fragen hinsichtlich der Chancengerechtigkeit auf. Dass automatisierte Verfahren zur Beurteilung studentischer Texte nicht für alle Gruppen gleichermaßen zuverlässig funktionieren, zeigen etwa Untersuchungen zu KI-Detektoren, bei denen insbesondere Nachteile für Studierende mit einer anderen Erstsprache diskutiert werden (z. B. Deep et al., 2025). Auch bei der Interpretation von Schreibprozessdaten ist deshalb zu fragen, welche Schreib- und Arbeitsweisen implizit als Standard vorausgesetzt werden. Eine Auseinandersetzung mit diesem Bias ist für eine fundierte kritische Analyse der Tools unerlässlich. Paradoxerweise scheint an Hochschulen die Sensibilität für unterschiedliche Lern-, Arbeits- und Schreibweisen zuzunehmen, während gleichzeitig durch den Einsatz der beschriebenen Maßnahmen Entstehungsprozesse von Texten standardisiert würden.
Aber was beweist der beobachtete Prozess eigentlich?
Noch grundlegender ist eine andere Frage. Angenommen, ein System kann zweifelsfrei feststellen, dass ein Text über einen bestimmten Zeitraum entstanden ist, insgesamt eine bestimmte Anzahl an Stunden daran gearbeitet wurde, verschiedene Absätze geschrieben, wieder gelöscht und neu formuliert wurden und zwischendurch Text eingefügt wurde. Dann wäre damit genau das bewiesen, nicht aber dass die wissenschaftliche Denkleistung hinter diesem Dokument von der Person stammt, deren Interaktionen aufgezeichnet wurden.
Dieser Unterschied wird zuvor schon mit menschlichen Ghost-Writern, spätestens aber mit KI-Agenten relevant. Sie können schrittweise arbeiten, Zwischenergebnisse erzeugen, Veränderungen vornehmen und mit einer digitalen Arbeitsumgebung interagieren. Damit ist prinzipiell nicht nur die Produktion eines Endprodukts automatisierbar, sondern auch die Produktion eines plausibel wirkenden Entstehungsprozesses (https://detectiondrama.com/writing-process-trackers-what-they-prove/ ).
Das führt zu einem ziemlich vorhersehbaren Wettrüsten: KI erzeugt Texte. Hochschulen reagieren mit KI-Detektoren. Weil KI-Detektoren unzuverlässig sind (wegweisend hier Weber-Wulff et al. 2023), wird der Schreibprozess zum neuen Prüfobjekt. Agentische KI wiederum kann neben dem Produkt auch einen beobachtbaren Prozess erzeugen. Sobald Eigenleistung anhand maschinenlesbarer Verhaltensindikatoren beurteilt wird, entsteht ein Anreiz, genau diese Indikatoren zu produzieren. Aus „proof of process“ kann damit „proof of performed process“ werden. Ein aufgeführter Schreibprozess ist jedoch kein Beleg für eigenständiges Denken.
Auch Wasserzeichen liefern keinen Prüfbeweis
Die aktuelle Kennzeichnungsdebatte verschärft das Problem. Anthropic kündigte im August 2026 an, von Claude erzeugte Texte mit eingebetteten, maschinenlesbaren Wasserzeichen und unterstützte Dateien mit signierten Herkunftsmetadaten zu versehen. Das Unternehmen stellt dies ausdrücklich in den Kontext seiner Verpflichtungen aus dem Transparenzkodex zu Artikel 50 Absatz 2 des EU AI Act (Anthropic 2026; Europäische Kommission 2026).
Für die Leistungsbewertung ist das jedoch ein Feigenblatt. Anthropic weist selbst darauf hin, dass ein erkanntes Zeichen lediglich besagt, ein Inhalt könne von Claude verarbeitet worden sein: Auch Korrektur, Übersetzung oder Zusammenfassung menschlicher Texte können markiert werden. Umgekehrt kann das Signal nach starker Bearbeitung, Paraphrase, Übersetzung, Vermischung mit anderen Texten oder bei sehr kurzen Passagen fehlen. Damit mag formal ein Transparenzsignal gesetzt sein; inhaltlich beantwortet es weder die Frage nach der Urheberschaft der Gedanken noch nach Umfang und Qualität der menschlichen Leistung. Als Kriterium für Benotung oder Täuschungsvorwurf ist es weder zuverlässig noch rechtlich belastbar.
Würden wir das auch von Wissenschaftler:innen verlangen?
An dieser Stelle hilft ein Perspektivwechsel. Auch wissenschaftliche Verlage haben auf generative KI reagiert (Lendvai & Petra 2026). Bislang ist uns jedoch kein seriöses Journal bekannt, das von Wissenschaftler:innen verlangt, ein Paper ausschließlich in dessen Editor zu verfassen, welcher die Schreibzeiten aufzeichnet, die Überarbeitungen registriert und ungewöhnliches Schreibverhalten für die Redaktion markiert. Die spontane Reaktion vieler Wissenschaftler:innen auf eine solche Forderung lässt sich erahnen.
Warum erscheint manchen Akteur:innen an Hochschulen dieselbe Logik bei Studierenden akzeptabel? Das ist mehr als eine rhetorische Frage und die Antwort liegt nahe: Studentische Hausarbeiten sind eine Prüfungsleistung und Prüfungen brauchen Regeln und Verfahren, mit denen Eigenleistung beurteilt werden kann. Aus diesem Grund müssen diese Verfahren auch in Hinblick auf die Eigenleistung valide sein und nicht nur die technisch präzise Vermessung der Textentstehung bieten. Das gibt nicht nur den Prüfenden, sondern auch den Geprüften Sicherheit. Wenn die erhobenen Daten nicht zuverlässig das abbilden, was eigentlich geprüft werden soll, wird aus mehr Kontrolle nicht automatisch eine bessere Prüfung.
Studien wie die von Conijn et al. (2021) zeigen jedoch, dass die Korrelation zwischen Schreibprozessdaten und tatsächlicher intellektueller Tiefe oder akademischer Qualität sehr begrenzt ist.
Reales Problem – aber falsche Lösung
Die Herausforderung durch generative KI ist real. Die Nutzung von KI kann dazu führen, dass Studierende Lern- und Denkaufgaben auslagern und darüber nicht zur Rechenschaft gezogen werden, was ein Studium in dieser Form entwertet. Der Fall des amerikanischen Wirtschaftsprofessors an der Brown Universität zeigte eindrücklich, wie unterschiedlich die Ergebnisse ausfallen können, wenn KI in einer Präsenzprüfung gerade nicht verwendet wird (https://t3n.de/news/elite-uni-professor-deckt-ki-betrug-auf-1752084/). Die Vorstellung, immer feinere technische Spuren sammeln zu können, bis sich daraus irgendwann der gedankliche Entstehungsprozess eines wissenschaftlichen Textes rekonstruieren lässt, führt aber in die falsche Richtung. Stattdessen sollten wir stärker fragen, was eine Hausarbeit künftig überhaupt leisten soll. Was sollen Studierende lernen und welche Kompetenz wollen wir damit prüfen? Welche Rolle darf KI dabei spielen? Ansätze wie etwa das DRIVE-Modell (Oliveira et al., 2025) bieten eine konstruktive Alternative zum Überwachungsmodell, indem der Fokus auf den Dialog und die Steuerung von KI durch Studierende gelegt wird, anstatt auf die bloße Protokollierung des Schreibvorgangs.
Bewertung neu denken: das 3-P-Modell
Eine mögliche Alternative liegt mit dem 3-P-Modell vor, das Doris Weßels 2023 erstmals vorgestellt hat (Weßels 2023) und das sich insbesondere für empirische Arbeiten eignet. Es ergänzt die Bewertung des schriftlichen Elaborats als Produkt um die Präsentation einschließlich mündlicher Verteidigung und um den Prozess; es knüpft damit an eine alte universitäre Tradition der Thesis und seiner Defensio an. In seiner ursprünglichen Fassung meint das dritte P jedoch gerade keine lückenlose Schritt-für-Schritt-Analyse des Schreibens. Bewertet wird das Design des Prozesses: einerseits das forschungsorientierte und methodische Prozessdesign, andererseits das technische Design, also die sinnstiftende und zielorientierte Auswahl und Nutzung von IT- und KI-Werkzeugen.
Diese Unterscheidung ist zentral. Nicht jede Pause, Einfügung oder Überarbeitung wird vermessen; beurteilt werden die Qualität des wissenschaftlichen Vorgehens, die begründeten Werkzeugentscheidungen und die Fähigkeit, diese Entscheidungen im Produkt und in der Verteidigung fachlich zu verantworten. Prozess, Produkt und Präsentation ergeben gemeinsam ein Bewertungsdesign, das menschliche Urteilskraft sichtbar machen soll, ohne Totalüberwachung zu versprechen.
Das gemeinsame HFD-Diskussionspapier von Weßels, Bils und Budde führt diese Debatte um das Ende der klassischen, ausschließlich produktzentrierten Haus- und Abschlussarbeit weiter (Weßels, Bils & Budde 2025). Sein Kern ist kein Verbot von KI oder einer Abschaffung von Hausarbeiten, sondern der Wechsel von Kontrolle zu Befähigung und die vorgängige Klärung, welches Ziel eine schriftliche Arbeit überhaupt verfolgt. Erst aus diesem Ziel lassen sich passende Aufgaben, zulässige Werkzeuge und valide Bewertungskriterien ableiten.
Es wäre fatal, Prozessbegleitung und Prozessüberwachung miteinander zu verwechseln. Prozessüberwachung bedeutet, Verhaltensdaten zu sammeln und daraus Eigenleistung und Authentizität ableiten zu wollen. Prozessbegleitung bedeutet, sich dafür zu interessieren, wie Studierende denken und arbeiten, um Lernen sichtbar und besprechbar zu machen. Die eigentliche Aufgabe von Hochschulen liegt in Zeiten generativer KI darin, bessere Wege zu finden, herauszubekommen, was jemand verstanden hat. Wenngleich damit im Einzelfall auch eine zeitlich aufwändige Lösung einhergeht, die gerade in den großen Studienfächern, in denen viel Text geschrieben wird, herausfordernd ist, scheint uns dies dennoch eine notwendige Erweiterung.
Die finale Grenze: wenn Gedanken selbst zum Beweismittel würden
Man kann die Logik der Prozessbeobachtung bis zu ihrem äußersten Ende denken: Ein Gehirn-Chip könnte künftig neuronale Aktivitäten und Gedankengänge protokollieren, zeitlich ordnen und für Prüfende auswertbar machen. Das wäre die perfekte Prozess-Einsicht – und ihr demokratisches Horrorszenario. Nicht mehr nur Tastatureingaben, Pausen und Einfügevorgänge, sondern die Gedanken selbst würden zu bewertbaren Daten. An diesem Punkt wäre die rote Linie unübersehbar: Die Gedanken sind nicht mehr frei. Gerade deshalb sollte Hochschulbildung heute die Grenze ziehen: Bewertung braucht nachvollziehbare Leistungen, aber keine Totaltransparenz des Denkens.
Literaturverzeichnis
Anthropic. (2026). How Claude marks AI-generated content. Claude Help Center. Abgerufen am 13.08.2026 von https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content
Bräuer, G. (Hrsg.) (2009): Scriptorium Ways of Interacting With Writers and Readers: A Professional development Program. Fillibach.
Buck, I., Haverkamp, H., Limburg, A., Lordick, N., Schindler, K. & Wilder, N. (2023). Zur Frage einer prozessorientierten Bewertung schriftlicher Prüfungsleistungen. VK:KIWA Blog. https://doi.org/10.5281/zenodo.8398506
Conijn, R., Cook, C., van Zaanen, M. & Van Waes, L. (2022). Early prediction of writing quality using keystroke logging. International Journal of Artificial Intelligence in Education, 32(4), 835–866. https://doi.org/10.1007/s40593-021-00268-w
Deep, P. D., Edgington, W. D., Ghosh, N. & Rahaman, M. S. (2025). Evaluating the Effectiveness and Ethical Implications of AI Detection Tools in Higher Education. Information, 16(10), Artikel 905. https://doi.org/10.3390/info16100905
Europäische Kommission (2026). Commission publishes Code of Practice on marking and labelling AI-generated content. 10.06.2026. Abgerufen am 13.08.2026 von https://digital-strategy.ec.europa.eu/en/news/commission-publishes-code-practice-marking-and-labelling-ai-generated-content
Hayes, J. R. & Flower, L. S. (1980). Identifying the organization of writing processes. In L. W. Gregg & E. R. Steinberg (Hrsg.), Cognitive Processes in Writing (S. 3–30). Lawrence Erlbaum.
Kruse, O. & Ruhmann, G. (2006). Prozessorientierte Schreibdidaktik. Eine Einführung. In Kruse, O., Berger, K. & Ulmi, M. (Hrsg.): Prozessorientierte Schreibdidaktik. Schreibtraining für Schule, Studium und Beruf (S. 13–38). Haupt.
Lendvai, G. F. & Aczél, P. (2026). Artificial intelligence in academic practices and policy discourses across ‘Big 5’ publishers. Research Evaluation, 35, Artikel rvag004. https://doi.org/10.1093/reseval/rvag004
Oliveira, M., Zednik, C., Bombaerts, G., Sadowski, B. & Conijn, R. (2025). Assessing students’ DRIVE: A framework to evaluate learning through interactions with generative AI. Computers and Education: Artificial Intelligence, 9, Artikel 100497. https://doi.org/10.1016/j.caeai.2025.100497
Vandermeulen, N., Leijten, M. & Van Waes, L. (2020). Reporting writing process feedback in the classroom: Using keystroke logging data to reflect on writing processes. Journal of Writing Research, 12(1), 109–140. https://doi.org/10.17239/jowr-2020.12.01.05
Weber-Wulff, D., Anohina-Naumeca, A., Bjelobaba, S., Foltýnek, T., Guerrero-Dib, J., Popoola, O., Šigut, P. & Waddington, L. (2023). Testing of detection tools for AI-generated text. International Journal for Educational Integrity, 19, Artikel 26. https://doi.org/10.1007/s40979-023-00146-z
Weßels, D. (2023). Die Transformation der Hochschulprüfungen: ChatGPT und die Zukunft der Bewertungskultur? Online-Keynote für die Hochschule Osnabrück, 24.11.2023. https://www.hs-osnabrueck.de/fileadmin/HSOS/Homepages/LearningCenter/LLK_2023/Wessels-KI-Keynote-HS-Osnabrueck-2023-11-18.pdf
Weßels, D., Bils, A. & Budde, J. (2025). Wissenschaftliche Abschlussarbeiten im KI-Zeitalter. Disruption, Herausforderungen und neue Bewertungsansätze (Diskussionspapier Nr. 38). Hochschulforum Digitalisierung. https://hochschulforumdigitalisierung.de/wp-content/uploads/2025/10/HFD_DP_38_wissenschaftliche_Abschlussarbeiten_im_KI-Zeitalter.pdf
KI-Disclaimer
Dieser Beitrag wurde unter ko-kreativer Nutzung generativer KI-Systeme erstellt. Es wurden ChatGPT für Brainstorming, erste konzeptionelle Überlegungen und erste Entwürfe, jenni.ai für die Überarbeitung sowie OpenAI Codex für die redaktionelle Überarbeitung im Änderungsmodus und die Quellenprüfung verwendet. Die inhaltliche Konzeption und redaktionelle Verantwortung liegen bei den Autorinnen. Stand der KI-Unterstützung: 13.08.2026.
