Het eerste chatbot-concept belandde ongeveer twee jaar geleden in de inbox van een docent, en de situatie is sindsdien alleen maar versneld. Een student kan nu ChatGPT vragen om vijf paragrafen te schrijven over de oorzaken van de Grote Depressie of de symboliek in The Great Gatsby, en een coherent antwoord ontvangen in minder tijd dan het kost om een potlood te slijpen. Voor docenten heeft dit de aard van academische integriteit veranderd. Ze zoeken niet langer alleen naar traditioneel plagiaat, waarbij de ene mens het werk van een andere mens kopieert. Ze zoeken ook naar synthetisch proza — tekst die menselijk klinkt, maar is samengesteld door een model zonder begrip, zonder herinneringen en zonder betrokkenheid bij het argument.

Wanneer de stem plots verandert

Docenten lezen elke semester honderden essays van studenten. Na verloop van tijd ontwikkelen ze een gehoor voor individuele cadans. Ze merken de gebruikelijke foutieve komma-verbindingen op, de vaste uitdrukkingen, de manier waarop een specifieke student een conclusie structureert. Wanneer er een paper binnenkomt die totaal niet klinkt als de stem die ze gewend zijn, lokt dat een nauwkeuriger beoordeling uit.

Dit gaat niet over het bestraffen van verbetering. Goede docenten leven voor de groei van hun leerlingen. Maar er is een verschil tussen een student die zijn syntaxis gestaag heeft verbeterd en een student die een essay inlevert dat leest als een gepolijst juridisch document, na acht maanden van houterige, eenvoudige zinnen. De proza kan onberispelijk zijn, maar het voelt geleend omdat het de archeologie van de praktijk mist. Die plotselinge, ononderbouwde sprong in verfijning is vaak de eerste aanwijzing.

Professioneel oppervlak, holle kern

AI-gegenereerde teksten lijken vaak in een 'uncanny valley' van correctheid te zitten. De grammatica is foutloos. De overgangen lopen soepel. Toch zweeft de tekst boven de materie in plaats van erin te duiken. Docenten beschrijven deze kwaliteit vaak als "professioneel generiek".

Beschouw een essay over Romeo en Julia. Een studentenschrijver kan gefixeerd raken op de kleine rol van Mercutio, een scène op een interessante manier verkeerd interpreteren, of de familievete vergelijken met een conflict in hun eigen gemeenschap. De stelling kan rommelig zijn, maar het is onmiskenbaar het product van één enkele geest die worstelt met de tekst. Een AI-concept vat daarentegen vaak het plot accuraat samen, somt drie universele thema's op en concludeert dat liefde opoffering vereist. Het is correct. Het is ook leeg. Die afwezigheid van risico — geen eigenzinnige mening, geen imperfect maar oprecht inzicht — is een van de meest betrouwbare indicatoren dat de schrijver niet de student was.

Referenties die nergens toe leiden

Een ander alarmsignaal is de gehallucineerde citatie. ChatGPT en soortgelijke tools verzinnen af en toe boeken, tijdschriftartikelen en zelfs auteurs. De vermeldingen zien er geloofwaardig uit, compleet met academisch klinkende titels, namen van uitgevers en publicatiejaren, maar ze hebben geen enkele link met de werkelijkheid.

Ervaren docenten verifiëren bronnen. Ze voeren titels in bij Google Scholar, zoeken in de database van de bibliotheek van de campus, of zoeken simpelweg een auteursnaam op via een zoekmachine. Wanneer elke citatie in een doodlopende weg eindigt, stort de geloofwaardigheid van het paper in. Het controleren van bibliografieën is altijd al onderdeel geweest van serieuze onderzoekstraining, maar het wordt nu standaardpraktijk, zelfs voor korte analytische essays. De literatuurlijst is niet langer alleen een vormgevingsoefening; het is een controlepunt voor integriteit.

De beperkingen van detectiesoftware

Veel onderwijsdistricten hebben gereageerd op de toename van synthetische tekst door AI-detectietools aan te schaffen. Deze programma's scannen op statistische patronen — lage perplexiteit, voorspelbare zinsstructuren, een repetitief ritme — die gebruikelijk zijn in door machines gegenereerd proza. Ze kunnen nuttig zijn. Een hoge waarschijnlijkheidsscore geeft een docent een reden om nauwkeuriger te kijken.

Maar docenten weten dat deze tools imperfect zijn. Ze geven soms vals-positieven, vooral bij teksten geschreven door niet-moedertaalsprekers van het Engels of door studenten die van nature een formele, beheerst stijl hanteren. Een detectiepercentage mag nooit op zichzelf als bewijs van fraude worden beschouwd. De meeste docenten gebruiken de software als één aanwijzing tussen vele andere, niet als het onomstotelijke bewijs. Het hulpmiddel ondersteunt het menselijk oordeel; het kan het niet vervangen.

Analyse zonder denker

Grote taalmodellen zijn goed in het samenvatten van feiten. Waar ze moeite mee hebben, is het leveren van aanhoudend kritisch denken of authentieke persoonlijke reflectie.

In een geschiedenisopdracht kan een AI bijvoorbeeld de economische, politieke en sociale oorzaken van een revolutie met tekstboekachtige precisie opsommen. Wat het niet gemakkelijk kan, is die oorzaken tegen elkaar afwegen, het gangbare narratief uitdagen of de gebeurtenis koppelen aan een actueel onderwerp waar de student echt om geeft. Menselijke schrijvers verraden zichzelf door hun specificiteit. Ze verwijzen naar een documentaire die ze hebben gezien, een gesprek met een ouder, of een patroon dat ze in drie verschillende onderdelen hebben opgemerkt. Door AI gegenereerde tekst bevat zelden deze ankerpunten, omdat de machine geen ervaringen heeft om uit te putten en geen meningen heeft om te verdedigen.

Het vijfminutengesprek

Een van de oudste methoden blijft de meest effectieve: de student vragen om over het werk te praten.

Een docent zou een student apart kunnen nemen tijdens