We zijn onafhankelijk. Help ons mee en word ook lid! Met jou erbij gaat het beter.

Geen lid, wel steunen?

Straks moeten we nog bewijzen dat we mensen zijn: een dialoog over journalistiek en AI

S

Met de komst van AI, en vooral AI-checkers, verandert het schrijfvak. Wat betekent het checken op het gebruik van kunstmatige intelligentie voor schrijvers, maar ook voor journalisten. Guido van Nispen zond er een artikel over in, Wijbrand Schaap naam de redactie ter hand, en had wat vragen. De e-mailconversatie die daaruit voortvloeide vonden we de moeite waard om met onze lezers te delen. 

De bijdrage van Guido van Nispen:

Een roman wordt geprezen, een opiniestuk overtuigt en een kunstwerk raakt ons, totdat iemand er een AI-detector overheen haalt en er een percentage naast zet. Aan het werk zelf is dan niets veranderd, maar aan onze blik erop des te meer. Daarmee ontstaat in de culturele sector een merkwaardige nieuwe bewijslast, want waar we ons jarenlang zorgen maakten over machines die zich overtuigend als mensen konden voordoen, komen we nu in een wereld terecht waarin mensen misschien moeten aantonen dat ze werkelijk mensen zijn.

Een roman die ineens iets anders werd

De debuutroman C’était ça ou mourir van de Haïtiaans-Canadese schrijver Thélyson Orélien leek aanvankelijk vooral een opmerkelijk literair succes. In vijf weken werden 35.000 exemplaren in Frankrijk verkocht, het boek won de romanprijs van Fnac en werd genoemd voor verschillende belangrijke Franse literaire prijzen. Critici hadden het gelezen, boekhandelaren aanbevolen, jury’s beoordeeld en lezers gekocht, waarmee het boek precies had doorlopen wat we in de culturele wereld doorgaans als een tamelijk grondig proces van waardering en selectie beschouwen.

Dat veranderde toen een anoniem account op X beweerde dat het boek vrijwel geheel met kunstmatige intelligentie was geschreven. Als onderbouwing werd verwezen naar Pangram, een AI-detector die probeert vast te stellen of een tekst door een mens of door een taalmodel is geproduceerd. Le Monde besloot de bewering te onderzoeken en voerde meer dan de helft van de roman in Pangram in, waarna de detector meer dan 95 procent van het onderzochte materiaal als AI-geschreven classificeerde.

Dat is niet zonder betekenis, want Pangram behoort tot de beter presterende AI-detectoren en kwam ook in twee door Le Monde aangehaalde academische onderzoeken relatief goed uit de bus. Tegelijkertijd is het systeem voor buitenstaanders grotendeels een black box, wilde het bedrijf tegenover de krant weinig zeggen over de precieze werking en waarschuwen onderzoekers dat prestaties kunnen verschillen tussen talen en bijzondere vormen van schrijven. Daarmee blijft er precies genoeg onzekerheid over om een ongemakkelijke situatie te creëren: het percentage is te hoog om eenvoudig te negeren, maar de methode is niet transparant genoeg om het zonder meer als bewijs te beschouwen.

Het interessante is vervolgens wat zo’n percentage met onze waarneming doet. Aan de roman is immers niets veranderd en hetzelfde geldt voor de woorden waarop lezers, boekhandelaren en juryleden hun eerdere oordeel baseerden. Er is alleen nieuwe informatie aan toegevoegd, afkomstig van een machine die zegt iets te weten over de manier waarop die woorden tot stand zijn gekomen. Vanaf dat moment lezen we niet alleen meer de roman, maar ook de verdenking.

Toen was er nog iets te controleren

Dat onderscheid is belangrijk, omdat niet iedere discussie over AI-gebruik hetzelfde is. We zagen eerder vorig jaar een heel andere casus rond Peter Vandermeersch, voormalig hoofdredacteur van NRC, die AI had gebruikt bij het verwerken en samenvatten van bronnen voor zijn publicaties. Bij nader onderzoek bleken in verschillende stukken citaten te staan die niet naar de oorspronkelijke bronnen konden worden herleid. Vandermeersch erkende vervolgens dat hij AI had gebruikt en dat de noodzakelijke menselijke controle onvoldoende was geweest.

Daarmee was sprake van een journalistiek probleem dat al lang vóór ChatGPT bestond en waarvoor we ook bestaande journalistieke normen hebben. Wanneer iemand tussen aanhalingstekens wordt geciteerd, moet die persoon die woorden daadwerkelijk hebben uitgesproken of geschreven. Als dat niet zo is, klopt de publicatie niet en doet het er voor de beoordeling uiteindelijk weinig toe of de fout is veroorzaakt door een taalmodel, een slordige aantekening of een journalist die zijn bronnen onvoldoende heeft gecontroleerd. De inhoud zelf leverde het bewijs voor het probleem.

Bij Orélien gebeurt iets wezenlijk anders. Niemand hoefde eerst een verzonnen personage, gestolen passage of aantoonbare feitelijke onjuistheid in zijn roman te vinden. De verdenking ontstond doordat een machine naar een gewaardeerd cultureel product keek en concludeerde dat het waarschijnlijk door een andere machine was gemaakt. Daarmee verschuift de discussie van wat er in een werk aantoonbaar mis is naar de vraag of wij de ontstaansgeschiedenis ervan nog vertrouwen.

Een percentage naast een opiniestuk

Nederland heeft inmiddels een eigen voorproefje van die ontwikkeling gekregen. AI Report onderzocht deze zomer 252 ingezonden opiniestukken uit de Volkskrant, NRC, Trouw, Het Parool en het FD met behulp van Pangram. Volgens de detector waren 49 stukken, bijna een vijfde van het totaal, met AI gegenereerd. Opvallend waren daarbij de verschillen tussen kranten: bij de Volkskrant werd een aanzienlijk deel van de onderzochte bijdragen als AI-gegenereerd aangemerkt, terwijl bij NRC geen enkel onderzocht opiniestuk die classificatie kreeg. Wanneer ook teksten werden meegenomen waarin volgens Pangram gedeeltelijk AI was gebruikt, liep het aandeel verder op.

Voor redacties zijn zulke bevindingen vanzelfsprekend relevant. Een krant mag voorwaarden stellen aan ingezonden stukken en lezers mogen verwachten dat een redactie weet wat zij publiceert, zeker wanneer een bijdrage wordt gepresenteerd als het persoonlijke betoog van een auteur. Dat de Volkskrant naar aanleiding van het onderzoek scherper is gaan controleren, is vanuit dat perspectief begrijpelijk. Interessanter wordt het wanneer de detector zelf onderdeel wordt van die controle, want dan krijgt een statistische waarschijnlijkheid een rol in een redactioneel oordeel dat voorheen vooral draaide om inhoud, originaliteit, betrouwbaarheid en kwaliteit.

Daar ontstaat dezelfde vreemde situatie als bij de Franse roman. Een lezer kan een opiniestuk interessant en overtuigend vinden, een redacteur kan het selecteren omdat het iets toevoegt aan het publieke debat en de tekst kan zonder problemen worden gepubliceerd. Wanneer Pangram er vervolgens een hoge AI-score naast zet, verandert het oordeel over precies dezelfde woorden. De detector heeft niets aan de tekst veranderd, maar heeft er wel een nieuwe betekenislaag overheen gelegd: misschien is dit niet wat je dacht dat het was.

Wanneer het hulpmiddel een scheidsrechter wordt

Voor de culturele sector raakt dit aan een veel fundamentelere kwestie dan de inmiddels wat voorspelbare discussie over de vraag of schrijvers, kunstenaars en andere makers wel of niet generatieve AI mogen gebruiken. Makers hebben altijd hulpmiddelen gebruikt en de grenzen tussen maken, redigeren en ondersteunen zijn nooit volledig scherp geweest. Een schrijver werkt met een redacteur, een fotograaf met beeldbewerkingssoftware, een componist met digitale instrumenten en een filmmaker met technologie die beelden kan creëren die voor de camera nooit hebben bestaan. Generatieve AI maakt die gereedschapskist ingewikkelder, omdat het gereedschap nu ook kan schrijven, tekenen, componeren en suggesties kan doen die rechtstreeks in het eindproduct terechtkomen. Juist daarom zijn afspraken over transparantie, auteurschap en verantwoordelijkheid nodig.

Een AI-detector introduceert echter nog een ander probleem, omdat hij niet alleen helpt om informatie te verzamelen, maar ook een oordeel over authenticiteit suggereert. Zodra zo’n oordeel maatschappelijk als bewijs gaat functioneren, verschuift ongemerkt de bewijslast. Degene die beweert dat een werk door AI is gemaakt hoeft dan niet langer overtuigend te reconstrueren hoe dat is gebeurd, terwijl de maker juist moet laten zien dat hij het zelf heeft gemaakt.

Volgens zijn uitgever begon Orélien al in 2017 aan zijn roman en inmiddels worden concepten, aantekeningen, eerdere versies en correspondentie gebruikt om de ontstaansgeschiedenis van het boek aannemelijk te maken. Materiaal dat ooit eenvoudigweg behoorde tot het rommelige en meestal onzichtbare proces waarin een schrijver een boek maakt, krijgt daarmee een nieuwe functie als bewijsmateriaal voor menselijk auteurschap. Voor schrijvers, journalisten, kunstenaars en andere makers kan dat uiteindelijk betekenen dat niet alleen het werk moet worden bewaard, maar ook de digitale archeologie van het maken ervan.

Daarmee draaien we een opmerkelijke cirkel. Jarenlang maakten we ons zorgen dat AI zo goed zou worden dat machines werk konden produceren dat wij niet meer van menselijk werk konden onderscheiden, waarop we machines zijn gaan bouwen die dat onderscheid alsnog voor ons moesten maken. Nu die detectoren steeds beter worden en hun percentages steeds overtuigender ogen, ontstaat een bijna tegengesteld risico: dat een mens iets maakt wat lezers waarderen, een redactie publiceert of een jury bekroont, waarna een machine ons vertelt dat we onze eigen waarneming beter nog eens kunnen herzien.

Misschien wordt de interessante vraag voor de culturele sector daarom niet alleen hoeveel AI een maker mag gebruiken, maar ook hoeveel gezag we bereid zijn toe te kennen aan een machine die achteraf vertelt wie de maker eigenlijk was. Want wanneer een goed ontvangen roman door één percentage in een verdacht werk kan veranderen, gaat de discussie al lang niet meer alleen over kunstmatige intelligentie. Dan gaat zij ook over de vraag wat wij nog als voldoende bewijs van menselijkheid beschouwen.

Bij het schrijven van dit artikel heb ik AI gebruikt voor onderzoek, vertaling, verificatie en eindredactie, waarna Pangram concludeerde dat ook mijn tekst, net als die van Orélien, voor 100 procent door AI is geschreven (andere tools zetten het percentage een stuk lager en er zijn ook weer tools om het te laten herschrijven zodat het nog lager wordt of zelfs zogenaamd 100% menselijk wordt).  Ik zal de losse papiertjes, aantekeningen en eerdere versies dus maar goed bewaren, voor het geval ik ooit nog moet bewijzen dat ik er zelf bij was. Een rommelig bureau wordt zo nog eens het bewijs van mens zijn.

De vraag van Wijbrand Schaap:

Hoi Guido,

Ik ga hier nog even op kauwen. Punt is: al voordat je zeer eerlijke en toe te juichen bekentenis aan het einde kwam, had ik al een 90 procent vermoeden dat de tekst erg veel AI-formuleringen bevatte. En dat dan met name omdat het een vrij onpersoonlijke stijl is. Ik ben die van je gewend, en je hebt eerder ook verteld hoe je gebruik maakt van AI, en daar heb ik dus geen overwegend bezwaar tegen.

Nu zit ik me wel af te vragen: is het in dit speciale geval dan niet leuker om meer in te gaan op hoe je AI hebt gebruikt? Welke prompts je geeft? Dat zou ik bijvoorbeeld ook tof vinden in het onderhavige geval van de al dan niet terecht verguisde schrijver (zit ook een racistisch kantje aan, net als bij die Cambridge hoorleraar). Dat je dus op een gegeven moment ook de prompts erbij geeft, als auteur, zodat de lezer desgewenst zijn eigen versie kan maken. 🙂

Maar dit is dus wel serieus. Zou je daar zin in hebben?

Met vriendelijke groet,

Wijbrand Schaap

Hoofdredacteur Cultuurpers


De reactie van Guido van Nispen:

Hi Wijbrand,

Ja, daar heb ik eigenlijk wel zin in, juist omdat jouw reactie een interessante extra laag aan het stuk toevoegt. Alleen is er in mijn geval niet één prompt die ik je kan geven, waarna er dit artikel uitrolt. Als ik het proces terugkijk, is het eerder een combinatie van onderzoek, zoeken, schrijven, corrigeren en redigeren, waarbij AI op verschillende momenten een andere rol heeft.

Het begint ermee dat ChatGPT inmiddels mijn zogenoemde ‘Guido-format’ voor eindredactie kent. Dat is in de loop van veel teksten en vooral veel correcties ontstaan. Het format bevast zaken als: spel/taal/grammatica-fouten eruit, geen losse retorische zinnen, een vloeiende redenering, rustig en precies, weinig opsmuk, niet verkoperig en niet alles voor de lezer willen afronden. Dat zit inmiddels als context in het model en hoef ik dus niet iedere keer opnieuw als één uitgebreide prompt mee te geven.

Vervolgens heb ik voor dit stuk mijn eerdere tekst over Orélien die ik voor LinkedIn schreef als inhoudelijk vertrekpunt gebruikt en aangegeven welke spanning ik erin zag: het publiek waardeert het werk, waarna een detector er een verdenking overheen legt zonder dat er aan het werk zelf iets is veranderd. Daarna heb ik AI gebruikt om het artikel van Le Monde te verwerken en feiten te controleren, maar ook om gericht naar Nederlandse voorbeelden te zoeken. Zo kwam de eerdere kwestie rond Peter Vandermeersch terug, die ik juist als contrast wilde gebruiken omdat daar aantoonbare fouten en gefabuleerde citaten waren gevonden. Vervolgens wilde ik het recente onderzoek met Pangram naar de opiniestukken in onder meer de Volkskranten NRC erbij. Ik heb dus zelf bepaald welke casussen erin moesten, waarom ze erin moesten en hoe ze zich tot elkaar verhouden.

Daarna volgde het schrijf- en redactieproces, en dat ging bepaald niet in één keer goed. De eerste versie heb ik herschreven omdat die te veel losse, retorische zinnen bevatte en daarmee juist niet mijn manier van schrijven was. De volgende versie liep beter, waarna ik nog apart aan de afsluiting en de intro heb gewerkt en de kernspanning verder heb aangescherpt.

Naar aanleiding van jouw mail heb ik ChatGPT overigens ook gewoon gevraagd of het mijn stijl zelf erg AI-achtig vindt. Het antwoord vond ik wel aardig, omdat het precies het probleem blootlegt dat ik ook in het artikel naar voren breng. Mijn gebruikelijke stijl bestaat volgens het model uit lange, doorlopende redeneringen, weinig retorische opsmuk en een rustige analytische afstand. Dat zijn kenmerken die moderne LLM’s inmiddels óók goed kunnen produceren. In deze tekst kwam daar volgens ChatGPT nog iets bij: de opbouw was uitzonderlijk ordelijk, de overgangen waren heel netjes en formuleringen als ‘Daarmee ontstaat…’, ‘Dat onderscheid is belangrijk…’ en ‘Voor de culturele sector raakt dit…’ structureerden het betoog bijna iets te zichtbaar. Ik ben een gestructureerd denker en bouw mijn artikelen ook zo op en het model kent me nu blijkbaar heel erg goed.

Dat vind ik eigenlijk een interessante observatie, ook omdat jouw menselijke oordeel veel genuanceerder is dan dat van Pangram. Jij zegt feitelijk: ik herken hier formuleringen en een gladheid die mij sterk aan AI doen denken. Pangram zegt: 100 procent AI. Dat zijn nogal verschillende uitspraken. En ja ik ben kritisch op die AI-detectoren en het gebruik ervan zoals je kunt lezen. Ik heb ook geen zin om mijn eigen vertrouwde stijl door een ‘humanizer’ te gooien om detectoren in verwarring te brengen. Ik schrijf de stukken voor de lezer en niet voor de detectoren.

Het hele proces lijkt voor mij daarom veel meer op werken met een behoorlijk snelle onderzoeker en (eind)redacteur dan op het geven van één opdracht aan een machine die vervolgens mijn artikel schrijft. Tegelijkertijd zou het flauw zijn om te ontkennen dat die onderzoeker en redacteur ook daadwerkelijk formuleringen produceert die in de uiteindelijke tekst terechtkomen. Precies daar wordt de vraag naar auteurschap interessant.

Daarom kan ik niet één niet-bestaande prompt geven om te laten publiceren, maar juist het proces laten zien, eventueel in een apart kader bij het artikel: van mijn oorspronkelijke gedachte en instructies, via het onderzoek, de zoekopdrachten en mijn correctierondes, tot de uiteindelijke tekst en vervolgens het oordeel van Pangram. Dan kan de lezer zelf bepalen waar in dat proces volgens hem of haar het auteurschap zit.

Groet,

Guido


Het voorstel van Wijbrand Schaap

Zou het leuk zijn om jouw eerste stuk, aangevuld met mijn reactie en dan weer jouw reactie, als integrale post op de site te zetten?

Met vriendelijke groet,

Wijbrand Schaap

Hoofdredacteur Cultuurpers


Het antwoord van Guido van Nispen:

Prima idee!

 

Guido van Nispen

Waardeer dit artikel!

donatie
Ik doneer

Over deze auteur

Guido van Nispen

Ondernemer, bestuurder, toezichthouder en adviseur op het snijvlak van technologie, media en governance. Hij is oprichter van MENSEN.WORK, een holding die zich richt op de samenwerking tussen mens, technologie en informatie. Eerder was hij onder meer CEO van het ANP, directeur van V-Ventures, fondsmanager bij het Dutch Creative Industry Fund, uitgever van Innovation for Jobs en executive director bij BT. Daarnaast vervulde hij toezicht- en adviesfuncties bij organisaties als Triodos, World Press Photo, Cinekid, de Raad voor Cultuur en AVROTROS. In zijn werk staat steeds de vraag centraal hoe organisaties verantwoord kunnen omgaan met de veranderende verhouding tussen technologie, informatie en bestuur.

Reageer!

Deze site gebruikt Akismet om spam te verminderen. Bekijk hoe je reactie gegevens worden verwerkt.

door Guido van Nispen

Populaire berichten

Zo wordt theater een thuis voor iedereen

Zo wordt theater een thuis voor iedereen

Een podcast over De Harmonie in Leeuwarden. Hoe directeur Siart Smit werkt aan een stadstheater dat ook overdag een thuis is voor alle inwoners. Verder veel over ILFU, Boeken en...
Is vragen stellen kunst?

Is vragen stellen kunst?

We kunnen heel veel leren van de laatste zomergasten. En van Theaterfestival Boulevard. En hoe we beter kunnen luisteren.
Soms is kunst beter dan vakantie

Soms is kunst beter dan vakantie

De kortste Zomergastenrecensie ooit, en waarom we in Groningen het licht zagen. En twee petities. Omdat ze heel hard nodig zijn. Tegen Hitler, vóór het gesprek.

Categorieën