Docs / Hoe controleer je AI-gegenereerd werk?
Hoe controleer je AI-gegenereerd werk?
Controle is één handeling: de bron openen, het citaat er woordelijk naast leggen, de vindplaats erbij zetten en vastleggen wat u gedaan heeft. Vier Nederlandse instanties beschrijven precies die handeling. Een tweede AI kan die handeling versnellen zolang hij de bron moet ophalen en woordelijk moet citeren. Zodra dat tweede model mag oordelen, scoren of overleggen met andere modellen, verdwijnt de winst en kan de uitkomst slechter worden dan een enkel model alleen.
Kernpunten
- Vier Nederlandse instanties beschrijven dezelfde handeling. De kortste formulering is van de NOvA: "Controleer citaten, jurisprudentie en feiten altijd handmatig vóór gebruik." De AFM, NBA en NOREA en de KNB schrijven inhoudelijk hetzelfde op, elk met een ander gewicht.
- NBA en NOREA beschrijven in AI-leidraad 2 (juni 2026) als manier 8 van negen: "Een controle AI-toepassing gebruiken om de verificatie en navolgbare onderbouwing van output uit de primaire AI-toepassing te controleren op fouten of hallucinaties. Dit kan bijvoorbeeld op basis van een tool of LLM van een andere leverancier."
- Een ongecontroleerde verwijzing heeft in Nederland inmiddels een prijs. De rechtbank Amsterdam telde op 12 augustus 2026 een halve punt bij de proceskosten op wegens een niet-bestaand citaat, begroot op 2.315,50 euro (ECLI:NL:RBAMS:2026:8258). De Raad van Discipline 's-Hertogenbosch legde op 27 juli 2026 een berisping op wegens klakkeloos overgenomen AI-jurisprudentie (ECLI:NL:TADRSHE:2026:93).
- Het sterkste geteste geautomatiseerde controlesysteem haalt 84,4 procent recall bij 40,8 procent precisie op een juridische citaat-benchmark van 4.499 citaties (Princeton, preprint, 6 augustus 2026). Meer dan de helft van de meldingen is dus loos alarm.
- Een tweede model is geen onafhankelijke tweede lezer. Op een leaderboard-dataset zijn twee modellen het 60 procent van de tijd met elkaar eens wanneer beide fout zitten, en die correlatie stijgt bij grotere en nauwkeuriger modellen, ook bij een andere architectuur en een andere aanbieder (ICML 2025, peer reviewed).
- Wat nergens gemeten is: hoe vaak, hoe lang en op welke manier Nederlandse documentprofessionals AI-output daadwerkelijk naast de bron leggen. En geen enkele opgehaalde bron test een generator plus een onafhankelijke verifier tegen menselijke controle alleen op hetzelfde documentcorpus.
1.Controleren is één handeling: de bron openen en het citaat ernaast leggen
Om zes uur ligt er een concept op uw scherm dat morgen de deur uit moet. Het is met AI opgesteld, het leest goed, en halverwege staat een verwijzing die u niet kent. Vanaf dat punt zijn er twee wegen. U neemt aan dat de verwijzing klopt, of u opent de bron en legt de zin ernaast. Alleen het tweede heet controleren.
Vier Nederlandse instanties beschrijven precies die handeling, elk voor een ander beroep. NBA en NOREA zetten hem in AI-leidraad 2 (juni 2026) bovenaan een lijst van negen: "In de uitkomsten van de AI-toepassing verwijzingen opnemen naar de gebruikte bronnen. Vervolgens kan de professional de belangrijkste bronnen openen en nagaan of de relevante inhoud correct is weergegeven (juistheid), of er geen materieel afwijkende inhoud is weggelaten en of alle relevante bronnen zijn gebruikt (volledigheid)."
De AFM schrijft in 12 bouwstenen voor beheerst gebruik van audit tooling (december 2025): "Wanneer de externe accountant de output van (Gen)AI-tooling gebruikt als controlebewijs, is het van belang dat deze output wordt geverifieerd. Dit kan bijvoorbeeld door de tool-output aan te sluiten met externe bronnen of brondocumenten, zodat deze traceerbaar is."
De NOvA is de kortste. Onder het kopje Deskundigheid, punt 3, Verifieer altijd de output: "Controleer citaten, jurisprudentie en feiten altijd handmatig vóór gebruik. Gebruik uitsluitend tools met bronvermelding, zodat de output verifieerbaar is en overeenkomst met de oorspronkelijke bron." Elders op dezelfde pagina, onder het kopje Integriteit, staat punt 1: "Neem AI-output nooit ongecontroleerd over."
De KNB schrijft het voor notarissen zo op: "De notaris moet waken om de uitkomsten van AI niet letterlijk over te nemen zonder hier zelf aandacht aan te besteden. Hij draagt verantwoordelijkheid om de juistheid hiervan te controleren."
Het gewicht van deze vier teksten verschilt sterk, en dat hoort erbij. De AFM spreekt als toezichthouder richting accountantsorganisaties onder toezicht. NBA en NOREA schrijven een leidraad voor hun leden, in taal die ruimte laat: "Een professional kan de validatie van de AI-toepassing op verschillende manieren bevorderen." De NOvA-tekst is een aanbeveling van de projectgroep Digitalisering en AI. De KNB-tekst is een afwegingskader binnen het notariaat. Geen van de vier is wet. Wat ze delen is de handeling zelf, en die is in alle vier gelijk: bron openen, output ernaast, zelf kijken.
2.Wie tekent blijft verantwoordelijk, en het dossier moet laten zien wat u deed
De verantwoordelijkheid verschuift niet mee met het gereedschap. De AFM zegt dat in het rapport zelf: "(Gen)AI-tooling kan wel een ondersteunende rol hebben bij de werkzaamheden van de externe accountant, maar mag de externe accountant en diens eindverantwoordelijkheid nooit vervangen." En als losse bouwsteen: "De externe accountant is eindverantwoordelijk voor de uitkomsten uit de (Gen)AI-tool."
Daarmee is de controle nog niet af. In dezelfde AI-leidraad 2 staat als manier 7: "Het vastleggen in het dossier van gehanteerde prompts, zoektermen, geraadpleegde bronnen, de signalen, uitgevoerde verificatiestappen en de uiteindelijke conclusies, zodat herleidbaar is hoe de uitkomsten van AI-toepassingen zijn beoordeeld en gebruikt." Controle die nergens is vastgelegd, is achteraf niet van niet-controleren te onderscheiden.
De KNB beschrijft in deel 2 van de AI-weegschaal wat menselijk toezicht in de praktijk inhoudt: "Door menselijk toezicht in te zetten bij het gebruik van systemen, zorgt u ervoor dat een mens controleert of het systeem doet wat ervan is gevraagd en of de resultaten correct zijn. Dit verkleint de kans op fouten en stelt u in staat om problemen in het systeem sneller op te sporen. Voor AI-systemen met een hoog risico is dit een verplichting." Die laatste zin verwijst naar de AI-verordening en geldt alleen voor systemen met een hoog risico.
Wij denken dat hier de kern van het hele vraagstuk zit. De AI draagt geen verantwoordelijkheid. U zet uw naam eronder, en u kunt die handtekening alleen verdedigen met wat u zelf gezien heeft.
3.Wat een ongecontroleerde verwijzing kost: een berisping en 2.315,50 euro
In Nederland ligt inmiddels een complete keten vast, van signaal tot maatregel, in één zaak. De Raad van Discipline 's-Hertogenbosch beschrijft het begin zo: "Eind 2025 heeft de deken van de rechtbank Oost-Brabant een signaal ontvangen over het optreden van verweerster in een huurzaak. Het signaal hield in dat verweerster op onzorgvuldige wijze gebruik had gemaakt van artificiële intelligentie (hierna: \"AI\")."
Wat de kantonrechter aantrof, staat woordelijk in diezelfde uitspraak: "In de conclusie van antwoord zijn acht uitspraken aangehaald. Eén ECLI-nummer bestaat niet en van de zeven andere uitspraken behoort het ECLI-nummer bij heel andere uitspraken dan omschreven in de conclusie van antwoord (bijvoorbeeld een echtscheidingsbeschikking en een strafzaak)." De advocaat trok de verwijzingen daarna in bij akte: "In de namens gedaagde opgestelde conclusie van antwoord is verwezen naar diverse rechterlijke uitspraken (ECLI-verwijzingen) die na controle niet traceerbaar bleken. Deze onjuiste verwijzingen staan in de alinea's 23- 27, 29, 30, 32, 37 en 41. Hierbij trekt gedaagde deze verwijzingen in."
De keten loopt van het signaal eind 2025, via de akte rectificatie van 3 december 2025 en het tussenvonnis van 12 februari 2026, naar het dekenbezwaar van 30 april 2026 en de berisping van 27 juli 2026. De raad vat samen wat er misging: "In de eerste plaats heeft verweerster de door de door haar gebruikte AI-tool gegenereerde rechtspraak klakkeloos overgenomen in de conclusie van antwoord in zaak M, zonder de verwijzingen op juistheid te controleren of de uitspraken ook maar te lezen." De norm eronder: "De raad overweegt dat alle bij de gerechtelijke procedure betrokken partijen erop moeten kunnen vertrouwen dat door een advocaat in een processtuk genoemde rechtspraak daadwerkelijk bestaat en dat verwijzingen kloppen."
De rechtbank Amsterdam hing er op 12 augustus 2026 een bedrag aan. In een conclusie van antwoord stond een citaat uit het arrest DSM/Fox dat daar niet in staat: "Deze bewoordingen zijn niet in het genoemde arrest te vinden, en ook niet elders in gepubliceerde rechtspraak." De rekening: "Het als citaat opnemen van niet bestaande rechtspraak acht de rechtbank kwalijk, want dit heeft zowel [eiser] als de rechtbank nodeloos extra tijd en aandacht gekost. De rechtbank begroot de daarmee gemoeide kosten op een halve punt in de proceskostenveroordeling (€ 2.315,50)."
Eén nuance hoort er nadrukkelijk bij, en die maakt de zaak sterker. De rechtbank liet in het midden waar de passage vandaan kwam. De eiser stelde AI-gebruik, en "[d]e raadsman van [gedaagden] heeft dit ontkend maar heeft niet kunnen achterhalen hoe de passage wel in de conclusie van antwoord terecht is gekomen." De rechtbank voegt toe: "De rechtbank vindt dit laatste niet beslissend." De rekening hangt aan het ongecontroleerde citaat, ongeacht de herkomst.
Eerder al, op 19 november 2025, stelde de rechtbank Noord-Nederland vast dat aangehaalde vindplaatsen niet bestonden of de gestelde rechtsregel niet bevatten, en schreef: "De rechtbank vermoedt dat de vindplaatsen via ChatGPT of een vergelijkbare zoekmachine zijn opgedoken en zonder controle in de processtukken zijn overgenomen."
Dat het toezicht dit oppikt, blijkt uit de vakpers. Mr. Online meldt: "Het Dekenberaad liet onlangs weten dat de dekens actief toezicht gaan houden op de wijze waarop advocaten AI gebruiken voor hun werkzaamheden. Eind februari vertelde de Gelderse deken Wouter Timmermans aan de NOS dat drie advocaten een waarschuwing hadden gekregen vanwege verkeerd gebruik van kunstmatige intelligentie. Twee van die advocaten zijn verplicht op een AI-cursus gestuurd." Dat is journalistiek dat een NOS-interview weergeeft, dus tweedehands. Een primaire bron voor de aankondiging van het dekenberaad hebben wij niet gevonden.
4.Een tweede model helpt zolang het de bron moet ophalen en woordelijk citeren
Wij denken dat een AI-probleem met AI op te lossen is, op één voorwaarde: de tweede laag moet ergens buiten zichzelf op vastzitten. Die voorwaarde is inmiddels gemeten.
Onderzoekers van Princeton bouwden een benchmark voor precies de taak die hier speelt: bestaat de aangehaalde bron, en staat er wat de tekst beweert. De dataset bevat 1.300 briefexcerpten met 4.499 citaties, waarvan 1.107 gehallucineerd. Het beste resultaat: "GPT-5 achieves 84.4% recall and a 55.0% F1 score in an agentic framework", bij 40,8 procent precisie. Niet-agentisch zakt dat naar 58,2 procent recall bij 36,9 procent precisie. Claude Code met Opus 4.8 haalt in dezelfde test de hoogste precisie, 76,1 procent, bij 62,8 procent recall.
Het ophalen van de bron is wat het verschil maakt: "Agentic retrieval improves recall by 26.2% over non-agentic baselines on GPT-5, but all models struggle most with incorrect pincites, verbatim misquotes, and content misrepresentation (52.8%, 95.2%, and 83.2% recall for GPT-5 respectively)." Woordelijk verkeerde citaten worden dus bijna allemaal gevonden, verkeerde paginaverwijzingen nauwelijks. De reden daarvoor is banaal en instructief: "Page number information for many cases is only accessible through Westlaw and LexisNexis, which explains why models perform the worst on this category." Waar de bron dichtzit, houdt de controle op.
Dat werk is bovendien traag: "Agentic verification remains resource-intensive, with GPT-5 averaging 15.3 steps per excerpt. Furthermore, restricted information access limits the efficacy of even the best agents." Dit alles is een preprint (versie 2, 6 augustus 2026), gebaseerd op Amerikaanse rechtspraak en Amerikaanse citatieconventies. In Nederland is er niets aan bindend, en de citatiepraktijk verschilt.
Een tweede meting wijst dezelfde kant op. Wie verificatie toevoegt, haalt een zwakker model dicht naar een sterker toe: "the Gemma2-9B to Gemma2-27B performance gap shrinks by 75.7%". Dezelfde auteurs zetten er meteen de grens bij: "we identify cases where strong verifiers offer limited advantage over weak ones, as both fail to provide meaningful verification gains, suggesting that verifier scaling alone cannot overcome fundamental verification challenges". Beide uit een preprint.
En het model dat zijn eigen werk nakijkt, is de zwakste opzet: "LLMs remain weak at verifying their own answers, revealing a persistent capability asymmetry between generation and self-verification". Eerlijkheidshalve: die paper heet Learning to Self-Verify Makes Language Models Better Reasoners en pleit juist voor één model waarin genereren en zelfverificatie samengaan. De bron draagt de vaststelling dat zelfverificatie zwak is. Hij draagt geen conclusie over het scheiden van schrijver en controleur.
5.Zodra het tweede model mag oordelen, verdwijnt de winst
De literatuur die het tweede model laat oordelen in plaats van ophalen, staat vol met dezelfde uitkomst. Vier faalmodi, elk apart gemeten.
Gecorreleerde fouten. "We find substantial correlation in model errors -- on one leaderboard dataset, models agree 60% of the time when both models err. We identify factors driving model correlation, including shared architectures and providers. Crucially, however, larger and more accurate models have highly correlated errors, even with distinct architectures and providers." Dit is de enige peer-reviewede bron in deze reeks (aanvaard voor ICML 2025). Een tweede model van een andere leverancier is daarmee geen onafhankelijke tweede lezer.
Voorkeur voor het vertrouwde. Een model dat mag beoordelen, beloont tekst die op zijn eigen tekst lijkt: "LLMs assign significantly higher evaluations to outputs with lower perplexity than human evaluators, regardless of whether the outputs were self-generated. This suggests that the essence of the bias lies in perplexity and that the self-preference bias exists because LLMs prefer texts more familiar to them." Bij GPT-4 was die vertekening 0,520, opgebouwd uit 0,945 recall bij gunstige menselijke oordelen tegen 0,425 bij ongunstige. Dat komt uit een workshoppaper, geen hoofdtrack. Een verwante preprint over 20 modellen voegt toe dat sterkere modellen niet vanzelf eerlijker oordelen: "Empirical analysis across 20 mainstream LLMs reveals that advanced capabilities are often uncorrelated, or even negatively correlated, with low SPB." Hun mitigatie haalde de vertekening met gemiddeld 31,5 procent omlaag, dus niet weg.
Overleg maakt het slechter. "we demonstrate that debate can lead to a decrease in accuracy over time - even in settings where stronger (i.e., more capable) models outnumber their weaker counterparts. Our analysis reveals that models frequently shift from correct to incorrect answers in response to peer reasoning, favoring agreement over challenging flawed reasoning." Een tweede preprint kwantificeert dat meeloopgedrag: overname van het meerderheidsantwoord tot 85,5 procent, destabilisering van eerder correcte redeneringen tot 70,0 procent, en verlies van juiste antwoorden die al in de pool zaten tot 32,3 procentpunt. Ook richting de gebruiker gebeurt hetzelfde: in een test over ChatGPT-4o, Claude Sonnet en Gemini 1.5 Pro was er in 58,19 procent van de gevallen sprake van meebuigen, waarvan 14,66 procent naar een fout antwoord, met een persistentie van 78,5 procent.
Een automatische beoordelaar ziet een denkfout niet. Dertien geautomatiseerde reviewsystemen kregen 133 papers met 931 varianten voorgelegd, waarvan een deel met een ingebouwde logische fout: "At a significance level of α=0.05, none of the models show a significant difference in the ATE between neutral and critical edits for aspects, sentiment, or score." Het oordeel bewoog niet mee met de fout.
De ontwerpwet die hieruit volgt, houden wij aan voor onszelf: het tweede model mag ophalen en citeren, en het mag nooit oordelen of scoren. Geen eindoordeel en geen score is bij ons dus geen positionering. Het is wat het bewijs toelaat.
6.Loos alarm is de prijs: 40,8 procent precisie bij het sterkste geteste systeem
Het eerlijke tegenwicht in dit hele dossier is één getal. Van de meldingen die het beste systeem in de Princeton-benchmark doet, is 40,8 procent terecht. Meer dan de helft van wat zo'n motor aanwijst, blijkt bij nakijken in orde.
Dat raakt precies de klacht die wij in Onderzoek 02 (18 augustus 2026) als meest gehoorde patroon vonden, in elk werkveld: controleren kost meer tijd dan maken. Een advocaat en lid van de NOvA-projectgroep Digitalisering en AI zei het zo: "Als advocaat ben je meestal langer bezig met het controleren en herschrijven van zo'n stuk, dan de tijd die je besteedt om het zelf op te stellen." Voor iemand met die klacht verplaatst een controlemotor met 40,8 procent precisie de last, zolang niemand het loze alarm eruit haalt.
De knop die dat rechttrekt, is een keuze, en die heeft een prijs. Wij hanteren een fail-closed regel: staat het citaat er niet woordelijk, dan vervalt de bevinding. Dat ruilt recall in voor precisie. Wat die ruil precies kost aan gemiste fouten, heeft niemand op documenten gemeten, wij ook nog niet.
Er is een tweede reden om een controlemotor niet als laatste woord te behandelen. Een AI-checker die in 2.500 gepubliceerde AI-papers echte fouten vond met 83,2 procent precisie, gemiddeld 4,7 per paper, miste in dezelfde studie 40 procent van de fouten die de onderzoekers er zelf in hadden gestopt: "The AI Checker achieves an overall recall of 60.0% across the 90 injected mistakes". Let op wat daar gemeten is: een model dat door mensen geschreven publicaties nakijkt. Een tweede model dat de output van een eerste model nakijkt, is daar niet getest.
Dezelfde precisering hoort bij het onderzoek dat het vaakst wordt aangehaald om te laten zien dat AI de mens verslaat op controlewerk. Bij het beoordelen van juridische facturen haalden modellen "up to 92% accuracy, surpassing the 72% ceiling set by experienced lawyers", met F-scores van 81 procent tegen 43 procent voor de beste menselijke groep. Dat is model tegenover mens op dezelfde taak. Het is geen model bovenop model. De samenvatting van die preprint is bovendien promotioneel geschreven ("a seismic shift", "the era of LLM-powered legal spend management is not on the horizon, it has arrived"), met mogelijk leveranciersbelang.
En de last die de gebruiker ervaart, is buiten Nederland wel bevraagd: "Uit onderzoek van adviesbureau Adaptavist onder 2.500 kenniswerkers in het Verenigd Koninkrijk, de Verenigde Staten, Canada, Duitsland en Spanje blijkt dat 42 procent inmiddels meer tijd kwijt is aan het controleren van AI-gegenereerde informatie dan de technologie aan tijd bespaart." Nederland zit niet in die steekproef, en het is zelfrapportage van een adviesbureau.
7.Wat niemand heeft gemeten, en waarom wij dat hier opschrijven
Wie deze vraag serieus stelt, komt vier lege velden tegen. Wij zetten ze hier op een rij, omdat een leeg veld zelf een bevinding is.
Er is geen Nederlandse meting van controlegedrag. Hoe vaak, hoe lang en op welke manier documentprofessionals AI-output daadwerkelijk naast de bron leggen, is nergens vastgesteld. Wij zochten in de primaire publicaties van NBA en NOREA, de AFM, de KNB, de NOvA en het College van Toezicht, en in de Nederlandse vakpers rond die publicaties. Alles wat er circuleert, is zelfrapportage of houdingsonderzoek.
De enige Nederlandse zelfrapportage wijst bovendien de vriendelijke kant op. KPMG en Ipsos I&O (N=1.013, algemeen publiek) melden: "Zeven op de tien gebruikers controleren de output standaard." Dat is wat mensen zeggen te doen. Wij beweren hier dus nadrukkelijk niet dat er nauwelijks gecontroleerd wordt. Daar is geen meting voor, en de enige beschikbare Nederlandse cijfers spreken dat tegen.
Er is geen meting van controletijd. Een directe meting van minuten controle per document of per verwijzing vonden wij opnieuw niet, ook niet in de vier primaire beroepsdocumenten die wij voor dit stuk volledig hebben doorgenomen (AFM 36 pagina's, NBA en NOREA 48, KNB 19 en 36, Werkplan College van Toezicht 19). Geen van die documenten kwantificeert de controlestap. Ze beschrijven de handeling en de vastlegging, en zwijgen over tijd, foutpercentages en steekproefomvang.
Er is geen test van de opzet die dit stuk beschrijft. Geen enkele bron die wij ophaalden, zet een generator plus een onafhankelijke verifier naast menselijke controle alleen op hetzelfde documentcorpus. Dat is het lege veld waar dit hele vraagstuk in staat, en het is ook het veld waar wij zelf in staan.
En niemand heeft gemeten wat loos alarm kost. Bij 40,8 procent precisie is meer dan de helft van de meldingen onterecht. Hoeveel tijd een professional kwijt is aan het wegwerken daarvan, staat in geen enkele bron.
Over de status van het bewijs zijn wij net zo precies. Achter de technische secties van dit stuk zitten zestien unieke bronnen: twaalf kale arXiv-preprints zonder venue, één workshoppaper (NeurIPS 2024 Safe Generative AI Workshop), twee peer-reviewde publicaties (ICML 2025 en Nature Machine Intelligence 8, 326-336, 2026) en een Nederlandse rechterlijke uitspraak. Een preprint is niet gereviewd door vakgenoten. Wij markeren ze daarom overal als preprint.
8.Twee keer vonden wij een toezichttekst die scherper werd naverteld dan hij is
Tijdens het opzoekwerk voor dit stuk liepen wij twee keer tegen hetzelfde aan. Een samenvatting van een toezichttekst zei iets stelliger dan de tekst zelf. Wij zetten beide gevallen hier naast elkaar, omdat ze laten zien wat controleren op verwijzingen concreet oplevert.
Geval één, de AFM. Een vakmedium vatte het rapport over audit-tooling samen onder de noemer dat het fundament vaak wankel is. In de PDF van de AFM staat: "Enkele grotere accountantsorganisaties lopen voorop in het voeren van beleid voor tooling in de wettelijke controle. Bij andere is het fundament wankeler. Overal is ruimte voor verbetering." Dat is een vergelijking tussen organisaties. Het is geen vaststelling dat het fundament in de regel ontbreekt.
Geval twee, het College van Toezicht op de advocatuur. Op een vakportaal staat dat het college verwacht dat dekens daar risicogestuurd en transparant toezicht op inrichten. In het Werkplan 2026 van datzelfde college staat: "Het college ontvangt soms signalen over het gebruik van AI door advocaten en verneemt graag van de toezichthouders hoe op dit gebruik toezicht wordt gehouden." En: "In het kader van de actuele ontwikkelingen wil het college stilstaan bij het gebruik van AI binnen de advocatuur en de wijze waarop de dekens op dat gebruik toezicht houden." Wij hebben het werkplan doorzocht: het woord risicogestuurd komt daar in verband met AI niet in voor, en de formulering verwacht dat dekens staat er niet.
Wij verwijten die redacties niets. Hun overige verslaggeving hield in onze controle stand, en samenvatten vraagt keuzes. Het punt is het mechanisme. Wie de tussenschakel leest en niet de bron, neemt een halve graad extra stelligheid over, en die graad reist door naar het volgende stuk dat erop bouwt. Dit is dezelfde beweging als een AI die een arrest samenvat met één woord erbij. Het verschil tussen wat er staat en wat erover geschreven wordt, komt alleen aan het licht als iemand de bron opent.
9.Een controlemethode die vandaag werkt, ook zonder gereedschap van ons
Alles hierboven is samen te vatten in acht stappen die u morgen kunt uitvoeren met de middelen die u al heeft. De stappen komen uit de bronnen in dit stuk, met de vindplaats erbij.
1. Laat de output verwijzingen naar de gebruikte bronnen bevatten. AI-leidraad 2 zet dit op nummer één. De NOvA voegt toe: "Gebruik uitsluitend tools met bronvermelding, zodat de output verifieerbaar is en overeenkomst met de oorspronkelijke bron."
2. Open de belangrijkste bronnen zelf. Toets juistheid, en toets ook of er niets is weggelaten. AI-leidraad 2 noemt beide: "of de relevante inhoud correct is weergegeven (juistheid), of er geen materieel afwijkende inhoud is weggelaten en of alle relevante bronnen zijn gebruikt (volledigheid)".
3. Toets per verwijzing in vier treden. Bestaat de bron. Staat het citaat er woordelijk. Klopt de vindplaats, dus de paginaverwijzing of het randnummer. Draagt de passage de stelling waarvoor hij wordt aangehaald. De Princeton-benchmark meet die vier apart, en de verschillen zijn groot: woordelijk verkeerde citaten worden bijna altijd gevonden (95,2 procent recall), verkeerde vindplaatsen zelden (52,8 procent).
4. Besteed uw scherpste aandacht aan de vindplaats. Daar zakt de geautomatiseerde controle het diepst weg, en de reden is toegang: "Page number information for many cases is only accessible through Westlaw and LexisNexis". Waar de bron achter een betaalmuur zit, is er geen controle, alleen vertrouwen.
5. Zet een tweede model in om op te halen en te citeren. De winst zit daar: agentische ophaling verhoogde de recall met 26,2 procent boven dezelfde opzet zonder ophaling.
6. Laat een model nooit het eindoordeel geven en nooit een cijfer plakken. Beoordelende modellen belonen tekst die op hun eigen tekst lijkt, en hun fouten lopen samen op met die van andere modellen (60 procent overeenstemming wanneer beide fout zitten).
7. Laat twee modellen niet samen tot een conclusie komen. In debat schuiven modellen van goed naar fout, met overname van het meerderheidsantwoord tot 85,5 procent.
8. Leg vast wat u deed. AI-leidraad 2, manier 7: prompts, zoektermen, geraadpleegde bronnen, signalen, uitgevoerde verificatiestappen en conclusies, "zodat herleidbaar is hoe de uitkomsten van AI-toepassingen zijn beoordeeld en gebruikt".
Kantoren leggen dit inmiddels zelf vast. Advocatenkantoor Pallas publiceert: "Elke uitkomst betreffende de juridische dienstverlening die met behulp van AI tot stand komt, wordt door een bevoegde advocaat beoordeeld op juistheid, relevantie en toepasbaarheid." Bij accountantskantoor FACET klinkt het zo: "AI kan ons helpen patronen te herkennen, maar de eindverantwoordelijkheid, het oordeel, ligt bij de accountant." Beide zijn beschrijvingen van eigen beleid, geen normen voor anderen.
En de druk om dit goed te regelen loopt op buiten de juridische wereld. Onder 670 Nederlandse salarisprofessionals steeg het AI-gebruik in de salarisverwerking naar 54 procent, tegen 29 procent een jaar eerder. Uit datzelfde onderzoek: "Opvallend veel salarisprofessionals hebben aangegeven dat het veel tijd kost om deze vaak foutieve informatie te corrigeren".
10.Waar Haertdijk AI in dit verhaal staat
Het gereedschap dat deze handeling uitvoert, is beschreven door de beroepsorganisaties zelf. AI-leidraad 2 noemt als manier 8 van negen: "Een controle AI-toepassing gebruiken om de verificatie en navolgbare onderbouwing van output uit de primaire AI-toepassing te controleren op fouten of hallucinaties. Dit kan bijvoorbeeld op basis van een tool of LLM van een andere leverancier." Dat is het producttype, opgeschreven door NBA en NOREA.
Haertdijk AI is dat gereedschap. De motor doet één ding: hij legt elke bewering naast de bron, met letterlijk citaat en vindplaats. Staat het citaat er niet woordelijk, dan vervalt de bevinding. Er komt geen eindoordeel uit en geen score, om de reden die in de vorige secties staat: beoordelende modellen belonen het vertrouwde en hun fouten lopen samen op met die van andere modellen. Wat de motor per bevinding vastlegt, is het dossierstuk dat manier 7 beschrijft.
Wat er niet is, zeggen wij er direct bij. Wij doen geen tijdsbesparingsclaim, want die meting bestaat nergens en wij hebben hem zelf nog niet afgerond. De precisie van het sterkste publiek geteste systeem in dit veld is 40,8 procent, en wij hebben geen enkele reden om te doen alsof loos alarm bij ons niet bestaat. Onze fail-closed regel drukt dat aantal omlaag en kost recall, en hoeveel recall precies is een open vraag die wij in de pilots meten.
Waar dit op uitkomt, is geen technologie-verhaal. U tekent, en dat blijft zo. De AI draagt geen enkele verantwoordelijkheid en zal die voorlopig ook niet dragen. Het enige wat een controlelaag kan doen, is u sneller bij de bron brengen die u toch al moest openen.
11.Wat mensen hierover vragen
- Hoe controleer je AI-gegenereerd werk?
- Door de bron te openen en de tekst er woordelijk naast te leggen. NBA en NOREA beschrijven die handeling in AI-leidraad 2 (juni 2026) als eerste van negen manieren: verwijzingen naar de gebruikte bronnen opnemen, en dan "de belangrijkste bronnen openen en nagaan of de relevante inhoud correct is weergegeven (juistheid), of er geen materieel afwijkende inhoud is weggelaten en of alle relevante bronnen zijn gebruikt (volledigheid)". De NOvA schrijft het korter op: "Controleer citaten, jurisprudentie en feiten altijd handmatig vóór gebruik." Toets per verwijzing vier dingen: bestaat de bron, staat het citaat er woordelijk, klopt de vindplaats, en draagt de passage de stelling.
- Ben ik verplicht om AI-output te controleren?
- Dat hangt af van uw beroep en van wie het opschrijft. De AFM spreekt als toezichthouder richting accountantsorganisaties: "De externe accountant is eindverantwoordelijk voor de uitkomsten uit de (Gen)AI-tool." NBA en NOREA schrijven een leidraad voor hun leden, in taal die ruimte laat. De NOvA-tekst is een aanbeveling van de projectgroep Digitalisering en AI. De KNB-tekst is een afwegingskader voor het notariaat. Bindend zijn de tuchtrechter en de rechter, en die hebben zich inmiddels uitgesproken.
- Kan een tweede AI de eerste controleren?
- Ja, voor het ophalen en citeren van bronnen, en dat is ook precies waar het bewijs ligt. Op een juridische citaat-benchmark met 4.499 citaties haalt het beste systeem 84,4 procent recall bij 40,8 procent precisie, en agentische ophaling verhoogt de recall met 26,2 procent boven dezelfde opzet zonder ophaling (Princeton, preprint, 2026). NBA en NOREA noemen dit zelf als manier 8: een controle-AI over de output van de primaire AI, eventueel van een andere leverancier. Laat dat tweede model geen oordeel of score geven: modellen die beoordelen belonen tekst die op hun eigen tekst lijkt, en twee modellen zijn het 60 procent van de tijd met elkaar eens wanneer beide fout zitten (ICML 2025).
- Wat gebeurt er als je AI-output niet controleert?
- In Nederland ligt dat inmiddels vast in twee uitspraken. De Raad van Discipline 's-Hertogenbosch legde op 27 juli 2026 een berisping op aan een advocaat die AI-jurisprudentie "klakkeloos" had overgenomen "zonder de verwijzingen op juistheid te controleren of de uitspraken ook maar te lezen" (ECLI:NL:TADRSHE:2026:93). De rechtbank Amsterdam telde op 12 augustus 2026 een halve punt bij de proceskosten op wegens een niet-bestaand citaat, begroot op 2.315,50 euro, omdat dit "zowel [eiser] als de rechtbank nodeloos extra tijd en aandacht gekost" had (ECLI:NL:RBAMS:2026:8258). In die tweede zaak liet de rechtbank in het midden waar de passage vandaan kwam.
- Hoeveel tijd bespaart een controlemotor?
- Dat weten wij niet, en niemand anders in de bronnen die wij onderzochten weet het ook. Een directe meting van controletijd per document of per verwijzing bestaat nergens, ook niet in de vier Nederlandse beroepsdocumenten die wij volledig doornamen. Wat wel bekend is: bij het sterkste publiek geteste systeem is 40,8 procent van de meldingen terecht, dus meer dan de helft van het nakijkwerk gaat naar loos alarm. Zolang die meting ontbreekt, doen wij geen tijdsbesparingsclaim.
- Controleren Nederlandse professionals hun AI-output eigenlijk wel?
- Er is geen meting van gedrag die die vraag beantwoordt. Wij zochten in de primaire publicaties van NBA en NOREA, de AFM, de KNB, de NOvA en het College van Toezicht, en in de vakpers daaromheen. Alle beschikbare cijfers zijn zelfrapportage of houdingsonderzoek. De enige Nederlandse zelfrapportage wijst de vriendelijke kant op: KPMG en Ipsos I&O melden onder 1.013 respondenten uit het algemeen publiek dat "[z]even op de tien gebruikers de output standaard controleren". Wij beweren dus niet dat er nauwelijks gecontroleerd wordt.
Waar dit stuk ophoudt
- Wij hebben geen meting van controlegedrag in Nederland gevonden, en dit stuk levert er zelf geen. Hoe vaak en hoe lang documentprofessionals AI-output naast de bron leggen, weten wij niet.
- Wij hebben geen meting van controletijd gevonden, in minuten per document of per verwijzing. Ook de vier primaire beroepsdocumenten die wij volledig doornamen, kwantificeren de controlestap nergens.
- Geen enkele bron in dit stuk vergelijkt een generator plus een onafhankelijke verifier met menselijke controle alleen op hetzelfde documentcorpus. De opzet die wij beschrijven, is in die vorm nergens getest.
- De cijfers over geautomatiseerde citaatcontrole komen uit een Amerikaanse benchmark met Amerikaanse rechtspraak en citatieconventies. Niets daaraan is bindend in Nederland, en de overdraagbaarheid naar Nederlandse bronnen is niet gemeten.
- Twaalf van de zestien onderzoeksbronnen achter de technische secties zijn arXiv-preprints zonder peer review. Twee zijn peer reviewed, één is een workshoppaper. Wij markeren dat overal, en wij hangen er geen zekerheid aan die er niet is.
- De vier Nederlandse beroepsdocumenten hebben verschillend gewicht. De AFM spreekt als toezichthouder richting accountantsorganisaties, NBA en NOREA schrijven een leidraad, de NOvA-tekst is een aanbeveling van een projectgroep en de KNB-tekst is een afwegingskader. Alleen de tuchtrechter en de rechter binden individueel.
- Voor de aankondiging van het dekenberaad over actief toezicht op AI-gebruik vonden wij geen primaire bron. Die staat alleen als vakpers-weergave, en daar uitsluitend gedateerd als onlangs.
- Wat de fail-closed regel kost aan gemiste fouten, weten wij niet. De literatuur voorspelt een ruil van recall tegen precisie, en niemand heeft die ruil op documenten gemeten, wij ook nog niet.
Bronnen
- NBA en NOREA, AI-leidraad 2: AI Toegepast (juni 2026). Primaire PDF, 48 pagina's. Bron voor de negen manieren om validatie te bevorderen, waaronder manier 1 (bron openen, juistheid en volledigheid), manier 7 (vastleggen in het dossier) en manier 8 (controle-AI over de primaire AI). Leidraad voor leden, geen wet. nba.nl/siteassets/tools-en-ondersteuning/publicaties/2026/
- AFM, 12 bouwstenen voor beheerst gebruik van audit tooling (december 2025). Primaire PDF, 36 pagina's. Bron voor de verificatie-eis bij (Gen)AI-output als controlebewijs, de eindverantwoordelijkheid van de externe accountant en de eigen bewoordingen over de stand bij accountantsorganisaties. Verwachting van de toezichthouder richting organisaties onder toezicht. afm.nl/~/profmedia/files/rapporten/2025/12-bouwstenen-voor
- NOvA, Aanbevelingen AI in de advocatuur. Bron voor Deskundigheid punt 3 ("Controleer citaten, jurisprudentie en feiten altijd handmatig vóór gebruik"), Integriteit punt 1 ("Neem AI-output nooit ongecontroleerd over") en Onafhankelijkheid punt 3. Aanbeveling van de projectgroep Digitalisering en AI, geen zelfstandige tuchtnorm. advocatenorde.nl/voor-advocaten/digitalisering-ai/aanbevel
- KNB, AI-weegschaal, afwegingskader deel 1 (19 pagina's). Bron voor de passage onder het kopje De notaris blijft eindverantwoordelijk. Afwegingskader binnen het notariaat, geen wet. knb.nl/publish/pages/12688/ai_afwegingskader_ai_weegschaal
- KNB, AI-weegschaal deel 2 (36 pagina's). Bron voor de omschrijving van menselijk toezicht; de slotzin verwijst naar de verplichting voor AI-systemen met een hoog risico onder de AI-verordening. knb.nl/publish/pages/12780/ai_afwegingskader_ai_weegschaal
- Raad van Discipline 's-Hertogenbosch, ECLI:NL:TADRSHE:2026:93 (27 juli 2026). Berisping wegens klakkeloos overgenomen AI-jurisprudentie. Bevat het signaal van de deken eind 2025, de akte rectificatie van 3 december 2025 en het integraal geciteerde tussenvonnis van de kantonrechter over de acht ECLI-nummers. Bindend Nederlands tuchtrecht. tuchtrecht.overheid.nl/ECLI:NL:TADRSHE:2026:93
- Rechtbank Amsterdam, ECLI:NL:RBAMS:2026:8258 (12 augustus 2026). Halve punt extra proceskosten, begroot op 2.315,50 euro, wegens een niet-bestaand citaat uit het arrest DSM/Fox. De rechtbank liet de herkomst van de passage uitdrukkelijk in het midden. uitspraken.rechtspraak.nl/details?id=ECLI:NL:RBAMS:2026:82
- Rechtbank Noord-Nederland, ECLI:NL:RBNNE:2025:4814 (19 november 2025), zaaknummer C/18/244013 HA ZA 25-101. Vindplaatsen die niet bestonden of de rechtsregel niet bevatten; de rechtbank vermoedde overname via ChatGPT zonder controle. Opgehaald bij de open databron van de Raad voor de Rechtspraak. data.rechtspraak.nl/uitspraken/content?id=ECLI:NL:RBNNE:20
- College van Toezicht advocatuur, Werkplan 2026 (19 pagina's). Bron voor de eigen bewoordingen over AI-toezicht ("verneemt graag van de toezichthouders hoe op dit gebruik toezicht wordt gehouden"). Beschrijft voornemens, geen norm voor individuele advocaten. collegevantoezichtnova.nl/wp-content/uploads/2026/01/Werkp
- Mr. Online, over een advocaat die twee keer bij dezelfde rechtbank met AI-jurisprudentie kwam (16 maart 2026). Bron voor het dekenberaad, het NOS-interview met deken Timmermans van eind februari en de twee Gelderse bijstandszaken. Journalistiek, dus tweedehands; de Gelderse zaken betreffen een andere advocaat dan de Oost-Brabantse huurzaak. mr-online.nl/advocaat-komt-twee-keer-bij-zelfde-rechtbank-
- Who Checks the Citations? Benchmarking Legal Hallucination Detection (Princeton), arXiv preprint v2, 6 augustus 2026. 1.300 briefexcerpten, 4.499 citaties waarvan 1.107 gehallucineerd. Bron voor 84,4 procent recall, 55,0 F1 en 40,8 procent precisie bij GPT-5 agentisch, 26,2 procent winst door agentische ophaling, 15,3 stappen per excerpt en de Westlaw-beperking. Amerikaans, niet bindend in Nederland. arxiv.org/html/2606.21155v2
- Onderzoek naar verifier-schaling, arXiv preprint. Bron voor het krimpen van het gat Gemma2-9B naar Gemma2-27B met 75,7 procent en voor de grens dat sterke verifiers op moeilijke reasoning-problemen weinig toevoegen. arxiv.org/abs/2509.17995
- Learning to Self-Verify Makes Language Models Better Reasoners, arXiv preprint (7 februari 2026). Gebruikt voor één vaststelling: modellen zijn zwak in het verifiëren van hun eigen antwoorden. De auteurs bepleiten zelf een gecombineerd model, dus de bron draagt geen conclusie over het scheiden van schrijver en controleur. arxiv.org/abs/2602.07594
- Onderzoek naar gecorreleerde modelfouten, aanvaard voor ICML 2025 (peer reviewed). Bron voor 60 procent overeenstemming tussen twee modellen wanneer beide fout zitten, en voor het gegeven dat grotere en nauwkeuriger modellen sterker gecorreleerde fouten maken, ook bij een andere architectuur en aanbieder. arxiv.org/abs/2506.07962
- Onderzoek naar self-preference bias en perplexiteit, NeurIPS 2024 Safe Generative AI Workshop (workshop, geen hoofdtrack). Bron voor de voorkeur van beoordelende modellen voor vertrouwde tekst en voor de waarde 0,520 bij GPT-4 (0,945 tegen 0,425). arxiv.org/abs/2410.21819
- Onderzoek naar mitigatie van self-preference bias over 20 modellen, arXiv preprint v4 (2 juni 2026). Bron voor de vaststelling dat sterkere modellen niet vanzelf minder bevooroordeeld oordelen, en voor de gemiddelde verlaging van 31,5 procent. arxiv.org/abs/2604.22891
- Great Models Think Alike and this Undermines AI Oversight, arXiv preprint v2. Bron voor de voorkeur van een LLM-beoordelaar voor modellen die op hem lijken en voor het gelijkvormiger worden van modelfouten bij stijgende capaciteit. arxiv.org/abs/2502.04313
- Onderzoek naar debat tussen modellen, arXiv preprint. Bron voor de daling van de nauwkeurigheid over de tijd, ook wanneer sterkere modellen in de meerderheid zijn. arxiv.org/abs/2509.05396
- Onderzoek naar faalmodi in homogene multi-agent debatten, arXiv preprint. Bron voor overname van het meerderheidsantwoord tot 85,5 procent, destabilisering van eerder correcte redeneringen tot 70,0 procent en verlies van juiste antwoorden tot 32,3 procentpunt. arxiv.org/abs/2605.00914
- Peacemaker or Troublemaker: How Sycophancy Shapes Multi-Agent Debate, arXiv preprint. Bron voor het vroegtijdig instorten van consensus en voor lagere nauwkeurigheid dan een enkel model alleen. export.arxiv.org/abs/2509.23055
- Onderzoek naar sycofantie in mens-model-interactie (ChatGPT-4o, Claude Sonnet, Gemini 1.5 Pro), arXiv preprint. Bron voor 58,19 procent meebuigen, 14,66 procent regressief en 78,5 procent persistentie. arxiv.org/abs/2502.08177
- Counterfactual-test met 13 geautomatiseerde reviewsystemen op 133 papers en 931 varianten, arXiv preprint v2 (30 januari 2026). Bron voor de vaststelling dat een ingebouwde logische denkfout het gegenereerde oordeel niet significant veranderde. arxiv.org/html/2508.21422v2
- To Err Is Human, arXiv preprint (5 december 2025). AI-checker over 2.500 gepubliceerde AI-papers: 83,2 procent precisie, gemiddeld 4,7 fouten per paper, en 60,0 procent recall op 90 kunstmatig ingebouwde fouten. Gemeten is een model dat door mensen geschreven publicaties nakijkt. arxiv.org/html/2512.05925
- Better Bill GPT, arXiv preprint (2 april 2025). Factuurcontrole in juridische context: tot 92 procent accuratesse tegen een plafond van 72 procent bij ervaren advocaten, F-score 81 tegen 43 procent. Gemeten is model tegenover mens op dezelfde taak. De samenvatting is promotioneel geschreven, met mogelijk leveranciersbelang. arxiv.org/abs/2504.02881
- KPMG met Ipsos I&O, Nationale AI-vertrouwensmonitor (N=1.013, algemeen publiek). Bron voor de zelfrapportage dat zeven op de tien gebruikers de output standaard controleren. Zelfrapportage, geen gedragsmeting. kpmg.com/nl/nl/inzichten/technologie-en-ai/nationale-ai-ve
- CFO.nl over Adaptavist-onderzoek onder 2.500 kenniswerkers in het Verenigd Koninkrijk, de Verenigde Staten, Canada, Duitsland en Spanje (augustus 2026): 42 procent is meer tijd kwijt aan controleren dan de technologie bespaart. Nederland zit niet in de steekproef; leveranciersonderzoek en zelfrapportage. cfo.nl/artikel/kenniswerkers-raken-ai-moe/
- Advocatenkantoor Pallas, gepubliceerd AI-beleid. Bron voor de eigen regel dat elke AI-uitkomst door een bevoegde advocaat wordt beoordeeld. Intern kantoorbeleid, geen norm voor anderen. pallas.nl/ai-beleid/
- Accountant.nl, Automatiseren zonder vertrouwen te verliezen (februari 2026). Bron voor het citaat van accountantskantoor FACET over waar het oordeel ligt. Vakpers met citaat van een kantoorpartner, praktijkbeschrijving. accountant.nl/achtergrond/2026/2/automatiseren-zonder-vert
- Salaris van Morgen over het NIRPA Trendonderzoek onder 670 Nederlandse salarisprofessionals (31 maart 2026): AI-gebruik in de salarisverwerking op 54 procent tegen 29 procent een jaar eerder, met de klacht dat het corrigeren van foutieve informatie veel tijd kost. Zelfrapportage. salarisvanmorgen.nl/2026/03/31/salarisprofessionals-zetten
- Haertdijk AI, Onderzoek 02 (18 augustus 2026): 120 letterlijk geverifieerde uitspraken van Nederlandse documentprofessionals. Bron voor patroon P1, controleren kost meer tijd dan maken, en voor het citaat van de advocaat van Guldemond Advocaten [V6-20]. Volledige tekst intern beschikbaar op /Users/bossmen/Desktop/haertdijk-ai/onderzoek/chatgpt-vragen-2026-08-22/onderzoek02-volledig.txt haertdijk.nl/docs/de-controlelast
Zelf nalezen, of een stuk meenemen
De bronnen hierboven staan er zodat u ze zelf kunt openen; dat is de hele gedachte van dit stuk. Wilt u een concreet stuk naast de bron leggen, mail dan naar [email protected].