Hoe werkt PDF anonimiseren?

Deze pagina legt uit wat er stap voor stap gebeurt tussen het moment dat je een PDF in het venster sleept en het moment dat je een nieuw bestand downloadt. Dat is handig als je wilt beoordelen of de uitkomst betrouwbaar genoeg is voor het dossier waarmee je bezig bent.

Stap 1: het bestand wordt gelezen, niet verstuurd

De tool opent je PDF in de browser zelf. Er is geen server die het bestand ontvangt, en er is geen tijdelijke opslag. Wat er wel gebeurt: de tekstlaag van elke pagina wordt uitgelezen, en de tool stelt vast of er überhaupt selecteerbare tekst in het document zit.

Dat laatste is belangrijk, want een PDF waarin elke pagina een afbeelding is — een scan, een foto, een uitdraai — heeft geen tekstlaag. Daar kan geen patroonherkenning op losgelaten worden. In dat geval biedt de tool tekstherkenning aan, of je kunt ervoor kiezen om zelf te markeren.

Stap 2: drie manieren om iets te herkennen

De analyse haalt drie soorten herkenning over de tekst heen. Ze vullen elkaar aan, en je ziet in het controlescherm altijd uit welke bron een vondst komt.

Patronen vinden wat een vaste vorm heeft. Een BSN wordt alleen gemeld als het de elfproef doorstaat; een IBAN alleen als de modulocontrole klopt. Dat zijn echte controles: ze filteren getallen weg die er wel op lijken maar het niet zijn. Daarnaast zijn er patronen voor postcodes, telefoonnummers, datums, bedragen, kentekens en zaaknummers.

Labels doen het omgekeerde: ze zoeken het woord dat bij een waarde hoort. Een getal van negen cijfers is niets bijzonders, maar "patiëntnummer 1234567" is dat wel. Daarom wordt een nummer zonder label niet gemeld: de vorm verschilt per instelling en er is geen betrouwbare opbouw om op te varen.

De slimme AI-scan herkent namen, organisaties en plaatsen aan de zin waarin ze staan, ook als er geen label of patroon bij staat. Die staat standaard uit en moet je zelf aanzetten, omdat het model eenmalig wordt opgehaald en het de analyse langzamer maakt.

Stap 3: wat de zekerheidsniveaus betekenen

Elke vondst krijgt een niveau. Dat niveau zegt iets over de onderbouwing, niet over de kans dat het gevoelige informatie is.

| Niveau | Betekenis | | --- | --- | | Zeker | Een controle of een expliciet label onderbouwt de vondst. | | Waarschijnlijk | De vorm klopt, maar het label ontbreekt. | | Mogelijk | Aannemelijk maar dubbelzinnig, zoals een nationaliteit of een losse functietitel. |

De AI-scan levert nooit "zeker". Dat niveau is gereserveerd voor dingen die je kunt narekenen. Wie bij het instellen kiest voor "alleen zeker" ziet dus geen enkele vondst van de AI-scan, en dat is de bedoeling.

Je vinkt zelf af wat weg moet. Wat de tool vindt is een voorstel, geen besluit; op een document van dertig pagina's is het de bedoeling dat je er in twee minuten doorheen loopt, niet dat je de uitkomst blind overneemt.

Stap 4: wat er bij het exporteren gebeurt

Dit is het deel dat het verschil maakt. Bij het exporteren worden de tekens die binnen een markering vallen uit het bestand verwijderd, ook als ze midden in een regel staan. Daarna komt er een ondoorzichtig blok op de plek van de markering. De regelafbreking en de uitlijning blijven daarbij gelijk, omdat de tool rekening houdt met de breedte van elk teken.

Staat er een afbeelding onder een markering, dan weigert de tool de tekst te verwijderen. Dat is geen fout maar een keuze: in de beeldpunten van een foto kan de tool niets verwijderen. Zulke pagina's worden in plaats daarvan opnieuw opgebouwd als afbeelding, met de blokken er al in gebakken. Je krijgt vooraf te zien welke pagina's dat betreft.

Bij elke export worden ook de gegevens over het bestand zelf verwijderd: wie het heeft gemaakt, wanneer, met welk programma, en de titel, het onderwerp en de trefwoorden die erin staan. Ook verborgen lagen, het nummer waarmee het bestand zichzelf identificeert en de opbouw voor voorleesprogramma's gaan mee. Daar is geen instelling voor nodig. Wat overblijft is een vaste producentnaam die het PDF-programma zelf schrijft; daar staat geen documentinhoud in.

Wat de tool niet doet

Eerlijkheid over de grenzen is hier belangrijker dan een lange lijst met mogelijkheden.

Waarom dit in de browser kan

PDF lezen en herschrijven is niet eenvoudig, maar het kan zonder server. Het tekenen van de pagina's gebeurt met dezelfde techniek die browsers al gebruiken om PDF's weer te geven. Het aanpassen van het bestand gebeurt met een programma dat in de pagina zelf draait, in plaats van op een server. Dat verklaart ook de eenmalige downloads die je ziet: ongeveer 135 MB voor het AI-model en 10 MB voor het Nederlandse taalpakket. Beide worden door je browser lokaal bewaard, zodat je ze niet bij elk bezoek opnieuw ophaalt.

Veelgestelde vragen

Wordt mijn PDF geüpload?

Nee. Er is geen server die je bestand ontvangt. De tool opent je PDF in de browser, leest de tekstlaag uit en past de redactie lokaal toe. Er gaan geen bestanden, tekstfragmenten of zoektermen over het netwerk; de enige downloads zijn de programma-onderdelen van deze site zelf. Het enige dat ooit van jou naar buiten gaat, is wat je zelf in het contactformulier typt.

Hoe werkt de analyse van mijn document?

De tool leest de tekstlaag van elke pagina en haalt daar drie soorten herkenning overheen. Patronen vinden wat een vaste vorm heeft: een BSN dat de elfproef doorstaat, een IBAN die de vaste cijfercontrole doorstaat, een postcode, een datum. Tekstherkenning leest pagina's zonder tekstlaag, bijvoorbeeld een scan. De slimme AI-scan herkent namen, organisaties en plaatsen aan de zin waarin ze staan, ook zonder label of patroon. Je bepaalt zelf welke categorieën meedoen en hoe zeker een vondst moet zijn.

Is de redactie echt definitief, of staat er alleen een zwart blok overheen?

De tekst wordt uit het bestand verwijderd, niet bedekt. Bij het exporteren haalt de tool de tekens die binnen een markering vallen uit de tekst van de pagina en zet er daarna een ondoorzichtig blok neer op de plek waar ze stonden. Een gewone zwarte rechthoek bovenop de tekst is iets anders: de letters blijven dan in het bestand staan en zijn met kopiëren of met een andere lezer zo weer zichtbaar.

Wat gebeurt er met gevoelige tekst in een afbeelding of een logo?

Beeldpunten van een afbeelding worden nooit herschreven. Zodra een markering over een afbeelding valt, weigert de tool de tekst te verwijderen en wordt die pagina in plaats daarvan opnieuw opgebouwd als afbeelding, met de blokken er al in gebakken. Je krijgt daar vooraf een melding over, en het exportrapport vermeldt welke pagina's opnieuw zijn opgebouwd.

Probeer het met je eigen document

Open de tool

Je bestand blijft op je eigen apparaat. Er wordt niets verstuurd en niets opgeslagen.

Verder lezen