Gescande PDF's anonimiseren met OCR
Een scan van een brief is voor een computer geen tekst maar een foto van tekst. Zoeken naar een BSN of een postcode levert dan niets op, hoe duidelijk het nummer ook op de pagina staat. Dat is geen fout in de tool: er is geen tekst om te doorzoeken.
Wat tekstherkenning doet
Tekstherkenning leest de afbeelding en zet de letters om naar tekst. Daarna is de pagina voor de analyse net als elke andere pagina: dezelfde patronen, dezelfde categorieën, hetzelfde controlescherm. Je hoeft dus niet twee verschillende werkwijzen te leren; het enige verschil is dat je voor een scan eerst op tekstherkenning klikt.
Twee dingen zijn hierbij de moeite waard om te weten.
De herkenning draait met het Nederlandse taalpakket (10 MB) en gebeurt volledig in je browser. Er gaat geen pagina naar een server om gelezen te worden; dat is bij een scan extra belangrijk, want het beeldmateriaal is dan de enige versie van het document die je hebt.
Het taalpakket wordt één keer opgehaald en daarna door je browser lokaal bewaard, zodat je het niet bij elk bezoek opnieuw hoeft te downloaden.
Hoe goed het gaat
Tekstherkenning is geen mensenwerk. Bij een scherpe scan van een gedrukte brief gaat het vrijwel altijd goed. Bij een scheve foto, een slecht contrast of een handschrift wordt het minder, en dan kan een cijfer in een BSN verkeerd gelezen worden. Dat is precies waarom de tool de gevonden waarden niet automatisch toepast: je ziet elke vondst in het controlescherm, met de tekst eromheen, en je vinkt zelf af wat weg moet. Bij een scan is die controle extra belangrijk.
Grote pagina's worden vóór de herkenning verkleind tot ongeveer 12 megapixel. Dat is een bewuste grens: een pagina die veel groter is, kost onevenredig veel geheugen en tijd zonder dat de herkenning er beter van wordt.
Wat er bij het exporteren gebeurt
Dit is het punt waarop een scan anders behandeld wordt dan een pagina met een tekstlaag. Op een pagina met tekst worden de getroffen tekens uit het bestand verwijderd. Bij een scan is die tekstlaag er niet; de pagina bestaat uit beeldpunten, en daar kan de tool niets uit verwijderen.
Daarom wordt een pagina met een markering erop in dat geval volledig opnieuw opgebouwd als afbeelding, met de blokken er al in. Dat heeft twee gevolgen die je vooraf moet weten:
- de tekst op die pagina is daarna niet meer selecteerbaar en niet meer doorzoekbaar;
- de toegankelijkheidstag van die pagina verdwijnt.
Daar staat tegenover dat de uitkomst betrouwbaar is: er is geen laag onder het blok waar de oorspronkelijke gegevens nog in staan. Je krijgt vooraf te zien welke pagina's opnieuw opgebouwd worden, en het exportrapport vermeldt het aantal.
Wanneer je beter zelf kunt markeren
Soms is tekstherkenning niet nodig. Als je van een scan maar één regel hoeft weg te halen — een handtekening, een stempel, een naam in de kop — dan ben je sneller klaar door zelf een rechthoek te trekken. De knop daarvoor staat direct naast de knop voor tekstherkenning, en je slaat de wachttijd van het taalpakket over.
Overigens: een scan van een ondertekend contract is een goed voorbeeld van een document waarin je meestal beide wilt doen. Eerst tekstherkenning voor de nummers in de tekst, en daarna zelf een paar rechthoeken voor de handtekening en het stempel. Wat je in stap 4 tekent, komt in dezelfde export terecht als wat de analyse heeft gevonden.
Veelgestelde vragen
Werkt het met gescande PDF's?
Ja. Als een document geen selecteerbare tekst heeft, kun je tekstherkenning starten. Die draait met het Nederlandse taalpakket (10 MB) volledig in je browser; het pakket wordt één keer opgehaald en daarna lokaal bewaard. Herkende woorden gaan door dezelfde detectie en hetzelfde controlescherm als een normale tekstlaag. Let op: pagina's met afbeeldingen worden bij het exporteren opnieuw opgebouwd als afbeelding, waardoor de tekst daar niet-selecteerbaar wordt.
Wat gebeurt er met gevoelige tekst in een afbeelding of een logo?
Beeldpunten van een afbeelding worden nooit herschreven. Zodra een markering over een afbeelding valt, weigert de tool de tekst te verwijderen en wordt die pagina in plaats daarvan opnieuw opgebouwd als afbeelding, met de blokken er al in gebakken. Je krijgt daar vooraf een melding over, en het exportrapport vermeldt welke pagina's opnieuw zijn opgebouwd.
Is er een limiet aan de bestandsgrootte?
Er is geen harde limiet; de tool weigert alleen lege bestanden en bestanden die geen PDF zijn. De tool krijgt tot ongeveer 1 GB werkgeheugen, en een groot bestand piekt op enkele malen zijn eigen omvang, dus reken bij bestanden boven de 100 MB op een trage verwerking en op veel geheugengebruik van je browser.
Herken de tekst in je scan — Alle categorieën behalve de Woo-grond-verwijzingen, standaard als zwart blok (lakken), met de mogelijkheid om per categorie een Woo-grond te vermelden.
Open de toolJe bestand blijft op je eigen apparaat. Er wordt niets verstuurd en niets opgeslagen.
Verder lezen
- Hoe werkt PDF anonimiseren?Van tekstlaag tot export: hoe de analyse werkt, wat de zekerheidsniveaus betekenen, en wat er met je bestand gebeurt als je op exporteren klikt.
- Veelgestelde vragenWordt mijn PDF geüpload? Hoe werkt de analyse? Wat gebeurt er met metadata? De antwoorden op de vragen die het vaakst gesteld worden.
- PDF anonimiseren voor Woo-verzoekenRedigeer Woo-documenten lokaal in je browser. Lakken is definitief, de Woo-grond noteer je per categorie, en er gaat geen bestand naar een server.