Hoe je eenvoudig kunt controleren of een PDF als tekst wordt herkend dankzij OCR

Een PDF kan perfect leesbare tekst op het scherm weergeven terwijl het technisch gezien een platte afbeelding is, zonder enige bruikbare tekstlaag. Het onderscheid tussen een afbeeldings-PDF en een PDF met functionele OCR-herkenning beïnvloedt de volledige tekstzoekfunctie, indexering, toegankelijkheid en gegevensextractie. We beschrijven hier de concrete methoden om snel te oordelen.

Leesvolgorde na OCR: de test die de meeste gidsen negeren

Een PDF kan een OCR-tekstlaag bevatten en toch onbruikbaar blijven. Het probleem doet zich voor bij documenten met meerdere kolommen, tabellen en complexe lay-outs: de OCR herkent de tekens maar niet de logische structuur van het document.

Om dit te controleren, selecteert u een tekstblok in een tabel- of meerkolomsgebied, kopieert u het en plakt u het in een platte teksteditor. Als de regels door elkaar lopen tussen kolommen of als de cellen van een tabel zonder scheidingsteken aan elkaar worden geplakt, is de OCR-laag aanwezig maar slecht gestructureerd. Het bestand zal een basis Ctrl+F-test doorstaan terwijl het bij een geautomatiseerde extractie bizarre resultaten oplevert.

Deze controle is bijzonder kritisch voor geautomatiseerde documentstromen (factuurparsering, wettelijke archivering, voeding van databases). Een “erkende” PDF in strikte zin maar met een onjuiste leesvolgorde genereert stille fouten stroomafwaarts.

Man die OCR-software op een computer gebruikt om de tekstherkenning in een PDF-bestand te controleren

Selectie met de cursor en Ctrl+F-zoekopdracht in een PDF

De snelste methode blijft de directe selectie-test. Open de PDF in elke lezer (Adobe Reader, Foxit, browser) en probeer een afzonderlijk woord met de cursor te markeren. Twee mogelijke resultaten:

  • Het woord wordt individueel gemarkeerd, teken voor teken: er bestaat een tekstlaag. De PDF bevat native tekst of is al door OCR verwerkt.
  • De selectie vangt de hele pagina als een uniek blok, of er wordt niets geselecteerd: het bestand is een afbeelding zonder tekstlaag. De OCR is niet toegepast.

Vul deze eerste diagnose aan met een Ctrl+F (of Cmd+F op macOS). Typ een woord dat zichtbaar is op het scherm. Als de zoekopdracht geen resultaten oplevert terwijl het woord duidelijk wordt weergegeven, is de PDF een gescande afbeelding. We raden aan om te weten hoe de tekenherkenning van een pdf te controleren voordat u enige extractie- of archiveringsverwerking start.

Deze twee gecombineerde tests duren minder dan tien seconden en vereisen geen gespecialiseerde software.

Doorzoekbare PDF en bewerkbare PDF: een veelvoorkomende verwarring met technische gevolgen

Het onderscheid tussen deze twee soorten bestanden wordt vaak gewist in de consumentenhulpmiddelen, terwijl het directe impact heeft op documentstromen.

Doorzoekbare PDF (searchable PDF)

De originele afbeelding wordt behouden in een zichtbare laag. Een onzichtbare tekstlaag, gegenereerd door OCR, wordt eronder geplaatst. De visuele weergave blijft identiek aan de originele scan. De volledige tekstzoekfunctie en knippen/plakken werken, maar de tekst is niet direct bewerkbaar in een klassieke PDF-editor.

Bewerkbare PDF na OCR

De OCR-motor reconstrueert de inhoud in native tekstobjecten, waarbij de afbeelding wordt vervangen door vervangende lettertypen en opnieuw gepositioneerde blokken. De lay-out kan verstoord zijn: verschoven regelovergangen, benaderde lettertypen, gedeconstrueerde tabellen. Dit formaat is geschikt voor hergebruik in een tekstverwerker (Word, LibreOffice), maar niet voor een trouw archivering van het oorspronkelijke document.

In de praktijk is het doorzoekbare formaat (afbeelding + onzichtbare tekstlaag) te verkiezen voor archivering en documentconformiteit. Voor het heruitgeven van inhoud is het bewerkbare formaat relevant ondanks de visuele trouwheidsbeperkingen.

Controleer de OCR-kwaliteit verder dan alleen detectie

Bevestigen dat er een tekstlaag aanwezig is, is niet genoeg. Een OCR van slechte kwaliteit produceert selecteerbare tekst maar vol fouten. Hier zijn de aanvullende controlepunten:

  • Kopieer een volledige alinea en plak deze in een editor. Tel de verkeerd herkende tekens: vervangende letters (rn als m gelezen, l als 1 gelezen), ontbrekende spaties, gebroken ligaturen.
  • Test de zoekopdracht op specifieke termen in het document (eigen namen, referenties, acroniemen). Deze elementen worden als eerste verkeerd herkend door OCR-motoren.
  • Controleer op meertalige documenten of de geaccentueerde tekens correct worden weergegeven. Een OCR die is ingesteld op Engels voor een Franse tekst zal systematisch falen op de é, è, ê, ù.

De OCR-kwaliteit hangt rechtstreeks af van de resolutie van de bron-scan. Een document dat is gescand onder de 200 dpi produceert een verzwakte herkenning, vooral op tekstlichamen van minder dan 10 punten.

Jongere die een PDF-document op een laptop controleert in een minimalistische woonkamer, OCR-herkenningstest

Snelheidsdiagnosetools voor grote PDF-bestanden

Bij een batch van tientallen of honderden bestanden zijn handmatige tests niet schaalbaar. Verschillende benaderingen maken het mogelijk om de controle te automatiseren.

In Adobe Acrobat Pro geeft de functie “Herken tekst” aan of er al een OCR-laag bestaat voordat de verwerking wordt gestart. Dit is een betrouwbare binaire indicator, maar beperkt tot één bestand tegelijk zonder aanvullende scripting.

Python-bibliotheken zoals PyMuPDF of pdfplumber maken het mogelijk om de tekstlaag van een PDF programmatisch te extraheren. Als de extractie een lege string retourneert op een pagina die visueel tekst bevat, is het bestand een niet-OCR-beeld. Dit soort script kan in enkele regels worden uitgerold en verwerkt hele batches in enkele minuten.

Voor organisaties die regelmatig documentstromen beheren, raden we aan deze geautomatiseerde controle voorafgaand aan elke indexerings- of archiveringsketen te integreren, in plaats van fouten achteraf te corrigeren.

De OCR-controle is geen eenmalige handeling, maar een terugkerende kwaliteitscontrole. Een document dat vandaag correct is herkend, kan morgen problemen opleveren als het uitvoerformaat of de OCR-motor verandert tussen twee batches. Het integreren van een systematische validatietest in de documentpipeline blijft de enige betrouwbare garantie op lange termijn.

Hoe je eenvoudig kunt controleren of een PDF als tekst wordt herkend dankzij OCR