Jitt/ AI
Alle labs

Labs

100 facturen verwerken met lokale AI

100 PDF-facturen uitgelezen en omgezet naar gestructureerde data, volledig lokaal. Lees verder om te zien hoe we op 2 seconden per factuur uitkwamen.

Auteur
Jitt AI Automation
Gepubliceerd op
Leestijd
4 min lezen
Resultaat
3 min 24 sec end-to-end
Dataset
100 PDF-facturen
Model
PaddleOCR + Qwen3 0.6B
Hardware
GPU met minimaal 4 GB VRAM

Hoe lang duurt het om 100 facturen (als PDF) automatisch uit te lezen én om te zetten naar bruikbare data? We hebben het gemeten met lokale AI: volledig op onze eigen computer en zonder cloud.

Het resultaat: gemiddeld 2 seconden per factuur, van PDF tot kant-en-klare data. De hele stapel van 100 facturen was klaar in 3 minuten en 24 seconden. Lees verder om te zien hoe we dat voor elkaar kregen.

Zo werkt de automatisering

Het proces bestaat uit twee gekoppelde workflows, gebouwd in n8n. De eerste leest de facturen uit, de tweede zet die tekst om naar gestructureerde data.

De eerste workflow verzorgt het uitlezen. Klik op de afbeelding voor een grotere weergave.

De enige handmatige stap is het aanleveren van de facturen via een formulier.

De tweede workflow zet de uitgelezen tekst vervolgens om naar gestructureerde data.

De cijfers op een rij

StapTotale tijdGemiddeld per factuur
Tekst uitlezen28,6 sec0,3 sec
Omzetten naar data2 min 55 sec1,7 sec
Rest van de workflow0,3 sec0,003 sec
Alles bij elkaar3 min 24 sec2,0 sec

Opvallend is dat het uitlezen van de tekst bijzonder snel gaat. Het omzetten naar gestructureerde data kost verreweg de meeste tijd en bepaalt daarmee het tempo van het hele proces.

De verdeling van de tijd

Tekst uitlezen — 14%

Omzetten naar data — 85,8%

Rest — 0,2%

Kwaliteit van de resultaten

De meeste facturen waren binnen ongeveer anderhalve seconde omgezet naar gestructureerde data. Eén factuur duurde langer (ruim vijf seconden), maar dat was een uitzondering: 95 van de 100 waren binnen 2,5 seconde klaar.

Verder:

  • alle 100 facturen kwamen in het afgesproken formaat terug;
  • bij 5 facturen lukte dat niet in één keer; een automatische herhaling loste dat op;
  • 4 facturen zijn apart gezet voor een handmatige controle;
  • geen enkele factuur bleef uiteindelijk onbruikbaar.

De logische volgende stap

De facturen staan nu als gestructureerde data klaar. Voor de hand liggende vervolgstappen zijn:

  • de data opslaan in een database;
  • die koppelen aan een boekhoudpakket, ERP of CMS, zodat alles automatisch op de juiste plek terechtkomt;
  • de vier twijfelgevallen doorsturen naar een controlewachtrij.

Wat scheelt dat met handwerk?

Het exacte verschil hangt af van hoe snel iemand werkt, maar een ruwe rekensom maakt de verhouding duidelijk. Wie een factuur met de hand openslaat, overtypt en controleert, is daar al gauw zo'n twee minuten mee bezig. Voor 100 facturen komt dat neer op ruim drie uur.

Conclusie

De facturen hadden allemaal een andere lay-out, indeling en gegevens, verdeeld over vier talen (Nederlands, Engels, Frans en Duits). Toch verwerkte de pipeline ze zonder haperen: de aanpak is niet vastgeklikt op één vast sjabloon, maar leest ook facturen die er heel verschillend uitzien.

Wat vooral opvalt, is dat dit lukte met twee lichte modellen. Zowel PaddleOCR als Qwen3 0.6B is compact en zuinig, en draait moeiteloos op bescheiden hardware. Toch waren ze prima geschikt voor deze taak: na controle kwamen alle 100 facturen foutloos en in het juiste formaat terug. Je hebt dus geen zware, dure infrastructuur nodig om betrouwbaar factuurwerk te automatiseren.

Kan dit alleen met lokale AI?

Nee. Dezelfde pipeline draait net zo goed op modellen in de cloud. We kozen bewust voor lokale AI, en dat heeft een paar duidelijke voordelen: de facturen verlaten je eigen computer niet, wat prettig is voor privacy en gevoelige bedrijfsgegevens. Je betaalt geen kosten per verwerkte pagina of per API-aanroep. En je bent niet afhankelijk van een internetverbinding of van een externe dienst die traag kan zijn of kan uitvallen.

Waarop we dit hebben getest

  • De stapel: 100 facturen als PDF, elk met een eigen lay-out, indeling en gegevens.
  • Talen: 50 Nederlands, 24 Engels, 14 Frans en 12 Duits.
  • Uitlezen: PaddleOCR van Baidu, met het compacte PP-OCRv5-model.
  • Omzetten naar data: Qwen3 0.6B, een klein taalmodel dat lokaal draaide.
  • Automatisering: twee gekoppelde workflows in n8n.
  • Hardware: een GPU met zo'n 4 GB VRAM is genoeg. Dat is vooral wat PaddleOCR prettig vindt; Qwen3 0.6B is zo compact dat het daar met gemak naast past.
  • Waar het draaide: volledig op onze eigen computer, zonder cloud.