We gaven vier AI-modellen dezelfde 800 contactformulieren en vroegen één ding: herken je wat voor bericht dit is? Denk aan een lead, een supportvraag, een klacht, een factuurvraag of spam. Dat is de kern van elke contactformulier- automatisering: berichten juist sorteren.
De modellen die we testten
| Model | Waar het draait | Benodigde VRAM |
|---|---|---|
| Fable Qwen 27B Q4 | Lokaal (Ollama) | ± 24 GB |
| GPT-5.4 mini | OpenAI API-key | — (draait in de cloud) |
| Ministral 14B | Lokaal (Ollama) | ± 16 GB |
| Ministral 3B | Lokaal (Ollama) | ± 6 GB |
De drie lokale modellen draaiden via Ollama; GPT-5.4 mini via de OpenAI API. De VRAM-waarden zijn richtlijnen: het gewicht van het model plus wat ruimte voor de context. Het 27B Q4-model vraagt de meeste geheugenruimte; de kleine Ministral 3B past al op een bescheiden kaart.
De score voor deze taak
Elk model kreeg een score van 0 tot 100% op hoe vaak het het juiste type bericht herkende (intent accuracy). Dat is de metric die telt: begrijpt het model de binnenkomende aanvraag?
Intent accuracy per model
Fable Qwen 27B
91,63%
GPT-5.4 mini
90,64%
Ministral 14B
74,50%
Ministral 3B
62,38%
Fable Qwen 27B (lokaal) en GPT-5.4 mini liggen bovenaan en dicht bij elkaar, met het lokale model nipt voorop. Fable Qwen herkende support-, facturatie- en opzeggingsberichten zelfs voor 100% correct, en ging beter om met bewust onduidelijke berichten dan GPT. De twee kleinere Ministral-modellen blijven duidelijk achter.
Welke modellen herkennen spam?
Spam verdient een aparte blik: een gemiste spam of een onterecht gewiste lead kost direct geld. Twee begrippen:
- Precision — als het model "spam" zegt, hoe vaak is dat terecht?
- Recall — hoeveel van alle aanwezige spam vindt het model?
Alle vier de modellen hadden 100% spam precision: geen enkel normaal bericht werd ten onrechte als spam gemarkeerd. Het verschil zat volledig in recall.
Spam recall per model
GPT-5.4 mini
45/60 · 75%
Fable Qwen 27B
38/60 · 63%
Ministral 14B
14/60 · 23%
Ministral 3B
3/60 · 5%
Hoe snel waren de modellen?
Gemiddelde modeltijd per bericht (ms)
Ministral 3B
584 ms
Fable Qwen 27B
2.467 ms
GPT-5.4 mini
2.748 ms
Ministral 14B
3.391 ms
Ministral 3B was met afstand het snelst (volledige run in 8m 26s), maar dat ging ten koste van begrip. Opvallend: Ministral 14B was zelfs trager dan het veel grotere Qwen 27B, terwijl het kwalitatief lager scoorde. Meer parameters betekent dus niet automatisch sneller en binnen dezelfde grootteklasse zegt de modelkeuze meer dan het aantal parameters. Qwen 27B laat zien dat een groot model óók snel en sterk kan zijn; Ministral 14B dat een middelgroot model traag en zwakker kan uitpakken.
Wil je weten hoe we dit precies hebben gemeten? Vanaf hier gaan we de diepte in.
De dataset van 800 berichten
Ieder model kreeg exact dezelfde 800 contactformulierberichten. De dataset was bewust divers:
- leads, algemene vragen, klachten, supportvragen, facturatievragen, opzeggingen, afspraakverzoeken, spam en opzettelijk onduidelijke berichten;
- meerdere talen;
- zeer korte berichten én langere berichten met extra context;
- duidelijke en dubbelzinnige formuleringen.
Elk bericht kreeg vooraf één van negen labels als verwacht resultaat: lead,
question, complaint, support, billing, cancellation, appointment,
spam of unclear. Het model moest per bericht dat type voorspellen. De benchmark
draaide sequentieel: één bericht per modelaanvraag.
De volledige model-ID's: fable-qwen3.6:27b-q4, gpt-5.4-mini-2026-03-17,
ministral-3:14b-instruct-2512-q8_0 en ministral-3:3b-instruct-2512-q8_0. De
lokale modellen draaiden met temperature 0, JSON-output en maximaal 160
outputtokens; GPT-5.4 mini met een strict JSON schema en dezelfde tokenlimiet.
Hoe de test draaide
De benchmark liep als één workflow: elk bericht ging naar het model, het antwoord (een JSON-object met de voorspelde intent) werd vergeleken met het verwachte label, en de score werd bijgehouden. Zo verwerkten we alle 800 berichten per model.
Wat de OpenAI-run kostte
OpenAI rapporteerde 175.439 inputtokens en 63.820 outputtokens. De volledige verwerking van 800 contactformulieren met GPT-5.4 mini kostte ongeveer $0,40, omgerekend zo'n €0,35 (koers ~0,86 EUR/USD), oftewel ongeveer €0,0004 per bericht.
| Volume | Kosten (USD) | Kosten (EUR) |
|---|---|---|
| 800 (deze run) | ± $0,40 | ± €0,35 |
| 10.000 | ± $5,00 | ± €4,30 |
| 100.000 | ± $50,00 | ± €43,00 |
De omrekening is indicatief; de wisselkoers schommelt. Voor de lokale modellen zijn er geen tokenkosten per aanvraag, maar wel eenmalige kosten voor hardware, onderhoud en stroom.
Analyse per model
Fable Qwen 27B — de hoogste intent accuracy van de test, met 100% correcte herkenning voor support, billing en cancellation. Dat is een belangrijk signaal: zodra categorieën duidelijk zijn afgebakend en weinig op elkaar lijken, benadert de herkenning de 100%. De fouten zaten juist bij categorieën die dicht bij elkaar liggen (bijvoorbeeld een lead die ook als algemene vraag te lezen is). Met scherpere categorie-definities is er dus nog ruimte om de score verder omhoog te brengen. Verder ging het beter met onduidelijke berichten dan GPT, eindigde het tweede bij spamdetectie, en draaide het lokaal op 24 GB VRAM. Een sterke allround kandidaat voor lokale classificatie.
GPT-5.4 mini — intent accuracy vrijwel gelijk aan Qwen, en de beste spam recall. Sterk in lead, support, billing en cancellation, zwakker op bewust onduidelijke berichten. Eenvoudig via API te gebruiken, maar afhankelijk van netwerk, provider en tokengebruik.
Ministral 14B — sterk bij duidelijke vragen, klachten, facturatie, opzeggingen en afspraken, maar zwakker bij leads, support, spam en onduidelijke berichten. Spam precision perfect, recall laag. Verrassend trager dan het lokale 27B-model en zonder overtuigend algemeen voordeel in deze test.
Ministral 3B — veruit het snelst (584 ms per bericht), maar voor deze taak schoot het tekort. Het herkende het berichttype veel vaker verkeerd en miste vrijwel alle spam (3 van 60), support en facturatie. Voor het betrouwbaar sorteren van contactformulieren is dit model niet geschikt.
Conclusie
De grootste verrassing was niet dat GPT-5.4 mini goed presteerde. De grootste verrassing was dat een lokaal 27B Q4-model, draaiend op een consumentenkaart met 24 GB VRAM, bij intentherkenning vrijwel gelijk eindigde en zelfs licht hoger scoorde. GPT was wel duidelijk beter in spamdetectie.
Dat betekent niet dat lokale modellen OpenAI altijd verslaan. Het betekent wel dat een goed gekozen lokaal model op een afgebakende classificatietaak verrassend dicht in de buurt kan komen — met de data die je eigen infrastructuur nooit verlaat en zonder kosten per aanvraag.
Zou jij voor deze toepassing kiezen voor maximale eenvoud via een API, of voor lokale controle en privacy?