Canonical: https://www.strataigize.com/nl/insights/what-an-ai-evaluation-actually-measures/
Description: Benchmarkscores zijn meetinstrumenten, en de meeste zijn nooit gevalideerd. Wat u controleert voordat u er een vertrouwt, en wat u beter zelf bouwt.
Published: 2026-09-13T00:00:00.000Z
Modified: 2026-09-13T00:00:00.000Z

[← Blog](https://www.strataigize.com/nl/insights/)

![](https://www.strataigize.com/blog/real/cover-what-an-ai-evaluation-actually-measures.webp)

# Wat een AI-evaluatie werkelijk meet

Door [**Eric Hedlin**](https://www.strataigize.com/nl/about/team/eric/), Hoofdwetenschapper AI · Gepubliceerd 13 september 2026 · 6 min leestijd

Een benchmarkscore vertelt u hoe een model presteerde op één vaste set vragen, op één bepaalde manier beoordeeld. Hij vertelt u niet of het model werkt op uw data. Een review uit 2025 van 445 benchmarks voor taalmodellen vond dat slechts 16% hun resultaten aan enige statistische toets onderwierp, en ander onderzoek laat zien dat ongeveer de helft van de geteste modellen benchmarkinhoud al tijdens de training had gezien. Bouw voordat u een AI-systeem koopt een kleine gelabelde set uit uw eigen echte gevallen en meet daartegen.

In dit artikel

1.  [Een benchmark is een instrument, en instrumenten moeten gevalideerd worden](https://www.strataigize.com/nl/insights/what-an-ai-evaluation-actually-measures/#een-benchmark-is-een-instrument-en-instrumenten-moeten-gevalideerd-worden)
2.  [Het besmettingsprobleem maakt het getal nog zachter](https://www.strataigize.com/nl/insights/what-an-ai-evaluation-actually-measures/#het-besmettingsprobleem-maakt-het-getal-nog-zachter)
3.  [Hoe dit er in onderzoek uitzag](https://www.strataigize.com/nl/insights/what-an-ai-evaluation-actually-measures/#hoe-dit-er-in-onderzoek-uitzag)
4.  [De evaluatie die u zelf bouwt, is de enige die op uw beslissing is afgestemd](https://www.strataigize.com/nl/insights/what-an-ai-evaluation-actually-measures/#de-evaluatie-die-u-zelf-bouwt-is-de-enige-die-op-uw-beslissing-is-afgestemd)
5.  [Wat u een leverancier vraagt](https://www.strataigize.com/nl/insights/what-an-ai-evaluation-actually-measures/#wat-u-een-leverancier-vraagt)
6.  [Hoe wij dit toepassen](https://www.strataigize.com/nl/insights/what-an-ai-evaluation-actually-measures/#hoe-wij-dit-toepassen)
7.  [Bronnen](https://www.strataigize.com/nl/insights/what-an-ai-evaluation-actually-measures/#bronnen)

[Voeg ons toe als voorkeursbron op Google](https://www.google.com/preferences/source?q=strataigize.com)

Een gratis Google-instelling om meer van onze relevante artikelen in uw zoekervaring te zien. U kunt dit altijd wijzigen.

Elke presentatie van een AI-leverancier bevat een grafiek waarin hun balk hoger is dan de andere. De grafiek klopt meestal. Hij is meestal ook irrelevant voor de vraag die de koper eigenlijk stelt: of het ding werkt op zijn eigen documenten, zijn eigen tickets, zijn eigen afbeeldingen.

Die kloof is geen oneerlijkheid van marketing. Het is een meetprobleem, en het is zorgvuldig genoeg gedocumenteerd dat u het zelf kunt controleren.

## Een benchmark is een instrument, en instrumenten moeten gevalideerd worden

In de wetenschappen die dingen meten die u niet direct kunt zien, moet een meetinstrument vertrouwen verdienen voordat de uitkomsten iets betekenen. De gemeten eigenschap moet gedefinieerd zijn. Er moet aangetoond worden dat de test die eigenschap meet en niet iets wat ermee samenhangt. Het resultaat moet vergezeld gaan van een schatting van hoeveel ervan ruis is. De psychometrie noemt dat constructvaliditeit, en het is gangbare praktijk.

Benchmarks voor taalmodellen zijn precies zulke instrumenten. “Redeneren” en “behulpzaamheid” zijn niet direct waarneembaar, dus een benchmark staat ervoor in de plaats. Of die plaatsvervanger werkt, is een beantwoordbare vraag, en in 2025 beantwoordde een team van 29 reviewers die voor [445 benchmarks uit toonaangevende conferenties over taalverwerking en machine learning](https://arxiv.org/abs/2511.04703), in werk dat verscheen in de Datasets and Benchmarks-track van NeurIPS 2025.

De cijfers verdienen het om langzaam gelezen te worden:

-   **16,0%** voerde überhaupt statistische toetsen of onzekerheidsschattingen uit. De andere 84% rapporteert een getal zonder enige aanwijzing hoeveel het zou verschuiven bij een nieuwe run.
-   **47,8%** van de benchmarks die hun doel überhaupt definieerden, mat een omstreden fenomeen, iets waarover het vakgebied het niet eens is over de definitie.
-   **81,3%** beoordeelde met exacte tekstovereenkomst, en 40,7% gebruikte niets anders. Een juist antwoord dat anders geformuleerd is, telt als fout.
-   **42,6%** hergebruikte items uit bestaande benchmarks, en zo verspreidt een fout in één test zich naar de tests die hem juist moesten controleren.

![Staafdiagram van 445 benchmarks voor taalmodellen: 16 procent voerde een statistische toets uit, 47,8 procent mat een omstreden doel, 81,3 procent beoordeelde met exacte tekstovereenkomst, 42,6 procent hergebruikte items](https://www.strataigize.com/blog/real/what-an-ai-evaluation-actually-measures-chart-1.svg)

_De meeste van de 445 benchmarks hebben het instrument nooit gevalideerd. Bron: [NeurIPS 2025, Measuring what Matters](https://arxiv.org/abs/2511.04703)._

Dit betekent niet dat de benchmarks waardeloos zijn. Het betekent dat een benchmarkscore een zwakkere bewering is dan hij lijkt, en dat de sterkte van die bewering er zelden bij staat.

## Het besmettingsprobleem maakt het getal nog zachter

Een benchmark werkt alleen als het model de antwoorden nog niet heeft gezien. Moderne trainingscorpora zijn groot genoeg, en breed genoeg bijeengeschraapt, dat dit moeilijk te garanderen en makkelijk fout te doen is.

Onderzoekers van de Shanghai Jiao Tong University [testten 31 modellen op aanwijzingen voor benchmarklekken](https://arxiv.org/html/2404.18824v1) bij GSM8K en MATH, twee datasets voor wiskundig redeneren, met perplexiteit en de nauwkeurigheid van n-gramvoorspelling om memorisatie op te sporen. Ongeveer de helft vertoonde tekenen van training op benchmarkdata. In het duidelijkste geval reproduceerde Qwen-1.8B elke reeks van vijf woorden in 223 voorbeelden uit de trainingsset van GSM8K, 67 uit de trainingsset van MATH en 25 uit de **test**set van MATH, het deel waarvan het hele doel is dat het ongezien blijft.

Een model dat een deel van een test uit het hoofd heeft geleerd, scoort daar goed op en zegt u niets over de prestaties op iets anders. Van buitenaf ziet dat er precies zo uit als een model dat gewoon goed is.

## Hoe dit er in onderzoek uitzag

Mijn promotieonderzoek ging erover om voorgetrainde modellen visuele taken te laten uitvoeren waarvoor ze nooit waren getraind, zonder gelabelde voorbeelden: eerst [semantische correspondenties vinden met een diffusiemodel](https://proceedings.neurips.cc/paper_files/paper/2023/hash/1a074a28c3a6f2056562d00649ae6416-Abstract-Conference.html) op NeurIPS 2023, daarna [keypoints uit dezelfde klasse modellen](https://openaccess.thecvf.com/content/CVPR2024/html/Hedlin_Unsupervised_Keypoints_from_Pretrained_Diffusion_Models_CVPR_2024_paper.html) op de conferentie Computer Vision and Pattern Recognition in 2024. Beide werden gemeten tegen standaard gelabelde benchmarks, omdat het vakgebied methoden zo vergelijkt.

Die cijfers waren echt en de vergelijkingen waren eerlijk. Ze konden ook niet de vraag beantwoorden die een bedrijf zou stellen: of de methode werkt op zijn afbeeldingen, in zijn resolutie, met zijn belichting, volgens zijn definitie van een juist antwoord. Benchmarkprestaties en prestaties in gebruik zijn verschillende metingen. Wie ooit een model van een paper naar een product heeft gebracht, heeft die kloof gezien.

## De evaluatie die u zelf bouwt, is de enige die op uw beslissing is afgestemd

De oplossing is weinig glamoureus en werkt. Voordat u zich vastlegt op een AI-systeem, verzamelt u een set echte gevallen uit uw eigen bedrijfsvoering en labelt u de juiste uitkomst met de hand. Het is de nuttigste halve dag die iemand aan een AI-project besteedt.

**Trek een steekproef uit de werkelijkheid, niet uit de makkelijke gevallen.** Neem echte leads, echte tickets, echte facturen, echte foto’s, ook de misvormde. Een set die alleen uit schone voorbeelden bestaat, meet een systeem dat u niet hebt.

**Mik om te beginnen op 100 tot 300 gelabelde items.** Genoeg om een systeem dat meestal gelijk heeft te onderscheiden van een systeem dat maar net iets vaker gelijk heeft dan toeval, en weinig genoeg dat één persoon het echt in een middag kan doen.

**Schrijf op wat juist betekent voordat u naar enige output kijkt.** Twee mensen in hetzelfde team zijn het vaak oneens over de vraag of een lead gekwalificeerd was of een document goed was gearchiveerd. Die onenigheid op papier oplossen is de moeite waard, of u nu iets koopt of niet, en het achteraf doen betekent dat de definitie meebuigt met het resultaat.

**Label dubbelzinnige gevallen als dubbelzinnig.** Wie een ja-neeantwoord oplegt aan een geval dat uw eigen team zou escaleren, bouwt een test die juist gedrag bestraft.

**Houd een deel achter.** Bewaar een deel dat niemand ziet die het systeem bouwt of afstelt, ook uw leverancier niet. Dat achtergehouden deel is het enige waarvan u de score voor waar kunt aannemen.

**Leg vast hoe vaak uw eigen labelaars het oneens zijn.** Als twee van uw mensen het in 85% van de gevallen eens zijn, presteert een systeem met 85% op uw taak op menselijk niveau, en meet een leverancier die 99% belooft ofwel iets anders, ofwel heeft hij uw antwoorden gezien.

## Wat u een leverancier vraagt

De nuttige vragen gaan over de methode, niet over de score.

Vraag waarop het gerapporteerde getal is gemeten en of het systeem op diezelfde data is afgesteld. Vraag naar de prestaties op de gevallen die het fout doet, want foutanalyse ontbrak grotendeels in de 445 onderzochte benchmarks en daar zit meestal het operationele risico. Vraag wat het getal zou zijn op een set die de leverancier nooit heeft gezien, en lever er dan een aan. Vraag om een betrouwbaarheidsinterval, of om het resultaat van de evaluatie wanneer die meer dan één keer wordt uitgevoerd.

Een leverancier die hierop kan antwoorden, doet het werk. Een leverancier die alleen met een plek op een ranglijst antwoordt, heeft u verteld waar hij staat in de test van iemand anders.

## Hoe wij dit toepassen

Elk systeem in onze [catalogus van AI-systemen](https://www.strataigize.com/nl/services/ai-systems/) volgt een vaste volgorde, en de tweede stap is dat een met de hand gelabelde set van de echte gevallen van de klant wordt afgesproken voordat iemand het over bespaarde uren heeft. Niets wordt opgeschaald op basis van een benchmarkscore. De [AI Opportunity Audit](https://www.strataigize.com/nl/offers/ai-opportunity-audit/) waarmee de meeste opdrachten beginnen, levert die gelabelde set op als resultaat, en die is van u, of we daarna iets bouwen of niet.

De evaluatie is ook wat een schriftelijke stopdrempel zinvol maakt. Vooraf afspreken om te stoppen bij een bepaald prestatieniveau is een lege belofte zonder een afgesproken manier om prestaties te meten.

## Bronnen

-   Measuring what Matters: Construct Validity in Large Language Model Benchmarks, Datasets and Benchmarks-track van NeurIPS 2025: [arxiv.org/abs/2511.04703](https://arxiv.org/abs/2511.04703)
-   Benchmarking Benchmark Leakage in Large Language Models, Xu, Wang, Fan en Liu: [arxiv.org/html/2404.18824v1](https://arxiv.org/html/2404.18824v1)

Auteur

**Eric Hedlin**

Volgende stap

Waar lekt uw groei? De Growth Diagnostic vergelijkt uw funnel in zes vragen.

[Diagnostic starten →](https://www.strataigize.com/tools/growth-diagnostic/)

Praat met ons

### Spreek met het team dat het zou runnen

Vertel ons waar we moeten kijken en we antwoorden binnen 24 uur met het startpunt. Geen pitch tot u de waarde ziet.

[Voeg ons toe als voorkeursbron op Google](https://www.google.com/preferences/source?q=strataigize.com)

Een gratis Google-instelling om meer van onze relevante artikelen in uw zoekervaring te zien. U kunt dit altijd wijzigen.

## Gerelateerde lectuur

[Alle AI en automatisering-artikelen →](https://www.strataigize.com/nl/insights/topics/ai-automation/)

[Moet je bedrijf aanroepbaar zijn voor AI-agents?De AI-assistent van een klant kan een record wijzigen als je hem die taak laat starten. Schrijf deze week de verbodslijst, voordat iemand iets koppelt.](https://www.strataigize.com/nl/insights/should-your-business-be-agent-callable/)[Wanneer een kleiner AI-model volstaatHet meeste agentwerk is één smalle taak die terugkeert. Daar verslaat een klein, bijgetraind model vaak een frontiermodel, voor een fractie van de prijs.](https://www.strataigize.com/nl/insights/when-a-smaller-ai-model-will-do/)[Agent-led growth: gekozen worden vóór het eerste gesprekJe koper vroeg een AI-assistent al wie hij moet inhuren. Zet deze week prijs, wat je niet doet en één agenda op de site, of je mist de shortlist.](https://www.strataigize.com/nl/insights/agent-led-growth/)

## Wilt u dat wij dit voor u doen?

Boek een gratis consult van 30 minuten. Geen pitch tot u de waarde ziet.

[Groeiconsult boeken →](https://www.strataigize.com/nl/audit/) [Beoordeling **5,0** op Clutch](https://clutch.co/profile/strataigize-marketing)
