Home / Vault & Second Brain / “Dit model maakt veel fouten.” Dus ging ik het meten.

“Dit model maakt veel fouten.” Dus ging ik het meten.

Een benchmark die AI-modelnauwkeurigheid meet

“Dit model maakt veel fouten.” Dus ging ik het meten.

Vorige week betrapte ik mezelf op iets wat ik niet kon bewijzen: “Ik blijf zien dat dit model fouten maakt.” Het was een gevoel, geen feit. En ik ben het afgelopen jaar vaak genoeg gebrand door gevoelens-die-voor-metingen-kwamen om precies te weten waar die weg eindigt. Dus stopte ik met klagen en bouwde ik een benchmark.

De opzet was simpel. Vierentwintig concrete taken — een sensor toevoegen aan Home Assistant, een specifieke WordPress-post vinden, een doelwaarde instellen. Elke taak draaide drie keer, over drie verschillende modellen, met een deterministische verifier die het resultaat controleerde. Geen LLM die een andere LLM beoordeelt, geen onderbuik. Gewoon: klopte de uitkomst met de verwachte toestand, ja of nee.

Tweehonderdzestien runnen later was het oordeel ongemakkelijk. Het model waarover ik klaagde — het model dat elke dag mijn eigen agents draait — scoorde het beste van de drie. Het maakte precies nul echte fouten op zijn tweeënzeventig runs. Het duurdere “pro”-model waar ik bijna naar overstapte scoorde slechter, en kostte meer.


De fout zat in mijn meetlint

Dus als het model niet fout zat, wat dan wel? Mijn instrumenten. Toen alle drie de modellen een taak faalden met een identieke foutmelding, had ik het meteen moeten weten: de benchmark was stuk, niet de modellen. En dat was zo. De verifier eiste dat een nieuwe sensor op een specifieke index in een lijst verscheen, terwijl de taak alleen maar zei “voeg een sensor toe.” Modellen die hem onderaan toevoegden werden afgekeurd — modellen die hem in het midden invoegden ook. Beide waren correct.

Er zat zelfs een “reddingsroute” in de code, geschreven om volgorde-onafhankelijk te zijn, die precies dit moest opvangen. Die had nog nooit één keer gevuurd — omdat hij onbereikbaar was. Een ongetest vangnet, besefte ik, is erger dan helemaal geen net. Het laat een kapotte check opzettelijk lijken.

Het echte foutpercentage, na het repareren van mijn verifier, was 1,4% over alle 216 runs — en het model dat ik in productie draai, zat bij geen van die drie. De les gaat niet eens over AI. Het is dezelfde die ik blijf herleren over mijn eigen domotica, mijn eigen backups, mijn eigen monitoring: een plausibel ogend getal dat niet echt gemeten is, is het gevaarlijkste soort bug.


Gevoelens zijn goedkoop. Getallen niet.

Als je AI — of je dashboard, of je onderbuik — je vertelt dat er iets stuk is, is de reflex om het ding te vervangen. Maar de helft van de tijd is het ding prima, en is het je meetlint dat tegen je liegt. De volgende keer dat je wilt zeggen “dit model maakt te veel fouten,” vraag jezelf dan af: heb ik het eigenlijk wel geteld? Of ben ik gewoon moe van het kijken hoe het de lange weg om neemt?

Ik hoor het graag — heb jij ooit een tool de schuld gegeven, om erachter te komen dat de fout zat in hoe je hem meette? Laat hieronder een reactie achter.

Wat vond je van dit bericht?

Laat een reactie achter

Je e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *