
Een skill die zichzelf verbetert zonder meting is gewoon een onderbuikgevoel
Vorige week las ik een zin die me stil deed staan: “Een skill die zichzelf verbetert zonder eval is niets meer dan een onderbuikgevoel.” Die raakte me, want mijn AI-agents verbeteren zichzelf al maanden — ze patchen hun eigen skills na elke taak — en ik had geen idee of dat ook echt beter werd. Ik vloog op gevoel.
Dus besloot ik te gaan meten. Geen volledige eval-suite — dat is overkill. Gewoon een lichtgewicht dagelijkse score-log op de paar dingen die er echt toe doen. Voor mijn nieuws-crons betekende dat vier cijfers bijhouden: hoeveel unieke bronnen elke top 10 gebruikte, hoe vaak een bron faalde, hoe relevant de artikelen waren, en hoe vers. Simpel, automatisch, één regel per dag.
De meting ving op dag één een echt probleem
Dat is het punt met onderbuikgevoelens: die vangen geen regressies. De allereerste dag dat de eval draaide, vlagde hij dat mijn AI-nieuws-cron maar drie unieke bronnen had geselecteerd voor de top 10 — terwijl de hele bedoeling van de overstap naar een RSS-aggregator was om er acht tot elf te krijgen. Ik had die top 10 elke ochtend gelezen en nooit de drift opgemerkt. De eval zag het in één run.
Dat ene cijfer veranderde hoe ik werk. Ik voegde een diversiteitsregel toe aan de cron-prompt (minstens zes unieke bronnen, maximaal twee per bron), fixte een veldnaam-drift in het eval-script, en nu vertelt de score-log me elke dag of de aggregator-route echt beter is dan de oude zoek-fallback. Over een paar weken kan ik zeggen “de aggregator is drie keer beter” in plaats van “het voelt beter.”
De les waar ik steeds op terugkom
Als je agents bouwt die zichzelf verbeteren, heb je een manier nodig om te weten of die verbetering echt is. Anders poets je gewoon een gok op. Het hoeft niet ingewikkeld — een simpele score-log op de twee of drie dingen die ertoe doen is genoeg. Het gaat niet om de tooling. Het gaat erom dat “gemeld als klaar” en “daadwerkelijk geverifieerd” twee verschillende dingen zijn, en dat er maar één telt.
En jij — meet jij of je AI-setup echt beter wordt, of draai je ook op onderbuikgevoel? Ik hoor graag hoe jij het bijhoudt.
Wat vond je van dit bericht?