Home / Vault & Second Brain / Het model was nooit de bottleneck

Het model was nooit de bottleneck

Het model was nooit de bottleneck

Het model was nooit de bottleneck

Maandenlang ging ik ervan uit dat het plafond van mijn AI-agents het model was. Beter model erin, betere resultaten eruit — dat was de hele theorie. Tot ik deze week een benchmark las die me dwong om mijn hele thuissetup opnieuw te bekijken.

Iemand op r/PiCodingAgent draaide exact hetzelfde model — DeepSeek V4 Flash, precies het model dat ik in mijn eigen Hermes-setup gebruik — door twee verschillende harnesses. De ene was minimaal: slechts vier tools, lezen, schrijven, bewerken en een shell. De andere was een fork met eenendertig tools, een language server, een debugger, een browser, alles erop en eraan. Dezelfde dertig taken, dezelfde verifier, dezelfde tijdslimiet.

De minimale harness won. Twintig van de dertig taken geslaagd, tegen zeventien voor de tool-zware fork. Hij was sneller, goedkoper en verbruikte minder tokens. Meer tooling won niet. Dat ene resultaat kwam harder binnen dan welke modelrelease ik dit jaar ook heb gevolgd.


Wat ik wél in de hand heb

Ik draai zelf een flinke stapel MCP-servers op mijn agent — domotica, zoeken, e-mail, een hele gereedschapskist. Toen ik die benchmark las, moest ik mezelf een botte vraag stellen: hoeveel van dat oppervlak is dode last? De les is niet “tools zijn slecht.” Het is dat de harness — hoe context wordt opgebouwd, hoe tools worden gerouteerd, hoe de agent herstelt van een verkeerde afslag — meer van het werk doet dan ik hem toeschreef.

Er circuleert op dit moment een formule in de agent-engineeringwereld: waargenomen kwaliteit is model maal harness maal context. Dezelfde gewichten, andere system prompt, andere beperkingen — ander resultaat. Ik heb het zelf gezien. Hetzelfde model dat afdwaalt en dingen “verbetert” waar ik nooit om vroeg, blijft perfect op koers met een strakkere harness eromheen.

Dus de vraag waar ik deze week mee zit is simpel: als de harness het duurzame bezit is en het model vervangbaar, welke delen van mijn eigen stack bouw ik dan eigenlijk om te blijven?

Wat is jouw ervaring — heb jij ooit betere resultaten gekregen door tools weg te halen in plaats van toe te voegen? Ik hoor het graag.

Wat vond je van dit bericht?

Laat een reactie achter

Je e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *