
Ik mat het toolgebruik van mijn AI. 90% van het werk ging de moeilijke weg.
Vorige week deed ik eindelijk een meting die ik maanden had uitgesteld. Ik heb een vloot geplande agents die dingen doen als nieuws scannen, geheugen consolideren en clippings verwerken. Ik nam aan dat ze efficiënt werkten. Toen ging ik tellen hoe ze dat eigenlijk deden — en het getal dat terugkwam deed me stoppen.
Bij vier van mijn meest terminal-gedreven cron-jobs was tussen de 78% en 95% van elke actie een ruwe shell-opdracht. Geen dedicated tool. Geen gestructureerde aanroep. Gewoon cat, grep, sed, ls — dezelfde commando’s die ik zelf in een terminal zou typen. Mijn agents deden hun werk op de moeilijke manier, één fragiele shell-pipe tegelijk.
De saaie fix die wél werkte
Ik herschreef niets ingenieus. Ik voegde geen nieuw model of slimmere prompt toe. Ik zette gewoon één regel in mijn cron-prompts: gebruik de dedicated tools — read_file, search_files, patch, write_file — in plaats van ruwe shell voor bestandsbewerkingen. Daarna draaide ik dezelfde meting een week later opnieuw.
De terminal-dominantie zakte van ruwweg 90% naar tussen de 62% en 67% bij drie van de vier jobs. Eén job ging van 95% naar 67%. Dat is een verschuiving van 28 procentpunt door één zin in een prompt. Geen nieuwe architectuur. Geen nieuw model. Gewoon de agent vertellen de tool te gebruiken die voor de klus is ontworpen, in plaats van degene die toevallig het makkelijkst te bereiken is.
Wat ik leerde
Drie dingen bleven hangen. Ten eerste: je kunt niet fixen wat je niet meet. Maandenlang nam ik aan dat mijn agents efficiënt waren. Zodra ik ging tellen, werd het probleem zichtbaar en oplosbaar. Ten tweede: de fix was gênant goedkoop. Een regel in een prompt, geen herschrijving. Ten derde: één job bewoog niet. Die bleef op 75% terminal-gebruik — en dat vertelde me ook iets. Sommige van die aanroepen zijn terecht shell-only (git, python3, date). Maar sommige zijn waarschijnlijk prompt-drift: de regel wordt niet consequent toegepast. Dat is mijn volgende meting.
Als jij agents draait — gepland of interactief — wed ik dat hetzelfde bij jou gebeurt. Wanneer heb jij voor het laatst geteld hoe je AI zijn werk écht doet? Niet hoe je denkt dat het gaat, maar wat de logs zeggen. Het antwoord zou je net zo kunnen verrassen als mij.
Wat vond je van dit bericht?