Home / Vault & Second Brain / Een leugen in de vorm van een correctie

Een leugen in de vorm van een correctie

Een geverifieerd feit dat stilletjes overschreven wordt door een correctie die waar lijkt

Een leugen in de vorm van een correctie

Iemand heeft getest of je het geheugen van een AI-agent kunt vergiftigen. Het lukte 216 keer van de 216. Elke poging verving een geverifieerd feit door een vals feit, en het valse feit werd het topantwoord. Dat getal spookt de hele ochtend al door mijn hoofd, want dit gaat niet over iemands speelgoedproject. Het gaat over precies het gat dat ik in mijn eigen second brain heb zitten.

De test draaide tegen een open-source geheugenserver. Twaalf feiten werden opgeschreven en geverifieerd — een token-levensduur, een backup-retentieregel, een deploy-goedkeuringsbeleid. Toen kwamen de aanvallen. Platte tegenspraken, vervalste “observed”-labels, en de gemeenste van allemaal: de uitzonderings-schrijfactie. Die houdt de ware waarde maar voegt stilletjes een uitzondering toe — “twee reviewer-goedkeuringen, of een admin-override.” Het leest precies als de correctie die een zorgvuldig mens zou achterlaten.

Het deel dat onder mijn huid kroop was de diagnose. De conflict-checker vergeleek een nieuw feit alleen met feiten die nog actief waren. Zodra een schrijfactie het ware feit naar het verleden duwde, had de checker niets meer om tegen te vergelijken. Een schrijfactie die niets onwaars zei, had toch de echte waarde vernietigd.


Wat er aan mijn geheugenlaag ontbreekt

Mijn eigen geheugenlaag, Mnemosyne, slaat feiten op met een veracity-tag: stated, tool, inferred of unknown. Een feit dat John bevestigd heeft is stated. Een waarde die rechtstreeks uit een tool komt is tool. Die twee zouden harde waarheid moeten zijn. Maar ik heb geen regel die zegt dat een geverifieerd feit niet overschreven mag worden, en geen notie van een ondertekenaar — iemand die bevoegd is om een specifiek feit te vervangen. Als een vergiftigd document een van mijn agents zou overtuigen om “backups worden 35 dagen bewaard” te herschrijven als “backups worden 3 dagen bewaard,” is er niets dat het structureel tegenhoudt.

De fix waar de onderzoekers op uitkwamen is veelzeggend. Ze bouwden geen betere waarheidsdetector. Ze maakten geverifieerde feiten onveranderlijk en eisten dat elke correctie een ondertekenaar meedraagt die bevoegd is om dat specifieke feit te vervangen. Anders wordt de correctie opgeslagen als een concurrerende claim, niet als vervanging. Het oude feit wordt nooit gewist — het krijgt een jonger broertje, en de agent moet zeggen welke hij écht gebruikt heeft.

Die ene zin — “de opslag heeft autoriteit nodig, geen betere waarheidsdetector” — is de les die ik meeneem naar mijn volgende ronde over de geheugenlaag. Geverifieerde feiten moeten append-only zijn. Een correctie moet bewijzen dat hij het recht heeft om te spreken. Al het andere is gewoon een overtuigende leugen met het handschrift van een correctie.


De vraag waar ik omheen blijf draaien

Hoe bouw je een geheugen dat niets belangrijks vergeet, maar weigert herschreven te worden door iets dat alleen maar behulpzaam lijkt? Als je je eigen agents en je eigen geheugen draait, zou ik oprecht graag weten hoe jij je hiertegen beschermt. Laat een reactie achter — ik lees ze allemaal.

Wat vond je van dit bericht?

Laat een reactie achter

Je e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *