剣 KENSAI
← Terug naar blog
Research 6 min read7 april 2026

AI-red teaming voor interne agents: tool poisoning testen voordat aanvallers dat doen

Veel teams red-teamen nog steeds alleen prompts en negeren de tools achter de agent. Dat is precies omgekeerd. Interne agents breken eerder op vergiftigde tool-output, misleidende context en overmachtige credentials dan op spectaculaire jailbreaks.

Begin bij vertrouwensgrenzen, niet bij de demo

De mooiste demo verbergt vaak de lelijkste aannames. Welke tools mogen schrijven. Welke tools kunnen bij secrets. Welke tools veroorzaken side effects buiten de sandbox. Die kaart is belangrijker dan alweer een lijst jailbreakprompts.

Als het model een tool kan aanroepen die door een ander systeem al wordt vertrouwd, heb je een transitief vertrouwensprobleem. Red teaming moet die vertrouwensketen volgen, niet alleen het chatvenster.

Tool poisoning is vooral een contextaanval

Een vergiftigde tool heeft geen shell-toegang nodig om gevaarlijk te zijn. Hij kan misleidende samenvattingen teruggeven, waarschuwingen verstoppen in lange output of riskante acties framen als onschuldige onderhoudstaken. Het model leest dat als context en gaat daarna zelfverzekerd de fout in.

Test of de agent tegenstrijdigheden ziet, bevestiging vraagt voor destructieve stappen en veilig afremt wanneer tool-output verdacht, misvormd of opvallend overtuigend is.

Ontwerp tests die op normaal werk lijken

Val niet alleen aan met overduidelijk kwaadaardige strings. Gebruik realistische tickets, verouderde documentatie, verkeerde runbooks en subtiel gevaarlijke toolreacties. Interne agents trappen eerder in routineus ogende slechte input dan in tekenfilmachtige prompts.

Een goede suite dekt stille data-exfiltratie, approval-bypass, geheugenvervuiling en rolverwarring tussen menselijke instructies en toolinstructies.

Winnen betekent netjes weigeren

Je probeert niet te bewijzen dat het model onbevreesd is. Je wilt bewijs dat het vertraagt, vraagt, schade beperkt en weigert autoriteit te stapelen die het nooit had mogen krijgen.

De beste interne agent is niet degene die altijd handelt. Het is degene die weet wanneer hij moet stoppen met behulpzaam zijn.

KENSAI take: Prompt injection is maar één stuk van het risico. De smerigste fouten ontstaan wanneer vertrouwde tools slechte richting geven aan een model dat te graag gehoorzaamt.

Test interne agents vóór productie creatief wordt.

KENSAI helpt teams agentworkflows, gevaarlijke toolketens en verborgen vertrouwensgrenzen te controleren voordat gemak verandert in blootstelling.

Start Your Free Scan →