Detectie van vectorvergiftiging: hoe u retrieval-corruptie opvangt voordat agenten handelen
Kort samengevat: Een vergiftigde vector store is niet alleen slechte zoekkwaliteit. Het is blijvende geheugencorruptie. Zodra kwaadaardige chunks retrieval domineren, kan een agent slechte beslissingen blijven nemen lang nadat de oorspronkelijke ingest-gebeurtenis is vergeten.
Waarom dit belangrijk is
De meeste teams praten nog steeds over promptinjectie alsof elke aanval begint en eindigt binnen één modelinteractie. Dat is te beperkt. Als slechte embeddings de retrieval-laag bereiken, kan het systeem keer op keer door de aanvaller gecontroleerde context blijven leveren. De impact is groter omdat de slechte status blijvend wordt.
Daarom hoort vergiftiging van vector stores tot dezelfde dreigingsfamilie als geheugenvergiftiging. De retrieval-laag is geheugen, alleen in dichte vorm in plaats van markdown of JSON.
De snelste detector die nog steeds eerlijk is
De goedkope versie is ook het juiste startpunt. Let op twee verklaarbare signalen voordat een batch wordt gepromoveerd naar productiegeheugen: centroid drift en hubness-anomalieën.
- Centroid drift: is de nieuwe embeddingbatch meer dan normaal afgeweken van het vertrouwde corpus?
- Hubness: is een klein aantal chunks plotseling universele naaste buren geworden en begon het retrieval te domineren?
Die twee controles vangen de meest voorkomende lelijke gevallen op zonder te doen alsof u modelhertraining of een enorm anomalieplatform nodig heeft vanaf dag één.
Wat centroid drift opvangt
Als een namespace bedoeld is om beperkt, vertrouwd materiaal te bevatten, zou een kwaadaardige of niet-relevante batch het centrum van die embeddingwolk niet ver mogen verplaatsen. Grote verschuivingen betekenen vaak een van drie dingen: door de aanvaller gecontroleerde chunks werden in bulk ingevoegd, willekeurige rommel werd geëmbed, of de namespace nam stilletjes een bron op die daar niet thuishoort.
Dat signaal wordt sterker wanneer u de omvang van de verschuiving vergelijkt met de normale straal van het vertrouwde corpus in plaats van een ruwe afstandsdrempel te gebruiken. Het punt is niet wiskundige elegantie. Het punt is of deze batch eruitziet alsof hij in de kamer thuishoort.
Wat hubness opvangt
Hubness is de retrieval-versie van een attention-kaping. Als een klein aantal chunks plotseling als buren verschijnt voor al het andere, is er iets mis. Soms is het duplicatie. Soms is het geparafraseerd vergif dat ontworpen is om breed relevant te lijken. Hoe dan ook, het betekent dat de store wordt gekanteld zodat hetzelfde door de aanvaller gecontroleerde materiaal steeds wint bij retrieval.
Dat is precies het faalpatroon waar verdedigers zich zorgen over moeten maken, want het model kan er normaal uitzien terwijl de contextselectielaag al gecompromitteerd is.
De operationele regel die het meest telt
Laat verdachte batches hun eigen basislijn niet bepalen. Houd vertrouwde voortschrijdende basislijnen per namespace bij, reset ze bij wijzigingen van het embeddingmodel, en werk ze alleen bij vanuit goedgekeurde of consistent laag-risico batches. Anders leert de store langzaam dat vergiftigd normaal is.
- Log batch-id, namespace, bronmix, embeddingmodel, drift-metrics, hubness-metrics en de uiteindelijke beslissing.
- Ondersteun slechts drie uitkomsten:
allow,quarantine, ofblock. - Waarschuw wanneer een namespace herhaalde waarschuwingsbatches ziet of één duidelijk slechte batch.
Hoe goed eruitziet
Een verstandig ingest-pad meet anomaliesignalen vóór commit, houdt het audittrail append-only, en biedt operators een schoon overschrijvingspad wanneer ze opzettelijk backfills of modelmigraties uitvoeren. Statische controles kunnen verifiëren dat die verdedigingen bestaan, maar runtime-metingen moeten dicht bij het vector-schrijfpad gebeuren.
Het belangrijke deel is verklaarbaar blijven. Beveiligingsteams moeten weten waarom een batch geblokkeerd werd, niet alleen dat een black box hem afkeurde.
KENSAI-conclusie
De echte les is op een goede manier saai. Als uw retrieval-laag stilletjes veranderd kan worden, dan kan het geheugen van uw agent stilletjes veranderd worden. Begin met goedkope wiskunde, sterke logging en quarantainecontroles. Fancy modellering kan wachten.
KENSAI helpt teams agentgeheugenoppervlakken, retrieval-verdedigingen en goedkeuringscontroles te beoordelen voordat blijvende contextcorruptie uitgroeit tot een productie-incident.
KENSAIKENSAI — AI-gestuurde beveiligingsintelligentie