Erkennung von Vektorvergiftungen: So erkennen Sie Abrufkorruption, bevor Agenten eingreifen
Ein vergifteter Vektorshop ist nicht nur eine schlechte Suchqualität. Es handelt sich um eine anhaltende Speicherbeschädigung. Sobald bösartige Chunks den Abruf dominieren, kann ein Agent beginnen, schlechte Entscheidungen zu treffen, lange nachdem das ursprüngliche Aufnahmeereignis vergessen wurde.
Warum das wichtig ist
Die meisten Teams sprechen immer noch von der sofortigen Injektion, als ob jeder Angriff innerhalb einer Modellinteraktion beginnt und endet. Das ist zu eng. Wenn fehlerhafte Einbettungen in die Abrufschicht gelangen, kann das System den vom Angreifer kontrollierten Kontext immer wieder bereitstellen. Der Explosionsradius ist größer, da der schlechte Zustand dauerhaft wird.
Aus diesem Grund gehört Vector-Store-Poisoning zur gleichen Bedrohungsfamilie wie Memory-Poisoning. Die Abrufschicht ist Speicher, nur in dichter Form anstelle von Markdown oder JSON.
Der schnellste Detektor, der immer noch ehrlich ist
Auch die günstige Variante ist der richtige Einstieg. Beobachten Sie zwei erklärbare Signale, bevor eine Charge in den Produktionsspeicher befördert wird: Schwerpunktdrift und Hubness-Anomalien.
- Schwerpunktdrift: Hat sich der neue Einbettungsbatch mehr als normal vom vertrauenswürdigen Korpus entfernt?
- Hubness: Wurden kleine Blöcke plötzlich zu universellen nächsten Nachbarn und begannen, die Suche zu dominieren?
Diese beiden Überprüfungen decken die häufigsten hässlichen Fälle auf, ohne am ersten Tag vorzutäuschen, dass Sie eine Modellumschulung oder eine riesige Anomalieplattform benötigen.
Was fängt die Schwerpunktdrift ein?
Wenn ein Namespace eng begrenztes, vertrauenswürdiges Material enthalten soll, sollte ein bösartiger oder themenfremder Stapel das Zentrum dieser einbettenden Cloud nicht sehr weit verschieben. Große Verschiebungen bedeuten oft eines von drei Dingen: Vom Angreifer kontrollierte Blöcke wurden in großen Mengen eingefügt, zufälliger Müll wurde eingebettet oder der Namespace hat stillschweigend eine Quelle absorbiert, die nicht dorthin gehört.
Dieses Signal wird stärker, wenn Sie die Verschiebungsgröße mit dem normalen Radius des vertrauenswürdigen Korpus vergleichen, anstatt einen Rohentfernungsschwellenwert zu verwenden. Es geht nicht um mathematische Eleganz. Es geht um die Frage, ob diese Charge so aussieht, als ob sie in den Raum gehört.
Was Hubness fängt
Hubness ist die Retrieval-Version einer Aufmerksamkeitsentführung. Wenn plötzlich eine kleine Anzahl von Chunks als Nachbarn für alles andere auftauchen, stimmt etwas nicht. Manchmal handelt es sich um Duplikate. Manchmal handelt es sich um umschriebenes Gift, das so gestaltet ist, dass es allgemein relevant aussieht. In jedem Fall bedeutet dies, dass der Speicher gekippt wird, sodass weiterhin dasselbe von Angreifern kontrollierte Material den Abruf gewinnt.
Das ist genau der Fehlermodus, auf den sich Verteidiger konzentrieren sollten, da das Modell möglicherweise normal erscheint, obwohl die Kontextauswahlebene bereits kompromittiert ist.
Die Betriebsregel, die am wichtigsten ist
Lassen Sie nicht zu, dass verdächtige Chargen ihre eigene Baseline definieren. Behalten Sie vertrauenswürdige fortlaufende Baselines pro Namespace bei, setzen Sie sie bei Änderungen des Einbettungsmodells zurück und aktualisieren Sie sie nur aus genehmigten oder durchweg risikoarmen Batches. Ansonsten lernt der Laden langsam, dass Vergiftung normal ist.
- Protokollieren Sie Batch-ID, Namespace, Quellmix, Einbettungsmodell, Driftmetriken, Hubness-Metriken und endgültige Entscheidung.
- Unterstützt nur drei Ergebnisse:
allow,quarantineoderblock. - Warnung, wenn ein Namespace wiederholte Warnbatches oder einen eindeutig fehlerhaften Batch sieht.
Wie gut aussieht
Ein vernünftiger Aufnahmepfad misst Anomaliesignale vor dem Commit, behält den Audit-Trail nur beim Anhängen bei und bietet Bedienern einen sauberen Überschreibungspfad, wenn sie absichtlich Backfills oder Modellmigrationen durchführen. Statische Prüfungen können das Vorhandensein dieser Abwehrmaßnahmen überprüfen, die Laufzeitmessung muss jedoch in der Nähe des Vektorschreibpfads erfolgen.
Das Wichtigste ist, erklärbar zu bleiben. Sicherheitsteams müssen wissen, warum eine Charge blockiert wurde, und nicht nur, dass eine Black Box sie nicht mochte.
KENSAI-Imbiss
Der eigentliche Unterricht ist im positiven Sinne langweilig. Wenn Ihre Abrufschicht stillschweigend geändert werden kann, kann auch Ihr Agentenspeicher stillschweigend geändert werden. Beginnen Sie mit billiger Mathematik, starker Protokollierung und Quarantänekontrollen. Ausgefallenes Modeln kann warten.
Testen Sie die Speichersteuerung, bevor der vergiftete Kontext normal wird
KENSAI unterstützt Teams dabei, Agentenspeicheroberflächen, Abrufabwehrmaßnahmen und Genehmigungskontrollen zu überprüfen, bevor anhaltende Kontextbeschädigungen zu einem Produktionsvorfall werden.
KENSAIKENSAI – KI-gestützte Sicherheitsintelligenz