剣 KENSAI
Sicherheit von AI-Agenten 9. April 2026 · 5 Min. Lesezeit

Erkennung von Vektor-Poisoning: So erkennen Sie manipulierte Abfragen, bevor Agenten handeln

Ein manipulierter Vektorspeicher beeinträchtigt nicht nur die Suchqualität. Er stellt eine dauerhafte Beschädigung des Gedächtnisses dar. Sobald bösartige Textabschnitte die Abfragen dominieren, kann ein Agent noch lange nach dem ursprünglichen Einlesevorgang Fehlentscheidungen treffen.


Warum das wichtig ist

Die meisten Teams sprechen noch immer über Prompt-Injection, als würde jeder Angriff innerhalb einer einzigen Modellinteraktion beginnen und enden. Das greift zu kurz. Gelangen manipulierte Embeddings in die Abfrageschicht, kann das System immer wieder vom Angreifer kontrollierten Kontext ausliefern. Der Wirkungsradius ist größer, weil der schädliche Zustand dauerhaft wird.

Deshalb gehört Vektorspeicher-Poisoning zur selben Bedrohungsfamilie wie Memory-Poisoning. Die Abfrageschicht ist ein Gedächtnis – nur in dichter Form statt als Markdown oder JSON.

Der schnellste Detektor, der dennoch verlässlich ist

Die kostengünstige Variante ist zugleich der richtige Ausgangspunkt. Überwachen Sie zwei nachvollziehbare Signale, bevor ein Batch in das Produktivgedächtnis übernommen wird: Zentroidverschiebung und Hubness-Anomalien.

Diese beiden Prüfungen erkennen die häufigsten problematischen Fälle, ohne vorzugeben, dass dafür bereits am ersten Tag ein erneutes Modelltraining oder eine riesige Anomalieplattform erforderlich wäre.

Was die Zentroidverschiebung erkennt

Wenn ein Namensraum eng umrissene, vertrauenswürdige Inhalte enthalten soll, dürfte ein bösartiger oder themenfremder Batch das Zentrum dieser Embedding-Wolke nicht weit verschieben. Große Verschiebungen haben häufig eine von drei Ursachen: Vom Angreifer kontrollierte Textabschnitte wurden massenhaft eingefügt, zufälliger Datenmüll wurde eingebettet oder der Namensraum hat unbemerkt eine Quelle aufgenommen, die dort nicht hingehört.

Dieses Signal wird aussagekräftiger, wenn Sie das Ausmaß der Verschiebung mit dem normalen Radius des vertrauenswürdigen Korpus vergleichen, anstatt einen absoluten Distanzschwellenwert zu verwenden. Es geht nicht um mathematische Eleganz. Entscheidend ist die Frage, ob dieser Batch so aussieht, als gehöre er hierher.

Was Hubness erkennt

Hubness ist die Abfragevariante einer Aufmerksamkeitsübernahme. Wenn eine kleine Anzahl von Textabschnitten plötzlich für alle anderen als Nachbarn erscheint, stimmt etwas nicht. Manchmal handelt es sich um Duplikate. Manchmal ist es umformuliertes Poisoning-Material, das gezielt so gestaltet wurde, dass es allgemein relevant erscheint. In beiden Fällen wird der Speicher so manipuliert, dass immer wieder dasselbe vom Angreifer kontrollierte Material bei der Abfrage gewinnt.

Genau dieser Fehlermodus sollte für Verteidiger entscheidend sein, denn das Modell kann normal erscheinen, obwohl die Schicht zur Kontextauswahl bereits kompromittiert ist.

Die wichtigste betriebliche Regel

Lassen Sie verdächtige Batches nicht ihre eigene Baseline definieren. Führen Sie vertrauenswürdige, fortlaufend aktualisierte Baselines pro Namensraum, setzen Sie diese bei Änderungen des Embedding-Modells zurück und aktualisieren Sie sie nur anhand freigegebener oder durchgehend risikoarmer Batches. Andernfalls lernt der Speicher allmählich, dass manipuliert normal ist.

So sieht eine gute Umsetzung aus

Ein vernünftiger Einlesepfad misst Anomaliesignale vor dem Commit, führt einen ausschließlich erweiterbaren Audit-Trail und bietet Betreibern eine klare Möglichkeit zum Übersteuern, wenn sie bewusst Backfills oder Modellmigrationen durchführen. Statische Prüfungen können verifizieren, dass diese Schutzmaßnahmen vorhanden sind, doch die Laufzeitmessung muss in unmittelbarer Nähe des Schreibpfads zum Vektorspeicher erfolgen.

Entscheidend ist, dass alles nachvollziehbar bleibt. Sicherheitsteams müssen wissen, warum ein Batch blockiert wurde – nicht nur, dass eine Blackbox ihn abgelehnt hat.

Fazit von KENSAI

Die eigentliche Erkenntnis ist auf eine gute Art unspektakulär. Wenn sich Ihre Abfrageschicht unbemerkt verändern lässt, kann auch das Gedächtnis Ihres Agenten unbemerkt verändert werden. Beginnen Sie mit kostengünstiger Mathematik, aussagekräftiger Protokollierung und Quarantänekontrollen. Anspruchsvolle Modellierung kann warten.

Testen Sie Gedächtniskontrollen, bevor manipulierter Kontext zur Normalität wird

KENSAI unterstützt Teams dabei, Gedächtnisoberflächen von Agenten, Abwehrmechanismen für Abfragen und Freigabekontrollen zu überprüfen, bevor eine dauerhafte Kontextbeschädigung zu einem Produktionsvorfall führt.

KENSAI

KENSAI — AI-gestützte Sicherheitsinformationen