Sécurité des agents IA 9 avril 2026 · 5 minutes de lecture

Détection d'empoisonnement vectoriel : comment détecter la corruption de récupération avant que les agents n'agissent

Un magasin de vecteurs empoisonnés n’est pas seulement une mauvaise qualité de recherche. Il s'agit d'une corruption persistante de la mémoire. Une fois que les morceaux malveillants dominent la récupération, un agent peut commencer à prendre de mauvaises décisions longtemps après que l’événement d’ingestion d’origine soit oublié.


Pourquoi c'est important

La plupart des équipes parlent encore d’injection rapide comme si chaque attaque commençait et se terminait au sein d’une seule interaction de modèle. C'est trop étroit. Si de mauvaises intégrations parviennent à la couche de récupération, le système peut continuer à servir encore et encore un contexte contrôlé par l'attaquant. Le rayon de souffle est plus large car le mauvais état devient durable.

C’est pourquoi l’empoisonnement par stockage vectoriel appartient à la même famille de menaces que l’empoisonnement de la mémoire. La couche de récupération est de la mémoire, uniquement sous forme dense au lieu de markdown ou JSON.

Le détecteur le plus rapide qui reste honnête

La version bon marché est également le bon point de départ. Observez deux signaux explicables avant qu'un lot ne soit promu dans la mémoire de production : dérive du centroïde et anomalies du hubness.

Ces deux contrôles détectent les cas laids courants sans prétendre que vous avez besoin d'un recyclage de modèle ou d'une plate-forme d'anomalie géante dès le premier jour.

Ce que la dérive du centroïde attrape

Si un espace de noms est censé contenir du matériel restreint et fiable, un lot malveillant ou hors sujet ne devrait pas déplacer très loin le centre de ce cloud d'intégration. Des changements importants signifient souvent l'une des trois choses suivantes : des morceaux contrôlés par l'attaquant ont été insérés en masse, des fichiers indésirables aléatoires ont été intégrés ou l'espace de noms a discrètement absorbé une source qui n'y appartenait pas.

Ce signal devient plus fort lorsque vous comparez la taille du décalage au rayon normal du corpus de confiance au lieu d'utiliser un seuil de distance brut. Il ne s’agit pas d’élégance mathématique. Le but est de se demander si ce lot semble appartenir à la pièce.

Ce que le hubness attrape

Hubness est la version de récupération d'un détournement d'attention. Si un petit nombre de fragments apparaissent soudainement comme voisins de tout le reste, quelque chose ne va pas. Parfois, c'est une duplication. Parfois, il s’agit d’un poison paraphrasé conçu pour paraître largement pertinent. Quoi qu’il en soit, cela signifie que le magasin est incliné de sorte que le même matériel contrôlé par l’attaquant continue de gagner en récupération.

C’est exactement ce dont les défenseurs du mode de défaillance devraient se soucier, car le modèle peut paraître normal alors que la couche de sélection du contexte est déjà compromise.

La règle opérationnelle qui compte le plus

Ne laissez pas les lots suspects définir leur propre référence. Conservez des lignes de base mobiles fiables par espace de noms, réinitialisez-les en cas de modifications du modèle d'intégration et mettez-les à jour uniquement à partir de lots approuvés ou à faible risque. Sinon, le magasin apprend peu à peu qu’un empoisonnement est normal.

À quoi ressemble le bien

Un chemin d'ingestion sain mesure les signaux d'anomalie avant la validation, conserve la piste d'audit en annexe uniquement et donne aux opérateurs un chemin de remplacement propre lorsqu'ils exécutent intentionnellement des remplissages ou des migrations de modèles. Les vérifications statiques peuvent vérifier que ces défenses existent, mais la mesure du temps d'exécution doit avoir lieu à proximité du chemin d'écriture vectorielle.

L’important est de rester explicable. Les équipes de sécurité doivent savoir pourquoi un lot a été bloqué, pas seulement parce qu'une boîte noire ne l'aimait pas.

KENSAI à emporter

La vraie leçon est ennuyeuse dans le bon sens du terme. Si votre couche de récupération peut être modifiée silencieusement, la mémoire de votre agent peut être modifiée silencieusement. Commencez par des calculs bon marché, une journalisation solide et des contrôles de quarantaine. Le mannequinat sophistiqué peut attendre.

Testez les contrôles de mémoire avant que le contexte empoisonné ne devienne normal

KENSAI aide les équipes à examiner les surfaces de mémoire des agents, les défenses de récupération et les contrôles d'approbation avant qu'une corruption persistante du contexte ne se transforme en incident de production.

KENSAI

KENSAI — Intelligence de sécurité basée sur l'IA