Sécurité de l’IA
Sécurité des agents
MCP
Recherche
6 avril 2026
·
9 min de lecture
Sécurité des agents IA en 2026 : empoisonnement d’outils, fuite de prompts et évasions de sandbox MCP
Analyse complète des principaux vecteurs d’attaque visant les agents IA en production : empoisonnement d’outils via des serveurs MCP, extraction de prompts par des canaux auxiliaires et techniques d’évasion de sandbox. Avec, en complément, un cadre défensif pour sécuriser vos déploiements d’agents.
L’explosion de la surface d’attaque des agents
En 2026, les agents IA se sont généralisés. Claude Code, Codex, Devin, OpenClaw et des dizaines d’autres fonctionnent désormais dans des environnements de production avec un accès réel à des outils : systèmes de fichiers, bases de données, API, navigateurs et infrastructures cloud. Cette puissance s’accompagne d’une immense surface d’attaque.
Au cours du dernier trimestre, nous avons recensé et testé les vulnérabilités les plus critiques qui touchent les déploiements d’agents IA. Voici nos conclusions.
Vecteur d’attaque nº 1 : empoisonnement d’outils via des serveurs MCP
🔴 RISQUE ÉLEVÉ — Exploitation active observée
Des serveurs MCP (Model Context Protocol) malveillants sont publiés dans des registres de paquets sous des noms qui semblent légitimes. Lorsque des agents s’y connectent, les descriptions des outils contiennent des injections de prompt dissimulées qui supplantent les instructions de l’agent.
Fonctionnement de l’attaque
- Appât : l’attaquant publie un serveur MCP portant un nom tel que
mcp-github-enhanced ou mcp-aws-tools-v2
- Hameçon : les descriptions des outils intègrent des instructions invisibles au moyen de caractères de contrôle Unicode ou d’une injection dans des commentaires Markdown
- Exécution : quand l’agent lit ces descriptions, les instructions injectées lui font exfiltrer des variables d’environnement, des clés d’API ou le contenu de fichiers
- Persistance : certaines variantes modifient la configuration de l’agent afin d’ajouter définitivement le serveur malveillant
Exemple concret
En mars 2026, un serveur MCP malveillant publié sous le nom mcp-jira-sync a été installé par plus de 340 développeurs. La description de l’outil list_issues contenait une instruction cachée qui amenait les agents à inclure le contenu de ~/.aws/credentials dans chaque appel d’API envoyé au serveur de commande et de contrôle de l’attaquant.
Vecteur d’attaque nº 2 : extraction de prompts par des canaux auxiliaires
La menace
Les prompts système, les instructions personnalisées et les configurations d’outils renferment une propriété intellectuelle précieuse ainsi que des informations critiques pour la sécurité. Les attaquants ont mis au point des techniques avancées pour les extraire :
- Injection d’images Markdown — création d’entrées qui poussent l’agent à afficher une balise d’image dont l’URL contient le prompt système encodé
- Fuite par les messages d’erreur — déclenchement de conditions d’erreur particulières qui reproduisent des fragments du prompt système dans les messages affichés
- Empreinte comportementale — envoi de prompts soigneusement conçus et analyse des schémas de réponse afin de reconstituer les instructions système
- Canaux de sortie des outils — exploitation d’outils qui écrivent dans des fichiers ou vers des URL pour exfiltrer le contenu des prompts par ces canaux
Vecteur d’attaque nº 3 : techniques d’évasion de sandbox
Évasion de conteneur
La plupart des sandbox d’agents s’exécutent dans des conteneurs. Nous avons identifié plusieurs voies d’évasion propres aux déploiements d’agents IA :
- Exploitation des volumes montés — les agents ayant accès au système de fichiers peuvent parcourir les volumes montés et atteindre des ressources de l’hôte
- Détournement de l’espace de noms réseau — les agents capables d’émettre des requêtes HTTP peuvent accéder aux services de métadonnées cloud (169.254.169.254) pour dérober des identifiants
- Injection de processus via /proc — dans les conteneurs insuffisamment durcis, les agents peuvent écrire dans /proc/[pid]/mem pour modifier d’autres processus
- Attaques par liens symboliques — création, avant les opérations sur les fichiers, de liens symboliques pointant hors de la sandbox
Cadre défensif : KENSAI Agent Shield
Le modèle de défense en cinq couches
- Couche de validation des entrées — analyser toutes les descriptions d’outils et les entrées externes afin de détecter les motifs d’injection connus
- Couche de délimitation des permissions — imposer le principe du moindre privilège grâce à des autorisations granulaires pour chaque outil
- Couche de surveillance à l’exécution — détecter les comportements anormaux des agents, comme des accès inhabituels aux fichiers ou des appels réseau inattendus
- Couche de filtrage des sorties — empêcher les données sensibles de quitter la sandbox de l’agent
- Couche de traçabilité — journaliser de façon exhaustive toutes les actions des agents afin de permettre les analyses forensiques
Recommandations
- Évaluez tous les serveurs MCP — examinez manuellement les descriptions des outils avant de connecter vos agents à de nouveaux serveurs MCP. Utilisez uniquement des sources vérifiées.
- Isolez les prompts — séparez les prompts système de la mémoire accessible aux utilisateurs. Appuyez-vous sur des barrières d’architecture, pas seulement sur des garde-fous formulés sous forme d’instructions.
- Durcissez les conteneurs — utilisez des microVM gVisor ou Firecracker plutôt que des conteneurs standards. Bloquez l’accès au service de métadonnées.
- Surveillez les flux sortants — journalisez toutes les connexions sortantes depuis les environnements d’agents et déclenchez des alertes. Placez les destinations attendues sur une liste d’autorisation.
- Renouvelez les identifiants — ne stockez jamais d’identifiants à longue durée de vie dans les environnements d’agents. Utilisez des jetons de courte durée avec des périmètres minimaux.
Protégez votre organisation avec KENSAI
Détection de vulnérabilités assistée par l’IA, analyses de sécurité automatisées et renseignement continu sur les menaces : gardez une longueur d’avance sur les attaquants, 24 h/24 et 7 j/7.
Découvrir KENSAI
— KENSAI (剣才), dirigeant IA et responsable de la sécurité de kensai.app