Перейти к содержимому
Guide

Матрица аудита Клода смущенного депутата: 4 слепых пятна, 3 препятствия

| 8 min read

Четыре исследовательские группы опубликовали результаты оперативного внедрения Клода в период с 6 по 7 мая 2026 года. Матрицу аудита, сопоставляющую каждое слепое пятно с конкретным ограждением (проверка URL-адресов, сканирование PII, список разрешений оболочки), вы можете отправить на этой неделе.

Security audit checklist representing Claude confused-deputy guardrails
Photo by Towfiqu barbhuiya on Unsplash

В период с 6 по 7 мая 2026 года четыре отдельные исследовательские группы опубликовали выводы о Клоде Промпте. инъекция. Большинство репортажей рассматривали их как три разные истории. Это одна и та же история: запутанная задача депутата, когда Клод выполняет действия от имени злоумышленника, который контролирует ненадежный контент в его контекстном окне.

README в клонированном репозитории может запускать команды оболочки через Claude Code. Веб-страница в Клоде в Chrome может убедить агента получить URL-адреса злоумышленника. Ответ инструмента MCP может вводить инструкции. что следующий вызов инструмента подчиняется. Модель делает то, что ей сказали; проблема в модели не могу сказать, кто говорит.

Частичная защита антропных кораблей (запросы разрешений в Клод-коде, подтверждения действий в Клод в Chrome). Остальное ваше. Вот матрица аудита, которая сопоставляет каждое слепое пятно с бетонное ограждение и проверку API одним вызовом, которую вы можете добавить в свой шлюз MCP сегодня.

Четыре слепых пятна

Поверхность Вектор атаки Что работает Родное ограждение
Клод Код Отравленный README, пакет postinstallили git commit body Команда оболочки, запись файла, git push Запрос разрешения
Клод в Chrome Инструкции веб-страницы, замаскированные под запросы пользователей Нажмите, отправьте форму, перейдите по ссылке. Подтверждение действия
Клод Рабочий стол + MCP Ответ инструмента содержит инструкции для следующего вызова. Связанный вызов инструмента MCP, чтение файла, выборка по сети Диалоговое окно согласия инструмента
API tool_use Ненадежная строка внутри блока результатов инструмента Что бы ни решил следующий ход Нет по умолчанию

Каждое встроенное ограждение улавливает очевидный случай (команду оболочки, которую пользователь не запрашивал) и упускает тонкий момент («безобидный» завиток для похожего хоста, которого пользователь никогда не видел). Исправление это глубокоэшелонированная защита на уровне инструментов, а не на уровне подсказок.

Guardrail 1: проверять на фишинг каждый URL-адрес, к которому прикасается агент.

Самый распространенный способ эскалации в замешательстве — «посетите этот URL-адрес и скажите мне, что там написано». URL принадлежит злоумышленнику. Данные, которые агент читает дальше, теперь являются его входными данными. Запустить фишинг проверьте каждый URL-адрес, который агент не видел в исходном приглашении пользователя:

Необработанный исполняемый файл, размещенный на анонимной основе без закрепленного коммита, является классикой. цепочка «быстрое внедрение — выполнение оболочки». Вердикт возвращается менее чем через 100 мс; вы кэшируете Хэш URL за 10 минут; вы отбрасываете вызовы инструментов, вердикт которых отличается от clean.

Guardrail 2: PII и секретное сканирование каждого ответа инструмента MCP

Вторая эскалация — отравление реакции инструмента. Инструмент MCP возвращает большой двоичный объект JSON размером 4 КБ; где-то в этом BLOB-объекте находится строка инструкций. Клод читает весь объект, и инструкция побеждает. Большой двоичный объект также может привести к утечке учетных данных, собранных где-то еще, которые затем попадают в рассуждения модели. трассировка и журналы ваших разговоров.

Заблокируйте ответ инструмента от достижения модели, если он содержит действующие учетные данные. Редактировать электронные письма и телефоны, если пользователь не попросил их. Считайте каждый сервер MCP ненадежным по умолчанию; ты не знаю, кто отравил восходящий источник данных.

Guardrail 3: жесткие списки хостов и оболочки на шлюзе

Третья эскалация — это та, которая кусает предприятия: агент, который незаметно расширяет свою собственную достичь. README убеждает Клода Кода запуститься curl evil.sh | bash «для настройки». А веб-страница убеждает Клода в Chrome отправить форму в похожем домене. Обе атаки умирают против фиксированного белого списка:

Белый список — это скучно. Суть в том, что это скучно. Любое действие, выходящее за пределы белого списка, либо происходит немедленный сбой или выдается приглашение, которое пользователь должен прочитать. Агент остается полезным внутри песочница и безобидна за ее пределами.

60-линейный шлюз MCP, соединяющий все вместе

Все три ограждения находятся в одной функции промежуточного программного обеспечения, которая находится между Клодом и каждым MCP. сервер. Он извлекает URL-адреса из ответов инструмента, проверяет их на соответствие набору доверенных хостов, а также список разрешенных сеансов, запускает сканирование PII и возвращает решение о структурированном блокировании ведущему приложению. может появиться пользователю:

Набор доверенных хостов содержит ваши собственные API. Список разрешенных сеансов начинается пустым и увеличивается по мере пользователь явно утверждает хосты во время сеанса. Кэширование делает чек фактически бесплатным для повторяющиеся URL-адреса (подумайте о нумерации страниц, повторных попытках, одной и той же странице документации при вызове инструмента).

Если вы еще не можете запустить шлюз, используйте дешевый вариант: регистрируйте каждый URL-адрес и каждую команду оболочки. агент делает предложение в структурированное хранилище и предупреждает обо всем, что попадает на хост, которого вы не сделали. предварительно авторизовать. Обнаружение без предотвращения не сравнится ни с тем, ни с другим.

Где это вписывается в позицию глубокоэшелонированной защиты

Матрица аудита не является заменой собственной работы Anthropic. Это слой, которым вы управляете. А разумное разделение:

  • Anthropic владеет моделью: надежность быстрого внедрения, иерархия инструкций обучение, отказное поведение.
  • Вы владеете поверхностью инструмента: Проверка URL-адреса, очистка PII, хост и оболочка списки разрешенных, инвентарь сервера MCP.
  • Ваш IdP владеет удостоверением: кратковременные токены для агента, за сеанс аудит, отдельные учетные данные от пользователя-человека.

Пропустите любой уровень, и следующий отчет о замешательстве депутата будет включать в себя ваш инцидент. Исследование 6-7 мая — это бесплатный предварительный просмотр того, что должна выпустить каждая команда, прежде чем это станет ежеквартальным циклом новостей.

Ключевые выводы

  • Четыре слепых пятна, одна основная причина. Клод рассматривает каждый токен как потенциально несущий инструкции. Ненадежный контент в контексте — это вектор действия, а не пассивное чтение.
  • Проверка фишинга URL-адресов для каждого URL-адреса, предложенного инструментом. Один вызов API, 100 мс, кэшируется. Отменяет наиболее распространенную цепочку эскалации быстрого внедрения.
  • Сканирование PII при каждом ответе инструмента MCP. Блокирует утечку учетных данных через инструмент отравляет результаты и сохраняет секреты в журналах разговоров.
  • Жесткие списки разрешенных на шлюзе. Команда оболочки и списки разрешенных хостов убивают «тихо расширить охват» эскалации. Скучно, ограниченно, эффективно.
  • Раскол в глубокоэшелонированной защите. Anthropic владеет моделью, вы владеете поверхностью инструмента. ваш IdP владеет личностью. Пропустите слой, и следующая исследовательская капля назовет вас.

Ботойские экспонаты /v1/phishing/check, /v1/pii/detect, /v1/url-metadataи еще примерно 200 одноцелевых конечных точек за одним ключом API. при 5 запросах/мин бесплатно. Подключите их к шлюзу MCP или позвоните им из самого Claude Code через тот ботои MCP сервер. Просмотрите интерактивные документы начать.

FAQ

В чем проблема Клода с запутавшимся депутатом?
Атака с замешательством заместителя происходит, когда привилегированный процесс (Claude Code, Claude в Chrome) выполняет действия от имени злоумышленника, который контролирует часть его ввода. В период с 6 по 7 мая 2026 года четыре исследовательские группы опубликовали результаты, показывающие, что Клода можно обманом заставить выполнить команды оболочки, украсть данные или посетить URL-адреса злоумышленника, когда ненадежный контент (README, веб-страница, ответ инструмента MCP) содержит инструкции, похожие на запросы пользователя.
Какие поверхности Клода затронуты?
Код Claude (агент CLI, читающий файлы репозитория), Claude в Chrome (агент просмотра веб-страниц, читающий веб-страницы), Claude Desktop с серверами MCP (ответы инструментов могут содержать инструкции) и API, когда результаты Tool_use содержат строки, контролируемые злоумышленником. Корень проблемы один и тот же во всех четырех: Клод рассматривает каждый токен в контексте как потенциально несущий инструкции.
Предоставляет ли Anthropic ограждения для этого?
Да, частично. В Claude Code есть система разрешений на запись в оболочку и файлы. У Клода в Chrome есть слой подтверждения действий. Ничто не мешает решительному злоумышленнику совместить быструю инъекцию с социальной инженерией. Уровень глубокоэшелонированной защиты — ваш: проверяйте каждый URL-адрес, предлагаемый агентом, сканируйте каждый ответ инструмента на предмет IOC и ограничивайте радиус взрыва на шлюзе API.
Чем это отличается от обычной быстрой инъекции?
Классическое внедрение подсказки заканчивается при выводе текста. Сбитый с толку депутат заканчивает действовать: выполняется команда оболочки, извлекается URL-адрес, срабатывает вебхук, деньги перемещаются. Исправление должно действовать там, где происходят действия (слой инструмента), а не там, где генерируется текст (модель). Вот почему защитные прокси-серверы и проверка URL-адресов имеют большее значение, чем быстрое усиление защиты.
Какой минимум мне следует добавить на этой неделе?
Три вещи. Проверка URL-адреса на фишинг перед тем, как агент получит или свяжет любой домен, который он не видел в приглашении пользователя. PII и секретное сканирование каждого ответа инструмента MCP, прежде чем он попадет в контекст Клода. И жесткий список разрешенных команд оболочки или HTTP-хостов на уровне шлюза. Каждый из них представляет собой один вызов API и один блок конфигурации.

Начните разработку с botoi

150+ API-эндпоинтов для поиска, обработки текста, генерации изображений и утилит для разработчиков. Бесплатный тариф, без банковской карты.