Lewati ke konten utama

Praktik terbaik penahanan agen: memulai (beta pribadi)

Untuk pelanggan dalam Program Verifikasi Siber kami, kami menyediakan pengklasifikasi sandbox escape baru di API untuk memantau dan mengurangi perilaku yang tidak diinginkan. Artikel ini memberikan gambaran umum tentang panduan yang tersedia untuk Anda, dengan tautan ke setiap sumber daya.

Pengklasifikasi ini dalam beta pribadi.

Panduan ini disediakan sebagaimana adanya, hanya untuk informasi. Ini menjelaskan rekomendasi, bukan persyaratan. Praktik ini harus mengurangi risiko tetapi mungkin tidak mencegah setiap tindakan di luar cakupan. Anda tetap bertanggung jawab untuk memilih, menguji, dan mengoperasikan kontrol yang sesuai dengan lingkungan Anda.

Gambaran umum praktik terbaik

  • Jalankan setiap agen otonomi di dalam sandbox yang divirtualisasi perangkat keras. Desain referensi menggunakan satu microVM per agen (Kata Containers dengan Firecracker) di jaringan internal (lihat Sandboxing).

  • Penggunaan interaktif, dengan manusia menyetujui setiap tindakan atau mengawasi agen di mode otomatis Claude Code, membawa risiko lebih rendah, tetapi kami tetap merekomendasikan sandbox. Mode otomatis sendiri adalah pemeriksaan upaya terbaik, bukan pengganti sandboxing. Jika Anda menjalankan pekerjaan interaktif hanya file tanpa sandbox, tinjau setiap penulisan dan jangan jalankan apa pun yang ditulis agen tanpa membacanya.

  • Jangan pasang jalur yang membawa kredensial ke lingkungan agen. Jaga kredensial model-API keluar dari lingkungan agen juga: memiliki proxy terpisah menambahkannya ke permintaan API agen (lihat bagian proxy kredensial dalam Sandboxing).

  • Jalankan agen Claude Code dalam mode izin otomatis sebagai pemeriksaan tambahan di dalam sandbox (lihat Mode otomatis). Pengklasifikatornya mungkin menolak beberapa pekerjaan keamanan yang sah; artikel itu menjelaskan apa yang diharapkan dan cara menyetelnya.

  • Simpan transkrip agen dan log proxy selama minimal 30 hari, tinjau selama dan setelah berjalan (lihat Pemantauan offline transkrip agen), dan beri tahu tim akun Anthropic Anda jika Anda melihat agen bertindak di luar cakupannya.

Gambaran umum artikel

Panduan mencakup lima area:

  • Sandboxing. Mengapa agen otonomi membutuhkan isolasi yang kuat, bagaimana desain referensi mengisolasinya, dan cara membatasi dan mengawasi keterlibatan yang memerlukan akses jaringan.

  • Izin agen: mode otomatis. Mengapa agen harus berjalan di bawah pengklasifikasi izin, apa yang dapat dan tidak dapat diandalkan, dan apa yang harus diberitahu kepada pengklasifikasi.

  • Injeksi prompt. Bagaimana teks dari target dapat mengarahkan agen, dan cara membatasi efeknya.

  • Pemantauan offline transkrip agen. Apa yang harus dicari dalam transkrip agen dan log proxy, cara melakukannya, dan berapa lama menyimpannya.

  • Pemantauan online: skor sandbox-escape dalam respons API. Untuk agen yang Anda jalankan langsung terhadap Messages API: skor per-permintaan dari pengklasifikasi sandbox escape, cara memintanya, dan cara membacanya.

Bagaimana panduan ini memetakan praktik terbaik

Praktik terbaik

Di mana itu tercakup

Apa yang Anda lakukan

Isolasi sandbox dan jaringan

Jalankan setiap agen di VM-nya sendiri dengan host yang diperkuat, tolak egress secara default, dan simpan kredensial model-API di proxy di luar sandbox.

Validasi pra-keterlibatan

Tinjau konfigurasi dan jalankan tes escape yang diawasi pada setiap host baru, setelah setiap perubahan sandbox, dan dengan setiap model baru. Konfirmasi target dibangun dan agen memiliki alat yang dibutuhkannya.

Retensi dan tinjauan transkrip

Tulis transkrip untuk setiap tahap agen, pindai transkrip sesuai jadwal, baca apa yang ditandai pemindaian, dan simpan transkrip dan log selama minimal 30 hari.

Pengklasifikasi sandbox escape

Minta skor dari agen yang Anda jalankan langsung terhadap Messages API, dan gunakan untuk memutuskan transkrip mana yang harus dibaca terlebih dahulu. Ini tidak tersedia untuk agen yang berjalan di Claude Code, atau di Amazon Bedrock atau Platform Agen Google Cloud (Vertex AI).

Mode otomatis

Jalankan agen Claude Code dalam mode otomatis, dan jelaskan lingkungan Anda kepada pengklasifikasi.

Scoping jaringan

Daftarkan putih hanya target dalam cakupan, dan lebih suka lingkungan staging atau replika.

Penetapan cakupan eksplisit

Nyatakan cakupan dalam instruksi yang Anda berikan kepada setiap agen.

Penggunaan alat yang dimediasi

Letakkan proxy atau alat yang dapat diamati antara agen dan target.

Pengawasan manusia

Tonton run yang memiliki akses jaringan, batasi giliran setiap agen dan waktu run, dan ketahui cara menghentikan agen.

Target konsekuensi tinggi

Jangan arahkan agen otonomi ke sistem langsung yang kegagalannya dapat membahayakan keselamatan atau layanan penting.

Pemeriksaan mana yang berlaku tergantung pada cara agen Anda berjalan:

Jika agen Anda berjalan

Mode otomatis

Skor API

Tinjauan transkrip

di Claude Code

Ya

Tidak. Claude Code tidak menampilkan skor

Ya

terhadap Messages API secara langsung

Tidak. Mode otomatis adalah fitur Claude Code

Ya, di API Claude pihak pertama

Ya

Pemantauan dalam panduan ini (tinjauan transkrip dan skor API) mencari upaya untuk meninggalkan sandbox atau memperluas akses jaringan. Ini tidak mendeteksi agen yang tetap berada di dalam sandbox tetapi melampaui keterlibatan pada host yang diizinkan untuk dijangkau.

Injeksi prompt bukan salah satu praktik terbaik, tetapi penting setiap kali agen membaca konten yang ditulis oleh seseorang di luar organisasi Anda.

Melaporkan perilaku di luar cakupan

Jika agen menyelidiki sandbox atau isolasi jaringannya, atau bertindak di luar keterlibatan, beri tahu tim akun Anthropic Anda, selain apa pun yang diperlukan proses insiden Anda sendiri. Apa yang harus dilakukan saat hit menjelaskan cara menghentikan agen dan apa yang harus dikumpulkan terlebih dahulu.

Apakah pertanyaan Anda terjawab?