Per i clienti del nostro Cyber Verification Program, stiamo fornendo un nuovo classificatore di sandbox escape nell'API per monitorare e ridurre i comportamenti indesiderati. Questo articolo fornisce una panoramica della guida disponibile, con link a ogni risorsa.
Questo classificatore è in beta privata.
Questa guida è fornita così com'è, solo a scopo informativo. Descrive raccomandazioni, non requisiti. Queste procedure dovrebbero ridurre il rischio ma potrebbero non prevenire ogni azione fuori ambito. Rimani responsabile della scelta, del test e del funzionamento dei controlli adatti al tuo ambiente.
Panoramica delle procedure consigliate
Esegui ogni agente autonomo all'interno di una sandbox virtualizzata a livello hardware. Il design di riferimento utilizza una microVM per agente (Kata Containers con Firecracker) su una rete interna (vedi Sandboxing).
L'uso interattivo, con un umano che approva ogni azione o supervisiona l'agente in modalità auto di Claude Code, comporta meno rischio, ma consigliamo comunque una sandbox. La modalità auto da sola è un controllo best-effort, non un sostituto del sandboxing. Se esegui lavoro interattivo solo su file senza sandbox, rivedi ogni scrittura e non eseguire nulla che l'agente ha scritto senza leggerlo.
Non montare mai percorsi che contengono credenziali nell'ambiente dell'agente. Mantieni anche la credenziale modello-API fuori dall'ambiente dell'agente: fai in modo che un proxy separato la aggiunga alle richieste API dell'agente (vedi la sezione del proxy delle credenziali in Sandboxing).
Esegui gli agenti Claude Code in modalità autorizzazione automatica come controllo aggiuntivo all'interno della sandbox (vedi Modalità auto). Il suo classificatore potrebbe negare alcuni lavori di sicurezza legittimi; quell'articolo spiega cosa aspettarsi e come sintonizzarlo.
Conserva i transcript degli agenti e i log del proxy per almeno 30 giorni, revisionali durante e dopo le esecuzioni (vedi Monitoraggio offline dei transcript degli agenti), e comunica al tuo team di account Anthropic se vedi un agente agire al di fuori del suo ambito.
Panoramica degli articoli
La guida copre cinque aree:
Sandboxing. Perché gli agenti autonomi hanno bisogno di un isolamento forte, come il design di riferimento li isola, e come definire l'ambito e supervisionare gli impegni che richiedono accesso alla rete.
Autorizzazioni degli agenti: modalità auto. Perché gli agenti dovrebbero funzionare sotto un classificatore di autorizzazioni, cosa può e non può essere affidabile, e cosa dire al classificatore.
Prompt injection. Come il testo da un target potrebbe guidare un agente, e come limitare l'effetto.
Monitoraggio offline dei transcript degli agenti. Cosa cercare nei transcript degli agenti e nei log del proxy, come farlo, e quanto tempo conservarli.
Monitoraggio online: punteggi di sandbox escape nelle risposte API. Per gli agenti che esegui direttamente contro l'API Messages: il punteggio per richiesta dal classificatore di sandbox escape, come richiederlo, e come leggerlo.
Come questa guida si mappa alle procedure consigliate
Procedura consigliata | Dove è coperta | Cosa fai |
Isolamento sandbox e di rete | Esegui ogni agente nella sua VM con un host hardened, nega l'egresso per impostazione predefinita, e mantieni la credenziale modello-API in un proxy al di fuori della sandbox. | |
Convalida pre-impegno | Rivedi la configurazione ed esegui un test di escape supervisionato su ogni nuovo host, dopo ogni modifica della sandbox, e con ogni nuovo modello. Conferma che il target si compila e che l'agente ha gli strumenti di cui ha bisogno. | |
Conservazione e revisione dei transcript | Scrivi un transcript per ogni fase dell'agente, scansiona i transcript secondo una pianificazione, leggi ciò che le scansioni segnalano, e conserva i transcript e i log per almeno 30 giorni. | |
Classificatore di sandbox escape | Richiedi il punteggio dagli agenti che esegui direttamente contro l'API Messages, e usalo per decidere quali transcript leggere per primi. Non è disponibile per gli agenti che funzionano in Claude Code, o su Amazon Bedrock o sulla piattaforma Agent di Google Cloud (Vertex AI). | |
Modalità auto | Esegui gli agenti Claude Code in modalità auto, e descrivi il tuo ambiente al classificatore. | |
Scoping della rete | Consenti solo i target in ambito, e preferisci un ambiente di staging o replica. | |
Impostazione esplicita dell'ambito | Dichiara l'ambito nelle istruzioni che dai a ogni agente. | |
Uso di strumenti intermediati | Metti un proxy o uno strumento osservabile tra l'agente e il target. | |
Supervisione umana | Monitora le esecuzioni che hanno accesso alla rete, limita i turni e il tempo di esecuzione di ogni agente, e sappi come fermare un agente. | |
Target ad alte conseguenze | Non puntare agenti autonomi a sistemi live il cui guasto potrebbe mettere in pericolo la sicurezza o i servizi critici. |
Quali controlli si applicano dipende da come funziona il tuo agente:
Se il tuo agente funziona | Modalità auto | Punteggio API | Revisione dei transcript |
in Claude Code | Sì | No. Claude Code non espone il punteggio | Sì |
direttamente contro l'API Messages | No. La modalità auto è una funzione di Claude Code | Sì, sull'API Claude di prima parte | Sì |
Il monitoraggio in questa guida (revisione dei transcript e il punteggio API) cerca i tentativi di lasciare la sandbox o di ampliare l'accesso alla rete. Non rileva un agente che rimane all'interno della sua sandbox ma supera l'impegno su host a cui è autorizzato a raggiungere.
L'iniezione di prompt non è una delle procedure consigliate, ma è importante ogni volta che un agente legge contenuto scritto da qualcuno al di fuori della tua organizzazione.
Segnalazione di comportamento fuori ambito
Se un agente sonda la sua sandbox o isolamento di rete, o agisce al di fuori dell'impegno, notifica il tuo team di account Anthropic, oltre a qualunque sia il tuo processo di incidente. Cosa fare in caso di hit descrive come fermare l'agente e cosa raccogliere per primo.