Vai al contenuto principale

Procedure consigliate per il contenimento degli agenti: guida introduttiva (beta privata)

Per i clienti del nostro Cyber Verification Program, stiamo fornendo un nuovo classificatore di sandbox escape nell'API per monitorare e ridurre i comportamenti indesiderati. Questo articolo fornisce una panoramica della guida disponibile, con link a ogni risorsa.

Questo classificatore è in beta privata.

Questa guida è fornita così com'è, solo a scopo informativo. Descrive raccomandazioni, non requisiti. Queste procedure dovrebbero ridurre il rischio ma potrebbero non prevenire ogni azione fuori ambito. Rimani responsabile della scelta, del test e del funzionamento dei controlli adatti al tuo ambiente.

Panoramica delle procedure consigliate

  • Esegui ogni agente autonomo all'interno di una sandbox virtualizzata a livello hardware. Il design di riferimento utilizza una microVM per agente (Kata Containers con Firecracker) su una rete interna (vedi Sandboxing).

  • L'uso interattivo, con un umano che approva ogni azione o supervisiona l'agente in modalità auto di Claude Code, comporta meno rischio, ma consigliamo comunque una sandbox. La modalità auto da sola è un controllo best-effort, non un sostituto del sandboxing. Se esegui lavoro interattivo solo su file senza sandbox, rivedi ogni scrittura e non eseguire nulla che l'agente ha scritto senza leggerlo.

  • Non montare mai percorsi che contengono credenziali nell'ambiente dell'agente. Mantieni anche la credenziale modello-API fuori dall'ambiente dell'agente: fai in modo che un proxy separato la aggiunga alle richieste API dell'agente (vedi la sezione del proxy delle credenziali in Sandboxing).

  • Esegui gli agenti Claude Code in modalità autorizzazione automatica come controllo aggiuntivo all'interno della sandbox (vedi Modalità auto). Il suo classificatore potrebbe negare alcuni lavori di sicurezza legittimi; quell'articolo spiega cosa aspettarsi e come sintonizzarlo.

  • Conserva i transcript degli agenti e i log del proxy per almeno 30 giorni, revisionali durante e dopo le esecuzioni (vedi Monitoraggio offline dei transcript degli agenti), e comunica al tuo team di account Anthropic se vedi un agente agire al di fuori del suo ambito.

Panoramica degli articoli

La guida copre cinque aree:

Come questa guida si mappa alle procedure consigliate

Procedura consigliata

Dove è coperta

Cosa fai

Isolamento sandbox e di rete

Esegui ogni agente nella sua VM con un host hardened, nega l'egresso per impostazione predefinita, e mantieni la credenziale modello-API in un proxy al di fuori della sandbox.

Convalida pre-impegno

Rivedi la configurazione ed esegui un test di escape supervisionato su ogni nuovo host, dopo ogni modifica della sandbox, e con ogni nuovo modello. Conferma che il target si compila e che l'agente ha gli strumenti di cui ha bisogno.

Conservazione e revisione dei transcript

Scrivi un transcript per ogni fase dell'agente, scansiona i transcript secondo una pianificazione, leggi ciò che le scansioni segnalano, e conserva i transcript e i log per almeno 30 giorni.

Classificatore di sandbox escape

Richiedi il punteggio dagli agenti che esegui direttamente contro l'API Messages, e usalo per decidere quali transcript leggere per primi. Non è disponibile per gli agenti che funzionano in Claude Code, o su Amazon Bedrock o sulla piattaforma Agent di Google Cloud (Vertex AI).

Modalità auto

Esegui gli agenti Claude Code in modalità auto, e descrivi il tuo ambiente al classificatore.

Scoping della rete

Consenti solo i target in ambito, e preferisci un ambiente di staging o replica.

Impostazione esplicita dell'ambito

Dichiara l'ambito nelle istruzioni che dai a ogni agente.

Uso di strumenti intermediati

Metti un proxy o uno strumento osservabile tra l'agente e il target.

Supervisione umana

Monitora le esecuzioni che hanno accesso alla rete, limita i turni e il tempo di esecuzione di ogni agente, e sappi come fermare un agente.

Target ad alte conseguenze

Non puntare agenti autonomi a sistemi live il cui guasto potrebbe mettere in pericolo la sicurezza o i servizi critici.

Quali controlli si applicano dipende da come funziona il tuo agente:

Se il tuo agente funziona

Modalità auto

Punteggio API

Revisione dei transcript

in Claude Code

Sì

No. Claude Code non espone il punteggio

Sì

direttamente contro l'API Messages

No. La modalità auto è una funzione di Claude Code

Sì, sull'API Claude di prima parte

Sì

Il monitoraggio in questa guida (revisione dei transcript e il punteggio API) cerca i tentativi di lasciare la sandbox o di ampliare l'accesso alla rete. Non rileva un agente che rimane all'interno della sua sandbox ma supera l'impegno su host a cui è autorizzato a raggiungere.

L'iniezione di prompt non è una delle procedure consigliate, ma è importante ogni volta che un agente legge contenuto scritto da qualcuno al di fuori della tua organizzazione.

Segnalazione di comportamento fuori ambito

Se un agente sonda la sua sandbox o isolamento di rete, o agisce al di fuori dell'impegno, notifica il tuo team di account Anthropic, oltre a qualunque sia il tuo processo di incidente. Cosa fare in caso di hit descrive come fermare l'agente e cosa raccogliere per primo.

Hai ricevuto la risposta alla tua domanda?