Para clientes do nosso Programa de Verificação de Segurança, estamos fornecendo um novo classificador de escape de sandbox na API para monitorar e reduzir comportamentos indesejados. Este artigo fornece uma visão geral da orientação disponível para você, com links para cada recurso.
Este classificador está em beta privado.
Esta orientação é fornecida como está, apenas para informação. Descreve recomendações, não requisitos. Essas práticas devem reduzir riscos, mas podem não prevenir todas as ações fora do escopo. Você permanece responsável por escolher, testar e operar os controles que se adequam ao seu ambiente.
Visão geral das melhores práticas
Execute cada agente autônomo dentro de um sandbox virtualizado por hardware. O design de referência usa uma microVM por agente (Kata Containers com Firecracker) em uma rede interna (veja Sandboxing).
O uso interativo, com um humano aprovando cada ação ou supervisionando o agente no modo automático do Claude Code, apresenta menos risco, mas ainda recomendamos um sandbox. O modo automático por si só é uma verificação de melhor esforço, não um substituto para sandboxing. Se você executar trabalho interativo apenas com arquivos sem sandbox, revise cada escrita e não execute nada que o agente escreveu sem ler.
Nunca monte caminhos com credenciais no ambiente do agente. Mantenha a credencial do modelo-API fora do ambiente do agente também: tenha um proxy separado adicionando-a às solicitações de API do agente (veja Sandboxing).
Execute agentes do Claude Code no modo de permissão automática como uma verificação adicional dentro do sandbox (veja Modo automático). Seu classificador pode negar alguns trabalhos de segurança legítimos; esse artigo explica o que esperar e como ajustá-lo.
Mantenha transcrições de agentes e logs de proxy por pelo menos 30 dias, revise-os durante e após as execuções (veja Monitoramento offline de transcrições de agentes), e notifique sua equipe de conta Anthropic se vir um agente agir fora do seu escopo.
Visão geral dos artigos
A orientação cobre cinco áreas:
Sandboxing. Por que agentes autônomos precisam de isolamento forte, como o design de referência os isola e como definir o escopo e supervisionar engajamentos que precisam de acesso à rede.
Permissões de agentes: modo automático. Por que agentes devem ser executados sob um classificador de permissões, no que ele pode e não pode ser confiável e o que informar ao classificador.
Injeção de prompt. Como texto de um alvo pode orientar um agente e como limitar o efeito.
Monitoramento offline de transcrições de agentes. O que procurar em transcrições de agentes e logs de proxy, como fazer isso e por quanto tempo mantê-los.
Monitoramento online: pontuações de escape de sandbox em respostas de API. Para agentes que você executa diretamente contra a API de Mensagens: a pontuação por solicitação do classificador de escape de sandbox, como solicitá-la e como lê-la.
Como esta orientação mapeia para as melhores práticas
Melhor prática | Onde está coberto | O que você faz |
Isolamento de sandbox e rede | Execute cada agente em sua própria VM com um host endurecido, negue saída por padrão e mantenha a credencial do modelo-API em um proxy fora do sandbox. | |
Validação pré-engajamento | Revise a configuração e execute um teste de escape supervisionado em cada novo host, após cada mudança de sandbox e com cada novo modelo. Confirme que o alvo é compilado e que o agente tem as ferramentas de que precisa. | |
Retenção e revisão de transcrição | Escreva uma transcrição para cada estágio do agente, digitalize transcrições em um cronograma, leia o que as digitalizações sinalizam e mantenha transcrições e logs por pelo menos 30 dias. | |
Classificador de escape de sandbox | Solicite a pontuação de agentes que você executa diretamente contra a API de Mensagens e use-a para decidir quais transcrições ler primeiro. Não está disponível para agentes que são executados no Claude Code, ou no Amazon Bedrock ou na Plataforma de Agentes do Google Cloud (Vertex AI). | |
Modo automático | Execute agentes do Claude Code no modo automático e descreva seu ambiente ao classificador. | |
Escopo de rede | Coloque na lista de permissões apenas os alvos no escopo e prefira um ambiente de preparação ou réplica. | |
Definição explícita de escopo | Declare o escopo nas instruções que você dá a cada agente. | |
Uso de ferramenta intermediada | Coloque um proxy observável ou ferramenta entre o agente e o alvo. | |
Supervisão humana | Observe execuções que têm acesso à rede, limite os turnos e tempo de execução de cada agente e saiba como parar um agente. | |
Alvos de alta consequência | Não aponte agentes autônomos para sistemas ao vivo cuja falha pudesse colocar em risco a segurança ou serviços críticos. |
Quais verificações se aplicam depende de como seu agente é executado:
Se seu agente é executado | Modo automático | Pontuação de API | Revisão de transcrição |
no Claude Code | Sim | Não. Claude Code não exibe a pontuação | Sim |
contra a API de Mensagens diretamente | Não. Modo automático é um recurso do Claude Code | Sim, na API Claude de primeira parte | Sim |
O monitoramento nesta orientação (revisão de transcrição e pontuação de API) procura por tentativas de sair do sandbox ou ampliar o acesso à rede. Não detecta um agente que permanece dentro de seu sandbox, mas excede o engajamento em hosts que tem permissão para alcançar.
Injeção de prompt não é uma das melhores práticas, mas importa sempre que um agente lê conteúdo que alguém fora de sua organização escreveu.
Relatando comportamento fora do escopo
Se um agente testa seu sandbox ou isolamento de rede, ou age fora do engajamento, notifique sua equipe de conta Anthropic, além de qualquer que seja seu próprio processo de incidente. Descreve como parar o agente e o que coletar primeiro.