Ir para conteúdo principal

Melhores práticas de contenção de agentes: primeiros passos (beta privado)

Para clientes do nosso Programa de Verificação de Segurança, estamos fornecendo um novo classificador de escape de sandbox na API para monitorar e reduzir comportamentos indesejados. Este artigo fornece uma visão geral da orientação disponível para você, com links para cada recurso.

Este classificador está em beta privado.

Esta orientação é fornecida como está, apenas para informação. Descreve recomendações, não requisitos. Essas práticas devem reduzir riscos, mas podem não prevenir todas as ações fora do escopo. Você permanece responsável por escolher, testar e operar os controles que se adequam ao seu ambiente.

Visão geral das melhores práticas

  • Execute cada agente autônomo dentro de um sandbox virtualizado por hardware. O design de referência usa uma microVM por agente (Kata Containers com Firecracker) em uma rede interna (veja Sandboxing).

  • O uso interativo, com um humano aprovando cada ação ou supervisionando o agente no modo automático do Claude Code, apresenta menos risco, mas ainda recomendamos um sandbox. O modo automático por si só é uma verificação de melhor esforço, não um substituto para sandboxing. Se você executar trabalho interativo apenas com arquivos sem sandbox, revise cada escrita e não execute nada que o agente escreveu sem ler.

  • Nunca monte caminhos com credenciais no ambiente do agente. Mantenha a credencial do modelo-API fora do ambiente do agente também: tenha um proxy separado adicionando-a às solicitações de API do agente (veja Sandboxing).

  • Execute agentes do Claude Code no modo de permissão automática como uma verificação adicional dentro do sandbox (veja Modo automático). Seu classificador pode negar alguns trabalhos de segurança legítimos; esse artigo explica o que esperar e como ajustá-lo.

  • Mantenha transcrições de agentes e logs de proxy por pelo menos 30 dias, revise-os durante e após as execuções (veja Monitoramento offline de transcrições de agentes), e notifique sua equipe de conta Anthropic se vir um agente agir fora do seu escopo.

Visão geral dos artigos

A orientação cobre cinco áreas:

Como esta orientação mapeia para as melhores práticas

Melhor prática

Onde está coberto

O que você faz

Isolamento de sandbox e rede

Execute cada agente em sua própria VM com um host endurecido, negue saída por padrão e mantenha a credencial do modelo-API em um proxy fora do sandbox.

Validação pré-engajamento

Revise a configuração e execute um teste de escape supervisionado em cada novo host, após cada mudança de sandbox e com cada novo modelo. Confirme que o alvo é compilado e que o agente tem as ferramentas de que precisa.

Retenção e revisão de transcrição

Escreva uma transcrição para cada estágio do agente, digitalize transcrições em um cronograma, leia o que as digitalizações sinalizam e mantenha transcrições e logs por pelo menos 30 dias.

Classificador de escape de sandbox

Solicite a pontuação de agentes que você executa diretamente contra a API de Mensagens e use-a para decidir quais transcrições ler primeiro. Não está disponível para agentes que são executados no Claude Code, ou no Amazon Bedrock ou na Plataforma de Agentes do Google Cloud (Vertex AI).

Modo automático

Execute agentes do Claude Code no modo automático e descreva seu ambiente ao classificador.

Escopo de rede

Coloque na lista de permissões apenas os alvos no escopo e prefira um ambiente de preparação ou réplica.

Definição explícita de escopo

Declare o escopo nas instruções que você dá a cada agente.

Uso de ferramenta intermediada

Coloque um proxy observável ou ferramenta entre o agente e o alvo.

Supervisão humana

Observe execuções que têm acesso à rede, limite os turnos e tempo de execução de cada agente e saiba como parar um agente.

Alvos de alta consequência

Não aponte agentes autônomos para sistemas ao vivo cuja falha pudesse colocar em risco a segurança ou serviços críticos.

Quais verificações se aplicam depende de como seu agente é executado:

Se seu agente é executado

Modo automático

Pontuação de API

Revisão de transcrição

no Claude Code

Sim

Não. Claude Code não exibe a pontuação

Sim

contra a API de Mensagens diretamente

Não. Modo automático é um recurso do Claude Code

Sim, na API Claude de primeira parte

Sim

O monitoramento nesta orientação (revisão de transcrição e pontuação de API) procura por tentativas de sair do sandbox ou ampliar o acesso à rede. Não detecta um agente que permanece dentro de seu sandbox, mas excede o engajamento em hosts que tem permissão para alcançar.

Injeção de prompt não é uma das melhores práticas, mas importa sempre que um agente lê conteúdo que alguém fora de sua organização escreveu.

Relatando comportamento fora do escopo

Se um agente testa seu sandbox ou isolamento de rede, ou age fora do engajamento, notifique sua equipe de conta Anthropic, além de qualquer que seja seu próprio processo de incidente. Descreve como parar o agente e o que coletar primeiro.

Isto respondeu à sua pergunta?