Ir al contenido principal

Mejores prácticas de contención de agentes: primeros pasos (beta privada)

Para clientes en nuestro Programa de Verificación de Ciberseguridad, proporcionamos un nuevo clasificador de escape de sandbox en la API para monitorear y reducir comportamientos no deseados. Este artículo proporciona una descripción general de la orientación disponible, con enlaces a cada recurso.

Este clasificador está en beta privada.

Esta orientación se proporciona tal cual, solo para información. Describe recomendaciones, no requisitos. Estas prácticas deberían reducir el riesgo pero pueden no prevenir todas las acciones fuera del alcance. Usted sigue siendo responsable de elegir, probar y operar los controles que se ajusten a su entorno.

Descripción general de mejores prácticas

  • Ejecute cada agente autónomo dentro de un sandbox virtualizado por hardware. El diseño de referencia utiliza una microVM por agente (Kata Containers con Firecracker) en una red interna (consulte Sandboxing).

  • El uso interactivo, con un humano aprobando cada acción o supervisando el agente en el modo automático de Claude Code, conlleva menos riesgo, pero aún recomendamos un sandbox. El modo automático por sí solo es una verificación de mejor esfuerzo, no un sustituto del sandboxing. Si ejecuta trabajo interactivo solo de archivos sin sandbox, revise cada escritura y no ejecute nada que el agente escribió sin leerlo.

  • Nunca monte rutas que contengan credenciales en el entorno del agente. Mantenga también la credencial del modelo-API fuera del entorno del agente: tenga un proxy separado que la agregue a las solicitudes de API del agente (consulte Sandboxing).

  • Ejecute agentes de Claude Code en modo de permiso automático como una verificación adicional dentro del sandbox (consulte Modo automático). Su clasificador puede denegar algunos trabajos de seguridad legítimos; ese artículo explica qué esperar y cómo ajustarlo.

  • Mantenga transcripciones de agentes y registros de proxy durante al menos 30 días, revíselos durante y después de las ejecuciones (consulte Monitoreo sin conexión de transcripciones de agentes), e informe a su equipo de cuenta de Anthropic si ve que un agente actúa fuera de su alcance.

Descripción general de artículos

La orientación cubre cinco áreas:

Cómo esta orientación se asigna a las mejores prácticas

Mejor práctica

Dónde se cubre

Lo que hace

Aislamiento de sandbox y red

Ejecute cada agente en su propia VM con un host endurecido, deniegue la salida por defecto, y mantenga la credencial del modelo-API en un proxy fuera del sandbox.

Validación previa al compromiso

Revise la configuración y ejecute una prueba de escape supervisada en cada nuevo host, después de cada cambio de sandbox, y con cada nuevo modelo. Confirme que el objetivo se construye y que el agente tiene las herramientas que necesita.

Retención y revisión de transcripciones

Escriba una transcripción para cada etapa del agente, escanee transcripciones según un cronograma, lea lo que los escaneos marcan, y mantenga transcripciones y registros durante al menos 30 días.

Clasificador de escape de sandbox

Solicite la puntuación de agentes que ejecuta directamente contra la API de Mensajes, y úsela para decidir qué transcripciones leer primero. No está disponible para agentes que se ejecutan en Claude Code, o en Amazon Bedrock o en la Plataforma de Agentes de Google Cloud (Vertex AI).

Modo automático

Ejecute agentes de Claude Code en modo automático, y describa su entorno al clasificador.

Alcance de red

Permita solo los objetivos dentro del alcance, y prefiera un entorno de ensayo o réplica.

Establecimiento explícito del alcance

Indique el alcance en las instrucciones que da a cada agente.

Uso de herramientas intermediadas

Coloque un proxy observable o herramienta entre el agente y el objetivo.

Supervisión humana

Observe ejecuciones que tengan acceso a la red, limite los turnos y el tiempo de ejecución de cada agente, y sepa cómo detener un agente.

Objetivos de alto impacto

No apunte agentes autónomos a sistemas en vivo cuya falla podría poner en peligro la seguridad o servicios críticos.

Qué verificaciones se aplican depende de cómo se ejecute su agente:

Si su agente se ejecuta

Modo automático

Puntuación de API

Revisión de transcripción

en Claude Code

Sí

No. Claude Code no muestra la puntuación

Sí

contra la API de Mensajes directamente

No. El modo automático es una característica de Claude Code

Sí, en la API de Claude de primera parte

Sí

El monitoreo en esta orientación (revisión de transcripción y la puntuación de API) busca intentos de dejar el sandbox o ampliar el acceso a la red. No detecta un agente que permanece dentro de su sandbox pero excede el compromiso en hosts que se le permite alcanzar.

La inyección de solicitud no es una de las mejores prácticas, pero importa siempre que un agente lea contenido que alguien fuera de su organización escribió.

Informe del comportamiento fuera del alcance

Si un agente prueba su aislamiento de sandbox o red, o actúa fuera del compromiso, notifique a su equipo de cuenta de Anthropic, además de lo que requiera su propio proceso de incidentes. Qué hacer en un acierto describe cómo detener el agente y qué recopilar primero.

¿Ha quedado contestada tu pregunta?