Pour les clients de notre programme de vérification de cybersécurité, nous fournissons un nouveau classificateur d'échappement de bac à sable dans l'API pour surveiller et réduire les comportements indésirables. Cet article fournit un aperçu des conseils disponibles, avec des liens vers chaque ressource.
Ce classificateur est en bêta privée.
Ces conseils sont fournis tels quels, à titre informatif uniquement. Ils décrivent des recommandations, non des exigences. Ces pratiques devraient réduire les risques mais peuvent ne pas prévenir chaque action hors de portée. Vous restez responsable du choix, du test et de l'exploitation des contrôles adaptés à votre environnement.
Aperçu des meilleures pratiques
Exécutez chaque agent autonome dans un bac à sable virtualisé par matériel. La conception de référence utilise une microVM par agent (Kata Containers avec Firecracker) sur un réseau interne (voir Sandboxing).
L'utilisation interactive, avec un humain approuvant chaque action ou supervisant l'agent en mode auto de Claude Code, présente moins de risques, mais nous recommandons toujours un bac à sable. Le mode auto seul est une vérification au mieux, pas un substitut au sandboxing. Si vous exécutez un travail interactif et basé sur des fichiers sans bac à sable, examinez chaque écriture et n'exécutez rien que l'agent a écrit sans le lire.
Ne montez jamais de chemins porteurs de credentials dans l'environnement de l'agent. Gardez également la credential modèle-API hors de l'environnement de l'agent : faites en sorte qu'un proxy séparé l'ajoute aux demandes API de l'agent (voir la section proxy de credential dans Sandboxing).
Exécutez les agents Claude Code en mode permission auto comme vérification supplémentaire dans le bac à sable (voir Mode auto). Son classificateur peut refuser certains travaux de sécurité légitimes ; cet article explique à quoi s'attendre et comment l'ajuster.
Conservez les transcriptions d'agents et les journaux de proxy pendant au moins 30 jours, examinez-les pendant et après les exécutions (voir Surveillance hors ligne des transcriptions d'agents), et informez votre équipe de compte Anthropic si vous voyez un agent agir en dehors de sa portée.
Aperçu des articles
Les conseils couvrent cinq domaines :
Sandboxing. Pourquoi les agents autonomes ont besoin d'une isolation forte, comment la conception de référence les isole, et comment délimiter et superviser les engagements qui nécessitent un accès réseau.
Permissions des agents : mode auto. Pourquoi les agents doivent s'exécuter sous un classificateur de permissions, ce sur quoi on peut et ne peut pas compter, et ce qu'il faut dire au classificateur.
Injection de prompt. Comment le texte d'une cible pourrait diriger un agent, et comment limiter l'effet.
Surveillance hors ligne des transcriptions d'agents. Ce qu'il faut chercher dans les transcriptions d'agents et les journaux de proxy, comment le faire, et combien de temps les conserver.
Surveillance en ligne : scores d'échappement de bac à sable dans les réponses API. Pour les agents que vous exécutez directement contre l'API Messages : le score par demande du classificateur d'échappement de bac à sable, comment le demander, et comment le lire.
Comment ces conseils correspondent aux meilleures pratiques
Meilleure pratique | Où c'est couvert | Ce que vous faites |
Isolation du bac à sable et du réseau | Exécutez chaque agent dans sa propre VM avec un hôte renforcé, refusez l'egress par défaut, et gardez la credential modèle-API dans un proxy en dehors du bac à sable. | |
Validation pré-engagement | Examinez la configuration et exécutez un test d'échappement supervisé sur chaque nouvel hôte, après chaque modification du bac à sable, et avec chaque nouveau modèle. Confirmez que la cible se construit et que l'agent dispose des outils dont il a besoin. | |
Rétention et examen des transcriptions | Écrivez une transcription pour chaque étape d'agent, analysez les transcriptions selon un calendrier, lisez ce que les analyses signalent, et conservez les transcriptions et les journaux pendant au moins 30 jours. | |
Classificateur d'échappement de bac à sable | Demandez le score des agents que vous exécutez directement contre l'API Messages, et utilisez-le pour décider quelles transcriptions lire en premier. Il n'est pas disponible pour les agents qui s'exécutent dans Claude Code, ou sur Amazon Bedrock ou la plateforme Agent de Google Cloud (Vertex AI). | |
Mode auto | Exécutez les agents Claude Code en mode auto, et décrivez votre environnement au classificateur. | |
Délimitation du réseau | Mettez en liste blanche uniquement les cibles dans la portée, et préférez un environnement de staging ou de réplica. | |
Définition explicite de la portée | Énoncez la portée dans les instructions que vous donnez à chaque agent. | |
Utilisation d'outils intermédiée | Placez un proxy observable ou un outil entre l'agent et la cible. | |
Supervision humaine | Surveillez les exécutions qui ont accès au réseau, limitez les tours et le temps d'exécution de chaque agent, et sachez comment arrêter un agent. | |
Cibles à conséquences élevées | Ne pointez pas les agents autonomes vers des systèmes en direct dont la défaillance pourrait mettre en danger la sécurité ou les services critiques. |
Les vérifications applicables dépendent de la façon dont votre agent s'exécute :
Si votre agent s'exécute | Mode auto | Score API | Examen des transcriptions |
dans Claude Code | Oui | Non. Claude Code ne surface pas le score | Oui |
directement contre l'API Messages | Non. Le mode auto est une fonctionnalité de Claude Code | Oui, sur l'API Claude propriétaire | Oui |
La surveillance dans ces conseils (examen des transcriptions et le score API) recherche les tentatives de quitter le bac à sable ou d'élargir l'accès au réseau. Elle ne détecte pas un agent qui reste dans son bac à sable mais dépasse l'engagement sur les hôtes qu'il est autorisé à atteindre.
L'injection de prompt n'est pas l'une des meilleures pratiques, mais elle importe chaque fois qu'un agent lit du contenu que quelqu'un en dehors de votre organisation a écrit.
Signalement du comportement hors de portée
Si un agent sonde son isolation de bac à sable ou de réseau, ou agit en dehors de l'engagement, notifiez votre équipe de compte Anthropic, en plus de ce que votre propre processus d'incident exige. Que faire en cas de détection décrit comment arrêter l'agent et ce qu'il faut collecter en premier.