Passer au contenu principal

Meilleures pratiques de confinement des agents : premiers pas (bêta privée)

Pour les clients de notre programme de vérification de cybersécurité, nous fournissons un nouveau classificateur d'échappement de bac à sable dans l'API pour surveiller et réduire les comportements indésirables. Cet article fournit un aperçu des conseils disponibles, avec des liens vers chaque ressource.

Ce classificateur est en bêta privée.

Ces conseils sont fournis tels quels, à titre informatif uniquement. Ils décrivent des recommandations, non des exigences. Ces pratiques devraient réduire les risques mais peuvent ne pas prévenir chaque action hors de portée. Vous restez responsable du choix, du test et de l'exploitation des contrôles adaptés à votre environnement.

Aperçu des meilleures pratiques

  • Exécutez chaque agent autonome dans un bac à sable virtualisé par matériel. La conception de référence utilise une microVM par agent (Kata Containers avec Firecracker) sur un réseau interne (voir Sandboxing).

  • L'utilisation interactive, avec un humain approuvant chaque action ou supervisant l'agent en mode auto de Claude Code, présente moins de risques, mais nous recommandons toujours un bac à sable. Le mode auto seul est une vérification au mieux, pas un substitut au sandboxing. Si vous exécutez un travail interactif et basé sur des fichiers sans bac à sable, examinez chaque écriture et n'exécutez rien que l'agent a écrit sans le lire.

  • Ne montez jamais de chemins porteurs de credentials dans l'environnement de l'agent. Gardez également la credential modèle-API hors de l'environnement de l'agent : faites en sorte qu'un proxy séparé l'ajoute aux demandes API de l'agent (voir la section proxy de credential dans Sandboxing).

  • Exécutez les agents Claude Code en mode permission auto comme vérification supplémentaire dans le bac à sable (voir Mode auto). Son classificateur peut refuser certains travaux de sécurité légitimes ; cet article explique à quoi s'attendre et comment l'ajuster.

  • Conservez les transcriptions d'agents et les journaux de proxy pendant au moins 30 jours, examinez-les pendant et après les exécutions (voir Surveillance hors ligne des transcriptions d'agents), et informez votre équipe de compte Anthropic si vous voyez un agent agir en dehors de sa portée.

Aperçu des articles

Les conseils couvrent cinq domaines :

Comment ces conseils correspondent aux meilleures pratiques

Meilleure pratique

Où c'est couvert

Ce que vous faites

Isolation du bac à sable et du réseau

Exécutez chaque agent dans sa propre VM avec un hôte renforcé, refusez l'egress par défaut, et gardez la credential modèle-API dans un proxy en dehors du bac à sable.

Validation pré-engagement

Examinez la configuration et exécutez un test d'échappement supervisé sur chaque nouvel hôte, après chaque modification du bac à sable, et avec chaque nouveau modèle. Confirmez que la cible se construit et que l'agent dispose des outils dont il a besoin.

Rétention et examen des transcriptions

Écrivez une transcription pour chaque étape d'agent, analysez les transcriptions selon un calendrier, lisez ce que les analyses signalent, et conservez les transcriptions et les journaux pendant au moins 30 jours.

Classificateur d'échappement de bac à sable

Demandez le score des agents que vous exécutez directement contre l'API Messages, et utilisez-le pour décider quelles transcriptions lire en premier. Il n'est pas disponible pour les agents qui s'exécutent dans Claude Code, ou sur Amazon Bedrock ou la plateforme Agent de Google Cloud (Vertex AI).

Mode auto

Exécutez les agents Claude Code en mode auto, et décrivez votre environnement au classificateur.

Délimitation du réseau

Mettez en liste blanche uniquement les cibles dans la portée, et préférez un environnement de staging ou de réplica.

Définition explicite de la portée

Énoncez la portée dans les instructions que vous donnez à chaque agent.

Utilisation d'outils intermédiée

Placez un proxy observable ou un outil entre l'agent et la cible.

Supervision humaine

Surveillez les exécutions qui ont accès au réseau, limitez les tours et le temps d'exécution de chaque agent, et sachez comment arrêter un agent.

Cibles à conséquences élevées

Ne pointez pas les agents autonomes vers des systèmes en direct dont la défaillance pourrait mettre en danger la sécurité ou les services critiques.

Les vérifications applicables dépendent de la façon dont votre agent s'exécute :

Si votre agent s'exécute

Mode auto

Score API

Examen des transcriptions

dans Claude Code

Oui

Non. Claude Code ne surface pas le score

Oui

directement contre l'API Messages

Non. Le mode auto est une fonctionnalité de Claude Code

Oui, sur l'API Claude propriétaire

Oui

La surveillance dans ces conseils (examen des transcriptions et le score API) recherche les tentatives de quitter le bac à sable ou d'élargir l'accès au réseau. Elle ne détecte pas un agent qui reste dans son bac à sable mais dépasse l'engagement sur les hôtes qu'il est autorisé à atteindre.

L'injection de prompt n'est pas l'une des meilleures pratiques, mais elle importe chaque fois qu'un agent lit du contenu que quelqu'un en dehors de votre organisation a écrit.

Signalement du comportement hors de portée

Si un agent sonde son isolation de bac à sable ou de réseau, ou agit en dehors de l'engagement, notifiez votre équipe de compte Anthropic, en plus de ce que votre propre processus d'incident exige. Que faire en cas de détection décrit comment arrêter l'agent et ce qu'il faut collecter en premier.

Avez-vous trouvé la réponse à votre question ?