Für Kunden in unserem Cyber Verification Program stellen wir einen neuen Sandbox-Escape-Klassifizierer in der API bereit, um unerwünschtes Verhalten zu überwachen und zu reduzieren. Dieser Artikel bietet einen Überblick über die verfügbaren Richtlinien mit Links zu jeder Ressource.
Dieser Klassifizierer befindet sich in der privaten Beta.
Diese Richtlinien werden wie vorliegend bereitgestellt, nur zu Informationszwecken. Sie beschreiben Empfehlungen, keine Anforderungen. Diese Praktiken sollten das Risiko reduzieren, können aber nicht jede Aktion außerhalb des Geltungsbereichs verhindern. Sie sind weiterhin verantwortlich für die Auswahl, das Testen und den Betrieb der Kontrollen, die zu Ihrer Umgebung passen.
Überblick über Best Practices
Führen Sie jeden autonomen Agent in einer hardwarevirtualisierten Sandbox aus. Das Referenzdesign verwendet eine microVM pro Agent (Kata Containers mit Firecracker) in einem internen Netzwerk (siehe Sandboxing).
Interaktive Nutzung, bei der ein Mensch jede Aktion genehmigt oder den Agent im Auto-Modus von Claude Code überwacht, ist mit weniger Risiko verbunden, aber wir empfehlen dennoch eine Sandbox. Der Auto-Modus allein ist eine Best-Effort-Überprüfung, kein Ersatz für Sandboxing. Wenn Sie interaktive, dateibasierte Arbeiten ohne Sandbox ausführen, überprüfen Sie jeden Schreibvorgang und führen Sie nichts aus, das der Agent geschrieben hat, ohne es zu lesen.
Mounten Sie niemals Pfade mit Anmeldedaten in die Umgebung des Agenten. Halten Sie auch die Anmeldedaten für das Modell-API aus der Umgebung des Agenten fern: Verwenden Sie einen separaten Proxy, um sie zu den API-Anfragen des Agenten hinzuzufügen (siehe den Abschnitt zum Anmeldedaten-Proxy in Sandboxing).
Führen Sie Claude Code-Agenten im Auto-Berechtigungsmodus als zusätzliche Überprüfung in der Sandbox aus (siehe Auto-Modus). Sein Klassifizierer kann einige legitime Sicherheitsarbeiten ablehnen; dieser Artikel erklärt, was zu erwarten ist und wie man ihn anpasst.
Bewahren Sie Agent-Transkripte und Proxy-Protokolle mindestens 30 Tage lang auf, überprüfen Sie sie während und nach Läufen (siehe Offline-Überwachung von Agent-Transkripten), und benachrichtigen Sie Ihr Anthropic-Kontoteam, wenn Sie sehen, dass ein Agent außerhalb seines Geltungsbereichs handelt.
Überblick über Artikel
Die Richtlinien decken fünf Bereiche ab:
Sandboxing. Warum autonome Agenten starke Isolation benötigen, wie das Referenzdesign sie isoliert, und wie man Engagements mit Netzwerkzugriff scoped und überwacht.
Agent-Berechtigungen: Auto-Modus. Warum Agenten unter einem Berechtigungsklassifizierer ausgeführt werden sollten, worauf man sich verlassen kann und worauf nicht, und was man dem Klassifizierer mitteilen sollte.
Prompt-Injection. Wie Text von einem Ziel einen Agent lenken könnte, und wie man die Auswirkung begrenzt.
Offline-Überwachung von Agent-Transkripten. Worauf man in Agent-Transkripten und Proxy-Protokollen achten sollte, wie man es tut, und wie lange man sie aufbewahrt.
Online-Überwachung: Sandbox-Escape-Scores in API-Antworten. Für Agenten, die Sie direkt gegen die Messages API ausführen: der Pro-Request-Score vom Sandbox-Escape-Klassifizierer, wie man ihn anfordert, und wie man ihn liest.
Wie diese Richtlinien den Best Practices entsprechen
Best Practice | Wo es behandelt wird | Was Sie tun |
Sandbox- und Netzwerkisolation | Führen Sie jeden Agent in seiner eigenen VM mit einem gehärteten Host aus, verweigern Sie Egress standardmäßig, und halten Sie die Anmeldedaten für das Modell-API in einem Proxy außerhalb der Sandbox. | |
Validierung vor dem Engagement | Überprüfen Sie die Konfiguration und führen Sie einen überwachten Escape-Test auf jedem neuen Host durch, nach jeder Sandbox-Änderung und mit jedem neuen Modell. Bestätigen Sie, dass das Ziel erstellt wird und der Agent die benötigten Tools hat. | |
Transkriptaufbewahrung und -überprüfung | Schreiben Sie ein Transkript für jede Agent-Phase, scannen Sie Transkripte nach Plan, lesen Sie, was die Scans kennzeichnen, und bewahren Sie Transkripte und Protokolle mindestens 30 Tage lang auf. | |
Sandbox-Escape-Klassifizierer | Fordern Sie den Score von Agenten an, die Sie direkt gegen die Messages API ausführen, und verwenden Sie ihn, um zu entscheiden, welche Transkripte Sie zuerst lesen. Er ist nicht für Agenten verfügbar, die in Claude Code ausgeführt werden, oder auf Amazon Bedrock oder Google Clouds Agent Platform (Vertex AI). | |
Auto-Modus | Führen Sie Claude Code-Agenten im Auto-Modus aus, und beschreiben Sie Ihre Umgebung dem Klassifizierer. | |
Netzwerk-Scoping | Whitelist nur die im Geltungsbereich liegenden Ziele, und bevorzugen Sie eine Staging- oder Replica-Umgebung. | |
Explizite Geltungsbereichsfestlegung | Geben Sie den Geltungsbereich in den Anweisungen an, die Sie jedem Agent geben. | |
Vermittelte Tool-Nutzung | Platzieren Sie einen beobachtbaren Proxy oder ein Tool zwischen dem Agent und dem Ziel. | |
Menschliche Überwachung | Überwachen Sie Läufe mit Netzwerkzugriff, begrenzen Sie die Anzahl der Turns und die Laufzeit jedes Agenten, und wissen Sie, wie man einen Agent stoppt. | |
Ziele mit hohen Konsequenzen | Richten Sie autonome Agenten nicht auf Live-Systeme aus, deren Ausfall die Sicherheit oder kritische Dienste gefährden könnte. |
Welche Überprüfungen gelten, hängt davon ab, wie Ihr Agent ausgeführt wird:
Wenn Ihr Agent ausgeführt wird | Auto-Modus | API-Score | Transkript-Überprüfung |
in Claude Code | Ja | Nein. Claude Code zeigt den Score nicht an | Ja |
direkt gegen die Messages API | Nein. Auto-Modus ist eine Claude Code-Funktion | Ja, auf der First-Party Claude API | Ja |
Die Überwachung in dieser Richtlinie (Transkript-Überprüfung und der API-Score) sucht nach Versuchen, die Sandbox zu verlassen oder den Netzwerkzugriff zu erweitern. Sie erkennt keinen Agent, der in seiner Sandbox bleibt, aber das Engagement auf Hosts überschreitet, auf die er Zugriff hat.
Prompt-Injection ist keine der Best Practices, aber es ist wichtig, wenn ein Agent Inhalte liest, die jemand außerhalb Ihrer Organisation geschrieben hat.
Meldung von Verhalten außerhalb des Geltungsbereichs
Wenn ein Agent seine Sandbox oder Netzwerkisolation testet oder außerhalb des Engagements handelt, benachrichtigen Sie Ihr Anthropic-Kontoteam zusätzlich zu allen Anforderungen Ihres eigenen Incident-Prozesses. Was bei einem Hit zu tun ist beschreibt, wie man den Agent stoppt und was man zuerst sammelt.