사이버 검증 프로그램의 고객을 위해 API에서 원치 않는 동작을 모니터링하고 줄이기 위한 새로운 샌드박스 탈출 분류기를 제공합니다. 이 문서는 사용 가능한 지침의 개요와 각 리소스로의 링크를 제공합니다.
이 분류기는 비공개 베타 상태입니다.
이 지침은 정보 제공 목적으로만 현재 상태대로 제공됩니다. 요구사항이 아닌 권장사항을 설명합니다. 이러한 관행은 위험을 줄일 수 있지만 모든 범위 외 작업을 방지하지 못할 수 있습니다. 사용자는 자신의 환경에 맞는 제어를 선택, 테스트 및 운영할 책임이 있습니다.
모범 사례 개요
모든 자율 에이전트를 하드웨어 가상화 샌드박스 내에서 실행합니다. 참조 설계는 내부 네트워크의 에이전트당 하나의 마이크로VM(Firecracker가 포함된 Kata Containers)을 사용합니다(샌드박싱 참조).
인간이 모든 작업을 승인하거나 Claude Code의 자동 모드에서 에이전트를 감독하는 대화형 사용은 위험이 적지만 여전히 샌드박스를 권장합니다. 자동 모드 자체는 샌드박싱의 대체물이 아닌 최선의 노력 확인입니다. 샌드박스 없이 대화형 파일 전용 작업을 실행하는 경우 모든 쓰기를 검토하고 에이전트가 작성한 것을 읽지 않고 실행하지 마십시오.
자격증명을 포함하는 경로를 에이전트의 환경에 마운트하지 마십시오. 모델-API 자격증명도 에이전트의 환경에서 제외하십시오. 별도의 프록시가 에이전트의 API 요청에 추가하도록 합니다(샌드박싱의 자격증명 프록시 섹션 참조).
샌드박스 내의 추가 확인으로 Claude Code 에이전트를 자동 권한 모드에서 실행합니다(자동 모드 참조). 분류기가 일부 정당한 보안 작업을 거부할 수 있습니다. 해당 문서에서는 예상할 사항과 조정 방법을 설명합니다.
에이전트 기록 및 프록시 로그를 최소 30일 동안 유지하고, 실행 중 및 실행 후에 검토하며(에이전트 기록의 오프라인 모니터링 참조), 에이전트가 범위를 벗어나 작동하는 것을 발견하면 Anthropic 계정 팀에 알립니다.
문서 개요
지침은 5가지 영역을 다룹니다:
샌드박싱. 자율 에이전트가 강력한 격리가 필요한 이유, 참조 설계가 이들을 격리하는 방법, 네트워크 액세스가 필요한 참여의 범위를 정하고 감독하는 방법.
에이전트 권한: 자동 모드. 에이전트가 권한 분류기 아래에서 실행되어야 하는 이유, 의존할 수 있는 것과 없는 것, 분류기에 알려야 할 사항.
프롬프트 주입. 대상의 텍스트가 에이전트를 조종하는 방법과 영향을 제한하는 방법.
에이전트 기록의 오프라인 모니터링. 에이전트 기록 및 프록시 로그에서 찾을 사항, 수행 방법, 유지 기간.
온라인 모니터링: API 응답의 샌드박스 탈출 점수. Messages API에 대해 직접 실행하는 에이전트의 경우: 샌드박스 탈출 분류기의 요청당 점수, 요청 방법, 읽는 방법.
이 지침이 모범 사례에 매핑되는 방법
모범 사례 | 다루는 위치 | 수행할 작업 |
샌드박스 및 네트워크 격리 | 각 에이전트를 자체 VM에서 강화된 호스트로 실행하고, 기본적으로 송신을 거부하며, 모델-API 자격증명을 샌드박스 외부의 프록시에 유지합니다. | |
참여 전 검증 | 각 새 호스트에서, 각 샌드박스 변경 후, 각 새 모델로 구성을 검토하고 감독된 탈출 테스트를 실행합니다. 대상이 빌드되고 에이전트에 필요한 도구가 있는지 확인합니다. | |
기록 보존 및 검토 | 모든 에이전트 단계에 대한 기록을 작성하고, 일정에 따라 기록을 스캔하며, 스캔이 플래그한 내용을 읽고, 기록 및 로그를 최소 30일 동안 유지합니다. | |
샌드박스 탈출 분류기 | Messages API에 대해 직접 실행하는 에이전트에서 점수를 요청하고 이를 사용하여 먼저 읽을 기록을 결정합니다. Claude Code에서 실행되는 에이전트나 Amazon Bedrock 또는 Google Cloud의 에이전트 플랫폼(Vertex AI)에서는 사용할 수 없습니다. | |
자동 모드 | Claude Code 에이전트를 자동 모드에서 실행하고, 분류기에 환경을 설명합니다. | |
네트워크 범위 지정 | 범위 내 대상만 허용 목록에 추가하고 스테이징 또는 복제 환경을 선호합니다. | |
명시적 범위 설정 | 각 에이전트에 제공하는 지침에서 범위를 명시합니다. | |
중개 도구 사용 | 에이전트와 대상 사이에 관찰 가능한 프록시 또는 도구를 배치합니다. | |
인간 감독 | 네트워크 액세스 권한이 있는 실행을 감시하고, 모든 에이전트의 턴과 실행 시간을 제한하며, 에이전트를 중지하는 방법을 알아야 합니다. | |
높은 영향도 대상 | 자율 에이전트를 장애가 안전이나 중요 서비스를 위협할 수 있는 라이브 시스템에 지정하지 마십시오. |
적용되는 확인은 에이전트 실행 방식에 따라 다릅니다:
에이전트가 실행되는 경우 | 자동 모드 | API 점수 | 기록 검토 |
Claude Code에서 | 예 | 아니요. Claude Code는 점수를 표시하지 않습니다 | 예 |
Messages API에 대해 직접 | 아니요. 자동 모드는 Claude Code 기능입니다 | 예, 1차 Claude API에서 | 예 |
이 지침의 모니터링(기록 검토 및 API 점수)은 샌드박스를 떠나거나 네트워크 액세스를 확대하려는 시도를 찾습니다. 에이전트가 샌드박스 내에 머물지만 액세스할 수 있는 호스트에서 참여를 초과하는 경우는 감지하지 않습니다.
프롬프트 주입은 모범 사례 중 하나가 아니지만 에이전트가 조직 외부의 누군가가 작성한 콘텐츠를 읽을 때마다 중요합니다.
범위 외 동작 보고
에이전트가 샌드박스 또는 네트워크 격리를 조사하거나 참여 범위를 벗어나 작동하는 경우, 자신의 인시던트 프로세스에서 요구하는 것 외에도 Anthropic 계정 팀에 알립니다. 히트 시 수행할 작업에서는 에이전트를 중지하는 방법과 먼저 수집할 사항을 설명합니다.