Для клиентов нашей программы Cyber Verification Program мы предоставляем новый классификатор побега из песочницы в API для мониторинга и снижения нежелательного поведения. Эта статья содержит обзор доступного вам руководства со ссылками на каждый ресурс.
Этот классификатор находится в закрытой бета-версии.
Это руководство предоставляется в том виде, в котором оно есть, только в информационных целях. Оно описывает рекомендации, а не требования. Эти практики должны снизить риск, но могут не предотвратить все действия вне области применения. Вы остаетесь ответственны за выбор, тестирование и эксплуатацию элементов управления, которые подходят для вашей среды.
Обзор лучших практик
Запускайте каждого автономного агента внутри аппаратно-виртуализированной песочницы. Эталонный дизайн использует одну microVM на агента (Kata Containers с Firecracker) во внутренней сети (см. Sandboxing).
Интерактивное использование, когда человек одобряет каждое действие или контролирует агента в режиме auto режима Claude Code, несет меньший риск, но мы все равно рекомендуем песочницу. Режим auto сам по себе — это проверка на основе лучших усилий, а не замена для песочницы. Если вы запускаете интерактивную работу только с файлами без песочницы, проверьте каждую запись и не запускайте ничего, что написал агент, без его прочтения.
Никогда не монтируйте пути, содержащие учетные данные, в окружение агента. Также держите учетные данные модели-API вне окружения агента: используйте отдельный прокси для добавления их к запросам API агента (см. раздел прокси учетных данных в Sandboxing).
Запускайте агентов Claude Code в режиме автоматического разрешения как дополнительную проверку внутри песочницы (см. Auto mode). Его классификатор может отклонить некоторые законные работы по безопасности; эта статья объясняет, чего ожидать и как его настроить.
Сохраняйте стенограммы агентов и логи прокси как минимум 30 дней, проверяйте их во время и после запусков (см. Offline monitoring of agent transcripts) и сообщите команде вашего аккаунта Anthropic, если вы видите, что агент действует вне своей области.
Обзор статей
Руководство охватывает пять областей:
Sandboxing. Почему автономные агенты нуждаются в сильной изоляции, как эталонный дизайн их изолирует и как определить область и контролировать взаимодействия, которым требуется доступ в сеть.
Agent permissions: auto mode. Почему агенты должны работать под классификатором разрешений, на что он может и не может полагаться, и что сказать классификатору.
Prompt injection. Как текст из целевого объекта может направить агента и как ограничить эффект.
Offline monitoring of agent transcripts. Что искать в стенограммах агентов и логах прокси, как это делать и как долго их хранить.
Online monitoring: sandbox-escape scores in API responses. Для агентов, которых вы запускаете непосредственно против Messages API: оценка за запрос от классификатора побега из песочницы, как ее запросить и как ее читать.
Как это руководство соответствует лучшим практикам
Лучшая практика | Где это описано | Что вы делаете |
Изоляция песочницы и сети | Запускайте каждого агента в его собственной ВМ с усиленным хостом, запретите исходящий трафик по умолчанию и держите учетные данные модели-API в прокси вне песочницы. | |
Проверка перед взаимодействием | Проверьте конфигурацию и запустите контролируемый тест побега на каждом новом хосте, после каждого изменения песочницы и с каждой новой моделью. Подтвердите, что целевой объект собирается и агент имеет необходимые ему инструменты. | |
Сохранение и проверка стенограмм | Напишите стенограмму для каждого этапа агента, сканируйте стенограммы по расписанию, прочитайте то, что отмечают сканы, и сохраняйте стенограммы и логи как минимум 30 дней. | |
Классификатор побега из песочницы | Запросите оценку от агентов, которых вы запускаете непосредственно против Messages API, и используйте ее для определения того, какие стенограммы читать в первую очередь. Она недоступна для агентов, которые работают в Claude Code, или на Amazon Bedrock или Google Cloud Agent Platform (Vertex AI). | |
Режим auto | Запускайте агентов Claude Code в режиме auto и опишите вашу среду классификатору. | |
Определение области сети | Добавьте в список разрешений только целевые объекты в области применения и предпочитайте промежуточную или реплицированную среду. | |
Явное определение области | Укажите область в инструкциях, которые вы даете каждому агенту. | |
Использование инструментов через посредника | Поместите наблюдаемый прокси или инструмент между агентом и целевым объектом. | |
Контроль человека | Наблюдайте за запусками, которые имеют доступ в сеть, ограничьте количество ходов и время выполнения каждого агента и знайте, как остановить агента. | |
Целевые объекты с высокими последствиями | Не указывайте автономные агенты на живые системы, отказ которых может угрожать безопасности или критическим услугам. |
Какие проверки применяются, зависит от того, как работает ваш агент:
Если ваш агент работает | Режим auto | Оценка API | Проверка стенограммы |
в Claude Code | Да | Нет. Claude Code не отображает оценку | Да |
непосредственно против Messages API | Нет. Режим auto — это функция Claude Code | Да, на первостороннем Claude API | Да |
Мониторинг в этом руководстве (проверка стенограмм и оценка API) ищет попытки покинуть песочницу или расширить доступ в сеть. Он не обнаруживает агента, который остается внутри своей песочницы, но превышает взаимодействие на хостах, к которым ему разрешен доступ.
Внедрение подсказок не является одной из лучших практик, но это важно, когда агент читает контент, который написал кто-то вне вашей организации.
Сообщение о поведении вне области
Если агент проверяет свою песочницу или сетевую изоляцию, или действует вне взаимодействия, уведомите команду вашего аккаунта Anthropic в дополнение к любому процессу инцидентов, который требует ваша организация. What to do on a hit описывает, как остановить агента и что собрать в первую очередь.