К основному содержимому

Лучшие практики изоляции агентов: начало работы (закрытая бета)

Для клиентов нашей программы Cyber Verification Program мы предоставляем новый классификатор побега из песочницы в API для мониторинга и снижения нежелательного поведения. Эта статья содержит обзор доступного вам руководства со ссылками на каждый ресурс.

Этот классификатор находится в закрытой бета-версии.

Это руководство предоставляется в том виде, в котором оно есть, только в информационных целях. Оно описывает рекомендации, а не требования. Эти практики должны снизить риск, но могут не предотвратить все действия вне области применения. Вы остаетесь ответственны за выбор, тестирование и эксплуатацию элементов управления, которые подходят для вашей среды.

Обзор лучших практик

  • Запускайте каждого автономного агента внутри аппаратно-виртуализированной песочницы. Эталонный дизайн использует одну microVM на агента (Kata Containers с Firecracker) во внутренней сети (см. Sandboxing).

  • Интерактивное использование, когда человек одобряет каждое действие или контролирует агента в режиме auto режима Claude Code, несет меньший риск, но мы все равно рекомендуем песочницу. Режим auto сам по себе — это проверка на основе лучших усилий, а не замена для песочницы. Если вы запускаете интерактивную работу только с файлами без песочницы, проверьте каждую запись и не запускайте ничего, что написал агент, без его прочтения.

  • Никогда не монтируйте пути, содержащие учетные данные, в окружение агента. Также держите учетные данные модели-API вне окружения агента: используйте отдельный прокси для добавления их к запросам API агента (см. раздел прокси учетных данных в Sandboxing).

  • Запускайте агентов Claude Code в режиме автоматического разрешения как дополнительную проверку внутри песочницы (см. Auto mode). Его классификатор может отклонить некоторые законные работы по безопасности; эта статья объясняет, чего ожидать и как его настроить.

  • Сохраняйте стенограммы агентов и логи прокси как минимум 30 дней, проверяйте их во время и после запусков (см. Offline monitoring of agent transcripts) и сообщите команде вашего аккаунта Anthropic, если вы видите, что агент действует вне своей области.

Обзор статей

Руководство охватывает пять областей:

  • Sandboxing. Почему автономные агенты нуждаются в сильной изоляции, как эталонный дизайн их изолирует и как определить область и контролировать взаимодействия, которым требуется доступ в сеть.

  • Agent permissions: auto mode. Почему агенты должны работать под классификатором разрешений, на что он может и не может полагаться, и что сказать классификатору.

  • Prompt injection. Как текст из целевого объекта может направить агента и как ограничить эффект.

  • Offline monitoring of agent transcripts. Что искать в стенограммах агентов и логах прокси, как это делать и как долго их хранить.

  • Online monitoring: sandbox-escape scores in API responses. Для агентов, которых вы запускаете непосредственно против Messages API: оценка за запрос от классификатора побега из песочницы, как ее запросить и как ее читать.

Как это руководство соответствует лучшим практикам

Лучшая практика

Где это описано

Что вы делаете

Изоляция песочницы и сети

Запускайте каждого агента в его собственной ВМ с усиленным хостом, запретите исходящий трафик по умолчанию и держите учетные данные модели-API в прокси вне песочницы.

Проверка перед взаимодействием

Проверьте конфигурацию и запустите контролируемый тест побега на каждом новом хосте, после каждого изменения песочницы и с каждой новой моделью. Подтвердите, что целевой объект собирается и агент имеет необходимые ему инструменты.

Сохранение и проверка стенограмм

Напишите стенограмму для каждого этапа агента, сканируйте стенограммы по расписанию, прочитайте то, что отмечают сканы, и сохраняйте стенограммы и логи как минимум 30 дней.

Классификатор побега из песочницы

Запросите оценку от агентов, которых вы запускаете непосредственно против Messages API, и используйте ее для определения того, какие стенограммы читать в первую очередь. Она недоступна для агентов, которые работают в Claude Code, или на Amazon Bedrock или Google Cloud Agent Platform (Vertex AI).

Режим auto

Запускайте агентов Claude Code в режиме auto и опишите вашу среду классификатору.

Определение области сети

Добавьте в список разрешений только целевые объекты в области применения и предпочитайте промежуточную или реплицированную среду.

Явное определение области

Укажите область в инструкциях, которые вы даете каждому агенту.

Использование инструментов через посредника

Поместите наблюдаемый прокси или инструмент между агентом и целевым объектом.

Контроль человека

Наблюдайте за запусками, которые имеют доступ в сеть, ограничьте количество ходов и время выполнения каждого агента и знайте, как остановить агента.

Целевые объекты с высокими последствиями

Не указывайте автономные агенты на живые системы, отказ которых может угрожать безопасности или критическим услугам.

Какие проверки применяются, зависит от того, как работает ваш агент:

Если ваш агент работает

Режим auto

Оценка API

Проверка стенограммы

в Claude Code

Да

Нет. Claude Code не отображает оценку

Да

непосредственно против Messages API

Нет. Режим auto — это функция Claude Code

Да, на первостороннем Claude API

Да

Мониторинг в этом руководстве (проверка стенограмм и оценка API) ищет попытки покинуть песочницу или расширить доступ в сеть. Он не обнаруживает агента, который остается внутри своей песочницы, но превышает взаимодействие на хостах, к которым ему разрешен доступ.

Внедрение подсказок не является одной из лучших практик, но это важно, когда агент читает контент, который написал кто-то вне вашей организации.

Сообщение о поведении вне области

Если агент проверяет свою песочницу или сетевую изоляцию, или действует вне взаимодействия, уведомите команду вашего аккаунта Anthropic в дополнение к любому процессу инцидентов, который требует ваша организация. What to do on a hit описывает, как остановить агента и что собрать в первую очередь.

Нашли ответ на свой вопрос?