跳至主要內容

模型安全漏洞賞金計畫

目的

我們相信外部測試對於建立安全的人工智慧生態系統至關重要。隨著模型能力的進步,越獄的後果可能會變得越來越重大。本持續計畫以我們之前成功的漏洞賞金計畫為基礎,具有幾個關鍵目標:

  1. 識別我們已部署系統中具有 ASL-3 保護的通用越獄

  2. 持續評估我們安全措施的有效性

  3. 測試我們監控系統偵測漏洞的能力

  4. 激勵使用者透過一個中央合法管道報告公開可用的越獄

計畫概述

我們的模型安全漏洞賞金計畫透過 HackerOne 運營。透過本計畫,我們有興趣尋找超越我們 Constitutional Classifiers 系統的通用越獄。我們也會不時在整體計畫內運營針對性計畫,以測試我們希望在未來推出的分類器的穩健性。

通用越獄是一種廣泛的技術,無論輸入提示如何,都能可靠地從語言模型引發違反政策的回應。與依賴特定問題或背景細節的狹隘越獄不同,通用越獄可在廣泛的提示和情境中發揮作用。

這是一項持續的計畫。一旦在 HackerOne 上被接受加入計畫,參與者可以隨時透過本計畫提交越獄報告。為了幫助您的紅隊測試工作,我們提供對免費模型別名的存取權限,該別名反映了我們最新、最先進模型上的即時模型和分類器您對此免費模型別名的使用必須限於執行授權的紅隊測試活動。

計畫範圍

本計畫主要有興趣發現通用的越獄,即能夠在廣泛的查詢中揭示有害資訊的越獄,以及詳細的越獄,即揭示與生物威脅相關的高度具體有害資訊的越獄。

強調一下,我們有興趣的越獄是那些提取資訊以回答我們與計畫中被接受的參與者分享的一組有害生物學問題的越獄。

我們將為每個新穎的通用越獄支付最高 $35,000。我們只對根據我們的唯一標準和裁量權揭示大量有害資訊的越獄感興趣。我們使用基於內部評分標準的滑動比例來頒發賞金,該標準決定了回應的詳細程度和準確性。

本計畫的範圍限於我們 Constitutional Classifiers 上的越獄。對於可能存在於我們資訊系統上的技術漏洞,例如配置錯誤、CSRF 或跨站請求偽造、權限提升攻擊、SQL 注入、XSS 和目錄遍歷攻擊,請參閱我們的 負責任披露政策並在此處提交您的報告。

如何申請

您可以在此申請加入我們的計畫。我們會持續審查申請。如果被接受,您將透過 HackerOne 收到邀請。如果您還沒有 HackerOne 帳戶,請在申請計畫前建立一個帳戶,以便我們可以直接在平台上邀請您。您必須使用您的 @wearehackerone.com 電子郵件別名來建立 Claude Console 帳戶

披露指南與保密義務

所有計畫參與者都必須簽署保密協議,以保護計畫機密性作為加入的條件。您可以公開披露:

  • Anthropic 模型安全漏洞賞金計畫的存在。

  • 您作為計畫中被選中的參與者的參與情況。

未經明確許可,您不得披露:

  • 未經 Anthropic 明確同意,不得在計畫外披露任何越獄/漏洞(即使已解決)。

  • 測試問題集。

  • 有關分類器和安全緩解措施的詳細資訊。

  • 有關正在測試的模型的資訊。

  • 其他參與者的身份。

  • 與計畫相關的任何其他資訊,除非上述明確允許。

Anthropic 對計畫數據的使用

參與者同意,提交給 Anthropic 的所有數據,包括其產品和服務,與本計畫相關,可由 Anthropic 無限期地使用、儲存、共享和/或發佈,以推進其安全研究、模型開發和相關目的,無需進一步對參與者的義務。

是否回答了您的問題?