Lewati ke konten utama

Program Bug Bounty Keselamatan Model

Tujuan

Kami percaya bahwa pengujian eksternal sangat penting untuk membangun ekosistem AI yang aman. Seiring dengan kemajuan kemampuan model, konsekuensi dari jailbreak dapat menjadi semakin signifikan. Program berkelanjutan ini dibangun atas dasar inisiatif bug bounty sebelumnya yang sukses dengan beberapa tujuan utama:

  1. Mengidentifikasi jailbreak universal dalam sistem yang kami terapkan dengan perlindungan ASL-3

  2. Memberikan penilaian berkelanjutan terhadap efektivitas perlindungan kami

  3. Menguji kemampuan sistem pemantauan kami untuk mendeteksi kerentanan

  4. Mendorong penggunaan satu saluran sah terpusat untuk melaporkan jailbreak yang tersedia untuk publik

Ikhtisar Program

Program Bug Bounty Keselamatan Model kami dijalankan melalui HackerOne. Melalui Program ini, kami tertarik untuk menemukan jailbreak universal yang melampaui sistem Constitutional Classifiers kami. Kami juga secara berkala menjalankan program yang ditargetkan dalam Program keseluruhan kami untuk menguji ketangguhan pengklasifikasi yang kami harapkan untuk diluncurkan di masa depan.

Jailbreak universal adalah teknik yang digeneralisasi yang secara andal membangkitkan respons yang melanggar kebijakan dari model bahasa, terlepas dari prompt input. Tidak seperti jailbreak sempit, yang bergantung pada spesifik pertanyaan atau konteks tertentu, jailbreak universal bekerja di berbagai prompt dan skenario.

Ini adalah Program berkelanjutan. Setelah diterima ke Program di HackerOne, peserta dapat mengirimkan laporan jailbreak kapan saja melalui Program ini. Untuk membantu upaya red-teaming Anda, kami menyediakan akses ke alias model gratis yang mencerminkan model dan pengklasifikasi yang aktif di model paling canggih terbaru kami. Penggunaan Anda terhadap alias model gratis ini harus terbatas pada melakukan aktivitas red-teaming yang berwenang.

Ruang Lingkup Program

Program ini terutama tertarik untuk menemukan jailbreak yang universal, dalam hal mereka dapat mengungkapkan informasi berbahaya di berbagai pertanyaan, dan terperinci, dalam hal mereka mengungkapkan informasi berbahaya yang sangat spesifik terkait ancaman biologis.

Untuk menekankan, kami tertarik pada jailbreak yang mengekstrak informasi yang menjawab serangkaian pertanyaan biologis berbahaya yang kami bagikan dengan peserta yang diterima dalam Program.

Kami akan membayar hingga $35.000 per jailbreak universal baru yang diidentifikasi. Kami hanya tertarik pada jailbreak yang mengungkapkan jumlah informasi berbahaya yang substansial berdasarkan kriteria dan kebijaksanaan kami sendiri. Kami memberikan bounty menggunakan skala geser berdasarkan rubrik penilaian internal yang menentukan seberapa terperinci dan akurat responsnya.

Program ini dibatasi pada jailbreak di Constitutional Classifiers kami. Untuk kerentanan teknis yang berpotensi ada di Sistem Informasi kami seperti salah konfigurasi, CSRF atau pemalsuan permintaan lintas situs, serangan eskalasi hak istimewa, SQL Injection, XSS, dan serangan traversal direktori, silakan lihat Kebijakan Pengungkapan Bertanggung Jawab kami dan kirimkan laporan Anda di sini.

Cara Mendaftar

Anda dapat mendaftar untuk bergabung dengan Program kami di sini. Kami meninjau aplikasi secara bergulir. Jika diterima, Anda akan menerima undangan melalui HackerOne. Jika Anda belum memiliki akun HackerOne, silakan buat satu sebelum mendaftar ke Program sehingga kami dapat mengundang Anda langsung di platform. Anda harus menggunakan alias email @wearehackerone.com Anda untuk membuat akun Claude Console.

Pedoman Pengungkapan & Kewajiban Kerahasiaan

Semua peserta Program diharuskan menandatangani perjanjian kerahasiaan untuk melindungi kerahasiaan Program sebagai syarat untuk bergabung. Anda dapat mengungkapkan secara publik:

  • Keberadaan Program Bug Bounty Keselamatan Model Anthropic.

  • Partisipasi Anda sebagai peserta terpilih dalam Program.

Anda tidak boleh mengungkapkan tanpa izin tegas:

  • Jailbreak/kerentanan apa pun (bahkan yang sudah diselesaikan) di luar Program tanpa persetujuan tegas dari Anthropic.

  • Kumpulan pertanyaan pengujian.

  • Detail tentang pengklasifikasi dan mitigasi keselamatan.

  • Informasi tentang model yang sedang diuji.

  • Identitas peserta lain.

  • Informasi lain apa pun yang terkait dengan Program, kecuali sebagaimana secara tegas diizinkan di atas.

Penggunaan Data Anthropic dari Program

Peserta setuju bahwa semua data yang disampaikan kepada Anthropic, termasuk produk dan layanannya, sehubungan dengan Program ini dapat digunakan, disimpan, dibagikan, dan/atau dipublikasikan oleh Anthropic tanpa batas waktu untuk memajukan penelitian keselamatan, pengembangan model, dan tujuan terkait tanpa kewajiban lebih lanjut kepada Peserta.

Apakah pertanyaan Anda terjawab?