Ir al contenido principal

Programa de Recompensas por Vulnerabilidades de Seguridad del Modelo

Propósito

Creemos que las pruebas externas son cruciales para construir un ecosistema de IA seguro. A medida que avanzan las capacidades de los modelos, las consecuencias de los jailbreaks podrían volverse cada vez más significativas. Este Programa continuo se basa en nuestras iniciativas anteriores exitosas de recompensas por vulnerabilidades con varios objetivos clave:

  1. Identificar jailbreaks universales en nuestros sistemas implementados con protecciones ASL-3

  2. Proporcionar evaluación continua de la efectividad de nuestras salvaguardas

  3. Probar la capacidad de nuestros sistemas de monitoreo para detectar vulnerabilidades

  4. Incentivar el uso de un canal legítimo central único para reportar jailbreaks disponibles públicamente

Descripción General del Programa

Nuestro Programa de Recompensas por Vulnerabilidades de Seguridad del Modelo se ejecuta a través de HackerOne. A través de este Programa, nos interesa encontrar jailbreaks universales que superen nuestro sistema de Clasificadores Constitucionales. También ejecutamos ocasionalmente programas dirigidos dentro de nuestro Programa general para probar la robustez de los clasificadores que esperamos lanzar en el futuro.

Un jailbreak universal es una técnica generalizada que extrae de manera confiable respuestas que violan políticas de un modelo de lenguaje, independientemente del prompt de entrada. A diferencia de los jailbreaks estrechos, que dependen de los detalles de una pregunta o contexto particular, los jailbreaks universales funcionan en una amplia gama de prompts y escenarios.

Este es un Programa continuo. Una vez aceptado en el Programa en HackerOne, los participantes pueden enviar reportes de jailbreak en cualquier momento a través de este Programa. Para ayudarte con tus esfuerzos de pruebas de seguridad, proporcionamos acceso a un alias de modelo gratuito que refleja el modelo y los clasificadores activos en nuestro modelo más reciente y avanzado. Tu uso de este alias de modelo gratuito debe limitarse a realizar actividades autorizadas de pruebas de seguridad.

Alcance del Programa

Este Programa está principalmente interesado en descubrir jailbreaks que sean universales, en el sentido de que pueden revelar información dañina en una amplia gama de consultas, y detallados, en el sentido de que revelan información dañina altamente específica relacionada con amenazas biológicas.

Para enfatizar, nos interesan los jailbreaks que extraen información que responde a un conjunto de preguntas biológicas dañinas que compartimos con los participantes aceptados en el Programa.

Pagaremos hasta $35,000 por cada jailbreak universal novel identificado. Solo nos interesan los jailbreaks que revelen cantidades sustanciales de información dañina según nuestros criterios únicos y discreción. Otorgamos recompensas utilizando una escala móvil basada en una rúbrica de calificación interna que determina cuán detalladas y precisas son las respuestas.

Este programa se limita a jailbreaks en nuestros Clasificadores Constitucionales. Para vulnerabilidades técnicas que potencialmente existen en nuestros Sistemas de Información, como configuraciones incorrectas, CSRF o falsificaciones de solicitud entre sitios, ataques de escalada de privilegios, inyección SQL, XSS y ataques de traversal de directorios, consulta nuestra Política de Divulgación Responsable y envía tu reporte aquí.

Cómo Solicitar

Puedes solicitar unirte a nuestro Programa aquí. Revisamos las solicitudes de forma continua. Si eres aceptado, recibirás una invitación a través de HackerOne. Si aún no tienes una cuenta de HackerOne, crea una antes de solicitar el Programa para que podamos invitarte directamente en la plataforma. Debes usar tu alias de correo electrónico @wearehackerone.com para crear una cuenta de Claude Console.

Directrices de Divulgación y Obligaciones de Confidencialidad

Se requiere que todos los participantes del Programa firmen un acuerdo de no divulgación para proteger la confidencialidad del Programa como condición para unirse. Puedes divulgar públicamente:

  • La existencia del Programa de Recompensas por Vulnerabilidades de Seguridad del Modelo de Anthropic.

  • Tu participación como participante seleccionado en el Programa.

No puedes divulgar sin permiso expreso:

  • Ningún jailbreak/vulnerabilidad (incluso los resueltos) fuera del Programa sin consentimiento expreso de Anthropic.

  • El conjunto de preguntas de prueba.

  • Detalles sobre los clasificadores y mitigaciones de seguridad.

  • Información sobre los modelos siendo probados.

  • Identidad de otros participantes.

  • Cualquier otra información relacionada con el Programa, excepto según lo expresamente permitido anteriormente.

Uso de Datos del Programa por Anthropic

El Participante acepta que todos los datos enviados a Anthropic, incluidos sus productos y servicios, en conexión con este Programa pueden ser utilizados, almacenados, compartidos y/o publicados por Anthropic indefinidamente en furtherance de su investigación de seguridad, desarrollo de modelos y propósitos relacionados sin obligación adicional al Participante.

¿Ha quedado contestada tu pregunta?