Ya sea que recién esté comenzando el proceso de configurar protecciones para su implementación de API de Claude, o su implementación ya esté en funcionamiento, aquí hay algunas estrategias a considerar al crear su propio programa de seguridad de IA. Estas sugerencias están diseñadas para ayudarle a cumplir con nuestros Términos de Servicio y Política de Uso, que prohíben ciertos usos de Claude. El incumplimiento de los Términos y la Política de Uso puede resultar en la suspensión o terminación de su acceso a los servicios.
Protecciones Básicas
Almacene IDs vinculados con cada llamada de API, para que si necesita identificar contenido violativo específico, tenga la capacidad de encontrarlo en sus sistemas.
Considere asignar IDs a los usuarios, lo que puede ayudarle a rastrear individuos específicos que violen la AUP de Anthropic, permitiendo acciones más dirigidas en casos de mal uso.
La opción de pasar IDs a Anthropic a través de la API depende de usted. Pero, si se proporcionan, podemos identificar violaciones con mayor precisión. Para ayudar a proteger la privacidad de los usuarios finales, cualquier ID pasado debe estar hasheado criptográficamente.
Considere requerir que los clientes se registren en una cuenta en su plataforma antes de utilizar Claude
Asegúrese de que sus clientes comprendan los usos permitidos
Advierta, limite la velocidad o suspenda a los usuarios que violen repetidamente los Términos de Servicio y la Política de Uso de Anthropic
Protecciones Intermedias
Cree marcos de personalización que restrinjan las interacciones de los usuarios finales con Claude a un conjunto limitado de indicaciones o que solo permitan que Claude revise un corpus de conocimiento específico que ya posee, lo que disminuirá la capacidad de los usuarios de participar en comportamientos violativos.
Anthropic ejecuta protecciones en tiempo real en las entradas y salidas de la API de forma predeterminada. No hay filtro de opción adicional para habilitar. Puede agregar su propia capa de moderación en su aplicación; consulte la guía de moderación en la documentación del desarrollador.
Para Clientes de Bedrock:
Active su bucket privado de S3 para almacenar indicaciones y completaciones para su propia evaluación
Protecciones Avanzadas
Ejecute una API de moderación contra todos los indicadores de usuarios finales antes de enviarlos a Claude para asegurarse de que no sean dañinos
Protecciones Integrales
Configure un sistema interno de revisión humana para marcar indicaciones que estén marcadas por Claude (siendo utilizadas para moderación de contenido) o una API de moderación como dañinas para que pueda intervenir para restringir o eliminar usuarios con altas tasas de violación.
