Claude の API デプロイメント用のセーフガードの設定を始めたばかりの場合でも、既にデプロイメントが実行中の場合でも、独自の AI 安全プログラムを構築する際に検討すべき戦略をいくつかご紹介します。これらの提案は、Claude の特定の使用を禁止する 利用規約 および 使用ポリシー への準拠を支援するために設計されています。利用規約 および 使用ポリシー に準拠しない場合、サービスへのアクセスが一時停止または終了される可能性があります。
基本的なセーフガード
各 API 呼び出しにリンクされた ID を保存して、違反コンテンツを特定する必要がある場合に、システム内でそれを見つけることができるようにします。
ユーザーに ID を割り当てることを検討してください。これにより、Anthropic の AUP に違反している特定の個人を追跡でき、不正使用の場合により的を絞ったアクションが可能になります。
API を通じて Anthropic に ID を渡す かどうかは、あなた次第です。ただし、提供された場合、違反をより正確に特定できます。エンドユーザーのプライバシーを保護するために、渡される ID は暗号化ハッシュ化する必要があります。
Claude を利用する前に、顧客がプラットフォーム上でアカウントにサインアップすることを要求することを検討してください
顧客が許可された使用方法を理解していることを確認してください
中級セーフガード
エンドユーザーと Claude の相互作用を限定されたプロンプトセットに制限するか、既に持っている特定のナレッジコーパスのみを Claude に確認させるカスタマイズフレームワークを作成します。これにより、ユーザーが違反行為に従事する能力が低下します。
Anthropic は、デフォルトで API の入力と出力に対してリアルタイムセーフガードを実行します。有効にするための追加のオプトインフィルターはありません。アプリケーションに独自のモデレーションレイヤーを追加できます。開発者ドキュメントのモデレーションガイダンスを参照してください。
Bedrock のお客様へ:
プライベート S3 バケットをアクティブ化して、プロンプトと完了を独自の評価用に保存します
高度なセーフガード
Claude に送信される前に、すべてのエンドユーザープロンプトに対してモデレーション API を実行して、有害でないことを確認します
包括的なセーフガード
Claude (コンテンツモデレーションに使用されている) またはモデレーション API によって有害とマークされたプロンプトにフラグを立てるための内部人間レビューシステムを設定して、違反率が高いユーザーを制限または削除するために介入できるようにします。
