メインコンテンツにスキップ

Claude がSonnet 5.5 との会話でモデルを切り替えた理由

この記事では、Claude Sonnet 5.5 でリクエストが別のモデルにフォールバックされたり、ブロックされたりする理由、チャットがモデルを切り替えるときに何が起こるか、および自動切り替えを管理する方法について説明します。

一部のリクエストがブロックされる理由

Claude Sonnet 5.5 のサイバーセキュリティ機能は Claude Sonnet 5 から大幅に向上しており、最も高度なモデル向けに開発したものと同様のサイバーフォールバックを備えた最初の Sonnet モデルです。生物学的セーフガードは Sonnet 5 と同じです。両方のセーフガードは限定的な高リスクリクエストを対象としており、日常的なソフトウェア開発とほとんどのライフサイエンス業務は影響を受けません。

Sonnet 5.5 に送信されるほとんどのリクエストはこれらのセーフガードに遭遇しません。限定的な高リスクリクエストは Sonnet 5 にフォールバックするか直接ブロックされるため、日常業務のサポートを継続しながら悪用のリスクを制限できます。これらのセーフガードを継続的に改善し、正当なリクエストのブロックを減らしています。分類器を微調整して誤検知を減らしています。ご意見はこの取り組みの指針となります。

フォールバックまたはブロックされる可能性のあるリクエスト

Sonnet 5.5 はすべてのリクエストに対して自動安全チェック(分類器)を実行します。チェックはモデルが読み取るすべてのもの(最新のメッセージだけではなく)も確認します。これにはメモリ、コネクタからのコンテンツ、ウェブ検索結果、ファイルが含まれるため、入力していないコンテンツによってフォールバックまたはブロックがトリガーされる可能性があります。

フォールバックとブロックは、トリガーされた分類器のタイプ(サイバーセキュリティ、生物学、LLM 開発、蒸留)によって異なる方法で機能します。

サイバーセキュリティ

Sonnet 5.5 は、サイバー分類器が潜在的により高いリスクの攻撃的なサイバーセキュリティリクエストにフラグを立てた場合、Claude Sonnet 5 にフォールバックする可能性があります。例えば:

  • エクスプロイト生成

  • バイナリベースの脆弱性スキャン

  • ペネトレーションテスト

ソースコードの脆弱性をスキャンするなど、セキュアコーディングのユースケースでは引き続き Sonnet 5.5 を使用できます。

生物学

Sonnet 5.5 は、誰かが深刻な生物学的危害を引き起こすのに役立つ可能性のあるリクエストをブロックします。生物学的ブロックは別のモデルにフォールバックせず、リクエストは直接ブロックされます。

Sonnet 5.5 は Sonnet 5 と同じ生物学的セーフガードセットを使用します。これらは有害なリクエストを対象としており、ほとんどの研究、教育、臨床業務は影響を受けませんが、一部の微生物学およびウイルス学リクエストは誤ってフラグが立てられる可能性があります。組織は、生物学関連業務の全範囲向けに設計されたセーフガードへのアクセスのために、ライフサイエンス検証プログラムに申請できます。

フロンティア LLM 開発

Sonnet 5.5 には、特定の ML アクセラレータのカーネル開発など、最も高度な LLM 開発に関連する限定的な機能セット用の分類器があります。これらは従来の AI または ML 開発、研究、または一般的なコーディングの大多数に影響を与えるべきではありません。これらの分類器がリクエストにフラグを立てた場合、Claude は Sonnet 5.5 から Sonnet 5 にフォールバックします。

蒸留

Sonnet 5.5 には、モデルの内部推論を抽出しようとする試みを検出して直接ブロックする分類器があります。蒸留ブロックは別のモデルにフォールバックせず、リクエストは直接ブロックされます。

ブロックされたリクエストの例には、Claude に推論を逐語的に繰り返すか、完全な思考の連鎖を外部出力に書き込むよう求めるプロンプトが含まれます。Claude に推論を説明させたり、概念を教えたり、コードレビューを実行させたりすることはできます。「なぜそうしたのですか?」などの会話型リクエストは影響を受けません。

フォールバック後に何が起こるか

自動モデル切り替えはデフォルトで有効です。リクエストがフォールバックすると、Claude は同じ会話で Sonnet 5 で再実行します。すべてのフォールバックは透過的です。つまり、モデルが切り替わったことを説明する通知が表示され、応答は応答したモデルでラベル付けされます。

切り替え後、モデルピッカーはチャットの残りの部分で Sonnet 5 に留まります。モデルピッカーからいつでも Sonnet 5.5 に戻すことができます。

注:自動モデル切り替え後に Sonnet 5.5 に戻した場合、元のリクエストがまだ会話の一部であれば、同じセーフガードが Claude を再度フォールバックさせる可能性があります。再試行する前に前のメッセージを編集すると、多くの場合役に立ちます。

フォールバックリクエストもブロックされた場合

Sonnet 5 には独自の安全システムがあります。リクエストが Sonnet 5 でもブロックされている場合は、メッセージを編集して再試行できます。

生物学の場合、組織が正当なライフサイエンス研究を行っており、これらのセーフガードの影響を受けている場合は、ライフサイエンス検証プログラム(LSVP)に申請して、機能を拡張できます。Sonnet 5.5 では、LSVP は高リスク使用アドオンを通じてのみ生物学的セーフガードを緩和します。詳細については、ブログをご覧ください:ライフサイエンス検証プログラムの紹介。

Sonnet 5.5 は起動時にサイバー検証プログラムでは利用できません。まもなく、サイバー防御者は Sonnet 5.5 のより高度な機能へのティアード アクセスのために、拡張されたサイバー検証プログラムに申請できるようになります。

注:Claude Sonnet 5.5 はゼロデータ保持(ZDR)と互換性があります。

自動モデル切り替えを管理する

自動切り替えは Sonnet 5.5 ではデフォルトで有効になっており、いつでもオフにできます:

  1. 設定 > 機能(または Claude Code では設定 > モデルと出力)に移動します。

  2. メッセージがフラグされたときにモデルを切り替えるをオフにします。

自動モデル切り替えをオフにすると、フォールバックするリクエストはモデルを切り替える代わりにチャットを一時停止します。その後、以下を実行できます:

  • メッセージを編集して Sonnet 5.5 で再試行する

  • 同じメッセージを別のモデルに手動で送信する

使用量と請求

フォールバックまたはブロックされるリクエストの請求方法は、ブロックが発生するタイミングとトリガーされた分類器によって異なります:

  • Claude が応答する前にブロック:セーフガードへの調整された攻撃を中断するために、出力前に到着する拒否は、生物学、蒸留、または LLM 開発安全分類器が原因で停止またはフォールバックするときに請求されます。他のカテゴリで出力前にブロックされたリクエストは請求されません。

  • Claude が応答を開始した後にブロック:リクエストがストリーム中にブロックされた場合、入力トークンとブロック前にストリーミングされたトークンは、それらを生成したモデルのレートで請求されます。

  • フォールバックリクエスト:自動モデル切り替えにオプトインしており、ブロック後にチャットが Sonnet 5 に切り替わった場合、Sonnet 5 応答は Sonnet 5 のレートで個別に請求されます。フォールバックリクエストのキャッシュミスを補うためのクレジットを提供します。

拒否とフォールバックの詳細をご覧ください。

フィードバックを送信する

リクエストがブロックされているが、上記の分類器のいずれかに関連していないように見える場合、または正当な業務が継続的にフォールバックしている場合は、お知らせください。「フィードバックを送信」を使用して報告してください。誤ってブロックされたリクエストの報告は、これらのセーフガードを絞り込んで改善するのに役立ちます。

自動モデル切り替えが適用される場所

自動モデル切り替えは、Claude Sonnet 5.5 を使用できるすべての場所で同じように機能します:

  • ウェブ上の Claude

  • Claude モバイル

  • Claude デスクトップ

  • Claude Cowork

  • Claude Code

  • Claude Design

  • Claude for Microsoft 365

  • Claude Tag

  • Claude Science

重要:Claude API を使用している場合、モデル切り替えは異なる方法で機能します。自動切り替えはデフォルトで有効になっていないため、API ユーザーはフォールバックにオプトインして構成する必要があります。フォールバックが構成されるまで、モデルは API で停止理由を含む 200 応答を返します。詳細については、開発者ドキュメントをご覧ください。

Claude Sonnet 5.5の詳細については、ブログをご覧ください。

セーフガードはモデルの機能に合わせて構築されています。

Claude Opus 5.5 でのセーフガードの動作については、Claude が Opus 5 または Opus 5.5 との会話でモデルを切り替えた理由をご覧ください。Claude Fable 5.1 については、Claude が Fable 5 または Fable 5.1 との会話でモデルを切り替えた理由をご覧ください。

こちらの回答で解決しましたか?