Ir para conteúdo principal

Pensamento preservado: alterando como a API de Mensagens lida com blocos de pensamento para proteger contra destilação

Com o Claude Fable 5.1, estamos alterando como a API de Mensagens lida com blocos de pensamento para proteger contra destilação. Um bloco de pensamento é um registro do raciocínio que Claude pode produzir ao trabalhar em uma resposta. Novas contas de API para Fable 5.1 não poderão mais editar o contexto ao redor de um bloco de pensamento, como as mensagens, ferramentas ou prompt do sistema, durante uma conversa com múltiplos turnos.

Modificar esse contexto anterior tem aplicações legítimas, que continuamos a apoiar usando os ajustes descritos abaixo. No entanto, tais modificações também são uma técnica comum e documentada publicamente para destilação ilícita em escala industrial, que é proibida pela nossa Política de Uso e Termos de Serviço.

Aqui está o que muda: a API agora verificará que um bloco de pensamento é enviado de volta com o mesmo prompt do sistema, ferramentas e mensagens que o produziram, e retornará um erro se não corresponderem. Para que solicitações modificadas tenham sucesso, os desenvolvedores podem optar por ter os blocos de pensamento removidos de tais solicitações; o modelo responderá sem ver o bloco de pensamento. Para Fable 5.1, o pensamento preservado se aplica apenas a novas contas de API, embora essa atualização se aplique a todas as contas em futuras versões de modelo.

Neste artigo, compartilhamos detalhes sobre por que estamos fazendo isso e os ajustes que você pode fazer para minimizar a interrupção.

O que são blocos de pensamento?

Claude produz etapas de raciocínio antes de fornecer sua resposta final. Na API, essas são retornadas ao usuário como "blocos de pensamento." Em uma conversa com múltiplos turnos, os usuários da API enviam esses blocos de volta com cada troca (junto com o prompt do sistema, ferramentas e mensagens anteriores), para que Claude tenha contexto conversacional completo.

O que está mudando?

Para contas afetadas (veja abaixo) no Fable 5.1, a API retornará um erro se o prompt do sistema, ferramentas ou mensagens anteriores a um bloco de pensamento anterior tiverem sido modificados.

Para evitar uma mensagem de erro, você pode optar pelo modo "não-restrito". Neste modo, a solicitação será processada, mas os blocos de pensamento afetados serão removidos do que o modelo vê. Isso permite que você continue sua conversa ou tarefa sem interrupção, apesar do pensamento dos turnos anteriores não ser mostrado ao modelo. Quando isso acontecer, a resposta da API informará quais blocos foram removidos.

Por que estamos fazendo essa mudança?

Alterar os turnos anteriores de uma conversa é uma técnica comum usada em campanhas de destilação ilícita, que visam extrair as capacidades de modelos avançados—especialmente pensamento—para treinar outro modelo, sem autorização. A destilação é frequentemente empregada em escala industrial, usando milhares de contas falsas. Criptografamos os blocos de pensamento do Claude para evitar isso, mas ao editar a conversa antes de um bloco de pensamento, um usuário poderia fazer Claude descriptografar e imprimir seu raciocínio. Sistemas treinados dessa forma podem herdar capacidades que não teriam de outra forma, sem herdar as proteções que construímos para evitar uma ampla gama de abuso como ataques cibernéticos e desenvolvimento de armas.

Essa mudança visa tornar as campanhas de destilação mais difíceis de executar. Ela se baseia em medidas anti-destilação existentes, como classificadores de destilação aprimorados e restrições na transferência de sessões ou raciocínio de modelos mais avançados para modelos menos capazes com proteções mais fracas.

O que isso significa para integrações de API?

Certas integrações—particularmente aquelas que envolvem reescrever turnos anteriores no meio da conversa, como compactação de contexto e lembretes de sistema injetados—podem precisar de ajustes.

Aqui estão os recursos para ajudá-lo nesta atualização:

Se as orientações acima não cobrirem seu caso de uso, entre em contato com nossa equipe de suporte. Se você trabalha com uma equipe de conta, também pode entrar em contato com eles para obter suporte na atualização de integrações mais complexas.

Há benefícios adicionais em manter os blocos de pensamento consistentes: isso significa que a API pode reutilizar prompts em cache com mais frequência, o que reduz custos e tempo de resposta.

Quem será afetado por isso?

No Fable 5.1, essa atualização se aplica a novas contas de API criadas após 31 de agosto de 2026 às 12:00:00 AM UTC. Especificamente, afeta novas organizações da Plataforma Claude, contas do Amazon Bedrock, projetos do Google Cloud Vertex AI e projetos do Microsoft Azure Foundry criados em ou após 31 de agosto de 2026.

Estamos adotando uma abordagem faseada para aplicação, começando com novas contas, onde vemos a maior concentração de abuso relacionado a destilação. Contas existentes não serão afetadas para Fable 5.1, o que dá aos desenvolvedores tempo para tornar seus harnesses e integrações compatíveis com essa atualização. O pensamento preservado se aplicará a todos os usuários para modelos futuros.

Usuários do Claude Code, Claude Cowork, Claude.ai ou Claude através de um produto de terceiros não são afetados, nem o uso de modelos diferentes do Fable 5.1.

Isto respondeu à sua pergunta?