Vai al contenuto principale

Pensiero preservato: come cambiamo il modo in cui l'API Messages gestisce i blocchi di pensiero per proteggersi dalla distillazione

Stiamo cambiando il modo in cui l'API Messages gestisce i blocchi di pensiero per proteggersi dalla distillazione. Un blocco di pensiero è una registrazione del ragionamento che Claude può produrre mentre lavora su una risposta. Su Claude Fable 5.1, Claude Opus 5.5 e Claude Sonnet 5.5, i nuovi account API non possono più modificare il contesto attorno a un blocco di pensiero, come i messaggi, gli strumenti o il prompt di sistema, durante una conversazione multi-turno. Espanderemo il rollout a tutti gli utenti con i prossimi lanci di modelli.

Modificare questo contesto precedente ha applicazioni legittime, che continuiamo a supportare utilizzando gli adattamenti descritti di seguito. Tuttavia, tali modifiche sono anche una tecnica comune e pubblicamente documentata per la distillazione illecita su scala industriale, che è vietata dalla nostra Politica di utilizzo e dai Termini di servizio.

Ora, l'API verificherà che un blocco di pensiero sia rimandato indietro con lo stesso prompt di sistema, gli stessi strumenti e gli stessi messaggi che lo hanno prodotto, e restituirà un errore se non corrispondono. Affinché le richieste modificate abbiano successo, gli sviluppatori possono scegliere di avere invece i blocchi di pensiero rimossi da tali richieste; il modello risponderà senza vedere il blocco di pensiero.

In questo articolo, condividiamo i dettagli su perché stiamo facendo questo e gli adattamenti che puoi apportare per ridurre al minimo le interruzioni.

Cosa sono i blocchi di pensiero?

Claude produce passaggi di ragionamento prima di fornire la sua risposta finale. Sull'API, questi vengono restituiti all'utente come "blocchi di pensiero". In una conversazione multi-turno, gli utenti dell'API rimandano questi blocchi indietro con ogni scambio (insieme al prompt di sistema, agli strumenti e ai messaggi precedenti), in modo che Claude abbia il contesto conversazionale completo.

Cosa sta cambiando?

Per gli account interessati che utilizzano i modelli elencati di seguito, l'API restituirà un errore se il prompt di sistema, gli strumenti o i messaggi che precedono un blocco di pensiero precedente sono stati modificati.

Per evitare un messaggio di errore, puoi optare per la modalità "non ristretta". In questa modalità, la richiesta andrà a buon fine, ma i blocchi di pensiero interessati verranno eliminati da ciò che il modello vede. Questo ti consente di continuare la tua conversazione o attività senza interruzioni nonostante il pensiero dei turni precedenti non sia mostrato al modello. Quando ciò accade, la risposta dell'API ti dirà quali blocchi sono stati eliminati.

Perché stiamo apportando questo cambiamento?

Alterare i turni precedenti di una conversazione è una tecnica comune utilizzata nelle campagne di distillazione illecita, che mirano a estrarre le capacità di modelli avanzati, in particolare il pensiero, per addestrare un altro modello, senza autorizzazione. La distillazione è spesso impiegata su scala industriale, utilizzando migliaia di account falsi. Crittografiamo i blocchi di pensiero di Claude per prevenire questo, ma modificando la conversazione prima di un blocco di pensiero, un utente potrebbe far sì che Claude decrittografi e stampi il suo ragionamento. I sistemi addestrati in questo modo possono ereditare capacità che altrimenti non avrebbero, senza ereditare i meccanismi di sicurezza che abbiamo costruito per prevenire un'ampia gamma di abusi come attacchi informatici e sviluppo di armi.

Questo cambiamento mira a rendere più difficile l'esecuzione delle campagne di distillazione. Si basa su misure anti-distillazione esistenti come classificatori di distillazione migliorati e restrizioni sul trasferimento di sessioni o ragionamento da modelli più avanzati a modelli meno capaci con meccanismi di sicurezza più deboli.

Cosa significa questo per le integrazioni API?

Alcune integrazioni, in particolare quelle che comportano la riscrittura dei turni precedenti a metà conversazione, come la compattazione del contesto, i promemoria di sistema iniettati o la modifica degli strumenti a metà sessione, potrebbero richiedere adattamenti.

Ecco le risorse per aiutarti a navigare questo aggiornamento:

  • La documentazione del pensiero preservato copre dove si applica il cambiamento, come verificare se la tua integrazione è interessata, e come apportare modifiche comuni senza interrompere il pensiero preservato.

  • Compattazione (beta) può riassumere i turni più vecchi mantenendo i turni più recenti parola per parola, e può costruire il riassunto in background mentre il tuo agente continua a lavorare. Sostituisce la compattazione lato client, che è probabilmente il motivo più comune per cui le integrazioni devono cambiare.

  • Modifiche degli strumenti a metà conversazione (beta) ti permettono di aggiungere o rimuovere strumenti durante una conversazione senza modificare i turni precedenti.

  • Le nostre guide alla migrazione hanno una lista di controllo completa per il passaggio a ogni modello.

Controlla ogni pagina per la disponibilità su Amazon Bedrock, Google Cloud Vertex AI e Microsoft Foundry.

Se le indicazioni di cui sopra non coprono il tuo caso d'uso, contatta il nostro team di supporto. Se lavori con un team di account, puoi anche contattarli per supporto nell'aggiornamento di integrazioni più complesse.

Ci sono vantaggi aggiuntivi nel mantenere i blocchi di pensiero coerenti: significa che l'API può riutilizzare i prompt memorizzati nella cache più spesso, il che riduce i costi e il tempo di risposta.

Chi sarà interessato da questo?

Il pensiero preservato si applica a questi modelli e account:

Modello

Account API creati il 31 agosto 2026 o successivamente (00:00 UTC)

Account creati prima di allora

Claude Fable 5.1

Si applica

Non si applica

Claude Opus 5.5

Si applica

Non si applica

Claude Sonnet 5.5

Si applica

Non si applica

Questo copre le organizzazioni della piattaforma Claude, gli account Amazon Bedrock, i progetti Google Cloud Vertex AI e i progetti Microsoft Foundry.

Stiamo adottando un approccio graduale all'applicazione, iniziando con i nuovi account, dove vediamo la più alta concentrazione di abusi legati alla distillazione. Questo dà ai sviluppatori con account esistenti il tempo di rendere i loro harness e le loro integrazioni compatibili.

Se usi Claude Code, Claude Cowork o Claude.ai, non c'è nulla che devi cambiare; questi prodotti gestiscono i blocchi di pensiero per te.

Il pensiero può essere letto solo dall'account che lo ha creato

A partire da Claude Sonnet 5.5, un blocco di pensiero può essere letto solo dall'account che lo ha creato, o da un account collegato ad esso.

I blocchi di pensiero possono contenere informazioni private. Poiché sono crittografati, tali informazioni non sono visibili quando ispezioni una trascrizione. Questo controllo aiuta a impedire che una trascrizione condivisa o trapelata esponga il ragionamento al suo interno. Rende anche più difficile per i distillatori spostare le trascrizioni raccolte su nuovi account dopo che abbiamo bannato l'account che le ha prodotte.

Se una richiesta include il pensiero da un account che non è collegato, l'API elimina quel pensiero e la richiesta continua. Non restituisce un errore. La risposta successiva potrebbe essere più lenta e utilizzare più token, simile a una compattazione.

Gli account nella stessa organizzazione padre della piattaforma Claude o nella stessa organizzazione Google Cloud sono collegati automaticamente. Se continui le conversazioni tra altri account, ad esempio per eseguire il failover tra la piattaforma Claude e Amazon Bedrock, contatta il tuo team di account per collegarli.

In Claude Code, il cambio di account a metà sessione ha lo stesso effetto: la risposta successiva è più lenta e utilizza più token.

Hai ricevuto la risposta alla tua domanda?