Researchers Expose Flaw in Encrypted LLM Reasoning Traces
Blocchi di Ragionamento Criptati Sfruttati per Rivelare la Catena di Pensiero Nascosta
I modelli linguistici di grandi dimensioni (LLM) proprietari di Anthropic, OpenAI e Google presentano una nuova vulnerabilità: le loro tracce di ragionamento criptate possono essere rubate e decodificate. Un articolo di ricerca, Stealing Reasoning Traces from Proprietary LLM APIs, dimostra un attacco che estrae la catena di pensiero nascosta dai modelli all'avanguardia senza attaccarli direttamente. La tecnica sfrutta il modo in cui i fornitori restituiscono blocchi di ragionamento criptati ai client, che sono portabili e condividono chiavi di crittografia tra famiglie di modelli.
L'attacco, descritto in dettaglio su stolen-thoughts.com e arXiv, funziona in due chiamate API. In primo luogo, gli aggressori catturano un blocco di ragionamento criptato da un modello forte (ad esempio, Claude Opus 4.8). Quindi, iniettano quel blocco in un modello fratello più debole e violato (ad esempio, Claude Haiku 4.5) dello stesso fornitore. Il modello più debole decodifica il blocco e restituisce il ragionamento originale in chiaro, aggirando le salvaguardie anti-distillazione.
Chiavi di Crittografia Portabili Consentono la Riproduzione tra Modelli
La causa principale è che i fornitori restituiscono blocchi di ragionamento criptati ai client, che vengono poi reinviati con richieste successive. Questi blocchi sono completamente intercambiabili tra sessioni, utenti e modelli all'interno dell'ecosistema di un fornitore. Gli autori dell'articolo hanno scoperto che tutti i modelli sotto la stessa famiglia condividono la stessa chiave di crittografia, rendendo banale riprodurre un blocco da un modello all'avanguardia in un fratello più debole.
Simon Willison, che ha trattato l'articolo, ha osservato che l'attacco era semplice: "Ogni modello sotto la stessa famiglia utilizzava la stessa chiave di crittografia, il che significava che si potevano reinserire quei blocchi nei membri più deboli della famiglia di modelli e violarli per far emergere i blocchi di ragionamento grezzi non criptati." Gli autori dell'articolo lo hanno confermato per Anthropic, OpenAI e Google, con Claude Haiku 4.5 il più facile da sfruttare.
Vettori di Attacco: Dal Furto di Proprietà Intellettuale alla Perdita di Dati Privati
La vulnerabilità consente quattro distinti vettori di attacco. In primo luogo, aggira i meccanismi anti-distillazione, consentendo agli avversari di estrarre ragionamenti proprietari da modelli come GPT-5.2, Claude Opus 4.8 e Gemini. In secondo luogo, consente l'estrazione su larga scala di dati privati. I ricercatori hanno raccolto 6.708 traiettorie di agenti pubblici da GitHub e Hugging Face, decodificando 315.320 blocchi di ragionamento. Da questi, hanno recuperato 704 artefatti distinti relativi alla privacy, tra cui 62 chiavi API, 33 password, 24 token di accesso e 30 indirizzi email personali.
In particolare, 64 di questi artefatti apparivano esclusivamente all'interno dei blocchi di ragionamento e da nessuna parte nella sessione visibile. Ciò significa che gli sviluppatori che condividono pubblicamente i log delle sessioni stanno inavvertitamente divulgando dati sensibili nascosti nelle tracce criptate. L'articolo mostra anche che l'attacco può rivelare informazioni pericolose, come istruzioni per rubare automobili, anche quando la risposta visibile sembra innocua.
Impatto nel Mondo Reale: Credenziali e PII in Tracce Nascoste
L'articolo include esempi di ragionamento decodificato da esecuzioni di benchmark e sessioni pubbliche. In un esempio di GPT-5.2 Codex, il modello delibera sulla sanificazione delle chiavi API in un repository, esponendo credenziali effettive come chiavi di accesso AWS e token GitHub. In un altro, un agente di prenotazione voli ragiona sul numero di passaporto, i dettagli della carta di credito e il CVV di un utente, tutti nascosti nella traccia criptata.
Ciò evidenzia un rischio critico: anche se l'output visibile è sicuro, il ragionamento nascosto può contenere informazioni sensibili. I ricercatori hanno anche dimostrato che precompilare il ragionamento di Kimi-K3 con l'1% dei token di Opus 4.8 sposta la sua risposta visibile verso la formulazione di Opus, mostrando che il ragionamento nascosto può influenzare gli output in modi sottili.
Risposta dei Fornitori e Mitigazione
Gli autori dell'articolo hanno divulgato responsabilmente la vulnerabilità a tutti i fornitori, che hanno accusato ricevuta. "Tutti i fornitori di modelli hanno accusato ricevuta del nostro rapporto e successivamente non siamo stati in grado di lanciare gli stessi attacchi", hanno scritto. Ciò suggerisce che il problema è stato risolto, almeno parzialmente. Tuttavia, i risultati dell'articolo hanno implicazioni significative per la governance dell'AI e la sicurezza aziendale.
L'attacco mina il presupposto di sicurezza che le tracce di ragionamento criptate siano sicure. Solleva anche domande sulla pratica di restituire blocchi criptati ai client, progettata per proteggere la proprietà intellettuale ma che introduce una nuova superficie di attacco. Come ha osservato Simon Willison, l'articolo fornisce una rara occhiata alla catena di pensiero grezza, rivelando "token di ragionamento chiaramente mai destinati al consumo umano."
Per le aziende che si affidano ad API LLM proprietarie, questa ricerca funge da campanello d'allarme. Gli sviluppatori devono essere cauti nel condividere i log delle sessioni, anche se ritengono che il contenuto visibile sia sicuro. Le tracce di ragionamento nascoste possono contenere dati sensibili che non sono evidenti per l'utente. Come dimostra l'articolo, i blocchi criptati non sono solo un dettaglio tecnico: sono una potenziale responsabilità.
La ricerca evidenzia anche la necessità di pratiche di crittografia più forti e difese più robuste contro il jailbreak per i modelli più deboli. Sebbene l'attacco specifico possa essere stato corretto, la vulnerabilità architetturale sottostante—blocchi criptati portabili e condivisibili—rimane una preoccupazione. Le future famiglie di modelli devono garantire che le chiavi di crittografia siano uniche per sessione e modello e che i modelli più deboli siano protetti contro gli attacchi di iniezione.
Related News

La Ricerca AI Sta Cancellando la Memoria Collettiva di Internet

Needle 2: LLM da 14 MB su Dispositivo Porta l'IA Agente su Hardware Economico

Registratore AI per Riunioni Espone 181.000 Registrazioni in una Violazione di Firestore

La Profezia AI del 1978 di John C. Lilly: L'Ascesa dell'Intelligenza a Stato Solido

La Scommessa di 11 Anni sul Link Rot: L'URL è Sopravvissuto? Il Verdetto di Long Bets

