AcasăCentrul de știri LBank
„Gândurile interioare” ale fiecărui model major de AI, dezvăluite într-un exploit masiv
inner-thoughts-every-major-ai-model-exposed-exploit
„Gândurile interioare” ale fiecărui model major de AI, dezvăluite într-un exploit masiv
Cercetătorii au descoperit că fiecare furnizor major de AI criptează tokenii de raționament cu o singură cheie globală — și au exploatat acest lucru pentru a decoda 315.320 de blocuri ascunse de gândire din jurnale publice, recuperând pe parcurs parole și chei API active.
2026-08-12 Sursă:decrypt.co

Pe scurt

  • O echipă de cercetători a descoperit că Anthropic, OpenAI și Google utilizează toate o singură cheie globală de criptare pentru token-urile de raționament AI.
  • Prin decodarea a 315.320 de blocuri de raționament extrase din depozitele publice GitHub și Hugging Face, cercetătorii au recuperat 182 de acreditări, inclusiv 62 de chei API active, 33 de parole și 30 de adrese de email personale.
  • OpenAI, Anthropic și Google au implementat patch-uri la nivel de server după divulgarea responsabilă, dar jurnalele istorice de sesiune deja partajate public rămân decodabile.

Cercetătorii în securitate au găsit o modalitate de a citi "gândurile interne" criptate ale fiecărui model major de raționament AI – și au descoperit 62 de chei API active și 33 de parole îngropate în jurnalele de sesiune pe care dezvoltatorii le-au partajat public online fără să știe ce conțin.

„Prin decodarea a 315.320 de blocuri de raționament extrase din depozite publice, am recuperat 367 de artefacte de Informații de Identificare Personală (PII) și 182 de acreditări”, au scris cercetătorii.

Lucrarea, depusă pe 10 august de o echipă de la MATS Research, Institutul ELLIS Tübingen, Institutul Max Planck pentru Sisteme Inteligente și firma de securitate Snyk, vizează o clasă specifică de AI: modelele de raționament. Acestea sunt modele care nu răspund imediat, ci încep cu un lanț de gândire intern (o zonă de lucru pas cu pas în care AI-ul rezolvă o problemă înainte de a arăta răspunsul), apoi oferă un răspuns final.

Anthropic, OpenAI și Google criptează toate acea zonă de lucru ascunsă. Criptarea — procesul de transformare a datelor într-un cod ilizibil — are scopul de a proteja proprietatea intelectuală a companiei și de a menține raționamentul intermediar sensibil departe de utilizatori. Blocul criptat este transmis înapoi către serverele furnizorului cu fiecare mesaj ulterior, menținând conversația fără a stoca nimic la sfârșitul companiei.

O singură cheie pentru a le guverna pe toate

Defecțiunea este arhitecturală. În loc să lege fiecare bloc de raționament criptat de un utilizator, sesiune sau model specific, toți cei trei furnizori folosesc o singură cheie de criptare la nivelul întregului furnizor, în tot ecosistemul lor. „Aceste blocuri criptate sunt pe deplin compatibile și interschimbabile între diferite sesiuni, utilizatori și chiar diferite modele în cadrul ecosistemului unui furnizor”, au scris cercetătorii.

Asta înseamnă că un bloc de raționament criptat de la Claude Opus 4.8 – modelul emblematic al Anthropic – poate fi injectat în Claude Haiku 4.5, o variantă mai ieftină și mai puțin protejată, fără a încălca regulile Anthropic. Haiku nu are alinierea anti-distilare (antrenament de siguranță special conceput pentru a împiedica un model să-și transcrie propriul raționament la comandă) pe care o are Opus.

Dacă îi spui lui Haiku să citească blocul criptat ad litteram, o face. „Prin injectarea unei urme de raționament criptate de la un model dat într-un model mai slab și mai puțin protejat de la același furnizor, îl forțăm să decodeze și să afișeze urma ad litteram în text clar, fără a face vreodată jailbreaking modelului mai capabil direct”, afirmă lucrarea.

„Portabilitatea inter-modele înseamnă că Haiku 4.5 poate citi gândurile lui Opus 4.8”, a scris cercetătorul principal Alexander Panfilov pe X. Același atac a fost reprodus în familia GPT-5.6 a OpenAI și în gama de modele Gemini de la Google. Nu a fost necesar un acces special – accesul API standard (conexiunea pe care dezvoltatorii o folosesc pentru a construi aplicații peste modelele AI) a fost suficient pentru a-l executa.

We can finally talk about it:

We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company.

We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7

— Alexander Panfilov (@kotekjedi_ml) August 11, 2026

Ce conțineau jurnalele publice

Pentru a demonstra daune în lumea reală, echipa a extras 6.708 transcrieri ale agenților AI partajate public – jurnale de sesiune automate pe care dezvoltatorii le postează în mod obișnuit pe GitHub și Hugging Face pentru colaborare sau depanare. Aceștia au decodat 315.320 de blocuri de raționament din acele jurnale.

„Dezvoltatorii își partajează frecvent jurnalele de sesiune și urmele de gândire criptate public online, complet inconștienți de datele sensibile ascunse în blocurile criptate”, notează lucrarea. Majoritatea acelor secrete nu au apărut niciodată în rezultatul vizibil al AI-ului – au existat doar în raționamentul criptat, invizibile pentru oricine nu a efectuat atacul.

Vulnerabilitatea deschide patru vectori de atac dincolo de simplul furt de acreditări: furtul de modele de raționament proprietare de la companiile AI pentru a antrena modele concurente prin distilare (atunci când un AI mai mic învață să imite unul mai mare studiind rezultatele sale); extragerea datelor private din jurnalele partajate; executarea de injectare invizibilă de prompt-uri, unde instrucțiunile malițioase sunt ascunse în blocurile de raționament criptate pe care instrumentele de monitorizare a securității nu le văd niciodată; și jailbreaking-ul modelelor puternice prin intermediul variantelor lor mai puțin protejate.

Anthropic, OpenAI și Google au implementat toate măsuri de atenuare la nivel de server după ce echipa a urmat procedurile de divulgare responsabilă. După cum a raportat anterior Decrypt, Anthropic a fost un punct de interes recurent pentru cercetătorii în securitate în acest an, mai ales că cele mai recente modele ale sale consumă mult mai mulți token-uri în acest proces.

Patch-urile sunt live. Cele 6.708 transcrieri de sesiune cu blocuri de raționament decodate deja extrase de pe web-ul public nu vor dispărea nicăieri.