
Natuklasan ng mga security researcher ang isang paraan upang basahin ang naka-encrypt na "inner thoughts" ng bawat pangunahing modelo ng AI reasoning—at natuklasan ang 62 live na API key at 33 password na nakabaon sa mga session log na ibinahagi ng mga developer sa publiko online nang hindi nila nalalaman kung ano ang laman nito.
“Sa pamamagitan ng pag-decode ng 315,320 reasoning block na kinuha mula sa mga pampublikong repositoryo, nakarekober kami ng 367 Personally Identifiable Information (PII) artifact at 182 credential,” sulat ng mga mananaliksik.
Ang papel, na isinumite noong Agosto 10 ng isang pangkat mula sa MATS Research, ang ELLIS Institute Tübingen, ang Max Planck Institute for Intelligent Systems, at security firm Snyk, ay tumutukoy sa isang partikular na uri ng AI: mga reasoning model. Ito ay mga modelo na hindi agad sumasagot at sa halip ay nagsisimula sa isang panloob na chain-of-thought (isang step-by-step scratchpad kung saan nilulutas ng AI ang isang problema bago ipakita sa iyo ang sagot), at pagkatapos ay nagbibigay ng huling tugon.
Ang Anthropic, OpenAI, at Google ay pare-parehong ini-encrypt ang nakatagong scratchpad na iyon. Ang encryption—ang proseso ng paghalo ng data sa isang hindi mababasa na code—ay nilalayon upang protektahan ang intellectual property ng kumpanya at ilayo ang sensitibong intermediate reasoning mula sa mga user. Ang naka-encrypt na block ay ibinabalik sa mga server ng provider sa bawat follow-up na mensahe, na pinapanatili ang pag-uusap nang hindi nagtatabi ng anumang bagay sa dulo ng kumpanya.
Ang depekto ay arkitektural. Sa halip na ikabit ang bawat naka-encrypt na reasoning block sa isang partikular na user, session, o modelo, ang tatlong provider ay gumagamit ng isang single, provider-wide encryption key sa kanilang buong ecosystem. "Ang mga naka-encrypt na block na ito ay ganap na tugma at maaaring palitan sa iba't ibang session, user, at maging sa iba't ibang modelo sa loob ng ecosystem ng isang provider," sulat ng mga mananaliksik.
Nangangahulugan iyan na ang isang block ng naka-encrypt na reasoning mula sa Claude Opus 4.8—ang flagship model ng Anthropic—ay maaaring ipasok sa Claude Haiku 4.5, isang mas mura, at hindi gaanong binabantayang bersyon nang hindi nilalabag ang mga patakaran ng Anthropic. Kulang ang Haiku sa anti-distillation alignment (safety training na partikular na idinisenyo upang pigilan ang isang modelo na i-transcribe ang sarili nitong reasoning sa utos) na mayroon ang Opus.
Sabihan ang Haiku na basahin ang naka-encrypt na block nang salita sa salita, at gagawin nito. "Sa pamamagitan ng pagpasok ng naka-encrypt na reasoning trace mula sa isang partikular na modelo sa isang mas mahina, at hindi gaanong binabantayang modelo mula sa parehong provider, pinipilit namin itong i-decode at ilabas ang trace nang salita sa salita sa plaintext, nang hindi direktang dina-jailbreak ang mas may kakayahang modelo," nakasaad sa papel.
"Ang cross-model portability ay nangangahulugang mababasa ng Haiku 4.5 ang mga kaisipan ng Opus 4.8," isinulat ng nangungunang mananaliksik na si Alexander Panfilov sa X. Ang parehong atake ay naulit sa pamilya ng GPT-5.6 ng OpenAI at sa linya ng modelo ng Gemini ng Google. Walang kinakailangang espesyal na access—sapat na ang standard API access (ang koneksyon na ginagamit ng mga developer upang bumuo ng mga application sa ibabaw ng mga modelo ng AI) upang isagawa ito.
We can finally talk about it:
We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company.
We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7
— Alexander Panfilov (@kotekjedi_ml) August 11, 2026
Upang ipakita ang tunay na pinsala, kinuha ng pangkat ang 6,708 pampublikong ibinahaging transcript ng AI agent—mga automated session log na regular na ina-upload ng mga developer sa GitHub at Hugging Face para sa kolaborasyon o debugging. Na-decode nila ang 315,320 reasoning block mula sa mga log na iyon.
"Madalas ibinabahagi ng mga developer ang kanilang mga session log at naka-encrypt na thinking trace sa publiko online, nang hindi nalalaman ang sensitibong data na nakatago sa loob ng mga naka-encrypt na block," tala ng papel. Karamihan sa mga sikreto na iyon ay hindi lumabas sa nakikitang output ng AI—umiral lang sila sa loob ng naka-encrypt na reasoning, hindi nakikita ng sinuman na hindi nagpatakbo ng atake.
Ang kahinaan ay nagbubukas ng apat na attack vector maliban sa simpleng pagnanakaw ng credential: pagnanakaw ng proprietary reasoning pattern mula sa mga kumpanya ng AI upang sanayin ang mga nakikipagkumpitensyang modelo sa pamamagitan ng distillation (kapag ang isang mas maliit na AI ay natututong gayahin ang isang mas malaking AI sa pamamagitan ng pag-aaral ng mga output nito); pagkuha ng pribadong data mula sa mga shared log; pagpapatupad ng invisible prompt injection, kung saan ang mga mapanirang instruksyon ay nakatago sa loob ng mga naka-encrypt na reasoning block na hindi nakikita ng mga security monitoring tool; at jailbreaking ng mga makapangyarihang modelo sa pamamagitan ng kanilang hindi gaanong binabantayang bersyon.
Ang Anthropic, OpenAI, at Google ay pare-parehong nag-deploy ng server-side mitigation matapos sundin ng pangkat ang responsible disclosure procedure. Gaya ng naunang iniulat ng Decrypt, ang Anthropic ay patuloy na naging pokus para sa mga security researcher ngayong taon, lalo na dahil mas maraming token ang kinokonsumo ng mga pinakabagong modelo nito sa prosesong iyon.
Nakalabas na ang mga patch. Ang 6,708 session transcript na may decoded reasoning block na nakuha na mula sa pampublikong web ay hindi mawawala.








