ГоловнаНовинний центр LBank
«Внутрішні думки» кожної великої AI-моделі розкрито в масштабному експлойті
inner-thoughts-every-major-ai-model-exposed-exploit
«Внутрішні думки» кожної великої AI-моделі розкрито в масштабному експлойті
Дослідники виявили, що кожен великий постачальник ШІ шифрує токени міркувань одним глобальним ключем — і скористалися цим, щоб розшифрувати 315 320 прихованих блоків мислення з публічних журналів, попутно відновивши паролі та активні API-ключі.
2026-08-12 Джерело:decrypt.co

Коротко

  • Команда дослідників виявила, що Anthropic, OpenAI та Google використовують єдиний глобальний ключ шифрування для токенів міркування ШІ.
  • Розшифрувавши 315 320 блоків міркування, зібраних з публічних репозиторіїв GitHub та Hugging Face, дослідники відновили 182 облікові дані, включаючи 62 активні ключі API, 33 паролі та 30 особистих адрес електронної пошти.
  • OpenAI, Anthropic та Google розгорнули патчі на стороні сервера після відповідального розкриття інформації, але історичні журнали сесій, вже опубліковані, залишаються доступними для розшифровки.

Дослідники безпеки знайшли спосіб читати зашифровані «внутрішні думки» кожної великої моделі міркування ШІ — і виявили 62 активні ключі API та 33 паролі, поховані в журналах сесій, які розробники опублікували онлайн, не знаючи, що в них міститься.

«Розшифрувавши 315 320 блоків міркування, зібраних з публічних репозиторіїв, ми відновили 367 артефактів особистої ідентифікуючої інформації (PII) та 182 облікові дані», — написали дослідники.

Дослідження, подане 10 серпня командою з MATS Research, ELLIS Institute Tübingen, Інституту інтелектуальних систем Макса Планка та компанії з кібербезпеки Snyk, стосується специфічного класу ШІ: моделей міркування. Це моделі, які не просто відповідають негайно, а починають з внутрішнього ланцюжка думок (покрокового чернетки, де ШІ опрацьовує проблему, перш ніж показати відповідь), а потім видають остаточну відповідь.

Anthropic, OpenAI та Google шифрують цю приховану чернетку. Шифрування — процес перетворення даних у нечитабельний код — призначене для захисту інтелектуальної власності компанії та уникнення доступу користувачів до чутливих проміжних міркувань. Зашифрований блок передається назад на сервери провайдера з кожним наступним повідомленням, підтримуючи розмову без зберігання чогось на стороні компанії.

Один ключ, щоб панувати над усіма

Вада полягає в архітектурі. Замість того, щоб прив'язувати кожен зашифрований блок міркування до конкретного користувача, сесії чи моделі, усі три провайдери використовують єдиний, загальнопровайдерський ключ шифрування в усій своїй екосистемі. «Ці зашифровані блоки повністю сумісні та взаємозамінні між різними сесіями, користувачами та навіть різними моделями в екосистемі провайдера», — написали дослідники.

Це означає, що блок зашифрованих міркувань від Claude Opus 4.8 — флагманської моделі Anthropic — можна ввести в Claude Haiku 4.5, дешевшого та менш захищеного «побратима», не порушуючи правил Anthropic. Haiku не має вирівнювання проти дистиляції (тренування безпеки, спеціально розробленого для запобігання транскрибуванню моделлю власних міркувань за командою), яке має Opus.

Скажіть Haiku прочитати зашифрований блок дослівно, і він це зробить. «Вводячи зашифрований слід міркувань від певної моделі у слабшу та менш захищену модель від того ж провайдера, ми змушуємо її розшифровувати та виводити слід дослівно у відкритому тексті, ніколи безпосередньо не зламуючи більш спроможну модель», — йдеться в дослідженні.

«Крос-модельна портативність означає, що Haiku 4.5 може читати думки Opus 4.8», — написав провідний дослідник Олександр Панфілов на X. Така ж атака була відтворена в сімействі GPT-5.6 від OpenAI та лінійці моделей Gemini від Google. Спеціального доступу не потрібно — стандартного доступу до API (з'єднання, яке розробники використовують для створення додатків на основі моделей ШІ) було достатньо для її виконання.

We can finally talk about it:

We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company.

We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7

— Alexander Panfilov (@kotekjedi_ml) August 11, 2026

Що містили публічні журнали

Щоб продемонструвати реальну шкоду, команда зібрала 6708 публічно поширених транскриптів ШІ-агентів — автоматизованих журналів сесій, які розробники регулярно публікують на GitHub та Hugging Face для співпраці або налагодження. Вони розшифрували 315 320 блоків міркування з цих журналів.

«Розробники часто публікують свої журнали сесій та зашифровані сліди думок онлайн, абсолютно не знаючи про чутливі дані, приховані в зашифрованих блоках», — зазначається в дослідженні. Більшість цих секретів ніколи не з'являлися у видимому виводі ШІ — вони існували лише всередині зашифрованих міркувань, невидимі для тих, хто не здійснював атаку.

Уразливість відкриває чотири вектори атаки, окрім простої крадіжки облікових даних: викрадення власних шаблонів міркувань у ШІ-компаній для навчання конкуруючих моделей шляхом дистиляції (коли менший ШІ вчиться імітувати більший, вивчаючи його виводи); вилучення приватних даних із спільних журналів; виконання невидимої ін'єкції підказок, де шкідливі інструкції приховані всередині зашифрованих блоків міркувань, які інструменти моніторингу безпеки ніколи не бачать; та злам потужних моделей через їхніх менш захищених «побратимів».

Anthropic, OpenAI та Google розгорнули серверні заходи пом'якшення після того, як команда дотримувалася процедур відповідального розкриття інформації. Як раніше повідомляв Decrypt, Anthropic цього року є постійним об'єктом уваги дослідників безпеки, особливо тому, що її останні моделі споживають набагато більше токенів у цьому процесі.

Патчі діють. 6708 транскриптів сесій з розшифрованими блоками міркувань, вже зібраних з публічної мережі, нікуди не зникнуть.

Популярна криптовалюта
Зареєструйтеся зараз, щоб не пропустити жодного оновлення!