
محققان امنیتی راهی برای خواندن "افکار درونی" رمزگذاری شده تمامی مدلهای اصلی استدلال هوش مصنوعی پیدا کردهاند—و 62 کلید API فعال و 33 رمز عبور را کشف کردهاند که در گزارشهای نشستی دفن شده بودند که توسعهدهندگان بدون اطلاع از محتوای آنها، به صورت عمومی آنلاین به اشتراک گذاشته بودند.
محققان نوشتند: «با رمزگشایی 315,320 بلوک استدلالی که از مخازن عمومی جمعآوری شده بودند، ما 367 مورد از اطلاعات قابل شناسایی شخصی (PII) و 182 اعتبارنامه را بازیابی کردیم.»
این مقاله که در 10 آگوست توسط تیمی از MATS Research، مؤسسه ELLIS Tübingen، مؤسسه Max Planck برای سیستمهای هوشمند، و شرکت امنیتی Snyk ارائه شد، یک دسته خاص از هوش مصنوعی را هدف قرار میدهد: مدلهای استدلالی. این مدلها مدلهایی هستند که بلافاصله پاسخ نمیدهند و در عوض با یک زنجیره فکری داخلی (یک دفترچه یادداشت گام به گام که هوش مصنوعی در آن یک مسئله را قبل از نشان دادن پاسخ به شما حل میکند) شروع میکنند، سپس یک پاسخ نهایی ارائه میدهند.
Anthropic، OpenAI و Google همگی این دفترچه یادداشت پنهان را رمزگذاری میکنند. رمزگذاری—فرآیند درهم آمیختن دادهها به یک کد ناخوانا—برای محافظت از مالکیت معنوی شرکت و دور نگه داشتن استدلالهای میانی حساس از کاربران در نظر گرفته شده است. بلوک رمزگذاری شده با هر پیام پیگیری به سرورهای ارائهدهنده بازگردانده میشود، و مکالمه را بدون ذخیره هیچ چیز در سمت شرکت حفظ میکند.
این نقص معماری است. به جای اتصال هر بلوک استدلالی رمزگذاری شده به یک کاربر، نشست یا مدل خاص، هر سه ارائهدهنده از یک کلید رمزگذاری واحد و مختص ارائهدهنده در سراسر اکوسیستم خود استفاده میکنند. محققان نوشتند: «این بلوکهای رمزگذاری شده در سراسر نشستهای مختلف، کاربران و حتی مدلهای مختلف در اکوسیستم یک ارائهدهنده، کاملاً سازگار و قابل تعویض هستند.»
این بدان معناست که یک بلوک استدلال رمزگذاری شده از Claude Opus 4.8—مدل پرچمدار Anthropic—میتواند بدون نقض قوانین Anthropic، به Claude Haiku 4.5، که مدل ارزانتر و کمتر محافظت شده است، تزریق شود. Haiku فاقد همترازی ضد تقطیر (آموزش ایمنی که به طور خاص برای جلوگیری از بازنویسی استدلال خود توسط مدل به فرمان طراحی شده است) است که Opus دارد.
به Haiku بگویید که بلوک رمزگذاری شده را کلمه به کلمه بخواند، و این کار را میکند. مقاله میگوید: «با تزریق یک رد استدلال رمزگذاری شده از یک مدل معین به یک مدل ضعیفتر و کمتر محافظت شده از همان ارائهدهنده، ما آن را مجبور میکنیم که رد را کلمه به کلمه به صورت متن ساده رمزگشایی و خروجی دهد، بدون اینکه هرگز مدل تواناتر را مستقیماً جیلبریک کند.»
الکساندر پانفیلوف، محقق اصلی، در X نوشت: «قابلیت حمل بین مدلها به این معنی است که Haiku 4.5 میتواند افکار Opus 4.8 را بخواند.» همین حمله در خانواده GPT-5.6 شرکت OpenAI و مدلهای Gemini گوگل نیز تکرار شد. هیچ دسترسی خاصی لازم نبود—دسترسی استاندارد API (اتصالی که توسعهدهندگان برای ساخت برنامهها بر روی مدلهای هوش مصنوعی استفاده میکنند) برای اجرای آن کافی بود.
We can finally talk about it:
We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company.
We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7
— Alexander Panfilov (@kotekjedi_ml) August 11, 2026
برای اثبات آسیب واقعی، تیم 6,708 رونوشت عامل هوش مصنوعی که به صورت عمومی به اشتراک گذاشته شده بودند—گزارشهای نشست خودکار که توسعهدهندگان معمولاً برای همکاری یا اشکالزدایی در GitHub و Hugging Face ارسال میکنند—را جمعآوری کردند. آنها 315,320 بلوک استدلالی را از این گزارشها رمزگشایی کردند.
این مقاله اشاره میکند: «توسعهدهندگان غالباً گزارشهای نشست و ردپای فکری رمزگذاری شده خود را به صورت عمومی آنلاین به اشتراک میگذارند، در حالی که کاملاً از دادههای حساسی که در بلوکهای رمزگذاری شده پنهان شدهاند، بیاطلاع هستند.» بیشتر این اسرار هرگز در خروجی قابل مشاهده هوش مصنوعی ظاهر نشدند—آنها تنها در داخل استدلال رمزگذاری شده وجود داشتند، و برای هر کسی که این حمله را اجرا نکرده بود، نامرئی بودند.
این آسیبپذیری چهار بردار حمله را فراتر از سرقت ساده اعتبارنامه باز میکند: سرقت الگوهای استدلالی اختصاصی از شرکتهای هوش مصنوعی برای آموزش مدلهای رقیب از طریق تقطیر (هنگامی که یک هوش مصنوعی کوچکتر با مطالعه خروجیهای یک هوش مصنوعی بزرگتر، تقلید از آن را یاد میگیرد)؛ استخراج دادههای خصوصی از گزارشهای به اشتراک گذاشته شده؛ اجرای تزریق پرامپت پنهان، که در آن دستورالعملهای مخرب در داخل بلوکهای استدلالی رمزگذاری شدهای پنهان میشوند که ابزارهای نظارت امنیتی هرگز آنها را نمیبینند؛ و جیلبریک کردن مدلهای قدرتمند از طریق خواهر و برادران کمتر محافظت شدهشان.
Anthropic، OpenAI و Google همگی پس از اینکه تیم رویههای افشای مسئولانه را دنبال کرد، کاهشدهندههای سمت سرور را منتشر کردند. همانطور که Decrypt قبلاً گزارش داده بود، Anthropic امسال کانون توجه مکرر محققان امنیتی بوده است، به ویژه از آنجایی که جدیدترین مدلهای آن توکنهای بسیار بیشتری در آن فرآیند مصرف میکنند.
وصلهها فعال هستند. 6,708 رونوشت نشست با بلوکهای استدلالی رمزگشایی شده که قبلاً از وب عمومی جمعآوری شدهاند، به جایی نمیروند.