صفحه اصلیمرکز اخبار LBank
«افکار درونی» هر مدل بزرگ هوش مصنوعی در یک بهره‌برداری عظیم افشا شد
inner-thoughts-every-major-ai-model-exposed-exploit
«افکار درونی» هر مدل بزرگ هوش مصنوعی در یک بهره‌برداری عظیم افشا شد
پژوهشگران دریافتند هر ارائه‌دهندهٔ اصلی هوش مصنوعی، توکن‌های استدلال را با یک کلید سراسری واحد رمزگذاری می‌کند—و از این موضوع سوءاستفاده کردند تا ۳۱۵٬۳۲۰ بلوک فکری پنهان را از لاگ‌های عمومی رمزگشایی کنند و در این مسیر، گذرواژه‌ها و کلیدهای زندهٔ API را نیز بازیابی کنند.
2026-08-12 منبع:decrypt.co

به اختصار

  • تیمی از محققان دریافتند که Anthropic، OpenAI و Google همگی از یک کلید رمزگذاری جهانی واحد برای توکن‌های استدلال هوش مصنوعی استفاده می‌کنند.
  • با رمزگشایی 315,320 بلوک استدلالی که از مخازن عمومی GitHub و Hugging Face جمع‌آوری شده بودند، محققان 182 اعتبارنامه، شامل 62 کلید API فعال، 33 رمز عبور و 30 آدرس ایمیل شخصی را بازیابی کردند.
  • OpenAI، Anthropic و Google پس از افشای مسئولانه، پچ‌های سمت سرور را منتشر کردند، اما گزارش‌های نشست تاریخی که قبلاً به صورت عمومی به اشتراک گذاشته شده‌اند، قابل رمزگشایی باقی می‌مانند.

محققان امنیتی راهی برای خواندن "افکار درونی" رمزگذاری شده تمامی مدل‌های اصلی استدلال هوش مصنوعی پیدا کرده‌اند—و 62 کلید API فعال و 33 رمز عبور را کشف کرده‌اند که در گزارش‌های نشستی دفن شده بودند که توسعه‌دهندگان بدون اطلاع از محتوای آن‌ها، به صورت عمومی آنلاین به اشتراک گذاشته بودند.

محققان نوشتند: «با رمزگشایی 315,320 بلوک استدلالی که از مخازن عمومی جمع‌آوری شده بودند، ما 367 مورد از اطلاعات قابل شناسایی شخصی (PII) و 182 اعتبارنامه را بازیابی کردیم.»

این مقاله که در 10 آگوست توسط تیمی از MATS Research، مؤسسه ELLIS Tübingen، مؤسسه Max Planck برای سیستم‌های هوشمند، و شرکت امنیتی Snyk ارائه شد، یک دسته خاص از هوش مصنوعی را هدف قرار می‌دهد: مدل‌های استدلالی. این مدل‌ها مدل‌هایی هستند که بلافاصله پاسخ نمی‌دهند و در عوض با یک زنجیره فکری داخلی (یک دفترچه یادداشت گام به گام که هوش مصنوعی در آن یک مسئله را قبل از نشان دادن پاسخ به شما حل می‌کند) شروع می‌کنند، سپس یک پاسخ نهایی ارائه می‌دهند.

Anthropic، OpenAI و Google همگی این دفترچه یادداشت پنهان را رمزگذاری می‌کنند. رمزگذاری—فرآیند درهم آمیختن داده‌ها به یک کد ناخوانا—برای محافظت از مالکیت معنوی شرکت و دور نگه داشتن استدلال‌های میانی حساس از کاربران در نظر گرفته شده است. بلوک رمزگذاری شده با هر پیام پیگیری به سرورهای ارائه‌دهنده بازگردانده می‌شود، و مکالمه را بدون ذخیره هیچ چیز در سمت شرکت حفظ می‌کند.

یک کلید برای اداره همه

این نقص معماری است. به جای اتصال هر بلوک استدلالی رمزگذاری شده به یک کاربر، نشست یا مدل خاص، هر سه ارائه‌دهنده از یک کلید رمزگذاری واحد و مختص ارائه‌دهنده در سراسر اکوسیستم خود استفاده می‌کنند. محققان نوشتند: «این بلوک‌های رمزگذاری شده در سراسر نشست‌های مختلف، کاربران و حتی مدل‌های مختلف در اکوسیستم یک ارائه‌دهنده، کاملاً سازگار و قابل تعویض هستند.»

این بدان معناست که یک بلوک استدلال رمزگذاری شده از Claude Opus 4.8—مدل پرچمدار Anthropic—می‌تواند بدون نقض قوانین Anthropic، به Claude Haiku 4.5، که مدل ارزان‌تر و کمتر محافظت شده است، تزریق شود. Haiku فاقد همترازی ضد تقطیر (آموزش ایمنی که به طور خاص برای جلوگیری از بازنویسی استدلال خود توسط مدل به فرمان طراحی شده است) است که Opus دارد.

به Haiku بگویید که بلوک رمزگذاری شده را کلمه به کلمه بخواند، و این کار را می‌کند. مقاله می‌گوید: «با تزریق یک رد استدلال رمزگذاری شده از یک مدل معین به یک مدل ضعیف‌تر و کمتر محافظت شده از همان ارائه‌دهنده، ما آن را مجبور می‌کنیم که رد را کلمه به کلمه به صورت متن ساده رمزگشایی و خروجی دهد، بدون اینکه هرگز مدل تواناتر را مستقیماً جیلبریک کند.»

الکساندر پانفیلوف، محقق اصلی، در X نوشت: «قابلیت حمل بین مدل‌ها به این معنی است که Haiku 4.5 می‌تواند افکار Opus 4.8 را بخواند.» همین حمله در خانواده GPT-5.6 شرکت OpenAI و مدل‌های Gemini گوگل نیز تکرار شد. هیچ دسترسی خاصی لازم نبود—دسترسی استاندارد API (اتصالی که توسعه‌دهندگان برای ساخت برنامه‌ها بر روی مدل‌های هوش مصنوعی استفاده می‌کنند) برای اجرای آن کافی بود.

We can finally talk about it:

We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company.

We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7

— Alexander Panfilov (@kotekjedi_ml) August 11, 2026

آنچه گزارش‌های عمومی حاوی آن بودند

برای اثبات آسیب واقعی، تیم 6,708 رونوشت عامل هوش مصنوعی که به صورت عمومی به اشتراک گذاشته شده بودند—گزارش‌های نشست خودکار که توسعه‌دهندگان معمولاً برای همکاری یا اشکال‌زدایی در GitHub و Hugging Face ارسال می‌کنند—را جمع‌آوری کردند. آن‌ها 315,320 بلوک استدلالی را از این گزارش‌ها رمزگشایی کردند.

این مقاله اشاره می‌کند: «توسعه‌دهندگان غالباً گزارش‌های نشست و ردپای فکری رمزگذاری شده خود را به صورت عمومی آنلاین به اشتراک می‌گذارند، در حالی که کاملاً از داده‌های حساسی که در بلوک‌های رمزگذاری شده پنهان شده‌اند، بی‌اطلاع هستند.» بیشتر این اسرار هرگز در خروجی قابل مشاهده هوش مصنوعی ظاهر نشدند—آن‌ها تنها در داخل استدلال رمزگذاری شده وجود داشتند، و برای هر کسی که این حمله را اجرا نکرده بود، نامرئی بودند.

این آسیب‌پذیری چهار بردار حمله را فراتر از سرقت ساده اعتبارنامه باز می‌کند: سرقت الگوهای استدلالی اختصاصی از شرکت‌های هوش مصنوعی برای آموزش مدل‌های رقیب از طریق تقطیر (هنگامی که یک هوش مصنوعی کوچکتر با مطالعه خروجی‌های یک هوش مصنوعی بزرگتر، تقلید از آن را یاد می‌گیرد)؛ استخراج داده‌های خصوصی از گزارش‌های به اشتراک گذاشته شده؛ اجرای تزریق پرامپت پنهان، که در آن دستورالعمل‌های مخرب در داخل بلوک‌های استدلالی رمزگذاری شده‌ای پنهان می‌شوند که ابزارهای نظارت امنیتی هرگز آن‌ها را نمی‌بینند؛ و جیلبریک کردن مدل‌های قدرتمند از طریق خواهر و برادران کمتر محافظت شده‌شان.

Anthropic، OpenAI و Google همگی پس از اینکه تیم رویه‌های افشای مسئولانه را دنبال کرد، کاهش‌دهنده‌های سمت سرور را منتشر کردند. همانطور که Decrypt قبلاً گزارش داده بود، Anthropic امسال کانون توجه مکرر محققان امنیتی بوده است، به ویژه از آنجایی که جدیدترین مدل‌های آن توکن‌های بسیار بیشتری در آن فرآیند مصرف می‌کنند.

وصله‌ها فعال هستند. 6,708 رونوشت نشست با بلوک‌های استدلالی رمزگشایی شده که قبلاً از وب عمومی جمع‌آوری شده‌اند، به جایی نمی‌روند.

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!