الصفحة الرئيسةمركز أخبار LBank
تم الكشف عن "الأفكار الداخلية" لكل نموذج ذكاء اصطناعي رئيسي في استغلال ضخم
inner-thoughts-every-major-ai-model-exposed-exploit
تم الكشف عن "الأفكار الداخلية" لكل نموذج ذكاء اصطناعي رئيسي في استغلال ضخم
وجد الباحثون أن كل مزود رئيسي للذكاء الاصطناعي يشفّر رموز الاستدلال بمفتاح عالمي واحد — واستغلوا ذلك لفك ترميز 315,320 كتلة تفكير مخفية من السجلات العامة، واستعادوا كلمات مرور ومفاتيح API حيّة خلال العملية.
2026-08-12 المصدر:decrypt.co

باختصار

  • وجد فريق من الباحثين أن شركات Anthropic وOpenAI وجوجل تستخدم جميعها مفتاح تشفير عالميًا واحدًا لرموز استدلال الذكاء الاصطناعي.
  • عبر فك تشفير 315,320 كتلة استدلال تم جمعها من مستودعات GitHub وHugging Face العامة، استعاد الباحثون 182 بيانات اعتماد، بما في ذلك 62 مفتاح API فعالًا، و33 كلمة مرور، و30 عنوان بريد إلكتروني شخصيًا.
  • قامت OpenAI وAnthropic وجوجل بتطبيق تحديثات من جانب الخادم بعد الإفصاح المسؤول، لكن سجلات الجلسات التاريخية التي تمت مشاركتها علنًا بالفعل تظل قابلة للفك.

اكتشف باحثو الأمن طريقة لقراءة "الأفكار الداخلية" المشفرة لكل نموذج استدلال رئيسي للذكاء الاصطناعي—وكشفوا عن 62 مفتاح API فعالًا و33 كلمة مرور مدفونة في سجلات الجلسات التي شاركها المطورون علنًا عبر الإنترنت دون معرفة ما تحتويه.

كتب الباحثون: "عبر فك تشفير 315,320 كتلة استدلال تم جمعها من المستودعات العامة، استعدنا 367 قطعة من المعلومات الشخصية المحددة (PII) و182 بيانات اعتماد."

تستهدف الورقة البحثية، التي قدمها فريق من MATS Research، ومعهد ELLIS Tübingen، ومعهد ماكس بلانك للأنظمة الذكية، وشركة الأمن Snyk في 10 أغسطس، فئة محددة من الذكاء الاصطناعي: نماذج الاستدلال. هذه النماذج لا تجيب فورًا، بل تبدأ بسلسلة تفكير داخلية (مسودة خطوة بخطوة حيث يعمل الذكاء الاصطناعي على حل مشكلة قبل عرض الإجابة)، ثم تقدم استجابة نهائية.

تقوم Anthropic وOpenAI وجوجل جميعها بتشفير تلك المسودة المخفية. يهدف التشفير—وهو عملية تشويش البيانات إلى رمز غير قابل للقراءة—إلى حماية الملكية الفكرية للشركة وإبعاد الاستدلالات الوسيطة الحساسة عن المستخدمين. يتم تمرير الكتلة المشفرة مرة أخرى إلى خوادم المزود مع كل رسالة متابعة، مما يحافظ على المحادثة دون تخزين أي شيء على جانب الشركة.

مفتاح واحد ليحكمها جميعًا

الخلل معماري. فبدلاً من ربط كل كتلة استدلال مشفرة بمستخدم أو جلسة أو نموذج معين، تستخدم جميع الشركات الثلاث مفتاح تشفير واحدًا على مستوى المزود عبر نظامها البيئي بأكمله. كتب الباحثون: "هذه الكتل المشفرة متوافقة وقابلة للتبادل بشكل كامل عبر الجلسات والمستخدمين وحتى النماذج المختلفة ضمن النظام البيئي للمزود."

وهذا يعني أن كتلة استدلال مشفرة من Claude Opus 4.8—النموذج الرائد لـ Anthropic—يمكن حقنها في Claude Haiku 4.5، وهو نموذج شقيق أرخص وأقل حماية دون خرق قواعد Anthropic. يفتقر Haiku إلى محاذاة مقاومة التقطير (التدريب الأمني المصمم خصيصًا لمنع النموذج من نسخ استدلاله الخاص عند الطلب) الذي يمتلكه Opus.

اطلب من Haiku قراءة الكتلة المشفرة حرفيًا، وسيفعل ذلك. تنص الورقة البحثية: "عبر حقن تتبع استدلال مشفر من نموذج معين في نموذج أضعف وأقل حماية من نفس المزود، نجبره على فك تشفير التتبع وإخراجه حرفيًا بنص عادي، دون اختراق النموذج الأكثر قدرة مباشرة".

كتب الباحث الرئيسي ألكسندر بانفيلوف على X: "قابلية النقل بين النماذج تعني أن Haiku 4.5 يمكنه قراءة أفكار Opus 4.8". وقد تكرر نفس الهجوم عبر عائلة GPT-5.6 من OpenAI ومجموعة نماذج Gemini من جوجل. لم يتطلب الأمر وصولاً خاصًا—كان وصول API القياسي (الاتصال الذي يستخدمه المطورون لبناء تطبيقات فوق نماذج الذكاء الاصطناعي) كافيًا لتنفيذه.

We can finally talk about it:

We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company.

We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7

— Alexander Panfilov (@kotekjedi_ml) August 11, 2026

ما تحتويه السجلات العامة

لإظهار الأضرار في العالم الحقيقي، قام الفريق بجمع 6,708 نسخ من سجلات وكلاء الذكاء الاصطناعي المشتركة علنًا—وهي سجلات جلسات تلقائية ينشرها المطورون بشكل روتيني على GitHub وHugging Face للتعاون أو تصحيح الأخطاء. قاموا بفك تشفير 315,320 كتلة استدلال من تلك السجلات.

تشير الورقة البحثية إلى أن "المطورين يشاركون سجلات جلساتهم وتتبعات تفكيرهم المشفرة علنًا عبر الإنترنت بشكل متكرر، دون علمهم بالبيانات الحساسة المخفية داخل الكتل المشفرة". لم تظهر معظم تلك الأسرار أبدًا في مخرجات الذكاء الاصطناعي المرئية—بل كانت موجودة فقط داخل الاستدلال المشفر، وغير مرئية لأي شخص لم ينفذ الهجوم.

تفتح هذه الثغرة الأمنية أربعة متجهات هجوم تتجاوز سرقة بيانات الاعتماد البسيطة: سرقة أنماط الاستدلال الاحتكارية من شركات الذكاء الاصطناعي لتدريب نماذج منافسة عبر التقطير (عندما يتعلم ذكاء اصطناعي أصغر تقليد نموذج أكبر من خلال دراسة مخرجاته)؛ استخراج البيانات الخاصة من السجلات المشتركة؛ تنفيذ حقن المطالبة غير المرئي، حيث يتم إخفاء التعليمات الضارة داخل كتل الاستدلال المشفرة التي لا تراها أدوات مراقبة الأمن أبدًا؛ واختراق النماذج القوية من خلال أشقائها الأقل حماية.

قامت Anthropic وOpenAI وجوجل جميعها بتطبيق إجراءات تخفيف على جانب الخادم بعد أن اتبع الفريق إجراءات الإفصاح المسؤول. وكما ذكرت Decrypt سابقًا، كانت Anthropic محط تركيز متكرر لباحثي الأمن هذا العام، خاصة وأن أحدث نماذجها تستهلك عددًا أكبر بكثير من الرموز في تلك العملية.

التحديثات مباشرة. أما 6,708 نسخة من سجلات الجلسات مع كتل الاستدلال التي تم فك تشفيرها والتي تم جمعها بالفعل من الويب العام، فلن تختفي.

العملات المشفرة الشائعة
سجل الآن ولا تفوّت أي تحديثات!