होमLBank समाचार केंद्र
प्रत्येक प्रमुख एआई मॉडल के 'अंदरूनी विचार' बड़े पैमाने के एक्सप्लॉइट में उजागर हुए
inner-thoughts-every-major-ai-model-exposed-exploit
प्रत्येक प्रमुख एआई मॉडल के 'अंदरूनी विचार' बड़े पैमाने के एक्सप्लॉइट में उजागर हुए
शोधकर्ताओं ने पाया कि हर प्रमुख AI प्रदाता reasoning tokens को एक ही वैश्विक कुंजी से एन्क्रिप्ट करता है—और इसका उपयोग करके सार्वजनिक लॉग्स से 315,320 छिपे हुए सोच-खंडों को डिकोड किया, जिसके दौरान पासवर्ड और लाइव API keys भी पुनः प्राप्त कीं।
2026-08-12 स्रोत:decrypt.co

संक्षेप में

  • शोधकर्ताओं की एक टीम ने पाया कि एंथ्रोपिक, OpenAI, और Google सभी AI रीजनिंग टोकन के लिए एक एकल वैश्विक एन्क्रिप्शन कुंजी का उपयोग करते हैं।
  • सार्वजनिक GitHub और Hugging Face रिपॉजिटरी से स्क्रैप किए गए 315,320 रीजनिंग ब्लॉक को डीकोड करके, शोधकर्ताओं ने 182 क्रेडेंशियल बरामद किए, जिनमें 62 लाइव एपीआई कुंजियाँ, 33 पासवर्ड और 30 व्यक्तिगत ईमेल पते शामिल हैं।
  • जिम्मेदार प्रकटीकरण के बाद OpenAI, एंथ्रोपिक और Google ने सर्वर-साइड पैच तैनात किए, लेकिन सार्वजनिक रूप से साझा किए गए ऐतिहासिक सत्र लॉग अभी भी डीकोड किए जा सकते हैं।

सुरक्षा शोधकर्ताओं ने हर बड़े AI रीजनिंग मॉडल के एन्क्रिप्टेड "आंतरिक विचारों" को पढ़ने का एक तरीका खोज लिया है—और सत्र लॉग में दबे 62 लाइव एपीआई कुंजियाँ और 33 पासवर्ड का खुलासा किया है, जिन्हें डेवलपर्स ने उनमें क्या था यह जाने बिना सार्वजनिक रूप से ऑनलाइन साझा किया था।

शोधकर्ताओं ने लिखा, "सार्वजनिक रिपॉजिटरी से स्क्रैप किए गए 315,320 रीजनिंग ब्लॉक को डीकोड करके, हमने 367 व्यक्तिगत पहचान योग्य जानकारी (PII) कलाकृतियाँ और 182 क्रेडेंशियल बरामद किए।"

MATS रिसर्च, ELLIS इंस्टीट्यूट ट्यूबिंगेन, मैक्स प्लैंक इंस्टीट्यूट फॉर इंटेलिजेंट सिस्टम्स और सुरक्षा फर्म Snyk की एक टीम द्वारा 10 अगस्त को प्रस्तुत किया गया पेपर, AI के एक विशिष्ट वर्ग: रीजनिंग मॉडल को लक्षित करता है। ये वे मॉडल हैं जो तुरंत जवाब नहीं देते हैं और इसके बजाय एक आंतरिक विचार-श्रृंखला (एक स्टेप-बाय-स्टेप स्क्रैचपैड जहां AI आपको जवाब दिखाने से पहले एक समस्या पर काम करता है), फिर एक अंतिम प्रतिक्रिया देता है।

एंथ्रोपिक, OpenAI और Google सभी उस छिपे हुए स्क्रैचपैड को एन्क्रिप्ट करते हैं। एन्क्रिप्शन—डेटा को एक अपठनीय कोड में बदलने की प्रक्रिया—कंपनी की बौद्धिक संपदा की रक्षा करने और संवेदनशील मध्यवर्ती तर्क को उपयोगकर्ताओं से दूर रखने के लिए है। एन्क्रिप्टेड ब्लॉक हर फॉलो-अप संदेश के साथ प्रदाता के सर्वर पर वापस भेज दिया जाता है, जिससे कंपनी के अंत में कुछ भी स्टोर किए बिना बातचीत बनी रहती है।

सभी के लिए एक ही कुंजी

यह दोष वास्तुकला संबंधी है। प्रत्येक एन्क्रिप्टेड रीजनिंग ब्लॉक को एक विशिष्ट उपयोगकर्ता, सत्र या मॉडल से बांधने के बजाय, तीनों प्रदाता अपने पूरे पारिस्थितिकी तंत्र में एक एकल, प्रदाता-व्यापी एन्क्रिप्शन कुंजी का उपयोग करते हैं। शोधकर्ताओं ने लिखा, "ये एन्क्रिप्टेड ब्लॉक विभिन्न सत्रों, उपयोगकर्ताओं और यहां तक कि एक प्रदाता के पारिस्थितिकी तंत्र के भीतर विभिन्न मॉडलों में पूरी तरह से संगत और विनिमेय हैं।"

इसका मतलब है कि क्लाउड ओपस 4.8—एंथ्रोपिक के प्रमुख मॉडल—से एन्क्रिप्टेड रीजनिंग का एक ब्लॉक क्लाउड हाइकू 4.5 में डाला जा सकता है, जो एंथ्रोपिक के नियमों को तोड़े बिना एक सस्ता, कम संरक्षित सहोदर है। हाइकू में एंटी-डिस्टिलेशन संरेखण (सुरक्षा प्रशिक्षण विशेष रूप से एक मॉडल को कमांड पर अपने तर्क को ट्रांसक्राइब करने से रोकने के लिए डिज़ाइन किया गया) की कमी है जो ओपस में है।

हाइकू को एन्क्रिप्टेड ब्लॉक को हूबहू पढ़ने के लिए कहें, और वह ऐसा करता है। पेपर में कहा गया है, "एक दिए गए मॉडल से एक एन्क्रिप्टेड रीजनिंग ट्रेस को उसी प्रदाता के एक कमजोर और कम संरक्षित मॉडल में इंजेक्ट करके, हम इसे ट्रेस को सादे टेक्स्ट में हूबहू डिकोड और आउटपुट करने के लिए मजबूर करते हैं, बिना सीधे अधिक सक्षम मॉडल को जेलब्रेक किए।"

"क्रॉस-मॉडल पोर्टेबिलिटी का मतलब है कि हाइकू 4.5 ओपस 4.8 के विचारों को पढ़ सकता है," प्रमुख शोधकर्ता अलेक्जेंडर पैनफिलोव ने X पर लिखा। OpenAI के GPT-5.6 परिवार और Google के जेमिनी मॉडल लाइनअप में भी यही हमला दोहराया गया। किसी विशेष पहुंच की आवश्यकता नहीं थी—मानक एपीआई पहुंच (एआई मॉडल के शीर्ष पर एप्लिकेशन बनाने के लिए डेवलपर्स जिस कनेक्शन का उपयोग करते हैं) इसे निष्पादित करने के लिए पर्याप्त थी।

We can finally talk about it:

We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company.

We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7

— Alexander Panfilov (@kotekjedi_ml) August 11, 2026

सार्वजनिक लॉग में क्या था

वास्तविक दुनिया के नुकसान को प्रदर्शित करने के लिए, टीम ने 6,708 सार्वजनिक रूप से साझा किए गए AI एजेंट ट्रांसक्रिप्ट्स—स्वचालित सत्र लॉग, जिन्हें डेवलपर्स सहयोग या डिबगिंग के लिए नियमित रूप से GitHub और Hugging Face पर पोस्ट करते हैं—को स्क्रैप किया। उन्होंने उन लॉग से 315,320 रीजनिंग ब्लॉक को डीकोड किया।

पेपर में कहा गया है, "डेवलपर्स अक्सर अपने सत्र लॉग और एन्क्रिप्टेड विचार ट्रेस को सार्वजनिक रूप से ऑनलाइन साझा करते हैं, एन्क्रिप्टेड ब्लॉकों के भीतर छिपे संवेदनशील डेटा से पूरी तरह अनजान होते हैं।" इनमें से अधिकांश रहस्य कभी भी दृश्य AI आउटपुट में दिखाई नहीं दिए—वे केवल एन्क्रिप्टेड तर्क के अंदर मौजूद थे, जो उस हमले को चलाने वाले किसी भी व्यक्ति के लिए अदृश्य थे।

यह भेद्यता साधारण क्रेडेंशियल चोरी से परे चार हमले के वैक्टर खोलती है: डिस्टिलेशन के माध्यम से प्रतिस्पर्धी मॉडल को प्रशिक्षित करने के लिए AI कंपनियों से मालिकाना तर्क पैटर्न चोरी करना (जब एक छोटा AI अपने आउटपुट का अध्ययन करके एक बड़े मॉडल की नकल करना सीखता है); साझा लॉग से निजी डेटा निकालना; अदृश्य प्रॉम्प्ट इंजेक्शन निष्पादित करना, जहां दुर्भावनापूर्ण निर्देश एन्क्रिप्टेड रीजनिंग ब्लॉकों के अंदर छिपे होते हैं जिन्हें सुरक्षा निगरानी उपकरण कभी नहीं देखते हैं; और कम संरक्षित सहोदरों के माध्यम से शक्तिशाली मॉडलों को जेलब्रेक करना।

टीम द्वारा जिम्मेदार प्रकटीकरण प्रक्रियाओं का पालन करने के बाद एंथ्रोपिक, OpenAI और Google सभी ने सर्वर-साइड शमन तैनात किए। जैसा कि डिक्रिप्ट ने पहले रिपोर्ट किया था, एंथ्रोपिक इस साल सुरक्षा शोधकर्ताओं के लिए एक आवर्ती फोकस रहा है, खासकर क्योंकि इसके नवीनतम मॉडल उस प्रक्रिया में बहुत अधिक टोकन का उपभोग करते हैं।

पैच लाइव हैं। सार्वजनिक वेब से पहले से ही स्क्रैप किए गए डिकोड किए गए रीजनिंग ब्लॉक वाले 6,708 सत्र ट्रांसक्रिप्ट कहीं नहीं जा रहे हैं।

लोकप्रिय क्रिप्टो
अभी रजिस्टर करें, कोई भी अपडेट न चूकें!