
Des chercheurs en sécurité ont découvert un moyen de lire les « pensées intérieures » chiffrées de tous les principaux modèles de raisonnement d'IA – et ont mis au jour 62 clés API actives et 33 mots de passe enfouis dans des journaux de session que des développeurs avaient partagés publiquement en ligne sans en connaître le contenu.
« En décodant 315 320 blocs de raisonnement extraits de dépôts publics, nous avons récupéré 367 artefacts d'informations personnelles identifiables (PII) et 182 identifiants », ont écrit les chercheurs.
L'article, soumis le 10 août par une équipe de MATS Research, de l'ELLIS Institute Tübingen, du Max Planck Institute for Intelligent Systems et de la firme de sécurité Snyk, cible une classe spécifique d'IA : les modèles de raisonnement. Il s'agit de modèles qui ne répondent pas immédiatement, mais commencent par une chaîne de pensée interne (un brouillon étape par étape où l'IA résout un problème avant de vous montrer la réponse), puis fournissent une réponse finale.
Anthropic, OpenAI et Google chiffrent tous ce brouillon caché. Le chiffrement – le processus de brouillage des données en un code illisible – vise à protéger la propriété intellectuelle de l'entreprise et à empêcher les utilisateurs d'accéder aux raisonnements intermédiaires sensibles. Le bloc chiffré est renvoyé aux serveurs du fournisseur à chaque message de suivi, maintenant la conversation sans rien stocker du côté de l'entreprise.
La faille est architecturale. Au lieu de lier chaque bloc de raisonnement chiffré à un utilisateur, une session ou un modèle spécifique, les trois fournisseurs utilisent une clé de chiffrement unique, à l'échelle du fournisseur, pour l'ensemble de leur écosystème. « Ces blocs chiffrés sont entièrement compatibles et interchangeables entre différentes sessions, utilisateurs et même différents modèles au sein de l'écosystème d'un fournisseur », ont écrit les chercheurs.
Cela signifie qu'un bloc de raisonnement chiffré de Claude Opus 4.8 – le modèle phare d'Anthropic – peut être injecté dans Claude Haiku 4.5, un modèle moins cher et moins protégé, sans enfreindre les règles d'Anthropic. Haiku n'a pas l'alignement anti-distillation (une formation de sécurité spécifiquement conçue pour empêcher un modèle de transcrire son propre raisonnement sur commande) que possède Opus.
Demandez à Haiku de lire le bloc chiffré mot pour mot, et il le fera. « En injectant une trace de raisonnement chiffrée d'un modèle donné dans un modèle plus faible et moins protégé du même fournisseur, nous le forçons à décoder et à afficher la trace textuellement en clair, sans jamais jailbreaker directement le modèle plus performant », indique l'article.
« La portabilité inter-modèles signifie que Haiku 4.5 peut lire les pensées d'Opus 4.8 », a écrit le chercheur principal Alexander Panfilov sur X. La même attaque a été reproduite sur la famille GPT-5.6 d'OpenAI et la gamme de modèles Gemini de Google. Aucun accès spécial n'était requis – un accès API standard (la connexion que les développeurs utilisent pour créer des applications basées sur des modèles d'IA) était suffisant pour l'exécuter.
Nous pouvons enfin en parler :
Nous avons trouvé un moyen d'extraire le raisonnement caché des modèles de pointe en utilisant une vulnérabilité dans les API de chaque entreprise d'IA de pointe.
Nous avons vérifié que notre nombre de jetons de raisonnement correspond aux jetons de pensée API facturés 1:1 pour la plupart des invites que nous avons interrogées.
— Alexander Panfilov (@kotekjedi_ml) August 11, 2026
Pour démontrer les dommages réels, l'équipe a extrait 6 708 transcriptions d'agents IA partagées publiquement – des journaux de session automatisés que les développeurs publient régulièrement sur GitHub et Hugging Face pour la collaboration ou le débogage. Ils ont décodé 315 320 blocs de raisonnement à partir de ces journaux.
« Les développeurs partagent fréquemment leurs journaux de session et leurs traces de pensée chiffrées publiquement en ligne, ignorant totalement les données sensibles cachées dans les blocs chiffrés », indique l'article. La plupart de ces secrets n'apparaissaient jamais dans la sortie visible de l'IA – ils n'existaient qu'à l'intérieur du raisonnement chiffré, invisibles pour quiconque n'avait pas mené l'attaque.
La vulnérabilité ouvre quatre vecteurs d'attaque au-delà du simple vol d'identifiants : le vol de modèles de raisonnement propriétaires d'entreprises d'IA pour entraîner des modèles concurrents via la distillation (lorsqu'une IA plus petite apprend à imiter une plus grande en étudiant ses sorties) ; l'extraction de données privées à partir de journaux partagés ; l'exécution d'une injection de prompt invisible, où des instructions malveillantes sont cachées à l'intérieur de blocs de raisonnement chiffrés que les outils de surveillance de la sécurité ne voient jamais ; et le jailbreaking de modèles puissants via leurs homologues moins protégés.
Anthropic, OpenAI et Google ont tous déployé des mesures d'atténuation côté serveur après que l'équipe a suivi les procédures de divulgation responsable. Comme Decrypt l'avait précédemment rapporté, Anthropic a été un centre d'intérêt récurrent pour les chercheurs en sécurité cette année, d'autant plus que ses derniers modèles consomment beaucoup plus de jetons dans ce processus.
Les correctifs sont en ligne. Les 6 708 transcriptions de session avec des blocs de raisonnement décodés déjà extraits du web public ne disparaîtront pas.