
Investigadores de seguridad han encontrado una manera de leer los "pensamientos internos" cifrados de cada modelo de razonamiento de IA importante, y descubrieron 62 claves API activas y 33 contraseñas enterradas en registros de sesión que los desarrolladores habían compartido públicamente en línea sin saber lo que contenían.
“Al decodificar 315.320 bloques de razonamiento extraídos de repositorios públicos, recuperamos 367 artefactos de Información de Identificación Personal (PII) y 182 credenciales”, escribieron los investigadores.
El artículo, presentado el 10 de agosto por un equipo de MATS Research, el Instituto ELLIS de Tubinga, el Instituto Max Planck de Sistemas Inteligentes y la firma de seguridad Snyk, se dirige a una clase específica de IA: los modelos de razonamiento. Estos son modelos que no solo responden de inmediato, sino que comienzan con una cadena de pensamiento interna (un bloc de notas paso a paso donde la IA elabora un problema antes de mostrar la respuesta), y luego entregan una respuesta final.
Anthropic, OpenAI y Google cifran ese bloc de notas oculto. El cifrado, el proceso de codificar datos en un código ilegible, está destinado a proteger la propiedad intelectual de la empresa y mantener el razonamiento intermedio sensible lejos de los usuarios. El bloque cifrado se devuelve a los servidores del proveedor con cada mensaje de seguimiento, manteniendo la conversación sin almacenar nada en el extremo de la empresa.
La falla es arquitectónica. En lugar de vincular cada bloque de razonamiento cifrado a un usuario, sesión o modelo específico, los tres proveedores utilizan una única clave de cifrado a nivel de proveedor en todo su ecosistema. "Estos bloques cifrados son totalmente compatibles e intercambiables entre diferentes sesiones, usuarios e incluso diferentes modelos dentro del ecosistema de un proveedor", escribieron los investigadores.
Eso significa que un bloque de razonamiento cifrado de Claude Opus 4.8, el modelo insignia de Anthropic, puede inyectarse en Claude Haiku 4.5, un hermano más barato y menos protegido, sin romper las reglas de Anthropic. Haiku carece de la alineación antidestilación (entrenamiento de seguridad diseñado específicamente para evitar que un modelo transcriba su propio razonamiento bajo demanda) que tiene Opus.
Dile a Haiku que lea el bloque cifrado textualmente, y lo hace. "Al inyectar un rastro de razonamiento cifrado de un modelo dado en un modelo más débil y menos protegido del mismo proveedor, lo obligamos a decodificar y generar el rastro textualmente en texto plano, sin siquiera hacer jailbreak al modelo más capaz directamente", afirma el artículo.
"La portabilidad entre modelos significa que Haiku 4.5 puede leer los pensamientos de Opus 4.8", escribió el investigador principal Alexander Panfilov en X. El mismo ataque se reprodujo en la familia GPT-5.6 de OpenAI y en la línea de modelos Gemini de Google. No se requirió acceso especial; el acceso API estándar (la conexión que utilizan los desarrolladores para crear aplicaciones sobre los modelos de IA) fue suficiente para ejecutarlo.
Por fin podemos hablar de ello:
Encontramos una manera de extraer el razonamiento oculto de los modelos de frontera utilizando una vulnerabilidad en las API de todas las empresas de IA de frontera.
Verificamos que nuestro recuento de tokens de razonamiento coincide 1:1 con los tokens de pensamiento de la API facturados para la mayoría de las consultas que realizamos. pic.twitter.com/S7wN8aP3X7
— Alexander Panfilov (@kotekjedi_ml) August 11, 2026
Para demostrar el daño en el mundo real, el equipo extrajo 6.708 transcripciones de agentes de IA compartidas públicamente —registros de sesión automatizados que los desarrolladores suelen publicar en GitHub y Hugging Face para colaboración o depuración. Decodificaron 315.320 bloques de razonamiento de esos registros.
“Los desarrolladores suelen compartir sus registros de sesión y rastros de pensamiento cifrados públicamente en línea, sin ser conscientes de los datos sensibles ocultos dentro de los bloques cifrados”, señala el artículo. La mayoría de esos secretos nunca aparecieron en la salida visible de la IA; solo existían dentro del razonamiento cifrado, invisibles para cualquiera que no hubiera ejecutado el ataque.
La vulnerabilidad abre cuatro vectores de ataque más allá del simple robo de credenciales: el robo de patrones de razonamiento propietarios de empresas de IA para entrenar modelos competidores mediante destilación (cuando una IA más pequeña aprende a imitar a una más grande estudiando sus resultados); la extracción de datos privados de registros compartidos; la ejecución de inyección de prompt invisible, donde las instrucciones maliciosas se ocultan dentro de bloques de razonamiento cifrados que las herramientas de monitoreo de seguridad nunca ven; y el jailbreaking de modelos potentes a través de sus hermanos menos protegidos.
Anthropic, OpenAI y Google implementaron mitigaciones del lado del servidor después de que el equipo siguió los procedimientos de divulgación responsable. Como Decrypt informó anteriormente, Anthropic ha sido un foco recurrente para los investigadores de seguridad este año, especialmente porque sus últimos modelos consumen muchos más tokens en ese proceso.
Los parches están activos. Las 6.708 transcripciones de sesión con bloques de razonamiento decodificados que ya se extrajeron de la web pública no desaparecerán.