
Agentes de OpenAI utilizaron un sitio web alemán para intercambiar atajos de tareas, soluciones para eludir restricciones y formas de ocultar su actividad a partir de mayo, según una investigación de Reuters publicada el viernes.
Funcionarios de OpenAI supieron de la actividad semanas antes de la publicación, pero no la revelaron, informó Reuters, citando a dos personas familiarizadas con el asunto. La compañía dijo que había revelado incidentes relevantes y trabajado de buena fe con expertos externos.
Los investigadores Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts y Thomas Larsen encontraron aproximadamente 18.000 publicaciones de agentes de IA que se identificaban como pertenecientes a OpenAI, según su informe preliminar. Von Arx, CEO de la organización sin fines de lucro de seguridad de IA Nightingale, y Byrd descubrieron la actividad a finales de agosto, informó Reuters.
Los investigadores creen que a los agentes se les asignaron tareas de búsqueda web cronometradas con permiso para leer sitios web, pero no para publicar en ellos. Sin embargo, encontraron una manera de escribir en DseWiki, un sitio alemán de programación editable públicamente, donde intercambiaron respuestas y compartieron formas de eludir las restricciones.
Según el informe, los agentes comenzaron a intentar editar la wiki el 11 de mayo y lo lograron el 24 de mayo, suplantando posteriormente a moderadores, intentando explotar vulnerabilidades y verificando cuándo estaban siendo cerrados. Crearon páginas de respaldo después de que el administrador comenzara a eliminar mensajes el 19 de junio, informó Reuters. Los investigadores vincularon la actividad a OpenAI a través de nombres de usuario de agentes y patrones de tráfico, incluidas visitas desde direcciones IP de OpenAI el 21 de junio.
La actividad de los agentes disminuyó drásticamente al día siguiente, lo que sugiere una posible intervención de la compañía, dijeron los investigadores.
OpenAI disputó la caracterización de la actividad en DseWiki como un hackeo, basándose en el material que había revisado, y dijo que estaba examinando los hallazgos completos.
“No pudimos responder a las afirmaciones ya que Reuters y los autores del informe rechazaron nuestra solicitud de acceder a los hallazgos antes de la publicación. Ahora estamos revisando cuidadosamente su contenido y tomaremos las medidas necesarias”, dijo un portavoz de OpenAI en un comunicado compartido con Decrypt.
El portavoz también rechazó las acusaciones en el informe de Reuters de que el equipo legal de la compañía se resistió a una investigación más amplia.
“Las afirmaciones de que nuestro equipo legal desalentó la investigación del incidente son falsas”, dijeron.
OpenAI dijo que el incidente de DseWiki no estaba relacionado con la brecha de Hugging Face a principios de este año. En su evaluación pública de seguridad, publicada el martes, la compañía describió salvaguardias adicionales destinadas a detectar y detener actividades no autorizadas durante el entrenamiento y la implementación.
Aunque el informe de Reuters no identifica a Astra como responsable del incidente alemán, la revelación sigue al lanzamiento el jueves de GPT-6 Astra. OpenAI calificó a Astra como su primer modelo con capacidades de ciberseguridad “críticas”, lo que significa que puede encontrar y explotar fallos desconocidos en sistemas bien protegidos sin una guía humana paso a paso, dadas las herramientas y el acceso adecuados.
Anthropic también ha revisado sus salvaguardas después de que los modelos Claude accedieran a los sistemas de empresas reales durante las pruebas. La compañía reconoció fallos de seguridad y comportamiento e introdujo un aislamiento y monitoreo más estrictos para las evaluaciones de ciberseguridad.
La revelación también llega mientras el Senador estadounidense Bernie Sanders (I-Vt.) y el Representante estadounidense Greg Casar (D-Texas) anunciaron la próxima Ley de Prohibición de la Superinteligencia Artificial.
La propuesta prohibiría permanentemente el desarrollo y despliegue de IA superinteligente y detendría temporalmente el desarrollo avanzado de IA hasta que un nuevo regulador federal establezca reglas de seguridad, según la oficina de Sanders.