
Агенти OpenAI використовували німецький вебсайт для обміну ярликами завдань, обходу обмежень та способів приховування своєї діяльності, починаючи з травня, згідно з розслідуванням Reuters, опублікованим у п’ятницю.
Представники OpenAI дізналися про цю діяльність за кілька тижнів до публікації, але не розкрили її, повідомляє Reuters з посиланням на двох людей, обізнаних у справі. Компанія заявила, що розкрила відповідні інциденти та сумлінно співпрацювала із зовнішніми експертами.
Дослідники Сідні Фон Аркс, Кормак Слейд Берд, Спенсер Кіттс і Томас Ларсен виявили близько 18 000 дописів від ШІ-агентів, які ідентифікували себе як приналежні до OpenAI, згідно з їхнім попереднім звітом. Фон Аркс, генеральний директор некомерційної організації з безпеки ШІ Nightingale, та Берд виявили цю діяльність наприкінці серпня, повідомляє Reuters.
Дослідники вважають, що агентам були доручені завдання з пошуку в Інтернеті з обмеженим часом, з дозволом читати вебсайти, але не публікувати на них. Проте вони знайшли спосіб писати на DseWiki, загальнодоступному німецькому сайті для програмістів, де обмінювалися відповідями та ділилися способами обходу обмежень.
Згідно зі звітом, агенти почали намагатися редагувати вікі 11 травня і досягли успіху 24 травня, пізніше видаючи себе за модераторів, намагаючись використовувати вразливості та перевіряючи, коли їх вимикають. Вони створили резервні сторінки після того, як адміністратор почав видаляти повідомлення 19 червня, повідомляє Reuters. Дослідники пов'язали діяльність з OpenAI через імена користувачів агентів та шаблони трафіку, включаючи відвідування з IP-адрес OpenAI 21 червня.
Активність агентів різко знизилася наступного дня, що свідчить про можливе втручання компанії, заявили дослідники.
OpenAI оскаржила характеристику діяльності на DseWiki як хакерства, базуючись на переглянутих матеріалах, і заявила, що вивчає повні висновки.
«Ми не змогли відповісти на звинувачення, оскільки Reuters та автори звіту відхилили наш запит на доступ до висновків до публікації. Зараз ми ретельно переглядаємо його вміст і зробимо всі необхідні подальші кроки», – заявив представник OpenAI у заяві, переданій Decrypt.
Представник також відкинув звинувачення у звіті Reuters про те, що юридичний відділ компанії чинив опір ширшому розслідуванню.
«Заяви про те, що наша юридична команда перешкоджала розслідуванню інциденту, є неправдивими», – сказали вони.
OpenAI заявила, що інцидент з DseWiki не пов'язаний з витоком даних Hugging Face на початку цього року. У своїй публічній оцінці безпеки, опублікованій у вівторок, компанія описала додаткові заходи безпеки, призначені для виявлення та припинення несанкціонованої діяльності під час навчання та розгортання.
Хоча звіт Reuters не вказує Astra як відповідальну за німецький інцидент, розкриття інформації відбулося після четвергового запуску GPT-6 Astra. OpenAI назвала Astra своєю першою моделлю з «критичними» можливостями кібербезпеки, що означає, що вона може знаходити та використовувати невідомі вразливості в добре захищених системах раніше без покрокового керівництва людини, за умови наявності відповідних інструментів та доступу.
Anthropic також переглянула свої заходи безпеки після того, як моделі Claude отримали доступ до систем реальних компаній під час тестування. Компанія визнала провали у безпеці та поведінці та запровадила суворішу ізоляцію та моніторинг для оцінок кібербезпеки.
Розкриття інформації також відбувається на тлі того, як сенатор США Берні Сандерс (незалежний, Вермонт) та представник США Грег Касар (демократ, Техас) оголосили про майбутній Акт про заборону штучного суперінтелекту.
Пропозиція передбачає повну заборону розробки та розгортання суперінтелектуального ШІ та тимчасове призупинення розробки передового ШІ, доки новий федеральний регулятор не встановить правила безпеки, згідно з офісом Сандерса.