OpenZeppelin зазначає методологічні вади в бенчмарку безпеки блокчейну OpenAI EVMbench

OpenZeppelin виявляє забруднення даних та недійсні вразливості високої критичності в EVMbench від OpenAI, ставлячи під сумнів надійність AI-бенчмарків для безпеки блокчейну

Розгортається суперечка щодо використання штучного інтелекту та безпеки блокчейну. OpenZeppelin дослідив нові бенчмарки ШІ, випущені OpenAI стосовно смартконтрактів (EVMbench), і виявив деякі проблеми з методологією, а також забруднення тестованих даних.
Розроблений для оцінки того, наскільки добре моделі ШІ можуть ідентифікувати, усувати та експлуатувати вразливості у смартконтрактах віртуальної машини Ethereum, цей бенчмарк є результатом співпраці між криптоінвестиційною компанією Paradigm та дослідниками зі Стенфордського університету.
OpenZeppelin висловив підтримку цій пропозиції, але застосував ту саму ретельність, яка використовується для оцінки інших великих протоколів DeFi, роблячи те саме з цією пропозицією бенчмарка. Це призвело до вивчення бенчмарка, яке порушило численні важливі питання щодо того, як ми будемо вимірювати продуктивність ШІ, пов'язану з безпекою блокчейну, в майбутньому.
Для чого призначений EVMbench
EVMbench служить бенчмарком для тестування моделей ШІ на предмет фактичних вразливостей у смартконтрактах на базі коду Solidity та EVM, дозволяючи вам:
- Виявляти вразливості безпеки в коді Solidity,
- Класифікувати серйозність цих вразливостей безпеки,
- Рекомендувати патчі для ослабленої безпеки,
- Демонструвати, як зловмисник міг би використати слабке місце.
Метою бенчмарка є надання розробникам об'єктивної оцінки того, наскільки ефективно їхній код забезпечить безпеку блокчейн-рішення, коли фінансові ставки високі, а експлуатація блокчейну може призвести до незмірних втрат.
Зі зростанням використання ШІ в аудиторських процесах, ці бенчмарки можуть вплинути на вибір командами розробників інструментів ШІ для аудиту/безпеки протоколів.
Однак; порівняння ШІ в умовах високого ризику/безпрограшних середовищах вимагає високого ступеня методологічної дисципліни при бенчмаркінгу ШІ;

Зображення автора
Процес перевірки OpenZeppelin
За словами представника OpenZeppelin, компанія вирішила перевірити EVMbench, дотримуючись тих самих загальних процедур, що й ті, які використовуються для аудиту великих децентралізованих фінансових протоколів.
OpenZeppelin провів аудити багатьох проєктів, включаючи Aave, Lido та Uniswap, які обробляють транзакції на мільярди доларів.
OpenZeppelin заявив, що його метою не було заперечувати цю ініціативу; скоріше, це було забезпечення того, щоб заяви про безпеку, засновані на ШІ, підтверджувалися довільною та суворою статистичною методологією.
Компанія публічно та в обговореннях з громадськістю заявила, що бенчмарки штучного інтелекту, які впливатимуть на рішення щодо безпеки блокчейн-проєктів, повинні пройти тест на опірність зловмисникам.
Ключова проблема 1: Забруднення навчальних даних
Результати мого дослідження демонструють, що забруднення навчальних даних становить значний ризик.
Забруднення виникає тоді, коли набір даних бенчмарка, що використовується для оцінки продуктивності алгоритмів машинного навчання (МН), частково або повністю збігається з даними, які використовуються для навчання алгоритмів. Це перекриття призведе до завищених показників продуктивності.
У контексті EVMbench існує занепокоєння щодо забруднення.
Якщо будь-які вразливості, що містяться в наборах даних бенчмарка, були присутні у загальнодоступних публічних репозиторіях (наприклад, GitHub) або в інших опублікованих дослідженнях, існує ймовірність, що високорозвинені алгоритми МН запам'ятали ці патерни (тобто навчилися запам'ятовувати зв'язок між навчальними даними та відповідними показниками).
Таким чином, це підриває довіру до бенчмарків EVMbench як до дійсного показника здатності алгоритму до міркування.
Міркування є критично важливим у світі безпеки блокчейну, де існує середовище конкурентної креативності, де покладатися на інтерпретацію запам'ятованих даних (тобто пригадування) набагато складніше, ніж демонструвати послідовне застосування аналітичного мислення (тобто логіки).
Ключова проблема 2: Помилки в класифікації вразливостей
OpenZeppelin заявив у своїй другій головній проблемі щодо класифікації вразливостей, що, схоже, існує численні проблеми, класифіковані як дуже висока серйозність, які неможливо експлуатувати на практиці. Вони повідомили нам, що принаймні чотири з цих класифікацій високої серйозності насправді є недійсними, оскільки за реальних умов блокчейну ці вразливості фактично не можуть бути використані.
Важливість системи класифікації серйозності полягає в тому, що:
• Класифікації серйозності допомагають зосередити ресурси на вирішенні найважливіших проблем першочергово
• Класифікації серйозності впливають на оцінки моделі
• Громадське сприйняття можливостей ШІ буде формуватися класифікаціями серйозності
Якщо модель правильно депріоритизує неексплуатовану проблему, але цій проблемі присвоєно високий рівень серйозності, тоді ця модель може бути несправедливо покарана за це. З іншого боку, модель може просто позначати набагато більше проблем, не маючи можливості визначити, чи можна їх експлуатувати, і може отримати вищий бал.
Ці розбіжності також підривають надійність бенчмарків.

Зображення автора
Чому цілісність бенчмарків важлива для безпеки блокчейну
Критичний фактор, що формує впровадження штучного інтелекту
Бенчмарк, який забезпечує міру впевненості в тому, що певна модель ШІ зможе ефективно ідентифікувати та експлуатувати вразливості, є тим, що може спонукати команди розробників інтегрувати його у свої виробничі аудиторські конвеєри.
Використання недосконалих інструментів аудиту в Децентралізованих Фінансах (DeFi) може мати серйозні наслідки, що включають:
- Втрата коштів користувачів
- Неплатоспроможність протоколу
- Порушення управління
- Шкода репутації
Смартконтракти блокчейну зазвичай розгортаються та є незмінними. Вразливості безпеки не можуть бути легко виправлені без координації управління або міграції. Це збільшує потребу в точних класифікаціях вразливостей та надійних метриках оцінки. Ненадійний бенчмарк може створити середовище невиправданої довіри до продуктів безпеки, керованих ШІ.
Зростаюча роль ШІ в аудиті смартконтрактів
Смартконтракти зараз зазвичай перевіряються за допомогою штучного інтелекту (ШІ). Використання ШІ в цьому аспекті можна підсумувати наступним чином:
- Для попереднього сканування програмного коду та виявлення ідентифікованих нових вразливостей,
- Допомагати людським аудиторам в аналізі коду на наявність функціональних або логічних помилок,
- Надавати рекомендації щодо виправлення коду, якщо виявлені помилки, та
- Створювати тестові випадки, які симулюють експлуатацію вразливості.
Ефективне використання штучного інтелекту доповнюватиме, але не замінюватиме роботу людських аудиторів. Все частіше ми бачимо використання штучного інтелекту саме таким чином. EVMbench – це спроба оцінити, наскільки добре ШІ працює відповідно до встановлених метрик у цій підгалузі. OpenZeppelin пропонує критику цього методу оцінки, відзначаючи потребу в безпечному та зручно спроєктованому процесі оцінювання для цілей бенчмаркінгу.
Нарешті, щоб бути ефективними щодо супротивників, які активно шукатимуть слабкі місця, процеси оцінювання повинні бути розроблені таким чином, щоб їх неможливо було 'обіграти' (маніпулювати).
Ширші наслідки для оцінки ШІ в криптоіндустрії
Суперечка навколо EVMbench підкреслює постійну проблему при оцінці ШІ: розрізнення між справжнім міркуванням та розпізнаванням патернів.
Оскільки можливості великих мовних моделей продовжують розширюватися, бенчмарки, які використовуються для оцінки їхніх можливостей, зазвичай також покращуються. Однак, без належного виділення та перевірки основного набору даних бенчмарка, такі покращення можливостей можуть бути приписані впливу навчальних даних, а не розвитку справжньої аналітичної глибини.
Це розрізнення особливо важливе при оцінці безпеки смартконтрактів, оскільки ці типи експлуатації часто включають складні взаємодії, контекстуальні обмеження та економічні крайні випадки. Щоб бути надійним бенчмарком, бенчмарк повинен:
• Можливість виконання вимог через практичну експлуатованість
• Економічні міркування щодо доцільності
• Обмеження виконання, пов'язані з ончейн-транзакціями
• Поверхні атаки, які існують у фізичному світі
Якщо рівні серйозності або припущення щодо вразливостей, що використовуються в бенчмаркінгу, є невірними, ці бенчмарки можуть ввести розробників в оману. Коментарі OpenZeppelin вказують на те, що індустрія криптобезпеки має ті самі очікування щодо бенчмарків на основі ШІ, що й у процесі аудиту протоколів.
Конструктивне напруження між ШІ та експертами з безпеки
Слід зазначити, що OpenZeppelin висловив свою підтримку ініціативі до публікації своєї критики. Це свідчить про те, що аргумент спрямований не проти використання ШІ для бенчмаркінгу, а скоріше на посилення процесу бенчмаркінгу ШІ.
Взаємозв'язок між спільнотою аудиту безпеки блокчейну та дослідницькою спільнотою ШІ є конструктивним напруженням, яке створить:
Спільна робота над розробкою визначень, критеріїв та стандартів для наборів даних допоможе зменшити ймовірність надмірної впевненості в автоматизованих системах, а також заохочуватиме інновації, оскільки інструменти на основі ШІ продовжують зростати в популярності в просторі розробки Web3.
Оскільки інструменти штучного інтелекту набувають все більшої популярності в спільноті розробників Web3, стає все важливішим встановити прозорий процес перевірки їх використання.
Висновок
Результати EVMbench від OpenZeppelin підкреслюють, наскільки складно оцінити якість штучного інтелекту, що використовується для оцінки безпеки в блокчейн-просторі. Виявлення потенційного забруднення навчальних даних, що може вплинути на те, наскільки добре ШІ може ідентифікувати вразливості в контрактах, породило дуже важливу розмову навколо цілісності бенчмарків, що використовуються в цій індустрії. Ця індустрія управляє сотнями мільярдів доларів вартості, що зберігається в ланцюгу, тому використання надійних методів при проведенні будь-якого аналізу є критично важливим.
Щоб штучний інтелект став надійним учасником аудиту смартконтрактів, будь-яка структура, що використовується для оцінки ШІ, також повинна буде підлягати тому типу ворожої оцінки, яку допомагатиме встановлювати штучний інтелект для базових протоколів. Очікується, що конвергенція ШІ та блокчейну принесе значну ефективність, але, як показало це тематичне дослідження, інновації повинні будуть відповідати найвищим стандартам, щоб цей результат був реалізований.
Джерела
Пост OpenZeppelin в X про огляд EVMbench
Анонс запуску EVMbench від OpenAI та Paradigm
Документація з методології аудиту безпеки OpenZeppelin
Документація з найкращих практик безпеки смартконтрактів Ethereum
Академічне дослідження щодо забруднення даних бенчмарків ШІ та упередженості оцінки





