
Флот із восьми роботизованих маніпуляторів у лабораторії GEAR від Nvidia протягом останніх кількох тижнів навчав себе вставляти штифти, встановлювати графічні карти та перерізати стяжки. Єдиними залученими людьми були ті, хто написав статтю після цього.
Ця навичка походить від ENPIRE, фреймворку, детально описаного в статті, опублікованій у вівторок дослідниками з Nvidia, Університету Карнегі-Меллон та Каліфорнійського університету в Берклі. ENPIRE повністю передає завдання навчання робота агентам ШІ-кодування, тому ж програмному забезпеченню, яке вже пише та тестує власний код, і дозволяє їм запускати цей процес безпосередньо на фізичному обладнанні.
Кодувальні агенти, такі як OpenAI's Codex, Anthropic's Claude Code та Moonshot's Kimi Code, протягом останнього року здійснювали те, що дослідники називають автодослідженням — написання коду, його тестування та переписування без участі людини. Цей цикл здебільшого залишався на екрані, де скидання невдалого експерименту нічого не коштує. ENPIRE переносить його у фізичний світ, де скидання експерименту означає переміщення справжнього роботизованого маніпулятора.
Система розділяє роботу на два етапи. На першому етапі людина проводить агента через побудову двох постійних інструментів: процедури скидання, яка повертає робочий простір у вихідне положення, та функції винагороди, яка спостерігає за відеоматеріалами камери для оцінки успіху — по суті, рефері, який ніколи не моргає і ніколи не робить перерви на обід. Це налаштування відбувається один раз, а потім повторно використовується для кожної наступної спроби.
Після створення цих інструментів, агент повністю бере на себе управління. Він шукає ідеї в опублікованих дослідженнях, обирає між методами навчання, такими як навчання через наслідування, навчання з підкріпленням або правила, написані вручну, потім переписує свій власний код і тестує результат на роботі. Ніщо в цьому циклі не вимагає спостереження людини, що є або визвольним, або трохи бентежним, залежно від того, як ви ставитеся до робота, який тримає ножиці без нагляду.
Nvidia проводила експеримент на восьми дворучних роботизованих станціях, кожна з яких мала власне обладнання, комп'ютер та кодувального агента. Станції обмінюються прогресом через Git, той самий інструмент, який кодери використовують для злиття коду, тому виграшна ідея поширюється по всьому флоту протягом декількох хвилин.
Дослідники виміряли ефективність на завданні «Push-T», де робот пересуває Т-подібний блок у цільову зону лише штовханнями, та на завданні вставляння штифтів, де він вставляє штифти у 4-міліметрові отвори. Масштабування від одного робота до восьми скоротило час освоєння Push-T приблизно з п'яти годин до двох, а вставляння штифтів — з понад 90 хвилин до приблизно 40.
За словами авторів статті, у всіх чотирьох реальних завданнях, які були протестовані, агенти довели свою політику до 99% успішності. Для вставляння штифтів агенти досягли майже ідеальної надійності швидше, ніж порівнянний метод із залученням людини, який все ще вимагає, щоб хтось з'являвся щоранку.
Джим Фен з Nvidia, співкерівник GEAR Lab, який керує дослідженнями компанії в галузі ШІ, назвав проєкт спробою вперше увімкнути AutoResearch у фізичному світі. Фен зазначив, що команда надала агентам флот роботів, виділення графічних процесорів та бюджет токенів, а потім відступила, дозволивши роботам взяти на себе управління.
Today, we enable AutoResearch in the physical world for the first time! Introducing ENPIRE: we give 8 Codex agents a fleet of robots, an allocation of GPUs, and generous token budget. We set them free with a simple goal: solve the task as quickly as possible, keep the robots busy… pic.twitter.com/zC0OQNzDBs
— Jim Fan (@DrJimFan) June 16, 2026
Розрив між симуляцією та реальністю проявився майже одразу. Усі три кодувальні агенти вирішили Push-T у симуляторі, але два з трьох зазнали невдачі, коли те саме завдання перенесли на фізичного робота, зазначається в статті.
Симулятори не мають проблем з тертям. Справжні столи мають.
Nvidia також протестувала ENPIRE у RoboCasa, симульованому кухонному бенчмарку, який оцінює роботів за такими завданнями, як відкривання шаф або вимикання плит за рівнем успішності, милостиво без ризику спалити приміщення. Там ENPIRE перевершив як власну наскрізну модель Nvidia GR00T, так і CaP-X, агента, що використовує інструменти, який повністю пропускає цикл автодослідження.
ENPIRE розширює ідею, яку Nvidia вперше висунула з Eureka, системою 2023 року, що використовувала мовну модель для написання функцій винагороди для роботів у симуляторі замість того, щоб це робили інженери вручну. ENPIRE переносить цей цикл самовдосконалення з симулятора на реальне обладнання, при цьому агент розробляє власні тести, а не лише власні винагороди.
Цей реліз збігається з тим самим тижнем, коли Alibaba представила свій власний напрямок розвитку втіленого ШІ, Qwen-Robot Suite, тріо фундаментальних моделей для навігації роботів, маніпуляцій та фізичного моделювання. Alibaba створює програмні "мізки" для тіл роботів, які вона не виробляє; Nvidia тестує, чи можуть агенти запускати весь цикл досліджень на обладнанні, яке їй належить від початку до кінця. Обидва вказують на одну й ту саму тенденцію: фізичні роботи стають наступною ареною для конкуренції кодувальних агентів.