ГоловнаНовинний центр LBank
Ornith — це відкрита модель кодування, розроблена для агентів, а не для людей
ornith-open-source-coding-model-built-for-agents
Ornith — це відкрита модель кодування, розроблена для агентів, а не для людей
Нова модель, створена DeepReinforce, призначена для розробників, які прагнуть, щоб ШІ доводив справу до кінця, а не просто автозаповнював наступний рядок.
2026-06-29 Джерело:decrypt.co

Коротко

  • DeepReinforce випустила Ornith-1.0 25 червня за ліцензією MIT, спеціально розроблену для агентів ШІ, що працюють з кодом у реальних термінальних середовищах та репозиторіях.
  • Варіант 9B набирає 69.4 балів у SWE-bench Verified, перевершуючи Google Gemma 4-31B (52.0).
  • Власний опис моделі Ornith попереджає, що моделі можуть показувати гірші результати в некодувальних завданнях — вони налаштовані на конвеєри розробки, а не на універсальні розмови ШІ.

DeepReinforce, дослідницька лабораторія ШІ, раніше відома завдяки CUDA-L1 та циклу оптимізації код-агента IterX, випустила Ornith-1.0 наприкінці минулого тижня — сімейство моделей кодування з відкритим вихідним кодом, доступних на Hugging Face у чотирьох розмірах на основі кількості параметрів: 9 мільярдів, 31 мільярд, 35 мільярдів (суміш експертів) та флагманська модель на 397 мільярдів (суміш експертів), усі під ліцензією MIT без регіональних обмежень.

Параметри — це, по суті, кількість налаштувань і конфігурацій, які модель може обробляти під час свого навчання. Чим більше параметрів, тим більш здатною є модель. Модель на 9 мільярдів параметрів вважається невеликою, достатньою для роботи на хорошому смартфоні, але нездатною надійно виконувати будь-які складні завдання міркування. Модель на 397 мільярдів значно потужніша, але вимагає значних обчислювальних ресурсів, недоступних на споживчому обладнанні.

Лабораторія описує її як "сімейство моделей з відкритим вихідним кодом, що самовдосконалюється, спеціально для агентних завдань кодування". Це слово — агентний — відіграє тут велику роль.

Aloha! 🌺 Зустрічайте Ornith-1.0, сімейство LLM з відкритим вихідним кодом, спеціалізованих для агентного кодування.

Ornith-1.0 охоплює повні розміри параметрів, включаючи 9B Dense, 31B Dense, 35B MoE та 397B MoE. Вона досягає найсучаснішої продуктивності серед моделей з відкритим вихідним кодом порівнянного розміру на… pic.twitter.com/7g1rmacLps

— Ornith (@ornith_) June 25, 2026

Більшість ШІ, з яким взаємодіють люди, є розмовним: ви друкуєте, він відповідає, обмін закінчується. Агентний ШІ відрізняється — він отримує завдання та виконує дії для його завершення без участі людини на кожному кроці. У контексті кодування це означає ШІ, який читає файли, запускає тести, виявляє, що не так, виправляє код і повторює цикл, доки завдання не буде виконано.

Отже, агентний ШІ означає, що людині не потрібно бути за клавіатурою більшу частину часу. У цьому й полягає весь сенс. Це також напрямок, де у 2026 році відбувається найбільш комерційно значущий прогрес — моделі, які можуть працювати без нагляду через 20-етапні робочі процеси розробки, цінніші, ніж ті, що пишуть чисту функцію на запит.

Однак більшість великих мовних моделей все ще розробляються з урахуванням людського зворотного зв'язку.

Як працює мозок Ornith

Більшість агентів ШІ для кодування поєднуються з розробленою людиною системою — фіксованим набором правил для того, як агент структурує свою роботу: коли викликати інструмент, як обробляти помилки, як декомпонувати багатоетапну проблему. Натомість Ornith "розглядає каркас як об'єкт, що навчається та співрозвивається з політикою".

Переклад: замість того, щоб успадковувати чужий план дій, він розробляє свій власний.

Під час навчання з підкріпленням кожен етап навчання відбувається у дві стадії. Модель спочатку читає завдання та пропонує вдосконалену стратегію його виконання. Потім вона використовує цю стратегію для генерування рішення.

Винагорода від результату повертається до обох стадій — отже, модель оптимізується для написання кращих стратегій, а не тільки кращого коду. Робіть це тисячі та мільйони разів, і специфічні для завдань підходи з'являються без втручання людини.

DeepReinforce також серйозно ставиться до "хакінгу винагороди". Якщо модель може написати власний тренувальний каркас, вона теоретично може написати каркас, який обходить верифікатор — змінюючи файл, щоб створити видимість виконання завдання, не виконуючи його насправді. Цьому перешкоджають три рівні захисту: середовище та набір тестів є незмінними та недоступними для моделі, детермінований монітор відстежує будь-які спроби отримати доступ до обмежених шляхів або змінити сценарії верифікації, а заморожена модель судді розташована над автоматичним верифікатором як вето.

Цифри

Флагманська модель з 397 мільярдами параметрів демонструє 82.4 бали на SWE-bench Verified — тесті, де ШІ отримує реальну помилку з відкритого репозиторію GitHub і має виправити її, не бачачи набору тестів, оцінюючись як відсоток успішно вирішених проблем.

Це перевершує показники Claude Opus 4.7 (80.8) та DeepSeek-V4-Pro (80.6) у тому ж тесті. На Terminal Bench 2.1 — 89 завдань, що виконуються в контейнерних термінальних середовищах, від налагодження асинхронного коду до усунення вразливостей безпеки, оцінюваних за рівнем виконання — вона показує 77.5 проти 70.3 у Claude Opus 4.7. 

Враховуючи, що раніше публічно висловлювалися занепокоєння щодо "забруднення" SWE-bench — OpenAI на початку цього року стверджувала, що моделі завищували оцінки, запам'ятовуючи еталонні рішення, побачені під час навчання — Ornith також повідомляє цифри для SWE-bench Pro, складнішої версії, яка використовує більш різноманітні, менш "просочені" кодові бази, оцінювані таким же чином. Модель на 397 мільярдів там набирає 62.2. Значно нижче, але все ще конкурентоспроможно в галузі, і все ще краще, ніж Deepseek V4 Pro.

Модель на 9 мільярдів параметрів може бути цікавішою точкою даних. Вона набирає 69.4 на SWE-bench Verified — вище, ніж Gemma 4-31B (52), і конкурентоспроможно з Qwen 3.5-35B (70), незважаючи на те, що вона в 3-4 рази менша.

Для кого це, а для кого ні

Ornith-1.0 явно не є ШІ загального призначення. Власна документація моделі зазначає, що вона може показувати гірші результати в завданнях, що не стосуються агентного кодування. Якщо ви хочете, щоб ШІ узагальнював документ, допомагав вам писати докторську дисертацію або складав електронний лист, Ornith-1.0 — неправильний вибір.

Він оптимізований для вузького набору проблем: конвеєрів розробки, де агент ШІ отримує опис завдання, працює всередині репозиторію коду або термінальної сесії та виконує багатоетапну роботу без втручання. Це інструмент, створений для людей, які вже використовують агентну інфраструктуру — а не для тих, хто намагається вирішити, чи варто взагалі використовувати ШІ.

Заголовок "перевершує Claude" є реальним, але вимагає контексту. Як повідомляв Decrypt, кожна лабораторія зараз полює за продуктивністю в оцінках агентного кодування, тому що саме там криються корисні відмінності в продуктивності.

Ornith-1.0-397B дійсно перевершує Claude Opus 4.7 на обох різних бенчмарках кодування, але поточний флагман Anthropic, Claude Opus 4.8, набирає вище. Порівняння, яке має сенс, знаходиться в категорії відкритого вихідного коду, з порівнянною кількістю параметрів, для завдань, специфічних для агентного кодування.

Для розробників, які створюють власні конвеєри кодування, агентну інфраструктуру або подібну роботу, орієнтовану на кодування, невеликі та середні моделі, що працюють на периферійному обладнанні, можуть бути дійсно корисними, але пересічному користувачеві, можливо, варто пошукати щось інше.

Популярна криптовалюта
Зареєструйтеся зараз, щоб не пропустити жодного оновлення!