ГоловнаНовинний центр LBank
Perceptron перетворює невикористану пропускну здатність на дані для навчання ШІ
perceptron-is-turning-idle-bandwidth-into-ai-training-data
Perceptron перетворює невикористану пропускну здатність на дані для навчання ШІ
Perceptron використовує вільну пропускну спроможність споживачів для збору загальнодоступних веб-даних та надання дешевших наборів даних для навчання ШІ. Платформа заявляє, що її мережа охоплює понад 150 країн та винагороджує учасників, при цьому перевіряючи якість даних перед їхнім постачанням корпоративним клієнтам. Perceptron запустив Фонд даних ШІ у розмірі 10 мільйонів доларів, щоб допомогти розробникам отримати доступ до інфраструктури даних та прискорити розробку моделей ШІ.
2026-07-03 Джерело:crypto.news

Сектор штучного інтелекту наразі стикається із серйозним вузьким місцем у навчанні даних, особливо коли централізовані технологічні монополії блокують раннім розробникам доступ до високоякісних інформаційних потоків. Децентралізована платформа для інфраструктури даних Perceptron намагається вирішити це структурне вузьке місце, розгортаючи децентралізований інфраструктурний рівень, який збирає веб-інформацію за допомогою повсякденних пристроїв користувачів.

Короткий зміст
  • Perceptron використовує вільну пропускну здатність споживачів для збору загальнодоступних веб-даних та надання дешевших наборів даних для навчання ШІ.
  • Платформа стверджує, що її мережа охоплює понад 150 країн і винагороджує учасників, перевіряючи якість даних перед їх наданням корпоративним клієнтам.
  • Perceptron запустила фонд AI Data Fund на суму $10 мільйонів для допомоги розробникам у доступі до інфраструктури даних та прискорення розробки моделей ШІ.

Сучасні медіа повністю зосереджені на тому, щоб висвітлювати, як провідні імена в галузі штучного інтелекту постійно розгортають системи апаратного забезпечення нового покоління для збільшення своєї обчислювальної потужності. Але одним з найменш обговорюваних операційних обмежень є якість навчальних даних, які складають основну основу будь-якої функціональної моделі ШІ.

Проблема полягає в тому, що більшість відкритого веб-контенту вже ретельно зібрано, а агресивний корпоративний контроль над загальнодоступними інтерфейсами прикладного програмування заблокував решту основ збору наборів даних за непомірними багатомільйонними платними доступами. По суті, це стало надзвичайно дорогим ексклюзивним привілеєм для жменьки масивних технологічних монополій.

Для технологічних гігантів, які зараз лідирують у гонці ШІ, забезпечення цих високоякісних інформаційних потоків не є великою фінансовою проблемою, але що ж робити недофінансованим інноваторам? Без необхідних бюджетів, стартапи на ранній стадії залишаються боротися за створення конкурентоспроможних продуктів.

"OpenAI платить приблизно від $60 до $100 мільйонів на рік таким компаніям, як Reddit і Twitter, щоб мати доступ до даних через API", – розповів співзасновник та генеральний директор Perceptron, Пітер Ентоні, crypto.news під час нещодавнього інтерв'ю.

"Багато нових проєктів ШІ не мають бюджету, щоб витратити від $60 до $100 мільйонів на доступ до даних. Якщо ви створите найкращу модель у світі, вона буде досить марною, якщо не матиме доступу до якісних даних. Ви можете бути найрозумнішим учнем у школі, але якщо у вас немає доступу до книг, вам дійсно не буде чого представити."

Ентоні зрозумів, що ця ринкова асиметрія залишає місце для альтернативної інфраструктури, яка обслуговуватиме незалежний ринковий сегмент, що зрештою призвело його до співзаснування Perceptron, платформи, яка планує використовувати незадіяну пропускну здатність споживачів для вирішення "проблеми вузького місця даних", від якої зараз страждає ШІ.

"Більшість світових даних вже було доступно та зібрано, але є багато даних, які приховані в різних місцях і ще недоступні, тому ми збираємо дані та позиціонуємо себе, щоб надавати дані для компаній ШІ за зниженою ціною", – пояснив Ентоні.

Збір незадіяної пропускної здатності

Але що таке ця незадіяна пропускна здатність, яку Perceptron планує використовувати? Ентоні пояснив, що це невизнаний економічний актив, який щоденні користувачі постійно генерують під час звичайного цифрового перегляду, лише для того, щоб спостерігати, як великі корпорації видобувають і отримують з цього прибуток.

"Зараз щоразу, коли ви та я користуємося Інтернетом на наших телефонах, наших комп'ютерах, ми генеруємо дані. Ці дані збираються, упаковуються у величезні набори даних такими компаніями, як Google, і продаються за мільйони, іноді мільярди доларів. Проте ми з вами ніколи не бачимо жодного цента від цієї вартості."

Те, що зробив Perceptron, полягає в тому, щоб повністю перевернути цю екстрактивну модель. Вони побудували мережу, що охоплює понад 150 країн, яка налічує близько 800 000 вузлів, і ці вузли живляться індивідуальними користувачами, які просто використовують розширення браузера в Chrome або додаток на своїх пристроях Android.

Хоча ці кінцеві установки не збирають приватні цифрові файли і не надають фірмі конфіденційну особисту телеметрію, вони натомість забезпечують локалізовані географічні перспективи, які Ентоні описав як "різні точки зору" на відкритий веб, які потім можуть бути витягнуті невеликими частинами та об'єднані в один значущий набір даних.

"Дуже важливо, щоб ми зосередилися на тому, що це не використовує дані окремих осіб, це не зачіпає ваші особисті дані та інформацію, але, скажімо, зараз ви перебуваєте в Малаві. Коли ви переглядаєте певний веб-сайт, я міг би піти і переглянути той самий веб-сайт, але, швидше за все, оскільки я в Дубаї, ми побачимо інший набір результатів. Все, що ми отримуємо від цієї ситуації, це можливість використовувати ваш комп'ютер для перегляду чогось, наприклад, звичайної веб-сторінки, або що б це не було."

Для ілюстрації Ентоні зазначив, що якщо корпоративному клієнту потрібен набір даних про дописи в соціальних мережах, пов'язані з охороною здоров'я, зі США, Perceptron може координувати роботу своєї глобальної сітки вузлів для вилучення окремих публічних дописів без взаємодії з обмежувальними корпоративними API.

Оскільки ці дані вже вільно доступні громадськості через будь-який стандартний веб-браузер, маршрутизація збору через окремі кінцеві вузли юридично обходить комерційні платні доступи. Після отримання цих невеликих пакетів даних мережа передає неочищені дані назад на централізований сервер, де спеціалізовані моделі штучного інтелекту очищають і перевіряють інформацію для контролю якості.

"Роблячи це, ми можемо значно скоротити витрати, які зараз стягуються багатьма великими централізованими компаніями, такими як Google."

Завдяки економічному циклу, що стимулює якісних учасників мережі

Наступне питання полягає в тому, чому хтось добровільно надаватиме своє обладнання такій мережі, і відповідь проста: спільний цінностний цикл, який гарантує, що ці вузли заробляють бали за свою пасивну підключеність, які в майбутньому будуть конвертовані в нативні криптотокени.

За словами Ентоні, ця розподілена модель "дозволить їм заробляти бали", які виступають прямим показником їхнього внеску в мережу, і, отже, "щоразу, коли компанія генерує дохід, токени будуть повертатися в екосистему" для підтримки циклічного економічного циклу.

"Також будуть виділені токени, які використовуватимуться для викупу токенів", – додав він.

Однак не кожен, хто керує вузлом, по суті, має право на постійні винагороди, оскільки існує постійний виклик контролю якості, який може скомпрометувати цілісність набору даних, якщо його залишити без нагляду.

Perceptron вирішує цю проблему, направляючи зібрані пакети назад на централізований сервер, де автоматизовані алгоритми систематично оцінюють вхідні дані за цільовими показниками, перш ніж виплачувати будь-яку компенсацію.

Крім того, Ентоні повідомив, що стартап нещодавно придбав компанію, що спеціалізується на програмному забезпеченні для перевірки транзакцій та платежів, щоб структурно автоматизувати цей процес валідації.

Щоб ще більше залучити учасників мережі та стимулювати створення наборів даних, Perceptron також планує запустити структуровану платформу Data Questing, яка дозволить дописувачам перетворювати активну людську працю на унікальні навчальні вхідні дані.

"Ми прагнемо ефективно створювати набори даних, які наразі недоступні через централізовані процеси", – додав Ентоні.

Кінцева мета

У довгостроковій перспективі, за словами Ентоні, він хотів би, щоб мережа перейшла до моделі, орієнтованої на бізнес-аналітику, яка зможе надавати глибокий аналіз для корпоративних клієнтів.

"Різниця полягає в тому, що традиційні набори даних статичні, вони збираються один раз і швидко застарівають. Але величезна кількість даних генерується щоразу, коли ви взаємодієте з чимось в Інтернеті, і зараз більшість з них просто марнується", – сказав Ентоні.

"Один сервер, який намагається моніторити всіх цих різних користувачів, насправді не може зібрати значущу розвідувальну інформацію в такому масштабі. Нам потрібен перехід до розподіленої бізнес-аналітики, щоб ми могли фактично покращити послуги в таких сферах, як електронна комерція, торгівля та багато іншого."

Perceptron також запустив фонд AI Data Fund на суму $10 мільйонів, за допомогою якого платформа планує фінансувати незалежних розробників та підтримувати розгортання "реальних проєктів, які надають реальні послуги". Згідно з умовами програми, обрані інженерні команди отримують п'ять тижнів спеціалізованої допомоги в галузі інфраструктури даних та до 5 ТБ реальних даних безкоштовно для прискорення оптимізації ранніх моделей ШІ.

"Мета полягає в тому, щоб підтримувати проєкти в міру їхнього зростання та збільшення вимог до даних. Ми можемо стати одним з їхніх основних постачальників, це і інвестиція в ширшу екосистему, і спосіб для нас створити стабільний, довгостроковий дохід", – зазначив Ентоні.

На момент публікації Ентоні повідомив, що Perceptron вже активно постачає різноманітні продукти даних для низки комерційних підприємств. Мережа надає великі набори зображень для платформ генерації тексту в відео, включно з компанією Everlyn AI, для навчання моделей точній синтезу візуального контенту.

Крім того, проєкт виходить за рамки стандартного збору зображень, оскільки платформа вийшла на сектор аналізу настроїв, відстежуючи публічні дискусії в Twitter, YouTube та на ринках цифрових активів. Аналіз цих публічних настроїв допомагає криптофірмам та біржам створювати інструменти відстеження, які дають ранні сигнали для запобігання раптовим коливанням цін.