
Sectorul inteligenței artificiale se confruntă în prezent cu un blocaj sever al datelor de antrenament, mai ales că monopolurile tehnologice centralizate blochează accesul dezvoltatorilor aflați la început de drum la conducte de informații de înaltă calitate. Platforma de infrastructură de date descentralizată Perceptron încearcă să abordeze acest blocaj structural prin implementarea unui strat de infrastructură descentralizată care colectează informații web de la dispozitivele utilizatorilor obișnuiți.
Mass-media modernă se concentrează în totalitate pe evidențierea modului în care nume de top din spațiul inteligenței artificiale implementează constant sisteme hardware de generație următoare pentru a-și amplifica puterea de calcul brută. Însă una dintre cele mai puțin discutate constrângeri operaționale este calitatea datelor de antrenament care stau la baza oricărui model AI funcțional.
Problema este că, în condițiile în care majoritatea covârșitoare a conținutului web deschis a fost deja culeasă în detaliu, controlul corporativ agresiv asupra interfețelor de programare a aplicațiilor publice (API-uri) a blocat accesul la restul fundațiilor de colectare a seturilor de date în spatele unor paywall-uri exorbitante de milioane de dolari. A devenit, în esență, un privilegiu exclusiv prohibitiv de scump pentru o mână de monopoluri tehnologice masive.
Pentru giganții tehnologici care conduc în prezent cursa AI, asigurarea acestor conducte de informații costisitoare nu reprezintă o provocare financiară majoră, dar ce se întâmplă cu inovatorii subfinanțați? Fără bugetele necesare, startup-urile aflate la început de drum se confruntă cu dificultăți în a construi produse competitive.
„OpenAI plătește aproximativ 60 până la 100 de milioane de dolari pe an companiilor precum Reddit și Twitter pentru a putea accesa date prin API-uri”, a declarat Peter Anthony, Co-fondator și CEO Perceptron, pentru crypto.news în timpul unui interviu recent.
„Multe proiecte AI noi nu au bugete pentru a cheltui 60-100 de milioane de dolari pentru a putea accesa date. Dacă construiești cel mai bun model din lume, este destul de inutil dacă nu are acces la date de bună calitate. Poți fi cel mai inteligent copil din școală, dar dacă nu poți accesa nicio carte, nu ai prea multe informații de prezentat.”
Anthony a realizat că această asimetrie de piață lasă loc pentru o infrastructură alternativă care ar servi segmentului de piață independent, ceea ce l-a condus în cele din urmă la co-fondarea Perceptron, o platformă care intenționează să utilizeze lățimea de bandă inactivă a consumatorilor pentru a rezolva „problema blocajului datelor” de care suferă AI în prezent.
„Majoritatea datelor lumii au fost deja accesate și extrase, dar există o mulțime de date care sunt cumva ascunse în diferite locuri care nu sunt încă accesibile, așa că noi colectăm date și ne poziționăm pentru a putea furniza date companiilor AI la un cost redus”, a explicat Anthony.
Dar ce este această lățime de bandă inactivă pe care Perceptron intenționează să o valorifice? Anthony a explicat că acesta este un activ economic nerecunoscut pe care utilizatorii de zi cu zi îl produc constant prin navigarea digitală de rutină, doar pentru a vedea cum marile corporații îl extrag și profită de pe urma lui.
„În acest moment, de fiecare dată când tu și eu folosim internetul pe telefoanele noastre, pe computerele noastre, generăm date. Aceste date sunt colectate, împachetate în seturi de date masive de companii precum Google și vândute pentru milioane, uneori miliarde de dolari. Cu toate acestea, tu și eu nu vedem niciodată un cent din această valoare.”
Ceea ce a făcut Perceptron este să răstoarne complet acest model extractiv. Ei au construit o rețea care se întinde în peste 150 de țări, cuprinzând aproximativ 800.000 de noduri, iar aceste noduri sunt alimentate de utilizatori individuali care rulează pur și simplu o extensie de browser pe Chrome sau o aplicație pe dispozitivele lor Android.
Deși aceste instalări la nivel de endpoint nu extrag fișiere digitale private și nu furnizează companiei telemetrie personală sensibilă, ele asigură perspective geografice localizate, pe care Anthony le-a descris ca fiind „puncte de observație diferite” asupra web-ului deschis, care pot fi apoi extrase în bucăți mici și combinate într-un set de date semnificativ.
„Este foarte important să ne concentrăm pe faptul că nu folosește datele individuale, nu accesează datele și informațiile dvs. personale, dar să spunem că în acest moment sunteți în Malawi. Când vă uitați la un anumit site web, aș putea merge și eu să mă uit la același site web, dar șansele sunt, deoarece sunt în Dubai, că vom vedea un alt tip de rezultate. Tot ceea ce obținem din această situație este posibilitatea de a folosi computerul dvs. pentru a privi ceva precum o pagină web normală, sau orice altceva.”
Pentru a ilustra, Anthony a menționat că, dacă un client corporativ necesită un set de date de postări pe rețelele sociale legate de sănătate din SUA, Perceptron poate coordona între rețeaua sa globală de noduri pentru a extrage postări publice individuale fără a interacționa cu API-urile restrictive ale întreprinderilor.
Deoarece aceste date sunt deja accesibile gratuit publicului prin orice browser web standard, rutarea colectării prin noduri terminale individuale ocolește legal paywall-urile comerciale. Odată ce aceste pachete mici de date sunt recuperate, rețeaua transferă datele neprelucrate înapoi către un server centralizat, unde modelele specializate de inteligență artificială curăță și auditează informațiile pentru controlul calității.
„Procedând astfel, putem reduce semnificativ costul care este perceput în prezent de multe dintre marile companii centralizate precum Google.”
Următoarea întrebare este de ce ar oferi cineva hardware-ul său voluntar unei rețele de acest tip, iar răspunsul este simplu: o buclă de valoare partajată care asigură că aceste noduri câștigă puncte pentru conectivitatea lor pasivă, care urmează să fie convertite în tokenuri cripto native pe viitor.
Potrivit lui Anthony, acest model distribuit „le va permite să câștige puncte” care acționează ca o metrică directă a contribuției lor la rețea, și, prin urmare, „ori de câte ori există venituri generate de companie, tokenurile vor fi reintroduse în ecosistem” pentru a susține o buclă economică ciclică.
„Vor exista, de asemenea, tokenuri puse deoparte care sunt folosite pentru răscumpărarea tokenurilor”, a adăugat el.
Cu toate acestea, nu oricine rulează un nod se califică esențial pentru recompense consistente, deoarece există provocarea omniprezentă a controlului calității, care poate compromite integritatea setului de date dacă este lăsată neverificată.
Perceptron abordează acest aspect prin rutarea pachetelor colectate înapoi către un server centralizat, unde algoritmii automatizați evaluează sistematic intrările în raport cu reperele țintă înainte de a elibera orice compensație.
Mai mult, Anthony a declarat că startup-ul a achiziționat recent o companie specializată în software de verificare a tranzacțiilor și plăților pentru a automatiza structural acest proces de validare.
Pentru a angaja în continuare participanții la rețea și pentru a stimula crearea de seturi de date, Perceptron intenționează, de asemenea, să lanseze o platformă structurată de „Data Questing”, care va permite contribuitorilor să transforme efortul uman activ în intrări unice de antrenament.
„Ne propunem să putem construi și crea seturi de date care nu sunt disponibile în prezent prin procese centralizate”, a adăugat Anthony.
Pe termen lung, Anthony a spus că ar dori să vadă rețeaua tranziționând către un model axat pe inteligența afacerilor, capabil să ofere analize de nivel profund pentru clienții corporativi.
„Diferența este că seturile de date tradiționale sunt statice, sunt colectate o singură dată și devin rapid depășite. Dar există o cantitate enormă de date generate de fiecare dată când interacționați cu ceva online, iar în prezent, majoritatea se pierde pur și simplu”, a spus Anthony.
„Un singur server care încearcă să monitorizeze toți acești utilizatori diferiți nu poate aduna cu adevărat informații semnificative la acea scară. Ceea ce avem nevoie este o trecere către inteligența afacerilor distribuită, astfel încât să putem îmbunătăți efectiv serviciile în domenii precum comerțul electronic, tranzacționarea și multe altele.”
Perceptron a lansat, de asemenea, un Fond de Date AI de 10 milioane de dolari, prin care platforma se așteaptă să finanțeze dezvoltatori independenți și să sprijine implementarea de „proiecte reale care oferă servicii reale”. Conform termenilor programului, echipele de ingineri selectate primesc cinci săptămâni de asistență dedicată pentru infrastructura de date și până la 5 TB de date din lumea reală gratuit, pentru a accelera optimizarea modelelor AI în stadiu incipient.
„Scopul este de a sprijini proiectele pe măsură ce cresc și cerințele lor de date cresc. Putem deveni unul dintre furnizorii lor preferați, este atât o investiție în ecosistemul mai larg, cât și o modalitate pentru noi de a construi venituri consistente, pe termen lung”, a menționat Anthony.
La momentul publicării, Anthony a declarat că Perceptron furnizează deja în mod activ diverse produse de date unei varietăți de întreprinderi comerciale. Rețeaua oferă seturi extinse de date de imagini platformelor generative text-to-video, inclusiv o companie numită Everlyn AI, pentru a antrena modelele să sintetizeze cu precizie conținut vizual.
Dincolo de aceasta, proiectul depășește și compilarea standard de imagini, deoarece platforma a intrat în sectorul analizei sentimentelor prin urmărirea discursului public pe Twitter, YouTube și piețele de active digitale. Analiza acestui sentiment public ajută firmele cripto și bursele să construiască instrumente de urmărire care oferă semnale timpurii pentru a preveni fluctuațiile bruște de preț.