
कृत्रिम बुद्धिमत्ता क्षेत्र वर्तमान में प्रशिक्षण डेटा की गंभीर कमी से जूझ रहा है, खासकर जब केंद्रीकृत प्रौद्योगिकी एकाधिकार शुरुआती चरण के डेवलपर्स को उच्च-गुणवत्ता वाली सूचना पाइपलाइनों से बाहर कर रहे हैं। विकेंद्रीकृत डेटा इंफ्रास्ट्रक्चर प्लेटफॉर्म परसेप्ट्रॉन रोज़मर्रा के उपयोगकर्ता उपकरणों के माध्यम से वेब जानकारी जुटाकर इस संरचनात्मक बाधा को दूर करने का प्रयास कर रहा है।
आधुनिक मीडिया पूरी तरह से इस बात पर केंद्रित है कि कृत्रिम बुद्धिमत्ता क्षेत्र के अग्रणी नाम अपनी कच्ची कंप्यूटिंग शक्ति को बढ़ाने के लिए लगातार अगली पीढ़ी के हार्डवेयर सिस्टम कैसे तैनात कर रहे हैं। लेकिन सबसे कम चर्चित परिचालन बाधाओं में से एक प्रशिक्षण डेटा की गुणवत्ता है जो किसी भी कार्यात्मक एआई मॉडल का मुख्य आधार बनती है।
समस्या यह है कि अधिकांश ओपन-वेब सामग्री पहले ही अच्छी तरह से एकत्र की जा चुकी है, सार्वजनिक एप्लिकेशन प्रोग्रामिंग इंटरफेस पर आक्रामक कॉर्पोरेट नियंत्रण ने डेटासेट संग्रह के शेष आधारों को अत्यधिक महंगे बहु-मिलियन डॉलर के पेवॉल के पीछे बंद कर दिया है। यह अनिवार्य रूप से कुछ विशाल तकनीकी एकाधिकारों के लिए एक अत्यधिक महंगा विशिष्ट विशेषाधिकार बन गया है।
उन तकनीकी दिग्गजों के लिए जो वर्तमान में एआई दौड़ का नेतृत्व कर रहे हैं, इन उच्च लागत वाली सूचना पाइपलाइनों को सुरक्षित करना कोई बड़ी वित्तीय चुनौती नहीं है, लेकिन कम वित्त पोषित नवोन्मेषकों का क्या? आवश्यक बजट के बिना, शुरुआती चरण के स्टार्टअप प्रतिस्पर्धी उत्पाद बनाने के लिए संघर्ष कर रहे हैं।
परसेप्ट्रॉन के सह-संस्थापक और सीईओ, पीटर एंथोनी ने हाल ही में crypto.news के साथ एक साक्षात्कार के दौरान बताया, “ओपनएआई एपीआई के माध्यम से डेटा तक पहुंचने में सक्षम होने के लिए रेडिट और ट्विटर जैसी कंपनियों को हर साल लगभग 60 मिलियन से 100 मिलियन डॉलर का भुगतान करता है।”
“बाजार में कई नए एआई प्रोजेक्ट के पास डेटा तक पहुंचने के लिए 60 मिलियन से 100 मिलियन डॉलर खर्च करने का बजट नहीं है। यदि आप दुनिया का सबसे अच्छा मॉडल बनाते हैं, तो वह काफी बेकार है यदि उसके पास अच्छी गुणवत्ता वाले डेटा तक पहुंच नहीं है। आप स्कूल में सबसे होशियार बच्चे हो सकते हैं, लेकिन यदि आप किसी भी किताब तक पहुंचने में सक्षम नहीं हैं, तो आपके पास वास्तव में पेश करने के लिए बहुत अधिक जानकारी नहीं होगी।”
एंथोनी ने महसूस किया कि बाजार की यह विषमता वैकल्पिक इंफ्रास्ट्रक्चर के लिए जगह छोड़ती है जो स्वतंत्र बाजार खंड की सेवा करेगा, जिसके परिणामस्वरूप अंततः उन्होंने परसेप्ट्रॉन की सह-स्थापना की, एक ऐसा प्लेटफॉर्म जो एआई की वर्तमान "डेटा बॉटलनेक समस्या" को हल करने के लिए निष्क्रिय उपभोक्ता बैंडविड्थ का उपयोग करने की योजना बना रहा है।
एंथोनी ने समझाया, “दुनिया के अधिकांश डेटा तक पहले ही पहुंचा जा चुका है और उसे स्क्रैप किया जा चुका है, लेकिन बहुत सारा डेटा है जो विभिन्न जगहों पर छिपा हुआ है और अभी तक सुलभ नहीं है, इसलिए हम डेटा एकत्र कर रहे हैं और खुद को इस स्थिति में ला रहे हैं कि हम एआई कंपनियों को कम लागत पर डेटा प्रदान कर सकें।”
लेकिन यह निष्क्रिय बैंडविड्थ क्या है जिसका परसेप्ट्रॉन लाभ उठाना चाहता है? एंथोनी ने समझाया कि यह एक अमान्यता प्राप्त आर्थिक संपत्ति है जिसे रोज़मर्रा के उपयोगकर्ता नियमित डिजिटल ब्राउज़िंग के माध्यम से लगातार उत्पन्न करते हैं, केवल यह देखने के लिए कि बड़ी निगम इससे लाभ कमाते हैं।
“अभी, हर बार जब आप और मैं अपने फोन, कंप्यूटर पर इंटरनेट का उपयोग करते हैं, तो हम डेटा उत्पन्न कर रहे होते हैं। वह डेटा गूगल जैसी कंपनियों द्वारा एकत्र किया जाता है, बड़े डेटासेट में पैक किया जाता है, और लाखों, कभी-कभी अरबों डॉलर में बेचा जाता है। फिर भी आप और मैं उस मूल्य का एक पैसा भी कभी नहीं देखते।”
परसेप्ट्रॉन ने जो किया है वह इस निष्कर्षण मॉडल को पूरी तरह से उलट देना है। उन्होंने 150 से अधिक देशों में फैला एक नेटवर्क बनाया है जिसमें लगभग 800,000 नोड्स शामिल हैं, और ये नोड्स व्यक्तिगत उपयोगकर्ताओं द्वारा संचालित होते हैं जो केवल क्रोम पर एक ब्राउज़र एक्सटेंशन या अपने एंड्रॉइड डिवाइस पर एक एप्लिकेशन चला रहे हैं।
जबकि ये एंडपॉइंट इंस्टॉलेशन निजी डिजिटल फाइलों को स्क्रैप नहीं करते या फर्म को संवेदनशील व्यक्तिगत टेलीमेट्री प्रदान नहीं करते, यह इसके बजाय स्थानीय भौगोलिक दृष्टिकोणों को सुरक्षित करता है, जिसे एंथोनी ने ओपन वेब पर "विभिन्न सुविधाजनक बिंदु" बताया, जिसे छोटे टुकड़ों में निकाला जा सकता है और एक सार्थक डेटासेट में संयोजित किया जा सकता है।
“यह बहुत महत्वपूर्ण है कि हम इस तथ्य पर ध्यान केंद्रित करें कि यह व्यक्तियों के डेटा का उपयोग नहीं कर रहा है, यह आपके अपने व्यक्तिगत डेटा और जानकारी में सेंध नहीं लगा रहा है, लेकिन मान लीजिए कि अभी आप मलावी में हैं। जब आप किसी विशेष वेबसाइट को देख रहे हैं, तो मैं जाकर उसी वेबसाइट को देख सकता हूँ, लेकिन संभावना है, क्योंकि मैं दुबई में हूँ, हमें अलग तरह के परिणाम देखने को मिलेंगे। इस स्थिति से हमें जो मिल रहा है वह यह है कि हम आपके कंप्यूटर का उपयोग करके एक सामान्य वेब पेज जैसी किसी चीज़ को देख सकते हैं, या जो कुछ भी हो।”
उदाहरण के तौर पर, एंथोनी ने बताया कि यदि किसी कॉर्पोरेट ग्राहक को अमेरिका से स्वास्थ्य सेवा-संबंधी सोशल मीडिया पोस्ट का डेटासेट चाहिए, तो परसेप्ट्रॉन प्रतिबंधात्मक एंटरप्राइज़ एपीआई के साथ इंटरफेस किए बिना व्यक्तिगत सार्वजनिक पोस्ट निकालने के लिए अपने वैश्विक नोड जाल (mesh) में समन्वय स्थापित कर सकता है।
क्योंकि यह डेटा किसी भी मानक वेब ब्राउज़र के माध्यम से जनता के लिए स्वतंत्र रूप से उपलब्ध है, व्यक्तिगत टर्मिनल नोड्स के माध्यम से संग्रह को रूट करके कानूनी रूप से वाणिज्यिक पेवॉल को दरकिनार कर देता है। एक बार ये छोटे डेटा पैकेट प्राप्त हो जाते हैं, नेटवर्क अपरिष्कृत डेटा को एक केंद्रीकृत सर्वर पर वापस स्थानांतरित करता है जहां विशेषज्ञ कृत्रिम बुद्धिमत्ता मॉडल गुणवत्ता नियंत्रण के लिए जानकारी को साफ़ और ऑडिट करते हैं।
“ऐसा करके, हम लागत को काफी कम कर सकते हैं जो वर्तमान में गूगल जैसी कई बड़ी केंद्रीकृत कंपनियों द्वारा लिया जा रहा है।”
अगला सवाल यह है कि कोई भी इस तरह के नेटवर्क में अपना हार्डवेयर क्यों स्वेच्छा से देगा, और इसका जवाब सीधा है, एक साझा मूल्य चक्र जो यह सुनिश्चित करता है कि ये नोड्स अपनी निष्क्रिय कनेक्टिविटी के लिए अंक अर्जित करें जो आगे चलकर मूल क्रिप्टो टोकन में परिवर्तित होने वाले हैं।
एंथोनी के अनुसार, यह वितरित मॉडल “उन्हें अंक अर्जित करने में सक्षम करेगा” जो उनके नेटवर्क योगदान का एक सीधा माप है, और इसलिए “जब भी कंपनी द्वारा राजस्व उत्पन्न होता है, तो टोकन को पारिस्थितिकी तंत्र में वापस भेज दिया जाएगा” ताकि एक चक्रीय आर्थिक चक्र को बनाए रखा जा सके।
उन्होंने आगे कहा, “टोकन वापस खरीदने के लिए अलग रखे गए टोकन भी होंगे।”
हालांकि, हर कोई जो एक नोड चला रहा है, उसे लगातार पुरस्कारों के लिए अनिवार्य रूप से योग्य नहीं माना जाता है, क्योंकि गुणवत्ता नियंत्रण की हमेशा मौजूद रहने वाली चुनौती होती है, जो यदि अनियंत्रित छोड़ दिया जाए तो डेटासेट की अखंडता से समझौता कर सकती है।
परसेप्ट्रॉन इस समस्या को एकत्रित पैकेटों को एक केंद्रीकृत सर्वर पर वापस भेजकर हल करता है, जहां स्वचालित एल्गोरिदम कोई भी मुआवजा जारी करने से पहले लक्षित बेंचमार्क के खिलाफ इनपुट का व्यवस्थित रूप से मूल्यांकन करते हैं।
इसके अलावा, एंथोनी ने कहा कि स्टार्टअप ने हाल ही में एक ऐसी कंपनी का अधिग्रहण किया है जो लेनदेन और भुगतान सत्यापन सॉफ्टवेयर में विशेषज्ञता रखती है ताकि इस सत्यापन प्रक्रिया को संरचनात्मक रूप से स्वचालित किया जा सके।
नेटवर्क प्रतिभागियों को और अधिक शामिल करने और डेटा सेट के निर्माण को भी बढ़ावा देने के लिए, परसेप्ट्रॉन एक संरचित डेटा क्वेस्टिंग प्लेटफॉर्म भी लॉन्च करने की योजना बना रहा है, जो योगदानकर्ताओं को सक्रिय मानवीय प्रयासों को अद्वितीय प्रशिक्षण इनपुट में बदलने की अनुमति देगा।
एंथोनी ने आगे कहा, “हम प्रभावी रूप से डेटासेट बनाने और ऐसे डेटासेट बनाने में सक्षम होना चाहते हैं जो वर्तमान में केंद्रीकृत प्रक्रियाओं के माध्यम से उपलब्ध नहीं हैं।”
लंबे समय में, एंथोनी ने कहा कि वह नेटवर्क को एक व्यावसायिक बुद्धिमत्ता-केंद्रित मॉडल में परिवर्तित होते देखना चाहेंगे जो एंटरप्राइज़ ग्राहकों के लिए डीप-लेयर एनालिटिक्स प्रदान करने में सक्षम हो।
एंथोनी ने कहा, “अंतर यह है कि पारंपरिक डेटासेट स्थिर होते हैं, वे एक बार एकत्र किए जाते हैं और जल्दी अप्रचलित हो जाते हैं। लेकिन हर बार जब आप ऑनलाइन किसी भी चीज़ के साथ इंटरैक्ट करते हैं तो भारी मात्रा में डेटा उत्पन्न होता है, और अभी, इसका अधिकांश भाग बस बर्बाद हो रहा है।”
परसेप्ट्रॉन ने 10 मिलियन डॉलर का एआई डेटा फंड भी लॉन्च किया है, जिसके माध्यम से प्लेटफॉर्म स्वतंत्र डेवलपर्स को वित्त पोषित करेगा और उन “वास्तविक परियोजनाओं” की तैनाती का समर्थन करेगा जो वास्तविक सेवाएं प्रदान कर रही हैं। कार्यक्रम की शर्तों के तहत, चयनित इंजीनियरिंग टीमों को पांच सप्ताह की समर्पित डेटा इंफ्रास्ट्रक्चर सहायता मिलती है और शुरुआती चरण के एआई मॉडल के अनुकूलन में तेजी लाने के लिए 5 टीबी तक वास्तविक दुनिया का डेटा मुफ्त में मिलता है।“इन सभी अलग-अलग उपयोगकर्ताओं की निगरानी करने की कोशिश करने वाला एक अकेला सर्वर उस पैमाने पर वास्तव में सार्थक जानकारी एकत्र नहीं कर सकता है। हमें वितरित व्यावसायिक बुद्धिमत्ता की ओर बदलाव की आवश्यकता है, ताकि हम ई-कॉमर्स, ट्रेडिंग और बहुत कुछ जैसी चीजों में सेवाओं में सुधार कर सकें।”
एंथोनी ने टिप्पणी की, “लक्ष्य परियोजनाओं का समर्थन करना है जैसे-जैसे वे बढ़ते हैं और उनकी डेटा आवश्यकताएं बढ़ती हैं। हम उनके पसंदीदा प्रदाताओं में से एक बन सकते हैं, यह व्यापक पारिस्थितिकी तंत्र में एक निवेश भी है और हमारे लिए लगातार, दीर्घकालिक राजस्व बनाने का एक तरीका भी है।”
प्रकाशन के समय तक, एंथोनी ने कहा कि परसेप्ट्रॉन पहले से ही विभिन्न वाणिज्यिक उद्यमों को विविध डेटा उत्पाद सक्रिय रूप से आपूर्ति कर रहा है। नेटवर्क टेक्स्ट-टू-वीडियो जनरेटिव प्लेटफॉर्म को व्यापक इमेज डेटासेट प्रदान करता है, जिसमें एवरलिन एआई नामक एक कंपनी भी शामिल है, ताकि मॉडल को दृश्य सामग्री को सटीक रूप से संश्लेषित करने के लिए प्रशिक्षित किया जा सके।
इसके अलावा, यह परियोजना मानक छवि संकलन से भी आगे बढ़ रही है, क्योंकि प्लेटफॉर्म ट्विटर, यूट्यूब और डिजिटल परिसंपत्ति बाजारों में सार्वजनिक चर्चा को ट्रैक करके भावनात्मक विश्लेषण क्षेत्र में प्रवेश कर चुका है। इस सार्वजनिक भावना का विश्लेषण क्रिप्टो फर्मों और एक्सचेंजों को ट्रैकिंग टूल बनाने में मदद करता है जो अचानक मूल्य परिवर्तनों को रोकने के लिए शुरुआती संकेत देते हैं।