सभी श्रेणियाँ

“डेटा फ्यूज़न” से “नेटिव आर्किटेक्चर” की ओर बढ़ना: सेंसटाइम ने नियो आर्किटेक्चर जारी किया, जो मल्टीमॉडल मॉडल्स के प्रदर्शन की सीमा को पुनः परिभाषित करता है

2026-09-18

सेंसटाइम ने अपने नए बहु-मॉडल मॉडल आर्किटेक्चर, एनईओ को आधिकारिक रूप से जारी किया है और ओपन सोर्स किया है, जिसे नानयांग टेक्नोलॉजिकल यूनिवर्सिटी एस-लैब के सहयोग से विकसित किया गया है, जो सेंसनोवा बहु-मॉडल मॉडल के लिए एक नई पीढ़ी के आर्किटेक्चर की नींव रखता है।
उद्योग का पहला उपलब्ध मूल बहु-मॉडल आर्किटेक्चर (नेटिव वीएलएम) होने के नाते, जो गहन एकीकरण प्राप्त करता है, एनईओ पारंपरिक "मॉड्यूलर" पैराडाइम के पारंपरिक बंधनों को मूल सिद्धांतों से तोड़ता है और नवाचारी रूप से "बहु-मॉडल के लिए विशेष रूप से जन्मा होने" के लिए डिज़ाइन किया गया है। कोर आर्किटेक्चर स्तर पर विभिन्न मॉडलिटीज़ के गहन एकीकरण के माध्यम से, यह प्रदर्शन, दक्षता और सार्वभौमिकता में एक व्यापक टूटफूट प्राप्त करता है, बहु-मॉडल मॉडलों के प्रदर्शन की सीमा को पुनः परिभाषित करता है, और कृत्रिम बुद्धिमत्ता की बहु-मॉडल प्रौद्योगिकी के "मूल आर्किटेक्चर" के नए युग में आधिकारिक प्रवेश को चिह्नित करता है।
रुकावटों को तोड़ना, 'पैचवर्क' को अलविदा कहना, 'मूल' को अपनाना
वर्तमान में, उद्योग में प्रचलित बहु-मॉडल मॉडल्स अधिकांशतः "दृश्य एन्कोडर+प्रोजेक्टर+भाषा मॉडल" के मॉड्यूलर पैटर्न का अनुसरण करते हैं। लार्ज लैंग्वेज मॉडल (LLM) पर आधारित यह विस्तार विधि छवि इनपुट के साथ संगतता प्राप्त करती है, लेकिन मूल रूप से अभी भी भाषा पर केंद्रित रहती है, और छवि व भाषा का संलयन केवल डेटा स्तर तक ही सीमित रहता है। यह "जोड़-टाँक" डिज़ाइन न केवल सीखने की दक्षता को कम करता है, बल्कि जटिल बहु-मॉडल परिदृश्यों—जैसे छवि के विस्तृत विवरणों को पकड़ना या जटिल स्थानिक संरचना को समझना—में मॉडल की प्रसंस्करण क्षमता को भी सीमित करता है। सेंसटाइम NEO आर्किटेक्चर इसी समस्या के समाधान के लिए विकसित किया गया था। पहले से ही 2024 के दूसरे छमाही में, शांगटांग ने चीन में बहु-मॉडल स्वदेशी संलयन प्रशिक्षण प्रौद्योगिकी में अग्रणी टूट की घोषणा की, जिसने एकल मॉडल के साथ सुपरक्लू भाषा मूल्यांकन और ओपनकॉम्पैस बहु-मॉडल मूल्यांकन में शीर्ष स्थान प्राप्त किया। इस मुख्य प्रौद्योगिकी के आधार पर, निस्सिन सेंसनोवा 6.0 का निर्माण किया गया, जिसने बहु-मॉडल तर्कणा में अग्रणी क्षमता प्राप्त की। इसके बाद, जुलाई 2025 में निचिरॉन सेंसनोवा 6.5 लॉन्च किया गया, जिसने एन्कोडर स्तर पर प्रारंभिक संलयन सुनिश्चित किया, बहु-मॉडल मॉडल्स की लागत-प्रभावशीलता को तीन गुना बढ़ाया, और चीन में ग्राफ़िक व टेक्स्ट के अंतर्विराम अनुमान (इंटरलीव्ड इंफरेंस) के व्यावसायिक स्तर के पहले लॉन्च के रूप में स्थापित किया। सेंसटाइम ने पारंपरिक मॉड्यूलर संरचना को पूरी तरह त्याग दिया है और मूल सिद्धांतों से शुरू करते हुए, शून्य से डिज़ाइन किए गए NEO स्वदेशी आर्किटेक्चर को लॉन्च किया है।
तीन मूलभूत नवाचार दृष्टि और भाषा के गहन एकीकरण को साकार करते हैं
NEO आर्किटेक्चर अंतिम दक्षता और गहन एकीकरण जैसे मूल सिद्धांतों पर आधारित है, और ध्यान तंत्र, स्थिति संकेतन और अर्थ-मैपिंग जैसे तीन प्रमुख आयामों में आधारभूत नवाचारों के माध्यम से, मॉडल में स्वाभाविक रूप से दृश्य और भाषा दोनों को एकीकृत रूप से संसाधित करने की क्षमता होती है
मूल पैच एम्बेडिंग: विविध छवि टोकनाइज़र्स को त्याग दिया जाता है और एक विशिष्ट पैच एम्बेडिंग लेयर (PEL) के माध्यम से पिक्सेल से शब्दों तक एक सतत मैपिंग का निर्माण नीचे से ऊपर की ओर किया जाता है। यह डिज़ाइन छवि के विवरणों को अधिक सूक्ष्म रूप से पकड़ने में सक्षम है, जिससे प्रमुख मॉडलों में छवि मॉडलिंग की सीमा को मौलिक रूप से तोड़ा जाता है।
स्वदेशी रोपे: त्रि-आयामी स्थान-समय आवृत्ति आवंटन को नवाचारपूर्ण रूप से अलग करता है, जिसमें दृश्य आयाम में उच्च आवृत्तियों का और भाषिक आयाम में निम्न आवृत्तियों का उपयोग किया जाता है, जो दोनों प्रकार के संकेतों की प्राकृतिक संरचना के साथ पूर्णतः अनुकूलित होता है। यह न केवल एनईओ को छवियों की स्थानिक संरचना को सटीक रूप से पकड़ने में सक्षम बनाता है, बल्कि वीडियो प्रसंस्करण और फ्रेम-पार क्रॉस-फ्रेम मॉडलिंग जैसे जटिल दृश्यों तक सुग्राही रूप से विस्तारित होने की क्षमता भी प्रदान करता है।
स्वदेशी बहु-शीर्ष ध्यान: विभिन्न प्रकार के संकेतों की विशेषताओं के अनुकूल, एनईओ ने एकीकृत ढांचे के भीतर पाठ टोकन के लिए स्व-प्रवाही ध्यान (ऑटोरिग्रेसिव अटेंशन) और दृश्य टोकन के लिए द्वि-दिशात्मक ध्यान दोनों को लागू किया है। यह डिज़ाइन मॉडल में स्थानिक संरचना सहसंबंध के उपयोग को काफी बढ़ाती है, जिससे जटिल चित्र-पाठ मिश्रित समझ और तर्कणा को बेहतर रूप से समर्थित किया जा सकता है।
इसके अतिरिक्त, नवाचारी प्री-बफ़र और पोस्ट-एलएलएम दो-चरणीय संलयन प्रशिक्षण रणनीति के साथ, एनईओ मूल एलएलएम की पूर्ण भाषाई तर्क प्रक्रिया क्षमता को अवशोषित कर सकता है, जबकि इसकी शक्तिशाली दृश्य धारणा क्षमता का शून्य से निर्माण किया जाता है, जिससे पारंपरिक अंतर-माध्यम प्रशिक्षण में भाषाई क्षमता के कमज़ोर होने की समस्या पूरी तरह सुलझ जाती है।
परीक्षणित प्रदर्शन: फ़्लैगशिप-स्तरीय प्रदर्शन का मूल्यांकन करने के लिए डेटा का एक-दसवाँ हिस्सा उपयोग किया गया
स्थापत्य नवाचार से संचालित, एनईओ ने आश्चर्यजनक डेटा दक्षता और प्रदर्शन लाभों का प्रदर्शन किया है: अत्यधिक उच्च डेटा दक्षता: केवल उद्योग-समकक्ष प्रदर्शन मॉडलों (३९ करोड़ छवि-पाठ उदाहरण) के डेटा आकार के १/१० के साथ, एनईओ शीर्ष-श्रेणी की दृश्य धारणा क्षमताओं का विकास कर सकता है। विशाल डेटा या अतिरिक्त दृश्य एन्कोडरों पर निर्भर न होते हुए, इसकी संक्षिप्त संरचना कई दृश्य समझ कार्यों में क्यूवेन२-वीएल और इंटरनवीएल३ जैसे शीर्ष संशोधित फ्लैगशिप मॉडलों के समान प्रदर्शन प्राप्त कर सकती है। उत्कृष्ट और संतुलित प्रदर्शन: एमएमएमयू, एमएमबी, एमएमस्टार, सीडी-आई, पोप आदि जैसे कई सार्वजनिक प्रामाणिक मूल्यांकनों में, एनईओ संरचना ने उच्च अंक प्राप्त किए हैं, जो अन्य मूल वीएलएम्स की तुलना में व्यापक प्रदर्शन को प्रदर्शित करता है और वास्तव में मूल संरचना के "सटीकता-हीन नुकसान" को साकार करता है। अंतिम तार्किक लागत-प्रभावशीलता: विशेष रूप से ०.६बी–८बी पैरामीटर सीमा के भीतर, एनईओ को किनारे पर तैनाती में महत्वपूर्ण लाभ हैं। यह न केवल सटीकता और दक्षता में दोहरी प्रगति प्राप्त करता है, बल्कि अनुमान लगाने की लागत को भी काफी कम कर देता है, जिससे बहु-माध्यमिक दृश्य धारणा की "लागत-प्रभावशीलता" को अत्यधिक। ओपन सोर्स सह-निर्माण
एआई बुनियादी ढांचे के अगले पीढ़ी के निर्माण का आधार "मॉडल का कंकाल" है, और केवल एक मजबूत कंकाल के साथ ही यह भविष्य की बहु-मोडल प्रौद्योगिकी का समर्थन कर सकता है।
निओ आर्किटेक्चर के प्रारंभिक संलयन डिज़ाइन में कोई भी रिज़ॉल्यूशन और लंबी छवि इनपुट का समर्थन किया जाता है, जो वीडियो और शारीरिक बुद्धिमत्ता जैसे अग्रणी क्षेत्रों तक सुग्राही रूप से विस्तारित होता है, जिससे नीचे से ऊपर तक और एंड-टू-एंड सच्चा संलयन प्राप्त होता है। अनुप्रयोग के दृष्टिकोण से, एंड-टू-एंड "मूल एकीकरण" डिज़ाइन रोबोट शारीरिक अंतःक्रिया, बुद्धिमान टर्मिनल बहु-मोडल प्रतिक्रिया, वीडियो समझ, 3डी अंतःक्रिया और शारीरिक बुद्धिमत्ता जैसे विविध परिदृश्यों के अनुप्रयोग के लिए मजबूत तकनीकी समर्थन प्रदान करता है।
वर्तमान में, सेंसटाइम ने ओपन-सोर्स समुदाय में मूल बहु-मोडल वास्तुकला पर नवाचार और अनुप्रयोग को बढ़ावा देने के लिए एनईओ वास्तुकला पर आधारित दो विनिर्देश मॉडल—2B और 9B—को आधिकारिक रूप से ओपन सोर्स कर दिया है। सेंसटाइम टेक्नोलॉजी ने कहा है कि वह ओपन सोर्स सहयोग और परिदृश्य-आधारित कार्यान्वयन के माध्यम से एनईओ को एक स्केलेबल और पुनः उपयोग योग्य अगली पीढ़ी की एआई अवसंरचना के रूप में विकसित करने के प्रति प्रतिबद्ध है, जिससे मूल बहु-मोडल तकनीक का प्रयोग प्रयोगशाला से व्यापक औद्योगिक स्तर पर किया जा सके, तथा अगली पीढ़ी के औद्योगिक स्तर के मूल बहु-मोडल तकनीक मानकों के निर्माण को त्वरित किया जा सके।

हमारे बारे में
फ़ोन: ०५१८-८०२३६६९९
ईमेल: [email protected]
पता: जियांगसू प्रांत, लियानयुंगांग शहर, हाइज़्हौ ज़िला
उद्योग और सूचना प्रौद्योगिकी मंत्रालय सरकारी सेवा प्लेटफ़ॉर्म
सू आईसीपी तैयारी २०२५२११९१४
सू गॉन्गवांग सुरक्षा संख्या ३२०७०६०२०१०१८४
तकनीकी सहायता: जियांगसू शियाओला टेक्नोलॉजी कंपनी लिमिटेड
फेसबुक फेसबुक
फेसबुक
व्हॉट्सएप व्हॉट्सएप
व्हॉट्सएप