Të gjitha Kategoritë

Lëvizja nga "fuzionimi i të dhënave" te "arkitektura native": SenseTime lansoi arkitekturën NEO, duke riperkufizuar kufirin e performancës së modeleve multimodale

2026-09-18

SenseTime ka publikuar zyrtarisht dhe ka bërë të hapur burimin e arkitekturës së re multimodale të saj, NEO, të zhvilluar në bashkëpunim me Nanyang Technological University S-Lab, duke vendosur themelet për një arkitekturë të re gjeneracioni për modelin multimodal SenseNova.
Si arkitektura multimodale native (Native VLM) e parë në industrinë që është e disponueshme dhe që arrin integrim të thellë, NEO thyen kufizimet e paradigmes tradicionale "modulare" nga parimet themelore, dhe projektimi i saj inovativ është bërë me qëllim specifikisht për multimodalitetin. Përmes integrimi të thellë të shumë modaliteteve në nivelin e arkitekturës bazë, ajo arrin një zhvillim të plotë në performancë, efikasitet dhe universalitet, riperkufizon kufirin e performancës së modeleve multimodale dhe shënon hyrjen zyrtare të teknologjisë së inteligjencës artificiale multimodale në një epokë të re të "arkitekturës native".
Duke thyer pengesat, largohemi nga 'përpunimi i pjesëve', mirësevini 'native'
Në kohën e tanishme, modelet multimodale kryesore në industrinë e teknologjisë ndjekin përgjithësisht paradigmen modulare të "enkoderit vizual + projektorit + modelit gjuhësor". Ky metodë e zgjerimit bazuar në Modelin e Madh Gjuhësor (LLM) arrin përshtatshmërinë me hyrjet e imazheve, por thellësisht vazhdon të fokusohet në gjuhë, ndërsa bashkimi i imazheve dhe gjuhës mbetet vetëm në nivelin e të dhënave. Kjo dizajn "përshkues" nuk ka vetëm efikasitet të ulët mësimi, por gjithashtu kufizon aftësinë e modelit për të përpunuar skena komplekse multimodale, si p.sh. kapja e detajeve të imazhit apo kuptimi i strukturave hapësinore të komplikuara. Arkitektura SenseTime NEO u krijuar për të adresuar këtë problem. Që nga e dyta gjysmë e vitit 2024, Shangtang e kaloi parë në Kinë teknologjinë e trajnimit natyral multimodal, duke fituar vlerësimin gjuhësor SuperCLUE dhe vlerësimin multimodal OpenCompass me një model të vetëm; dhe bazuar në këtë teknologji qendrore, krijoi Nissin SenseNova 6.0 për të arritur aftësi udhëheqëse në arsyetimin multimodal. Më pas, në korrik të vitit 2025, u lansua Nichiron SenseNova 6.5, i cili arriti bashkimin e hershëm në nivelin e enkoderit, triplojoi efikasitetin kosto-performancë të modeleve multimodale dhe ishte i pari në Kinë që lansoi inferencën tregtare të nivelit komercial për tekst dhe grafikë të ndërlidhur. SenseTime ka bërë hapat tjetër duke braktisur plotësisht strukturën modulare tradicionale dhe duke filluar nga parimet themelore, duke lansuar arkitekturën native NEO, të krijuar nga zero.
Tre innovacione kryesore arrijnë një bashkimi të thellë të shikimit dhe gjuhës
Arkitektura NEO bazohet në konceptet kryesore të efikasitetit maksimal dhe integrimi të thellë, dhe përmes inovacioneve thelbësore në tri dimensione kryesore: mekanizmi i vëmendjes, kodimi i pozicionit dhe hartimi semantik, modeli posedon natyrshëm aftësinë për të trajtuar në mënyrë të bashkuar si vizionin ashtu edhe gjuhën
Injektimi natyror i Patches: hedh poshtë tokenizatorët diskretë të figurave dhe ndërton një hartim të vazhdueshëm nga pikselat te fjalët, nga baza deri në kulm, përmes një shtresë unike të Injektimit të Patches (PEL). Kjo dizajnimi mund të kapë detajet e figurave më saktë, duke thyer thellësisht pengesën e modelimit të figurave në modele kryesore.
RoPE native: ndanë në mënyrë inovative shpërndarjen e frekuencave hapësinore-kohore tridimensionale, duke përdorur frekuenca të larta në dimensionin vizual dhe frekuenca të ulëta në dimensionin tekstual, duke u përshtatur perfekt me strukturën natyrale të të dyja modaliteteve. Kjo jo vetëm i lejon NEO të kapë saktë strukturën hapësinore të imazheve, por gjithashtu ka potencialin të zgjerohet pa probleme në skena komplekse si përpunimi i videove dhe modelimi kryq i fremeve.
Vëmendje native me shumë koka: Në përgjigje të karakteristikave të modaliteteve të ndryshme, NEO ka zbatuar të dyja vëmendjen autoregresive për tokenët tekstualë dhe vëmendjen dyanshme për tokenët vizualë brenda një kuadri unifikues. Kjo dizajnim rrit në mënyrë të konsiderueshme përdorimin e korrelacionit të strukturës hapësinore në model, duke mbështetur më mirë kuptimin dhe arsyetimin e përziera të grafikëve dhe teksteve.
Shtuashtë, me strategjinë inovatore të trajnimit me dy faza Pre Buffer & Post LLM, NEO mund të absorbë aftësinë e plotë të arsyetimit gjuhësor të LLM origjinal, ndërkohë që ndërton nga zero një aftësi të fuqishme percepcioni vizuale, duke zgjidhur plotësisht problemin e dëmtimit të aftësive gjuhësore në trajnimin tradicional të modulit të përbashkët.
Performanca e testuar: Një e dhjetëta e të dhënave përdoret për vlerësimin e performancës së nivelit të flotës
I drejtuar nga inovacioni i arkitekturës, NEO ka treguar efikasitet të jashtëzakonshëm të dhënash dhe avantazhe performancësh: efikasitet i jashtëzakonshëm i dhënash: me vetëm 1/10 të vëllimit të dhënave të modeleve me performancë të barabartë në industrinë (390 milion shembuj imazh–tekst), NEO mund të zhvillojë kapacitete vizuale perceptuese të klasës së parë. Pa mbështetur në dhëna masive dhe kodifikatorë vizualë shtesë, arkitektura e saj e thjeshtë mund të arrijë performancë të barabartë me modelet modulare kryesore si Qwen2-VL dhe InternVL3 në shumë detyra kuptimi vizual. Performancë e shkëlqyeshme dhe e balancuar: Në shumë vlerësime publike autoritative si MMMU, MMB, MMStar, SEED-I, POPE etj., arkitektura NEO ka arritur rezultate të larta, duke treguar performancë komplekse mbi VLM-të e tjera native, realizojnë në fakt "humbrën zero të saktësisë" të arkitekturës native. Efikasitet maksimal i kushtimit të arsyetimit: Veçanërisht brenda intervalit të parametrave 0,6B–8B, NEO ka avantazhe të dukshme në zbatimin në skaj. Ajo nuk vetëm që arrin një përparim dyfish në saktësi dhe efikasitet, por edhe ul në mënyrë të konsiderueshme kushtimet e inferencës, duke shtyrë "efikasitetin kosto–performancë" të percepcionit multimodal vizual në kulmin e tij extreme. Konstruksion i përbashkët me burim të hapur
Ndërtimi i infrastrukturës së ardhmëshme të inteligjencës artificiale është "korniza" e modelit, dhe vetëm me një kornizë të fortë mund të mbështesë të ardhmen e teknologjisë multimodale.
Dizajni i shkrirjes së hershme i arkitekturës NEO suporton rezolucionin arbitrare dhe hyrjen e imazheve të gjata, duke zgjatur pa ndërprerje në fushat e avancuara si video dhe inteligjenca e trupit, duke arritur shkrirje të vërtetë nga baza deri në kulm dhe nga fundi deri në fund. Nga pikëpamja e aplikimit, dizajni i "integrimi natyror" nga fundi deri në fund ofron mbështetje teknike të fortë për aplikimin e skenarëve të ndryshëm si interaksioni i robotëve me trup, përgjigjet multimodale të terminaleve inteligjente, kuptimi i videove, interaksioni 3D dhe inteligjenca e trupit.
Në këtë moment, SenseTime ka hapur zyrtarisht burimin e dy modeleve të specifikacionit të bazuar në arkitekturën NEO, 2B dhe 9B, për të nxitur inovacionin dhe zbatimin në komunitetin e burimit të hapur rreth arkitekturave native multimodale. Teknologjia SenseTime tha se është e përkushtuar të ndërtojë NEO si një infrastrukturë AI të gjeneratës së ardhshme, të shkallëzueshme dhe të përdorshme përsëri, përmes bashkëpunimit me burim të hapur dhe zbatimit të skenarëve, duke nxitur zbatimin industrial të gjerë të teknologjisë native multimodale nga laboratori, dhe duke nxitur ndërtimin e shpejtë të standardeve industriale të gjeneratës së ardhshme për teknologjinë native multimodale.

Rreth nesh
Telefoni: 0518-80236699
Email: [email protected]
Adresa: Rajoni Haizhou, Qyteti Lianyungang, Provina Jiangsu
Platforma e Shërbimeve Qeveritare e Ministria e Industrisë dhe Teknologjisë së Informacionit
Përgatitja Su ICP 2025211914
Siguria e Su Gongwang Nr. 32070602010184
Mbështetje teknike: Kompania e Teknologjisë Jiangsu Xiaola Sh.p.k.
Facebook Facebook
Facebook
Whatsapp Whatsapp
Whatsapp