Vse kategorije

Premik od »združevanja podatkov« k »nativni arhitekturi«: SenseTime izda arhitekturo NEO in ponovno določa meje zmogljivosti multimodalnih modelov.

2026-09-18

SenseTime je uradno izdal in odprl izvorno kodo svoje nove večmodalne arhitekture modela NEO, ki jo je razvil v sodelovanju z laboratorijem S-Lab na univerzi Nanyang Technological University ter s tem položil temelje za novo generacijo arhitekture modela SenseNova za večmodalne naloge.
Kot prva na voljo obstoječa izvirna večmodalna arhitektura (Native VLM) na področju industrije, ki dosega globoko integracijo, NEO prelomi omejitve tradicionalnega »modularnega« pristopa že na osnovni ravni in inovativno oblikuje arhitekturo, ki je »od rojstva namenjena večmodalnim nalogam«. Z globoko integracijo več modalnosti na ravni jedrne arhitekture doseže celovit napredek glede zmogljivosti, učinkovitosti in univerzalnosti, ponovno določi meje zmogljivosti večmodalnih modelov ter označuje uradni vstop tehnologije umetne inteligence za večmodalne naloge v novo dobo »izvirne arhitekture«.
Preboj skozi zastoje, poslovitev od »popravkov«, sprejetje »izvirnosti«
Trenutno prevladujoči multimodalni modeli v industriji večinoma sledijo modularnemu paradigmi »vizualni kodirnik + projektor + jezikovni model«. Ta razširitev na osnovi velikega jezikovnega modela (LLM) doseže združljivost z vhodnimi slikami, vendar se še naprej osredotoča predvsem na jezik, združevanje slik in jezika pa ostaja le na podatkovni ravni. Ta »popravljena« zasnova ne samo da ima nizko učinkovitost učenja, temveč tudi omejuje zmogljivost modela pri obdelavi zapletenih multimodalnih scenarijev, kot so zajemanje podrobnosti slike ali razumevanje zapletene prostorske strukture. Arhitektura SenseTime NEO je bila ustvarjena za reševanje te težave. Že v drugi polovici leta 2024 je Shangtang v Kitajski prvi prelomil tehnologijo izvirnega multimodalnega združevanja pri učenju, pri čemer je z enotnim modelom osvojil jezikovno ocenjevalno platformo SuperCLUE in multimodalno ocenjevalno platformo OpenCompass; na podlagi te jedrske tehnologije je ustvaril Nissin SenseNova 6.0, ki dosega vodilne zmogljivosti pri multimodalnem sklepanju. Kasneje, v juliju 2025, je bil izdan Nichiron SenseNova 6.5, ki je dosegel zgodnje združevanje na ravni kodirnika, trikrat povečal stroškovno učinkovitost multimodalnih modelov ter bil prvi v Kitajski, ki je komercialno uvedel sklepanje z mešanimi grafičnimi in besedilnimi elementi. SenseTime je naredil naslednji korak tako, da je popolnoma opustil tradicionalno modularno strukturo in se začel iz osnovnih načel, pri čemer je predstavil izvirno arhitekturo NEO, ki je bila zasnovana od nič.
Tri osnovne inovacije dosežejo globoko enotnost vida in jezika
Arhitektura NEO temelji na osnovnih konceptih najvišje učinkovitosti in globoke integracije ter prek temeljnih inovacij v treh ključnih dimenzijah – mehanizmu pozornosti, kodiranju položaja in semantičnem preslikovanju – modelu naravno podeli sposobnost enotnega obravnavanja tako vizualnih kot jezikovnih podatkov
Nativno vdelano sestavno delo (native patch embedding): opusti diskretne kodirnike slikovnih tokenov in s posebno plastjo vdelanih sestavnih delov (PEL) gradi zvezno preslikavo od slikovnih pik do besed od spodaj navzgor. Ta oblikovna rešitev omogoča bolj natančno zajemanje podrobnosti slik in temeljno prelomi omejitve modeliranja slik v prevladujočih modelih.
Native RoPE: inovativno loči trodimenzionalno prostoro-časovno porazdelitev frekvenc, pri čemer uporablja visoke frekvence v vizualni dimenziji in nizke frekvence v besedilni dimenziji, kar popolnoma ustreza naravni strukturi obeh modalnosti. To ne omogoča le, da NEO natančno zajame prostorsko strukturo slik, temveč tudi omogoča gladko razširitev na zapletene scene, kot so obdelava videoposnetkov in križno okvirno modeliranje.
Native Multi Head Attention: V odziv na značilnosti različnih modalnosti je NEO v enotnem okviru izvedel tako avtoregresivno pozornost za besedilne tokene kot tudi dvosmerno pozornost za vizualne tokene. Ta oblikovna rešitev znatno izboljša izkoriščanje prostorske strukturne povezanosti v modelu in s tem bolje podpira zapleteno mešano razumevanje in sklepanje slike in besedila.
Poleg tega lahko NEO z inovativno strategijo usposabljanja z dvostopenjsko združitvijo pred medpomnilnikom in po LLM popolnoma absorbira jezikovno sklepanje izvirnega LLM, hkrati pa od nič zgradi močne vizualne zaznavne sposobnosti in tako popolnoma reši težavo oslabitve jezikovnih sposobnosti pri tradicionalnem usposabljanju prek več modov.
Preizkusena zmogljivost: Za oceno zmogljivosti na vrhunski ravni je uporabljen deseti del podatkov
Poganjano z arhitekturno inovacijo, je NEO prikazal izjemno učinkovitost obdelave podatkov in prednosti v zmogljivosti: izjemno visoka učinkovitost obdelave podatkov – z le eno desetino količine podatkov, potrebnih za modele s primerljivo zmogljivostjo na trgu (390 milijonov primerov slike in besedila), lahko NEO razvije vrhunske sposobnosti vidnega zaznavanja. Brez zanašanja na ogromne količine podatkov in dodatne vidne kodirnike njegova pregledna arhitektura dosegajo zmogljivosti najboljših modularnih zastavnih modelov, kot sta Qwen2-VL in InternVL3, na več nalogah vidnega razumevanja. Odlična in uravnotežena zmogljivost – na več javnih, avtoritativnih ocenah, kot so MMMU, MMB, MMStar, SEED-I in POPE, je arhitektura NEO dosegla visoke rezultate, kar dokazuje njen celovit, nadpovprečen dosežek v primerjavi z drugimi izvirnimi VLM, kar resnično omogoča »natančno brezizgubno« izvirno arhitekturo. Najvišja razmerje med zmogljivostjo sklepanja in stroški – še posebej v obsegu parametrov 0,6 B–8 B ima NEO pomembne prednosti pri razmestitvi na robnih napravah. Ne le da doseže dvojni skok v natančnosti in učinkovitosti, temveč tudi znatno zmanjša stroške sklepanja, s čimer poveča »razmerje med zmogljivostjo in stroški« pri multimodalnem vidnem zaznavanju do ekstremno. Odprta izvorna sodelovalna gradnja
Gradnja infrastrukturne arhitekture umetne inteligence nove generacije je »skelét« modela; le z močnim skeletom lahko podpremo prihodnost multimodalnih tehnologij.
Zasnova zgodnjega združevanja v arhitekturi NEO omogoča poljubno ločljivost in dolge vhodne slike ter se brezhibno razširi na predelne področja, kot so video in udeležena inteligenca, kar doseže resnično združevanje od spodaj navzgor in od konca do konca. Z aplikacijskega vidika zasnova »nativne integracije« od konca do konca zagotavlja trdno tehnično podporo za uporabo v različnih scenarijih, kot so udeležena interakcija robotov, multimodalni odzivi na pametnih koncih, razumevanje videa, 3D-interakcija in udeležena inteligenca.
Trenutno je SenseTime uradno odprl izvorne kode dveh specifikacijskih modelov na osnovi arhitekture NEO, 2B in 9B, da bi spodbudil inovacije in uporabo v odprtokodni skupnosti za izvirno multimodalno arhitekturo. SenseTime Technology je izjavil, da se zavezuje k temu, da bo NEO postala razširljiva in ponovno uporabljiva umetna inteligenca nove generacije prek sodelovanja pri odprtem izvornem kodu in izvajanja v konkretnih scenarijih, kar bo spodbudilo širšo industrijsko uporabo izvirne multimodalne tehnologije iz laboratorijev ter pospešilo uveljavitev standardov za izvirno multimodalno tehnologijo nove generacije na industrijski ravni.

O nas
Telefon: 0518-80236699
E-pošta: [email protected]
Naslov: Okrožje Haizhou, mesto Lianyungang, provinca Jiangsu
Platforma za državne storitve Ministrstva za industrijo in informacijsko tehnologijo
Priprava na spletno stran Su ICP: 2025211914
Številka varnosti Su Gongwang: 32070602010184
Tehnična podpora: Jiangsu Xiaola Technology Co., Ltd
Facebook Facebook
Facebook
Whatsapp Whatsapp
Whatsapp