SenseTime on ametlikult avaldanud ja avanud oma uue mitmeprofiilse mudeli arhitektuuri NEO, mille on koostanud Nanyang Technological University S-Lab-iga koostöös ning mis moodustab aluse SenseNova mitmeprofiilse mudeli uue põlvkonna arhitektuurile.
Kui tööstuse esimene saadaval olev päriselt mitmeprofiilne arhitektuur (Native VLM), mis saavutab sügava integreerimise, purustab NEO traditsioonilise „moodulipõhise“ lähenemisviisi ahelaid algtasemelt ning kujundab innovatiivselt „sündinud just mitmeprofiilseteks“. Sügava mitme profiili integreerimise kaudu tuumarakenduse tasemel saavutatakse täielik läbimurde jõudluses, tõhususes ja universaalsuses, ümberdefineeritakse mitmeprofiilsete mudelite jõudluspiirid ning tähistatakse kunstliku intelligentsi mitmeprofiilsete tehnoloogiate ametlikku sisenemist uude „päriselt arhitektuuri“ ajastusse.
Läbimurde saavutamine takistustes, „kokkupõimitud lahenduste“ hülgamine ja „päriselt“ lahenduste vastuvõtmine
Hetkel on tööstuses levinud multimodaalsed mudelid enamasti ülesehitatud modulaarse struktuuriga „visuaalne kodeerija + projektor + keelemudel“. See suurte keelemudelite (LLM) põhjal loodud laiendusmeetod võimaldab pildisisendi kasutamist, kuid keskendub põhimõtteliselt siiski endiselt keeles ja pildi ning keele sulandumine jääb andmetasandile. Selline „paigaldus“-lahendus ei ole mitte ainult õppimise efektiivsuse poolest madal, vaid piirab ka mudeli võimet töödelda keerukaid multimodaalseid stsenaariume, näiteks pildi üksikasjade täpselt tuvastamist või keerukate ruumiliste struktuuride mõistmist. SenseTime NEO arhitektuur loodi just selle probleemi lahendamiseks. Juba 2024. aasta teises pooles oli Shangtang Hiina esimesena läbinud multimodaalse nativaalse sulandumise õppetehnoloogia, saavutades ühe mudeliga nii SuperCLUE keelehindamise kui ka OpenCompass multimodaalse hindamise. Selle tuumatehnoloogia alusel loodi Nissin SenseNova 6.0, mis tagas juhtiva võimekuse multimodaalses mõtlemises. Hiljem, juulis 2025, ilmus Nichiron SenseNova 6.5, mis saavutas varajase sulandumise kodeerijatasandil, kolmekordistas multimodaalsete mudelite kuluefektiivsuse ja oli Hiinas esimene, kes tõi turule kaubandusliku tasemega graafika ja teksti vahelduvat järeldust. SenseTime on astunud järgmise sammu, täielikult loobudes traditsioonilisest modulaarsest struktuurist ning alustades põhimõtetest, et välja panna täiesti uuesti loodud NEO nativaarhitektuur.
Kolm tuumainnovatsiooni saavutavad sügava ühtsuse nägemise ja keele vahel
NEO-arhitektuur põhineb tõhususe ja sügava integreerimise põhimõtetel ning mudelil on loomulik võime käsitleda nii visuaalseid kui ka keeleliselt põhinevaid andmeid ühtse viisiga – selle võimaldavad kolm põhiline alamkihi innovatsiooni: tähelepanu mehhanism, asukoha kodeerimine ja semantiline kujutamine
Loomulik paigutuse sisestamine (native patch embedding): loob pideva kujutuse pikslitest sõnadesse altpoolt ülespoole erilise paigutuse sisestuskihiga (PEL), loobumata diskreetsetest pilditokenisaatoritest. See disain võimaldab pildiüksikasjade täpsemat tuvastamist ja lähtub põhimõtteliselt peamiste mudelite pildimudeli kitsaskohast
Native RoPE: uuenduslikult lahutab kolmemõõtmelise ruumi-aegliku sagedusjaotuse, kasutades visuaalses dimensioonis kõrgsagedusi ja tekstis madalsagedusi, mis sobib täpselt mõlema mooduli loomulikku struktuuri. See võimaldab NEO-l täpselt tuvastada piltide ruumilist struktuuri ning annab samas potentsiaali sujuvalt laiendada keerukamatele stsenaariumidele, näiteks videotöötlusele ja ristraamimudelile.
Native Multi Head Attention: erinevate moodulite omaduste arvestamiseks on NEO rakendanud ühises raamistikus nii autoregressiivset tähelepanu tekstitokenitele kui ka kahepoolset tähelepanu visuaalsetele tokenitele. See disain suurendab oluliselt mudeli ruumilise struktuuri korrelatsiooni kasutamist, toetades seega paremini keerukat graafika ja teksti segatud mõistmist ning põhjendamist.
Lisaks võimaldab innovatiivne kaheastmeline füüsiline ühendusstrateegia (Pre Buffer&Post LLM), et NEO omaks täielikult originaalse LLM-i keeleline mõtlemisvõime, samal ajal kui ta arendab alustasemelt tugevat visuaalset tajuvõimet ja lahendab täielikult keeleoskuse halvenemise probleemi, mis on tüüpiline traditsioonilises ristrežiimilises treenimises.
Testitud jõudlus: esindusliku taseme jõudluse hindamiseks kasutati ühe kümnendiku andmeid
Arhitektuurna innovatsioonil põhinev NEO on näidanud üllatavat andmete kasutus- ja jõudluse eelisülekaalu: äärmiselt kõrge andmete kasutusmaht – vaid 1/10 teiste tööstuslikult võrdväärsete jõudlustasemega mudelite andmemahust (390 miljonit pildi-teksti näidet) suudab NEO arendada esiklassilisi visuaalseid tajumisvõimeid. Selle kompaktne arhitektuur ei vaja massilisi andmebaase ega lisandavaid visuaalseid kodeerijaid ning saavutab mitmes visuaalse mõistmise ülesandes sama tulemuslikkuse nagu tipptasemel moodulipõhised lipulaevamudelid, näiteks Qwen2-VL ja InternVL3. Väga hea ja tasakaalustatud jõudlus – mitmes avalikus ja autoriteetse hindamises, sealhulgas MMMU, MMB, MMStar, SEED-I ja POPE, on NEO arhitektuur saavutanud kõrged tulemused, mis tõendavad selle täielikku jõudlust, mis ületab teisi päriselt multimodaalseid keele-mudelid (VLM), ja realiseerib tõepoolest „täpsuskaotuseta“ päriselt arhitektuuri. Lõplik põhjenduskulude efektiivsus – eriti parameetrite vahemikus 0,6B–8B omab NEO olulist eelisülekaalu ääredeployimisel. See saavutab nii täpsuse kui ka tõhususe kahekordse hüppe ning vähendab oluliselt järeldusmakseid, viies multimodaalse visuaalse tajumise „kuluefektiivsuse“ uute tippnäitajateni. extreme.Avatud lähtekoodiga koostootmine
Järgmise põlvkonna AI-infrastruktuuri arhitektuuri ehitamine on mudeli "skelett", ja ainult kindla skeletiga saab toetada tulevikus multimodaalset tehnoloogiat.
NEO-arhitektuuri varajane füüsionikoonstruktsioon toetab suvalist resolutsiooni ja pikkade piltide sisendit ning laieneb õmbluseta kaasaegsetele valdkondadele, nagu video ja kehaline intelligentsus, saavutades tõelise füüsioni altpoolt üles ja otsast lõppu. Rakenduslikust vaatenurgast pakub otsast lõppu „nativne integreerimine“ kindlat tehnilist toetust erinevate stsenaariumide rakendamisele, näiteks robotite kehaline interaktsioon, nutiterminalite multimodaalsed vastused, videote mõistmine, 3D-interaktsioon ja kehaline intelligentsus.
Hetkel on SenseTime ametlikult avanud lähtekoodi kahele spetsifikatsioonimudelile, mis põhinevad NEO arhitektuuril – 2B-le ja 9B-le – et edendada innovatsiooni ja rakendusi avatud lähtekoodi kogukonnas nii originaalse multimodaalse arhitektuuri valdkonnas. SenseTime Technology teatas, et on pühendunud NEO arendamisele skaalatavaks ja taaskasutatavaks järgmise põlvkonna AI-infrastruktuuriks lähtekoodi avamise kaudu toimuvate koostööde ja stsenaariumide rakenduste kaudu, edendades originaalse multimodaalse tehnoloogia laialdast tööstuslikku kasutamist laborist välja ning kiirendades järgmise põlvkonna tööstustasemeliste originaalsete multimodaalsete tehnoloogiate standardite loomist.