SenseTime oficiāli ir izlaidis un atvēris savu jauno multimodālo modeli ar arhitektūru NEO, ko kopīgi izstrādājusi Nanyang Technological University S-Lab, nodrošinot pamatu jaunās paaudzes SenseNova multimodālajiem modeļiem.
Kā pirmā rūpniecībā pieejamā īsta multimodālā arhitektūra (Native VLM), kas sasniedz dziļu integrāciju, NEO pārvar tradicionālās „modulārās” paradigmas ierobežojumus no pašiem pamatiem un inovatīvi izstrādāta „tikai un vienīgi multimodālai lietošanai”. Dzīļa integrācija vairākām modālēm kodolārhittektūras līmenī nodrošina visaptverošu progresu veiktspējā, efektivitātē un universālumā, pārveido multimodālo modeļu veiktspējas robežas un norāda uz mākslīgā intelekta multimodālo tehnoloģiju oficiālu ienākšanu jaunā „īstās arhitektūras” laikmetā.
Pārvarot šķēršļus, atvadoties no „salikuma risinājumiem“ un pieņemot „īsto arhitektūru“
Pašlaik rūpniecībā dominējošie multimodālie modeļi lielākoties ievēro modulāro paradigmu „vizuālais kodētājs + projektoris + valodas modelis“. Šī paplašināšanas metode, kas balstīta uz lieliem valodas modeļiem (LVM), nodrošina saderību ar attēlu ievadi, taču būtībā joprojām koncentrējas uz valodu, un attēlu un valodas apvienošana paliek tikai datu līmenī. Šāda „salikta“ dizaina risinājums ne tikai ir zemas mācīšanās efektivitātes dēļ, bet arī ierobežo modeļa spēju apstrādāt sarežģītus multimodālus scenārijus, piemēram, attēlu detaļu uztveri vai sarežģītu telpisko struktūru izpratni. SenseTime NEO arhitektūra tika izveidota, lai novērstu šo problēmu. Jau 2024. gada otrajā pusē Shangtang pirmais Ķīnā paveica caururbjošu progresu multimodālās dabiskās apvienošanas apmācības tehnoloģijā, iegūstot SuperCLUE valodas novērtējumā un OpenCompass multimodālajā novērtējumā augstāko rezultātu ar vienu modeli; pamatojoties uz šo kodoltehnoloģiju, tika izveidots Nissin SenseNova 6.0, kas nodrošināja vadošas spējas multimodālajā izpratnē. Vēlāk, 2025. gada jūlijā, tika izlaists Nichiron SenseNova 6.5, kurš sasniedza agrīnu apvienošanu kodētāja līmenī, trīskāršoja multimodālo modeļu izmaksu efektivitāti un bija pirmais Ķīnā, kas komerciālā kvalitātē ieviesa grafikas un teksta mijiedarbības secīgu secināšanu. SenseTime ir veikusi nākamo soli, pilnībā atmetot tradicionālo modulāro struktūru un, izmantojot pamatprincipus, izstrādājot no nulles NEO dabisko arhitektūru.
Trīs kodolinnovācijas sasniedz dziļu redzes un valodas vienotību
NEO arhitektūra balstīta uz galvenajiem principiem – maksimālā efektivitāte un dziļa integrācija – un, veicot pamatnei balstītas inovācijas trīs galvenos dimensijās: uzmanības mehānisms, pozicionēšanas kodējums un semantiskā kartēšana, modelis dabiski iegūst spēju vienotā veidā apstrādāt gan vizuālo, gan valodas informāciju
Nativais Patch Embedding: atmet diskrētos attēlu tokenizatorus un, izmantojot unikālu Patch Embedding Layer (PEL), no apakšas uz augšu veido nepārtrauktu attēlojumu no pikseļiem uz vārdiem. Šī dizaina risinājuma dēļ var precīzāk uztvert attēlu detaļas, pamatīgi pārvarot attēlu modelēšanas šaurās vietas, kas raksturīgas populārajām modelēšanas metodēm.
Native RoPE: inovatīvi atdalīta trīsdimensiju telpiskās un laika frekvences sadale, izmantojot augstas frekvences vizuālajā dimensijā un zemas frekvences teksta dimensijā, ideāli pielāgojoties abu modalityu dabiskajai struktūrai. Tas ne tikai ļauj NEO precīzi uztvert attēlu telpisko struktūru, bet arī sniedz iespēju vienmērīgi paplašināt to uz sarežģītākām situācijām, piemēram, video apstrādi un pār kadru modelēšanu.
Native Multi Head Attention: Atbildot uz dažādu modalitāšu raksturīgajām īpašībām, NEO ieviesis gan autoregresīvo uzmanību teksta tokeniem, gan divvirziena uzmanību vizuālajiem tokeniem vienotā rāmī. Šis dizains ievērojami uzlabo telpiskās struktūras korelācijas izmantošanu modelī, tādējādi labāk atbalstot sarežģītu grafiku un teksta jauktu izpratni un spriedumu.
Turklāt, izmantojot inovatīvo divu posmu apvienošanas apmācības stratēģiju „Pre Buffer & Post LLM“, NEO var uztvert sākotnējā LLM pilnīgo valodas pamatojuma spēju, vienlaikus no nulles veidojot spēcīgu vizuālo uztveres spēju un pilnībā novēršot valodas spēju pasliktināšanās problēmu, kas raksturīga tradicionālajai krustmodālajai apmācībai.
Pārbaudītais sniegums: Desmitā daļa no datiem tiek izmantota, lai novērtētu karogprodukta līmeņa sniegumu
Dzīvots ar arhitektūras inovāciju, NEO ir parādījis izbrīnu izraisošu datu efektivitāti un veiktspējas priekšrocības: ārkārtīgi augstu datu efektivitāti — tikai ar 1/10 no datu apjoma, ko izmanto rūpniecības līmeņa modeļi ar līdzvērtīgu veiktspēju (390 miljoni attēlu–teksta paraugu), NEO spēj attīstīt augstas klases vizuālo uztveres spējas. Neatkarīgi no masīviem datu apjomiem un papildu vizuālajiem kodētājiem tā kompakta arhitektūra var konkurēt ar vadošajiem modulārajiem zvaigžņmodeļiem, piemēram, Qwen2-VL un InternVL3, vairākos vizuālās izpratnes uzdevumos. Izcilu un līdzsvarotu veiktspēju — vairākās publiskās, autoritatīvās novērtēšanās sistēmās, piemēram, MMMU, MMB, MMStar, SEED-I, POPE utt., NEO arhitektūra ir sasniegusi augstus rezultātus, pierādot visaptverošu veiktspēju, kas pārsniedz citus iebūvētos VLM, patiesi realizējot iebūvētās arhitektūras „precīzu bezzaudējumu“ darbību. Galēju pamatojuma izmaksu efektivitāti — īpaši parametru diapazonā no 0,6B līdz 8B NEO ir būtiskas priekšrocības malas izvietošanā. Tas ne tikai panāk divkāršu lēcienu gan precizitātē, gan efektivitātē, bet arī ievērojami samazina secināšanas izmaksas, virzot multimodālās vizuālās uztveres „izmaksu efektivitāti“ līdz extreme. Atvērtais kodols – kopīga izveide
Nākamās paaudzes mākslīgā intelekta infrastruktūras arhitektūras izveide ir modeļa «kaulu sistēma», un tikai ar ciešu kaulu sistēmu var atbalstīt nākotnes multimodālo tehnoloģiju attīstību.
NEO arhitektūras agrīnās saplūšanas dizains atbalsta patvaļīgu izšķirtspēju un garus attēlus, bez šķēršļiem paplašinoties uz jaunākajām jomām, piemēram, video un ķermeņa intelekts, sasniedzot patiesu saplūšanu no apakšas līdz augšai un beigām līdz beigām. Lietojuma viedokļa ziņā beigām līdz beigām «nativā integrācija» nodrošina ciešu tehnisko atbalstu dažādu scenāriju lietojumiem, piemēram, robotu ķermeņa mijiedarbībai, intelektuālo ierīču multimodālajai reakcijai, video izpratnei, 3D mijiedarbībai un ķermeņa intelektam.
Pašlaik SenseTime oficiāli atvērti divi specifikāciju modeļi, kas balstīti uz NEO arhitektūru — 2B un 9B, lai veicinātu inovācijas un lietojumprogrammu izstrādi atvērtā koda kopienā natiīvai multimodālai arhitektūrai. SenseTime Technology paziņoja, ka tā ir apņēmusies izveidot NEO par mērogojamu un atkārtoti izmantojamu nākamās paaudzes AI infrastruktūru, izmantojot atvērtā koda sadarbību un scenāriju realizāciju, veicinot natiīvās multimodālās tehnoloģijas plašu rūpniecisko pielietojumu no laboratorijas līmeņa un paātrinot nākamās paaudzes rūpnieciskā līmeņa natiīvās multimodālās tehnoloģijas standartu izveidi.