Lahat ng Kategorya

Paglipat mula sa "data fusion" patungo sa "native architecture": Inilabas ni SenseTime ang NEO architecture, na nagpapakilala muli sa hangganan ng pagganap ng mga multimodal na modelo

2026-09-18

Inilabas ng opisyal at inihayag ng SenseTime ang kanyang bagong arkitekturang multimodal na modelo, ang NEO, na binuo sa pakikipagtulungan sa Nanyang Technological University S-Lab, na nagtatag ng pundasyon para sa isang bagong henerasyong arkitektura para sa multimodal na modelo ng SenseNova.
Bilang unang magagamit na native multimodal na arkitektura (Native VLM) sa industriya na nakakamit ang malalim na integrasyon, ang NEO ay nabigyan ng kahulugan ang tradisyonal na paradigma ng "modular" mula sa mga pangunahing prinsipyo nito, at inimbento ang disenyo para sa "ipinanganak talaga para sa multimodal." Sa pamamagitan ng malalim na integrasyon ng maraming modalidad sa antas ng pangunahing arkitektura, nakamit nito ang buong pag-unlad sa pagganap, kahusayan, at kawastuhan, muling tinukoy ang hangganan ng pagganap ng mga multimodal na modelo, at tinalakay ang opisyal na pagsisimula ng teknolohiyang artificial intelligence multimodal sa bagong panahon ng "native architecture."
Nagpaputol ng mga bottleneck, lumalaya sa 'patchwork,' sumasaklaw sa 'native'
Kasalukuyan, ang pangunahing mga modelo ng multimodal sa industriya ay sumusunod sa modular na paraan ng "visual encoder + projector + language model." Ang paraang ito ng pagpapalawak batay sa Large Language Model (LLM) ay nagkakamit ng kahambalan sa input ng larawan, ngunit sa pangkalahatan ay nananatiling nakatuon sa wika, at ang pagsasama ng larawan at wika ay nananatiling nasa antas ng data lamang. Ang disenyo na ito na parang "sugpo" ay hindi lamang may mababang kahusayan sa pag-aaral, kundi limitado rin ang kakayahan ng modelo sa pagproseso ng mga kumplikadong senaryo ng multimodal, tulad ng pagkuha ng detalye ng larawan o pag-unawa sa kumplikadong istruktura ng espasyo. Ang arkitektura ng SenseTime NEO ay nilikha upang tugunan ang problemang ito. Noong ikalawang kalahati ng 2024, unang nagtagumpay si Shangtang sa China sa teknolohiyang pagsasanay ng tunay na pagsasama ng multimodal, at nanalo sa SuperCLUE language evaluation at OpenCompass multimodal evaluation gamit ang isang solong modelo; batay sa pangunahing teknolohiyang ito, nilikha nila ang Nissin SenseNova 6.0 upang makamit ang nangungunang kakayahan sa pag-iisip ng multimodal. Pagkatapos noon, noong Hulyo 2025, inilabas ang Nichiron SenseNova 6.5, na nakamit ang maagang pagsasama sa antas ng encoder, tripled ang cost-effectiveness ng mga modelo ng multimodal, at ang unang komersyal na antas ng graphic-text interleaving inference sa China. Ang SenseTime ay tumungo sa susunod na hakbang sa pamamagitan ng ganap na pagtatakwil sa tradisyonal na istruktura ng modular at simula sa mga pundamental na prinsipyo, na naglunsad ng NEO native architecture na idisenyo mula sa simula.
Tatlong pangunahing pagbabago ang nagkakamit ng malalim na pagkakaisa ng paningin at wika
Ang NEO architecture ay batay sa mga pangunahing konsepto ng kahulugan ng kahusayan at malalim na pagsasama, at sa pamamagitan ng mga likas na pagbabago sa tatlong mahahalagang dimensyon: mekanismo ng atensyon, positional encoding, at semantic mapping, ang modelo ay may likas na kakayahang pangasiwaan ang parehong visual at wika sa isang pinag-isang paraan
Likas na Patch Embedding: itinatapon ang hiwalay na image tokenizers at nililikha ang tuloy-tuloy na pagmamapa mula sa mga pixel patungo sa mga salita mula sa ibaba hanggang sa itaas gamit ang natatanging Patch Embedding Layer (PEL). Ang disenyo na ito ay nakakakuha ng mas detalyadong mga detalye ng imahe, na lubos na binabali ang bottleneck ng image modeling sa mga pangunahing modelo.
Native RoPE: nagpapabago nang malikhain ng pagkakahiwalay ng pag-alok ng dalawang dimensyon ng espasyo at panahon, gamit ang mataas na dalas sa visual na dimensyon at mababang dalas sa tekstwal na dimensyon, na umaangkop nang perpekto sa likas na istruktura ng parehong modalidad. Hindi lamang ito nagpapahintulot sa NEO na tumpak na mahuli ang espasyal na istruktura ng mga larawan, kundi may potensyal din itong pahabain nang maayos sa mga kumplikadong eksena tulad ng pagpoproseso ng video at cross-frame modeling.
Native Multi Head Attention: Bilang tugon sa mga katangian ng iba't ibang modalidad, ang NEO ay nagpapatupad ng parehong autoregressive attention para sa mga tekstwal na token at bidirectional attention para sa mga visual na token sa loob ng isang pinag-isang balangkas. Ang disenyo na ito ay lubos na nagpapataas ng paggamit ng ugnayan ng espasyal na istruktura sa modelo, kaya't mas mainam na sumuporta sa kumplikadong pag-unawa at pag-iisip na may halo ng larawan at teksto.
Bukod dito, sa pamamagitan ng makabagong estratehiya sa pagsasanay na may dalawang yugto—ang Pre Buffer at Post LLM—ang NEO ay kayang abutin ang kumpletong kakayahang pangwika ng orihinal na LLM habang nagtatayo ng malakas na kakayahang panvisual mula sa simula, na lubos na nalulutas ang problema ng pagkabawas ng kakayahang pangwika sa tradisyonal na pagsasanay na may krus na modalidad.
Nasubok na performance: Ginamit ang isang ikasampu ng data upang suriin ang performance na katumbas ng flagship level
Nakabatay sa inobasyon sa arkitektura, ipinakita ng NEO ang kahanga-hangang kahusayan sa paggamit ng data at mga pakinabang sa pagganap: napakataas na kahusayan sa data—gamit lamang ang 1/10 ng dami ng data kung ikukumpara sa mga modelo na may katumbas na antas ng pagganap sa industriya (390 milyong halimbawa ng imahe at teksto), kayang likhain ng NEO ang nangungunang kakayahan sa panlasa ng biswal. Nang hindi umaasa sa napakalaking dami ng data o karagdagang visual encoder, ang kanyang payak na arkitektura ay nakakapantay sa mga nangungunang modular na flagship model tulad ng Qwen2-VL at InternVL3 sa maraming gawain sa pang-unawa sa biswal. Mahusay at balanseng pagganap—sa maraming pampublikong awtorisadong pagsusuri tulad ng MMMU, MMB, MMStar, SEED-I, POPE, atbp., nakamit ng arkitekturang NEO ang mataas na marka, na nagpapakita ng buong saklaw ng pagganap na mas mahusay kaysa sa iba pang orihinal na VLM, na tunay na nagpapatupad ng "presisyong walang nawawala" sa orihinal na arkitektura. Pinakamahusay na gastos-kabisaan sa pag-iisip—lalo na sa saklaw ng parameter na 0.6B hanggang 8B, may malaking kalamangan ang NEO sa edge deployment. Hindi lamang ito nakakamit ng dalawang malaking hakbang sa katiyakan at kahusayan, kundi binabawasan din nito nang malaki ang gastos sa inference, na nagpapataas ng "gastos-kabisaan" ng multimodal na panlasa ng biswal hanggang sa sobrang bukas. Buong pagkakasali sa pagbuo
Ang paggawa ng susunod na henerasyon ng arkitektura ng AI infrastructure ang "buto" ng modelo, at kailangan lamang ng matibay na buto upang suportahan ang hinaharap ng teknolohiyang multimodal.
Ang disenyo ng maagang pagsasama ng NEO architecture ay sumusuporta sa anumang resolusyon at mahabang input ng larawan, nang walang putol na lumalawig patungo sa mga nangungunang larangan tulad ng video at embodied intelligence, na nagpapakita ng tunay na pagsasama mula sa ilalim hanggang sa tuktok at mula dulo hanggang dulo. Mula sa pananaw ng aplikasyon, ang disenyo ng end-to-end na "native integration" ay nagbibigay ng matibay na suportang teknikal para sa aplikasyon sa iba't ibang senaryo tulad ng robot embodied interaction, intelligent terminal multimodal response, video understanding, 3D interaction, at embodied intelligence.
Sa kasalukuyan, ang SenseTime ay opisyal na nagbukas ng dalawang modelo ng espesipikasyon batay sa arkitekturang NEO—ang 2B at 9B—upang pataasin ang inobasyon at aplikasyon sa bukas na komunidad ng mga tagapag-develop tungkol sa likas na multimodal na arkitektura. Sinabi ng SenseTime Technology na nakatuon ito sa pagbuo ng NEO bilang isang susunod-na-henerasyong AI infrastructure na maaaring i-scale at muling gamitin sa pamamagitan ng kolaborasyong bukas na source at pagpapatupad sa mga aktwal na senaryo, upang ipagpatuloy ang malawakang industriyal na aplikasyon ng likas na multimodal na teknolohiya mula sa laboratorio, at pabilisin ang pagkakabuo ng mga pamantayan para sa industriyal na antas ng susunod-na-henerasyong likas na multimodal na teknolohiya.

Tungkol sa amin
Telepono: 0518-80236699
Email: [email protected]
Adres: Haizhou District, Lianyungang City, Jiangsu Province
Platform ng Serbisyo ng Pamahalaan ng Ministry of Industry and Information Technology
Su ICP preparation 2025211914
Su Gongwang Security No. 32070602010184
Teknikal na Suporta: Jiangsu Xiaola Technology Co., Ltd
Facebook Facebook
Facebook
Whatsapp Whatsapp
Whatsapp