SenseTime har officiellt släppt och öppnat källkoden till sin nya multimodala modellarkitektur, NEO, som utvecklats i samarbete med Nanyang Technological University S-Lab och lagt grunden för en ny generations arkitektur för SenseNova:s multimodala modell.
Som industrins första tillgängliga inhemska multimodala arkitektur (Native VLM) som uppnår djup integration bryter NEO loss från den traditionella "modulära" paradigmet på grundläggande nivå och introducerar en innovativ design för att vara "född specifikt för multimodalitet". Genom djup integration av flera modaliteter på kärnarkitekturnivå uppnås en omfattande genombrott i prestanda, effektivitet och universalitet, vilket omdefinierar prestandagränsen för multimodala modeller och markerar den officiella inledningen av en ny era för artificiell intelligens multimodal teknik – en era präglad av "inhemska arkitekturer".
Bryta igenom flaskhalsar, säga farväl till 'sömmad lösning' och välkomna 'inhemska lösningar'
För närvarande följer de dominerande multimodala modellerna inom branschen främst den modulära paradigmen "visuell encoder+projektor+språkmodell". Denna utvidgningsmetod, som bygger på stora språkmodeller (LLM), uppnår kompatibilitet med bildinmatning, men fokuserar fortfarande i grunden på språk, och fusionen av bilder och språk stannar endast på datanivå. Denna "sömmade ihop" design har inte bara låg lärandoeffektivitet, utan begränsar också modellens förmåga att hantera komplexa multimodala scenarier, såsom detaljerad bilduppfattning eller förståelse av komplexa rumsliga strukturer. Arkitekturen SenseTime NEO skapades för att lösa just denna utmaning. Redan under andra halvan av 2024 tog Shangtang ledningen i Kina genom att göra genombrott inom tekniken för nativ multimodal fusionsträning, vilket resulterade i att en enda modell vann både SuperCLUE:s språkutvärdering och OpenCompass multimodala utvärdering. Utifrån denna kärnteknik utvecklades Nissin SenseNova 6.0, vilken uppnår ledande förmågor inom multimodal resonemang. Därefter lanserades Nichiron SenseNova 6.5 i juli 2025, vilken uppnår tidig fusion på encodernivå, tredubblar kostnadseffektiviteten för multimodala modeller och var den första kommersiella lösningen i Kina för grafisk-text-mellanväxlad inferens. SenseTime har nu tagit nästa steg genom att helt överge den traditionella modulära strukturen och istället, utifrån grundläggande principer, lanserat den helt nydesignade NEO-arkitekturen.
Tre kärninnovationer uppnår en djup enhet av syn och språk
NEO-arkitekturen bygger på de kärnkoncept som ultimat effektivitet och djup integration, och genom underliggande innovationer inom tre nyckeldimensioner – uppmärksamhetsmekanism, positionskodning och semantisk avbildning – besitter modellen naturligt förmågan att hantera både visuella och språkliga data på ett enhetligt sätt
Inbyggd patch-inbäddning: avstår från diskreta bildtokeniseringar och skapar en kontinuerlig avbildning från pixlar till ord från botten uppåt genom ett unikt lager för patch-inbäddning (PEL). Denna design kan fånga bilddetaljer finare och bryter grundläggande igenom flaskhalsen för bildmodellering i dominerande modeller.
Native RoPE: innovativt avkopplar tredimensionell rumstidlig frekvensallokering genom att använda höga frekvenser i det visuella dimensionen och låga frekvenser i det textuella dimensionen, vilket perfekt anpassar sig till den naturliga strukturen hos båda modaliteterna. Detta gör inte bara att NEO kan fånga bildernas spatiala struktur med hög noggrannhet, utan öppnar också möjligheten att sömlöst utökas till komplexa scenarier såsom videobehandling och korsrammodellering.
Native Multi Head Attention: Som svar på de olika modaliteternas egenskaper har NEO implementerat både autoregressiv uppmärksamhet för texttoken och tvåriktad uppmärksamhet för visuella token inom en enhetlig ram. Denna design förbättrar kraftigt utnyttjandet av spatial korrelation i modellen, vilket därmed stödjer bättre komplex förståelse och resonemang av blandade grafiska och textuella innehåll.
Dessutom, med den innovativa tvåstegsfusionsutbildningsstrategin Pre Buffer & Post LLM kan NEO absorbera den ursprungliga storspråksmodellens fullständiga språkliga resonemangsförmåga samtidigt som den bygger en kraftfull visuell uppfattning från grunden, vilket helt löser problemet med försämrad språkförmåga i traditionell tvärmodesutbildning.
Testad prestanda: En tiondel av datan används för att utvärdera flaggskeppsprestanda
Drivs av arkitektonisk innovation har NEO visat imponerande dataeffektivitet och prestandafördelar: extremt hög dataeffektivitet – med endast 1/10 av datavolymen jämfört med branschens motsvarande prestandamodeller (390 miljoner bild-text-exempel) kan NEO utveckla toppklassiga visuella uppfattningsegenskaper. Utan att förlita sig på massiva datamängder eller ytterligare visuella kodare kan dess koncisa arkitektur matcha toppmodulära flaggskeppsmodeller som Qwen2-VL och InternVL3 inom flera visuella förståelseuppgifter. Utmärkt och balanserad prestanda – i flera offentliga, auktoritativa utvärderingar såsom MMMU, MMB, MMStar, SEED-I och POPE har NEO-arkitekturen uppnått höga poäng, vilket visar en omfattande prestanda som överträffar andra inhemska VLM:er och verkligen realiserar "precision utan förlust" för den inhemska arkitekturen. Ultimat kostnadseffektivitet vid resonemang – särskilt inom parameterintervallet 0,6B–8B har NEO betydande fördelar för kantdistribution. Den uppnår inte bara en dubbel hopp i både noggrannhet och effektivitet, utan minskar också avsevärt inferenskostnaderna, vilket driver "kostnadseffektiviteten" för multimodal visuell uppfattning till nytt extreme.Öppen källkod och samkonstruktion
Att bygga nästa generations AI-infrastrukturarkitektur är modellens "stödstruktur", och endast med en solid stödstruktur kan den stödja framtiden för multimodal teknik.
NEO-arkitekturens tidiga sammanslagningsdesign stödjer godtycklig upplösning och långa bildinmatningar och utvidgas sömlöst till banbrytande områden som video och kroppslig intelligens, vilket uppnår sann sammanslagning från botten till toppen och slut-till-slut. Från ett applikationsperspektiv ger den slut-till-slut "nativa integrationen" stark teknisk support för applikationer i många olika scenarier, såsom kroppslig interaktion för robotar, multimodal respons för smarta enheter, videoanalys, 3D-interaktion och kroppslig intelligens.
För närvarande har SenseTime officiellt öppnat källkoden till två specifikationsmodeller baserade på NEO-arkitekturen, 2B och 9B, för att främja innovation och tillämpning inom den öppna källkodens gemenskap för inhemska multimodala arkitekturer. SenseTime Technology meddelade att företaget är förpliktat att bygga ut NEO till en skalbar och återanvändbar AI-infrastruktur för nästa generation genom öppen samarbetsmodell och scenariobaserad implementering, vilket främjar bred industriell tillämpning av inhemska multimodala teknologier från laboratoriet och accelererar utvecklingen av industriella standarder för inhemska multimodala teknologier för nästa generation.