Alle kategorier

Flytning fra «datafusion» til «nativ arkitektur»: SenseTime lancerer NEO-arkitekturen og omdefinerer ydelsesgrænsen for multimodale modeller

2026-09-18

SenseTime har officielt udgivet og gjort sin nye multimodale modelarkitektur, NEO, åben kildekode i samarbejde med Nanyang Technological University S-Lab, hvilket lægger grundlaget for en ny generations arkitektur til SenseNova-multimodale modeller.
Som branchens første tilgængelige native multimodale arkitektur (Native VLM), der opnår dyb integration, bryder NEO med de traditionelle "modulære" paradigmers begrænsninger på grundlæggende plan og introducerer innovativt en arkitektur, der er "født specifikt til multimodalitet". Gennem dyb integration af flere modaliteter på kernearkitekturniveau opnås en omfattende gennembrud i ydeevne, effektivitet og universalitet, hvilket gendefinerer ydeevnegrænsen for multimodale modeller og markerer den officielle indgang til en ny æra for kunstig intelligens multimodal teknologi – én præget af "native arkitektur".
Bryd gennem flaskehalse, farvel til 'kludelap', velkommen til 'native'
I øjeblikket følger de mest udbredte multimodale modeller i branchen overvejende det modulære paradigme »visuel encoder + projector + sprogmodel«. Denne udvidelsesmetode, der bygger på store sprogmodeller (LLM), opnår kompatibilitet med billedinput, men fokuserer i bund og grund stadig på sprog, og fusionen af billeder og sprog forbliver kun på dataniveau. Dette »sømmebånd«-design har ikke kun lav læringseffektivitet, men begrænser også modellens evne til at håndtere komplekse multimodale scener – såsom scener, der kræver detaljeret billedanalyse eller forståelse af komplekse rumlige strukturer. Arkitekturen SenseTime NEO blev skabt for at løse netop denne udfordring. Allerede i anden halvdel af 2024 var Shangtang den første i Kina, der brød igennem teknologien til nativ multimodal fusionstræning, og vandt både SuperCLUE-sprogudværelsen og OpenCompass-multimodaludværelsen med én enkelt model. Ud fra denne kerne-teknologi udviklede man Nissin SenseNova 6.0, der opnåede ledende evner inden for multimodal ræsonnement. Derefter lanceredes Nichiron SenseNova 6.5 i juli 2025, hvilket opnåede tidlig fusion på encoder-niveau, tredoblet omkostningseffektiviteten for multimodale modeller og var den første kommercielle grafisk-tekst-interleaved inferenceløsning i Kina. SenseTime har nu taget næste skridt ved fuldstændigt at opgive den traditionelle modulære struktur og i stedet gå tilbage til grundprincipperne – og lancere NEO-arkitekturen, som er designet fra bunden.
Tre kerneinnovationer opnår en dyb forening af syn og sprog
NEO-arkitekturen bygger på kernebegreberne ultimativ effektivitet og dyb integration og opnår gennem underliggende innovationer inden for tre centrale dimensioner – opmærksomhedsmechanisme, positionskodning og semantisk afbildning – at modellen naturligt besidder evnen til at håndtere både visuelle input og sprog på en forenet måde
Nativ Patch-indlejring: forkaster diskrete billedtokeniseringer og opbygger en kontinuerlig afbildning fra pixel til ord fra bunden og opad via en unik Patch-indlejringslag (PEL). Denne designløsning kan fange billeddetaljer mere præcist og bryder grundlæggende igennem flaskehalsen for billedmodellering i almindelige modeller.
Native RoPE: innovativt afkobler tredimensionel rumlig og tidlig frekvensallokering ved at bruge høje frekvenser i det visuelle dimensionsområde og lave frekvenser i det tekstlige dimensionsområde, hvilket perfekt tilpasser sig den naturlige struktur af begge modaliteter. Dette gør ikke kun NEO i stand til præcist at registrere den rumlige struktur af billeder, men åbner også mulighed for nahtløs udvidelse til komplekse scener såsom video-behandling og tværgående ramme-modellering.
Native Multi Head Attention: Som svar på karakteristika ved forskellige modaliteter har NEO implementeret både autoregressiv opmærksomhed for tekst-token og tovejs-opmærksomhed for visuelle token inden for en fælles ramme. Denne design-løsning forbedrer markant udnyttelsen af rumlig struktur-korrelation i modellen og understøtter dermed bedre kompleks grafisk og tekstlig blandet forståelse samt ræsonnement.
Desuden kan NEO, ved hjælp af den innovative totrinsfusions-træningsstrategi med forudgående buffer og efterfølgende LLM, absorbere den originale LLMs komplette sproglogiske evne, mens den samtidig opbygger en kraftfuld visuel perceptions-evne fra bunden, hvilket fuldstændigt løser problemet med nedsat sprogevne i traditionel tværmodesk træning.
Testet ydeevne: En tiendedel af dataene bruges til at evaluere flagshipsniveau-ydeevnen
Drevet af arkitektonisk innovation har NEO vist imponerende datavirksomhed og præstationsfordele: ekstremt høj datavirksomhed – med kun 1/10 af datamængden, som bruges af branchens ækvivalente præstationsmodeller (390 millioner billed-tekst-eksempler), kan NEO udvikle førsteklasses visuel perceptionsdygtighed. Uden at skulle støtte sig til massiv data eller ekstra visuelle encodere kan dens kompakte arkitektur matche topmodulære flagshipsmodeller såsom Qwen2-VL og InternVL3 på flere visuelle forståelsesopgaver. Fremragende og afbalanceret præstation – på flere offentlige, autoritative vurderinger såsom MMMU, MMB, MMStar, SEED-I og POPE har NEO-arkitekturen opnået høje scoringsresultater, hvilket demonstrerer en omfattende præstation, der overgår andre native VLM’er, og faktisk realiserer den native arkitekturs »præcisionsløse« egenskab. Ultimativ begrundelsesmæssig omkostningseffektivitet – især inden for parameterintervallet 0,6B–8B har NEO betydelige fordele ved edge-deployment. Den opnår ikke blot en dobbelt fremgang i både nøjagtighed og effektivitet, men reducerer også inferensomkostningerne markant, hvilket driver »omkostningseffektiviteten« for multimodal visuel perception til det ekstrem. Åben kildekode-samkonstruktion
At bygge den næste generation af AI-infrastrukturarkitektur er "skelettet" i modellen, og kun med et solidt skelet kan det understøtte fremtidens multimodale teknologi.
NEO-arkitekturens tidlig fusion-design understøtter vilkårlig opløsning og lange billedeinput og udvides nahtløst til fremadrettet felter som video og embodied intelligence, hvilket opnår sand fusion fra bund til top og end-to-end. Fra et anvendelsesperspektiv giver det end-to-end "native integration"-design solide tekniske muligheder for anvendelse i mange scenarier, herunder robotbaseret embodied interaktion, intelligent terminal-multimodal respons, videoforståelse, 3D-interaktion og embodied intelligence.
I øjeblikket har SenseTime officielt gjort to specifikationsmodeller baseret på NEO-arkitekturen, nemlig 2B og 9B, tilgængelige som open source for at fremme innovation og anvendelse i open-source-fællesskabet inden for nativ multimodal arkitektur. SenseTime Technology erklærede, at virksomheden forpligter sig til at udvikle NEO til en skalerbar og genanvendelig AI-infrastruktur af næste generation gennem open-source-samarbejde og scenariebaseret implementering, fremme den bredere industrielle anvendelse af nativ multimodal teknologi fra laboratoriet og accelerere udviklingen af industrielle standarder for multimodal teknologi af næste generation.

Om os
Telefon: 0518-80236699
E-mail: [email protected]
Adresse: Haizhou-distriktet, Lianyungang-byen, Jiangsu-provinsen
Platform for regeringsydelser fra Ministeriet for Industri og Informationsteknologi
Su ICP-forberedelse 2025211914
Su Gongwang-sikkerhedsnummer 32070602010184
Teknisk support: Jiangsu Xiaola Technology Co., Ltd.
Facebook Facebook
Facebook
WhatsApp WhatsApp
WhatsApp