SenseTime heeft officieel zijn nieuwe multimodale modelarchitectuur, NEO, vrijgegeven en open source gemaakt. Deze is ontwikkeld in samenwerking met het S-Lab van Nanyang Technological University en legt de basis voor een nieuwe generatie architectuur voor het SenseNova-multimodale model.
Als de eerste in de industrie beschikbare native multimodale architectuur (Native VLM) die diepe integratie realiseert, breekt NEO de beperkingen van het traditionele ‘modulaire’ paradigma op grondniveau door en ontwerpt innovatief voor ‘geboren om specifiek multimodaal te zijn’. Door diepe integratie van meerdere modaliteiten op het niveau van de kernarchitectuur wordt een alomvattende doorbraak bereikt op het gebied van prestaties, efficiëntie en universaliteit. Dit herdefinieert de prestatiegrens van multimodale modellen en markeert de officiële ingang van de multimodale kunstmatige-intelligentietechnologie in een nieuw tijdperk van ‘native architectuur’.
Bottlenecks doorbreken, afscheid nemen van ‘patchwork’, welkom heten van ‘native’
Momenteel volgen de meest gebruikte multimodale modellen in de industrie grotendeels het modulaire paradigma van “visuele encoder + projector + taalmodel”. Deze uitbreidingsmethode, gebaseerd op grote taalmodellen (LLM’s), zorgt voor compatibiliteit met afbeeldingsinvoer, maar richt zich fundamenteel nog steeds op taal, en de integratie van afbeeldingen en taal blijft beperkt tot het dataniveau. Dit “geplakte” ontwerp leidt niet alleen tot een lage leerrendement, maar beperkt ook het verwerkingsvermogen van het model in complexe multimodale scenario’s, zoals het vastleggen van afbeeldingsdetails of het begrijpen van complexe ruimtelijke structuren. De SenseTime NEO-architectuur is ontwikkeld om dit knelpunt aan te pakken. Reeds in de tweede helft van 2024 was Shangtang als eerste in China in staat om doorbraak te boeken op het gebied van native multimodale fusietraining, waarmee het zowel de SuperCLUE-taalbeoordeling als de OpenCompass-multimodale beoordeling wist te winnen met één enkel model. Op basis van deze kerntechnologie werd Nissin SenseNova 6.0 ontwikkeld, wat leidde tot toonaangevende vermogens op het gebied van multimodale redenering. Vervolgens werd in juli 2025 Nichiron SenseNova 6.5 gelanceerd, wat vroege fusie op encoder-niveau realiseerde, de kosteneffectiviteit van multimodale modellen verdrievoudigde en als eerste in China commerciële grafisch-tekstuele interleave-inferentie introduceerde. SenseTime heeft nu de volgende stap gezet: het traditionele modulaire ontwerp volledig achter zich gelaten en, uitgaande van de fundamentele beginselen, een geheel nieuw ontworpen NEO-native architectuur gelanceerd.
Drie kerninnovaties realiseren een diepe eenheid van visie en taal
De NEO-architectuur is gebaseerd op de kernconcepten ultieme efficiëntie en diepe integratie, en via onderliggende innovaties in drie sleuteldimensies – aandachtsmechanisme, positionele codering en semantische mapping – bezit het model van nature het vermogen om zowel visuele als taalkundige informatie op een geïntegreerde manier te verwerken
Native Patch Embedding: laat discrete beeldtokenizers achter en bouwt via een unieke Patch Embedding Layer (PEL) van onder naar boven een continue afbeelding van pixels naar woorden op. Dit ontwerp kan beelddetails fijner vastleggen en doorbreekt fundamenteel de knelpunten in beeldmodellering van gangbare modellen.
Native RoPE: innoveert door de driedimensionale ruimtelijke en tijdelijke frequentieallocatie te ontkoppelen, waarbij hoge frequenties worden gebruikt in de visuele dimensie en lage frequenties in de tekstuele dimensie, wat perfect aansluit bij de natuurlijke structuur van beide modaliteiten. Dit stelt NEO niet alleen in staat om de ruimtelijke structuur van afbeeldingen nauwkeurig te vangen, maar biedt ook potentieel voor naadloze uitbreiding naar complexe scenario’s zoals videoverwerking en kaderoverschrijdend modelleren.
Native Multi Head Attention: Als reactie op de kenmerken van verschillende modaliteiten heeft NEO zowel autoregressieve aandacht voor teksttokens als bidirectionele aandacht voor visuele tokens geïmplementeerd binnen een uniform kader. Dit ontwerp verhoogt sterk het gebruik van ruimtelijke structuurcorrelatie in het model, waardoor complexe, grafisch-tekstuele mengbegrip en redenering beter worden ondersteund.
Bovendien kan NEO, dankzij de innovatieve tweestapsfusietrainingstrategie Pre Buffer & Post LLM, de volledige taalredeneervermogen van het oorspronkelijke LLM absorberen en tegelijkertijd krachtige visuele waarnemingsvermogens vanaf nul opbouwen, waardoor het probleem van verminderde taalvaardigheid bij traditionele kruismodale training volledig wordt opgelost.
Geteste prestaties: Een tiende van de gegevens wordt gebruikt om prestaties op vlagshipsniveau te evalueren
Aangedreven door architectonische innovatie heeft NEO verbazingwekkende gegevensefficiëntie en prestatievoordelen aangetoond: extreem hoge gegevensefficiëntie: met slechts 1/10 van het gegevensvolume van industrie-equivalente prestatiemodellen (390 miljoen afbeelding-tekstvoorbeelden) kan NEO eersteklas visuele waarnemingscapaciteiten ontwikkelen. Zonder te vertrouwen op massale gegevens of extra visuele encoders kan zijn beknopte architectuur in meerdere visuele begrijpstaakken concurreren met toonaangevende modulaire vlagshipsmodellen zoals Qwen2-VL en InternVL3. Uitstekende en evenwichtige prestaties: In meerdere openbare, gezaghebbende evaluaties zoals MMMU, MMB, MMStar, SEED-I en POPE heeft de NEO-architectuur hoge scores behaald, wat een alomvattende prestatie aantoont die superieur is aan andere native VLM’s, en daarmee werkelijk de ‘precisie zonder verlies’ van de native architectuur realiseert. Uiterste redeneerkosteneffectiviteit: Vooral binnen het parameterbereik van 0,6B–8B biedt NEO significante voordelen voor edge-implementatie. Het bereikt niet alleen een dubbele sprong in nauwkeurigheid en efficiëntie, maar verlaagt ook de inferentiekosten aanzienlijk, waardoor de ‘kosteneffectiviteit’ van multimodale visuele waarneming naar een nieuw niveau wordt gebracht. extreme. Open source co-construction
Het bouwen van de volgende generatie AI-infrastructuurarchitectuur is het ‘skelet’ van het model, en alleen met een stevig skelet kan de toekomst van multimodale technologie worden ondersteund.
Het vroege fusieontwerp van de NEO-architectuur ondersteunt willekeurige resolutie en lange afbeeldingsinvoer, en wordt naadloos uitgebreid naar baanbrekende domeinen zoals video en geïncorporeerde intelligentie, wat werkelijke fusie van onder tot boven en end-to-end bewerkstelligt. Vanuit een toepassingsperspectief biedt het end-to-end ‘native integration’-ontwerp stevige technische ondersteuning voor toepassingen in diverse scenario’s, zoals geïncorporeerde interactie met robots, multimodale respons op intelligente eindapparaten, videoanalyse, 3D-interactie en geïncorporeerde intelligentie.
Op dit moment heeft SenseTime officieel twee specificatiemodellen op basis van de NEO-architectuur, namelijk 2B en 9B, open source gemaakt om innovatie en toepassing binnen de open-sourcegemeenschap op het gebied van native multimodale architectuur te bevorderen. SenseTime Technology verklaarde zich inzetten om NEO op te bouwen tot een schaalbare en herbruikbare AI-infrastructuur van de volgende generatie via open-source samenwerking en scenario-implementatie, waardoor native multimodale technologie op grote schaal in de industrie kan worden toegepast — vanuit het laboratorium — en de ontwikkeling van industriële standaarden voor native multimodale technologie van de volgende generatie wordt versneld.