SenseTime ha ufficialmente rilasciato e reso open source la sua nuova architettura di modello multimodale, NEO, sviluppata in collaborazione con il S-Lab della Nanyang Technological University, gettando le basi per una nuova generazione di architetture per il modello multimodale SenseNova.
Essendo la prima architettura multimodale nativa (Native VLM) disponibile nel settore che raggiunge un’integrazione profonda, NEO supera i vincoli del tradizionale paradigma «modulare» a livello fondamentale e progetta in modo innovativo per essere «nata specificamente per la multimodalità». Grazie all’integrazione profonda di più modalità a livello di architettura centrale, NEO ottiene un progresso completo in termini di prestazioni, efficienza e universalità, ridefinisce il limite delle prestazioni dei modelli multimodali e segna l’ingresso ufficiale della tecnologia multimodale dell’intelligenza artificiale in una nuova era dell’«architettura nativa».
Superare i colli di bottiglia, salutare il «rattoppo», abbracciare il «nativo»
Attualmente, i principali modelli multimodali del settore seguono per lo più il paradigma modulare «codificatore visivo + proiettore + modello linguistico». Questo approccio di estensione basato su modelli linguistici di grandi dimensioni (LLM) consente la compatibilità con l’input di immagini, ma rimane fondamentalmente focalizzato sul linguaggio; la fusione tra immagini e linguaggio si limita così al livello dei dati. Questa progettazione «a pezzi» non solo comporta una bassa efficienza nell’apprendimento, ma limita anche la capacità del modello di gestire scenari multimodali complessi, come quelli che richiedono la cattura di dettagli nelle immagini o la comprensione di strutture spaziali articolate. L’architettura SenseTime NEO è stata concepita proprio per risolvere questo problema critico. Già nella seconda metà del 2024, Shangtang ha ottenuto in Cina il primo breakthrough tecnologico nel campo dell’addestramento nativo multimodale integrato, aggiudicandosi sia la valutazione linguistica SuperCLUE sia la valutazione multimodale OpenCompass con un singolo modello; sulla base di questa tecnologia fondamentale, è stato sviluppato Nissin SenseNova 6.0, capace di ragionamento multimodale all’avanguardia. Successivamente, nel luglio 2025, è stato rilasciato Nichiron SenseNova 6.5, che ha realizzato una fusione anticipata a livello di codificatore, triplicando l’efficienza costo-prestazioni dei modelli multimodali ed essendo il primo in Cina a lanciare un’inferenza commerciale di tipo grafico-testuale intercalato. SenseTime ha compiuto un ulteriore passo avanti abbandonando completamente la struttura modulare tradizionale e, partendo dai principi fondamentali, ha introdotto l’architettura nativa NEO, progettata ex novo.
Tre innovazioni fondamentali realizzano una profonda unificazione tra visione e linguaggio
L’architettura NEO si basa sui concetti fondamentali di massima efficienza e integrazione profonda, e grazie a innovazioni di base in tre dimensioni chiave — meccanismo di attenzione, codifica posizionale e mappatura semantica — il modello possiede naturalmente la capacità di gestire in modo unificato sia la visione che il linguaggio
Patch Embedding nativo: abbandona i tokenizer di immagini discreti e costruisce una mappatura continua dai pixel alle parole, dal basso verso l’alto, tramite un’esclusiva Patch Embedding Layer (PEL). Questa progettazione consente di catturare i dettagli dell’immagine con maggiore precisione, superando in maniera radicale il collo di bottiglia della modellazione delle immagini nei modelli principali.
Native RoPE: separa in modo innovativo l’allocazione della frequenza spaziotemporale tridimensionale, utilizzando frequenze elevate nella dimensione visiva e frequenze basse nella dimensione testuale, adattandosi perfettamente alla struttura naturale di entrambe le modalità. Ciò consente non solo a NEO di catturare con precisione la struttura spaziale delle immagini, ma offre anche il potenziale di estendersi senza soluzione di continuità a scenari complessi come l’elaborazione video e la modellazione cross-frame.
Native Multi Head Attention: in risposta alle caratteristiche delle diverse modalità, NEO implementa sia l’attenzione autoregressiva per i token testuali sia l’attenzione bidirezionale per i token visivi all’interno di un quadro unificato. Questa progettazione migliora notevolmente lo sfruttamento della correlazione della struttura spaziale nel modello, supportando così in modo più efficace la comprensione e il ragionamento misti tra grafica e testo.
Inoltre, grazie all’innovativa strategia di addestramento a due stadi Pre Buffer&Post LLM, NEO può acquisire la completa capacità di ragionamento linguistico del modello linguistico originale (LLM), costruendo contestualmente, ex novo, una potente capacità di percezione visiva, risolvendo così completamente il problema del deterioramento delle capacità linguistiche riscontrato nell’addestramento multimodale tradizionale.
Prestazioni testate: un decimo dei dati è stato utilizzato per valutare prestazioni di livello flagship
Guidato dall'innovazione architettonica, NEO ha dimostrato straordinari vantaggi in termini di efficienza dati e prestazioni: efficienza dati estremamente elevata: con soltanto 1/10 del volume dati richiesto dai modelli concorrenti di pari livello (390 milioni di esempi immagine-testo), NEO riesce a sviluppare capacità di percezione visiva di prim’ordine. Senza ricorrere a enormi quantità di dati né a codificatori visivi aggiuntivi, la sua architettura concisa eguaglia modelli modulari di punta come Qwen2-VL e InternVL3 su numerosi compiti di comprensione visiva. Prestazioni eccellenti ed equilibrate: in molteplici valutazioni pubbliche autorevoli — tra cui MMMU, MMB, MMStar, SEED-I e POPE — l’architettura NEO ha ottenuto punteggi molto alti, dimostrando prestazioni complete superiori ad altri VLM nativi, realizzando davvero la "precisione senza perdita" propria dell’architettura nativa. Massima convenienza computazionale nel ragionamento: in particolare nell’intervallo di parametri da 0,6 miliardi a 8 miliardi, NEO presenta vantaggi significativi per il deployment edge. Non solo ottiene un duplice balzo in termini di accuratezza ed efficienza, ma riduce anche in modo sostanziale i costi d’inferenza, spingendo la "convenienza computazionale" della percezione visiva multimodale al extreme.Costruzione condivisa open source
Costruire l'architettura delle infrastrutture per l'IA della prossima generazione è lo "scheletro" del modello: solo con uno scheletro solido si potrà sostenere il futuro della tecnologia multimodale.
La progettazione a fusione precoce dell'architettura NEO supporta risoluzioni arbitrarie e input immagine di lunghezza estesa, estendendosi senza soluzione di continuità a settori all'avanguardia come video e intelligenza incarnata, realizzando una vera fusione dall'origine alla fine e end-to-end. Dal punto di vista applicativo, la progettazione end-to-end a "integrazione nativa" fornisce un solido supporto tecnico per l'applicazione in scenari diversificati, quali interazione robotica incarnata, risposta multimodale su terminali intelligenti, comprensione video, interazione 3D e intelligenza incarnata.
Al momento, SenseTime ha ufficialmente reso disponibili come open source due modelli di specifica basati sull’architettura NEO, rispettivamente da 2B e da 9B, per promuovere l’innovazione e l’applicazione nella comunità open source relativa alle architetture multimodali native. SenseTime Technology ha dichiarato di impegnarsi a costruire NEO come un’infrastruttura AI di nuova generazione scalabile e riutilizzabile attraverso la collaborazione open source e l’implementazione in scenari concreti, favorendo così l’adozione industriale su larga scala della tecnologia multimodale native partendo dal laboratorio e accelerando lo sviluppo di standard industriali di nuova generazione per tale tecnologia.