Toate categoriile

Trecerea de la «fuziunea datelor» la «arhitectura nativă»: SenseTime lansează arhitectura NEO, redefinind granița performanței modelelor multimodale

2026-09-18

SenseTime a lansat oficial și a făcut open source noua sa arhitectură de model multimodal, NEO, dezvoltată în colaborare cu Nanyang Technological University S-Lab, punând bazele unei noi generații de arhitectură pentru modelul multimodal SenseNova.
Ca prima arhitectură multimodală nativă (Native VLM) disponibilă pe piață, care realizează o integrare profundă, NEO depășește limitele paradigmei tradiționale „modulare” la nivelul principiilor fundamentale și introduce inovativ conceptul de „născut special pentru multimodalitate”. Prin integrarea profundă a mai multor modalități la nivelul arhitecturii centrale, NEO obține o ruptură completă în ceea ce privește performanța, eficiența și universalitatea, redefinind granița performanței modelelor multimodale și semnând intrarea oficială a tehnologiei de inteligență artificială multimodală într-o nouă eră a „arhitecturii native”.
Depășirea blocajelor, luarea adio „parchetului”, adoptarea „native-ului”
În prezent, principalele modele multimodale din industrie urmează în mare parte paradigma modulară «encoder vizual + projector + model de limbaj». Această metodă de extindere bazată pe modele mari de limbaj (LLM) asigură compatibilitatea cu intrarea de imagini, dar rămâne fundamental orientată spre limbaj, iar fuziunea între imagini și limbaj se limitează doar la nivelul datelor. Această abordare «în pătrățele» nu doar că are o eficiență scăzută în învățare, ci și limitează capacitatea modelului de a procesa scenarii multimodale complexe, cum ar fi cele care implică captarea detaliilor imaginii sau înțelegerea structurilor spațiale complicate. Arhitectura SenseTime NEO a fost concepută pentru a rezolva această problemă. Încă din a doua jumătate a anului 2024, Shangtang a fost prima companie din China care a realizat o ruptură în tehnologia de antrenare nativă multimodală, obținând rezultate de top în evaluările SuperCLUE (limbaj) și OpenCompass (multimodal) cu un singur model; pe baza acestei tehnologii cheie, a lansat Nissin SenseNova 6.0, care a atins performanțe lider în raționamentul multimodal. Ulterior, în iulie 2025, a fost lansat Nichiron SenseNova 6.5, care a implementat o fuziune timpurie la nivelul encoderului, a triplat eficiența costurilor modelelor multimodale și a fost primul model comercial din China capabil să realizeze inferență grafic-text intercalată. SenseTime a făcut un pas suplimentar, renunțând complet la structura modulară tradițională și construind, de la bazele teoretice, arhitectura nativă NEO, proiectată integral de la zero.
Trei inovații fundamentale realizează o unire profundă a viziunii și limbajului
Arhitectura NEO se bazează pe conceptele fundamentale ale eficienței maxime și integrării profunde și, prin inovații de bază în trei dimensiuni cheie: mecanismul de atenție, codificarea pozițională și maparea semantică, modelul posedă în mod natural capacitatea de a gestiona atât viziunea, cât și limbajul într-o manieră unificată
Incorporare nativă de tip patch: renunță la tokenizatoarele discrete de imagini și construiește o mapare continuă de la pixeli la cuvinte, de jos în sus, printr-un strat unic de incorporare de tip patch (PEL). Această concepție poate capta detaliile imaginii mai fin, depășind fundamental blocajul modelării imaginilor din modelele dominante.
Native RoPE: decuplează în mod inovator alocarea frecvenței spațio-temporale tridimensionale, folosind frecvențe înalte în dimensiunea vizuală și frecvențe joase în dimensiunea textuală, adaptându-se perfect la structura naturală a ambelor modalități. Aceasta nu doar permite lui NEO să captureze cu acuratețe structura spațială a imaginilor, ci oferă și potențialul de a se extinde fără probleme către scene complexe, cum ar fi procesarea video și modelarea între cadre.
Native Multi Head Attention: În răspuns la caracteristicile diferitelor modalități, NEO implementează atât atenția autoregresivă pentru tokenii textului, cât și atenția bidirecțională pentru tokenii vizuali într-un cadru unitar. Această concepție sporește în mod semnificativ utilizarea corelației structurale spațiale în cadrul modelului, susținând astfel mai bine înțelegerea și raționamentul mixt, grafic și textual, complexe.
În plus, cu strategia inovatoare de antrenare în două etape cu fuziune Pre Buffer&Post LLM, NEO poate absorbi întreaga capacitate de raționament lingvistic a LLM original, în același timp construind din zero o puternică capacitate de percepție vizuală, rezolvând complet problema deteriorării capacității lingvistice în antrenarea tradițională cross-modală.
Performanța testată: O zecime din date este utilizată pentru evaluarea performanței de nivel flagship
Condus de inovații arhitecturale, NEO a demonstrat o eficiență remarcabilă în prelucrarea datelor și avantaje de performanță excepționale: eficiență extrem de ridicată în utilizarea datelor — cu doar 1/10 din volumul de date al modelelor echivalente din industrie (390 de milioane de exemple de imagini asociate cu texte), NEO poate dezvolta capacități vizuale de percepție de top. Fără a depinde de volume masive de date sau de codificatori vizuali suplimentari, arhitectura sa concisă poate egala modelele modulare de referință, cum ar fi Qwen2-VL și InternVL3, în mai multe sarcini de înțelegere vizuală. Performanță excelentă și echilibrată — în mai multe evaluări publice autorizate, cum ar fi MMMU, MMB, MMStar, SEED-I, POPE etc., arhitectura NEO a obținut scoruri ridicate, demonstrând o performanță cuprinzătoare superioară altor VLM native, realizând cu adevărat „pierderea zero de precizie” în cadrul unei arhitecturi native. Cost-eficiență maximă în raționament — în special în intervalul de parametri 0,6 miliarde–8 miliarde, NEO are avantaje semnificative în implementarea pe dispozitive periferice. Nu doar atinge un salt dublu în acuratețe și eficiență, ci reduce, de asemenea, în mod semnificativ costurile de inferență, impulsionând „cost-eficiența” percepției vizuale multimodale până la extreme. Construcție colaborativă open source
Construirea arhitecturii infrastructurii de inteligență artificială de următoarea generație este «scheletul» modelului, iar doar cu un schelet solid se poate susține viitorul tehnologiei multimodale.
Designul de fuziune timpurie al arhitecturii NEO susține rezoluții arbitrare și intrări de imagini lungi, extinzându-se fără întreruperi către domenii de ultimă oră, cum ar fi video și inteligența încorporată, realizând o fuziune autentică de la bază până la vârf și de capăt la cap. Din perspectiva aplicațiilor, designul de «integrare nativă» de capăt la cap oferă un suport tehnic solid pentru aplicații în scenarii diverse, cum ar fi interacțiunea robotizată încorporată, răspunsul multimodal al terminalelor inteligente, înțelegerea video, interacțiunea 3D și inteligența încorporată.
În prezent, SenseTime a lansat oficial în mod deschis două modele de specificație bazate pe arhitectura NEO, 2B și 9B, pentru a stimula inovația și aplicarea în comunitatea open-source privind arhitectura multimodală nativă. SenseTime Technology a declarat că își propune să construiască NEO ca o infrastructură AI de generație următoare, scalabilă și reutilizabilă, prin colaborarea open-source și implementarea în scenarii reale, promovând astfel aplicarea industrială extensivă a tehnologiei multimodale native, de la laborator la industrie, și accelerând elaborarea standardelor industriale de generație următoare pentru tehnologia multimodală native.

Despre noi
Telefon: 0518-80236699
Email: [email protected]
Adresă: Districtul Haizhou, orașul Lianyungang, provincia Jiangsu
Platforma de servicii guvernamentale a Ministerului Industriei și Tehnologiei Informației
Preparare ICP din Jiangsu nr. 2025211914
Nr. de securitate al rețelei publice din Jiangsu 32070602010184
Suport tehnic: Jiangsu Xiaola Technology Co., Ltd
Facebook Facebook
Facebook
WhatsApp WhatsApp
WhatsApp