A SenseTime hivatalosan kiadta és nyílt forráskódúvá tette új, többmódusú modellarchitektúráját, a NEO-t, amelyet a Nanyang Technological University S-Lab-jával együttműködésben fejlesztettek ki, és amely az új generációs SenseNova többmódusú modell alapját képezi.
Az iparág elsőként elérhető natív többmódusú architektúrájaként (Native VLM), amely mély integrációt ér el, a NEO megszabadítja magát a hagyományos „moduláris” paradigma korlátozásaitól az alapvető elvek szintjén, és innovatívan úgy tervezték, hogy „született többmódusúságra” legyen optimalizálva. A több módus mély integrációja a magarchitektúra szintjén teljes körű áttörést eredményez a teljesítményben, hatékonyságban és univerzalitásban, újrahatározza a többmódusú modellek teljesítményhatárát, és jelzi a mesterséges intelligencia többmódusú technológiájának hivatalos belépését egy új korszakba: a „natív architektúrába”.
Akadályok leküzdése, a „raklapozás” elhagyása, a „natív” fogadtatása
Jelenleg az iparágban elterjedt multimodális modellek túlnyomó többsége a „vizuális kódoló+projektor+nyelvi modell” moduláris paradigmát követi. Ez az Úri Nagy Nyelvi Modell (LLM) alapú bővítési módszer kompatibilitást ér el képbemenettel, de lényegében továbbra is a nyelvre összpontosít, és a kép–nyelv egyesítése csupán az adatszinten marad. Ez a „kézzel varrt” megoldás nemcsak alacsony tanulási hatékonyságot eredményez, hanem korlátozza a modell feldolgozási képességét összetett multimodális helyzetekben is – például részletgazdag képek érzékelése vagy összetett térbeli szerkezetek megértése esetén. A SenseTime NEO architektúra e probléma kezelésére született. Már 2024 második felében a Shangtang vezető szerepet vállalt Kínában a multimodális natív egyesítéses tanítási technológia áttörésében, és egyetlen modelllel nyerte el a SuperCLUE nyelvi értékelést és az OpenCompass multimodális értékelést; ezen alaptechnológia alapján hozták létre a Nissin SenseNova 6.0-ot, amely vezető képességet ért el multimodális következtetés területén. Ezt követően 2025 júliusában jelent meg a Nichiron SenseNova 6.5, amely az egyesítést már a kódoló szintjén valósította meg, háromszorosára növelte a multimodális modellek költség-hatékonyságát, és Kínában először indított kereskedelmi szintű grafikus szöveg közbeépítéses következtetést. A SenseTime tovább lépett: teljesen elhagyta a hagyományos moduláris struktúrát, és alapelvektől kezdve, nulláról tervezte meg a NEO natív architektúrát.
Három alapvető innováció éri el a látás és a nyelv mély szintű egységét
A NEO architektúra az abszolút hatékonyság és a mély integráció alapfogalmain alapul, és az alapvető innovációk három kulcsdimenzióján – a figyelem-mechanizmuson, a pozíciós kódoláson és a szemantikus leképezésen – keresztül a modell természetes módon képes egyaránt kezelni a vizuális és a nyelvi adatokat egységes módon
Natív Patch Embedding: elhagyja a diszkrét kép-tokenizerek használatát, és egy egyedi Patch Embedding Layer (PEL) réteg segítségével folytonos leképezést épít ki a pixelekből a szavakig alulról felfelé. Ez a megoldás finomabban ragadja meg a kép részleteit, és alapvetően áttöri a mainstream modellek képmodellezési korlátait.
Natív RoPE: újító módon szétválasztja a háromdimenziós tér-időbeli frekvenciaelosztást, magas frekvenciákat használva a vizuális dimenzióban és alacsony frekvenciákat a szöveges dimenzióban, így tökéletesen alkalmazkodik mindkét módus természetes szerkezetéhez. Ez nemcsak lehetővé teszi a NEO számára, hogy pontosan rögzítse a képek térbeli szerkezetét, hanem potenciálisan zavartalanul kiterjeszthető összetett forgatókönyvekre is, például videófeldolgozásra és keretek közötti modellezésre.
Natív többfejű figyelem: A különböző módusok jellemzőire reagálva a NEO egy egységes keretrendszeren belül mind az autoregresszív figyelmet a szöveges tokenekhez, mind a kétirányú figyelmet a vizuális tokenekhez megvalósította. Ez a tervezés jelentősen növeli a modellben a térbeli szerkezeti korrelációk kihasználását, így jobban támogatja az összetett grafikus és szöveges keverék értelmezését és következtetését.
Ezen felül a NEO az innovatív, előzetes pufferrel és utólagos LLM-mel működő kétlépcsős fúziós tanítási stratégiával képes teljes mértékben átvenni az eredeti LLM nyelvi érvelési képességét, miközben teljesen újra építi saját, erős vizuális érzékelési képességét, így teljes mértékben megoldja a hagyományos keresztmódusos tanítás nyelvi képességek romlásával járó problémáját.
Tesztelt teljesítmény: A zászlóshajó-szintű teljesítmény értékelésére az adatok egy tizede került felhasználásra
Az építészeti újítások által meghajtott NEO elképesztő adat-hatékonyságot és teljesítményelőnyöket mutatott: rendkívül magas adat-hatékonyság: csupán az iparági szinten összehasonlítható teljesítményű modellek (390 millió kép-szöveg példa) adatainak 1/10-ével képes kiváló vizuális érzékelési képességeket fejleszteni. Nem támaszkodva hatalmas adathalmazokra vagy további vizuális kódolókra, tömör architektúrája több vizuális értelmezési feladatban is versenyképes a Qwen2-VL és az InternVL3 minta moduláris zászlóshajó modellekkel. Kiváló és kiegyensúlyozott teljesítmény: Több nyilvánosan elismert, tekintélyes értékelésben – például az MMMU, MMB, MMStar, SEED-I, POPE stb. – a NEO architektúra magas pontszámokat ért el, amelyek bizonyítják, hogy átfogó teljesítménye felülmúlja más natív VLM-eket, és valóban megvalósítja a natív architektúra „pontosságvesztés nélküli” működését. Legjobb következtetési költség-hatékonyság: Különösen a 0,6–8 milliárd paraméteres tartományban a NEO jelentős előnyökkel rendelkezik peremkörnyezetekben történő üzembe helyezéshez. Nemcsak a pontosság és a hatékonyság terén ér el kettős ugrást, hanem jelentősen csökkenti a következtetési költségeket is, ezzel a multimodális vizuális érzékelés „költség-hatékonyságát” új szintre emeli. szélsőséges. Nyílt forráskódú együttépítés
Az új generációs MI-infrastruktúra-architektúra építése a modell „csontváza”, és csak egy szilárd csontváz képes támogatni a multimodális technológia jövőjét.
A NEO architektúra korai fúziós terve tetszőleges felbontást és hosszú képbemenetet támogat, és zavartalanul kiterjeszthető a videó és az inkarnált intelligencia (embodied intelligence) olyan újító területeire, így valódi, alulról-felfelé és végponttól-végpontig tartó fúziót ér el. Alkalmazási szempontból a végponttól-végpontig történő „natív integráció” terve megbízható műszaki támogatást nyújt a robotok inkarnált interakciójára, az intelligens eszközök multimodális válaszaira, a videóértelmezésre, a 3D-interakcióra és az inkarnált intelligenciára (embodied intelligence) irányuló sokféle forgatókönyv alkalmazásához.
Jelenleg a SenseTime hivatalosan nyílt forráskódúvá tette két, a NEO architektúrán alapuló specifikációs modelljét – a 2B-t és a 9B-t – annak érdekében, hogy elősegítse az innovációt és az alkalmazásokat a nyílt forráskódú közösségben a natív multimodális architektúra területén. A SenseTime Technology kijelentette, hogy elkötelezett arra, hogy a NEO-t skálázható és újrafelhasználható, következő generációs mesterséges intelligencia-infrastruktúrává építse ki nyílt forráskódú együttműködés és forgatókönyv-alapú megvalósítás révén, ezzel előmozdítva a natív multimodális technológia széles körű ipari alkalmazását a laboratóriumokból kiindulva, valamint gyorsítva a következő generációs, ipari szintű natív multimodális technológiai szabványok kialakítását.