Všechny kategorie

Přesun od „fúze dat“ k „nativní architektuře“: SenseTime uvedl architekturu NEO a znovu definuje hranice výkonu multimodálních modelů

2026-09-18

SenseTime oficiálně uvolnil a zveřejnil svou novou multimodální architekturu modelu NEO, vyvinutou ve spolupráci s Nanyang Technological University S-Lab, čímž položil základy pro novou generaci architektury multimodálního modelu SenseNova.
Jako první v průmyslu dostupná nativní multimodální architektura (Native VLM), která dosahuje hluboké integrace, překonává NEO tradiční „modulární“ paradigma již na úrovni základních principů a inovativně navrhuje architekturu „narozitou speciálně pro multimodalitu“. Díky hluboké integraci více modalit na úrovni jádra architektury dosahuje komplexního pokročilého výkonu, efektivity a univerzálnosti, znovu definuje hranice výkonu multimodálních modelů a znamená oficiální vstup multimodálních technologií umělé inteligence do nové éry „nativní architektury“.
Překonání úzkých míst, rozloučení se s „náplastí“, přijetí „nativního řešení“
V současné době většina předních multimodálních modelů v odvětví vychází z modulárního přístupu „vizuální enkodér + projektovací vrstva + jazykový model“. Tato metoda rozšíření založená na velkých jazykových modelech (LLM) umožňuje kompatibilitu se vstupem obrazu, avšak zásadně stále zaměřuje pozornost na jazyk a sloučení obrazu a jazyka zůstává pouze na úrovni dat. Tento „náplastový“ návrh nejenže vykazuje nízkou efektivitu učení, ale také omezuje schopnost modelu zpracovávat složité multimodální scénáře, například ty, které vyžadují zachycení detailů obrazu nebo porozumění složitým prostorovým strukturám. Architektura SenseTime NEO vznikla právě za účelem řešení tohoto problému. Již ve druhé polovině roku 2024 společnost Shangtang jako první v Číně dosáhla průlomu v technologii nativního multimodálního sloučení během trénování, čímž získala výsledky v hodnocení SuperCLUE pro jazykové modely i v multimodálním hodnocení OpenCompass pomocí jediného modelu; na základě této klíčové technologie pak vytvořila model Nissin SenseNova 6.0, který dosahuje vedoucích schopností v multimodálním uvažování. Poté, v červenci 2025, byl uveden model Nichiron SenseNova 6.5, který umožnil rané sloučení již na úrovni enkodéru, ztrojnásobil cenovou efektivitu multimodálních modelů a stal se prvním komerčně nasaditelným modelem v Číně s podporou střídavého odvozování grafického a textového obsahu. Společnost SenseTime nyní učinila další krok tím, že zcela opustila tradiční modulární strukturu a od základních principů vytvořila zcela novou nativní architekturu NEO.
Tři základní inovace umožňují hlubokou jednotu vidění a jazyka
Architektura NEO vychází z klíčových konceptů maximální efektivity a hluboké integrace a prostřednictvím základních inovací ve třech klíčových dimenzích – mechanismu pozornosti, kódování pozice a sémantického mapování – model přirozeně získává schopnost zpracovávat vizuální i jazykové informace jednotným způsobem
Nativní vložení patchů: odmítá diskrétní tokenizátory obrazů a prostřednictvím jedinečné vrstvy vložení patchů (PEL) vytváří spojité mapování od pixelů ke slovům od spodní úrovně k horní. Tento návrh dokáže zachytit podrobnosti obrazu jemněji a zásadně překonává úzké hrdlo modelování obrazů v současných mainstreamových modelech.
Nativní RoPE: inovativně odděluje alokaci trojrozměrné prostoročasové frekvence, přičemž využívá vysokých frekvencí ve vizuální dimenzi a nízkých frekvencí v textové dimenzi, čímž se dokonale přizpůsobuje přirozené struktuře obou modalit. To nejen umožňuje modelu NEO přesně zachytit prostorovou strukturu obrázků, ale také nabízí potenciál pro bezproblémové rozšíření na složité scénáře, jako je zpracování videa a modelování napříč snímky.
Nativní vícehlavová pozornost: V reakci na charakteristiky různých modalit implementuje model NEO v rámci jednotného architektonického rámce jak autoregresivní pozornost pro textové tokeny, tak obousměrnou pozornost pro vizuální tokeny. Tento návrh výrazně zvyšuje využití korelací prostorové struktury v modelu a tím lépe podporuje složité porozumění a uvažování kombinující grafiku a text.
Kromě toho díky inovativní dvoufázové strategii trénování s předchozím vyrovnávacím paměťovým prostorem a následným jazykovým modelem (Pre Buffer&Post LLM) může NEO absorbovat úplnou schopnost jazykového uvažování původního jazykového modelu (LLM), zatímco současně vybuduje výkonnou schopnost vizuálního vnímání od základu, čímž naprosto vyřeší problém oslabení jazykových schopností při tradičním křížovém multimodálním trénování.
Otestovaný výkon: Pro vyhodnocení výkonu na úrovni vlajkové lodě se použije jedna desetina dat
Poháněn inovací v architektuře dosáhl model NEO úžasných výhod z hlediska efektivity zpracování dat a výkonu: extrémně vysoká efektivita zpracování dat – s pouhým 1/10 objemu dat potřebného pro modely s rovnocenným výkonem v průmyslu (390 milionů dvojic obrázek–text) dokáže model NEO vyvinout prvotřídní schopnosti vizuálního vnímání. Bez nutnosti masivních datových sad či dodatečných vizuálních kodérů jeho stručná architektura dosahuje ve více úlohách vizuálního porozumění stejného výkonu jako nejlepší modulární náročné modely, např. Qwen2-VL a InternVL3. Vynikající a vyvážený výkon – v několika veřejných autoritativních hodnoceních, jako jsou MMMU, MMB, MMStar, SEED-I a POPE, dosáhla architektura NEO vysokých skóre, což svědčí o komplexním výkonu převyšujícím jiné nativní multimodální jazykové modely (VLM), a tím i o skutečném dosažení „ztrátově bezchybné přesnosti“ nativní architektury. Nejvyšší poměr výkonu k nákladům na uvažování – zejména v rozsahu parametrů 0,6 miliardy až 8 miliard má model NEO výrazné výhody pro nasazení na hranici sítě (edge deployment). Nejenže dosahuje dvojího skoku jak v přesnosti, tak v efektivitě, ale také výrazně snižuje náklady na inferenci, čímž posouvá „poměr výkonu k ceně“ multimodálního vizuálního vnímání na novou úroveň. extreme.Otevřený zdroj společného vývoje
Výstavba infrastruktury umělé inteligence nové generace je „kostrou“ modelu, a pouze pevná kostra dokáže podporovat budoucnost multimodálních technologií.
Návrh architektury NEO s raným sloučením podporuje libovolné rozlišení a dlouhé obrázkové vstupy a bezproblémově se rozšiřuje do pokročilých oblastí, jako jsou video a inkarnovaná inteligence, čímž dosahuje skutečného sloučení od základu až po vrchol a koncepce „konec-koncem“. Z hlediska aplikací poskytuje návrh „nativní integrace“ koncepce „konec-koncem“ solidní technickou podporu pro aplikace v různorodých scénářích, jako je inkarnovaná interakce robotů, multimodální reakce inteligentních zařízení, porozumění videu, 3D interakce a inkarnovaná inteligence.
V současné době SenseTime oficiálně zveřejnila dva specifické modely založené na architektuře NEO – 2B a 9B – za účelem podporování inovací a aplikací v komunitě open source týkajících se nativní multimodální architektury. Společnost SenseTime Technology uvedla, že se zavazuje vybudovat NEO jako škálovatelnou a znovupoužitelnou umělou inteligenci nové generace prostřednictvím spolupráce v rámci open source a implementace konkrétních scénářů, čímž podporuje široké průmyslové využití nativní multimodální technologie od laboratorního prostředí a urychluje vytváření průmyslových standardů pro nativní multimodální technologii nové generace.

O nás
Telefon: 0518-80236699
E-mail: [email protected]
Adresa: Okres Haizhou, město Lianyungang, provincie Jiangsu
Platforma vládních služeb Ministerstva průmyslu a informatiky
Příprava ICP v provincii Su: 2025211914
Číslo bezpečnostního povolení Su Gongwang: 32070602010184
Technická podpora: společnost Jiangsu Xiaola Technology Co., Ltd.
Facebook Facebook
Facebook
Whatsapp Whatsapp
Whatsapp