Všetky kategórie

Presun od „zlučovania dát“ k „nativnej architektúre“: SenseTime predstavuje architektúru NEO a znovu definuje hranice výkonu multimodálnych modelov

2026-09-18

SenseTime oficiálne uvoľnil a zverejnil svoju novú multimodálnu architektúru modelov NEO, ktorú vyvinul vo spolupráci s Nanyang Technological University S-Lab a ktorá zakladá základ pre novú generáciu architektúry multimodálnych modelov SenseNova.
Ako prvá v odvetví dostupná natívna multimodálna architektúra (Native VLM), ktorá dosahuje hlbokú integráciu, NEO prelomuje obmedzenia tradičného „modulárneho“ prístupu na úrovni základných princípov a inovatívne je navrhnutá tak, aby bola „od narodenia určená pre multimodálnosť“. Prostredníctvom hlbokého integrovania viacerých modálnych vstupov na úrovni základnej architektúry dosahuje komplexný prelom v oblasti výkonu, efektivity a univerzality, znova definuje hranice výkonu multimodálnych modelov a znamená oficiálne vstup technológií umelnej inteligencie s multimodálnym prístupom do novej éry „natívnej architektúry“.
Prekonanie úzkych miest, rozlúčka s „kúskovitosťou“, prijatie „natívnej“ architektúry
V súčasnosti sa väčšina populárnych multimodálnych modelov v odvetví väčšinou riadi modulárnym prístupom „vizuálny enkóder + projektor + jazykový model“. Táto metóda rozšírenia založená na veľkom jazykovom modeli (LLM) umožňuje kompatibilitu so vstupom obrazov, no stále sa zásadne sústreďuje na jazyk a fúzia obrazov a jazyka sa nachádza len na úrovni dát. Tento „náplňový“ návrh má nižšiu účinnosť učenia a zároveň obmedzuje schopnosť modelu spracovať zložité multimodálne scénary, napríklad zachytenie detailov obrazu alebo pochopenie zložitej priestorovej štruktúry. Architektúra SenseTime NEO vznikla práve na riešenie tohto problému. Už v druhej polovici roku 2024 spoločnosť Shangtang ako prvá v Číne dosiahla prelom v technológii natívnej multimodálnej fúzie počas trénovania, čím získala najvyššie hodnotenie v jazykovej evaluácii SuperCLUE aj v multimodálnej evaluácii OpenCompass jediným modelom; na základe tejto kľúčovej technológie vytvorila model Nissin SenseNova 6.0, ktorý dosiahol vedúce schopnosti v multimodálnej úvahe. Neskôr, v júli 2025, bola uvedená verzia Nichiron SenseNova 6.5, ktorá dosiahla ranú fúziu na úrovni enkódera, trojnásobne zvýšila cenovú efektívnosť multimodálnych modelov a bola prvou v Číne, ktorá uviedla komerčne využiteľnú inferenciu s interkaláciou grafiky a textu. SenseTime teraz urobila ďalší krok – úplne opustila tradičnú modulárnu štruktúru a od základných princípov vyvinula novú natívnu architektúru NEO od začiatku.
Tri základné inovácie dosahujú hlboké zjednotenie videnia a jazyka
Architektúra NEO je založená na kľúčových konceptoch maximálnej efektívnosti a hlbokého integrovania a prostredníctvom podkladových inovácií v troch kľúčových rozmeroch – mechanizmu pozornosti, kódovania pozície a sémantickej mapy – má model prirodzene schopnosť spracovávať videnie aj jazyk jednotne
Nativné vkladanie patchov: odmieta diskrétne tokenizéry obrazov a prostredníctvom jedinečnej vrstvy vkladania patchov (PEL) vytvára spojité zobrazenie od pixelov k slovám od spodu nahor. Tento návrh dokáže zachytiť podrobnosti obrazu jemnejšie a zásadne prekonáva úzke miesto modelovania obrazov v bežných modeloch.
Native RoPE: inovatívne oddeluje trojrozmerné priestorovo-časové rozdelenie frekvencií tak, že využíva vysoké frekvencie v vizuálnej dimenzii a nízke frekvencie v textovej dimenzii, čím sa dokonale prispôsobuje prirodzenej štruktúre oboch modálností. To nielen umožňuje modelu NEO presne zachytiť priestorovú štruktúru obrázkov, ale tiež ponúka potenciál na bezproblémové rozšírenie na zložité scénary, ako je spracovanie videa a modelovanie cez rámce.
Native Multi Head Attention: Vzhľadom na charakteristiky rôznych modálností implementoval model NEO v rámci jednotného architektonického rámca autoregresívnu pozornosť pre textové tokeny a obojsmernú pozornosť pre vizuálne tokeny. Tento dizajn výrazne zvyšuje využitie korelácie priestorovej štruktúry v modeli a tým lepšie podporuje zložité porozumenie a uvažovanie kombinujúce grafiku a text.
Okrem toho sa vďaka inovatívnemu dvojstupňovému školeniu s fúziou pred vyrovnávacím pamäťovým bufferom a po LLM (veľkom jazykovom modeli) dokáže NEO plne osvojiť schopnosť jazykového uvažovania pôvodného LLM a zároveň od nuly vybudovať výkonnú schopnosť vizuálneho vnímania, čím úplne vyrieši problém zníženia jazykových schopností pri tradičnom krížovom multimodálnom školení.
Otestovaný výkon: Na vyhodnotenie výkonu na úrovni vlajkových modelov sa použila jedna desatina dát
Poháňaný architektonickou inováciou, NEO preukázal úžasnú efektívnosť spracovania dát a výkonnostné výhody: extrémne vysoká efektívnosť spracovania dát – s len 1/10 objemu dát modelov s rovnocenným výkonom v odvetví (390 miliónov príkladov obrázkov a textov) dokáže NEO vyvinúť prvotriedne vizuálne vnímacie schopnosti. Bez závislosti od obrovských množstiev dát a dodatočných vizuálnych enkodérov jeho stručná architektúra dokáže v niekoľkých úlohách vizuálneho porozumenia dosiahnuť výsledky porovnateľné s najlepšími modulárnymi „flagship“ modelmi, ako sú Qwen2-VL a InternVL3. Vynikajúci a vyvážený výkon – v niekoľkých verejných autoritatívnych hodnoteniach, ako sú MMMU, MMB, MMStar, SEED-I, POPE atď., architektúra NEO dosiahla vysoké skóre, čím preukázala komplexný výkon nad ostatnými natívnymi VLM, čo skutočne realizuje „presné bezstratové“ riešenie natívnej architektúry. Najvyššia nákladová efektívnosť pri uvažovaní o úvahách: najmä v rozsahu parametrov 0,6B–8B má NEO výrazné výhody pri nasadení na hraničných zariadeniach. Nielenže dosahuje dvojnásobný pokrok v presnosti aj efektívnosti, ale výrazne zníži aj náklady na inferenciu, čím posúva „nákladovú efektívnosť“ multimodálneho vizuálneho vnímania na úroveň extreme.Otvorená spolupráca pri vývoji
Výstavba infraštruktúry umelej inteligencie novej generácie je „kostrou“ modelu a len pevná kostra dokáže podporiť budúcnosť multimodálnej technológie.
Návrh architektúry NEO s ranou fúziou podporuje ľubovoľné rozlíšenie a dlhé vstupné obrázky a bezproblémovo sa rozširuje do najnovších oblastí, ako sú video a inkarnovaná inteligencia, čím dosahuje skutočnú fúziu od spodu po vrch a koniec-ku-koncu. Z hľadiska aplikácií návrh „prirodzenej integrácie“ koniec-ku-koncu poskytuje pevnú technickú podporu pre aplikácie v rôznych scénarioch, ako sú inkarnovaná interakcia robotov, multimodálne reakcie na inteligentných zariadeniach, porozumenie videa, 3D interakcia a inkarnovaná inteligencia.
V súčasnosti SenseTime oficiálne uvoľnil do otvorenej komunity dva špecifikačné modely založené na architektúre NEO – 2B a 9B – s cieľom podporiť inovácie a aplikácie v oblasti natívnej multimodálnej architektúry. SenseTime Technology uviedol, že sa zaväzuje vybudovať NEO ako škálovateľnú a opakovane použiteľnú AI infraštruktúru novej generácie prostredníctvom spolupráce v rámci otvorenej komunity a implementácie v konkrétnych scenároch, čím bude podporovať široké priemyselné využitie natívnej multimodálnej technológie od laboratórnych výskumov a zrýchli tvorbu priemyselných noriem pre natívnu multimodálnu technológiu novej generácie.

O nás
Telefón: 0518-80236699
E-mail: [email protected]
Adresa: Okres Haizhou, mesto Lianyungang, provincie Jiangsu
Platforma vládnych služieb Ministerstva priemyslu a informačných technológií
Príprava Su ICP č. 2025211914
Číslo bezpečnostného certifikátu Su Gongwang: 32070602010184
Technická podpora: Jiangsu Xiaola Technology Co., Ltd.
Facebook Facebook
Facebook
WhatsApp WhatsApp
WhatsApp