Visos kategorijos

Perėjimas nuo „duomenų sujungimo“ prie „natūralios architektūros“: SenseTime išleido NEO architektūrą, perdefinuodama daugiamodulių modelių našumo ribas

2026-09-18

SenseTime oficialiai išleido ir atvėrė šaltinio kodą savo naujajai daugiarežiminės modelių architektūrai NEO, kurią kartu su Nanyang Technological University S-Lab sukūrė ir kuri sudaro pagrindą naujos kartos SenseNova daugiarežiminiam modeliui.
Kaip pirmoji pramonėje prieinama natyvi daugiarežiminė architektūra (Native VLM), pasiekianti gilų integravimą, NEO nutraukia tradicinės „modulinės“ paradigmos grandines nuo pačių pagrindų ir inovatyviai projektuojama kaip „nuo pat gimimo skirta daugiarežiminei veiklai“. Gilus įvairių režimų integravimas ties pačia branduolio architektūros lygiu leidžia pasiekti visapusišką pažangą našumo, efektyvumo ir universalumo srityse, perdefinuoja daugiarežiminių modelių našumo ribas ir žymi dirbtinio intelekto daugiarežiminės technologijos oficialų įėjimą į naują „natyvios architektūros“ erą.
Peržengiant ribas, atsisakant „lankstymo“, priimant „natyvumą“
Šiuo metu pramonėje vyraujantys daugiamodžiai modeliai dažniausiai laikosi modulinės struktūros „vaizdo koduoklis + projektuotojas + kalbos modelis“. Šis pagrįstas didžiuoju kalbos modeliu (LLM) išplėtimo metodas užtikrina suderinamumą su vaizdo įvestimi, tačiau esminiu požiūriu vis dar orientuotas į kalbą, o vaizdų ir kalbos sujungimas lieka tik duomenų lygyje. Ši „lankstytoji“ konstrukcija ne tik turi žemą mokymosi efektyvumą, bet taip pat riboja modelio gebėjimą apdoroti sudėtingus daugiamodžius scenarijus, pvz., reikalaujančius vaizdo detalių aptikimo ar sudėtingos erdvinės struktūros supratimo. SenseTime NEO architektūra buvo sukurtą kaip sprendimas šiai problemai. Jau 2024 m. antrojoje pusėje Shangtang pirmoji Kinijoje pasiekė pranašumą daugiamodžiame natyviame sujungimo mokymosi srityje, vienu modeliu laimėjo SuperCLUE kalbos vertinimą ir OpenCompass daugiamodžių vertinimą; remdamasis šia pagrindine technologija, sukūrė Nissin SenseNova 6.0, kuris pasiekė lyderio pozicijas daugiamodžiame samprotavime. Vėliau, 2025 m. liepos mėn., buvo išleistas Nichiron SenseNova 6.5, kuris pasiekė ankstyvą sujungimą koduoklio lygyje, padidino daugiamodžių modelių naudingumo efektyvumą tris kartus ir buvo pirmasis Kinijoje komercinio lygio grafikos ir teksto maišytos išvedamosios funkcijos diegimas. SenseTime dar labiau pažengė – visiškai atsisakė tradicinės modulinės struktūros ir, grįždamas prie pagrindinių principų, sukūrė nuo nulio suprojektuotą NEO natyvią architektūrą.
Trys pagrindiniai naujovės pasiekia gilų vaizdo ir kalbos suvienijimą
NEO architektūra remiasi pagrindiniais principais – maksimaliu efektyvumu ir giliu integravimu – ir per esminius novatoriškus sprendimus trijuose pagrindiniuose aspektuose: dėmesio mechanizme, pozicijos kodavime ir semantiniame atvaizdavime modelis natūraliai įgyja gebėjimą vienodai tvarkyti tiek vaizdus, tiek kalbą
Gimtinis sklypų įterpimas: atsisakoma diskretiškų vaizdo ženklų kodo generatorių ir unikaliu sklypų įterpimo sluoksniu (PEL) nuo apačios iki viršaus sukuriamas tolygus atvaizdavimas nuo pikselių iki žodžių. Šis sprendimas leidžia tiksliau užfiksuoti vaizdo smulkmenas ir fundamentaliai pašalinti vaizdų modeliavimo spąstus, būdingus populiariems modeliams.
Gimtinė RoPE: inovatyviai atskiria trimatę erdvėlaikinę dažnių paskirstymą, naudodama aukštus dažnius vaizdo dimensijoje ir žemus dažnius teksto dimensijoje, idealiai pritaikydamasi prie abiejų modalumų natūralios struktūros. Tai ne tik leidžia NEO tiksliai užfiksuoti vaizdų erdvinę struktūrą, bet taip pat suteikia galimybę beveik be trukdžių išplėsti modelį sudėtingoms scenoms, pvz., vaizdo apdorojimui ir kryžminiam kadro modeliavimui.
Gimtinė daugiau galvų dėmesio mechanizmas: atsakant į skirtingų modalumų ypatumus, NEO įdiegė vieningoje architektūroje tiek autoregresinį dėmesio mechanizmą teksto simboliams, tiek dvikryptį dėmesio mechanizmą vaizdo simboliams. Šis sprendimas žymiai padidina erdvinės struktūros koreliacijos panaudojimą modelyje, todėl geriau palaiko sudėtingą vaizdų ir teksto mišrų supratimą bei samprotavimą.
Be toliau, naudojant inovacinę dviejų etapų sujungimo mokymo strategiją – „Pre Buffer&Post LLM“, NEO gali įsisavinti originalaus LLM visą kalbinį samprotavimo gebėjimą, tuo pat metu nuo nulio sukurdama galingą vaizdinio восприимчивumo gebėjimą, taip visiškai išsprendžiant kalbinio gebėjimo pablogėjimo problemą tradiciniame kryžminiuose režimuose vykstančiame mokyme.
Išbandytas našumas: viena dešimtoji duomenų naudojama įvertinti vadybinio lygio našumą
Vedamas architektūrinės inovacijos, NEO parodė nuostabų duomenų naudingumą ir našumo pranašumus: itin aukštą duomenų naudingumą – tik su 1/10 pramonės lygio lygiavertės našumo modelių duomenų kiekiu (390 mln. vaizdo–teksto pavyzdžių), NEO gali sukurti aukščiausios kokybės vaizdinio suvokimo gebėjimus. Nepriklausomas nuo milžiniškų duomenų apimčių ir papildomų vaizdinių koduoklių, jo glaustoji architektūra gali prilygti geriausiems moduliniams pirmaujantiems modeliams, tokiems kaip Qwen2-VL ir InternVL3, įvairiose vaizdinio supratimo užduotyse. Puikų ir subalansuotą našumą – keliuose viešuose, autoritetiniuose vertinimuose, pvz., MMMU, MMB, MMStar, SEED-I, POPE ir kt., NEO architektūra pasiekė aukštus rezultatus, parodydama visapusišką našumą, pranašesnį už kitus natyvius VLM, tikrai realizuodama natyvios architektūros „tikslų be nuostolių“ principą. Aukščiausią samprotavimo sąnaudų efektyvumą – ypač 0,6B–8B parametrų diapazone NEO turi reikšmingų pranašumų krašto (edge) diegime. Jis ne tik pasiekia dvigubą šuolį tikslumo ir efektyvumo srityse, bet taip pat žymiai sumažina išvedimo sąnaudas, stumdamas daugiamodalių vaizdinių suvokimo „sąnaudų efektyvumą“ iki extreme.Atvirojo kodo bendros statybos
Kitos kartos dirbtinio intelekto infrastruktūros architektūros kūrimas yra modelio „rėmai“, o tik stiprūs rėmai gali palaikyti ateities daugiarežiminės technologijos vystymąsi.
NEO architektūros ankstyvoji sujungimo schema palaiko bet kokius skiriamuosius gebėjimus ir ilgus vaizdus, be trukdžių išplečiantis į pačias naujausias sritis, tokias kaip vaizdo įrašai ir įkūnytas intelektas, pasiekiant tikrąjį visišką sujungimą nuo apačios iki viršaus ir galą iki galo. Taikymo požiūriu galą iki galo „natūralus integravimas“ suteikia patikimą techninę paramą įvairiems scenarijams, tokiems kaip robotų įkūnytas sąveikavimas, protingų prietaisų daugiarežiminiai atsakymai, vaizdo įrašų supratimas, 3D sąveika ir įkūnytas intelektas.
Šiuo metu „SenseTime“ oficialiai atvėrė šaltinio kodą dviejų specifikacijų modeliams, paremtiems „NEO“ architektūra – 2B ir 9B, siekdama skatinti inovacijas ir taikymą atvirosios kodo bendruomenėje natyvioms daugiamodėms architektūroms. „SenseTime Technology“ teigia, kad ji įsipareigojusi sukurti „NEO“ kaip mastelį keičiamą ir pakartotinai naudojamą naujos kartos dirbtinio intelekto infrastruktūrą per atvirosios kodo bendradarbiavimą ir scenarijų įgyvendinimą, skatindama natyvių daugiamodžių technologijų plačią pramoninę panaudojimą nuo laboratorijų ir pagreitindama naujos kartos pramoninio lygio natyvių daugiamodžių technologijų standartų kūrimą.

Apie mus
Telefonas: 0518-80236699
El. paštas: [email protected]
Adresas: Haizhou rajonas, Lianyungango miestas, Džiangsu provincija
Pramonės ir informacinės technologijų ministerijos vyriausybės paslaugų platforma
Su ICP parengiamasis numeris 2025211914
Su Gongwang saugumo numeris 32070602010184
Techninė palaika: Jiangsu Xiaola Technology Co., Ltd
Facebook Facebook
Facebook
WhatsApp WhatsApp
WhatsApp