Усі категорії

Перехід від «об’єднання даних» до «вбудованої архітектури»: SenseTime представила архітектуру NEO, що визначає нові межі продуктивності багатомодальних моделей

2026-09-18

SenseTime офіційно представив і відкрив вихідний код нової багатомодальної архітектури моделі NEO, розробленої у співпраці з S-Lab Наньянського технологічного університету, закладаючи основу для нового покоління архітектури багатомодальних моделей SenseNova.
Як перша в галузі доступна нативна багатомодальна архітектура (Native VLM), що забезпечує глибоку інтеграцію, NEO руйнує обмеження традиційної «модульної» парадигми на фундаментальному рівні й інноваційно проектується за принципом «народженої спеціально для багатомодальності». Шляхом глибокої інтеграції кількох модальностей на рівні базової архітектури вона досягає комплексного прориву у продуктивності, ефективності та універсальності, переозначає межі продуктивності багатомодальних моделей й ознаменовує офіційне вступлення багатомодальних технологій штучного інтелекту в нову еру «нативної архітектури».
Подолання «вузьких місць», прощання з «латанням», прийняття «нативного»
Наразі основні багатомодальні моделі в галузі переважно ґрунтуються на модульній парадигмі «візуальний енкодер + проектор + мовна модель». Цей метод розширення, заснований на великих мовних моделях (LLM), забезпечує сумісність із вхідними зображеннями, але за суттю все ще орієнтований на мову, а злиття зображень і мови залишається лише на рівні даних. Такий «лоскотковий» підхід не лише має низьку ефективність навчання, а й обмежує здатність моделі обробляти складні багатомодальні сцени, наприклад, ті, що вимагають детального аналізу зображень або розуміння складної просторової структури. Архітектура SenseTime NEO була створена саме для вирішення цієї проблеми. Ще у другій половині 2024 року компанія Shangtang стала першою в Китаї, хто досягнув прориву в технології нативного багатомодального злиття під час навчання, отримавши найвищі результати в мовній оцінці SuperCLUE та багатомодальній оцінці OpenCompass за допомогою однієї моделі; на основі цієї ключової технології було створено Nissin SenseNova 6.0, що забезпечило провідні здібності в багатомодальному міркуванні. Пізніше, у липні 2025 року, було представлено Nichiron SenseNova 6.5, яка реалізувала раннє злиття на рівні енкодера, збільшила ефективність витрат багатомодальних моделей утричі та стала першою в Китаї комерційно придатною моделлю, що підтримує висновування з чергуванням графіки та тексту. SenseTime зробила наступний крок — повністю відмовившись від традиційної модульної структури й почавши з фундаментальних принципів, було запущено нативну архітектуру NEO, розроблену з нуля.
Три основні інновації забезпечують глибоке об’єднання зору та мови
Архітектура NEO ґрунтується на ключових концепціях максимальної ефективності та глибокої інтеграції й завдяки фундаментальним інноваціям у трьох ключових вимірах — механізмі уваги, кодуванні позицій та семантичному відображенні — модель природно набуває здатності одночасно обробляти візуальні дані й мову в єдиному форматі
Вбудоване вбудовування патчів: відмова від дискретних токенізаторів зображень і створення безперервного відображення від пікселів до слів «знизу вгору» за допомогою унікального шару вбудовування патчів (PEL). Цей підхід дозволяє точніше захоплювати деталі зображень і принципово долає «вузьке місце» моделювання зображень у сучасних моделях.
Родинна RoPE: інноваційно роз’єднує тривимірне просторово-часове розподілення частот, використовуючи високі частоти у візуальному вимірі й низькі — у текстовому, що ідеально адаптується до природної структури обох модальностей. Це не лише дозволяє NEO точно захоплювати просторову структуру зображень, а й має потенціал безперервного розширення на складні сцени, такі як обробка відео й міжкадрова моделювання.
Родинна багатоголова увага: враховуючи особливості різних модальностей, NEO реалізує як автогресивну увагу для текстових токенів, так і двонапрямлену увагу для візуальних токенів у єдиному фреймворку. Такий підхід значно підвищує використання кореляції просторової структури в моделі, що краще підтримує складне змішане розуміння та міркування з графіки й тексту.
Крім того, завдяки інноваційній двоетапній стратегії навчання з об’єднанням даних до та після LLM (Pre Buffer&Post LLM) модель NEO може повністю засвоїти мовну логічну здатність оригінальної LLM, одночасно створюючи потужну здатність візуального сприйняття з нуля й повністю усуваючи проблему погіршення мовних здібностей у традиційному крос-модальному навчанні.
Протестовані показники: одну десяту частину даних використано для оцінки продуктивності на рівні флагманських моделей
Рухаючись завдяки архітектурним інноваціям, NEO продемонстрував вражаючу ефективність обробки даних та переваги у продуктивності: надзвичайно висока ефективність використання даних — використовуючи лише 1/10 обсягу даних порівняно з моделями галузевого рівня (390 мільйонів прикладів зображень і текстів), NEO здатен розвинути високоякісні здібності візуального сприйняття. Не покладаючись на масивні набори даних чи додаткові візуальні енкодери, його стисла архітектура забезпечує результати, порівнянні з провідними модульними флагманськими моделями, такими як Qwen2-VL та InternVL3, у низці завдань візуального розуміння. Відмінна та збалансована продуктивність — у кількох публічних авторитетних оцінках, зокрема MMMU, MMB, MMStar, SEED-I, POPE тощо, архітектура NEO досягла високих балів, що свідчить про комплексну продуктивність, кращу за інші власні VLM, і справді реалізує «точне безвтратне» виконання на основі власної архітектури. Максимальна ефективність міркувань за вартістю: особливо в діапазоні параметрів 0,6 млрд–8 млрд, NEO має значні переваги для розгортання на периферійних пристроях. Він не лише забезпечує подвійний стрибок у точності й ефективності, а й суттєво знижує витрати на висновування, посилюючи «ефективність за вартістю» багатомодального візуального сприйняття до extreme. Відкритий спільний розвиток
Створення архітектури інфраструктури штучного інтелекту нового покоління — це «скелет» моделі, і лише міцний скелет може підтримувати майбутнє багатомодальних технологій.
Дизайн раннього злиття в архітектурі NEO підтримує довільну роздільну здатність та довгі зображення на вході й безперервно поширюється на передові галузі, такі як відео та тілесний інтелект, забезпечуючи справжнє злиття знизу донизу та від кінця до кінця. З точки зору застосування дизайн «нативної інтеграції» від кінця до кінця надає міцну технічну підтримку для застосування в різноманітних сценаріях, зокрема взаємодії роботів у фізичному середовищі, багатомодальних відповідей інтелектуальних пристроїв, розуміння відео, тривимірної взаємодії та тілесного інтелекту.
Наразі SenseTime офіційно відкрила вихідні коди двох специфікаційних моделей на основі архітектури NEO — 2B та 9B — задля стимулювання інновацій та застосування в спільноті з відкритим кодом у сфері нативних багатомодальних архітектур. SenseTime Technology заявила, що прагне перетворити NEO на масштабовану й багаторазово використовувану інфраструктуру штучного інтелекту нового покоління шляхом співпраці з відкритим кодом та реалізації практичних сценаріїв, сприяючи широкому промисловому застосуванню нативних багатомодальних технологій поза межами лабораторій і прискорюючи розробку промислових стандартів нативних багатомодальних технологій нового покоління.

Про нас
Телефон: 0518-80236699
Електронна пошта: [email protected]
Адреса: район Хайчжоу, місто Ляньюньган, провінція Цзянсу
Платформа державних послуг Міністерства промисловості та інформаційних технологій
Підготовка до реєстрації Su ICP № 2025211914
Сертифікат безпеки Su Gongwang № 32070602010184
Технічна підтримка: Jiangsu Xiaola Technology Co., Ltd
Facebook Facebook
Facebook
WhatsApp WhatsApp
WhatsApp