Всички категории

Преминаване от „сливане на данни“ към „родна архитектура“: SenseTime представя архитектурата NEO, която прере дефинира граници на производителността на мултимодалните модели.

2026-09-18

SenseTime официално пусна и отвори изходния код на своята нова мултимодална моделна архитектура NEO, разработена в сътрудничество с S-Lab към Нанянгския технологичен университет, което залага основите за ново поколение архитектура на мултимодалните модели SenseNova.
Като първата в индустрията достъпна нативна мултимодална архитектура (Native VLM), постигаща дълбока интеграция, NEO преодолява ограниченията на традиционния „модулен“ подход още на фундаментално ниво и иновативно е проектирана така, че да е „родена специално за мултимодалност“. Чрез дълбока интеграция на множество модалности на нивото на основната архитектура тя постига всеобхватен пробив в производителността, ефективността и универсалността, прерисува границите на производителността на мултимодалните модели и бележи официалното влизане на мултимодалните технологии в изкуствения интелект в нова епоха на „нативна архитектура“.
Преодоляване на бутони, сбогуване с „пъстрите решения“, приемане на „нативното“
В момента основните мултимодални модели в индустрията предимно следват модулния подход „визуален енкодер + проектор + езиков модел“. Този метод за разширение, базиран на големи езикови модели (LLM), осигурява съвместимост с входни изображения, но по същество продължава да се фокусира върху езика, а сливането на изображения и език остава само на ниво данни. Тази „пъстра“ архитектура не само има ниска ефективност при обучението, но и ограничава способността на модела да обработва сложни мултимодални сценарии — например такива, които изискват улавяне на детайли в изображения или разбиране на сложни пространствени структури. Архитектурата SenseTime NEO е създадена именно за преодоляване на този проблем. Още през втората половина на 2024 г. Shangtang първа в Китай постига пробив в технологията за нативно мултимодално сливане по време на обучението, спечелвайки оценките SuperCLUE (езикова) и OpenCompass (мултимодална) с един-единствен модел; въз основа на тази ключова технология е създаден Nissin SenseNova 6.0, който постига водещи възможности в мултимодалното разсъждение. По-късно, през юли 2025 г., е представен Nichiron SenseNova 6.5, който осъществява ранно сливане на ниво енкодер, трипости повишава стойността на мултимодалните модели и е първият в Китай, който стартира търговско ниво на интерлийв инференс (смесено извеждане) на графика и текст. SenseTime прави следващата стъпка, като напълно отказва от традиционната модулна структура и, започвайки от основните принципи, представя изцяло новосъздадената нативна архитектура NEO.
Три основни иновации постигат дълбоко единство на визията и езика
Архитектурата NEO се основава на основните концепции за крайна ефективност и дълбока интеграция и чрез фундаментални иновации в три ключови измерения – механизъм на вниманието, кодиране на позицията и семантично картографиране – моделът естествено притежава способността да обработва както визуални, така и езикови данни по единен начин
Родно вграждане на патчета: отхвърля дискретните токенизатори за изображения и създава непрекъснато картографиране от пиксели към думи отдолу-нагоре чрез уникален слой за вграждане на патчета (PEL). Това решение позволява по-финото улавяне на детайли в изображенията и фундаментално преодолява бутилното гърло при моделирането на изображения в водещите модели.
Роден RoPE: иновативно разделя тримерното пространствено-времево разпределение на честоти, като използва високи честоти във визуалното измерение и ниски честоти в текстовото измерение, което идеално съответства на естествената структура на двете модалности. Това не само позволява на NEO да улавя точно пространствената структура на изображенията, но също така има потенциала да се разшири безпроблемно към сложни сцени като обработка на видео и крос-кадрово моделиране.
Родено многоглаво внимание: В отговор на характеристиките на различните модалности NEO прилага както автогресивно внимание за текстови токени, така и двупосочна внимателност за визуални токени в рамките на единен модел. Тази архитектура значително подобрява използването на корелацията в пространствената структура в модела и по този начин подпомага по-добре сложното смесено разбиране и разсъждение на графики и текст.
Освен това, благодарение на иновативната двустепенна стратегия за фузионно обучение Pre Buffer&Post LLM, NEO може да усвои пълната способност за езиково разсъждение на оригиналния LLM, докато създава мощна визуална възприемчивост от нулата, напълно решавайки проблема с намаляването на езиковите способности при традиционното кросмодално обучение.
Тествана производителност: Една десета от данните се използва за оценка на производителността на флагманския клас
Движена от архитектурни иновации, NEO е демонстрирала изумителна ефективност при обработка на данни и предимства в производителността: изключително висока ефективност при обработка на данни – със само 1/10 от обема данни, необходим за модели с еквивалентна производителност в отрасъла (390 милиона примера с изображения и текст), NEO може да развива върхови визуални възприемателни способности. Без да разчита на масивни обеми данни и допълнителни визуални кодери, нейната компактна архитектура постига резултати, сравними с тези на водещите модулни флагмански модели като Qwen2-VL и InternVL3 в множество задачи за визуално разбиране. Отлична и балансирана производителност – в множество публични и авторитетни оценки като MMMU, MMB, MMStar, SEED-I, POPE и др. архитектурата NEO постига високи резултати, което потвърждава нейната комплексна производителност, надминаваща тази на други нативни VLM, и действително осъществява „точно беззагубно“ функциониране на нативната архитектура. Крайна стойност на разсъжденията: особено в диапазона от 0,6B до 8B параметри NEO има значителни предимства при внедряване на периферията. Тя не само постига двойно подобрение в точност и ефективност, но и значително намалява разходите за извеждане на заключения, изтласквайки „стойността“ на мултимодалното визуално възприемане до extreme.Отворен код и съвместно строителство
Създаването на архитектурата за ИИ инфраструктура от следващото поколение е „скелетът“ на модела, а само здрав скелет може да поддържа бъдещето на мултимодалните технологии.
Ранната фузионна конструкция на архитектурата NEO поддържа произволни резолюции и дълги изображения като вход, безпроблемно разширявайки се към предовата област на видеото и въплътената интелигентност, постигайки истинска фузия отдолу-нагоре и край до край. От гледна точка на приложението, край до край конструкцията с „родна интеграция“ осигурява здрава техническа поддръжка за приложения в разнообразни сценарии като въплътено взаимодействие с роботи, мултимодален отговор от интелигентни терминали, разбиране на видео, 3D взаимодействие и въплътена интелигентност.
В момента SenseTime официално е освободила за обществено ползване два спецификационни модела, базирани на архитектурата NEO – 2B и 9B, за да насърчи иновациите и приложението в общността на отворения код относно нативната мултимодална архитектура. SenseTime Technology заяви, че е ангажирана да превърне NEO в мащабируема и многократно използваема ИИ-инфраструктура от следващо поколение чрез сътрудничество в рамките на отворения код и внедряване в конкретни сценарии, като по този начин насърчава широко разпространеното промишлено приложение на нативни мултимодални технологии извън лабораторната среда и ускорява създаването на стандарти за нативни мултимодални технологии от следващо поколение на промишлено равнище.

За нас
Телефон: 0518-80236699
Имейл: [email protected]
Адрес: Район Хайчжоу, град Лянюньган, провинция Цзянсу
Платформа за правителствени услуги на Министерството на индустрията и информационните технологии
Су ИЦП подготвителен номер 2025211914
Су Гунванг сигурност № 32070602010184
Техническа поддръжка: Джянсу Сяола Текнолъджи Ко., Лтд.
Facebook Facebook
Facebook
Whatsapp Whatsapp
Whatsapp