Wszystkie kategorie

Przejście od „fuzji danych” do „architektury natywnej”: SenseTime prezentuje architekturę NEO, przedefiniowując granice wydajności modeli multimodalnych

2026-09-18

SenseTime oficjalnie opublikował i udostępnił na licencji open source nową architekturę modelu multimodalnego NEO, opracowaną we współpracy z laboratorium S-Lab Uniwersytetu Technologicznego Nanyang, tworząc podwaliny pod nową generację architektury modeli multimodalnych SenseNova.
Jako pierwsza w branży dostępna natywna architektura multimodalna (Native VLM), osiągająca głęboką integrację, NEO przełamuje ograniczenia tradycyjnego paradygmatu „modułowego” na poziomie podstawowych założeń i innowacyjnie projektuje się jako architektura „urodzona specjalnie dla multimodalności”. Dzięki głębokiej integracji wielu modalności na poziomie rdzeniowej architektury osiąga ona kompleksowy przełom pod względem wydajności, efektywności i uniwersalności, przesuwając granice wydajności modeli multimodalnych i zapowiadając oficjalne wejście technologii multimodalnej sztucznej inteligencji w nową erę „architektury natywnej”.
Przełamanie utrzymujących się ograniczeń, pożegnanie się z podejściem „kombinowanym”, przyjęcie podejścia „natywnego”
Obecnie dominujące w branży multimodalne modele zazwyczaj opierają się na modularnym podejściu składającym się z „enkodera wizualnego + projektora + modelu językowego”. Ta metoda rozszerzania oparta na dużym modelu językowym (LLM) zapewnia kompatybilność z danymi obrazowymi, lecz nadal w istocie koncentruje się na języku, a fuzja obrazu i języka ogranicza się jedynie do poziomu danych. Takie „krojone na siłę” rozwiązanie charakteryzuje się nie tylko niską wydajnością uczenia się, ale także ogranicza zdolności modelu w złożonych scenach multimodalnych, takich jak np. przechwytywanie szczegółów obrazu lub zrozumienie skomplikowanej struktury przestrzennej. Architektura SenseTime NEO została stworzona właśnie w celu rozwiązania tego problemu. Już w drugiej połowie 2024 roku Shangtang jako pierwszy w Chinach przełamał barierę technologii natywnej treningowej fuzji multimodalnej, osiągając najwyższe wyniki w ocenach językowych SuperCLUE oraz multimodalnych OpenCompass przy użyciu jednego modelu; na podstawie tej kluczowej technologii stworzono Nissin SenseNova 6.0, który osiągnął liderstwo w zakresie rozumowania multimodalnego. Następnie, w lipcu 2025 roku, wprowadzono do sprzedaży Nichiron SenseNova 6.5, który umożliwił wczesną fuzję już na poziomie enkodera, potroił opłacalność modeli multimodalnych oraz jako pierwszy w Chinach wprowadził komercyjne wnioskowanie z naprzemiennym umieszczaniem grafik i tekstu. SenseTime poszedł dalej – całkowicie porzucił tradycyjną strukturę modularną i, od podstawowych zasad, opracował nową, od zera zaprojektowaną architekturę NEO.
Trzy podstawowe innowacje zapewniają głęboką jedność wizji i języka
Architektura NEO opiera się na kluczowych koncepcjach maksymalnej wydajności i głębokiej integracji oraz dzięki podstawowym innowacjom w trzech kluczowych wymiarach: mechanizmie uwagi, kodowaniu pozycji i mapowaniu semantycznemu model ten naturalnie posiada zdolność jednoczesnego przetwarzania danych wizualnych i językowych
Natywna warstwa osadzania łatek (Native Patch Embedding): rezygnuje z dyskretnych tokenizatorów obrazów i tworzy ciągłe odwzorowanie od pikseli do słów od podstawy do szczytu za pomocą unikalnej warstwy osadzania łatek (PEL). To rozwiązanie pozwala dokładniej uchwycić szczegóły obrazu, przełamując w sposób fundamentalny wąskie gardło modelowania obrazów w dominujących obecnie rozwiązaniach.
Rodzimy mechanizm RoPE: innowacyjnie rozdziela trójwymiarowe przyporządkowanie częstotliwości przestrzenno-czasowych, wykorzystując wysokie częstotliwości w wymiarze wizualnym i niskie częstotliwości w wymiarze tekstowym, co idealnie dopasowuje się do naturalnej struktury obu modalności. Dzięki temu model NEO nie tylko precyzyjnie uchwytuje strukturę przestrzenną obrazów, ale także ma potencjał bezszwowego rozszerzenia na złożone sceny, takie jak przetwarzanie wideo czy modelowanie międzyklatkowe.
Rodzimy mechanizm wielogłowicowy uwagi: w odpowiedzi na charakterystyczne cechy różnych modalności model NEO zaimplementował zarówno uwagę autoregresywną dla tokenów tekstowych, jak i uwagę dwukierunkową dla tokenów wizualnych w ramach jednolitego podejścia. Takie zaprojektowanie znacznie poprawia wykorzystanie korelacji struktury przestrzennej w modelu, wspierając tym samym lepsze zrozumienie i wnioskowanie w przypadku złożonych, mieszanych treści graficzno-tekstowych.
Dodatkowo, dzięki innowacyjnej dwuetapowej strategii treningu fuzji Pre Buffer&Post LLM model NEO może przejąć pełną zdolność językowego rozumowania oryginalnego LLM, jednocześnie budując od podstaw potężne umiejętności percepcji wizualnej, co całkowicie rozwiązuje problem utraty umiejętności językowych występujący w tradycyjnym treningu międzymodalnym.
Zmierzona wydajność: Jedna dziesiąta danych służy do oceny wydajności na poziomie flagowego modelu
Wprowadzony dzięki innowacjom architektonicznym, model NEO wykazał zdumiewającą skuteczność przetwarzania danych oraz zalety wydajnościowe: niezwykle wysoka skuteczność przetwarzania danych – przy zaledwie 1/10 objętości danych wymaganych przez modele o porównywalnej wydajności w branży (390 milionów przykładów obraz–tekst) NEO rozwija pierwszorzędne umiejętności percepcji wizualnej. Bez konieczności polegania na ogromnych zbiorach danych ani dodatkowych enkoderach wizualnych jego zwięzła architektura osiąga wyniki porównywalne z najnowocześniejszymi, modułowymi modelami flagowymi, takimi jak Qwen2-VL i InternVL3, w wielu zadaniach rozumienia treści wizualnej. Doskonała i zrównoważona wydajność – w wielu publicznych, autorytetowych ocenach, m.in. MMMU, MMB, MMStar, SEED-I i POPE, architektura NEO uzyskała wysokie wyniki, co potwierdza jej kompleksową wydajność przewyższającą inne natywne modele VLM i rzeczywiście realizującą zasadę „precyzyjnego, bezstratnego” działania architektury natywnej. Ostateczna opłacalność rozumowania – szczególnie w zakresie liczby parametrów od 0,6 mld do 8 mld, NEO oferuje istotne zalety przy wdrażaniu na urządzeniach brzegowych. Nie tylko zapewnia podwójny skok zarówno pod względem dokładności, jak i wydajności, ale także znacznie obniża koszty wnioskowania, przesuwając „opłacalność” multimodalnej percepcji wizualnej na nowy poziom. extreme.Otwarta współpraca przy budowie
Budowa infrastruktury sztucznej inteligencji nowej generacji to „szkielet” modelu – tylko solidny szkielet pozwala wspierać przyszłość technologii multimodalnych.
Projekt wczesnej fuzji architektury NEO obsługuje obrazy o dowolnym rozdzielczości i długich wymiarach, bezproblemowo rozszerzając się na nowoczesne dziedziny, takie jak przetwarzanie wideo czy inteligencja zmaterializowana (embodied intelligence), zapewniając prawdziwą fuzję od podstaw do samego szczytu oraz end-to-end. Z perspektywy zastosowań projekt end-to-end „nativnej integracji” zapewnia solidne wsparcie techniczne dla zastosowań w różnorodnych scenariuszach, takich jak interakcja robotów z otoczeniem, multimodalne odpowiedzi inteligentnych urządzeń końcowych, zrozumienie treści wideo, interakcja 3D oraz inteligencja zmaterializowana.
Obecnie SenseTime oficjalnie udostępniła wersję open source dwóch modeli specyfikacyjnych opartych na architekturze NEO – 2B i 9B – w celu wspierania innowacji oraz zastosowań w społeczności open source dotyczących natywnych architektur multimodalnych. SenseTime Technology oświadczyła, że zobowiązuje się do budowy NEO jako skalowalnej i wielokrotnie wykorzystywalnej infrastruktury sztucznej inteligencji nowej generacji poprzez współpracę open source oraz wdrażanie rozwiązań w konkretnych scenariuszach, promując powszechne zastosowanie przemysłowe technologii natywnie multimodalnych poza laboratorium oraz przyspieszając tworzenie standardów przemysłowych technologii natywnie multimodalnych nowej generacji.

O nas
Telefon: 0518-80236699
Adres e-mail: [email protected]
Adres: Dzielnica Haizhou, miasto Lianyungang, prowincja Jiangsu
Platforma usług rządowych Ministerstwa Przemysłu i Technologii Informacyjnej
Przygotowanie Su ICP nr 2025211914
Numer bezpieczeństwa Su Gongwang: 32070602010184
Wsparcie techniczne: Jiangsu Xiaola Technology Co., Ltd
Facebook Facebook
Facebook
WhatsApp WhatsApp
WhatsApp