Alle Kategorien

Von „Datenfusion“ zu „nativem Architekturansatz“: SenseTime veröffentlicht die NEO-Architektur und definiert damit die Leistungsgrenzen multimodaler Modelle neu

2026-09-18

SenseTime hat offiziell seine neue multimodale Modellarchitektur NEO veröffentlicht und als Open Source bereitgestellt, die in Zusammenarbeit mit dem S-Lab der Nanyang Technological University entwickelt wurde und die Grundlage für eine neue Generation der SenseNova-Multimodalmodellarchitektur legt.
Als erste im Branchen verfügbare native multimodale Architektur (Native VLM), die eine tiefe Integration erreicht, durchbricht NEO die Einschränkungen des traditionellen „modularen“ Paradigmas bereits auf der Grundlagenebene und entwirft innovativ ein System, das von Anfang an speziell für Multimodalität konzipiert ist. Durch die tiefe Integration mehrerer Modalitäten auf der Ebene der Kernarchitektur erzielt sie einen umfassenden Durchbruch hinsichtlich Leistung, Effizienz und Universalität, definiert die Leistungsgrenzen multimodaler Modelle neu und markiert den offiziellen Eintritt der künstlichen Intelligenz-Multimodaltechnologie in eine neue Ära der „nativen Architektur“.
Durchbruch bei Engpässen, Abschied von ‚Stückwerk‘, Hinwendung zu ‚native‘
Derzeit folgen die gängigen multimodalen Modelle der Branche überwiegend dem modularen Paradigma »visueller Encoder + Projektor + Sprachmodell«. Diese auf dem Großen Sprachmodell (LLM) basierende Erweiterungsmethode ermöglicht die Kompatibilität mit Bild-Eingaben, konzentriert sich jedoch grundsätzlich weiterhin auf Sprache, wobei die Fusion von Bild und Sprache lediglich auf der Datenebene verbleibt. Dieses »Stückwerk«-Design weist nicht nur eine geringe Lerneffizienz auf, sondern beschränkt zudem die Verarbeitungsfähigkeit des Modells in komplexen multimodalen Szenarien – etwa bei der Erfassung feiner Bilddetails oder beim Verständnis komplexer räumlicher Strukturen. Die SenseTime-NEO-Architektur wurde entwickelt, um genau diesen Schwachpunkt zu beheben. Bereits in der zweiten Hälfte des Jahres 2024 gelang Shangtang als erstem Unternehmen in China der Durchbruch bei der Technologie zum nativen multimodalen Fusionstraining; dabei erreichte ein einzelnes Modell sowohl im SuperCLUE-Sprachtest als auch im OpenCompass-Multimodaltest Bestwerte. Auf dieser Kerntechnologie basierend entstand Nissin SenseNova 6.0 mit führender Fähigkeit im multimodalen Schlussfolgern. Anschließend wurde im Juli 2025 Nichiron SenseNova 6.5 veröffentlicht: Es realisiert eine frühe Fusion bereits auf der Encoderebene, verdreifacht die Kosten-Nutzen-Effizienz multimodaler Modelle und ist das erste kommerziell nutzbare Modell in China mit grafisch-textuellem Interleaving-Inferenzverfahren. SenseTime geht nun den nächsten Schritt: Die traditionelle modulare Struktur wird vollständig aufgegeben, und ausgehend von den Grundprinzipien wird die NEO-Nativarchitektur von Grund auf neu entwickelt.
Drei Kerninnovationen ermöglichen eine tiefe Einheit von Sehen und Sprache
Die NEO-Architektur basiert auf den Kernkonzepten höchster Effizienz und tiefer Integration und verfügt durch zugrundeliegende Innovationen in drei zentralen Dimensionen – Aufmerksamkeitsmechanismus, Positions-Codierung und semantische Abbildung – natürlicherweise über die Fähigkeit, sowohl visuelle als auch sprachliche Informationen einheitlich zu verarbeiten.
Native Patch-Embedding: Verzichtet auf diskrete Bild-Tokenisierer und erstellt mithilfe einer einzigartigen Patch-Embedding-Schicht (PEL) eine kontinuierliche Abbildung von Pixeln zu Wörtern von unten nach oben. Dieses Design erfasst Bilddetails feiner und durchbricht grundlegend die Engpässe der Bildmodellierung bei gängigen Modellen.
Native RoPE: trennt auf innovative Weise die dreidimensionale räumlich-zeitliche Frequenzzuweisung und nutzt hohe Frequenzen in der visuellen Dimension sowie niedrige Frequenzen in der textlichen Dimension – eine perfekte Anpassung an die natürliche Struktur beider Modalitäten. Dadurch kann NEO nicht nur die räumliche Struktur von Bildern präzise erfassen, sondern bietet zudem das Potenzial für eine nahtlose Erweiterung auf komplexe Szenen wie Videoverarbeitung und Quer-Rahmen-Modellierung.
Native Multi-Head-Attention: Angesichts der Eigenschaften unterschiedlicher Modalitäten implementiert NEO innerhalb eines einheitlichen Rahmens sowohl autoregressive Aufmerksamkeit für Text-Token als auch bidirektionale Aufmerksamkeit für visuelle Token. Dieses Design steigert die Ausnutzung der räumlichen Strukturkorrelation im Modell erheblich und unterstützt damit besser ein komplexes, gemischt grafisch-textliches Verständnis und Schließen.
Zusätzlich kann NEO mithilfe der innovativen zweistufigen Fusionstrainingsstrategie Pre-Buffer&Post-LLM die vollständige sprachliche Schlussfolgerungsfähigkeit des ursprünglichen LLM aufnehmen und gleichzeitig eine leistungsstarke visuelle Wahrnehmungsfähigkeit von Grund auf aufbauen, wodurch das Problem der Beeinträchtigung der Sprachfähigkeit bei herkömmlichem multimodalem Training vollständig gelöst wird.
Getestete Leistung: Ein Zehntel der Daten wird zur Bewertung einer Flaggschiff-Leistung verwendet
Angetrieben durch architektonische Innovation hat NEO erstaunliche Daten-Effizienz und Leistungsvorteile unter Beweis gestellt: extrem hohe Daten-Effizienz – mit nur einem Zehntel des Datenvolumens branchenüblicher Modelle vergleichbarer Leistung (390 Millionen Bild-Text-Beispiele) entwickelt NEO erstklassige visuelle Wahrnehmungsfähigkeiten. Ohne auf umfangreiche Datensätze oder zusätzliche visuelle Encoder angewiesen zu sein, erreicht seine kompakte Architektur bei mehreren Aufgaben des visuellen Verstehens eine Leistung, die mit führenden modularen Flaggschiff-Modellen wie Qwen2-VL und InternVL3 mithält. Ausgezeichnete und ausgewogene Leistung – In mehreren öffentlichen, maßgeblichen Bewertungen wie MMMU, MMB, MMStar, SEED-I und POPE erzielte die NEO-Architektur hohe Punktzahlen und zeigte damit eine umfassende Leistung, die andere native VLMs übertrifft; sie realisiert wahrhaftig die „präzisionsverlustfreie“ native Architektur. Ultimative Kosteneffizienz bei der Schlussfolgerung – Insbesondere im Parameterbereich von 0,6 B bis 8 B bietet NEO klare Vorteile für den Einsatz am Edge. Es erreicht nicht nur einen doppelten Sprung in Genauigkeit und Effizienz, sondern senkt auch die Inferenzkosten deutlich und treibt so die „Kosteneffizienz“ der multimodalen visuellen Wahrnehmung an extreme.Open Source Co-Konstruktion
Der Aufbau der nächsten Generation von KI-Infrastrukturarchitekturen ist das „Gerüst“ des Modells; nur mit einem stabilen Gerüst lässt sich die Zukunft der multimodalen Technologie unterstützen.
Das Early-Fusion-Design der NEO-Architektur unterstützt beliebige Auflösungen und lange Bildeingaben und lässt sich nahtlos auf zukunftsweisende Bereiche wie Video und embodied intelligence erweitern, wodurch eine echte Fusion von unten nach oben und end-to-end erreicht wird. Aus Anwendungssicht bietet das end-to-end-„native Integration“-Design solide technische Unterstützung für den Einsatz in vielfältigen Szenarien wie robotergestützte embodied Interaktion, multimodale Reaktion intelligenter Endgeräte, Video-Verständnis, 3D-Interaktion und embodied intelligence.
Derzeit hat SenseTime zwei auf der NEO-Architektur basierende Spezifikationsmodelle, 2B und 9B, offiziell als Open-Source-Lösungen veröffentlicht, um Innovation und Anwendung in der Open-Source-Community im Bereich nativer multimodaler Architekturen zu fördern. SenseTime Technology erklärte, sich verpflichtet zu fühlen, NEO durch Open-Source-Zusammenarbeit und Szenario-Implementierung zu einer skalierbaren und wiederverwendbaren KI-Infrastruktur der nächsten Generation auszubauen, die breite industrielle Anwendung nativer multimodaler Technologie vom Labor aus voranzutreiben und den Aufbau von Industriestandards für native multimodale Technologien der nächsten Generation zu beschleunigen.

Über uns
Telefon: 0518-80236699
E-Mail: [email protected]
Adresse: Bezirk Haizhou, Stadt Lianyungang, Provinz Jiangsu
Plattform für Regierungsdienstleistungen des Ministeriums für Industrie und Informationstechnologie
Su ICP-Vorbereitung 2025211914
Sicherheitsnummer Su Gongwang 32070602010184
Technischer Support: Jiangsu Xiaola Technology Co., Ltd.
Facebook Facebook
Facebook
WhatsApp WhatsApp
WhatsApp