すべてのカテゴリ

『データ融合』から『ネイティブアーキテクチャ』へ:センスタイムがNEOアーキテクチャを発表し、マルチモーダルモデルの性能限界を再定義

2026-09-18

センスタイム社は、南洋理工大学Sラボとの共同開発により新たに構築したマルチモーダルモデルアーキテクチャ「NEO」を正式にリリースし、オープンソース化しました。これにより、センスノヴァ・マルチモーダルモデルの次世代アーキテクチャ基盤が築かれました。
業界初の実用可能なネイティブ・マルチモーダルアーキテクチャ(ネイティブVLM)であるNEOは、従来の「モジュール型」パラダイムという根本的な制約から脱却し、「マルチモーダルのために生まれた」ことを前提とした革新的な設計を実現しています。複数のモダリティをコア・アーキテクチャレベルで深く統合することで、性能・効率性・汎用性のすべてにおいて飛躍的な進化を達成し、マルチモーダルモデルの性能限界を再定義しました。これは、人工知能におけるマルチモーダル技術が、いよいよ「ネイティブ・アーキテクチャ」の新時代へと本格的に突入したことを示す画期的な出来事です。
ボトルネックの突破――「寄せ集め」へのさようなら、「ネイティブ」への歩み
現在、業界における主流のマルチモーダルモデルの多くは、「視覚エンコーダ+プロジェクタ+言語モデル」というモジュール型のパラダイムを採用しています。この大規模言語モデル(LLM)に基づく拡張手法は画像入力との互換性を実現しますが、本質的には依然として言語に焦点を当てており、画像と言語の融合はデータレベルにとどまっています。このような「継ぎ足し」的な設計は、学習効率が低く、画像の細部の抽出や複雑な空間構造の理解など、高度なマルチモーダルシーンにおけるモデルの処理能力を制限するという課題を抱えています。この課題に対応するため、センスタイム社はNEOアーキテクチャを開発しました。すでに2024年下半期には、シャンタン社が中国で初めてマルチモーダルなネイティブ融合学習技術を実現し、単一モデルでSuperCLUE言語評価およびOpenCompassマルチモーダル評価においてトップクラスの成績を収めました。このコア技術を基盤として、ニッシン・センスノヴァ6.0が開発され、マルチモーダル推論分野で業界をリードする性能を達成しました。その後、2025年7月にはニチロン・センスノヴァ6.5がリリースされ、エンコーダレベルでの早期融合を実現、マルチモーダルモデルのコストパフォーマンスを3倍に向上させ、中国初の商用レベルの画像とテキストの交互推論機能を提供しました。センスタイム社はさらに一歩進み、従来のモジュール型構造を完全に廃棄し、根本原理から出発して、ゼロベースで設計されたNEOネイティブアーキテクチャを新たに発表しました。
視覚と言語の深層的な統合を実現する3つのコアイノベーション
NEOアーキテクチャは、「究極の効率性」と「深層的統合」を核とする概念に基づき、アテンション機構、位置エンコーディング、意味マッピングという3つのキーディメンションにおいて基盤的なイノベーションを遂げることで、視覚情報と言語情報を自然に統一的に処理できる能力をモデルに内在させます。
ネイティブ・パッチ埋め込み:従来の離散型画像トークナイザーを廃棄し、独自のパッチ埋め込み層(PEL)を用いて、画素から単語へと、下位から上位へと連続的なマッピングを構築します。この設計により、画像のディテールをより精緻に捉えることが可能となり、主流モデルにおける画像モデリングのボトルネックを根本的に突破します。
ネイティブRoPE:3次元の時空間周波数配分を革新的に分離し、視覚的次元には高周波、言語的次元には低周波をそれぞれ適用することで、両モダリティの自然な構造に最適に適合します。これにより、NEOは画像の空間構造を正確に捉えるだけでなく、動画処理やフレーム間モデリングといった複雑なシーンへのシームレスな拡張も可能になります。
ネイティブマルチヘッドアテンション:異なるモダリティの特性に対応して、NEOはテキストトークン向けに自己回帰型アテンションを、視覚トークン向けに双方向アテンションを、統一されたフレームワーク内で実装しています。この設計により、モデルにおける空間構造相関の活用効率が大幅に向上し、複雑な図・文混在理解および推論をよりよく支援します。
さらに、革新的な「プリバッファ&ポストLLM」の2段階融合学習戦略により、NEOは従来のLLMが持つ完全な言語推論能力を吸収しつつ、視覚認識能力をゼロから強力に構築します。これにより、従来のマルチモーダル学習で生じる言語能力の低下という課題を完全に解決します。
評価性能:フラッグシップレベルの性能を検証するため、データの10分の1を用いてテスト
アーキテクチャの革新によって駆動されるNEOは、驚異的なデータ効率性と優れた性能を実証しています。極めて高いデータ効率性:業界で同等の性能を発揮するモデル(3億9,000万件の画像・テキスト例)と比較して、わずか1/10のデータ量で、トップクラスの視覚認識能力を獲得します。大量の学習データや追加の視覚エンコーダーに依存することなく、その簡潔なアーキテクチャは、Qwen2-VLやInternVL3などの先進的なモジュール型フラッグシップモデルと、複数の視覚理解タスクにおいて同等の性能を達成します。優れたバランスの取れた性能:MMMU、MMB、MMStar、SEED-I、POPEなど、複数の公開・権威あるベンチマーク評価において、NEOアーキテクチャは高得点を記録し、他のネイティブVLM(ビジョン・ランゲージ・モデル)を上回る包括的な性能を示しています。これはまさに、ネイティブアーキテクチャによる「精度損失ゼロ」の実現です。究極の推論コストパフォーマンス:特に0.6B~8Bのパラメータ範囲において、NEOはエッジデプロイメントに際して顕著な優位性を発揮します。精度と効率の両面で飛躍的な向上を果たすだけでなく、推論コストを大幅に削減し、マルチモーダル視覚認識の「コストパフォーマンス」を新たな高みへと押し上げています。 extreme.オープンソースによる共同構築
次世代AIインフラストラクチャのアーキテクチャを構築することは、モデルの「骨格」を形成することであり、この堅固な骨格があってこそ、今後のマルチモーダル技術の発展を支えることができる。
NEOアーキテクチャの初期融合設計は、任意の解像度および長尺画像入力に対応し、動画や具現知能(エンボディド・インテリジェンス)といった最先端分野へシームレスに拡張可能である。これにより、下位層から上位層まで、エンドツーエンドにわたる真の融合が実現される。アプリケーション観点からは、エンドツーエンドの「ネイティブ統合」設計が、ロボットによる具現インタラクション、スマート端末におけるマルチモーダル応答、動画理解、3Dインタラクション、具現知能など、多様な活用シーンに堅牢な技術的基盤を提供する。
現在、センスタイム社は、ネイティブなマルチモーダルアーキテクチャにおけるオープンソースコミュニティのイノベーションと応用を促進するため、NEOアーキテクチャに基づく2つの仕様モデル(2Bおよび9B)を公式にオープンソース化しました。センスタイム・テクノロジー社は、オープンソースによる協働および実際の活用シーンへの展開を通じて、NEOをスケーラブルかつ再利用可能な次世代AI基盤へと育て上げることを目標としており、実験室レベルから産業界へのネイティブ・マルチモーダル技術の広範な適用を推進するとともに、次世代の産業レベルにおけるネイティブ・マルチモーダル技術標準の構築を加速させています。

当社について
電話番号:0518-8023-6699
メールアドレス:[email protected]
住所:江蘇省連雲港市海州区
工業和信息化部政府サービスプラットフォーム
蘇ICP備2025211914号
蘇公安網安備32070602010184号
技術支援:江蘇小啦科技有限公司
Facebook Facebook
Facebook
WhatsApp WhatsApp
WhatsApp