Toutes les catégories

Passer de la « fusion de données » à une « architecture native » : SenseTime lance l’architecture NEO, redéfinissant les limites de performance des modèles multimodaux

2026-09-18

SenseTime a officiellement publié et ouvert la source de sa nouvelle architecture de modèle multimodal, NEO, développée en collaboration avec le S-Lab de l’Université technologique de Nanyang, posant ainsi les fondations d’une nouvelle génération d’architecture pour le modèle multimodal SenseNova.
En tant que première architecture multimodale native (Native VLM) disponible dans le secteur à réaliser une intégration approfondie, NEO rompt les contraintes du paradigme traditionnel « modulaire » dès ses principes fondamentaux et conçoit de façon innovante une architecture « née spécifiquement pour le multimodal ». Grâce à l’intégration approfondie de multiples modalités au niveau même de l’architecture centrale, elle réalise une percée globale en matière de performance, d’efficacité et d’universalité, redéfinit les limites de performance des modèles multimodaux et marque l’entrée officielle de la technologie d’intelligence artificielle multimodale dans une nouvelle ère de « l’architecture native ».
Franchir les goulots d’étranglement, dire adieu aux solutions « bricolées », adopter l’approche « native »
Actuellement, les principaux modèles multimodaux de l’industrie suivent majoritairement le paradigme modulaire « encodeur visuel + projecteur + modèle de langage ». Cette méthode d’extension fondée sur les grands modèles de langage (LLM) permet une compatibilité avec les entrées d’images, mais reste fondamentalement centrée sur le langage, et la fusion entre images et langage ne s’opère qu’au niveau des données. Cette conception « à la manière d’un ravaudage » présente non seulement une faible efficacité d’apprentissage, mais limite également la capacité du modèle à traiter des scénarios multimodaux complexes, tels que la capture fine des détails d’une image ou la compréhension approfondie de structures spatiales complexes. L’architecture SenseTime NEO a été conçue précisément pour résoudre ce problème critique. Dès la seconde moitié de 2024, Shangtang a été le premier acteur en Chine à franchir une percée décisive dans la technologie d’entraînement natif de fusion multimodale, remportant à la fois l’évaluation linguistique SuperCLUE et l’évaluation multimodale OpenCompass avec un seul modèle ; sur la base de cette technologie fondamentale, elle a ensuite développé Nissin SenseNova 6.0, atteignant ainsi une capacité de raisonnement multimodal de pointe. Par la suite, en juillet 2025, Nichiron SenseNova 6.5 a été lancé : il réalise une fusion précoce au niveau de l’encodeur, triple l’efficacité-coût des modèles multimodaux et constitue la première solution chinoise offrant une inférence commerciale de qualité supérieure combinant graphiques et texte. SenseTime franchit désormais une nouvelle étape en abandonnant totalement la structure modulaire traditionnelle et en repartant des principes fondamentaux pour concevoir, dès l’origine, l’architecture native NEO.
Trois innovations fondamentales permettent une intégration profonde de la vision et du langage
L’architecture NEO repose sur les concepts fondamentaux d’efficacité optimale et d’intégration approfondie, et grâce à des innovations sous-jacentes dans trois dimensions clés — le mécanisme d’attention, le codage de position et la cartographie sémantique — le modèle possède naturellement la capacité de traiter de façon unifiée à la fois la vision et le langage
Intégration native de « patches » : abandonne les tokeniseurs d’images discrets et construit, du pixel au mot, une correspondance continue via une couche d’intégration de « patches » (PEL) unique. Cette conception permet de capturer les détails d’image avec une finesse accrue, brisant ainsi fondamentalement le goulot d’étranglement de la modélisation d’images dans les modèles dominants.
RoPE natif : découple de façon innovante l’allocation tridimensionnelle des fréquences spatio-temporelles, en utilisant des hautes fréquences dans la dimension visuelle et des basses fréquences dans la dimension textuelle, s’adaptant ainsi parfaitement à la structure naturelle des deux modalités. Cela permet non seulement à NEO de capturer avec précision la structure spatiale des images, mais ouvre aussi la voie à une extension fluide vers des scénarios complexes tels que le traitement vidéo et la modélisation inter-cadres.
Attention multi-têtes native : en réponse aux caractéristiques propres à chaque modalité, NEO implémente, au sein d’un cadre unifié, à la fois une attention autorgressive pour les jetons textuels et une attention bidirectionnelle pour les jetons visuels. Cette conception améliore considérablement l’exploitation des corrélations de structure spatiale au sein du modèle, renforçant ainsi de façon optimale la compréhension et le raisonnement hybrides, graphique et textuel.
En outre, grâce à la stratégie innovante d’entraînement par fusion en deux étapes Pré Tampon & Post LLM, NEO peut intégrer l’intégralité des capacités de raisonnement linguistique du LLM d’origine tout en développant, à partir de zéro, une puissante capacité de perception visuelle, résolvant ainsi totalement le problème de dégradation des capacités linguistiques dans l’entraînement traditionnel multivocal.
Performance testée : Un dixième des données est utilisé pour évaluer une performance de niveau phare
Porté par une innovation architecturale, NEO a démontré une efficacité remarquable en matière de données et des avantages exceptionnels en termes de performances : une efficacité extrêmement élevée en matière de données — avec seulement un dixième du volume de données requis par des modèles concurrents offrant des performances comparables (390 millions d’exemples d’images accompagnées de texte), NEO développe des capacités de perception visuelle de premier ordre. Sans dépendre de jeux de données massifs ni d’encodeurs visuels supplémentaires, son architecture épurée égale les modèles modulaires phares tels que Qwen2-VL et InternVL3 sur plusieurs tâches de compréhension visuelle. Des performances excellentes et équilibrées : dans plusieurs évaluations publiques reconnues comme fiables (MMMU, MMB, MMStar, SEED-I, POPE, etc.), l’architecture NEO obtient des scores élevés, prouvant une performance globale supérieure à celle d’autres VLM natifs, concrétisant véritablement la « précision sans perte » propre à une architecture native. Un rapport coût-efficacité optimal en raisonnement : notamment dans la fourchette de paramètres allant de 0,6 milliard à 8 milliards, NEO présente des avantages significatifs pour le déploiement embarqué. Il réalise non seulement un double bond en précision et en efficacité, mais réduit aussi fortement les coûts d’inférence, portant ainsi le « rapport coût-efficacité » de la perception visuelle multimodale à son extreme.Coconstruction ouverte
Construire l’architecture des infrastructures d’intelligence artificielle de prochaine génération constitue le « squelette » du modèle ; seul un squelette solide peut soutenir l’avenir de la technologie multimodale.
La conception à fusion précoce de l’architecture NEO prend en charge des résolutions arbitraires et des entrées d’images longues, s’étendant sans heurt vers des domaines de pointe tels que la vidéo et l’intelligence incarnée, permettant ainsi une fusion véritable, de la base au sommet et de bout en bout. Du point de vue des applications, la conception « d’intégration native » de bout en bout fournit un soutien technique solide pour l’application dans des scénarios variés, tels que l’interaction incarnée avec les robots, la réponse multimodale sur les terminaux intelligents, la compréhension vidéo, l’interaction 3D et l’intelligence incarnée.
Actuellement, SenseTime a officiellement rendu open source deux modèles de spécification basés sur l’architecture NEO, les modèles 2B et 9B, afin de favoriser l’innovation et l’application au sein de la communauté open source en matière d’architecture native multimodale. SenseTime Technology a déclaré qu’elle s’engage à faire de NEO une infrastructure IA de nouvelle génération évolutive et réutilisable, grâce à la collaboration open source et à la mise en œuvre dans des scénarios concrets, à promouvoir l’application industrielle généralisée de la technologie native multimodale depuis le laboratoire, et à accélérer l’élaboration de normes industrielles de nouvelle génération pour cette technologie native multimodale.

À propos de nous
Téléphone : 0518-80236699
Courriel : [email protected]
Adresse : District de Haizhou, ville de Lianyungang, province du Jiangsu
Plateforme gouvernementale de services du Ministère de l’Industrie et des Technologies de l’information
Préparation ICP du Jiangsu n° 2025211914
Numéro de sécurité du réseau public du Jiangsu n° 32070602010184
Assistance technique : Jiangsu Xiaola Technology Co., Ltd
Facebook Facebook
Facebook
WhatsApp WhatsApp
WhatsApp