Todas las categorías

Pasar de la «fusión de datos» a una «arquitectura nativa»: SenseTime lanza la arquitectura NEO, redefiniendo el límite de rendimiento de los modelos multimodales

2026-09-18

SenseTime ha lanzado oficialmente y abierto el código fuente de su nueva arquitectura de modelo multimodal, NEO, desarrollada en colaboración con el S-Lab de la Universidad Tecnológica de Nanyang, sentando las bases para una nueva generación de arquitectura del modelo multimodal SenseNova.
Como la primera arquitectura multimodal nativa (Native VLM) disponible en la industria que logra una integración profunda, NEO rompe las limitaciones del paradigma tradicional «modular» desde sus principios fundamentales y diseña de forma innovadora para «nacer específicamente para lo multimodal». Mediante la integración profunda de múltiples modalidades a nivel de la arquitectura central, logra un avance integral en rendimiento, eficiencia y universalidad, redefine los límites de rendimiento de los modelos multimodales y marca la entrada oficial de la tecnología de inteligencia artificial multimodal en una nueva era de «arquitectura nativa».
Superando cuellos de botella, despidiéndose de los «parches» y abrazando lo «nativo»
Actualmente, los principales modelos multimodales de la industria siguen mayoritariamente el paradigma modular de «codificador visual + proyector + modelo de lenguaje». Este método de extensión basado en modelos de lenguaje grande (LLM) logra compatibilidad con entradas de imagen, pero sigue centrado fundamentalmente en el lenguaje, y la fusión entre imagen y lenguaje se limita únicamente al nivel de los datos. Este diseño «parcheado» no solo presenta baja eficiencia de aprendizaje, sino que también restringe la capacidad del modelo para procesar escenarios multimodales complejos, como la captura detallada de elementos visuales o la comprensión de estructuras espaciales complejas. La arquitectura SenseTime NEO nació precisamente para resolver este problema. Ya en la segunda mitad de 2024, Shangtang lideró en China la ruptura tecnológica en entrenamiento nativo de fusión multimodal, obteniendo resultados sobresalientes tanto en la evaluación lingüística SuperCLUE como en la evaluación multimodal OpenCompass con un único modelo; sobre esta tecnología central, desarrolló Nissin SenseNova 6.0, alcanzando capacidades líderes en razonamiento multimodal. Posteriormente, en julio de 2025, se lanzó Nichiron SenseNova 6.5, que implementó una fusión temprana a nivel de codificador, triplicó la relación costo-efectividad de los modelos multimodales y fue el primero en China en ofrecer inferencia comercial de texto e imágenes entrelazadas. SenseTime ha dado un paso más allá: abandonó por completo la estructura modular tradicional y, partiendo de principios fundamentales, lanzó la arquitectura nativa NEO, diseñada íntegramente desde cero.
Tres innovaciones fundamentales logran una profunda unidad entre visión y lenguaje
La arquitectura NEO se basa en los conceptos fundamentales de máxima eficiencia e integración profunda, y mediante innovaciones subyacentes en tres dimensiones clave —mecanismo de atención, codificación posicional y mapeo semántico—, el modelo adquiere de forma natural la capacidad de procesar tanto la visión como el lenguaje de manera unificada
Incrustación nativa de parches (Native Patch Embedding): abandona los tokenizadores de imágenes discretos y construye un mapeo continuo desde los píxeles hasta las palabras, de abajo hacia arriba, mediante una capa única de incrustación de parches (PEL). Este diseño permite capturar los detalles de la imagen con mayor precisión, superando fundamentalmente el cuello de botella del modelado de imágenes en los modelos predominantes.
RoPE nativo: desacopla de forma innovadora la asignación tridimensional de frecuencias espaciotemporales, utilizando frecuencias altas en la dimensión visual y frecuencias bajas en la dimensión textual, adaptándose perfectamente a la estructura natural de ambas modalidades. Esto no solo permite que NEO capture con precisión la estructura espacial de las imágenes, sino que también tiene potencial para extenderse sin interrupciones a escenarios complejos como el procesamiento de video y la modelización entre fotogramas.
Atención nativa de múltiples cabezas: En respuesta a las características de distintas modalidades, NEO implementa tanto atención autoregresiva para los tokens de texto como atención bidireccional para los tokens visuales dentro de un marco unificado. Este diseño mejora notablemente la utilización de la correlación de la estructura espacial en el modelo, apoyando así de manera más eficaz la comprensión y el razonamiento complejos de combinaciones gráfico-textuales.
Además, con la innovadora estrategia de entrenamiento por fusión en dos etapas Pre Buffer y Post LLM, NEO puede absorber la capacidad completa de razonamiento lingüístico del LLM original, al tiempo que construye desde cero una potente capacidad de percepción visual, resolviendo por completo el problema de la disminución de la capacidad lingüística en el entrenamiento tradicional cruzado entre modalidades.
Rendimiento probado: se utiliza una décima parte de los datos para evaluar un rendimiento de nivel insignia
Impulsado por una innovación arquitectónica, NEO ha demostrado una eficiencia de datos asombrosa y ventajas de rendimiento: eficiencia de datos extremadamente alta: con tan solo 1/10 del volumen de datos de modelos de rendimiento equivalente en la industria (390 millones de ejemplos de imágenes y textos), NEO puede desarrollar capacidades visuales de percepción de primer nivel. Sin depender de volúmenes masivos de datos ni de codificadores visuales adicionales, su arquitectura concisa iguala el desempeño de los principales modelos modulares de referencia, como Qwen2-VL e InternVL3, en múltiples tareas de comprensión visual. Rendimiento excelente y equilibrado: en diversas evaluaciones públicas y autorizadas —como MMMU, MMB, MMStar, SEED-I y POPE—, la arquitectura NEO ha obtenido puntuaciones elevadas, lo que demuestra un rendimiento integral superior al de otros VLM nativos, logrando realmente la "precisión sin pérdidas" propia de una arquitectura nativa. Rentabilidad definitiva en razonamiento: especialmente dentro del rango de parámetros de 0,6 B a 8 B, NEO presenta ventajas significativas para la implementación en dispositivos periféricos (edge). No solo consigue un doble avance en precisión y eficiencia, sino que también reduce considerablemente los costos de inferencia, impulsando la "rentabilidad" de la percepción visual multimodal hasta el extreme.Construcción colaborativa de código abierto
Construir la próxima generación de arquitectura de infraestructura de inteligencia artificial es el "esqueleto" del modelo; solo con un esqueleto sólido se puede respaldar el futuro de la tecnología multimodal.
El diseño de fusión temprana de la arquitectura NEO admite resoluciones arbitrarias y entradas de imagen largas, extendiéndose sin interrupciones a campos punteros como video e inteligencia corporizada, logrando una verdadera fusión de abajo hacia arriba y de extremo a extremo. Desde una perspectiva de aplicación, el diseño de "integración nativa" de extremo a extremo brinda soporte técnico sólido para aplicaciones en escenarios diversos, tales como interacción robótica corporizada, respuesta multimodal en terminales inteligentes, comprensión de video, interacción 3D e inteligencia corporizada.
Actualmente, SenseTime ha abierto oficialmente al público dos modelos de especificación basados en la arquitectura NEO: 2B y 9B, para impulsar la innovación y la aplicación en la comunidad de código abierto respecto a arquitecturas multimodales nativas. SenseTime Technology declaró que está comprometida con construir NEO como una infraestructura de IA de próxima generación escalable y reutilizable mediante la colaboración en código abierto y la implementación en escenarios reales, promoviendo así la aplicación industrial generalizada de la tecnología multimodal nativa desde el laboratorio y acelerando la creación de estándares industriales de nivel avanzado para tecnologías multimodales nativas de próxima generación.

Sobre nosotros
Teléfono: 0518-80236699
Correo electrónico: [email protected]
Dirección: Distrito Haizhou, Ciudad Lianyungang, Provincia de Jiangsu
Plataforma de Servicios Gubernamentales del Ministerio de Industria y Tecnologías de la Información
Preparación del ICP de Jiangsu n.º 2025211914
Número de Seguridad de la Red Pública de Jiangsu n.º 32070602010184
Soporte técnico: Jiangsu Xiaola Technology Co., Ltd.
Facebook Facebook
Facebook
WhatsApp WhatsApp
WhatsApp