Todas as Categorias

Mudança da "fusão de dados" para "arquitetura nativa": a SenseTime lança a arquitetura NEO, redefinindo o limite de desempenho dos modelos multimodais.

2026-09-18

A SenseTime lançou oficialmente e disponibilizou como código aberto sua nova arquitetura de modelo multimodal, NEO, desenvolvida em colaboração com o S-Lab da Universidade Tecnológica de Nanyang, estabelecendo as bases para uma nova geração de arquitetura para o modelo multimodal SenseNova.
Como a primeira arquitetura multimodal nativa (Native VLM) disponível no setor que alcança integração profunda, a NEO rompe as limitações do paradigma tradicional "modular" já nos princípios fundamentais e projeta inovadoramente para "nascer especificamente para multimodalidade". Por meio da integração profunda de múltiplas modalidades ao nível da arquitetura central, ela atinge um avanço abrangente em desempenho, eficiência e universalidade, redefine os limites de desempenho dos modelos multimodais e marca a entrada oficial da tecnologia multimodal de inteligência artificial em uma nova era de "arquitetura nativa".
Superando gargalos, dizendo adeus ao 'remendo' e adotando a 'natividade'
Atualmente, os principais modelos multimodais da indústria seguem, na sua maioria, o paradigma modular de «codificador visual + projetor + modelo de linguagem». Esse método de extensão baseado em modelos de linguagem de grande porte (LLM) permite compatibilidade com entradas de imagem, mas continua, fundamentalmente, centrado na linguagem, e a fusão entre imagens e linguagem permanece apenas ao nível dos dados. Esse design «pontilhado» não só apresenta baixa eficiência de aprendizagem, como também limita a capacidade do modelo para lidar com cenários multimodais complexos, tais como a captura de detalhes visuais ou a compreensão de estruturas espaciais elaboradas. A arquitetura SenseTime NEO foi desenvolvida especificamente para resolver esse problema. Já na segunda metade de 2024, a Shangtang liderou, na China, a inovação em tecnologia de treinamento nativo de fusão multimodal, obtendo resultados superiores nas avaliações linguísticas SuperCLUE e nas avaliações multimodais OpenCompass com um único modelo; com base nessa tecnologia central, criou-se o Nissin SenseNova 6.0, alcançando capacidades líderes em raciocínio multimodal. Posteriormente, em julho de 2025, foi lançado o Nichiron SenseNova 6.5, que implementou fusão precoce ao nível do codificador, triplicou a relação custo-eficácia dos modelos multimodais e foi o primeiro, na China, a oferecer inferência comercial de alto desempenho com intercalação gráfico-textual. A SenseTime deu um passo adiante ao abandonar totalmente a estrutura modular tradicional e, partindo dos princípios fundamentais, lançou a arquitetura nativa NEO, concebida integralmente desde a origem.
Três inovações fundamentais alcançam uma profunda unidade entre visão e linguagem
A arquitetura NEO baseia-se nos conceitos fundamentais de eficiência máxima e integração profunda, e, por meio de inovações subjacentes em três dimensões-chave — mecanismo de atenção, codificação posicional e mapeamento semântico — o modelo possui naturalmente a capacidade de lidar com visão e linguagem de forma unificada
Incorporação Nativa de Patches: abandona os tokenizadores de imagens discretos e constrói um mapeamento contínuo de pixels para palavras, de baixo para cima, por meio de uma camada exclusiva de incorporação de patches (PEL). Esse design consegue capturar detalhes da imagem com maior precisão, rompendo fundamentalmente o gargalo da modelagem de imagens em modelos predominantes.
RoPE Nativo: desacopla inovadoramente a alocação tridimensional de frequência espacial e temporal, utilizando altas frequências na dimensão visual e baixas frequências na dimensão textual, adaptando-se perfeitamente à estrutura natural de ambas as modalidades. Isso não só permite que o NEO capture com precisão a estrutura espacial das imagens, mas também possui potencial para se estender sem interrupções a cenários complexos, como processamento de vídeo e modelagem entre quadros.
Atenção Multicabeça Nativa: Em resposta às características de diferentes modalidades, o NEO implementou, dentro de um quadro unificado, tanto atenção autoregressiva para tokens textuais quanto atenção bidirecional para tokens visuais. Esse projeto aumenta significativamente a utilização da correlação da estrutura espacial no modelo, apoiando assim melhor a compreensão e o raciocínio complexos entre gráficos e texto.
Além disso, com a inovadora estratégia de treinamento em duas etapas de fusão Pré-Buffer e Pós-LLM, o NEO pode absorver integralmente a capacidade de raciocínio linguístico do LLM original, ao mesmo tempo que constrói, do zero, uma poderosa capacidade de percepção visual, resolvendo completamente o problema da deterioração da capacidade linguística no treinamento tradicional entre modos.
Desempenho testado: Um décimo dos dados é utilizado para avaliar o desempenho de nível bandeira
Impulsionado pela inovação arquitetural, o NEO demonstrou uma eficiência de dados e vantagens de desempenho surpreendentes: eficiência de dados extremamente elevada — com apenas 1/10 do volume de dados de modelos de desempenho equivalente no setor (390 milhões de exemplos de pares imagem-texto), o NEO consegue desenvolver capacidades de percepção visual de ponta. Sem depender de grandes volumes de dados nem de codificadores visuais adicionais, sua arquitetura concisa iguala modelos modulares de referência, como o Qwen2-VL e o InternVL3, em múltiplas tarefas de compreensão visual. Desempenho excelente e equilibrado — em diversas avaliações públicas e autorizadas, como MMMU, MMB, MMStar, SEED-I e POPE, a arquitetura NEO obteve altas pontuações, evidenciando um desempenho abrangente superior ao de outros VLMs nativos, concretizando verdadeiramente a "precisão sem perdas" da arquitetura nativa. Custo-efetividade máxima no raciocínio — especialmente na faixa de parâmetros de 0,6 B a 8 B, o NEO apresenta vantagens significativas para implantação em dispositivos de borda. Ele não só alcança um duplo salto em precisão e eficiência, mas também reduz substancialmente os custos de inferência, impulsionando a "custo-efetividade" da percepção visual multimodal ao extreme.Construção colaborativa de código aberto
Construir a próxima geração de arquitetura de infraestrutura de IA é o "esqueleto" do modelo, e somente com um esqueleto sólido é possível suportar o futuro da tecnologia multimodal.
O design de fusão precoce da arquitetura NEO suporta resoluções arbitrárias e entradas de imagens longas, estendendo-se perfeitamente a áreas de ponta, como vídeo e inteligência incorporada, alcançando uma verdadeira fusão de baixo para cima e de ponta a ponta. Do ponto de vista de aplicação, o design de "integração nativa" de ponta a ponta fornece suporte técnico sólido para aplicações em cenários diversos, tais como interação robótica incorporada, resposta multimodal em terminais inteligentes, compreensão de vídeo, interação 3D e inteligência incorporada.
Atualmente, a SenseTime abriu oficialmente o código-fonte de dois modelos de especificação baseados na arquitetura NEO, os modelos 2B e 9B, para impulsionar a inovação e a aplicação na comunidade de código aberto em arquiteturas multimodais nativas. A SenseTime Technology afirmou que está comprometida em transformar o NEO numa infraestrutura de IA de próxima geração escalável e reutilizável, por meio da colaboração em código aberto e da implementação em cenários práticos, promovendo a aplicação industrial generalizada da tecnologia multimodal nativa desde o laboratório e acelerando a construção de padrões industriais de próxima geração para essa tecnologia.

Sobre nós
Telefone: 0518-80236699
E-mail: [email protected]
Endereço: Distrito de Haizhou, Cidade de Lianyungang, Província de Jiangsu
Plataforma de Serviços Governamentais do Ministério da Indústria e Tecnologia da Informação
Preparação ICP de Jiangsu nº 2025211914
Número de Segurança da Rede Pública de Jiangsu nº 32070602010184
Suporte Técnico: Jiangsu Xiaola Technology Co., Ltd
Facebook Facebook
Facebook
WhatsApp WhatsApp
WhatsApp