Компания SenseTime официально выпустила и открыла исходный код своей новой мультимодальной архитектуры модели NEO, разработанной совместно с лабораторией S-Lab Наньянского технологического университета, заложив основу для нового поколения архитектуры мультимодальной модели SenseNova.
Будучи первой в отрасли доступной нативной мультимодальной архитектурой (Native VLM), обеспечивающей глубокую интеграцию, NEO снимает ограничения традиционной «модульной» парадигмы на фундаментальном уровне и инновационно проектируется как архитектура, изначально созданная специально для мультимодальности. Благодаря глубокой интеграции нескольких модальностей на уровне базовой архитектуры она обеспечивает всесторонний прорыв в производительности, эффективности и универсальности, переопределяет границы производительности мультимодальных моделей и знаменует официальное начало новой эпохи «нативных архитектур» в области мультимодальных технологий искусственного интеллекта.
Преодоление узких мест, прощание с «латанием», принятие «нативного подхода»
В настоящее время основные мультимодальные модели в отрасли в основном следуют модульной парадигме «визуальный энкодер + проектор + языковая модель». Такой метод расширения на основе большой языковой модели (LLM) обеспечивает совместимость с вводом изображений, однако по своей сути по-прежнему ориентирован на язык, а слияние изображений и языка остаётся лишь на уровне данных. Такой «заплаточный» дизайн не только характеризуется низкой эффективностью обучения, но и ограничивает способность модели обрабатывать сложные мультимодальные сцены — например, требующие точного захвата деталей изображения или понимания сложных пространственных структур. Архитектура SenseTime NEO была создана специально для решения этой проблемы. Уже во второй половине 2024 года компания Shangtang первой в Китае добилась прорыва в технологии нативного мультимодального слияния при обучении, получив высокие оценки в тестах SuperCLUE (языковая оценка) и OpenCompass (мультимодальная оценка) с использованием одной и той же модели; на основе этой ключевой технологии была разработана модель Nissin SenseNova 6.0, продемонстрировавшая передовые возможности в мультимодальном рассуждении. Затем, в июле 2025 года, вышла модель Nichiron SenseNova 6.5, реализовавшая раннее слияние уже на уровне энкодера, повысившую рентабельность мультимодальных моделей в три раза и ставшую первой в Китае коммерческой системой, поддерживающей чередование графики и текста при выводе. Компания SenseTime сделала следующий шаг: полностью отказавшись от традиционной модульной структуры и начав с базовых принципов, она представила с нуля разработанную нативную архитектуру NEO.
Три ключевых инновации обеспечивают глубокое единство восприятия и языка
Архитектура NEO основана на ключевых принципах максимальной эффективности и глубокой интеграции и за счёт базовых инноваций в трёх ключевых измерениях — механизме внимания, позиционном кодировании и семантическом отображении — модель естественным образом обладает способностью единообразно обрабатывать как визуальные данные, так и язык
Родная встраиваемая «заплатка» (Native Patch Embedding): отказ от дискретных токенизаторов изображений и построение непрерывного отображения от пикселей к словам «снизу вверх» посредством уникального слоя встраивания заплаток (PEL). Такой подход позволяет более точно захватывать детали изображения, принципиально преодолевая узкое место моделирования изображений в современных моделях.
Родной RoPE: инновационно разделяет трёхмерное пространственно-временное распределение частот, используя высокие частоты в визуальном измерении и низкие — в текстовом, что идеально соответствует естественной структуре обоих модальностей. Это позволяет NEO точно воспроизводить пространственную структуру изображений и открывает возможность бесшовного расширения на сложные сценарии, такие как обработка видео и кадр-кадровое моделирование.
Родное многоголовое внимание: учитывая особенности разных модальностей, NEO реализует как автогрессивное внимание для текстовых токенов, так и двунаправленное внимание для визуальных токенов в рамках единой архитектуры. Такой подход значительно повышает эффективность использования корреляций пространственной структуры в модели и тем самым лучше поддерживает сложное смешанное понимание и логические рассуждения на основе графики и текста.
Кроме того, благодаря инновационной двухэтапной стратегии обучения с объединением на этапах предварительного буферизации и последующей обработки с помощью языковой модели (Pre Buffer & Post LLM), модель NEO способна усваивать полную способность к языковому рассуждению исходной языковой модели (LLM), одновременно создавая мощные визуальные восприимчивые способности «с нуля», полностью решая проблему ослабления языковых возможностей при традиционном межмодальном обучении.
Проверенные показатели производительности: одна десятая часть данных используется для оценки производительности на уровне флагманских решений
Благодаря инновациям в архитектуре модель NEO продемонстрировала поразительную эффективность обработки данных и значительные преимущества в производительности: чрезвычайно высокая эффективность использования данных — при объёме данных всего в 1/10 по сравнению с моделями аналогичного уровня в отрасли (390 млн примеров изображение–текст) NEO способна развить превосходные возможности визуального восприятия. Не полагаясь на массивные наборы данных и дополнительные визуальные энкодеры, её лаконичная архитектура достигает результатов, сопоставимых с топовыми модульными флагманскими моделями, такими как Qwen2-VL и InternVL3, в ряде задач визуального понимания. Отличная и сбалансированная производительность — в нескольких публичных авторитетных оценках, включая MMMU, MMB, MMStar, SEED-I, POPE и др., архитектура NEO показала высокие баллы, подтвердив всестороннюю производительность, превосходящую другие нативные VLM, и фактически реализовав «точное безпотерянное» функционирование нативной архитектуры. Максимальная рентабельность рассуждений — особенно в диапазоне параметров от 0,6 млрд до 8 млрд параметров NEO обладает существенными преимуществами при развертывании на периферийных устройствах. Она обеспечивает двойной скачок как в точности, так и в эффективности, а также значительно снижает затраты на вывод, доводя «рентабельность» мультимодального визуального восприятия до extreme.Открытая совместная разработка
Создание архитектуры ИИ-инфраструктуры следующего поколения — это «скелет» модели; только прочный скелет способен поддерживать будущее мультимодальных технологий.
Раннее объединение в архитектуре NEO поддерживает изображения произвольного разрешения и большой длины, плавно расширяясь на передовые области, такие как видео и воплощённый интеллект, обеспечивая подлинное объединение «от основания до вершины» и сквозное (end-to-end). С точки зрения применения сквозной дизайн «родной интеграции» предоставляет надёжную техническую поддержку для применения в разнообразных сценариях: взаимодействие роботов в физическом мире, мультимодальные ответы на интеллектуальных терминалах, понимание видео, трёхмерное взаимодействие и воплощённый интеллект.
В настоящее время SenseTime официально открыла исходные коды двух моделей архитектуры NEO — 2B и 9B — с целью стимулирования инноваций и применения в сообществе открытого программного обеспечения в области нативных мультимодальных архитектур. Компания SenseTime Technology заявила, что стремится превратить NEO в масштабируемую и многократно используемую ИИ-инфраструктуру нового поколения посредством сотрудничества в рамках открытых исходных кодов и внедрения в конкретных сценариях, способствуя широкому промышленному применению нативных мультимодальных технологий, начиная с лабораторных разработок, а также ускоряя создание промышленных стандартов нативных мультимодальных технологий нового поколения.