센스타임은 난양 기술 대학교 S-랩과 협력하여 개발한 새로운 멀티모달 모델 아키텍처 네오(NEO)를 공식 출시하고 오픈소스화했다. 이는 센스노바(SenseNova) 멀티모달 모델을 위한 차세대 아키텍처의 초석을 마련한다.
산업계 최초로 실용화 가능한 토착 멀티모달 아키텍처(네이티브 VLM)인 네오는 전통적인 ‘모듈식’ 패러다임의 구조적 제약을 근본부터 타파하며, ‘멀티모달을 위해 태어난’ 것을 목표로 혁신적으로 설계되었다. 핵심 아키텍처 수준에서 다양한 모달리티를 심층 통합함으로써 성능, 효율성, 범용성 전반에 걸쳐 획기적인 돌파구를 마련했으며, 멀티모달 모델의 성능 한계를 재정의하고, 인공지능 멀티모달 기술이 ‘토착 아키텍처’ 시대로 본격 진입했음을 알리는 계기가 되었다.
병목 현상 극복, ‘패치워크’ 작별, ‘토착성’ 수용
현재 산업계의 주류 멀티모달 모델은 대부분 ‘비전 인코더 + 프로젝터 + 언어 모델’이라는 모듈식 패러다임을 따르고 있다. 대규모 언어 모델(LLM) 기반의 이 확장 방식은 이미지 입력과의 호환성을 달성하지만, 근본적으로 여전히 언어에 초점을 맞추고 있으며, 이미지와 언어의 융합은 단순히 데이터 수준에 머문다. 이러한 ‘패치워크’ 설계는 학습 효율이 낮을 뿐 아니라, 이미지 세부 정보 포착이나 복잡한 공간 구조 이해와 같은 고난도 멀티모달 상황에서 모델의 처리 능력을 제한한다. 센스타임(SENSE TIME)의 NEO 아키텍처는 바로 이 문제를 해결하기 위해 탄생하였다. 2024년 하반기부터 상탕(Shangtang)은 중국 내 최초로 멀티모달 네이티브 융합 훈련 기술을 돌파하였으며, 단일 모델로 슈퍼클루(SuperCLUE) 언어 평가 및 오픈컴패스(OpenCompass) 멀티모달 평가에서 모두 우수한 성적을 거두었다. 이를 바탕으로 니신 센스노바(SenseNova) 6.0을 개발하여 멀티모달 추론 분야에서 선도적인 역량을 확보하였다. 이후 2025년 7월, 니치론 센스노바(SenseNova) 6.5가 출시되었는데, 이는 인코더 수준에서 조기 융합(Early Fusion)을 실현하고, 멀티모달 모델의 비용 대비 성능을 3배 향상시켰으며, 중국 최초로 상용 수준의 그래픽-텍스트 교차 추론(Graphic-Text Interleaving Inference)을 도입하였다. 센스타임은 전통적인 모듈식 구조를 완전히 버리고, 근본 원리부터 재정립하여 처음부터 설계된 NEO 네이티브 아키텍처를 공식 출시함으로써 한 차원 더 진화하였다.
세 가지 핵심 혁신이 시각과 언어의 심층적 통합을 실현한다
NEO 아키텍처는 최고 수준의 효율성과 심층적 통합이라는 핵심 개념을 기반으로 하며, 주의 메커니즘, 위치 인코딩, 의미 매핑이라는 세 가지 핵심 차원에서 기반 기술을 혁신함으로써, 모델이 시각 정보와 언어 정보를 본능적으로 통합적으로 처리할 수 있는 능력을 자연스럽게 갖추게 된다
네이티브 패치 임베딩: 이산형 이미지 토크나이저를 버리고, 독자적인 패치 임베딩 레이어(PEL)를 통해 픽셀에서 단어에 이르는 연속적 매핑을 하위에서 상위로 구성한다. 이 설계는 이미지 세부 정보를 보다 정밀하게 포착할 수 있으며, 주류 모델에서 이미지 모델링에 존재하던 병목 현상을 근본적으로 타파한다
네이티브 로프(Native RoPE): 3차원 시공간 주파수 할당을 혁신적으로 분리하여, 시각 차원에는 고주파를, 텍스트 차원에는 저주파를 사용함으로써 두 모달리티의 자연스러운 구조에 완벽하게 적응한다. 이를 통해 NEO는 이미지의 공간 구조를 정확히 포착할 뿐만 아니라, 영상 처리 및 프레임 간 모델링과 같은 복잡한 장면으로도 매끄럽게 확장될 잠재력을 지닌다.
네이티브 멀티 헤드 어텐션(Native Multi Head Attention): 다양한 모달리티의 특성에 대응하기 위해, NEO는 단일 통합 프레임워크 내에서 텍스트 토큰에 대해서는 오토리그레시브 어텐션을, 시각 토큰에 대해서는 양방향 어텐션을 각각 구현하였다. 이 설계는 모델 내 공간 구조 상관관계 활용도를 크게 향상시켜, 복합적인 그래픽 및 텍스트 혼합 이해와 추론을 더욱 효과적으로 지원한다.
또한, 혁신적인 프리 버퍼&포스트 LLM 이단계 융합 훈련 전략을 통해 NEO는 기존 LLM의 완전한 언어 추론 능력을 흡수하면서도, 시각 인지 능력을 처음부터 강력하게 구축할 수 있어, 기존 다중 모달 훈련에서 발생하던 언어 능력 저하 문제를 완전히 해결한다.
시험 성능: 플래그십 수준의 성능 평가에 전체 데이터의 10분의 1이 사용됨
건축적 혁신을 기반으로 한 NEO는 놀라운 데이터 효율성과 성능 우위를 입증하였다. ▪ 극도로 높은 데이터 효율성: 업계 동급 성능 모델(3억 9천만 개의 이미지-텍스트 예시) 대비 단 1/10 수준의 데이터만으로도 최고 수준의 시각 인지 능력을 구축할 수 있다. 방대한 데이터나 추가 시각 인코더에 의존하지 않으며, 간결한 아키텍처로 Qwen2-VL 및 InternVL3 같은 최상위 모듈형 플래그십 모델과 여러 시각 이해 과제에서 어깨를 나란히 한다. ▪ 뛰어나고 균형 잡힌 성능: MMMU, MMB, MMStar, SEED-I, POPE 등 다수의 공개 권위 평가에서 NEO 아키텍처는 높은 점수를 달성하며, 타 토착 VLM 대비 종합적인 성능 우위를 보여주었고, 진정한 ‘정밀도 손실 없는’ 토착 아키텍처를 실현하였다. ▪ 극한의 추론 비용 효율성: 특히 0.6B–8B 파라미터 범위 내에서 NEO는 엣지 배포에 있어 뚜렷한 강점을 지닌다. 정확도와 효율성 모두에서 이중 도약을 달성할 뿐 아니라, 추론 비용을 크게 절감하여 멀티모달 시각 인지의 ‘비용 효율성’을 한 차원 높였다. 극한. 오픈소스 공동 구축
차세대 AI 인프라 아키텍처를 구축하는 것은 모델의 ‘골격’이며, 견고한 골격이 있어야만 향후 멀티모달 기술의 미래를 지탱할 수 있다.
NEO 아키텍처의 초기 융합 설계는 임의 해상도 및 긴 이미지 입력을 지원하며, 비디오 및 구현 지능과 같은 최첨단 분야로 매끄럽게 확장되어 하위에서 상위까지, 그리고 엔드투엔드까지 진정한 융합을 실현한다. 응용 관점에서 엔드투엔드 ‘네이티브 통합’ 설계는 로봇 구현 상호작용, 스마트 단말기 멀티모달 응답, 비디오 이해, 3D 상호작용, 구현 지능 등 다양한 시나리오 응용에 탄탄한 기술적 지원을 제공한다.
현재 센스타임은 네이티브 멀티모달 아키텍처 기반의 오픈소스 커뮤니티 혁신 및 응용을 촉진하기 위해 NEO 아키텍처를 기반으로 한 두 가지 사양 모델, 2B와 9B를 공식적으로 오픈소스화하였다. 센스타임 테크놀로지는 오픈소스 협업과 시나리오 구현을 통해 NEO를 확장 가능하고 재사용 가능한 차세대 AI 인프라로 구축하는 데 전념하고 있으며, 이를 통해 실험실 단계에서 산업 전반에 걸친 네이티브 멀티모달 기술의 광범위한 적용을 촉진하고, 차세대 산업 수준의 네이티브 멀티모달 기술 표준 구축을 가속화하고자 한다.