SenseTime, yeni çok modlu model mimarisi olan NEO’yu resmi olarak yayınladı ve açık kaynak yaptı. Bu mimari, SenseNova çok modlu modeli için yeni nesil bir mimari temeli oluşturmak amacıyla Nanyang Teknoloji Üniversitesi S-Lab ile iş birliği içinde geliştirildi.
Endüstrinin ilk kullanılabilir yerel çok modlu mimarisi (Native VLM) olan NEO, geleneksel "modüler" yaklaşımın sınırlarını temel düzeyde kıran, derin entegrasyon sağlayan bir yapıdır. Yenilikçi bir şekilde, "çok modluluk için doğrudan tasarlanmış" bir mimari kurgusuyla ortaya çıkar. Çoklu modların çekirdek mimari düzeyinde derin entegrasyonu sayesinde, performans, verimlilik ve evrensellik açısından kapsamlı bir atılım gerçekleştirir; çok modlu modellerin performans sınırını yeniden tanımlar ve yapay zekâ çok modlu teknolojisinin resmi olarak "yerel mimari" çağına girdiğini işaret eder.
Darboğazları aşmak, 'yamalama' yaklaşımına veda etmek ve 'yerel' yaklaşımı benimsemek
Şu anda sektördeki öncü çok modlu modellerin çoğu, "görsel kodlayıcı+projektör+dil modeli" adı verilen modüler bir yapıyı takip eder. Büyük Dil Modeli (LLM) temelli bu genişletme yöntemi, görüntü girdisiyle uyumluluğu sağlar; ancak temelde hâlâ dil odaklıdır ve görsel ile dilin birleşimi yalnızca veri düzeyinde kalır. Bu "yamalı" tasarım, yalnızca düşük öğrenme verimliliğine sahip değildir; aynı zamanda görüntü detaylarının yakalanması veya karmaşık uzamsal yapıların anlaşılması gibi durumları içeren karmaşık çok modlu senaryolarda modelin işleme yeteneğini de sınırlandırır. SenseTime NEO mimarisi, bu sorunu çözmek amacıyla geliştirilmiştir. 2024’ün ikinci yarısında Shangtang, Çin’de çok modlu doğrudan birleştirme eğitimi teknolojisinde öncülük ederek SuperCLUE dil değerlendirmesi ve OpenCompass çok modlu değerlendirmesini tek bir modelle kazandı; bu temel teknolojiye dayanarak Nissin SenseNova 6.0’ı oluşturdu ve çok modlu akıl yürütmede lider yetenek elde etti. Daha sonra Temmuz 2025’te Nichiron SenseNova 6.5 yayımlandı; bu sürüm, kodlayıcı düzeyinde erken birleştirme sağladı, çok modlu modellerin maliyet-verimliliğini üç katına çıkardı ve Çin’de grafik-metin arayışı çıkarımını ticari düzeyde ilk kez sunan çözüm oldu. SenseTime, geleneksel modüler yapıdan tamamen vazgeçerek temel ilkelerden başlayıp sıfırdan tasarlanan NEO yerel mimarisini duyurarak bir adım daha ileriye geçti.
Üç temel yenilik, görüş ile dilin derin birleşimini sağlar
NEO mimarisi, son derece verimlilik ve derin entegrasyon temel kavramlarına dayanır; dikkat mekanizması, konumsal kodlama ve anlamsal eşleme olmak üzere üç ana boyutta alt yapı düzeyinde yapılan yenilikler sayesinde model, hem görsel hem de dil bilgisi işleyebilme yeteneğini doğal olarak kazanır
Yerel Patch Gömme: Ayrık görüntü belirteçleyicilerini bırakır ve benzersiz bir Patch Gömme Katmanı (PEL) aracılığıyla piksellerden kelimelere doğru aşağıdan yukarıya sürekli bir eşleme oluşturur. Bu tasarım, görüntü ayrıntılarını daha ince şekilde yakalayabilir ve ana akım modellerdeki görüntü modelleme darboğazını temelden aşar.
Yerel RoPE: Üç boyutlu uzamsal-zamansal frekans tahsisi işlemini yenilikçi bir şekilde ayırır; görsel boyutta yüksek frekanslar, metin boyutunda ise düşük frekanslar kullanır ve bu sayede her iki modülün doğal yapısına mükemmel şekilde uyar. Bu durum, NEO’nun görüntülerin uzamsal yapısını doğru şekilde yakalamasını sağlarken, aynı zamanda video işleme ve çerçeveler arası modelleme gibi karmaşık sahnelerde sorunsuz genişlemeye de olanak tanır.
Yerel Çok Başlıklı Dikkat Mekanizması: Farklı modüllerin özelliklerine yanıt olarak NEO, metin token’ları için otoregresif dikkat mekanizması ile görsel token’ları için çift yönlü dikkat mekanizmasını tek bir çerçevede uygular. Bu tasarım, model içindeki uzamsal yapı korelasyonlarının kullanımını büyük ölçüde artırır ve böylece karmaşık grafik-metin karışık anlama ve akıl yürütme süreçlerini daha iyi destekler.
Ayrıca, yenilikçi Ön Tampon&Son LLM iki aşamalı füzyon eğitimi stratejisiyle NEO, orijinal LLM'nin tam dil akıl yürütme yeteneğini emerken güçlü görsel algı yeteneğini sıfırdan inşa eder ve böylece geleneksel çoklu modlu eğitimin dil yeteneği bozulması sorununu tamamen çözer.
Test edilen performans: Bayrak gemisi seviyesinde performansı değerlendirmek için verilerin onda biri kullanılmıştır
Mimari yenilikle hareket eden NEO, şaşırtıcı veri verimliliği ve performans avantajları sergilemiştir: son derece yüksek veri verimliliği: sektörde eşdeğer performansa sahip modellerin (390 milyon görsel-metin örneği) yalnızca onda biri kadar veri hacmiyle NEO, üst düzey görsel algılama yetenekleri geliştirebilir. Devasa veri kümelerine veya ek görsel kodlayıcılara dayanmadan, özgün ve sade mimarisiyle Qwen2-VL ve InternVL3 gibi önde gelen modüler bayrak taşıyıcı modellerle çoklu görsel anlama görevlerinde eş değer performans gösterir. Mükemmel ve dengeli performans: MMMU, MMB, MMStar, SEED-I, POPE gibi çeşitli kamuoyu tarafından tanınan ve otoriter değerlendirme setlerinde NEO mimarisi yüksek puanlar elde etmiştir; bu da diğer yerel çokmodlu dil modellerine (VLM’ler) kıyasla kapsamlı bir üstünlüğün varlığını kanıtlar ve gerçekten de yerel mimarinin "kesinlik kaybı olmaksızın" gerçeklenmesini sağlar. Son düzey akıl yürütme maliyet-etkinliği: Özellikle 0,6B–8B parametre aralığında NEO, kenar (edge) dağıtımlarında belirgin avantajlara sahiptir. Hem doğrulukta hem de verimlilikte çift sıçrama gerçekleştirirken aynı zamanda çıkarım maliyetlerini önemli ölçüde azaltır ve çokmodlu görsel algılamanın "maliyet-etkinliğini" zirveye taşır. açık kaynaklı ortak inşa
Yapay zekâ altyapısı mimarisinin bir sonraki neslini inşa etmek, modelin "iskeletini" oluşturur ve yalnızca sağlam bir iskelet ile çoklu modlu teknolojinin geleceği desteklenebilir.
NEO mimarisinin erken füzyon tasarımı, herhangi bir çözünürlüğü ve uzun görüntü girdisini destekler; bu da video ve bedensel zekâ gibi ileri düzey alanlara sorunsuz şekilde uzanmayı sağlar ve alttan üste ve uçtan uca gerçek füzyonu gerçekleştirir. Uygulama açısından uçtan uca "yerel entegrasyon" tasarımı, robot bedensel etkileşimi, akıllı uç cihazlarda çoklu modlu yanıt verme, video anlama, 3B etkileşim ve bedensel zekâ gibi çeşitli senaryoların uygulanması için sağlam teknik destek sağlar.
Şu anda SenseTime, yerel çok modlu mimari üzerinde açık kaynak topluluğunda yenilik ve uygulamayı teşvik etmek amacıyla NEO mimarisine dayalı iki spesifikasyon modelini — 2B ve 9B’yi — resmi olarak açık kaynak yaptı. SenseTime Technology, açık kaynak iş birliği ve senaryo uygulamaları aracılığıyla NEO’yu ölçeklenebilir ve yeniden kullanılabilir bir yeni nesil yapay zekâ altyapısı haline getirmeye adanmış olduğunu açıkladı; bu sayede yerel çok modlu teknolojinin laboratuvar seviyesinden endüstriyel uygulamaya yaygınlaşmasını destekleyecek ve yeni nesil endüstriyel düzeyde yerel çok modlu teknoloji standartlarının oluşturulmasını hızlandıracaktır.