Semua Kategori

Beralih dari "fusi data" ke "arsitektur asli": SenseTime meluncurkan arsitektur NEO, menetapkan kembali batas kinerja model multimodal

2026-09-18

SenseTime telah secara resmi merilis dan membuka kode arsitektur model multimodal baru miliknya, NEO, yang dikembangkan bekerja sama dengan Nanyang Technological University S-Lab, sehingga meletakkan fondasi bagi generasi arsitektur baru untuk model multimodal SenseNova.
Sebagai arsitektur multimodal asli (Native VLM) pertama di industri yang tersedia dan mampu mencapai integrasi mendalam, NEO mematahkan keterbatasan paradigma "modular" tradisional dari prinsip dasarnya, serta secara inovatif dirancang khusus untuk kebutuhan multimodal sejak awal. Melalui integrasi mendalam berbagai modalitas pada tingkat inti arsitektur, NEO berhasil mencapai terobosan komprehensif dalam hal kinerja, efisiensi, dan universalitas; menetapkan kembali batas kinerja model multimodal; serta menandai dimulainya era baru teknologi multimodal kecerdasan buatan berbasis "arsitektur asli".
Menerobos hambatan, mengakhiri pendekatan 'tempelan', beralih ke pendekatan 'asli'
Saat ini, model multimodal utama di industri sebagian besar mengikuti paradigma modular "encoder visual+projector+model bahasa". Metode ekstensi berbasis Large Language Model (LLM) ini mencapai kompatibilitas dengan input gambar, namun secara mendasar tetap berfokus pada bahasa, dan fusi antara gambar serta bahasa hanya terbatas pada tingkat data. Desain "tambal sulam" semacam ini tidak hanya memiliki efisiensi pembelajaran yang rendah, tetapi juga membatasi kemampuan model dalam memproses skenario multimodal kompleks—misalnya, penangkapan detail gambar atau pemahaman struktur spasial yang rumit. Arsitektur SenseTime NEO lahir untuk mengatasi permasalahan krusial ini. Sejak paruh kedua tahun 2024, Shangtang menjadi pelopor di Tiongkok dalam memecahkan teknologi pelatihan fusi asli multimodal, meraih hasil terbaik dalam evaluasi bahasa SuperCLUE dan evaluasi multimodal OpenCompass menggunakan satu model tunggal; berdasarkan teknologi inti ini, dikembangkan Nissin SenseNova 6.0 guna mencapai kemampuan unggul dalam penalaran multimodal. Selanjutnya, pada Juli 2025, diluncurkan Nichiron SenseNova 6.5, yang mewujudkan fusi dini di tingkat encoder, meningkatkan efektivitas biaya model multimodal hingga tiga kali lipat, serta menjadi yang pertama di Tiongkok meluncurkan inferensi komersial berkualitas tinggi untuk interleave teks–grafis. SenseTime kemudian mengambil langkah berikutnya dengan sepenuhnya meninggalkan struktur modular konvensional dan mulai dari prinsip dasar, meluncurkan arsitektur asli NEO yang dirancang dari awal.
Tiga inovasi inti mewujudkan kesatuan mendalam antara penglihatan dan bahasa
Arsitektur NEO didasarkan pada konsep inti efisiensi maksimal dan integrasi mendalam, serta melalui inovasi mendasar di tiga dimensi kunci: mekanisme perhatian, penyandian posisi, dan pemetaan semantik—sehingga model secara alami memiliki kemampuan menangani penglihatan dan bahasa secara terpadu
Penanaman Patch Asli: meninggalkan tokenizer gambar diskret dan membangun pemetaan kontinu dari piksel ke kata secara bertahap dari bawah ke atas melalui Lapisan Penanaman Patch (PEL) yang unik. Desain ini mampu menangkap detail gambar secara lebih halus, sehingga secara mendasar melampaui hambatan pemodelan gambar pada model-model utama.
Native RoPE: secara inovatif memisahkan alokasi frekuensi spasial-temporal tiga dimensi, menggunakan frekuensi tinggi pada dimensi visual dan frekuensi rendah pada dimensi tekstual, sehingga beradaptasi sempurna dengan struktur alami kedua modalitas tersebut. Pendekatan ini tidak hanya memungkinkan NEO menangkap struktur spasial gambar secara akurat, tetapi juga berpotensi diperluas tanpa hambatan ke skenario kompleks seperti pemrosesan video dan pemodelan lintas frame.
Native Multi Head Attention: Menanggapi karakteristik modalitas yang berbeda, NEO menerapkan baik perhatian autoregresif untuk token teks maupun perhatian dua arah untuk token visual dalam satu kerangka kerja terpadu. Desain ini secara signifikan meningkatkan pemanfaatan korelasi struktur spasial dalam model, sehingga mendukung pemahaman serta penalaran campuran grafis-teks yang kompleks secara lebih baik.
Selain itu, dengan strategi pelatihan fusi dua tahap inovatif Pre Buffer&Post LLM, NEO mampu menyerap kemampuan penalaran bahasa lengkap dari LLM asli sekaligus membangun kemampuan persepsi visual yang kuat dari nol, sehingga sepenuhnya mengatasi masalah penurunan kemampuan bahasa dalam pelatihan lintas modal tradisional.
Kinerja yang diuji: Sepuluh persen data digunakan untuk mengevaluasi kinerja tingkat unggulan
Didorong oleh inovasi arsitektur, NEO telah menunjukkan efisiensi data dan keunggulan kinerja yang luar biasa: efisiensi data sangat tinggi—dengan hanya 1/10 volume data dibandingkan model berkinerja setara di industri (390 juta contoh pasangan gambar-teks), NEO mampu mengembangkan kemampuan persepsi visual kelas atas. Tanpa mengandalkan data dalam jumlah masif maupun encoder visual tambahan, arsitektur ringkasnya mampu menyamai model modular unggulan terkemuka seperti Qwen2-VL dan InternVL3 dalam berbagai tugas pemahaman visual. Kinerja luar biasa dan seimbang: Dalam berbagai evaluasi publik otoritatif—seperti MMMU, MMB, MMStar, SEED-I, dan POPE—arsitektur NEO mencapai skor tinggi, menunjukkan kinerja komprehensif yang unggul dibandingkan VLM asli lainnya, benar-benar mewujudkan "presisi tanpa kehilangan" pada arsitektur asli. Efisiensi biaya penalaran maksimal: Terutama dalam kisaran parameter 0,6B–8B, NEO memiliki keunggulan signifikan untuk penerapan di edge. Model ini tidak hanya mencapai lompatan ganda dalam akurasi dan efisiensi, tetapi juga secara nyata menekan biaya inferensi, sehingga mendorong "efektivitas biaya" persepsi visual multimodal ke tingkat ekstrem. Pembangunan bersama sumber terbuka
Membangun arsitektur infrastruktur kecerdasan buatan generasi berikutnya merupakan "kerangka" model, dan hanya dengan kerangka yang kokoh dapat mendukung masa depan teknologi multimodal.
Desain fusi awal arsitektur NEO mendukung resolusi sembarang serta masukan gambar berukuran panjang, secara mulus diperluas ke bidang mutakhir seperti video dan kecerdasan berwujud, sehingga mencapai fusi sejati dari bawah ke atas dan ujung-ke-ujung. Dari sudut pandang penerapan, desain "integrasi asli" ujung-ke-ujung memberikan dukungan teknis yang kokoh bagi penerapan berbagai skenario, seperti interaksi robot berwujud, respons multimodal pada terminal cerdas, pemahaman video, interaksi 3D, serta kecerdasan berwujud.
Saat ini, SenseTime telah secara resmi membuka sumber dua model spesifikasi berbasis arsitektur NEO, yaitu 2B dan 9B, guna mendorong inovasi dan penerapan dalam komunitas open source mengenai arsitektur multimodal asli. SenseTime Technology menyatakan bahwa perusahaan berkomitmen membangun NEO menjadi infrastruktur AI generasi berikutnya yang dapat diskalakan dan dapat digunakan kembali melalui kolaborasi open source serta implementasi skenario nyata, sehingga mempercepat penerapan luas teknologi multimodal asli di tingkat industri dari laboratorium, sekaligus mempercepat penyusunan standar teknologi multimodal asli tingkat industri generasi berikutnya.

Tentang Kami
Telepon: 0518-80236699
Surel: [email protected]
Alamat: Distrik Haizhou, Kota Lianyungang, Provinsi Jiangsu
Platform Layanan Pemerintah Kementerian Perindustrian dan Teknologi Informasi
Persiapan ICP Su No. 2025211914
Nomor Keamanan Gongwang Su No. 32070602010184
Dukungan Teknis: Jiangsu Xiaola Technology Co., Ltd
Facebook Facebook
Facebook
WhatsApp WhatsApp
WhatsApp