SenseTime telah secara rasmi melancarkan dan membuka sumber arkitektur model multimodal baharu, NEO, yang dibangunkan melalui kerjasama dengan Nanyang Technological University S-Lab, meletakkan asas bagi generasi baharu arkitektur model multimodal SenseNova.
Sebagai arkitektur multimodal asli (Native VLM) pertama di dalam industri yang tersedia dan mencapai integrasi mendalam, NEO memecahkan belenggu paradigma "bermodul" tradisional dari prinsip asasnya, serta mereka bentuk secara inovatif untuk "dilahirkan khas bagi multimodal". Melalui integrasi mendalam pelbagai modality pada tahap arkitektur teras, NEO mencapai lompatan komprehensif dari segi prestasi, kecekapan, dan keserbagunaan, menetapkan semula sempadan prestasi model multimodal, serta menandakan permulaan rasmi teknologi kecerdasan buatan multimodal ke dalam era baharu "arkitektur asli".
Memecahkan kelumpuhan, mengucapkan selamat tinggal kepada pendekatan 'tampalan', dan menerima pendekatan 'asli'
Kini, model multimodal utama dalam industri kebanyakannya mengikuti paradigma modular "pengekod visual + pelancar + model bahasa". Kaedah peluasan ini yang berasaskan Model Bahasa Besar (LLM) mencapai keserasian dengan input imej, tetapi secara asasnya masih berfokus pada bahasa, dan penggabungan imej dengan bahasa hanya berada pada tahap data. Reka bentuk "tampalan" ini tidak sahaja mempunyai kecekapan pembelajaran yang rendah, malah juga menghadkan keupayaan model dalam senario multimodal yang kompleks, seperti penangkapan butiran imej atau pemahaman struktur ruang yang rumit. Arkitektur SenseTime NEO dicipta khusus untuk menangani titik kesakitan ini. Sejak separuh kedua tahun 2024, Shangtang telah memulakan terobosan teknologi latihan penggabungan asli multimodal di China, memenangi penilaian bahasa SuperCLUE dan penilaian multimodal OpenCompass dengan satu model sahaja; berdasarkan teknologi teras ini, ia melancarkan Nissin SenseNova 6.0 untuk mencapai keupayaan terkemuka dalam penaakulan multimodal. Setelah itu, pada Julai 2025, Nichiron SenseNova 6.5 dilancarkan, yang mencapai penggabungan awal pada tahap pengekod, meningkatkan ketepatan kos model multimodal sebanyak tiga kali ganda, serta menjadi yang pertama di China melancarkan inferens komersial bertaraf teks-grafik berselang. SenseTime kini telah melangkah seterusnya dengan sepenuhnya meninggalkan struktur modular tradisional dan bermula dari prinsip asas, melancarkan arkitektur NEO asli yang direka sepenuhnya dari awal.
Tiga inovasi utama mencapai kesatuan mendalam antara penglihatan dan bahasa
Arkitektur NEO berdasarkan konsep utama kecekapan maksimum dan integrasi mendalam, serta melalui inovasi asas dalam tiga dimensi utama: mekanisme perhatian, penyandian kedudukan, dan pemetaan semantik—model ini secara semula jadi memiliki keupayaan untuk mengendali penglihatan dan bahasa secara bersatu.
Penanaman Tambalan Asli: meninggalkan pengtoken imej diskret dan membina pemetaan berterusan dari piksel kepada perkataan dari bawah ke atas melalui Lapisan Penanaman Tambalan (PEL) yang unik. Reka bentuk ini dapat menangkap butiran imej dengan lebih halus, secara asasnya memecahkan botol leher dalam pemodelan imej pada model-model utama.
Native RoPE: secara inovatif memisahkan tiga dimensi alokasi frekuensi ruang-waktu, menggunakan frekuensi tinggi dalam dimensi visual dan frekuensi rendah dalam dimensi tekstual, sehingga menyesuaikan secara sempurna dengan struktur semula jadi kedua modaliti tersebut. Ini tidak hanya membolehkan NEO menangkap struktur ruang imej secara tepat, tetapi juga berpotensi diperluas secara lancar kepada adegan kompleks seperti pemprosesan video dan pemodelan merentasi bingkai.
Native Multi Head Attention: Sebagai tindak balas terhadap ciri-ciri modaliti yang berbeza, NEO telah melaksanakan perhatian autoregresif untuk token teks dan perhatian dwiarah untuk token visual dalam satu rangka kerja bersatu. Reka bentuk ini meningkatkan penggunaan korelasi struktur ruang dalam model secara ketara, seterusnya menyokong pemahaman dan penaakulan campuran grafik-teks yang kompleks dengan lebih baik.
Selain itu, dengan strategi latihan penggabungan dua peringkat Inovatif Pre Buffer & Post LLM, NEO mampu menyerap keupayaan penaakulan bahasa lengkap daripada LLM asal sambil membina keupayaan persepsi visual yang kuat dari awal, sepenuhnya menyelesaikan masalah kehilangan keupayaan bahasa dalam latihan silang mod tradisional.
Prestasi diuji: Sepuluh peratus daripada data digunakan untuk menilai prestasi tahap kapal induk
Didorong oleh inovasi arkitetural, NEO telah menunjukkan kecekapan data dan kelebihan prestasi yang mengagumkan: kecekapan data yang sangat tinggi — dengan hanya 1/10 isi data model setara industri (390 juta contoh imej-teks), NEO mampu membangunkan kemampuan persepsi visual bertaraf terbaik. Tanpa bergantung pada data berskala besar dan pengekod visual tambahan, arkiteturnya yang ringkas mampu menyamai model modul utama terkemuka seperti Qwen2-VL dan InternVL3 dalam pelbagai tugas pemahaman visual. Prestasi yang cemerlang dan seimbang — dalam pelbagai penilaian awam berotoriti seperti MMMU, MMB, MMStar, SEED-I, POPE, dan lain-lain, arkitetur NEO mencapai skor tinggi, menunjukkan prestasi komprehensif yang lebih unggul berbanding VLM asli lain, benar-benar merealisasikan "ketepatan tanpa kehilangan" dalam arkitetur asli. Kos-kesan penaakulan yang maksimum — khususnya dalam julat parameter 0.6B hingga 8B, NEO mempunyai kelebihan ketara dalam penempatan tepi. Ia tidak hanya mencapai lompatan ganda dalam ketepatan dan kecekapan, tetapi juga mengurangkan kos inferens secara ketara, mendorong "kos-kesan" persepsi visual multimodal ke tahap extreme.Pembinaan bersama sumber terbuka
Membina arsitektur infrastruktur AI generasi seterusnya merupakan "rangka" model, dan hanya dengan rangka yang kukuh sahaja ia dapat menyokong masa depan teknologi multimodal.
Reka bentuk pelangkapan awal arsitektur NEO menyokong resolusi sewenang-wenang dan input imej panjang, serta melanjutkan secara lancar ke bidang terkini seperti video dan kecerdasan berbadan, mencapai pelangkapan sebenar dari bawah ke atas dan hujung ke hujung. Dari perspektif aplikasi, reka bentuk "integrasi asli" hujung ke hujung memberikan sokongan teknikal yang kukuh untuk aplikasi dalam pelbagai senario seperti interaksi berbadan robot, tindak balas multimodal terminal pintar, pemahaman video, interaksi 3D, dan kecerdasan berbadan.
Pada masa ini, SenseTime telah secara rasmi membuka sumber dua model spesifikasi berdasarkan arkitektur NEO, iaitu 2B dan 9B, untuk mendorong inovasi dan aplikasi dalam komuniti sumber terbuka mengenai arkitektur multimodal asli. Teknologi SenseTime menyatakan bahawa pihaknya berkomitmen untuk membina NEO sebagai infrastruktur kecerdasan buatan generasi seterusnya yang boleh diskalakan dan digunakan semula melalui kerjasama sumber terbuka dan pelaksanaan senario, serta mempromosikan aplikasi industri meluas teknologi multimodal asli dari makmal, serta mempercepatkan pembinaan piawaian teknologi multimodal asli peringkat industri generasi seterusnya.