سنستایم بهصورت رسمی معماری جدید چندوجهی خود به نام نئو را منتشر و باز کرده است که در همکاری با آزمایشگاه اسلب دانشگاه فناوری نانیانگ توسعه یافته است و پایهای برای نسل جدیدی از مدلهای چندوجهی سنسنووا فراهم میکند.
نئو اولین معماری چندوجهی بومی (ویالام بومی) در صنعت است که قابل دسترسی است و ادغام عمیقی را به دست میآورد؛ این معماری از اصول بنیادین، قیدهای الگوی سنتی «ماژولی» را شکسته و بهصورت نوآورانهای برای «تولدِ اختصاصی برای چندوجهیبودن» طراحی شده است. با ادغام عمیق چندین وجه در سطح معماری هستهای، نئو پیشرفتی جامع در عملکرد، کارایی و جهانیبودن به دست میآورد، مرز عملکردی مدلهای چندوجهی را دوباره تعریف میکند و ورود رسمی فناوری هوش مصنوعی چندوجهی به عصر جدیدی از «معماری بومی» را نشان میدهد.
شکستن موانع، وداع با رویکرد «پچکاری» و پذیرش رویکرد «بومی»
در حال حاضر، مدلهای چندوجهی اصلی در صنعت عمدتاً از الگوی ماژولار «رمزنگار بصری + پروژکتور + مدل زبانی» پیروی میکنند. این روش گسترشدهنده مبتنی بر مدلهای بزرگ زبانی (LLM) سازگاری با ورودی تصویری را فراهم میکند، اما اساساً همچنان بر زبان متمرکز است و ادغام تصویر و زبان تنها در سطح دادهها باقی میماند. این طراحی «پچکاریشده» نهتنها کارایی یادگیری را پایین میآورد، بلکه توانایی مدل را در سناریوهای پیچیده چندوجهی — مانند تشخیص جزئیات تصویر یا درک ساختارهای فضایی پیچیده — نیز محدود میسازد. معماری NEO شرکت SenseTime برای رفع این مشکل ایجاد شده است. قبلاً در نیمه دوم سال ۲۰۲۴، شرکت شانگتانگ بهعنوان اولین شرکت در چین، فناوری آموزش ادغامی ذاتی چندوجهی را شکست و با یک مدل واحد، در ارزیابیهای زبانی SuperCLUE و ارزیابیهای چندوجهی OpenCompass پیروز شد؛ و بر اساس این فناوری هستهای، مدل Nissin SenseNova 6.0 را توسعه داد تا توانایی پیشرویی در استدلال چندوجهی را بهدست آورد. سپس در جولای ۲۰۲۵، مدل Nichiron SenseNova 6.5 منتشر شد که ادغام زودهنگام را در سطح رمزنگار انجام میدهد، بازده هزینه-کارایی مدلهای چندوجهی را سهبرابر کرده و اولین مدل در چین بود که استنتاج تفسیریِ گرافیکی-متنی در سطح تجاری را راهاندازی کرد. شرکت SenseTime گام بعدی را برداشته و ساختار ماژولار سنتی را کاملاً کنار گذاشته و با شروع از اصول بنیادین، معماری ذاتی NEO را از صفر طراحی و رونمایی کرده است.
سه نوآوری اصلی، اتحاد عمیق بین دید و زبان را بهدست میآورند
معماری NEO بر مفاهیم اصلی کارایی بیشینه و ادغام عمیق استوار است و از طریق نوآوریهای پایهای در سه بعد کلیدی: مکانیزم توجه، رمزگذاری مکانی و نگاشت معنایی، این مدل بهطور طبیعی توانایی پردازش همزمان دیداری و زبانی را در قالبی یکپارچه دارد
جاسازی تکههای اصلی (Native Patch Embedding): از رمزگذارهای گسستهٔ تصویری صرفنظر میکند و با استفاده از لایهٔ خاص جاسازی تکهها (PEL)، نگاشتی پیوسته از پیکسلها به کلمات را از پایین به بالا ایجاد میکند. این طراحی قادر است جزئیات تصویر را ظریفتر بگیرد و اساساً مانع اصلی مدلسازی تصویر در مدلهای رایج را از میان میبرد
روپ بومی: بهصورت نوآورانه تخصیص فرکانس فضازمانی سهبعدی را جدا میکند و از فرکانسهای بالا در بعد بصری و فرکانسهای پایین در بعد متنی استفاده میکند تا کاملاً با ساختار طبیعی هر دو نوع داده سازگار شود. این رویکرد نهتنها به نئو امکان میدهد ساختار فضایی تصاویر را با دقت بالا تشخیص دهد، بلکه پتانسیل گسترش بیدرز آن به صحنههای پیچیدهتری مانند پردازش ویدئو و مدلسازی بین فریمی را نیز فراهم میکند.
توجه چندسری بومی: با توجه به ویژگیهای متفاوت انواع داده، نئو در چارچوبی یکپارچه هم توجه خودکار (اتورگرسیو) برای توکنهای متنی و هم توجه دوسویه برای توکنهای بصری را پیادهسازی کرده است. این طراحی بهطور قابلتوجهی از همبستگی ساختار فضایی در مدل بهره میبرد و بنابراین پشتیبانی بهتری از درک و استدلال ترکیبی پیچیدهٔ گرافیکی و متنی فراهم میکند.
علاوهبراین، با استراتژی نوآورانهٔ آموزش ادغام دو مرحلهای «پیشبافر و پساز الالام»، سیستم نئو میتواند توانایی کامل استدلال زبانی الالام اصلی را جذب کند و همزمان توانایی قوی درک بصری را از صفر بسازد و بهطور کامل مشکل تضعیف توانایی زبانی در آموزش سنتی چندوجهی را حل کند.
عملکرد آزمودهشده: برای ارزیابی عملکرد سطح پرچمدار، یکدهم دادهها استفاده شدهاست
با الهام از نوآوری در معماری، سیستمِ نئو بهطور شگفتانگیزی کارایی دادهها و مزایای عملکردی برجستهای نشان داده است: کارایی بسیار بالای دادهها — با تنها یکدهم حجم دادههای مدلهای همرده در صنعت (۳۹۰ میلیون نمونهٔ تصویر-متن)، نئو قادر است تواناییهای برتر درک بصری را توسعه دهد. بدون اتکا به دادههای عظیم یا رمزگذارهای بصری اضافی، معماری فشردهٔ آن در چندین وظیفهٔ درک بصری، عملکردی مشابه مدلهای پرچمدار ماژولار برتر مانند Qwen2-VL و InternVL3 دارد. عملکرد عالی و متوازن — در چندین ارزیابی عمومی معتبر از جمله MMMU، MMB، MMStar، SEED-I و POPE، معماری نئو نمرات بسیار بالایی کسب کرده و عملکردی جامعتر از سایر مدلهای زبانی چندوجهی ذاتی (VLM) را نشان داده است؛ چنانکه واقعاً «دقت بدون اتلاف» را در معماری ذاتی به انجام رسانده است. بازدهی نهایی در استدلال — بهویژه در محدودهٔ پارامتری ۰٫۶ میلیارد تا ۸ میلیارد، نئو مزایای قابلتوجهی در استقرار روی لبههای شبکه (edge deployment) دارد. این مدل نهتنها پرش دوگانهای در دقت و کارایی ایجاد میکند، بلکه هزینههای استنتاج را نیز بهطور چشمگیری کاهش میدهد و «بازدهی هزینهای» درک بصری چندوجهی را به سطحی بیسابقه میرساند. باز. ساخت مشترک باز
ساخت معماری زیرساخت هوش مصنوعی نسل بعدی، «اسکلت» مدل است و تنها با اسکلتی محکم میتوان آیندهٔ فناوری چندوجهی را پشتیبانی کرد.
طراحی ادغام اولیهٔ معماری NEO از ورودیهای تصویری با وضوح دلخواه و طولانی پشتیبانی میکند و بهصورت بیدرز به حوزههای پیشرفتهتری مانند ویدئو و هوش تجسمیافته گسترش مییابد و ادغام واقعی از پایه تا بالا و پایانبهپایان را محقق میسازد. از منظر کاربردی، طراحی «ادغام ذاتی پایانبهپاین» از نظر فنی پایهای محکم برای کاربردهای متنوعی مانند تعامل تجسمیافته رباتها، پاسخدهی چندوجهی ترمینالهای هوشمند، درک ویدئو، تعامل سهبعدی و هوش تجسمیافته فراهم میکند.
در حال حاضر، شرکت سنستایم دو مدل مشخصاتی مبتنی بر معماری نئو، یعنی مدلهای ۲B و ۹B را بهصورت رسمی در اختیار جامعهٔ منبعباز قرار داده است تا نوآوری و کاربرد معماری چندوجهی اصیل را در این جامعه تقویت کند. شرکت فناوری سنستایم اعلام کرده است که با همکاری منبعباز و اجرای سناریوها، متعهد به ساخت نئو بهعنوان زیرساخت هوش مصنوعی نسل بعدی با قابلیت مقیاسپذیری و استفادهٔ مجدد است؛ این امر به گسترش گستردهٔ فناوری چندوجهی اصیل از آزمایشگاه به کاربردهای صنعتی کمک میکند و ساخت استانداردهای فناوری چندوجهی اصیل سطح صنعتی نسل بعدی را تسریع میکند.