همهٔ دسته‌بندی‌ها

حرکت از «ادغام داده‌ها» به سمت «معماری ذاتی»: سنستایم معماری نئو را منتشر کرده و مرز عملکردی مدل‌های چندوجهی را دوباره تعریف کرده است.

2026-09-18

سنس‌تایم به‌صورت رسمی معماری جدید چندوجهی خود به نام نئو را منتشر و باز کرده است که در همکاری با آزمایشگاه اس‌لب دانشگاه فناوری نانیانگ توسعه یافته است و پایه‌ای برای نسل جدیدی از مدل‌های چندوجهی سنس‌نووا فراهم می‌کند.
نئو اولین معماری چندوجهی بومی (وی‌ال‌ام بومی) در صنعت است که قابل دسترسی است و ادغام عمیقی را به دست می‌آورد؛ این معماری از اصول بنیادین، قیدهای الگوی سنتی «ماژولی» را شکسته و به‌صورت نوآورانه‌ای برای «تولدِ اختصاصی برای چندوجهی‌بودن» طراحی شده است. با ادغام عمیق چندین وجه در سطح معماری هسته‌ای، نئو پیشرفتی جامع در عملکرد، کارایی و جهانی‌بودن به دست می‌آورد، مرز عملکردی مدل‌های چندوجهی را دوباره تعریف می‌کند و ورود رسمی فناوری هوش مصنوعی چندوجهی به عصر جدیدی از «معماری بومی» را نشان می‌دهد.
شکستن موانع، وداع با رویکرد «پچ‌کاری» و پذیرش رویکرد «بومی»
در حال حاضر، مدل‌های چندوجهی اصلی در صنعت عمدتاً از الگوی ماژولار «رمزنگار بصری + پروژکتور + مدل زبانی» پیروی می‌کنند. این روش گسترش‌دهنده مبتنی بر مدل‌های بزرگ زبانی (LLM) سازگاری با ورودی تصویری را فراهم می‌کند، اما اساساً همچنان بر زبان متمرکز است و ادغام تصویر و زبان تنها در سطح داده‌ها باقی می‌ماند. این طراحی «پچ‌کاری‌شده» نه‌تنها کارایی یادگیری را پایین می‌آورد، بلکه توانایی مدل را در سناریوهای پیچیده چندوجهی — مانند تشخیص جزئیات تصویر یا درک ساختارهای فضایی پیچیده — نیز محدود می‌سازد. معماری NEO شرکت SenseTime برای رفع این مشکل ایجاد شده است. قبلاً در نیمه دوم سال ۲۰۲۴، شرکت شانگتانگ به‌عنوان اولین شرکت در چین، فناوری آموزش ادغامی ذاتی چندوجهی را شکست و با یک مدل واحد، در ارزیابی‌های زبانی SuperCLUE و ارزیابی‌های چندوجهی OpenCompass پیروز شد؛ و بر اساس این فناوری هسته‌ای، مدل Nissin SenseNova 6.0 را توسعه داد تا توانایی پیشرویی در استدلال چندوجهی را به‌دست آورد. سپس در جولای ۲۰۲۵، مدل Nichiron SenseNova 6.5 منتشر شد که ادغام زودهنگام را در سطح رمزنگار انجام می‌دهد، بازده هزینه-کارایی مدل‌های چندوجهی را سه‌برابر کرده و اولین مدل در چین بود که استنتاج تفسیریِ گرافیکی-متنی در سطح تجاری را راه‌اندازی کرد. شرکت SenseTime گام بعدی را برداشته و ساختار ماژولار سنتی را کاملاً کنار گذاشته و با شروع از اصول بنیادین، معماری ذاتی NEO را از صفر طراحی و رونمایی کرده است.
سه نوآوری اصلی، اتحاد عمیق بین دید و زبان را به‌دست می‌آورند
معماری NEO بر مفاهیم اصلی کارایی بیشینه و ادغام عمیق استوار است و از طریق نوآوری‌های پایه‌ای در سه بعد کلیدی: مکانیزم توجه، رمزگذاری مکانی و نگاشت معنایی، این مدل به‌طور طبیعی توانایی پردازش هم‌زمان دیداری و زبانی را در قالبی یکپارچه دارد
جاسازی تکه‌های اصلی (Native Patch Embedding): از رمزگذارهای گسستهٔ تصویری صرف‌نظر می‌کند و با استفاده از لایهٔ خاص جاسازی تکه‌ها (PEL)، نگاشتی پیوسته از پیکسل‌ها به کلمات را از پایین به بالا ایجاد می‌کند. این طراحی قادر است جزئیات تصویر را ظریف‌تر بگیرد و اساساً مانع اصلی مدل‌سازی تصویر در مدل‌های رایج را از میان می‌برد
روپ بومی: به‌صورت نوآورانه تخصیص فرکانس فضازمانی سه‌بعدی را جدا می‌کند و از فرکانس‌های بالا در بعد بصری و فرکانس‌های پایین در بعد متنی استفاده می‌کند تا کاملاً با ساختار طبیعی هر دو نوع داده سازگار شود. این رویکرد نه‌تنها به نئو امکان می‌دهد ساختار فضایی تصاویر را با دقت بالا تشخیص دهد، بلکه پتانسیل گسترش بی‌درز آن به صحنه‌های پیچیده‌تری مانند پردازش ویدئو و مدل‌سازی بین فریمی را نیز فراهم می‌کند.
توجه چندسری بومی: با توجه به ویژگی‌های متفاوت انواع داده، نئو در چارچوبی یکپارچه هم توجه خودکار (اتورگرسیو) برای توکن‌های متنی و هم توجه دوسویه برای توکن‌های بصری را پیاده‌سازی کرده است. این طراحی به‌طور قابل‌توجهی از همبستگی ساختار فضایی در مدل بهره می‌برد و بنابراین پشتیبانی بهتری از درک و استدلال ترکیبی پیچیدهٔ گرافیکی و متنی فراهم می‌کند.
علاوه‌براین، با استراتژی نوآورانهٔ آموزش ادغام دو مرحله‌ای «پیش‌بافر و پس‌از ال‌ال‌ام»، سیستم نئو می‌تواند توانایی کامل استدلال زبانی ال‌ال‌ام اصلی را جذب کند و همزمان توانایی قوی درک بصری را از صفر بسازد و به‌طور کامل مشکل تضعیف توانایی زبانی در آموزش سنتی چندوجهی را حل کند.
عملکرد آزموده‌شده: برای ارزیابی عملکرد سطح پرچم‌دار، یک‌دهم داده‌ها استفاده شده‌است
با الهام از نوآوری در معماری، سیستمِ نئو به‌طور شگفت‌انگیزی کارایی داده‌ها و مزایای عملکردی برجسته‌ای نشان داده است: کارایی بسیار بالای داده‌ها — با تنها یک‌دهم حجم داده‌های مدل‌های هم‌رده در صنعت (۳۹۰ میلیون نمونهٔ تصویر-متن)، نئو قادر است توانایی‌های برتر درک بصری را توسعه دهد. بدون اتکا به داده‌های عظیم یا رمزگذارهای بصری اضافی، معماری فشردهٔ آن در چندین وظیفهٔ درک بصری، عملکردی مشابه مدل‌های پرچمدار ماژولار برتر مانند Qwen2-VL و InternVL3 دارد. عملکرد عالی و متوازن — در چندین ارزیابی عمومی معتبر از جمله MMMU، MMB، MMStar، SEED-I و POPE، معماری نئو نمرات بسیار بالایی کسب کرده و عملکردی جامع‌تر از سایر مدل‌های زبانی چندوجهی ذاتی (VLM) را نشان داده است؛ چنان‌که واقعاً «دقت بدون اتلاف» را در معماری ذاتی به انجام رسانده است. بازدهی نهایی در استدلال — به‌ویژه در محدودهٔ پارامتری ۰٫۶ میلیارد تا ۸ میلیارد، نئو مزایای قابل‌توجهی در استقرار روی لبه‌های شبکه (edge deployment) دارد. این مدل نه‌تنها پرش دوگانه‌ای در دقت و کارایی ایجاد می‌کند، بلکه هزینه‌های استنتاج را نیز به‌طور چشمگیری کاهش می‌دهد و «بازدهی هزینه‌ای» درک بصری چندوجهی را به سطحی بی‌سابقه می‌رساند. باز. ساخت مشترک باز
ساخت معماری زیرساخت هوش مصنوعی نسل بعدی، «اسکلت» مدل است و تنها با اسکلتی محکم می‌توان آیندهٔ فناوری چندوجهی را پشتیبانی کرد.
طراحی ادغام اولیهٔ معماری NEO از ورودی‌های تصویری با وضوح دلخواه و طولانی پشتیبانی می‌کند و به‌صورت بی‌درز به حوزه‌های پیشرفته‌تری مانند ویدئو و هوش تجسم‌یافته گسترش می‌یابد و ادغام واقعی از پایه تا بالا و پایان‌به‌پایان را محقق می‌سازد. از منظر کاربردی، طراحی «ادغام ذاتی پایان‌به‌پاین» از نظر فنی پایه‌ای محکم برای کاربردهای متنوعی مانند تعامل تجسم‌یافته ربات‌ها، پاسخ‌دهی چندوجهی ترمینال‌های هوشمند، درک ویدئو، تعامل سه‌بعدی و هوش تجسم‌یافته فراهم می‌کند.
در حال حاضر، شرکت سنس‌تایم دو مدل مشخصاتی مبتنی بر معماری نئو، یعنی مدل‌های ۲B و ۹B را به‌صورت رسمی در اختیار جامعهٔ منبع‌باز قرار داده است تا نوآوری و کاربرد معماری چندوجهی اصیل را در این جامعه تقویت کند. شرکت فناوری سنس‌تایم اعلام کرده است که با همکاری منبع‌باز و اجرای سناریوها، متعهد به ساخت نئو به‌عنوان زیرساخت هوش مصنوعی نسل بعدی با قابلیت مقیاس‌پذیری و استفادهٔ مجدد است؛ این امر به گسترش گستردهٔ فناوری چندوجهی اصیل از آزمایشگاه به کاربردهای صنعتی کمک می‌کند و ساخت استانداردهای فناوری چندوجهی اصیل سطح صنعتی نسل بعدی را تسریع می‌کند.

دربارهٔ ما
تلفن: ۰۵۱۸-۸۰۲۳۶۶۹۹
پست الکترونیکی: [email protected]
آدرس: منطقهٔ هایژو، شهر لیان‌یون‌گانگ، استان جیانگسو
سکوی خدمات دولتی وزارت seguir صنعت و فناوری اطلاعات
آماده‌سازی ICP استان سو: ۲۰۲۵۲۱۱۹۱۴
شماره امنیتی شبکهٔ عمومی استان سو: ۳۲۰۷۰۶۰۲۰۱۰۱۸۴
پشتیبانی فنی: شرکت فناوری شیائولا جیانگسو محدود
فیسبوک فیسبوک
فیسبوک
واتساپ واتساپ
واتساپ