جميع الفئات

الانتقال من «دمج البيانات» إلى «الهندسة المعمارية الأصلية»: تُطلق شركة سينس تايم بنية نيو (NEO) وتُعيد تحديد حدود الأداء للنماذج متعددة الوسائط

2026-09-18

أطلقت شركة سينس تايم رسميًّا معمارية نموذجها المتعدد الوسائط الجديدة «نيو»، وجعلتها مفتوحة المصدر، بعد أن طوَّرتها بالتعاون مع مختبر إس-لاب في جامعة نانيانغ التكنولوجية. وبذلك وضعت الأساس لمعمارية جديدة تمامًا لنموذج سينس نوفا المتعدد الوسائط.
وبوصفها أول معمارية متعددة الوسائط أصلية (ناتيف فِلم) متاحة في القطاع وت loge تكامُلًا عميقًا، فإن «نيو» تكسر القيود المفروضة من النموذج التقليدي القائم على «الوحدات المنفصلة» عند مستوى المبادئ الأساسية، وتبتكر تصميمًا جديدًا يركِّز على كونها «مُصمَّمة منذ البداية خصيصًا للوسائط المتعددة». وبفضل التكامل العميق بين الوسائط المختلفة على مستوى البنية الأساسية للمعمارية، تحقِّق «نيو» قفزة شاملة في الأداء والكفاءة والشمولية، ما يعيد تحديد الحدود القصوى للأداء في النماذج المتعددة الوسائط، ويُعلن رسميًّا دخول تقنية الذكاء الاصطناعي المتعددة الوسائط عصرًا جديدًا يرتكز على «المعماريات الأصلية».
اختراق العقبات، والوداع النهائي لأسلوب «التجميع المؤقت»، والانفتاح على مفهوم «الأصالة»
حاليًّا، تتبع النماذج متعددة الوسائط السائدة في القطاع إلى حدٍّ كبير النموذج الوحدوي المكوَّن من «مشفر بصري + مُ projecting وحدة + نموذج لغوي كبير». وتتيح هذه الطريقة التوسعية القائمة على النموذج اللغوي الكبير (LLM) التوافق مع إدخال الصور، لكنها تركِّز جوهريًّا ما زالت على اللغة، بينما يقتصر دمج الصور واللغة على مستوى البيانات فقط. ولا يؤدي هذا التصميم «المركب» إلى كفاءة تعلُّم منخفضة فحسب، بل ويحدُّ أيضًا من قدرة النموذج على معالجة السيناريوهات المعقدة متعددة الوسائط، مثل تلك التي تتطلب التقاط التفاصيل الدقيقة في الصور أو فهم الهياكل المكانية المعقدة. وقد وُلد هيكل SenseTime NEO لمعالجة هذه العقبة. ففي النصف الثاني من عام ٢٠٢٤، سبقت شركة شانغتانغ جميع الجهات في الصين في تحقيق اختراقٍ في تقنية التدريب الأصلي المدمج متعدد الوسائط، وحقَّقت نجاحًا باهرًا في تقييم SuperCLUE اللغوي وتقييم OpenCompass متعدد الوسائط باستخدام نموذج واحد فقط. واستندت الشركة بعد ذلك إلى هذه التقنية الأساسية لإطلاق نموذج Nissin SenseNova ٦٫٠، الذي حقَّق قدرات رائدة في الاستنتاج متعدد الوسائط. وبعد ذلك، في يوليو ٢٠٢٥، أُطلِق نموذج Nichiron SenseNova ٦٫٥، الذي حقَّق الاندماج المبكر على مستوى المشفر، وضاعف فعالية التكلفة في النماذج متعددة الوسائط ثلاث مرات، وكان أول نموذج تجاري في الصين يدعم استنتاج التداخل بين الرسومات والنصوص. وبادرت SenseTime بعد ذلك باتخاذ خطوة تالية جوهرية، حيث تخلَّفت تمامًا عن البنية الوحدوية التقليدية، وابتدأت من المبادئ الأساسية، فأطلقت هيكل NEO الأصلي المصمم منذ البداية.
ثلاث ابتكارات أساسية تحقِّق اتحادًا عميقًا بين الرؤية واللغة
يعتمد هيكل NEO على المفاهيم الأساسية للكفاءة القصوى والتكامل العميق، ومن خلال ابتكارات جذرية في ثلاثة أبعاد رئيسية: آلية الانتباه، والتشفير الموضعي، ورسم الخرائط الدلالي، يمتلك النموذج بشكل طبيعي القدرةَ على معالجة كلٍّ من الرؤية واللغة بطريقة موحَّدة.
التضمين الأصلي للقطع (Native Patch Embedding): يتخلَّى عن مشغِّلات الرموز الصورية المنفصلة، ويبني خريطةً مستمرةً من البكسلات إلى الكلمات من الأسفل إلى الأعلى عبر طبقة تضمين القطع الفريدة (PEL). وتسمح هذه التصميمات بالتقاط تفاصيل الصورة بدقة أكبر، وتكسر جذريًّا حاجز الأداء في نمذجة الصور لدى النماذج السائدة.
الروابط الأصلية المُعتمدة على الترددات المكانية والزمنية (RoPE): تُفصِّل بطريقة مبتكرة توزيع الترددات ثلاثية الأبعاد مكانياً وزمنياً، مستخدمةً الترددات العالية في البُعد البصري والترددات المنخفضة في البُعد النصي، مما يتناغم تماماً مع البنية الطبيعية لكلا الوسيلتين. وهذا لا يمكّن نيو (NEO) فحسب من استيعاب البنية المكانية للصور بدقة، بل ويمنحه أيضاً القدرةَ على التوسع السلس نحو مشاهد معقدة مثل معالجة الفيديو ونمذجة الإطارات المتداخلة.
الانتباه متعدد الرؤوس الأصلي: استجابةً لخصائص الوسائط المختلفة، نفّذ نيو (NEO) كلاً من الانتباه التلقائي التسلسلي (autoregressive) لرموز النصوص والانتباه ثنائي الاتجاه لرموز الصور ضمن إطار موحَّد. وهذه التصميمات تعزِّز بشكل كبير الاستفادة من الارتباطات البنائية المكانية داخل النموذج، ما يدعم بصورة أفضل الفهم والاستنتاج المعقدَين المدمجين بين الرسوم والنصوص.
وبالإضافة إلى ذلك، وباستخدام استراتيجية التدريب المبتكرة المكوَّنة من مرحلتين «المخزن المؤقت السابق ونموذج اللغة الكبير اللاحق»، يستطيع نظام NEO اكتساب القدرة الكاملة على الاستنتاج اللغوي الخاصة بنموذج اللغة الكبير الأصلي، مع بناء قدرة بصرية إدراكية قوية من الصفر، مما يحلُّ تمامًا مشكلة تدهور القدرات اللغوية في طرق التدريب التقليدية متعددة الوسائط.
الأداء المختبر: استُخدم عُشر البيانات لتقييم الأداء على مستوى الطرازات الرائدة.
وبفضل الابتكار في التصميم المعماري، أظهر نموذج نِيو كفاءةً استثنائيةً في معالجة البيانات ومزاياً أداءً مذهلةً: كفاءةٌ عاليةٌ جداً في استخدام البيانات: إذ يكتسب قدراتٍ بصريةً ممتازةً باستخدام كميةٍ من البيانات لا تتجاوز عُشرَ كمية البيانات التي تتطلبها النماذج المنافسة في القطاع (أي ٣٩٠ مليون مثالٍ من الصور والنصوص)، دون الحاجة إلى كمّ هائلٍ من البيانات أو مشفراتٍ بصريةٍ إضافيةٍ، ويتمكّن تصميمه الموجز من منافسة النماذج الرائدة الوحدية مثل كويين-٢-في.إل وانترن-في.إل-٣ في مهام فهم الصور المتعددة. وأداءٌ ممتازٌ ومتوازنٌ: فقد حقق هذا التصميم درجاتٍ مرتفعةً في تقييماتٍ عامةٍ موثوقةٍ عدةٍ مثل إم.إم.إم.يو، وإم.إم.بي، وإم.إم.ستار، وسييد-آي، وبوب، وغيرها، ما يدلّ على أداءٍ شاملٍ يفوق أداءَ النماذج الأصلية الأخرى متعددة الوسائط، محققاً بذلك «الدقة الكاملة دون أي خسارة» في التصميم الأصلي. وكفاءةٌ قصوى في التكلفة بالنسبة لمهام الاستنتاج: وخصوصاً ضمن نطاق الحجم المعياري من ٠,٦ مليار إلى ٨ مليارات معلّمة، يتمتّع نِيو بمزايا كبيرة في النشر على الأجهزة الطرفية. فهو لا يحقق قفزةً مزدوجةً في الدقة والكفاءة فحسب، بل ويقلّل تكاليف الاستنتاج بشكلٍ ملحوظٍ، ما يدفع «الكفاءة التكلفة» في إدراك الصور متعددة الوسائط إلى أقصى حدٍّ لها. مفتوح المصدر والبناء التعاوني المتطرف
يُعَدُّ بناء جيلٍ جديدٍ من هياكل أساسية للذكاء الاصطناعي هو «الهيكل العظمي» للنموذج، ولا يمكنه دعم مستقبل التكنولوجيا متعددة الوسائط إلا بوجود هيكل عظميٍّ متين.
يدعم تصميم الاندماج المبكر لهندسة NEO مقاسات صورٍ تعسفيةً ومدخلات صورٍ طويلة، ويمتد بسلاسةٍ إلى مجالات رائدة مثل الفيديو والذكاء الجسدي، ما يحقِّق اندماجًا حقيقيًّا من القاعدة إلى القمة ومن الطرف إلى الطرف. ومن منظور التطبيقات، يوفِّر التصميم المدمج «الأصلي من الطرف إلى الطرف» دعماً فنيًّا متينًا لتطبيقات سيناريوهات متنوِّعة مثل التفاعل الجسدي للروبوتات، والاستجابة متعددة الوسائط للأجهزة الذكية الطرفية، وفهم الفيديو، والتفاعل ثلاثي الأبعاد، والذكاء الجسدي.
في الوقت الراهن، أطلقت شركة سينس تايم رسميًّا نموذجين معياريَّين مبنيَّين على بنية «نيو» (NEO)، وهما النموذج ٢ب ونموذج ٩ب، كمصدر مفتوح لتعزيز الابتكار والتطبيقات في مجتمع المصادر المفتوحة المعني بالهياكل متعددة الوسائط الأصلية. وأفادت شركة سينس تايم تكنولوجي بأنها ملتزمةٌ بتطوير منصة «نيو» لتصبح بنيةً تحتيةً ذكائيةً جيليةً جديدةً قابلةً للتوسُّع وإعادة الاستخدام، وذلك عبر التعاون المفتوح والتطبيق العملي في سيناريوهات متنوعة، بهدف دفع التوظيف الصناعي الواسع النطاق لتكنولوجيا الوسائط المتعددة الأصلية من داخل المختبرات، وتسريع وضع معايير الجيل القادم من هذه التكنولوجيا على المستوى الصناعي.

من نحن
الهاتف: ٠٥١٨-٨٠٢٣٦٦٩٩
البريد الإلكتروني: [email protected]
العنوان: منطقة هايتشو، مدينة ليان يونغانغ، مقاطعة جيانغسو
منصة خدمات الحكومة التابعة لوزارة الصناعة وتكنولوجيا المعلومات
إعداد رقم إس يو آي سي بي ٢٠٢٥٢١١٩١٤
رقم أمان شبكة جيانغسو رقم ٣٢٠٧٠٦٠٢٠١٠١٨٤
الدعم الفني: شركة جيانغسو شياولا التكنولوجية المحدودة
فيسبوك فيسبوك
فيسبوك
واتساب واتساب
واتساب