সেন্সটাইম আনুষ্ঠানিকভাবে তার নতুন মাল্টিমোডাল মডেল আর্কিটেকচার, এনইও-কে প্রকাশ করেছে এবং ওপেন সোর্স করেছে, যা ন্যানইয়াং টেকনোলজিক্যাল ইউনিভার্সিটি এস-ল্যাব-এর সহযোগিতায় উন্নয়ন করা হয়েছে, এবং সেন্সনোভা মাল্টিমোডাল মডেলের জন্য একটি নতুন প্রজন্মের আর্কিটেকচারের ভিত্তি স্থাপন করেছে।
শিল্পের প্রথম উপলব্ধ নেটিভ মাল্টিমোডাল আর্কিটেকচার (নেটিভ ভিএলএম) হিসেবে, যা গভীর একীকরণ অর্জন করে, এনইও ঐতিহ্যগত "মডুলার" প্যারাডাইমের বন্ধনকে মূল নীতি থেকে ভেঙে দেয় এবং উদ্ভাবনীভাবে "মাল্টিমোডালের জন্য বিশেষভাবে জন্মগ্রহণকৃত" হওয়ার জন্য ডিজাইন করা হয়েছে। কোর আর্কিটেকচার স্তরে বহু মোডালিটির গভীর একীকরণের মাধ্যমে এটি কার্যকারিতা, দক্ষতা এবং সার্বজনীনতায় একটি সমগ্র ভাবে অগ্রগতি অর্জন করে, মাল্টিমোডাল মডেলগুলির কার্যকারিতার সীমা পুনর্সংজ্ঞায়িত করে এবং কৃত্রিম বুদ্ধিমত্তা মাল্টিমোডাল প্রযুক্তির আনুষ্ঠানিকভাবে "নেটিভ আর্কিটেকচার"-এর নতুন যুগে প্রবেশের ঘোষণা করে।
বাধা অতিক্রম করা, 'প্যাচওয়ার্ক' থেকে বিদায় জানানো এবং 'নেটিভ' গ্রহণ করা
বর্তমানে, শিল্পের প্রধান বহু-মোডাল মডেলগুলি সাধারণত "দৃশ্য এনকোডার+প্রজেক্টর+ভাষা মডেল" এই পৃথক পৃথক অংশের সমন্বয়ে গঠিত মডুলার প্যারাডাইম অনুসরণ করে। বৃহৎ ভাষা মডেল (LLM)-এর উপর ভিত্তি করে এই সম্প্রসারণ পদ্ধতি ছবি ইনপুটের সাথে সামঞ্জস্যতা অর্জন করে, কিন্তু মূলত এখনও ভাষার উপর কেন্দ্রিভূত থাকে এবং ছবি ও ভাষার সংমিশ্রণ শুধুমাত্র ডেটা স্তরেই সীমাবদ্ধ থাকে। এই "জোড়াতালি" ডিজাইনটি শুধু শেখার দক্ষতা কম রাখে না, বরং ছবির বিস্তারিত বুঝতে পারা বা জটিল স্থানিক গঠন বোঝার মতো জটিল বহু-মোডাল পরিস্থিতিতে মডেলের প্রক্রিয়াকরণ ক্ষমতাকেও সীমিত করে। সেন্সটাইম নিও আর্কিটেকচার এই সমস্যার সমাধানের জন্য তৈরি করা হয়েছে। ২০২৪ সালের দ্বিতীয়ার্ধে শাংটাং চীনে প্রথম বার বহু-মোডাল নেটিভ ফিউশন ট্রেনিং প্রযুক্তিতে ভাঙন ঘটায়, একটি একক মডেল দিয়ে সুপারক্লু ভাষা মূল্যায়ন এবং ওপেনকম্পাস বহু-মোডাল মূল্যায়নে সফল হয়, এবং এই মূল প্রযুক্তির ভিত্তিতে নিসিন সেন্সনোভা ৬.০ তৈরি করে যা বহু-মোডাল যুক্তিবিদ্যায় অগ্রণী ক্ষমতা অর্জন করে। এরপর, জুলাই ২০২৫-এ নিচিরন সেন্সনোভা ৬.৫ মুক্তি পায়, যা এনকোডার স্তরে প্রাথমিক ফিউশন অর্জন করে, বহু-মোডাল মডেলগুলির খরচ-কার্যকারিতা তিনগুণ বৃদ্ধি করে এবং চীনে প্রথম বাণিজ্যিক মানের গ্রাফিক ও টেক্সট একসাথে প্রক্রিয়াকরণের অবকাশ তৈরি করে। সেন্সটাইম এখন ঐতিহ্যগত মডুলার গঠন সম্পূর্ণরূপে ত্যাগ করেছে এবং মৌলিক নীতি থেকে শুরু করে সম্পূর্ণ নতুনভাবে ডিজাইন করা নিও নেটিভ আর্কিটেকচার চালু করেছে।
তিনটি মূল উদ্ভাবন দৃষ্টি এবং ভাষার গভীর ঐক্য অর্জন করে
NEO আর্কিটেকচারটি চূড়ান্ত দক্ষতা এবং গভীর একীকরণের মূল ধারণার উপর ভিত্তি করে প্রতিষ্ঠিত; এবং মনোযোগ ব্যবস্থা, অবস্থান এনকোডিং এবং অর্থ ম্যাপিং—এই তিনটি মূল মাত্রায় মৌলিক উদ্ভাবনের মাধ্যমে মডেলটি স্বতঃস্ফূর্তভাবে দৃশ্য ও ভাষা উভয়কে একত্রিতভাবে পরিচালনা করার ক্ষমতা অর্জন করে
নেটিভ প্যাচ এম্বেডিং: বিচ্ছিন্ন ইমেজ টোকেনাইজারগুলি ত্যাগ করে এবং একটি অনন্য প্যাচ এম্বেডিং লেয়ার (PEL) এর মাধ্যমে পিক্সেল থেকে শব্দে নিম্ন-উচ্চ পর্যায়ে চলমান ম্যাপিং গঠন করে। এই ডিজাইনটি ইমেজের বিস্তারিত বিষয়গুলি আরও সূক্ষ্মভাবে ধারণ করতে পারে এবং প্রধান মডেলগুলিতে ইমেজ মডেলিংয়ের বোটলনেক সমস্যাকে মৌলিকভাবে ভেঙে দেয়।
দেশীয় রোপি: এটি তিন-মাত্রিক স্থান-সময় কম্পাঙ্ক বণ্টনকে উদ্ভাবনীভাবে আলাদা করে, দৃশ্যমান মাত্রায় উচ্চ কম্পাঙ্ক এবং লেখার মাত্রায় নিম্ন কম্পাঙ্ক ব্যবহার করে, যা উভয় মোডালিটির প্রাকৃতিক গঠনের সাথে সম্পূর্ণরূপে মানানসই। এটি শুধুমাত্র নিও-কে ছবির স্থানিক গঠন সঠিকভাবে ধরা দেওয়ার ক্ষমতা দেয় না, বরং ভিডিও প্রক্রিয়াকরণ এবং ফ্রেম-অতিক্রমী মডেলিং-এর মতো জটিল দৃশ্যে নির্বিঘ্নে প্রসারিত হওয়ার সম্ভাবনাও রাখে।
দেশীয় মাল্টি হেড অ্যাটেনশন: বিভিন্ন মোডালিটির বৈশিষ্ট্যগুলির প্রতি সাড়া দিয়ে, নিও একটি একীভূত ফ্রেমওয়ার্কের মধ্যে লেখার টোকেনগুলির জন্য স্ব-প্রবাহী অ্যাটেনশন এবং দৃশ্যমান টোকেনগুলির জন্য উভমুখী অ্যাটেনশন উভয়ই বাস্তবায়ন করেছে। এই নকশাটি মডেলের মধ্যে স্থানিক গঠন সম্পর্কের ব্যবহারকে উল্লেখযোগ্যভাবে বাড়ায়, ফলে জটিল চিত্র ও লেখা-মিশ্রিত বোঝাপড়া এবং যুক্তিসঙ্গত চিন্তার সমর্থন আরও ভালোভাবে করা যায়।
এছাড়াও, উদ্ভাবনী প্রি-বাফার এবং পোস্ট-এলএলএম দুই-পর্যায়ের ফিউশন ট্রেনিং কৌশলের মাধ্যমে, নিও মূল এলএলএম-এর সম্পূর্ণ ভাষাগত যুক্তিবিদ্যা ক্ষমতা শোষণ করতে পারে এবং এককভাবে শক্তিশালী দৃশ্য ধারণ ক্ষমতা গড়ে তোলে, যা ঐতিহ্যগত ক্রস-মোডাল ট্রেনিংয়ে ভাষাগত ক্ষমতা হ্রাসের সমস্যাটি সম্পূর্ণরূপে সমাধান করে।
পরীক্ষিত কর্মক্ষমতা: ফ্ল্যাগশিপ-স্তরের কর্মক্ষমতা মূল্যায়নের জন্য ডেটার এক-দশমাংশ ব্যবহার করা হয়েছে
স্থাপত্য উদ্ভাবনের দ্বারা চালিত হয়ে, নিও অবিশ্বাস্য ডেটা দক্ষতা এবং কার্যকারিতা সুবিধার প্রমাণ দিয়েছে: অত্যন্ত উচ্চ ডেটা দক্ষতা—শুধুমাত্র শিল্পের সমতুল্য কার্যকারিতা মডেলগুলির (৩৯ কোটি ছবি-পাঠ্য উদাহরণ) ডেটার মাত্র ১/১০ পরিমাণ ব্যবহার করে নিও শীর্ষস্থানীয় দৃশ্যমান ধারণার ক্ষমতা বিকাশ করতে পারে। বৃহৎ ডেটা এবং অতিরিক্ত দৃশ্যমান এনকোডারের উপর নির্ভর না করে, এর সংক্ষিপ্ত স্থাপত্য কয়েকটি দৃশ্যমান বোধগম্যতা কাজে Qwen2-VL এবং InternVL3-এর মতো শীর্ষ মডুলার ফ্ল্যাগশিপ মডেলগুলির সমতুল্য কার্যকারিতা অর্জন করতে পারে। উত্কৃষ্ট ও সুষম কার্যকারিতা—MMMU, MMB, MMStar, SEED-I, POPE ইত্যাদি একাধিক প্রকাশিত কর্তৃপক্ষের মূল্যায়নে নিও স্থাপত্য উচ্চ স্কোর অর্জন করেছে, যা অন্যান্য মূল ভিএলএম-এর তুলনায় ব্যাপক কার্যকারিতার শ্রেষ্ঠত্ব প্রদর্শন করে এবং সত্যিকার অর্থে মূল স্থাপত্যের "সূক্ষ্মতা ক্ষতিহীন" বাস্তবায়ন ঘটিয়েছে। চূড়ান্ত যুক্তিভিত্তিক খরচ-কার্যকারিতা—বিশেষ করে ০.৬ বিলিয়ন থেকে ৮ বিলিয়ন প্যারামিটার পরিসরে, নিও-এর প্রান্ত প্রয়োগে উল্লেখযোগ্য সুবিধা রয়েছে। এটি নির্ভুলতা ও দক্ষতায় দ্বৈত লাফ অর্জন করে এবং অনুমান খরচ উল্লেখযোগ্যভাবে কমিয়ে মাল্টিমোডাল দৃশ্যমান ধারণার "খরচ-কার্যকারিতা"-কে সর্বোচ্চ সীমায় নিয়ে যায় চরম। ওপেন সোর্স সহ-নির্মাণ
এআই অবকাঠামোর পরবর্তী প্রজন্ম গড়ে তোলা হলো মডেলের "কঙ্কাল"; শুধুমাত্র দৃঢ় কঙ্কাল থাকলেই বহু-মোডাল প্রযুক্তির ভবিষ্যতকে সমর্থন করা সম্ভব।
NEO আর্কিটেকচারের প্রারম্ভিক ফিউশন ডিজাইন যেকোনো রেজোলিউশন এবং দীর্ঘ চিত্র ইনপুটকে সমর্থন করে, যা ভিডিও এবং এমবডিড ইন্টেলিজেন্সের মতো অগ্রণী ক্ষেত্রগুলিতে নিরবচ্ছিন্নভাবে প্রসারিত হয়, এবং নীচ থেকে শীর্ষ পর্যন্ত এবং প্রান্ত থেকে প্রান্ত পর্যন্ত সত্যিকারের ফিউশন অর্জন করে। প্রয়োগের দৃষ্টিকোণ থেকে, প্রান্ত থেকে প্রান্ত পর্যন্ত "দেশজ একীভূতকরণ" ডিজাইন রোবট এমবডিড ইন্টারঅ্যাকশন, বুদ্ধিমান টার্মিনালের বহু-মোডাল প্রতিক্রিয়া, ভিডিও বোঝাপড়া, ৩ডি ইন্টারঅ্যাকশন এবং এমবডিড ইন্টেলিজেন্সের মতো বিভিন্ন পরিস্থিতির প্রয়োগের জন্য দৃঢ় প্রযুক্তিগত সমর্থন প্রদান করে।
বর্তমানে, সেন্সটাইম নেও আর্কিটেকচারের উপর ভিত্তি করে দুটি স্পেসিফিকেশন মডেল—২বি এবং ৯বি—কে ওপেন সোর্স হিসেবে আনুষ্ঠানিকভাবে মুক্ত করেছে, যাতে ওপেন সোর্স কমিউনিটিতে নেটিভ মাল্টিমোডাল আর্কিটেকচারের উদ্ভাবন ও প্রয়োগ বৃদ্ধি পায়। সেন্সটাইম টেকনোলজি ঘোষণা করেছে যে, ওপেন সোর্স সহযোগিতা এবং প্রাসঙ্গিক বাস্তবায়নের মাধ্যমে নেও-কে একটি স্কেলেবল ও পুনঃব্যবহারযোগ্য পরবর্তী প্রজন্মের এআই ইনফ্রাস্ট্রাকচার হিসেবে গড়ে তোলার জন্য তারা প্রতিশ্রুতিবদ্ধ; এটি ল্যাবরেটরিতে নেটিভ মাল্টিমোডাল প্রযুক্তির ব্যাপক শিল্পগত প্রয়োগকে ত্বরান্বিত করবে এবং পরবর্তী প্রজন্মের শিল্প-স্তরের নেটিভ মাল্টিমোডাল প্রযুক্তির মানদণ্ড গঠনকে ত্বরান্বিত করবে।