หมวดหมู่ทั้งหมด

ย้ายจากแนวคิด 'การผสานรวมข้อมูล' สู่ 'สถาปัตยกรรมแบบเนทีฟ': เซนส์ไทม์เปิดตัวสถาปัตยกรรม NEO เพื่อกำหนดขอบเขตประสิทธิภาพใหม่ของโมเดลแบบมัลติโมดัล

2026-09-18

เซนส์ไทม์ ได้เปิดตัวและเผยแพร่สถาปัตยกรรมโมเดลมัลติโมดัลรุ่นใหม่ชื่อ NEO อย่างเป็นทางการ โดยพัฒนาร่วมกับ S-Lab มหาวิทยาลัยหนานหยาง เทคโนโลยี ซึ่งวางรากฐานสำหรับสถาปัตยกรรมรุ่นใหม่ของโมเดลมัลติโมดัลเซนส์โนวา
ในฐานะสถาปัตยกรรมมัลติโมดัลแบบเนทีฟ (Native VLM) รุ่นแรกของอุตสาหกรรมที่พร้อมใช้งานจริง และสามารถบรรลุการผสานรวมอย่างลึกซึ้ง NEO ได้ก้าวข้ามข้อจำกัดของแนวทางแบบ 'แยกส่วน' แบบดั้งเดิมตั้งแต่ระดับหลักการพื้นฐาน และออกแบบอย่างสร้างสรรค์เพื่อให้ 'เกิดมาเพื่อมัลติโมดัลโดยแท้จริง' โดยการผสานรวมหลายรูปแบบเข้าด้วยกันอย่างลึกซึ้งในระดับแกนกลางของสถาปัตยกรรม ทำให้เกิดความก้าวหน้าอย่างครอบคลุมทั้งด้านประสิทธิภาพ ประสิทธิผล และความเป็นสากล จึงกำหนดขอบเขตใหม่ของประสิทธิภาพสำหรับโมเดลมัลติโมดัล และถือเป็นสัญญาณชัดเจนว่าเทคโนโลยีมัลติโมดัลของปัญญาประดิษฐ์ได้ก้าวเข้าสู่ยุคใหม่แห่ง 'สถาปัตยกรรมแบบเนทีฟ' อย่างเป็นทางการ
ก้าวข้ามข้อจำกัดที่เคยมี ลาจากแนวทางแบบ 'ต่อเติม' และก้าวเข้าสู่แนวทางแบบ 'เนทีฟ'
ปัจจุบัน โมเดลมัลติโมดัลหลักในอุตสาหกรรมส่วนใหญ่ยังคงใช้แนวทางแบบแยกส่วน ซึ่งประกอบด้วย "เอนโค้เดอร์ภาพ + โปรเจกเตอร์ + โมเดลภาษา" วิธีการขยายผลนี้ที่อิงจากโมเดลภาษาขนาดใหญ่ (LLM) ทำให้สามารถรองรับข้อมูลภาพได้ แต่โดยพื้นฐานแล้วยังเน้นที่ภาษาเป็นหลัก ส่วนการผสานรวมระหว่างภาพกับภาษาจึงยังจำกัดอยู่เพียงระดับข้อมูลเท่านั้น การออกแบบแบบ "เชื่อมต่อชิ้นส่วน" ลักษณะนี้ไม่เพียงแต่มีประสิทธิภาพการเรียนรู้ต่ำ แต่ยังจำกัดความสามารถของโมเดลในการประมวลผลสถานการณ์มัลติโมดัลที่ซับซ้อน เช่น การจับรายละเอียดของภาพ หรือการเข้าใจโครงสร้างเชิงพื้นที่ที่ซับซ้อน สถาปัตยกรรม SenseTime NEO ถูกพัฒนาขึ้นมาเพื่อแก้ไขจุดบกพร่องนี้โดยเฉพาะ ตั้งแต่ช่วงครึ่งหลังของปี 2024 บริษัท Shangtang ได้บรรลุความก้าวหน้าสำคัญในการพัฒนาเทคโนโลยีการฝึกฝนแบบผสานมัลติโมดัลโดยธรรมชาติ (native multimodal fusion training) เป็นรายแรกของจีน จนสามารถคว้าตำแหน่งผู้นำในการประเมินภาษา SuperCLUE และการประเมินมัลติโมดัล OpenCompass ด้วยโมเดลเพียงตัวเดียว จากเทคโนโลยีหลักนี้ บริษัทจึงพัฒนา Nissin SenseNova 6.0 ขึ้นมา ซึ่งมีความสามารถชั้นนำด้านการให้เหตุผลแบบมัลติโมดัล ต่อมา ในเดือนกรกฎาคม 2025 ได้เปิดตัว Nichiron SenseNova 6.5 ซึ่งบรรลุการผสานแบบเริ่มต้น (early fusion) ที่ระดับเอนโค้เดอร์ เพิ่มประสิทธิภาพต้นทุน-ผลลัพธ์ของโมเดลมัลติโมดัลเป็นสามเท่า และเป็นโมเดลแรกของจีนที่เปิดให้ใช้งานจริงสำหรับการอนุมานแบบสลับภาพกับข้อความ (graphic-text interleaving inference) ในระดับเชิงพาณิชย์ ขณะนี้ SenseTime ได้ก้าวไปอีกขั้นด้วยการละทิ้งโครงสร้างแบบแยกส่วนแบบดั้งเดิมอย่างสิ้นเชิง และเริ่มต้นใหม่ตั้งแต่หลักการพื้นฐาน โดยเปิดตัวสถาปัตยกรรม NEO แบบ native ที่ออกแบบขึ้นมาใหม่ทั้งหมด
นวัตกรรมหลักสามประการที่ทำให้เกิดความเป็นหนึ่งเดียวกันอย่างลึกซึ้งระหว่างการมองเห็นกับภาษา
สถาปัตยกรรม NEO สร้างขึ้นบนแนวคิดหลักสองประการ คือ ประสิทธิภาพสูงสุดและการผสานรวมอย่างลึกซึ้ง โดยอาศัยนวัตกรรมระดับพื้นฐานในสามมิติสำคัญ ได้แก่ กลไกการให้ความสนใจ (attention mechanism), การเข้ารหัสตำแหน่ง (positional encoding) และการจับคู่เชิงความหมาย (semantic mapping) ซึ่งทำให้โมเดลมีความสามารถโดยธรรมชาติในการจัดการทั้งข้อมูลภาพและภาษาอย่างบูรณาการ
การฝังแพตช์แบบเนทีฟ (Native Patch Embedding): ละทิ้งตัวแปลงโทเคนภาพแบบแยกส่วน (discrete image tokenizers) และสร้างการจับคู่แบบต่อเนื่องจากพิกเซลไปยังคำ ตั้งแต่ระดับล่างสุดขึ้นไปยังระดับบนสุด ผ่านเลเยอร์ฝังแพตช์เฉพาะ (Patch Embedding Layer: PEL) แบบไม่ซ้ำใคร การออกแบบนี้สามารถจับรายละเอียดของภาพได้อย่างแม่นยำยิ่งขึ้น และทำลายข้อจำกัดพื้นฐานของการสร้างแบบจำลองภาพในโมเดลกระแสหลัก
โรเพ่แบบเนทีฟ: แยกการจัดสรรความถี่เชิงพื้นที่-เวลาสามมิติอย่างสร้างสรรค์ โดยใช้ความถี่สูงในมิติภาพ และความถี่ต่ำในมิติข้อความ ซึ่งสอดคล้องอย่างสมบูรณ์กับโครงสร้างธรรมชาติของทั้งสองรูปแบบ วิธีนี้ไม่เพียงแต่ช่วยให้ NEO จับโครงสร้างเชิงพื้นที่ของภาพได้อย่างแม่นยำ แต่ยังมีศักยภาพในการขยายไปยังฉากที่ซับซ้อน เช่น การประมวลผลวิดีโอและการสร้างแบบจำลองข้ามเฟรม
แอตเทนชันแบบมัลติเฮดแบบเนทีฟ: เพื่อตอบสนองต่อลักษณะเฉพาะของรูปแบบต่าง ๆ NEO ได้นำแอตเทนชันแบบออโตเรเกรสซีฟมาใช้กับโทเคนข้อความ และแอตเทนชันแบบสองทิศทางกับโทเคนภาพภายในกรอบเดียวกัน การออกแบบนี้ช่วยยกระดับการใช้ประโยชน์จากความสัมพันธ์เชิงโครงสร้างเชิงพื้นที่ในโมเดลอย่างมาก จึงสนับสนุนการเข้าใจและให้เหตุผลเกี่ยวกับภาพและข้อความผสมที่ซับซ้อนได้ดียิ่งขึ้น
นอกจากนี้ ด้วยกลยุทธ์การฝึกแบบผสานสองขั้นตอนที่มีนวัตกรรมคือ Pre Buffer & Post LLM NEO สามารถดูดซับความสามารถในการให้เหตุผลด้วยภาษาอย่างสมบูรณ์ของ LLM ต้นฉบับ ขณะเดียวกันก็สร้างความสามารถในการรับรู้ภาพที่ทรงพลังขึ้นมาใหม่ตั้งแต่เริ่มต้น จึงแก้ปัญหาการเสื่อมถอยของความสามารถด้านภาษาในกระบวนการฝึกแบบข้ามโมดัลแบบดั้งเดิมได้อย่างสิ้นเชิง
ประสิทธิภาพที่ผ่านการทดสอบ: ใช้ข้อมูลเพียงหนึ่งในสิบส่วนเพื่อประเมินประสิทธิภาพระดับเรือธง
ขับเคลื่อนด้วยนวัตกรรมด้านสถาปัตยกรรม NEO แสดงให้เห็นถึงประสิทธิภาพในการจัดการข้อมูลที่น่าทึ่งและข้อได้เปรียบด้านประสิทธิภาพ: ประสิทธิภาพในการจัดการข้อมูลสูงมาก — โดยใช้ข้อมูลเพียงหนึ่งในสิบของปริมาณข้อมูลที่โมเดลคู่แข่งในอุตสาหกรรมใช้เพื่อบรรลุระดับประสิทธิภาพเทียบเท่า (ตัวอย่างคู่ภาพ-ข้อความ 390 ล้านชุด) NEO สามารถพัฒนาความสามารถในการรับรู้ภาพระดับแนวหน้าได้ ไม่จำเป็นต้องอาศัยข้อมูลจำนวนมากหรือเอนโค้เดอร์ภาพเพิ่มเติม สถาปัตยกรรมที่กระชับของมันสามารถทำคะแนนเทียบเท่าโมเดลเรือธงแบบแยกส่วนชั้นนำ เช่น Qwen2-VL และ InternVL3 ในการประเมินความเข้าใจภาพหลายประเภท ประสิทธิภาพยอดเยี่ยมและสมดุล: ในการประเมินสาธารณะที่เชื่อถือได้หลายรายการ เช่น MMMU, MMB, MMStar, SEED-I และ POPE สถาปัตยกรรม NEO ทำคะแนนสูงอย่างต่อเนื่อง แสดงให้เห็นถึงประสิทธิภาพโดยรวมที่เหนือกว่า VLM แบบเนทีฟอื่น ๆ ซึ่งสะท้อนถึงหลักการ ‘ความแม่นยำไร้การสูญเสีย’ ของสถาปัตยกรรมแบบเนทีฟอย่างแท้จริง ประสิทธิภาพด้านการให้เหตุผลสูงสุด: โดยเฉพาะในช่วงจำนวนพารามิเตอร์ 0.6B–8B NEO มีข้อได้เปรียบอย่างชัดเจนสำหรับการนำไปใช้งานบนอุปกรณ์ขอบ (edge deployment) ไม่เพียงแต่บรรลุการก้าวกระโดดทั้งด้านความแม่นยำและประสิทธิภาพพร้อมกัน แต่ยังลดต้นทุนการประมวลผลผลลัพธ์ลงอย่างมีนัยสำคัญ จึงยกระดับ ‘ประสิทธิภาพต่อต้นทุน’ ของการรับรู้ภาพแบบมัลติโมดัลให้สูงสุด เปิดให้เข้าร่วมพัฒนาร่วมกันอย่างกว้างขวาง
การสร้างสถาปัตยกรรมโครงสร้างพื้นฐานของปัญญาประดิษฐ์รุ่นต่อไป คือ โครงร่างหลักของโมเดล และมีเพียงโครงร่างที่แข็งแรงเท่านั้นที่จะสามารถรองรับอนาคตของเทคโนโลยีแบบหลายรูปแบบได้
การออกแบบการผสานรวมตั้งแต่ระยะแรกของสถาปัตยกรรม NEO รองรับการป้อนภาพที่มีความละเอียดตามต้องการและภาพความยาวมาก ขยายตัวอย่างไร้รอยต่อสู่สาขาล้ำสมัย เช่น วิดีโอและปัญญาประดิษฐ์เชิงกายภาพ (embodied intelligence) ทำให้เกิดการผสานรวมอย่างแท้จริงตั้งแต่ระดับล่างสุดจนถึงระดับบนสุด และแบบ end-to-end อย่างสมบูรณ์ จาุมุมมองการใช้งานจริง การออกแบบการผสานรวมแบบเนทีฟ (native integration) แบบ end-to-end นี้ ให้การสนับสนุนทางเทคนิคที่มั่นคงสำหรับการประยุกต์ใช้ในหลากหลายสถานการณ์ เช่น การโต้ตอบเชิงกายภาพของหุ่นยนต์ (robot embodied interaction) การตอบสนองแบบหลายรูปแบบบนอุปกรณ์อัจฉริยะ (intelligent terminal multimodal response) การเข้าใจวิดีโอ (video understanding) การโต้ตอบแบบสามมิติ (3D interaction) และปัญญาประดิษฐ์เชิงกายภาพ (embodied intelligence)
ปัจจุบัน เซนส์ไทม์ได้เปิดตัวแบบจำลองสองรุ่นที่อิงตามสถาปัตยกรรม NEO คือรุ่น 2B และ 9B อย่างเป็นทางการในรูปแบบโอเพนซอร์ส เพื่อส่งเสริมการสร้างสรรค์นวัตกรรมและการประยุกต์ใช้งานในชุมชนโอเพนซอร์สเกี่ยวกับสถาปัตยกรรมมัลติโมดัลแบบเนทีฟ เซนส์ไทม์ เทคโนโลยี ระบุว่า บริษัทมุ่งมั่นที่จะพัฒนา NEO ให้กลายเป็นโครงสร้างพื้นฐานด้านปัญญาประดิษฐ์รุ่นถัดไปที่สามารถปรับขนาดได้และนำกลับมาใช้ใหม่ได้ผ่านความร่วมมือด้านโอเพนซอร์สและการนำไปใช้งานจริงในสถานการณ์ต่าง ๆ โดยส่งเสริมให้เทคโนโลยีมัลติโมดัลแบบเนทีฟถูกนำไปใช้งานในเชิงอุตสาหกรรมอย่างแพร่หลายจากห้องปฏิบัติการ และเร่งการพัฒนามาตรฐานเทคโนโลยีมัลติโมดัลแบบเนทีฟระดับอุตสาหกรรมรุ่นถัดไป

เกี่ยวกับเรา
โทรศัพท์: 0518-80236699
อีเมล: [email protected]
ที่อยู่: เขตไห่โจว เมืองเหลียนหยุนกัง มณฑลเจียงซู
แพลตฟอร์มบริการของรัฐบาลกระทรวงอุตสาหกรรมและเทคโนโลยีสารสนเทศ
เตรียมพร้อมตามรหัส ICP ของมณฑลซู 2025211914
เลขที่ความมั่นคงไซเบอร์ของสำนักงานตำรวจมณฑลซู 32070602010184
ฝ่ายสนับสนุนเทคนิค: บริษัท เจียงซู เซียวลา เทคโนโลยี จำกัด
เฟซบุ๊ก เฟซบุ๊ก
เฟซบุ๊ก
วอตส์แอป วอตส์แอป
วอตส์แอป