Tất Cả Danh Mục

Chuyển từ "hội tụ dữ liệu" sang "kiến trúc gốc": SenseTime ra mắt kiến trúc NEO, định nghĩa lại giới hạn hiệu năng của các mô hình đa phương thức

2026-09-18

SenseTime chính thức phát hành và công bố mã nguồn mở kiến trúc mô hình đa phương thức mới của mình mang tên NEO, được phát triển thông qua hợp tác với Phòng thí nghiệm S-Lab thuộc Đại học Công nghệ Nanyang, từ đó đặt nền móng cho một thế hệ kiến trúc mới dành riêng cho mô hình đa phương thức SenseNova.
Là kiến trúc đa phương thức bản địa (Native VLM) đầu tiên trong ngành có sẵn và đạt được mức tích hợp sâu, NEO phá vỡ những ràng buộc của mô hình "theo mô-đun" truyền thống ngay từ các nguyên lý nền tảng, đồng thời thiết kế cách mạng theo hướng "sinh ra đặc biệt cho đa phương thức". Nhờ tích hợp sâu nhiều phương thức ngay ở cấp độ kiến trúc cốt lõi, NEO đạt bước đột phá toàn diện về hiệu năng, hiệu quả và tính phổ quát, tái định nghĩa giới hạn hiệu năng của các mô hình đa phương thức và đánh dấu sự gia nhập chính thức của công nghệ trí tuệ nhân tạo đa phương thức vào một kỷ nguyên mới mang tên "kiến trúc bản địa".
Vượt qua các điểm nghẽn, chia tay mô hình 'ghép nối', hướng tới mô hình 'bản địa'
Hiện nay, các mô hình đa phương thức chủ lưu trong ngành công nghiệp phần lớn tuân theo kiến trúc mô-đun gồm "bộ mã hóa thị giác + bộ chiếu (projector) + mô hình ngôn ngữ". Phương pháp mở rộng dựa trên Mô hình Ngôn ngữ Lớn (LLM) này đạt được khả năng tương thích với đầu vào hình ảnh, nhưng về bản chất vẫn tập trung chủ yếu vào ngôn ngữ, và việc kết hợp hình ảnh với ngôn ngữ chỉ dừng lại ở cấp độ dữ liệu. Thiết kế kiểu "ghép nối" này không chỉ có hiệu quả học tập thấp mà còn hạn chế khả năng xử lý của mô hình trong các tình huống đa phương thức phức tạp, chẳng hạn như nắm bắt chi tiết hình ảnh hoặc hiểu cấu trúc không gian phức tạp. Kiến trúc SenseTime NEO ra đời nhằm giải quyết điểm đau này. Ngay từ nửa cuối năm 2024, Shangtang đã dẫn đầu tại Trung Quốc trong việc đột phá công nghệ huấn luyện tích hợp đa phương thức gốc (native multimodal fusion), giành chiến thắng trong đánh giá ngôn ngữ SuperCLUE và đánh giá đa phương thức OpenCompass bằng một mô hình duy nhất; dựa trên công nghệ cốt lõi này, công ty đã phát triển Nissin SenseNova 6.0 để đạt được năng lực tiên phong trong suy luận đa phương thức. Sau đó, vào tháng 7 năm 2025, Nichiron SenseNova 6.5 được ra mắt, đạt được tích hợp sớm (early fusion) ở cấp độ bộ mã hóa (encoder), tăng hiệu quả chi phí – hiệu năng của các mô hình đa phương thức lên gấp ba lần, đồng thời là mô hình đầu tiên tại Trung Quốc triển khai suy luận xen kẽ đồ họa – văn bản (graphic-text interleaving inference) ở cấp thương mại. SenseTime tiếp tục tiến xa hơn bằng cách hoàn toàn từ bỏ cấu trúc mô-đun truyền thống và bắt đầu từ những nguyên lý nền tảng, cho ra đời kiến trúc NEO gốc (native architecture), được thiết kế hoàn toàn mới từ đầu.
Ba đột phá cốt lõi đạt được sự thống nhất sâu sắc giữa thị giác và ngôn ngữ
Kiến trúc NEO dựa trên các khái niệm cốt lõi về hiệu suất tối ưu và tích hợp sâu, đồng thời thông qua những đổi mới nền tảng trên ba chiều then chốt: cơ chế chú ý, mã hóa vị trí và ánh xạ ngữ nghĩa, mô hình tự nhiên sở hữu khả năng xử lý cả thị giác lẫn ngôn ngữ một cách thống nhất
Nhúng bản vá gốc (Native Patch Embedding): từ bỏ các bộ mã hóa token hình ảnh rời rạc và xây dựng một ánh xạ liên tục từ pixel sang từ vựng từ dưới lên trên thông qua lớp nhúng bản vá độc đáo (PEL). Thiết kế này có thể nắm bắt chi tiết hình ảnh tinh tế hơn, phá vỡ căn bản điểm nghẽn trong mô hình hóa hình ảnh của các mô hình phổ biến.
Native RoPE: tách rời một cách sáng tạo việc phân bổ tần số không gian – thời gian ba chiều, sử dụng tần số cao trong chiều thị giác và tần số thấp trong chiều văn bản, từ đó thích nghi hoàn hảo với cấu trúc tự nhiên của cả hai dạng thức. Điều này không chỉ giúp NEO nắm bắt chính xác cấu trúc không gian của ảnh mà còn có tiềm năng mở rộng liền mạch sang các tình huống phức tạp như xử lý video và mô hình hóa chéo khung hình.
Native Multi Head Attention: Để đáp ứng đặc điểm riêng của từng dạng thức, NEO đã triển khai đồng thời cơ chế chú ý tự hồi quy (autoregressive attention) cho các token văn bản và cơ chế chú ý hai chiều (bidirectional attention) cho các token thị giác trong một khuôn khổ thống nhất. Thiết kế này nâng cao đáng kể khả năng khai thác tương quan cấu trúc không gian trong mô hình, nhờ đó hỗ trợ tốt hơn việc hiểu và suy luận kết hợp giữa đồ họa và văn bản ở mức độ phức tạp.
Ngoài ra, với chiến lược huấn luyện hợp nhất hai giai đoạn sáng tạo Pre Buffer & Post LLM, NEO có thể tiếp thu toàn bộ khả năng suy luận ngôn ngữ của LLM gốc đồng thời xây dựng khả năng nhận thức thị giác mạnh mẽ từ đầu, giải quyết triệt để vấn đề suy giảm khả năng ngôn ngữ trong huấn luyện chéo mô-đun truyền thống.
Hiệu suất được kiểm tra: Một phần mười dữ liệu được sử dụng để đánh giá hiệu suất ở cấp độ flagship
Được thúc đẩy bởi đổi mới kiến trúc, NEO đã thể hiện hiệu quả sử dụng dữ liệu đáng kinh ngạc và lợi thế về hiệu năng: hiệu quả sử dụng dữ liệu cực cao — chỉ với 1/10 khối lượng dữ liệu so với các mô hình có hiệu năng tương đương trong ngành (390 triệu ví dụ cặp ảnh–văn bản), NEO vẫn phát triển được khả năng cảm nhận thị giác hàng đầu. Không cần dựa vào lượng dữ liệu khổng lồ hay bộ mã hóa thị giác bổ sung, kiến trúc gọn nhẹ của nó có thể sánh ngang các mô hình cờ đầu dạng module hàng đầu như Qwen2-VL và InternVL3 trên nhiều tác vụ hiểu thị giác. Hiệu năng xuất sắc và cân bằng: Trên nhiều bộ đánh giá công khai, uy tín như MMMU, MMB, MMStar, SEED-I, POPE,… kiến trúc NEO đạt điểm số cao, chứng minh hiệu năng toàn diện vượt trội so với các VLM gốc khác, thực sự hiện thực hóa nguyên tắc "chính xác không tổn thất" của kiến trúc gốc. Hiệu quả chi phí suy luận tối ưu: Đặc biệt trong dải tham số từ 0,6B đến 8B, NEO có lợi thế rõ rệt khi triển khai tại biên. Nó không chỉ đạt bước tiến kép về độ chính xác và hiệu quả mà còn giảm mạnh chi phí suy luận, đưa hiệu quả chi phí của cảm nhận thị giác đa phương thức lên mức extreme.Mở nguồn cùng xây dựng
Xây dựng kiến trúc cơ sở hạ tầng AI thế hệ tiếp theo là "bộ khung" của mô hình, và chỉ khi có bộ khung vững chắc thì mới có thể hỗ trợ tương lai của công nghệ đa phương thức.
Thiết kế hợp nhất sớm của kiến trúc NEO hỗ trợ độ phân giải tùy ý và đầu vào ảnh dài, mở rộng liền mạch sang các lĩnh vực tiên tiến như video và trí tuệ hiện thân, đạt được sự hợp nhất thực sự từ dưới lên trên và từ đầu đến cuối. Từ góc độ ứng dụng, thiết kế "tích hợp natively từ đầu đến cuối" cung cấp nền tảng kỹ thuật vững chắc cho việc triển khai trong nhiều tình huống đa dạng như tương tác robot hiện thân, phản hồi đa phương thức trên thiết bị thông minh, hiểu video, tương tác 3D và trí tuệ hiện thân.
Hiện tại, SenseTime đã chính thức mã nguồn mở hai mô hình đặc tả dựa trên kiến trúc NEO, gồm phiên bản 2B và 9B, nhằm thúc đẩy đổi mới và ứng dụng trong cộng đồng mã nguồn mở về kiến trúc đa phương thức gốc. SenseTime Technology khẳng định cam kết xây dựng NEO thành một cơ sở hạ tầng AI thế hệ tiếp theo có khả năng mở rộng và tái sử dụng được thông qua hợp tác mã nguồn mở và triển khai thực tế trong các tình huống cụ thể, từ đó thúc đẩy việc ứng dụng công nghiệp rộng rãi của công nghệ đa phương thức gốc từ phòng thí nghiệm, đồng thời đẩy nhanh quá trình xây dựng các tiêu chuẩn công nghệ đa phương thức gốc ở cấp độ công nghiệp thế hệ tiếp theo.

Giới thiệu về chúng tôi
Điện thoại: 0518-80236699
Email: [email protected]
Địa chỉ: Quận Haizhou, Thành phố Lianyungang, Tỉnh Giang Tô
Nền tảng Dịch vụ Chính phủ Bộ Công nghiệp và Công nghệ Thông tin
Số chuẩn bị ICP tỉnh Tô: 2025211914
Số an ninh mạng Công an tỉnh Tô: 32070602010184
Hỗ trợ kỹ thuật: Công ty TNHH Công nghệ Giang Tô Tiểu Lạp
Facebook Facebook
Facebook
WhatsApp WhatsApp
WhatsApp