Alibaba Mở Mã Qwen-Drive-1.0: Mô Hình Lái Tự Hành 4B Chạy Trên Một GPU 24GB

Nhóm Qwen của Alibaba phát hành Qwen-Drive-1.0 theo giấy phép Apache 2.0 — kèm mã nguồn, trọng số và dữ liệu mẫu. Mô hình gộp nhận diện 3D, hỏi đáp cảnh đường và lập quỹ đạo vào một khung duy nhất, và giữ được năng lực thị giác tổng quát của mô hình gốc. Locaith đọc kho mã, thẻ mô hình và bài báo để

Lái tự hành lâu nay là mảng khép kín nhất của ngành AI: dữ liệu độc quyền, mô hình không ai xem được, số liệu do chính hãng công bố. Đầu tháng 9/2026, nhóm Qwen của Alibaba mở toàn bộ một mô hình lái theo giấy phép Apache 2.0 — mã nguồn, trọng số, dữ liệu mẫu. Nó chạy vừa trên một GPU 24GB. Điều đó thay đổi ai được phép nhìn vào bên trong, chứ chưa thay đổi ai được phép đưa nó lên đường.

Ba việc trong một mô hình

Cách làm thông thường trong lái tự hành là ghép nhiều mô-đun chuyên biệt: một mô hình nhận diện vật thể, một mô hình dựng bản đồ, một mô-đun lập kế hoạch, nối với nhau bằng các định dạng trung gian. Qwen-Drive-1.0 gộp chúng lại quanh một xương sống thị giác - ngôn ngữ duy nhất là Qwen3.5-4B, rồi gắn thêm hai bộ phận:

Điểm đáng chú ý về mặt kỹ thuật là mô hình gốc không bị hy sinh. Theo nhóm phát triển, sau khi huấn luyện theo công thức nhiều giai đoạn trộn dữ liệu lái với dữ liệu thị giác - ngôn ngữ tổng quát, Qwen-Drive-1.0 vẫn nằm trong khoảng một điểm so với Qwen3.5-4B trên trung bình mười bộ đánh giá thị giác tổng quát. Nói cách khác: nó học lái mà không quên nhìn.

Biểu đồ radar so sánh Qwen-Drive-1.0 với các mô hình khác trên bốn nhóm bài đo: hỏi đáp lái xe, hỏi đáp thị giác tổng quát, nhận thức 3D và lập kế hoạch chuyển động
Bốn nhóm bài đo do nhóm Qwen công bố. Đáng chú ý ở nửa trái: trên LingoQA, Qwen-Drive-1.0 đạt 77,8 so với 70,4 của Qwen3.5-4B gốc, còn trên SURDS là 66,13 so với 52,95 — trong khi nhóm thị giác tổng quát gần như không đổi. Ảnh: nhóm Qwen, kho mã QwenLM/Qwen-Drive-1.0.

Các con số — và chúng đến từ đâu

Toàn bộ số dưới đây là số do nhóm phát triển tự công bố trong kho mã và bài báo, chưa có bên thứ ba đo lại độc lập:

Nhóm Bài đo Qwen-Drive-1.0
Lập kế hoạchNAVSIM v1.1 (PDMS)90,7 — bản tối ưu bằng học tăng cường
Lập kế hoạchWaymo Open Dataset đầu-cuối (RFS)7,91
Hỏi đáp lái xeLingoQA77,8 — so với 70,4 của mô hình gốc
Nhận thức 3DPhát hiện vật thể (mAP / NDS)43,95 / 42,83
Nhận thức 3DPhân vùng bản đồ (mIoU)60,99
Thị giác tổng quátMMBench85,5
Hiểu không gianEmbSpatial78,9

Nguồn: kho mã QwenLM/Qwen-Drive-1.0 trên GitHub và thẻ mô hình Qwen/Qwen-Drive-1.0-4B trên Hugging Face, Locaith đọc ngày 8/9/2026. Đây là số của hãng. Bài báo kỹ thuật mang mã arXiv 2609.00111.

Một chi tiết nhỏ nhưng đáng nêu vì hai tài liệu của chính hãng không khớp: tên mô hình là 4B, theo xương sống Qwen3.5-4B, nhưng thẻ mô hình trên Hugging Face ghi 5B tham số. Nhiều khả năng con số lớn hơn tính cả các đầu nhận thức và lập kế hoạch gắn thêm, song nhóm phát triển không giải thích. Locaith ghi cả hai thay vì chọn một.

Cần hiểu đúng những bài đo này đo cái gì.

NAVSIM và Waymo Open Dataset đánh giá mô hình trên dữ liệu đã ghi sẵn hoặc trong mô phỏng: cho mô hình xem lại một cảnh có thật rồi so quỹ đạo nó chọn với quỹ đạo người lái đã đi, hoặc chấm theo một hàm điểm tổng hợp. Chúng nói lên chất lượng tương đối giữa các mô hình. Chúng không nói mô hình an toàn trên đường — không bài đo nào trong bảng trên có mặt một chiếc xe thật, một người đi bộ thật, hay một tình huống mà mô hình chưa từng thấy trong dữ liệu huấn luyện.

Mở trọng số thay đổi điều gì, và không thay đổi điều gì

Việc phát hành theo Apache 2.0 — kèm mã nguồn, trọng số và dữ liệu mẫu, thực hiện cùng Đại học Khoa học và Công nghệ Hoa Trung — là điều hiếm trong mảng này. Nó đáng chú ý ở ba chỗ:

Nhưng cần nói thẳng phần còn lại. Giấy phép phần mềm không phải giấy phép lưu hành phương tiện. Apache 2.0 cho bạn quyền với mã và trọng số; nó không nói gì về việc đưa hệ thống này điều khiển một chiếc xe trên đường công cộng — đó là chuyện của quy định giao thông, đăng kiểm và trách nhiệm dân sự, ở Việt Nam cũng như mọi nơi. Ngoài ra, kho mã và thẻ mô hình không nêu giới hạn sử dụng rõ ràng kiểu "chỉ dùng cho nghiên cứu", điều mà một số bản phát hành khác trong lĩnh vực nhạy cảm này có nêu. Sự im lặng đó không phải là sự cho phép.

Ai ở Việt Nam thực sự dùng được cái này

Câu trả lời trung thực: không phải các doanh nghiệp đang tìm cách tự động hoá văn phòng. Đây không phải công cụ năng suất, và Locaith không khuyên ai lắp nó lên xe. Nhưng có ba nhóm mà bản phát hành này thực sự có nghĩa:

Với ba nhóm đó, việc đáng làm trong tuần này rất cụ thể: tải bản 9,1GB về, chạy dữ liệu mẫu, rồi tự đo lại trên dữ liệu đường Việt Nam của chính mình. Điều kiện giao thông ở Hà Nội hay TP.HCM — mật độ xe máy, cách nhập làn, biển báo — không giống bất kỳ bộ dữ liệu nào mô hình này được huấn luyện. Số của hãng nói mô hình tốt so với các mô hình khác trên dữ liệu phương Tây; nó không nói gì về việc mô hình hoạt động thế nào ở một ngã tư Việt Nam. Đó là phép đo mà chỉ bạn chạy được, và là phép đo duy nhất có nghĩa với bạn.

Nguồn:

Toàn bộ điểm số trong bài là số do nhóm phát triển tự công bố, chưa có bên thứ ba đo lại độc lập. Các bộ đánh giá được nêu là đánh giá trên dữ liệu ghi sẵn hoặc mô phỏng, không phải thử nghiệm trên đường thật, và không thay thế cho bất kỳ quy trình kiểm định an toàn nào. Locaith không khuyến nghị triển khai mô hình này để điều khiển phương tiện trên đường công cộng; giấy phép Apache 2.0 là giấy phép phần mềm, không phải giấy phép lưu hành. Số tham số được hai tài liệu của chính hãng ghi khác nhau (4B theo tên gọi, 5B theo thẻ mô hình) và bài này nêu cả hai. Ngày phát hành chính xác chưa được nêu rõ: thẻ mô hình ghi thời điểm đăng sớm hơn bản tin của TechNode ngày 7/9/2026, nên bài này chỉ nói "đầu tháng 9/2026". Phần nhận định về đối tượng sử dụng ở Việt Nam là quan điểm riêng của Locaith. Ảnh bìa và biểu đồ: nhóm Qwen, lấy từ kho mã chính thức. Biên soạn và phân tích bởi Ban Biên Tập Locaith, 8/9/2026.

Messenger