Alibaba Mở Mã Qwen-Drive-1.0: Mô Hình Lái Tự Hành 4B Chạy Trên Một GPU 24GB
Nhóm Qwen của Alibaba phát hành Qwen-Drive-1.0 theo giấy phép Apache 2.0 — kèm mã nguồn, trọng số và dữ liệu mẫu. Mô hình gộp nhận diện 3D, hỏi đáp cảnh đường và lập quỹ đạo vào một khung duy nhất, và giữ được năng lực thị giác tổng quát của mô hình gốc. Locaith đọc kho mã, thẻ mô hình và bài báo để
Lái tự hành lâu nay là mảng khép kín nhất của ngành AI: dữ liệu độc quyền, mô hình không ai xem được, số liệu do chính hãng công bố. Đầu tháng 9/2026, nhóm Qwen của Alibaba mở toàn bộ một mô hình lái theo giấy phép Apache 2.0 — mã nguồn, trọng số, dữ liệu mẫu. Nó chạy vừa trên một GPU 24GB. Điều đó thay đổi ai được phép nhìn vào bên trong, chứ chưa thay đổi ai được phép đưa nó lên đường.
Ba việc trong một mô hình
Cách làm thông thường trong lái tự hành là ghép nhiều mô-đun chuyên biệt: một mô hình nhận diện vật thể, một mô hình dựng bản đồ, một mô-đun lập kế hoạch, nối với nhau bằng các định dạng trung gian. Qwen-Drive-1.0 gộp chúng lại quanh một xương sống thị giác - ngôn ngữ duy nhất là Qwen3.5-4B, rồi gắn thêm hai bộ phận:
- Một đầu nhận thức theo góc nhìn từ trên xuống (BEV) làm đồng thời ba việc: phát hiện vật thể 3D, dự đoán ô chiếm dụng theo ngữ nghĩa, và phân vùng bản đồ.
- Một "Planning Expert" đọc chính biểu diễn dùng chung của mô hình thị giác - ngôn ngữ để sinh quỹ đạo tương lai cho xe. Nhóm phát hành hai bản: một bản học bắt chước từ dữ liệu lái người thật, một bản tinh chỉnh thêm bằng học tăng cường.
Điểm đáng chú ý về mặt kỹ thuật là mô hình gốc không bị hy sinh. Theo nhóm phát triển, sau khi huấn luyện theo công thức nhiều giai đoạn trộn dữ liệu lái với dữ liệu thị giác - ngôn ngữ tổng quát, Qwen-Drive-1.0 vẫn nằm trong khoảng một điểm so với Qwen3.5-4B trên trung bình mười bộ đánh giá thị giác tổng quát. Nói cách khác: nó học lái mà không quên nhìn.
Các con số — và chúng đến từ đâu
Toàn bộ số dưới đây là số do nhóm phát triển tự công bố trong kho mã và bài báo, chưa có bên thứ ba đo lại độc lập:
| Nhóm | Bài đo | Qwen-Drive-1.0 |
|---|---|---|
| Lập kế hoạch | NAVSIM v1.1 (PDMS) | 90,7 — bản tối ưu bằng học tăng cường |
| Lập kế hoạch | Waymo Open Dataset đầu-cuối (RFS) | 7,91 |
| Hỏi đáp lái xe | LingoQA | 77,8 — so với 70,4 của mô hình gốc |
| Nhận thức 3D | Phát hiện vật thể (mAP / NDS) | 43,95 / 42,83 |
| Nhận thức 3D | Phân vùng bản đồ (mIoU) | 60,99 |
| Thị giác tổng quát | MMBench | 85,5 |
| Hiểu không gian | EmbSpatial | 78,9 |
Nguồn: kho mã QwenLM/Qwen-Drive-1.0 trên GitHub và thẻ mô hình Qwen/Qwen-Drive-1.0-4B trên Hugging Face, Locaith đọc ngày 8/9/2026. Đây là số của hãng. Bài báo kỹ thuật mang mã arXiv 2609.00111.
Một chi tiết nhỏ nhưng đáng nêu vì hai tài liệu của chính hãng không khớp: tên mô hình là 4B, theo xương sống Qwen3.5-4B, nhưng thẻ mô hình trên Hugging Face ghi 5B tham số. Nhiều khả năng con số lớn hơn tính cả các đầu nhận thức và lập kế hoạch gắn thêm, song nhóm phát triển không giải thích. Locaith ghi cả hai thay vì chọn một.
Cần hiểu đúng những bài đo này đo cái gì.
NAVSIM và Waymo Open Dataset đánh giá mô hình trên dữ liệu đã ghi sẵn hoặc trong mô phỏng: cho mô hình xem lại một cảnh có thật rồi so quỹ đạo nó chọn với quỹ đạo người lái đã đi, hoặc chấm theo một hàm điểm tổng hợp. Chúng nói lên chất lượng tương đối giữa các mô hình. Chúng không nói mô hình an toàn trên đường — không bài đo nào trong bảng trên có mặt một chiếc xe thật, một người đi bộ thật, hay một tình huống mà mô hình chưa từng thấy trong dữ liệu huấn luyện.
Mở trọng số thay đổi điều gì, và không thay đổi điều gì
Việc phát hành theo Apache 2.0 — kèm mã nguồn, trọng số và dữ liệu mẫu, thực hiện cùng Đại học Khoa học và Công nghệ Hoa Trung — là điều hiếm trong mảng này. Nó đáng chú ý ở ba chỗ:
- Giới nghiên cứu và trường kỹ thuật được nhìn vào bên trong. Trước đây, muốn nghiên cứu một hệ lái tự hành hiện đại, bạn phải làm việc cho hãng có nó. Bây giờ một phòng thí nghiệm đại học ở Việt Nam tải về được toàn bộ.
- Yêu cầu phần cứng nằm trong tầm với. Khoảng 9,1GB tải về và một GPU 24GB — mức của một máy trạm có card 4090, hoặc vài chục nghìn đồng mỗi giờ nếu thuê máy. Đây là thứ một nhóm sinh viên chạy được.
- Apache 2.0 có điều khoản cấp phép sáng chế, nên rào cản pháp lý để nghiên cứu và thử nghiệm thương mại thấp hơn hẳn các giấy phép "chỉ dùng phi thương mại" thường gặp.
Nhưng cần nói thẳng phần còn lại. Giấy phép phần mềm không phải giấy phép lưu hành phương tiện. Apache 2.0 cho bạn quyền với mã và trọng số; nó không nói gì về việc đưa hệ thống này điều khiển một chiếc xe trên đường công cộng — đó là chuyện của quy định giao thông, đăng kiểm và trách nhiệm dân sự, ở Việt Nam cũng như mọi nơi. Ngoài ra, kho mã và thẻ mô hình không nêu giới hạn sử dụng rõ ràng kiểu "chỉ dùng cho nghiên cứu", điều mà một số bản phát hành khác trong lĩnh vực nhạy cảm này có nêu. Sự im lặng đó không phải là sự cho phép.
Ai ở Việt Nam thực sự dùng được cái này
Câu trả lời trung thực: không phải các doanh nghiệp đang tìm cách tự động hoá văn phòng. Đây không phải công cụ năng suất, và Locaith không khuyên ai lắp nó lên xe. Nhưng có ba nhóm mà bản phát hành này thực sự có nghĩa:
- Trường đại học và nhóm nghiên cứu. Đây là lần đầu một hệ lái tự hành gộp nhận thức - ngôn ngữ - kế hoạch ở mức hiện đại có thể mang vào lớp học. Với các khoa cơ điện tử, tự động hoá và khoa học máy tính, đó là tài liệu giảng dạy sống, không phải bài báo đọc chay.
- Doanh nghiệp làm phương tiện trong khu vực khép kín — xe nâng trong kho, xe tuần tra trong khu công nghiệp, thiết bị trong mỏ hoặc nông trại. Ở những nơi không phải đường công cộng, rào cản pháp lý khác hẳn, và phần nhận thức 3D cùng hỏi đáp cảnh có thể dùng độc lập với phần lập quỹ đạo.
- Nhóm cần phân tích video giao thông, không cần lái. Phần nhận thức — phát hiện vật thể 3D, phân vùng bản đồ, hỏi đáp cảnh đường bằng ngôn ngữ — dùng được cho giám sát giao thông, phân tích hiện trường va chạm hay kiểm đếm phương tiện, mà không đụng tới câu hỏi an toàn của việc điều khiển xe.
Với ba nhóm đó, việc đáng làm trong tuần này rất cụ thể: tải bản 9,1GB về, chạy dữ liệu mẫu, rồi tự đo lại trên dữ liệu đường Việt Nam của chính mình. Điều kiện giao thông ở Hà Nội hay TP.HCM — mật độ xe máy, cách nhập làn, biển báo — không giống bất kỳ bộ dữ liệu nào mô hình này được huấn luyện. Số của hãng nói mô hình tốt so với các mô hình khác trên dữ liệu phương Tây; nó không nói gì về việc mô hình hoạt động thế nào ở một ngã tư Việt Nam. Đó là phép đo mà chỉ bạn chạy được, và là phép đo duy nhất có nghĩa với bạn.
Nguồn:
- QwenLM — Kho mã Qwen-Drive-1.0 — nguồn sơ cấp cho kiến trúc, giấy phép Apache 2.0, yêu cầu GPU 24GB và toàn bộ điểm số; Locaith đọc trực tiếp 8/9/2026
- Hugging Face — Thẻ mô hình Qwen/Qwen-Drive-1.0-4B — nguồn cho dung lượng 9,1GB, cách chia các đầu tác vụ, và cho con số 5B tham số khác với tên gọi 4B; Locaith đọc trực tiếp 8/9/2026
- arXiv — Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving — bài báo kỹ thuật đi kèm bản phát hành
- TechNode — Alibaba's Qwen releases open-source model for autonomous driving, đăng 7/9/2026 — nguồn cho việc hợp tác với Đại học Khoa học và Công nghệ Hoa Trung và cho mốc thời gian đưa tin
Toàn bộ điểm số trong bài là số do nhóm phát triển tự công bố, chưa có bên thứ ba đo lại độc lập. Các bộ đánh giá được nêu là đánh giá trên dữ liệu ghi sẵn hoặc mô phỏng, không phải thử nghiệm trên đường thật, và không thay thế cho bất kỳ quy trình kiểm định an toàn nào. Locaith không khuyến nghị triển khai mô hình này để điều khiển phương tiện trên đường công cộng; giấy phép Apache 2.0 là giấy phép phần mềm, không phải giấy phép lưu hành. Số tham số được hai tài liệu của chính hãng ghi khác nhau (4B theo tên gọi, 5B theo thẻ mô hình) và bài này nêu cả hai. Ngày phát hành chính xác chưa được nêu rõ: thẻ mô hình ghi thời điểm đăng sớm hơn bản tin của TechNode ngày 7/9/2026, nên bài này chỉ nói "đầu tháng 9/2026". Phần nhận định về đối tượng sử dụng ở Việt Nam là quan điểm riêng của Locaith. Ảnh bìa và biểu đồ: nhóm Qwen, lấy từ kho mã chính thức. Biên soạn và phân tích bởi Ban Biên Tập Locaith, 8/9/2026.