Nemotron 3.5 Lightning: NVIDIA Mở Trọng Số 30B, Miễn Phí Dùng Thương Mại
Ngày 11/8/2026, NVIDIA phát hành Nemotron 3.5 Lightning — mô hình 30 tỷ tham số với chỉ 3 tỷ hoạt động mỗi lượt, theo giấy phép OpenMDW-1.1 cho phép dùng thương mại tự do. Kèm theo trọng số là cả dữ liệu và công thức huấn luyện. Điểm mạnh không phải độ thông minh mà là tốc độ: Artificial Analysis đo
Ngày 11/8/2026, NVIDIA phát hành Nemotron 3.5 Lightning — mô hình 30 tỷ tham số nhưng chỉ 3 tỷ hoạt động mỗi lượt, theo giấy phép OpenMDW-1.1 cho phép dùng thương mại tự do. Điều làm bản phát hành này khác biệt không nằm ở bảng điểm — mà ở chỗ NVIDIA công bố kèm cả dữ liệu và công thức huấn luyện, và ở tốc độ suy luận mà mô hình đạt được.
1. Giấy Phép — Phần Quan Trọng Nhất
Phần lớn cái được gọi là "mô hình mở" hiện nay chỉ mở phần trọng số: bạn tải được tệp mô hình, nhưng không biết nó được huấn luyện trên dữ liệu gì. Nemotron 3.5 Lightning đi xa hơn — NVIDIA phát hành trọng số, dữ liệu huấn luyện và công thức huấn luyện cùng nhau, dưới giấy phép OpenMDW-1.1 cho phép dùng thương mại.
Với phần lớn doanh nghiệp, khác biệt này không ảnh hưởng tới việc dùng hằng ngày. Nhưng với tổ chức phải kiểm toán nguồn gốc dữ liệu — ngân hàng, bảo hiểm, y tế, khu vực công — đây là khác biệt quyết định giữa "dùng được" và "không được phép dùng".
Trọng số nằm trên Hugging Face và ModelScope, với năm bản khác nhau trong họ nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B: bản tham chiếu BF16 đầy đủ, bản lượng tử hoá NVFP4 tối ưu cho triển khai, bản Base-BF16 đã tiền huấn luyện, và hai bản mô hình nháp (NVFP4-DFlash, NVFP4-DSpark) dùng cho kỹ thuật giải mã suy đoán.
2. Kiến Trúc Và Ngưỡng Phần Cứng
| Hạng mục | Thông số | Ghi chú |
|---|---|---|
| Tham số | 30 tỷ / 3 tỷ hoạt động | Artificial Analysis đo 31,6 tỷ / 3,6 tỷ |
| Kiến trúc | Lai Mamba-2 + MoE | Xen kẽ, cộng một số lớp Attention |
| Độ dài context | 1 triệu token | Một H100 chỉ đạt ~256.000 ở BF16 |
| Một GPU | H100 / A100 80GB | Context ~256.000 token |
| Nhiều GPU | 8 × H100 | Song song tensor, đủ 1 triệu token |
| Giấy phép | OpenMDW-1.1 | Cho phép dùng thương mại |
Kiến trúc là điểm kỹ thuật đáng chú ý: NVIDIA xen kẽ các lớp Mamba-2 với các lớp MoE, cộng thêm một số lớp Attention chọn lọc. Cách ghép này cho phép mô hình giữ được sức chứa của một mô hình lớn trong khi lượng tính toán cho mỗi yêu cầu vẫn thấp — đó chính là lý do nó nhanh.
Một lưu ý NVIDIA ghi rõ mà tin tức hay bỏ qua
Thẻ mô hình nêu rằng Nemotron 3.5 Lightning được thiết kế chủ yếu cho tuỳ biến và hậu huấn luyện — tinh chỉnh có giám sát, học tăng cường, thích ứng theo lĩnh vực — chứ không phải để triển khai thẳng ra môi trường sản xuất. Nói cách khác, đây là nguyên liệu để bạn xây mô hình của mình, không phải sản phẩm dùng ngay. Bỏ qua chi tiết này là cách nhanh nhất để một dự án thí điểm thất bại.
3. Bảng Điểm Của Chính NVIDIA Cho Thấy Qwen Vượt Lên
Điều hiếm gặp là bảng benchmark trong thẻ mô hình của NVIDIA lại cho thấy đối thủ thắng ở phần lớn hạng mục:
| Bộ đánh giá | Nemotron 3.5 Lightning | Qwen 3.6 35B | Gemma 4 26B |
|---|---|---|---|
| MMLU Pro | 81,94 | 85,63 | 85,20 |
| GPQA Diamond | 75,44 | 83,40 | 79,61 |
| SWE-bench Verified | 51,56 | 70,12 | 57,40 |
| IFBench (bám chỉ dẫn) | 71,88 | 63,71 | 77,25 |
Qwen 3.6 35B thắng ở ba trong bốn hạng mục trên, và khoảng cách ở SWE-bench Verified là rất lớn — 70,12 so với 51,56. Lightning chỉ vượt Qwen ở IFBench, nhưng ngay hạng mục đó lại thuộc về Gemma 4 26B. Một phân tích độc lập ghi nhận Qwen 3.6 35B A3B cao điểm hơn ở 13 trong 14 dòng của chính bảng do NVIDIA công bố.
Việc NVIDIA vẫn in bảng này trong tài liệu chính thức là điểm đáng ghi nhận về mặt minh bạch — và nó cũng cho thấy hãng không định bán mô hình này bằng luận điểm "thông minh nhất".
4. Luận Điểm Thật Sự: Tốc Độ
Đây mới là chỗ mô hình có lý do tồn tại. Theo đo đạc độc lập của Artificial Analysis:
- Gần 670 token mỗi giây — một con số rất cao so với mặt bằng mô hình mở.
- Khoảng 0,5 phút cho mỗi tác vụ trong bộ chỉ số, trong khi Qwen3.6 35B A3B cần khoảng 3,5 phút — chậm hơn khoảng bảy lần.
- 24 điểm trên chỉ số tổng hợp, ngang gpt-oss-120b của OpenAI dù chỉ có khoảng một phần tư tổng số tham số.
- Bản lượng tử hoá NVFP4 và bản BF16 cho kết quả gần như tương đương — mức suy giảm được mô tả là không đáng kể.
NVIDIA gọi đây là chiến thắng trên đường biên hiệu quả giữa độ chính xác và tốc độ, và công bố mức nhanh hơn tới 4 lần so với các mô hình cùng cỡ. Nhưng Artificial Analysis cũng đưa ra một mốc so sánh tỉnh táo: GPT-5.6 Luna đạt 52 điểm chỉ số tổng hợp trong chưa tới 2 phút mỗi tác vụ. Ở cán cân giữa tốc độ và trí tuệ, các mô hình đóng vẫn đang dẫn trước.
5. Ý Nghĩa Với Doanh Nghiệp Việt Nam
- Dữ liệu không rời khỏi hạ tầng của bạn. Đây vẫn là lý do mạnh nhất để chọn mô hình tự vận hành. Hồ sơ nhân sự, hợp đồng, chứng từ kế toán — những thứ nhiều tổ chức không được phép gửi lên API nước ngoài — xử lý được tại chỗ. Việc NVIDIA công bố cả dữ liệu huấn luyện còn giúp khâu kiểm toán tuân thủ dễ hơn hẳn.
- Phù hợp với việc lặp lại khối lượng lớn. Tốc độ gần 670 token/giây và chi phí biên gần bằng không sau khi đã có máy khiến mô hình này hợp với phân loại email, trích xuất trường từ biểu mẫu, gắn nhãn hồ sơ — chứ không phải với bài toán suy luận khó nhất.
- Ngưỡng phần cứng không nhỏ. Cần một GPU 80GB loại H100 hoặc A100 để chạy ở mức context 256.000 token. Đây không phải mô hình chạy trên máy văn phòng, và cần tính chi phí đầu tư hoặc thuê máy chủ vào bài toán.
- Đây là nguyên liệu, không phải sản phẩm. NVIDIA nói rõ mô hình hướng tới tuỳ biến và hậu huấn luyện. Nếu tổ chức bạn chưa có đội làm được việc tinh chỉnh, giá trị thu về sẽ thấp hơn kỳ vọng nhiều.
- Chưa có dữ liệu về tiếng Việt. Toàn bộ bộ đánh giá được nêu đều là tiếng Anh. Hãy tự kiểm thử trên đúng loại tài liệu của bạn trước khi kết luận.
Cần nói rõ để tránh kỳ vọng sai: triển khai một mô hình tự vận hành là một dự án kỹ thuật có chi phí vận hành liên tục, không phải một lần cài đặt. Nếu nhu cầu của bạn cụ thể hơn — chuẩn hoá văn bản hành chính theo Nghị định 30/2020/NĐ-CP, hay dựng nhanh bộ CV, brochure, slide — thì các công cụ chuyên biệt như Compose Word và Design Studio của Locaith cho kết quả ngay mà không cần đội vận hành hạ tầng riêng.
Nguồn tham khảo:
- Hugging Face — nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 (thẻ mô hình: kiến trúc lai Mamba-2 + MoE + Attention, 30 tỷ tham số với 3 tỷ hoạt động, context 1 triệu token, ngưỡng ~256.000 token trên một H100, giấy phép OpenMDW-1.1, bảng đối chiếu MMLU Pro / GPQA Diamond / SWE-bench Verified / IFBench với Qwen 3.6 35B và Gemma 4 26B, cấu hình phần cứng, mục đích tuỳ biến và hậu huấn luyện)
- Artificial Analysis — NVIDIA launches Nemotron 3.5 Lightning (đo độc lập: chỉ số tổng hợp 24 ngang gpt-oss-120b, gần 670 token/giây, ~0,5 phút mỗi tác vụ so với ~3,5 phút của Qwen3.6 35B A3B, 31,6 tỷ tham số với 3,6 tỷ hoạt động, mốc đối chiếu GPT-5.6 Luna, NVFP4 so với BF16)
- CNBC — Nvidia releases Nemotron 3.5 Lightning, open-source AI model (ngày phát hành 11/8/2026, định vị sản phẩm)
- NVIDIA Newsroom — NVIDIA Debuts Nemotron 3 Family of Open Models (bối cảnh họ mô hình Nemotron 3 Nano / Super / Ultra mà Lightning thuộc về)
Lưu ý về số liệu: bảng đối chiếu với Qwen 3.6 35B và Gemma 4 26B ở mục 3 là do NVIDIA tự công bố trong thẻ mô hình — đáng chú ý ở chỗ chính bảng của hãng cho thấy đối thủ thắng phần lớn hạng mục. Các số về tốc độ và chỉ số tổng hợp ở mục 4 là do Artificial Analysis đo độc lập. Có lệch nhỏ về số tham số giữa hai nguồn: thẻ mô hình ghi 30 tỷ với 3 tỷ hoạt động, Artificial Analysis đo 31,6 tỷ với 3,6 tỷ; chúng tôi giữ nguyên cả hai. Nhận định "cao điểm hơn ở 13 trong 14 dòng" là của một bên phân tích thứ ba, chúng tôi chỉ xác minh trực tiếp được bốn dòng nêu trong bảng. Chúng tôi không kiểm thử độc lập mô hình này với tiếng Việt. Tổng hợp và phân tích bởi Ban Biên Tập Locaith, ngày 14/8/2026.