Nemotron 3.5 Lightning: NVIDIA Mở Trọng Số 30B, Miễn Phí Dùng Thương Mại

Ngày 11/8/2026, NVIDIA phát hành Nemotron 3.5 Lightning — mô hình 30 tỷ tham số với chỉ 3 tỷ hoạt động mỗi lượt, theo giấy phép OpenMDW-1.1 cho phép dùng thương mại tự do. Kèm theo trọng số là cả dữ liệu và công thức huấn luyện. Điểm mạnh không phải độ thông minh mà là tốc độ: Artificial Analysis đo

Ngày 11/8/2026, NVIDIA phát hành Nemotron 3.5 Lightning — mô hình 30 tỷ tham số nhưng chỉ 3 tỷ hoạt động mỗi lượt, theo giấy phép OpenMDW-1.1 cho phép dùng thương mại tự do. Điều làm bản phát hành này khác biệt không nằm ở bảng điểm — mà ở chỗ NVIDIA công bố kèm cả dữ liệu và công thức huấn luyện, và ở tốc độ suy luận mà mô hình đạt được.

1. Giấy Phép — Phần Quan Trọng Nhất

Phần lớn cái được gọi là "mô hình mở" hiện nay chỉ mở phần trọng số: bạn tải được tệp mô hình, nhưng không biết nó được huấn luyện trên dữ liệu gì. Nemotron 3.5 Lightning đi xa hơn — NVIDIA phát hành trọng số, dữ liệu huấn luyện và công thức huấn luyện cùng nhau, dưới giấy phép OpenMDW-1.1 cho phép dùng thương mại.

Với phần lớn doanh nghiệp, khác biệt này không ảnh hưởng tới việc dùng hằng ngày. Nhưng với tổ chức phải kiểm toán nguồn gốc dữ liệu — ngân hàng, bảo hiểm, y tế, khu vực công — đây là khác biệt quyết định giữa "dùng được" và "không được phép dùng".

Trọng số nằm trên Hugging FaceModelScope, với năm bản khác nhau trong họ nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B: bản tham chiếu BF16 đầy đủ, bản lượng tử hoá NVFP4 tối ưu cho triển khai, bản Base-BF16 đã tiền huấn luyện, và hai bản mô hình nháp (NVFP4-DFlash, NVFP4-DSpark) dùng cho kỹ thuật giải mã suy đoán.

2. Kiến Trúc Và Ngưỡng Phần Cứng

Hạng mục Thông số Ghi chú
Tham số 30 tỷ / 3 tỷ hoạt động Artificial Analysis đo 31,6 tỷ / 3,6 tỷ
Kiến trúc Lai Mamba-2 + MoE Xen kẽ, cộng một số lớp Attention
Độ dài context 1 triệu token Một H100 chỉ đạt ~256.000 ở BF16
Một GPU H100 / A100 80GB Context ~256.000 token
Nhiều GPU 8 × H100 Song song tensor, đủ 1 triệu token
Giấy phép OpenMDW-1.1 Cho phép dùng thương mại

Kiến trúc là điểm kỹ thuật đáng chú ý: NVIDIA xen kẽ các lớp Mamba-2 với các lớp MoE, cộng thêm một số lớp Attention chọn lọc. Cách ghép này cho phép mô hình giữ được sức chứa của một mô hình lớn trong khi lượng tính toán cho mỗi yêu cầu vẫn thấp — đó chính là lý do nó nhanh.

Một lưu ý NVIDIA ghi rõ mà tin tức hay bỏ qua

Thẻ mô hình nêu rằng Nemotron 3.5 Lightning được thiết kế chủ yếu cho tuỳ biến và hậu huấn luyện — tinh chỉnh có giám sát, học tăng cường, thích ứng theo lĩnh vực — chứ không phải để triển khai thẳng ra môi trường sản xuất. Nói cách khác, đây là nguyên liệu để bạn xây mô hình của mình, không phải sản phẩm dùng ngay. Bỏ qua chi tiết này là cách nhanh nhất để một dự án thí điểm thất bại.

3. Bảng Điểm Của Chính NVIDIA Cho Thấy Qwen Vượt Lên

Điều hiếm gặp là bảng benchmark trong thẻ mô hình của NVIDIA lại cho thấy đối thủ thắng ở phần lớn hạng mục:

Bộ đánh giá Nemotron 3.5 Lightning Qwen 3.6 35B Gemma 4 26B
MMLU Pro 81,94 85,63 85,20
GPQA Diamond 75,44 83,40 79,61
SWE-bench Verified 51,56 70,12 57,40
IFBench (bám chỉ dẫn) 71,88 63,71 77,25

Qwen 3.6 35B thắng ở ba trong bốn hạng mục trên, và khoảng cách ở SWE-bench Verified là rất lớn — 70,12 so với 51,56. Lightning chỉ vượt Qwen ở IFBench, nhưng ngay hạng mục đó lại thuộc về Gemma 4 26B. Một phân tích độc lập ghi nhận Qwen 3.6 35B A3B cao điểm hơn ở 13 trong 14 dòng của chính bảng do NVIDIA công bố.

Việc NVIDIA vẫn in bảng này trong tài liệu chính thức là điểm đáng ghi nhận về mặt minh bạch — và nó cũng cho thấy hãng không định bán mô hình này bằng luận điểm "thông minh nhất".

Biểu đồ phân tán của Artificial Analysis: trục ngang là thời gian xử lý mỗi tác vụ (phút), trục dọc là điểm Artificial Analysis Intelligence Index, giới hạn ở các mô hình mở dưới 40 tỷ tham số. Nemotron 3.5 Lightning nằm sát mép trái ở khoảng 0,5 phút mỗi tác vụ với 24 điểm; Qwen3.6 35B A3B ở khoảng 3,5 phút với 32 điểm; Qwen3.6 27B ở khoảng 7,3 phút với 38 điểm; Gemma 4 31B khoảng 5,8 phút với 30 điểm; Nemotron 3 Nano và gpt-oss-20b nằm quanh 2–3 phút với 15 điểm.
Đúng hai vế của luận điểm trong một hình: Nemotron 3.5 Lightning hoàn thành mỗi tác vụ trong khoảng 0,5 phút, còn Qwen3.6 35B A3B cần khoảng 3,5 phút — chậm hơn bảy lần — nhưng Qwen lại cao hơn về điểm trí tuệ tổng hợp (32 so với 24). Đây chính là nguồn của các con số nêu ở phần này. Ảnh: Artificial Analysis.

4. Luận Điểm Thật Sự: Tốc Độ

Đây mới là chỗ mô hình có lý do tồn tại. Theo đo đạc độc lập của Artificial Analysis:

NVIDIA gọi đây là chiến thắng trên đường biên hiệu quả giữa độ chính xác và tốc độ, và công bố mức nhanh hơn tới 4 lần so với các mô hình cùng cỡ. Nhưng Artificial Analysis cũng đưa ra một mốc so sánh tỉnh táo: GPT-5.6 Luna đạt 52 điểm chỉ số tổng hợp trong chưa tới 2 phút mỗi tác vụ. Ở cán cân giữa tốc độ và trí tuệ, các mô hình đóng vẫn đang dẫn trước.

5. Ý Nghĩa Với Doanh Nghiệp Việt Nam

Cần nói rõ để tránh kỳ vọng sai: triển khai một mô hình tự vận hành là một dự án kỹ thuật có chi phí vận hành liên tục, không phải một lần cài đặt. Nếu nhu cầu của bạn cụ thể hơn — chuẩn hoá văn bản hành chính theo Nghị định 30/2020/NĐ-CP, hay dựng nhanh bộ CV, brochure, slide — thì các công cụ chuyên biệt như Compose WordDesign Studio của Locaith cho kết quả ngay mà không cần đội vận hành hạ tầng riêng.

Nguồn tham khảo:

  • Hugging Face — nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 (thẻ mô hình: kiến trúc lai Mamba-2 + MoE + Attention, 30 tỷ tham số với 3 tỷ hoạt động, context 1 triệu token, ngưỡng ~256.000 token trên một H100, giấy phép OpenMDW-1.1, bảng đối chiếu MMLU Pro / GPQA Diamond / SWE-bench Verified / IFBench với Qwen 3.6 35B và Gemma 4 26B, cấu hình phần cứng, mục đích tuỳ biến và hậu huấn luyện)
  • Artificial Analysis — NVIDIA launches Nemotron 3.5 Lightning (đo độc lập: chỉ số tổng hợp 24 ngang gpt-oss-120b, gần 670 token/giây, ~0,5 phút mỗi tác vụ so với ~3,5 phút của Qwen3.6 35B A3B, 31,6 tỷ tham số với 3,6 tỷ hoạt động, mốc đối chiếu GPT-5.6 Luna, NVFP4 so với BF16)
  • CNBC — Nvidia releases Nemotron 3.5 Lightning, open-source AI model (ngày phát hành 11/8/2026, định vị sản phẩm)
  • NVIDIA Newsroom — NVIDIA Debuts Nemotron 3 Family of Open Models (bối cảnh họ mô hình Nemotron 3 Nano / Super / Ultra mà Lightning thuộc về)

Lưu ý về số liệu: bảng đối chiếu với Qwen 3.6 35B và Gemma 4 26B ở mục 3 là do NVIDIA tự công bố trong thẻ mô hình — đáng chú ý ở chỗ chính bảng của hãng cho thấy đối thủ thắng phần lớn hạng mục. Các số về tốc độ và chỉ số tổng hợp ở mục 4 là do Artificial Analysis đo độc lập. Có lệch nhỏ về số tham số giữa hai nguồn: thẻ mô hình ghi 30 tỷ với 3 tỷ hoạt động, Artificial Analysis đo 31,6 tỷ với 3,6 tỷ; chúng tôi giữ nguyên cả hai. Nhận định "cao điểm hơn ở 13 trong 14 dòng" là của một bên phân tích thứ ba, chúng tôi chỉ xác minh trực tiếp được bốn dòng nêu trong bảng. Chúng tôi không kiểm thử độc lập mô hình này với tiếng Việt. Tổng hợp và phân tích bởi Ban Biên Tập Locaith, ngày 14/8/2026.

Messenger