DeepSeek V4.1 Flash: 552 Tỷ Tham Số, MIT, Giá Đầu Vào Chưa Bằng Một Phần Tư V4 Pro
Ngày 10/9/2026, DeepSeek phát hành V4.1 Flash — mô hình MoE đa phương thức 552 tỷ tham số, chỉ kích hoạt 8 tỷ tham số mỗi token khi nạp lời nhắc, ngữ cảnh 1 triệu token, trọng số mở theo giấy phép MIT. Giá đầu vào ngoài giờ cao điểm là 0,15 USD cho một triệu token, chưa bằng một phần tư V4 Pro. Trên
Ngày 10/9/2026, DeepSeek phát hành V4.1 Flash: 552 tỷ tham số bộ khung, kích hoạt 8 tỷ mỗi token, ngữ cảnh một triệu token, trọng số mở theo giấy phép MIT, và giá đầu vào chưa bằng một phần tư mô hình đắt nhất của chính hãng. Bài này đọc bảng thông số, bảng giá chính thức, và cả phép đo mà DeepSeek thua.
Bản này có gì
Điểm đáng chú ý nhất không nằm ở số tham số mà ở tỷ lệ giữa hai con số. 552 tỷ tham số bộ khung, nhưng mỗi token chỉ kích hoạt 8 tỷ khi nạp lời nhắc và 16 tỷ khi sinh chữ. Đó là kiến trúc hỗn hợp chuyên gia (MoE) đẩy tới mức khá cực đoan: mô hình giữ một kho năng lực rất lớn nhưng chỉ trả chi phí tính toán cho phần nhỏ được gọi ra mỗi lần.
| Hạng mục | Thông số |
|---|---|
| Tham số bộ khung | 552 tỷ |
| Kích hoạt mỗi token | 8 tỷ khi nạp lời nhắc, 16 tỷ khi sinh chữ |
| Kiến trúc | MoE đa phương thức, dạng Causal Encoder-Decoder, 40 lớp (20 mã hoá + 20 giải mã) |
| Cửa sổ ngữ cảnh | tới 1 triệu token |
| Bộ nhớ đệm KV toàn cục | 890 byte mỗi token |
| Đầu vào | văn bản và ảnh |
| Nỗ lực suy luận | chỉnh liên tục theo thang 1–100 |
| Giấy phép | MIT — cho phép dùng thương mại, sửa đổi, phân phối lại |
Nguồn: thẻ mô hình DeepSeek-V4.1-Flash trên Hugging Face. Đây là thông số do nhà phát hành công bố.
Một chỗ dễ hiểu nhầm về con số 8 tỷ.
"Kích hoạt 8 tỷ tham số" nói về chi phí tính toán mỗi token, không nói rằng mô hình chỉ nặng 8 tỷ. Để tự chạy, bạn vẫn phải nạp toàn bộ 552 tỷ tham số vào bộ nhớ, vì không biết trước token tiếp theo sẽ gọi tới chuyên gia nào. Giấy phép MIT khiến mô hình này được phép tự chạy; nó không khiến việc đó rẻ. Với phần lớn doanh nghiệp Việt Nam, gọi qua API vẫn là con đường thực tế hơn.
Điểm chuẩn: thắng ba, thua một
DeepSeek công bố một biểu đồ so sánh V4.1 Flash với Kimi-K3, GLM-5.3, Opus 5 và GPT-5.6 Sol trên bốn phép đo thiên về tác tử. Bảng dưới đây chép lại đúng các con số trên biểu đồ đó.
| Phép đo | V4.1 Flash | Kimi-K3 | GLM-5.3 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 3.0 | 30,0 | 17,7 | 28,3 | 43,3 | 34,4 |
| DeepSWE v1.1 | 74,2 | 67,5 | 66,9 | 74,0 | 73,0 |
| CyberGym | 88,1 | 80,0 | 84,5 | 84,5 | 84,5 |
| Automation-Bench | 54,8 | 46,7 | 48,8 | 50,3 | 45,8 |
Số do DeepSeek tự công bố, chưa có bên thứ ba đo lại. Locaith chép lại từ biểu đồ chính thức trong thẻ mô hình.
Ba trong bốn phép đo, V4.1 Flash đứng đầu, và ở CyberGym khoảng cách là thật: 88,1 so với 84,5 của cả ba đối thủ phía sau. Nhưng Terminal-Bench 3.0 thì ngược hẳn: 30,0 so với 43,3 của Opus 5, thua hơn 13 điểm — một khoảng cách lớn hơn bất kỳ khoảng cách nào mà DeepSeek dẫn trước ở ba phép đo kia. Terminal-Bench đo khả năng làm việc dài hơi trong môi trường dòng lệnh thật, đúng dạng việc mà người ta hay giao cho tác tử tự chạy.
Đọc đúng bảng này là: đây không phải mô hình tốt hơn ở mọi việc với giá rẻ hơn. Đây là mô hình rẻ hơn nhiều, mạnh hơn ở một số dạng việc, và yếu hơn rõ rệt ở dạng việc dòng lệnh dài. Việc DeepSeek để nguyên cụm cột bất lợi đó trên biểu đồ chính thức, thay vì bỏ đi, là điểm đáng ghi nhận cho tính minh bạch.
890 byte mỗi token — chỗ tiết kiệm thật nằm ở đây
Với ngữ cảnh dài, thứ quyết định chi phí thường không phải số tham số mà là bộ nhớ đệm KV — phần bộ nhớ giữ lại trạng thái của từng token đã đọc, và nó phình ra tuyến tính theo độ dài hội thoại. DeepSeek nói V4.1 Flash nén phần này xuống 890 byte mỗi token, nhờ kỹ thuật họ gọi là Compressed Sparse Attention 2 kèm bộ nhớ đệm KV ở độ chính xác FP4.
Con số này giải thích vì sao cửa sổ một triệu token là chuyện khả thi về mặt kinh tế chứ không chỉ là dòng quảng cáo. Ở mức 890 byte, một triệu token ngữ cảnh chiếm khoảng 890 MB bộ nhớ đệm; ở mức 48.068 byte của đời V3.2, cùng lượng ngữ cảnh đó sẽ ngốn khoảng 48 GB — tức là bất khả thi trên phần cứng thông thường. Đây là dạng cải tiến hạ tầng ít được nhắc tới nhưng quyết định việc bạn có dùng nổi tính năng hay không.
Bảng giá chính thức
DeepSeek tính giá theo hai khung giờ. Giờ cao điểm là 01:00–04:00 và 06:00–10:00 UTC, từ thứ Hai đến thứ Sáu; mọi khoảng thời gian còn lại, kể cả cuối tuần, tính giá ngoài cao điểm bằng đúng một nửa. Theo giờ Việt Nam (UTC+7), khung cao điểm rơi vào 08:00–11:00 và 13:00–17:00 các ngày trong tuần.
| Mỗi 1 triệu token | V4.1 Flash | V4 Pro | Chênh lệch |
|---|---|---|---|
| Đầu vào, trượt đệm (cao điểm) | 0,30 USD | 1,32 USD | rẻ hơn 4,4 lần |
| Đầu vào, trượt đệm (ngoài cao điểm) | 0,15 USD | 0,66 USD | rẻ hơn 4,4 lần |
| Đầu vào, trúng đệm (cao điểm) | 0,006 USD | 0,044 USD | rẻ hơn 7,3 lần |
| Đầu vào, trúng đệm (ngoài cao điểm) | 0,003 USD | 0,022 USD | rẻ hơn 7,3 lần |
| Đầu ra (cao điểm) | 1,20 USD | 3,96 USD | rẻ hơn 3,3 lần |
| Đầu ra (ngoài cao điểm) | 0,60 USD | 1,98 USD | rẻ hơn 3,3 lần |
Nguồn: trang giá chính thức của DeepSeek, Locaith đọc ngày 13/9/2026. Trong tài liệu, V4.1 Flash mang tên gọi API là deepseek-flash.
Chênh lệch giữa trúng và trượt bộ nhớ đệm đáng để tính kỹ: 0,003 USD so với 0,15 USD là năm mươi lần. Nếu hệ thống của bạn gửi đi gửi lại cùng một đoạn chỉ dẫn dài — thường là vậy với trợ lý nội bộ hay quy trình xử lý tài liệu — thì việc sắp xếp lời nhắc sao cho phần cố định nằm ở đầu và được đệm lại sẽ tiết kiệm hơn nhiều so với việc chọn mô hình rẻ hơn.
Một lưu ý khi so giá: đây là giá của chính DeepSeek. Các nhà cung cấp trung gian chạy cùng trọng số mở này tính giá khác — trang tổng hợp llm-stats ghi nhận Fireworks bán ở mức 0,22 USD đầu vào và 0,66 USD đầu ra, tức không có khái niệm giờ cao điểm nhưng đắt hơn giá gốc ngoài cao điểm. Trọng số mở nghĩa là có nhiều nơi bán, không nghĩa là mọi nơi bán cùng giá.
V4 Pro không bị tắt ngày 14/9 — nhiều bản tin nói ngược lại
Đây là chi tiết Locaith muốn nêu riêng, vì nó có thể khiến ai đó vội vàng đổi hệ thống trong tuần này mà không cần.
Một số bài phân tích đăng sau ngày ra mắt viết rằng từ 12:00 giờ Bắc Kinh ngày 14/9/2026, mọi yêu cầu gửi tới deepseek-v4-pro sẽ được chuyển sang V4.1 Flash và tính theo giá Flash. Nếu đúng, đó sẽ là chuyện lớn: cùng một tên mô hình, nhưng phía sau là một mô hình khác với đặc tính khác.
Tài liệu cập nhật chính thức của DeepSeek nói khác. Theo đó, dịch vụ API của V4 Pro được kéo dài quá mốc 14/9/2026 ban đầu, giữ nguyên cách tính giá hiện hành, cho tới khi có thông báo mới — và lý do được nêu là nhu cầu từ người dùng. Thứ thực sự bị nghỉ hưu là hai tên gọi đời cũ deepseek-v4-flash và deepseek-v4-flash-vision-exp; hai tên này được chuyển tạm thời sang V4.1 Flash, và tài liệu không nêu hạn chót cho việc chuyển tạm đó.
Hai bản tin không mâu thuẫn hoàn toàn — nhưng một bản đã cũ.
Cách đọc hợp lý nhất: mốc 14/9 từng là kế hoạch thật, sau đó DeepSeek gia hạn. Các bài viết nêu mốc đó không bịa ra nó, mà chép lại một thông báo đã bị thay thế. Bài học vận hành thì không đổi: với thông tin về vòng đời mô hình, hãy đọc thẳng tài liệu của nhà cung cấp, không đọc qua bản tin. Đây là loại thông tin thay đổi lặng lẽ và các bài phân tích hiếm khi được cập nhật lại.
Điều doanh nghiệp Việt Nam nên rút ra
- Giấy phép MIT là thứ hiếm ở tầm năng lực này, và nó có giá trị pháp lý cụ thể. Nhiều mô hình tự nhận "mở" nhưng kèm điều khoản giới hạn số người dùng, cấm dùng để huấn luyện mô hình khác, hoặc buộc xin phép khi vượt ngưỡng doanh thu. MIT gần như không ràng buộc gì. Với doanh nghiệp cần cam kết rằng nhà cung cấp không thể đơn phương cắt quyền sử dụng, đây là khác biệt đáng kể — kể cả khi trên thực tế bạn vẫn gọi qua API.
- Tính lại chi phí theo bộ nhớ đệm, đừng chỉ so giá niêm yết. Khoảng cách năm mươi lần giữa trúng đệm và trượt đệm lớn hơn mọi khoảng cách giữa các mô hình trong bảng. Nếu quy trình của bạn lặp lại cùng một đoạn chỉ dẫn dài, cấu trúc lời nhắc quyết định hoá đơn nhiều hơn việc chọn mô hình nào.
- Thử trên việc thật trước khi chuyển đổi, đặc biệt nếu bạn dùng tác tử dòng lệnh. Bảng điểm cho thấy V4.1 Flash mạnh ở tìm lỗi bảo mật và tự động hoá, nhưng thua Opus 5 hơn 13 điểm ở Terminal-Bench 3.0. Nếu việc của bạn là loại việc đó, khoản tiết kiệm bốn lần có thể bị ăn mòn hết bởi số lần chạy lại.
- Khung giờ cao điểm là một đòn bẩy có thật. Các tác vụ theo lô không cần chạy ngay — tổng hợp báo cáo, xử lý tài liệu tồn, làm giàu dữ liệu — nếu hẹn giờ chạy ngoài khung 08:00–11:00 và 13:00–17:00 giờ Việt Nam sẽ trả đúng một nửa. Cuối tuần luôn là giá ngoài cao điểm.
Với các nghiệp vụ văn bản hành chính theo Nghị định 30/2020/NĐ-CP mà Compose Word của Locaith phục vụ, phần đáng chú ý ở bản này là cửa sổ một triệu token với chi phí đệm thấp: nó cho phép nạp trọn một tập quy định dài làm ngữ cảnh cố định và hỏi nhiều lần trên đó, thay vì cắt nhỏ tài liệu rồi ghép kết quả.
Nguồn:
- DeepSeek — Thẻ mô hình DeepSeek-V4.1-Flash trên Hugging Face — nguồn sơ cấp cho 552 tỷ tham số bộ khung, mức kích hoạt 8 tỷ/16 tỷ, kiến trúc Causal Encoder-Decoder 40 lớp, ngữ cảnh 1 triệu token, bộ nhớ đệm KV 890 byte/token, kỹ thuật CSA2 với đệm FP4, giấy phép MIT và thang nỗ lực suy luận 1–100; Locaith đọc 13/9/2026
- DeepSeek — Biểu đồ điểm chuẩn tác tử chính thức và biểu đồ bộ nhớ đệm KV — nguồn cho toàn bộ số trong hai bảng điểm và cho mốc phát hành 9/2026; Locaith chép lại trực tiếp từ hình
- DeepSeek — Bảng giá API chính thức — nguồn sơ cấp cho toàn bộ bảng giá, cho khung giờ cao điểm 01:00–04:00 và 06:00–10:00 UTC, và cho mức giảm một nửa ngoài cao điểm; Locaith đọc 13/9/2026
- DeepSeek — Nhật ký cập nhật API — nguồn sơ cấp cho ngày phát hành 10/9/2026, cho việc hai tên gọi đời cũ được chuyển tạm sang V4.1 Flash, và cho việc dịch vụ V4 Pro được kéo dài quá mốc 14/9/2026; Locaith đọc 13/9/2026
- Yotta Labs — DeepSeek V4.1 Flash: Pricing, Specs, V4 Pro Routing — bài nêu mốc chuyển hướng 14/9/2026 mà tài liệu chính thức đã thay thế; dẫn ở đây để bạn đọc đối chiếu, không dùng làm nguồn dữ kiện
- llm-stats — trang tổng hợp DeepSeek-V4.1-Flash — nguồn cho mức giá của nhà cung cấp trung gian Fireworks (0,22 USD đầu vào, 0,66 USD đầu ra)
Toàn bộ điểm chuẩn trong bài là số do DeepSeek tự công bố và chưa có bên thứ ba đo lại; Locaith chép trực tiếp từ biểu đồ chính thức thay vì qua bản tin trung gian. Thông số kiến trúc và giá lấy từ tài liệu sơ cấp của DeepSeek. Có mâu thuẫn giữa các nguồn về số tham số: thẻ mô hình chính thức ghi 552 tỷ tham số bộ khung, trong khi trang tổng hợp llm-stats ghi 763,2 tỷ; bài này dùng con số của thẻ mô hình và nêu rõ sự chênh lệch. Cũng có mâu thuẫn về số phận của V4 Pro: một số bài phân tích nêu mốc dừng 14/9/2026, còn tài liệu chính thức nói dịch vụ được kéo dài quá mốc đó; Locaith theo tài liệu chính thức và nêu cả hai phiên bản. Quy đổi giờ cao điểm sang giờ Việt Nam là tính toán của Locaith từ khung UTC do DeepSeek công bố. Các khuyến nghị cuối bài là quan điểm riêng của Locaith. Ảnh bìa, biểu đồ điểm chuẩn và biểu đồ bộ nhớ đệm: DeepSeek. Biên soạn và phân tích bởi Ban Biên Tập Locaith, 13/9/2026.