DeepSeek V4.1 Flash: 552 Tỷ Tham Số, MIT, Giá Đầu Vào Chưa Bằng Một Phần Tư V4 Pro

Ngày 10/9/2026, DeepSeek phát hành V4.1 Flash — mô hình MoE đa phương thức 552 tỷ tham số, chỉ kích hoạt 8 tỷ tham số mỗi token khi nạp lời nhắc, ngữ cảnh 1 triệu token, trọng số mở theo giấy phép MIT. Giá đầu vào ngoài giờ cao điểm là 0,15 USD cho một triệu token, chưa bằng một phần tư V4 Pro. Trên

Ngày 10/9/2026, DeepSeek phát hành V4.1 Flash: 552 tỷ tham số bộ khung, kích hoạt 8 tỷ mỗi token, ngữ cảnh một triệu token, trọng số mở theo giấy phép MIT, và giá đầu vào chưa bằng một phần tư mô hình đắt nhất của chính hãng. Bài này đọc bảng thông số, bảng giá chính thức, và cả phép đo mà DeepSeek thua.

Bản này có gì

Điểm đáng chú ý nhất không nằm ở số tham số mà ở tỷ lệ giữa hai con số. 552 tỷ tham số bộ khung, nhưng mỗi token chỉ kích hoạt 8 tỷ khi nạp lời nhắc và 16 tỷ khi sinh chữ. Đó là kiến trúc hỗn hợp chuyên gia (MoE) đẩy tới mức khá cực đoan: mô hình giữ một kho năng lực rất lớn nhưng chỉ trả chi phí tính toán cho phần nhỏ được gọi ra mỗi lần.

Hạng mục Thông số
Tham số bộ khung552 tỷ
Kích hoạt mỗi token8 tỷ khi nạp lời nhắc, 16 tỷ khi sinh chữ
Kiến trúcMoE đa phương thức, dạng Causal Encoder-Decoder, 40 lớp (20 mã hoá + 20 giải mã)
Cửa sổ ngữ cảnhtới 1 triệu token
Bộ nhớ đệm KV toàn cục890 byte mỗi token
Đầu vàovăn bản và ảnh
Nỗ lực suy luậnchỉnh liên tục theo thang 1–100
Giấy phépMIT — cho phép dùng thương mại, sửa đổi, phân phối lại

Nguồn: thẻ mô hình DeepSeek-V4.1-Flash trên Hugging Face. Đây là thông số do nhà phát hành công bố.

Một chỗ dễ hiểu nhầm về con số 8 tỷ.

"Kích hoạt 8 tỷ tham số" nói về chi phí tính toán mỗi token, không nói rằng mô hình chỉ nặng 8 tỷ. Để tự chạy, bạn vẫn phải nạp toàn bộ 552 tỷ tham số vào bộ nhớ, vì không biết trước token tiếp theo sẽ gọi tới chuyên gia nào. Giấy phép MIT khiến mô hình này được phép tự chạy; nó không khiến việc đó rẻ. Với phần lớn doanh nghiệp Việt Nam, gọi qua API vẫn là con đường thực tế hơn.

Điểm chuẩn: thắng ba, thua một

DeepSeek công bố một biểu đồ so sánh V4.1 Flash với Kimi-K3, GLM-5.3, Opus 5 và GPT-5.6 Sol trên bốn phép đo thiên về tác tử. Bảng dưới đây chép lại đúng các con số trên biểu đồ đó.

Biểu đồ cột so sánh DeepSeek-V4.1-Flash với Kimi-K3, GLM-5.3, Opus5 và GPT5.6-Sol trên bốn phép đo Terminal-Bench 3.0, DeepSWE v1.1, CyberGym và Automation-Bench
Bảng điểm tác tử do DeepSeek công bố. Chú ý cụm bên trái: đây là phép đo duy nhất trong bốn phép đo mà V4.1 Flash thua, và thua khá xa. Ảnh: DeepSeek.
Phép đo V4.1 Flash Kimi-K3 GLM-5.3 Opus 5 GPT-5.6 Sol
Terminal-Bench 3.030,017,728,343,334,4
DeepSWE v1.174,267,566,974,073,0
CyberGym88,180,084,584,584,5
Automation-Bench54,846,748,850,345,8

Số do DeepSeek tự công bố, chưa có bên thứ ba đo lại. Locaith chép lại từ biểu đồ chính thức trong thẻ mô hình.

Ba trong bốn phép đo, V4.1 Flash đứng đầu, và ở CyberGym khoảng cách là thật: 88,1 so với 84,5 của cả ba đối thủ phía sau. Nhưng Terminal-Bench 3.0 thì ngược hẳn: 30,0 so với 43,3 của Opus 5, thua hơn 13 điểm — một khoảng cách lớn hơn bất kỳ khoảng cách nào mà DeepSeek dẫn trước ở ba phép đo kia. Terminal-Bench đo khả năng làm việc dài hơi trong môi trường dòng lệnh thật, đúng dạng việc mà người ta hay giao cho tác tử tự chạy.

Đọc đúng bảng này là: đây không phải mô hình tốt hơn ở mọi việc với giá rẻ hơn. Đây là mô hình rẻ hơn nhiều, mạnh hơn ở một số dạng việc, và yếu hơn rõ rệt ở dạng việc dòng lệnh dài. Việc DeepSeek để nguyên cụm cột bất lợi đó trên biểu đồ chính thức, thay vì bỏ đi, là điểm đáng ghi nhận cho tính minh bạch.

890 byte mỗi token — chỗ tiết kiệm thật nằm ở đây

Với ngữ cảnh dài, thứ quyết định chi phí thường không phải số tham số mà là bộ nhớ đệm KV — phần bộ nhớ giữ lại trạng thái của từng token đã đọc, và nó phình ra tuyến tính theo độ dài hội thoại. DeepSeek nói V4.1 Flash nén phần này xuống 890 byte mỗi token, nhờ kỹ thuật họ gọi là Compressed Sparse Attention 2 kèm bộ nhớ đệm KV ở độ chính xác FP4.

Biểu đồ cột ngang cho thấy bộ nhớ đệm KV toàn cục mỗi token giảm dần qua các đời DeepSeek: V1 389.120 byte, V3.2 48.068 byte, V4-Flash 3.514 byte và V4.1-Flash 890 byte
Bộ nhớ đệm KV mỗi token qua bốn đời mô hình DeepSeek, từ 389.120 byte ở V1 (11/2023) xuống 890 byte ở V4.1 Flash (9/2026). Ảnh: DeepSeek.

Con số này giải thích vì sao cửa sổ một triệu token là chuyện khả thi về mặt kinh tế chứ không chỉ là dòng quảng cáo. Ở mức 890 byte, một triệu token ngữ cảnh chiếm khoảng 890 MB bộ nhớ đệm; ở mức 48.068 byte của đời V3.2, cùng lượng ngữ cảnh đó sẽ ngốn khoảng 48 GB — tức là bất khả thi trên phần cứng thông thường. Đây là dạng cải tiến hạ tầng ít được nhắc tới nhưng quyết định việc bạn có dùng nổi tính năng hay không.

Bảng giá chính thức

DeepSeek tính giá theo hai khung giờ. Giờ cao điểm là 01:00–04:00 và 06:00–10:00 UTC, từ thứ Hai đến thứ Sáu; mọi khoảng thời gian còn lại, kể cả cuối tuần, tính giá ngoài cao điểm bằng đúng một nửa. Theo giờ Việt Nam (UTC+7), khung cao điểm rơi vào 08:00–11:00 và 13:00–17:00 các ngày trong tuần.

Mỗi 1 triệu token V4.1 Flash V4 Pro Chênh lệch
Đầu vào, trượt đệm (cao điểm)0,30 USD1,32 USDrẻ hơn 4,4 lần
Đầu vào, trượt đệm (ngoài cao điểm)0,15 USD0,66 USDrẻ hơn 4,4 lần
Đầu vào, trúng đệm (cao điểm)0,006 USD0,044 USDrẻ hơn 7,3 lần
Đầu vào, trúng đệm (ngoài cao điểm)0,003 USD0,022 USDrẻ hơn 7,3 lần
Đầu ra (cao điểm)1,20 USD3,96 USDrẻ hơn 3,3 lần
Đầu ra (ngoài cao điểm)0,60 USD1,98 USDrẻ hơn 3,3 lần

Nguồn: trang giá chính thức của DeepSeek, Locaith đọc ngày 13/9/2026. Trong tài liệu, V4.1 Flash mang tên gọi API là deepseek-flash.

Chênh lệch giữa trúng và trượt bộ nhớ đệm đáng để tính kỹ: 0,003 USD so với 0,15 USD là năm mươi lần. Nếu hệ thống của bạn gửi đi gửi lại cùng một đoạn chỉ dẫn dài — thường là vậy với trợ lý nội bộ hay quy trình xử lý tài liệu — thì việc sắp xếp lời nhắc sao cho phần cố định nằm ở đầu và được đệm lại sẽ tiết kiệm hơn nhiều so với việc chọn mô hình rẻ hơn.

Một lưu ý khi so giá: đây là giá của chính DeepSeek. Các nhà cung cấp trung gian chạy cùng trọng số mở này tính giá khác — trang tổng hợp llm-stats ghi nhận Fireworks bán ở mức 0,22 USD đầu vào và 0,66 USD đầu ra, tức không có khái niệm giờ cao điểm nhưng đắt hơn giá gốc ngoài cao điểm. Trọng số mở nghĩa là có nhiều nơi bán, không nghĩa là mọi nơi bán cùng giá.

V4 Pro không bị tắt ngày 14/9 — nhiều bản tin nói ngược lại

Đây là chi tiết Locaith muốn nêu riêng, vì nó có thể khiến ai đó vội vàng đổi hệ thống trong tuần này mà không cần.

Một số bài phân tích đăng sau ngày ra mắt viết rằng từ 12:00 giờ Bắc Kinh ngày 14/9/2026, mọi yêu cầu gửi tới deepseek-v4-pro sẽ được chuyển sang V4.1 Flash và tính theo giá Flash. Nếu đúng, đó sẽ là chuyện lớn: cùng một tên mô hình, nhưng phía sau là một mô hình khác với đặc tính khác.

Tài liệu cập nhật chính thức của DeepSeek nói khác. Theo đó, dịch vụ API của V4 Pro được kéo dài quá mốc 14/9/2026 ban đầu, giữ nguyên cách tính giá hiện hành, cho tới khi có thông báo mới — và lý do được nêu là nhu cầu từ người dùng. Thứ thực sự bị nghỉ hưu là hai tên gọi đời cũ deepseek-v4-flashdeepseek-v4-flash-vision-exp; hai tên này được chuyển tạm thời sang V4.1 Flash, và tài liệu không nêu hạn chót cho việc chuyển tạm đó.

Hai bản tin không mâu thuẫn hoàn toàn — nhưng một bản đã cũ.

Cách đọc hợp lý nhất: mốc 14/9 từng là kế hoạch thật, sau đó DeepSeek gia hạn. Các bài viết nêu mốc đó không bịa ra nó, mà chép lại một thông báo đã bị thay thế. Bài học vận hành thì không đổi: với thông tin về vòng đời mô hình, hãy đọc thẳng tài liệu của nhà cung cấp, không đọc qua bản tin. Đây là loại thông tin thay đổi lặng lẽ và các bài phân tích hiếm khi được cập nhật lại.

Điều doanh nghiệp Việt Nam nên rút ra

Với các nghiệp vụ văn bản hành chính theo Nghị định 30/2020/NĐ-CP mà Compose Word của Locaith phục vụ, phần đáng chú ý ở bản này là cửa sổ một triệu token với chi phí đệm thấp: nó cho phép nạp trọn một tập quy định dài làm ngữ cảnh cố định và hỏi nhiều lần trên đó, thay vì cắt nhỏ tài liệu rồi ghép kết quả.

Nguồn:

Toàn bộ điểm chuẩn trong bài là số do DeepSeek tự công bố và chưa có bên thứ ba đo lại; Locaith chép trực tiếp từ biểu đồ chính thức thay vì qua bản tin trung gian. Thông số kiến trúc và giá lấy từ tài liệu sơ cấp của DeepSeek. Có mâu thuẫn giữa các nguồn về số tham số: thẻ mô hình chính thức ghi 552 tỷ tham số bộ khung, trong khi trang tổng hợp llm-stats ghi 763,2 tỷ; bài này dùng con số của thẻ mô hình và nêu rõ sự chênh lệch. Cũng có mâu thuẫn về số phận của V4 Pro: một số bài phân tích nêu mốc dừng 14/9/2026, còn tài liệu chính thức nói dịch vụ được kéo dài quá mốc đó; Locaith theo tài liệu chính thức và nêu cả hai phiên bản. Quy đổi giờ cao điểm sang giờ Việt Nam là tính toán của Locaith từ khung UTC do DeepSeek công bố. Các khuyến nghị cuối bài là quan điểm riêng của Locaith. Ảnh bìa, biểu đồ điểm chuẩn và biểu đồ bộ nhớ đệm: DeepSeek. Biên soạn và phân tích bởi Ban Biên Tập Locaith, 13/9/2026.

Messenger