Cuộc Chiến Giá AI Tăng Nhiệt: DeepSeek Hạ Giá Sâu, OpenAI Giảm 80% Giá GPT-5.6 Luna

Chỉ trong bốn ngày cuối tháng 7/2026, DeepSeek tung V4-Flash-0731 với giá 0,14 USD mỗi triệu token đầu vào, còn OpenAI cắt 80% giá GPT-5.6 Luna. Ngày 3/8, Alibaba ra mắt Qwen3.8-Max 2,4 nghìn tỷ tham số. Nhưng đọc kỹ bảng giá sẽ thấy: giá chỉ rơi ở tầng phổ thông, còn tầng cao cấp gần như không nhúc

Bốn ngày. Đó là khoảng cách giữa việc OpenAI cắt 80% giá một model chủ lực và DeepSeek tung ra model lập trình có giá 0,14 USD mỗi triệu token. Thêm bốn ngày nữa, Alibaba ra mắt model 2,4 nghìn tỷ tham số. Nhưng nếu chỉ đọc tiêu đề, doanh nghiệp sẽ rút ra kết luận sai về chuyện đang thực sự xảy ra với giá AI.

1. DeepSeek V4 Flash 0731 — Đẩy Giá Xuống Đáy

Ngày 31/7/2026, DeepSeek phát hành DeepSeek-V4-Flash-0731, bản huấn luyện lại của dòng V4 Flash nhắm vào lập trình, suy luận và luồng tác nhân. Thông số kiến trúc: MoE thưa với 284 tỷ tham số tổng, 13 tỷ tham số kích hoạt mỗi token, cửa sổ ngữ cảnh 1.048.576 token, đầu ra tối đa 65.536 token.

Con số gây chú ý nằm ở bảng giá chính thức của DeepSeek:

Về năng lực, đánh giá độc lập của Artificial Analysis — không phải số do DeepSeek tự công bố — cho V4 Flash 0731 đạt 50 điểm trên Artificial Analysis Intelligence Index, xếp hạng 3 trong 101 model thuộc nhóm so sánh của họ, với tốc độ sinh 115,9 token/giây. Quy đổi theo tỷ lệ 7:2:1 giữa đầu vào trúng đệm, đầu vào thường và đầu ra, giá hỗn hợp rơi về khoảng 0,06 USD mỗi triệu token.

Bảng giá chính thức trong tài liệu API của DeepSeek, cột deepseek-v4-flash (bản DeepSeek-V4-Flash-0731) và deepseek-v4-pro. Mỗi triệu token: flash có 0,0028 USD đầu vào trúng bộ nhớ đệm, 0,14 USD đầu vào không trúng đệm, 0,28 USD đầu ra; pro là 0,003625 / 0,435 / 0,87 USD. Cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 384K, giới hạn đồng thời 2500 và 500. Chú thích (2) ghi dịch vụ sắp áp dụng giá giờ cao điểm gấp đôi, khung 9h–12h và 14h–18h giờ Bắc Kinh (UTC+8).
Nguồn gốc của mọi con số giá DeepSeek trong bài. Khoảng cách 50 lần giữa 0,0028 USD (trúng bộ nhớ đệm) và 0,14 USD (không trúng đệm) nằm ngay trên hai hàng liền nhau, và chú thích (2) chính là căn cứ cho chính sách giờ cao điểm nhân đôi giá — khung 9h–12h và 14h–18h giờ Bắc Kinh mà bài quy đổi thành 8h–11h và 13h–17h giờ Việt Nam. Ảnh: Tài liệu API DeepSeek, bản lưu Internet Archive ngày 3/8/2026 (giá trên trang hiện tại đã được điều chỉnh sau bài viết).

2. OpenAI Đáp Trả: Giảm 80% Giá Luna

Ngày 30/7/2026 — trước DeepSeek đúng một ngày — OpenAI công bố đợt giảm giá mạnh nhất từ đầu năm. Hãng giải thích nguyên nhân đến từ cải thiện hiệu suất trên cả mô hình lẫn hệ thống phục vụ.

Ít ngày sau, OpenAI công bố cột mốc một tỷ người dùng hoạt động. Ở quy mô đó, mỗi phần trăm chi phí suy luận tiết kiệm được đều là con số rất lớn — điều này giải thích vì sao hãng sẵn sàng hạ giá tầng dưới thay vì tầng trên.

3. Alibaba Nhập Cuộc Với Qwen3.8-Max

Ngày 3/8/2026, Alibaba chính thức ra mắt Qwen3.8-Max sau bản xem trước tại Hội nghị AI Thế giới ở Thượng Hải hôm 19/7. Đây là mô hình MoE thưa 2,4 nghìn tỷ tham số tổng, khoảng 95 tỷ tham số kích hoạt mỗi token, ngữ cảnh 1 triệu token, nhận đầu vào đa phương thức gồm văn bản, ảnh và video, trả về văn bản.

Giá ra mắt trên QwenCloud: 2 USD / 6 USD mỗi triệu token, riêng token đệm ngầm là 0,25 USD. Điểm đáng chú ý hơn giá: Alibaba cam kết mở trọng số trong khoảng một tuần sau ra mắt, trên Hugging Face và ModelScope — đây sẽ là model thuộc dòng Max đầu tiên mà hãng mở trọng số. Tại thời điểm đăng bài, trọng số chưa được phát hành.

Bảng So Sánh Giá (USD / 1 Triệu Token)

Model Đầu vào Đầu ra Ghi chú
DeepSeek V4 Flash 0731 0,14 0,28 Đệm: 0,0028 · sắp có giá giờ cao điểm ×2
DeepSeek V4 Pro 0,435 0,87 Đệm: 0,003625
GPT-5.6 Luna 0,20 1,20 Giảm 80% từ 1 / 6 (30/7/2026)
GPT-5.6 Terra 2,00 12,00 Giảm 20% từ 2,50 / 15
Qwen3.8-Max 2,00 6,00 Đệm ngầm: 0,25 · hứa mở trọng số
Claude Opus 5 5,00 25,00 không đổi
GPT-5.6 Sol chưa công bố mức mới chưa công bố mức mới giữ nguyên giá

Giá Rơi Ở Tầng Nào? Đây Mới Là Câu Chuyện Thật

Xếp các con số cạnh nhau sẽ thấy một quy luật rõ ràng mà phần lớn bản tin bỏ sót: giá chỉ sụp ở tầng phổ thông. GPT-5.6 Sol giữ nguyên. Claude Opus 5 vẫn 5 / 25 USD. Trong khi đó Luna giảm 80%, Terra giảm 20%, DeepSeek V4 Flash xuống 0,14 USD.

Cái đang trở thành hàng hoá phổ thông là năng lực tầm trung, không phải năng lực tiên phong

Ở tầng dưới, nhiều nhà cung cấp bán thứ gần như thay thế được cho nhau, nên giá bị đẩy về sát chi phí vận hành. Ở tầng tiên phong, số người bán vẫn đếm trên đầu ngón tay và giá gần như bất động. Với doanh nghiệp, hệ quả rất thực tế: chi phí cho phần việc dễ đang tiến gần về 0, còn chi phí cho phần việc khó thì không. Bài toán tối ưu vì thế chuyển từ "chọn model rẻ nhất" sang "định tuyến đúng việc vào đúng tầng".

Cái Bẫy Giờ Cao Điểm Rơi Trúng Giờ Hành Chính Việt Nam

Đây là chi tiết mà doanh nghiệp Việt cần đọc kỹ. Tài liệu API của DeepSeek ghi rõ dịch vụ sắp áp dụng chính sách giá theo giờ cao điểm và thấp điểm, trong đó giờ cao điểm giá gấp đôi. Khung giờ cao điểm được công bố là 9h–12h và 14h–18h giờ Bắc Kinh.

Bắc Kinh ở múi giờ UTC+8, Việt Nam UTC+7. Quy đổi ra giờ Việt Nam là 8h–11h và 13h–17hgần như trùng khít giờ hành chính. Nói cách khác, nếu doanh nghiệp dùng DeepSeek cho các tác vụ nội bộ do nhân viên kích hoạt trong giờ làm việc, mức giá thực tế phải tính là 0,28 USD đầu vào và 0,56 USD đầu ra, chứ không phải con số 0,14 / 0,28 trên trang chủ.

Ngược lại, các tác vụ chạy nền không cần tức thời — tổng hợp báo cáo đêm, xử lý hàng loạt tài liệu, sinh nội dung theo lô — nếu hẹn lịch chạy ngoài hai khung trên sẽ giữ được giá gốc. Lưu ý: tại thời điểm đăng bài, tài liệu DeepSeek dùng chữ "sắp áp dụng", chưa nêu ngày hiệu lực cụ thể.

Bộ Nhớ Đệm Mới Là Nơi Tiết Kiệm Thật

Khoảng cách giữa 0,14 USD (không trúng đệm) và 0,0028 USD (trúng đệm) là 50 lần — lớn hơn nhiều so với mọi khác biệt giữa các nhà cung cấp. Điều này có nghĩa: cách bạn dựng prompt ảnh hưởng tới hoá đơn nhiều hơn cả việc bạn chọn hãng nào.

Lời Khuyên Cho Doanh Nghiệp Việt Nam

Đây cũng chính là nguyên tắc Locaith áp dụng khi xây Compose Word (soạn thảo văn bản hành chính chuẩn Nghị định 30/2020/NĐ-CP) và Design Studio: mỗi bước trong quy trình được ghép với model vừa đủ mạnh cho bước đó, thay vì dùng một model đắt nhất cho toàn bộ luồng.

Câu Hỏi Thường Gặp

DeepSeek V4 Flash giá bao nhiêu?

Theo bảng giá chính thức của DeepSeek, deepseek-v4-flash có giá 0,14 USD mỗi triệu token đầu vào khi không trúng bộ nhớ đệm, 0,28 USD mỗi triệu token đầu ra, và chỉ 0,0028 USD mỗi triệu token đầu vào khi trúng bộ nhớ đệm — tức rẻ hơn 50 lần so với đầu vào thường.

OpenAI đã giảm giá những model nào?

Ngày 30/7/2026, OpenAI giảm giá GPT-5.6 Luna tới 80%, từ 1 USD / 6 USD xuống còn 0,20 USD / 1,20 USD mỗi triệu token đầu vào và đầu ra. GPT-5.6 Terra giảm 20%, từ 2,50 USD / 15 USD xuống 2 USD / 12 USD. Model đầu bảng Sol giữ nguyên giá. OpenAI giải thích nguyên nhân là nhờ cải thiện hiệu suất ở cả mô hình lẫn hệ thống phục vụ.

Giá AI rẻ đi có nghĩa là model mạnh nhất cũng rẻ đi không?

Không. Đây là hiểu nhầm phổ biến nhất về đợt giảm giá này. GPT-5.6 Sol của OpenAI giữ nguyên giá, Claude Opus 5 vẫn 5 USD / 25 USD. Giá chỉ sụp ở tầng phổ thông và tầng suy luận nhanh, nơi có nhiều model cạnh tranh trực tiếp. Tầng tiên phong vẫn là thị trường ít người bán và gần như không giảm.

Chính sách giá giờ cao điểm của DeepSeek ảnh hưởng thế nào tới Việt Nam?

DeepSeek thông báo sẽ áp dụng giá theo giờ cao điểm và thấp điểm, trong đó giờ cao điểm nhân đôi giá. Khung giờ cao điểm là 9h–12h và 14h–18h giờ Bắc Kinh, tương ứng 8h–11h và 13h–17h giờ Việt Nam. Đây gần như trùng khít giờ hành chính Việt Nam, nên doanh nghiệp dùng DeepSeek cho tác vụ nội bộ có nguy cơ luôn rơi vào khung giá gấp đôi.

Qwen3.8-Max có gì đáng chú ý?

Alibaba ra mắt Qwen3.8-Max ngày 3/8/2026: mô hình MoE thưa 2,4 nghìn tỷ tham số tổng, khoảng 95 tỷ tham số kích hoạt mỗi token, cửa sổ ngữ cảnh 1 triệu token, nhận đầu vào đa phương thức gồm văn bản, ảnh và video. Giá ra mắt là 2 USD / 6 USD mỗi triệu token. Alibaba cam kết mở trọng số trong khoảng một tuần — đây sẽ là model đầu bảng đầu tiên của hãng được mở trọng số.

Nguồn tham khảo:

Giá DeepSeek lấy trực tiếp từ tài liệu API chính thức. Điểm Intelligence Index, tốc độ sinh và giá hỗn hợp là số đo độc lập của Artificial Analysis, không phải số nhà phát triển tự công bố. Giá GPT-5.6 và Qwen3.8-Max lấy từ tường thuật báo chí về công bố của hãng; trọng số Qwen3.8-Max chưa phát hành tại thời điểm đăng bài. Quy đổi khung giờ cao điểm sang giờ Việt Nam do Ban Biên Tập Locaith thực hiện. Bài viết được Ban Biên Tập Locaith tổng hợp & phân tích, cập nhật ngày 5/8/2026.

Messenger