DeepSeek V4 Pro 0813: Điểm Tự Công Bố Vọt Cao, Đo Độc Lập Chỉ Hơn Bản Rẻ Một Điểm
DeepSeek lặng lẽ nâng cấp mô hình đầu bảng ngày 12/8/2026 — không blog, không thông cáo, chỉ một dòng trong tài liệu API. Bảng điểm tự công bố cho thấy mức nhảy vọt ở nhóm tác tử, có hạng mục tăng gần 50 điểm. Nhưng khi Artificial Analysis đo độc lập, mô hình đạt 53 điểm chỉ số tổng hợp — hơn đúng m
Ngày 12/8/2026, DeepSeek nâng cấp mô hình đầu bảng của mình lên bản V4-Pro-0813 — không blog, không thông cáo báo chí, chỉ một dòng trong nhật ký cập nhật tài liệu API. Bảng điểm hãng tự công bố cho thấy những bước nhảy rất lớn ở nhóm tác tử. Nhưng khi Artificial Analysis đo độc lập, kết quả kể một câu chuyện khác hẳn — và đó mới là phần đáng đọc.
1. Một Bản Phát Hành Gần Như Im Lặng
Thông báo duy nhất là dòng chữ trong tài liệu API của DeepSeek: "Mô hình deepseek-v4-pro đã được cập nhật lên DeepSeek-V4-Pro-0813." Không có bài blog kỹ thuật, không có thẻ mô hình chi tiết, không có bài đăng mạng xã hội.
Theo South China Morning Post, hãng có đăng một thông báo ngắn trên website chính thức, nói rằng bản mới có "năng lực tác tử được nâng cao đáng kể" — nhưng thông báo đó đã bị gỡ trong chiều hôm sau. Với một bản nâng cấp mô hình đầu bảng, cách phát hành như vậy là bất thường, nhất là khi so với sự chú ý mà chính DeepSeek từng nhận được ở các thế hệ trước.
2. Bảng Điểm DeepSeek Tự Công Bố
So với bản xem trước, các con số hãng đưa ra rất ấn tượng:
| Bộ đánh giá | Bản xem trước | Bản 0813 |
|---|---|---|
| DeepSWE (kỹ thuật phần mềm) | 12,8 | 62,7 |
| CyberGym (an ninh mạng) | 52,7 | 83,3 |
| Terminal-Bench 2.1 (tác tử dòng lệnh) | 72,1 | 87,9 |
| NL2Repo | chưa công bố | 61,5 |
Mức tăng gần 50 điểm ở DeepSWE là con số dễ gây chú ý nhất. Nếu chỉ đọc bảng này, kết luận tự nhiên sẽ là DeepSeek vừa tạo ra một bước nhảy lớn về năng lực lập trình tự động.
3. Rồi Bên Thứ Ba Đo Lại
Artificial Analysis chạy mô hình qua bộ chỉ số tổng hợp Intelligence Index phiên bản 4.1.1 — gồm chín bài đánh giá trải từ suy luận, lập trình, dùng công cụ tác tử đến kiến thức. Kết quả: 53 điểm.
Khoảng lệch đáng chú ý nhất
Trên cùng một bộ đánh giá Terminal-Bench v2.1: DeepSeek công bố 87,9, Artificial Analysis đo được 79. Chênh gần 9 điểm. Đây không nhất thiết là dấu hiệu của sự thiếu trung thực — các bộ đánh giá tác tử phụ thuộc mạnh vào khung chạy, cách viết prompt, mức "effort" và bộ công cụ đi kèm, và nhà cung cấp đương nhiên chạy ở cấu hình tốt nhất của mình. Nhưng nó cho thấy rõ vì sao số của nhà cung cấp không thay thế được số đo độc lập.
Các hạng mục đo độc lập khác của Artificial Analysis:
| Bộ đánh giá | Điểm | Nội dung |
|---|---|---|
| GPQA Diamond | 93% | Suy luận khoa học trình độ sau đại học |
| Terminal-Bench v2.1 | 79% | Tác tử dòng lệnh — hãng công bố 87,9 |
| GDPval-AA v2 | 55% | Công việc thực tế dạng tác tử |
| AA-Omniscience | 49% | Kiến thức |
| SciCode | 49% | Lập trình khoa học |
| τ³-Banking | 40% | Dùng công cụ trong nghiệp vụ ngân hàng |
| Humanity's Last Exam | 39% | Suy luận khó |
| CritPt | 18% | Suy luận vật lý |
4. Vấn Đề Thật Sự: Hơn Bản Rẻ Đúng Một Điểm
Con số 53 điểm đưa V4 Pro 0813 lên hạng 3 trong 106 mô hình mà Artificial Analysis xếp hạng — nghe rất tốt. Nhưng đặt cạnh các mốc so sánh cụ thể thì bức tranh khác đi:
- Hơn đúng 1 điểm so với DeepSeek V4 Flash 0731 (52 điểm) — chính mô hình rẻ hơn và nhanh hơn của DeepSeek, vốn từng được khen ngợi về hiệu quả chi phí hồi tháng trước. Đây là so sánh gây khó xử nhất cho hãng.
- Ngang GLM-5.2 của Zhipu AI, cũng 53 điểm.
- Kém GPT-5.6 của OpenAI (57 điểm) và Kimi K3 của Moonshot AI (60 điểm).
- Xếp thứ 12 trên bảng Vals Index, dưới cả GPT-5.5 thế hệ trước và các hệ thống biên giới như Claude Opus 5.
Theo phân tích của Vals AI, mô hình gặp khó ở hai việc rất cụ thể: hoàn thành tác vụ trong môi trường terminal có kiểm soát, và dựng mô hình tài chính phức tạp trên bảng tính Excel. Điều này đáng chú ý vì cả hai đều nằm đúng trong nhóm năng lực mà thông báo đã bị gỡ của hãng nhấn mạnh.
Mảng mô hình thực sự nổi bật là an ninh mạng — SCMP ghi nhận mô hình gây ấn tượng với giới nghiên cứu ở các lĩnh vực hẹp này, phù hợp với mức tăng CyberGym mà hãng công bố. SCMP cũng ghi nhận một bộ phận lập trình viên bày tỏ thất vọng về cả năng lực lẫn giá, trái ngược với sự đón nhận dành cho bản V4 Flash nhỏ hơn.
5. Thông Số Kỹ Thuật Và Giá
| Hạng mục | Thông số | Ghi chú |
|---|---|---|
| Tham số | 1,6 nghìn tỷ | 49 tỷ hoạt động mỗi lượt (MoE) |
| Độ dài context | 1 triệu token | Theo OpenRouter |
| Tốc độ sinh | ~80 token/giây | Đo bởi Artificial Analysis |
| Độ trễ token đầu | 1,82 giây | Đo bởi Artificial Analysis |
| Giá (OpenRouter) | 0,435 / 0,87 USD | Đầu vào / đầu ra, mỗi triệu token |
| Giá (Artificial Analysis) | 1,32 / 3,96 USD | Nhiều khả năng ở cấu hình effort cao nhất |
| Đầu vào trúng cache | 0,004 USD | Mỗi triệu token |
Về giá, hai nguồn của chúng tôi ghi khác nhau và chúng tôi giữ nguyên cả hai thay vì chọn một bên. Cách giải thích hợp lý nhất là Artificial Analysis đo ở cấu hình suy luận mức effort cao nhất — vốn sinh ra nhiều token suy nghĩ hơn nên đắt hơn — trong khi OpenRouter niêm yết giá cơ bản. Artificial Analysis cũng lưu ý mô hình khá dài dòng: nó sinh ra 130 triệu token đầu ra trong quá trình chạy bộ chỉ số. Với mô hình tính tiền theo token đầu ra, mức dài dòng đó là chi phí thật.
6. Bài Học Rút Ra Cho Người Chọn Mô Hình
- Luôn hỏi ai là người chấm. Cùng một mô hình, cùng một bộ đánh giá, hai bên đo ra 87,9 và 79. Khi đọc bất kỳ bảng benchmark nào, câu hỏi đầu tiên nên là số này do ai đo và ở cấu hình nào.
- Mô hình đắt hơn không mặc nhiên tốt hơn. Ở đây, bản Pro chỉ hơn bản Flash của cùng hãng một điểm trên chỉ số tổng hợp. Trước khi trả thêm tiền cho tầng cao cấp, hãy kiểm chứng khoảng cách thật trên tác vụ của bạn.
- Đo trên công việc thật, đừng đo trên bảng xếp hạng. Mô hình này mạnh ở an ninh mạng nhưng yếu ở bảng tính Excel. Thứ hạng tổng hợp không nói cho bạn biết điều đó.
- Tính cả độ dài đầu ra vào chi phí. Một mô hình dài dòng có thể đắt hơn đáng kể so với giá niêm yết trên mỗi token, vì nó đơn giản là viết nhiều hơn.
Nguồn tham khảo:
- DeepSeek API Docs — News / changelog (thông báo duy nhất: mô hình deepseek-v4-pro được cập nhật lên DeepSeek-V4-Pro-0813)
- Artificial Analysis — DeepSeek V4 Pro 0813 — Intelligence, Performance & Price Analysis (chỉ số tổng hợp 53, hạng 3/106, 1,6 nghìn tỷ tham số với 49 tỷ hoạt động, tốc độ 80 token/giây, độ trễ 1,82 giây, 130 triệu token đầu ra khi chạy đánh giá, giá 1,32/3,96 USD)
- OfficeChai — DeepSeek v4-0813-Pro Benchmarks: Model Scores One Point Higher Than Flash On Artificial Analysis Intelligence Index (bảng điểm đo độc lập từng hạng mục: GPQA Diamond 93%, Terminal-Bench v2.1 79%, GDPval-AA v2 55%, SciCode 49%, τ³-Banking 40%, HLE 39%, CritPt 18%, AA-Omniscience 49%; giá trúng cache 0,004 USD; so sánh với V4 Flash 0731)
- South China Morning Post — DeepSeek's updated V4 Pro AI model struggles on benchmarks, shines in cybersecurity (thông báo bị gỡ sau một ngày, xếp hạng 12 trên Vals Index, khó khăn ở terminal và Excel theo Vals AI, so sánh với GLM-5.2 / GPT-5.6 / Kimi K3, phản ứng của lập trình viên)
- OpenRouter — DeepSeek V4 Pro 0813 — API Pricing & Benchmarks (giá 0,435/0,87 USD mỗi triệu token, context 1 triệu token, ngày phát hành 12/8/2026)
Lưu ý về số liệu: bài này cố ý phân tách hai loại số. Do DeepSeek tự công bố: DeepSWE 12,8→62,7, CyberGym 52,7→83,3, Terminal-Bench 2.1 72,1→87,9, NL2Repo 61,5. Do Artificial Analysis đo độc lập: chỉ số tổng hợp 53 và toàn bộ bảng phần trăm ở mục 3. Hai bên mâu thuẫn rõ ở Terminal-Bench v2.1 (87,9 so với 79) và ở giá (0,435/0,87 so với 1,32/3,96 USD); chúng tôi giữ nguyên cả hai thay vì chọn một bên. Chúng tôi không kiểm thử độc lập mô hình này với tiếng Việt. Tổng hợp và phân tích bởi Ban Biên Tập Locaith, ngày 14/8/2026.