DeepSeek V4 Pro 0813: Điểm Tự Công Bố Vọt Cao, Đo Độc Lập Chỉ Hơn Bản Rẻ Một Điểm

DeepSeek lặng lẽ nâng cấp mô hình đầu bảng ngày 12/8/2026 — không blog, không thông cáo, chỉ một dòng trong tài liệu API. Bảng điểm tự công bố cho thấy mức nhảy vọt ở nhóm tác tử, có hạng mục tăng gần 50 điểm. Nhưng khi Artificial Analysis đo độc lập, mô hình đạt 53 điểm chỉ số tổng hợp — hơn đúng m

Ngày 12/8/2026, DeepSeek nâng cấp mô hình đầu bảng của mình lên bản V4-Pro-0813 — không blog, không thông cáo báo chí, chỉ một dòng trong nhật ký cập nhật tài liệu API. Bảng điểm hãng tự công bố cho thấy những bước nhảy rất lớn ở nhóm tác tử. Nhưng khi Artificial Analysis đo độc lập, kết quả kể một câu chuyện khác hẳn — và đó mới là phần đáng đọc.

1. Một Bản Phát Hành Gần Như Im Lặng

Thông báo duy nhất là dòng chữ trong tài liệu API của DeepSeek: "Mô hình deepseek-v4-pro đã được cập nhật lên DeepSeek-V4-Pro-0813." Không có bài blog kỹ thuật, không có thẻ mô hình chi tiết, không có bài đăng mạng xã hội.

Theo South China Morning Post, hãng có đăng một thông báo ngắn trên website chính thức, nói rằng bản mới có "năng lực tác tử được nâng cao đáng kể" — nhưng thông báo đó đã bị gỡ trong chiều hôm sau. Với một bản nâng cấp mô hình đầu bảng, cách phát hành như vậy là bất thường, nhất là khi so với sự chú ý mà chính DeepSeek từng nhận được ở các thế hệ trước.

2. Bảng Điểm DeepSeek Tự Công Bố

So với bản xem trước, các con số hãng đưa ra rất ấn tượng:

Bộ đánh giá Bản xem trước Bản 0813
DeepSWE (kỹ thuật phần mềm) 12,8 62,7
CyberGym (an ninh mạng) 52,7 83,3
Terminal-Bench 2.1 (tác tử dòng lệnh) 72,1 87,9
NL2Repo chưa công bố 61,5

Mức tăng gần 50 điểm ở DeepSWE là con số dễ gây chú ý nhất. Nếu chỉ đọc bảng này, kết luận tự nhiên sẽ là DeepSeek vừa tạo ra một bước nhảy lớn về năng lực lập trình tự động.

3. Rồi Bên Thứ Ba Đo Lại

Artificial Analysis chạy mô hình qua bộ chỉ số tổng hợp Intelligence Index phiên bản 4.1.1 — gồm chín bài đánh giá trải từ suy luận, lập trình, dùng công cụ tác tử đến kiến thức. Kết quả: 53 điểm.

Khoảng lệch đáng chú ý nhất

Trên cùng một bộ đánh giá Terminal-Bench v2.1: DeepSeek công bố 87,9, Artificial Analysis đo được 79. Chênh gần 9 điểm. Đây không nhất thiết là dấu hiệu của sự thiếu trung thực — các bộ đánh giá tác tử phụ thuộc mạnh vào khung chạy, cách viết prompt, mức "effort" và bộ công cụ đi kèm, và nhà cung cấp đương nhiên chạy ở cấu hình tốt nhất của mình. Nhưng nó cho thấy rõ vì sao số của nhà cung cấp không thay thế được số đo độc lập.

Các hạng mục đo độc lập khác của Artificial Analysis:

Bộ đánh giá Điểm Nội dung
GPQA Diamond 93% Suy luận khoa học trình độ sau đại học
Terminal-Bench v2.1 79% Tác tử dòng lệnh — hãng công bố 87,9
GDPval-AA v2 55% Công việc thực tế dạng tác tử
AA-Omniscience 49% Kiến thức
SciCode 49% Lập trình khoa học
τ³-Banking 40% Dùng công cụ trong nghiệp vụ ngân hàng
Humanity's Last Exam 39% Suy luận khó
CritPt 18% Suy luận vật lý

4. Vấn Đề Thật Sự: Hơn Bản Rẻ Đúng Một Điểm

Con số 53 điểm đưa V4 Pro 0813 lên hạng 3 trong 106 mô hình mà Artificial Analysis xếp hạng — nghe rất tốt. Nhưng đặt cạnh các mốc so sánh cụ thể thì bức tranh khác đi:

Theo phân tích của Vals AI, mô hình gặp khó ở hai việc rất cụ thể: hoàn thành tác vụ trong môi trường terminal có kiểm soát, và dựng mô hình tài chính phức tạp trên bảng tính Excel. Điều này đáng chú ý vì cả hai đều nằm đúng trong nhóm năng lực mà thông báo đã bị gỡ của hãng nhấn mạnh.

Mảng mô hình thực sự nổi bật là an ninh mạng — SCMP ghi nhận mô hình gây ấn tượng với giới nghiên cứu ở các lĩnh vực hẹp này, phù hợp với mức tăng CyberGym mà hãng công bố. SCMP cũng ghi nhận một bộ phận lập trình viên bày tỏ thất vọng về cả năng lực lẫn giá, trái ngược với sự đón nhận dành cho bản V4 Flash nhỏ hơn.

5. Thông Số Kỹ Thuật Và Giá

Hạng mục Thông số Ghi chú
Tham số 1,6 nghìn tỷ 49 tỷ hoạt động mỗi lượt (MoE)
Độ dài context 1 triệu token Theo OpenRouter
Tốc độ sinh ~80 token/giây Đo bởi Artificial Analysis
Độ trễ token đầu 1,82 giây Đo bởi Artificial Analysis
Giá (OpenRouter) 0,435 / 0,87 USD Đầu vào / đầu ra, mỗi triệu token
Giá (Artificial Analysis) 1,32 / 3,96 USD Nhiều khả năng ở cấu hình effort cao nhất
Đầu vào trúng cache 0,004 USD Mỗi triệu token

Về giá, hai nguồn của chúng tôi ghi khác nhau và chúng tôi giữ nguyên cả hai thay vì chọn một bên. Cách giải thích hợp lý nhất là Artificial Analysis đo ở cấu hình suy luận mức effort cao nhất — vốn sinh ra nhiều token suy nghĩ hơn nên đắt hơn — trong khi OpenRouter niêm yết giá cơ bản. Artificial Analysis cũng lưu ý mô hình khá dài dòng: nó sinh ra 130 triệu token đầu ra trong quá trình chạy bộ chỉ số. Với mô hình tính tiền theo token đầu ra, mức dài dòng đó là chi phí thật.

Hai biểu đồ đường do DeepSeek công bố: bên trái là chi phí tính toán mỗi token theo vị trí token, bên phải là dung lượng bộ nhớ đệm KV tích lũy theo độ dài chuỗi, so sánh DeepSeek V3.2 với V4-Pro và V4-Flash
Lý do dòng V4 giữ được giá thấp ở ngữ cảnh dài: tại mốc 1 triệu token, bộ nhớ đệm KV của V3.2 leo lên khoảng 50 GB trong khi V4-Pro và V4-Flash giữ dưới 6 GB. Biểu đồ từ thông cáo ra mắt V4 (24/04/2026), phản ánh kiến trúc chung của dòng V4 chứ không riêng bản 0813. Ảnh: DeepSeek.

6. Bài Học Rút Ra Cho Người Chọn Mô Hình

Nguồn tham khảo:

Lưu ý về số liệu: bài này cố ý phân tách hai loại số. Do DeepSeek tự công bố: DeepSWE 12,8→62,7, CyberGym 52,7→83,3, Terminal-Bench 2.1 72,1→87,9, NL2Repo 61,5. Do Artificial Analysis đo độc lập: chỉ số tổng hợp 53 và toàn bộ bảng phần trăm ở mục 3. Hai bên mâu thuẫn rõ ở Terminal-Bench v2.1 (87,9 so với 79) và ở giá (0,435/0,87 so với 1,32/3,96 USD); chúng tôi giữ nguyên cả hai thay vì chọn một bên. Chúng tôi không kiểm thử độc lập mô hình này với tiếng Việt. Tổng hợp và phân tích bởi Ban Biên Tập Locaith, ngày 14/8/2026.

Messenger