Gemini 3.7 Flash: Model Giá Rẻ Của Google Vừa Đánh Bại Cả Sonnet 5 Và GPT-5.6 Terra Ở Mảng Lập Trình

Ngày 13/8/2026, Google phát hành Gemini 3.7 Flash chỉ ba tuần sau bản 3.6 — và lần này model tầm giá thấp lại dẫn đầu FrontierCode, Code Arena, AutomationBench, vượt qua những model đắt gấp 2-3 lần. Bài viết so sánh benchmark chi tiết với GPT-5.6 Terra, Claude Sonnet 5, Muse Spark 1.2, phân tích nơi

Ba tuần. Đó là khoảng cách giữa Gemini 3.6 Flash và 3.7 Flash — nhịp phát hành nhanh đến mức bất thường ngay cả trong ngành AI. Nhưng thứ đáng chú ý không phải tốc độ, mà là kết quả: một model thuộc dòng giá rẻ của Google vừa vượt qua những model đắt gấp đôi, gấp ba ở đúng mảng mà các hãng đang cạnh tranh khốc liệt nhất — lập trình.

Chuyện gì vừa xảy ra?

Ngày 13/8/2026, Google DeepMind phát hành Gemini 3.7 Flash, định vị là "model chủ lực thông minh nhất" cho lập trình, phát triển web và các luồng tác vụ tự động (agentic). Model có mặt ngay trên Google AI Studio, Android Studio, Google Antigravity, nền tảng Gemini Enterprise, và tới tay người dùng cá nhân qua Gemini Spark tại hơn 160 quốc gia.

Điểm gây chú ý nhất nằm ở chỗ: đây là dòng Flash — dòng tối ưu chi phí, vốn được xem là "hạng phổ thông" trong danh mục của Google. Vậy mà nó lại đứng đầu nhiều bài kiểm tra lập trình.

Bước nhảy so với chính đàn anh ba tuần trước

Trước khi so với đối thủ, hãy nhìn mức cải thiện nội bộ — đây là con số Google tự công bố:

Bài kiểm tra 3.6 Flash 3.7 Flash Chênh lệch
FrontierCode 1.1 (chất lượng code) 34,4% 43,6% +9,2 điểm
DeepSWE v1.1 (kỹ thuật phần mềm dài hơi) 48,6% 65,3% +16,7 điểm
AutomationBench (tự động hoá quy trình) 17,0% 30,4% +13,4 điểm
GDP.pdf (đọc hiểu tài liệu PDF phức tạp) 22,0% 34,0% +12,0 điểm
Code Arena (Elo, phát triển web) 1538 1588 +50 Elo

Mức tăng 16,3 điểm ở DeepSWE chỉ sau ba tuần là con số hiếm thấy. Nó gợi ý rằng Google không chỉ tinh chỉnh nhẹ mà đã thay đổi đáng kể ở khâu huấn luyện cho tác vụ lập trình dài hơi.

Đối đầu trực tiếp với các model mạnh nhất hiện nay

Đây mới là phần đáng giá. Bảng dưới đối chiếu Gemini 3.7 Flash với ba model đang dẫn đầu thị trường. Lưu ý: phần lớn số liệu do chính các nhà cung cấp công bố và được tổng hợp lại bởi bên thứ ba — nên mang tính tham khảo, ô trống nghĩa là không có số liệu công bố chứ không phải model đó yếu.

Bài kiểm tra Gemini 3.7 Flash GPT-5.6 Terra Claude Sonnet 5 Muse Spark 1.2
FrontierCode 1.1 43,6% ▲ 41,3% 42,7%
Code Arena (Elo) 1588 ▲ 1523 1541 1535
AutomationBench 30,4% ▲ 23,6% 10,7%
DeepSWE v1.1 65,3% 69,6% 53,8% 54,9%
Terminal-bench 2.1 85,8% 87,4%
OSWorld-2.0 (điều khiển máy tính) 47,9% 50,2%
GDPval-AA v2 (Elo) (công việc tri thức) 1525 1578 1598 1628
AA Intelligence Index 56 57 55 57
Giá (input / output / 1M token) $0,75 / $3,75 $2,00 / $12,00 $2,00 / $10,00 $1,25 / $4,25
Bảng benchmark chính thức của Google so sánh Gemini 3.7 Flash với Gemini 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra và Muse Spark 1.2 trên 20 bài kiểm tra
Bảng benchmark đầy đủ do Google công bố — 20 chỉ số, đối chiếu trực tiếp 5 model. Dòng cuối ghi rõ giá ưu đãi hết hạn 31/12/2026. Ảnh: Google.

Con số đáng chú ý nhất

AutomationBench, Gemini 3.7 Flash đạt 30,4% — gần gấp ba Claude Sonnet 5 (10,7%) và cao hơn GPT-5.6 Terra (23,6%), trong khi giá đầu ra chỉ bằng khoảng một phần ba. Với doanh nghiệp đang xây dựng quy trình tự động hoá chạy ở quy mô lớn, đây là tỷ lệ hiệu năng/chi phí khó bỏ qua.

Nhưng Google chưa thắng toàn diện

Điều đáng nói là chính bảng số liệu của Google cũng không cho thấy 3.7 Flash soán ngôi ở mọi mặt. Nhìn kỹ sẽ thấy một ranh giới khá rõ:

Nói cách khác: đây là một model chuyên biệt cho lập trình, không phải model mạnh nhất về mọi mặt. Cách Google đặt tên "workhorse" — ngựa thồ — khá chính xác.

Cái bẫy giá: hãy đọc kỹ chữ "giới thiệu"

Mức giá $0,75 / $3,75 đang được quảng bá rầm rộ là giá ưu đãi có thời hạn, chỉ áp dụng đến 31/12/2026. Từ 1/1/2027, giá chính thức sẽ là $1,50 đầu vào và $7,50 đầu ra — tức tăng gấp đôi.

Ở mức giá chính thức, khoảng cách với Claude Sonnet 5 ($2,00 / $10,00) thu hẹp đáng kể. Doanh nghiệp nào đang tính bài toán chi phí dài hạn nên lập kế hoạch trên mức giá sau ưu đãi, đừng lấy giá hiện tại làm cơ sở — nếu không, hoá đơn tháng 1/2027 sẽ là một bất ngờ không dễ chịu.

Nhịp phát hành ba tuần nói lên điều gì?

Việc Google ra model mới chỉ ba tuần sau bản trước là tín hiệu về mức độ khốc liệt của cuộc đua hiện tại. Với người dùng, đây là tin tốt: giá giảm, chất lượng tăng, chu kỳ nâng cấp ngắn lại. Nhưng nó cũng đặt ra một vấn đề vận hành thực tế — gắn chặt sản phẩm vào một model cụ thể ngày càng rủi ro, vì chỉ vài tuần sau đã có lựa chọn tốt hơn hoặc rẻ hơn.

Doanh nghiệp Việt Nam nên làm gì?

Đây cũng chính là triết lý Locaith theo đuổi khi xây dựng sản phẩm: chọn đúng model cho đúng tác vụ, thay vì gắn chặt vào một nhà cung cấp duy nhất. Các sản phẩm như Compose Word (soạn thảo văn bản chuẩn Nghị định 30/2020/NĐ-CP) hay Design Studio được thiết kế để linh hoạt đổi mô hình phía sau — nên mỗi lần thị trường có bước nhảy như hôm nay, người dùng được hưởng lợi mà không phải làm lại gì.

Nguồn tham khảo:

Ảnh: Google. Số liệu đối chiếu 3.6 vs 3.7 Flash và bảng giá lấy từ công bố chính thức của Google; các con số so sánh với model của hãng khác do nhà cung cấp tự công bố và được bên thứ ba tổng hợp, mang tính tham khảo và có thể chênh lệch giữa các lần đo. Ô trống trong bảng nghĩa là không có số liệu công bố. Bài viết được Ban Biên Tập Locaith tổng hợp & phân tích, cập nhật 13/8/2026.

Messenger