Gemini 3.7 Flash: Model Giá Rẻ Của Google Vừa Đánh Bại Cả Sonnet 5 Và GPT-5.6 Terra Ở Mảng Lập Trình
Ngày 13/8/2026, Google phát hành Gemini 3.7 Flash chỉ ba tuần sau bản 3.6 — và lần này model tầm giá thấp lại dẫn đầu FrontierCode, Code Arena, AutomationBench, vượt qua những model đắt gấp 2-3 lần. Bài viết so sánh benchmark chi tiết với GPT-5.6 Terra, Claude Sonnet 5, Muse Spark 1.2, phân tích nơi
Ba tuần. Đó là khoảng cách giữa Gemini 3.6 Flash và 3.7 Flash — nhịp phát hành nhanh đến mức bất thường ngay cả trong ngành AI. Nhưng thứ đáng chú ý không phải tốc độ, mà là kết quả: một model thuộc dòng giá rẻ của Google vừa vượt qua những model đắt gấp đôi, gấp ba ở đúng mảng mà các hãng đang cạnh tranh khốc liệt nhất — lập trình.
Chuyện gì vừa xảy ra?
Ngày 13/8/2026, Google DeepMind phát hành Gemini 3.7 Flash, định vị là "model chủ lực thông minh nhất" cho lập trình, phát triển web và các luồng tác vụ tự động (agentic). Model có mặt ngay trên Google AI Studio, Android Studio, Google Antigravity, nền tảng Gemini Enterprise, và tới tay người dùng cá nhân qua Gemini Spark tại hơn 160 quốc gia.
Điểm gây chú ý nhất nằm ở chỗ: đây là dòng Flash — dòng tối ưu chi phí, vốn được xem là "hạng phổ thông" trong danh mục của Google. Vậy mà nó lại đứng đầu nhiều bài kiểm tra lập trình.
Bước nhảy so với chính đàn anh ba tuần trước
Trước khi so với đối thủ, hãy nhìn mức cải thiện nội bộ — đây là con số Google tự công bố:
| Bài kiểm tra | 3.6 Flash | 3.7 Flash | Chênh lệch |
|---|---|---|---|
| FrontierCode 1.1 (chất lượng code) | 34,4% | 43,6% | +9,2 điểm |
| DeepSWE v1.1 (kỹ thuật phần mềm dài hơi) | 48,6% | 65,3% | +16,7 điểm |
| AutomationBench (tự động hoá quy trình) | 17,0% | 30,4% | +13,4 điểm |
| GDP.pdf (đọc hiểu tài liệu PDF phức tạp) | 22,0% | 34,0% | +12,0 điểm |
| Code Arena (Elo, phát triển web) | 1538 | 1588 | +50 Elo |
Mức tăng 16,3 điểm ở DeepSWE chỉ sau ba tuần là con số hiếm thấy. Nó gợi ý rằng Google không chỉ tinh chỉnh nhẹ mà đã thay đổi đáng kể ở khâu huấn luyện cho tác vụ lập trình dài hơi.
Đối đầu trực tiếp với các model mạnh nhất hiện nay
Đây mới là phần đáng giá. Bảng dưới đối chiếu Gemini 3.7 Flash với ba model đang dẫn đầu thị trường. Lưu ý: phần lớn số liệu do chính các nhà cung cấp công bố và được tổng hợp lại bởi bên thứ ba — nên mang tính tham khảo, ô trống nghĩa là không có số liệu công bố chứ không phải model đó yếu.
| Bài kiểm tra | Gemini 3.7 Flash | GPT-5.6 Terra | Claude Sonnet 5 | Muse Spark 1.2 |
|---|---|---|---|---|
| FrontierCode 1.1 | 43,6% ▲ | 41,3% | 42,7% | — |
| Code Arena (Elo) | 1588 ▲ | 1523 | 1541 | 1535 |
| AutomationBench | 30,4% ▲ | 23,6% | 10,7% | — |
| DeepSWE v1.1 | 65,3% | 69,6% | 53,8% | 54,9% |
| Terminal-bench 2.1 | 85,8% | 87,4% | — | — |
| OSWorld-2.0 (điều khiển máy tính) | 47,9% | 50,2% | — | — |
| GDPval-AA v2 (Elo) (công việc tri thức) | 1525 | 1578 | 1598 | 1628 |
| AA Intelligence Index | 56 | 57 | 55 | 57 |
| Giá (input / output / 1M token) | $0,75 / $3,75 | $2,00 / $12,00 | $2,00 / $10,00 | $1,25 / $4,25 |
Con số đáng chú ý nhất
Ở AutomationBench, Gemini 3.7 Flash đạt 30,4% — gần gấp ba Claude Sonnet 5 (10,7%) và cao hơn GPT-5.6 Terra (23,6%), trong khi giá đầu ra chỉ bằng khoảng một phần ba. Với doanh nghiệp đang xây dựng quy trình tự động hoá chạy ở quy mô lớn, đây là tỷ lệ hiệu năng/chi phí khó bỏ qua.
Nhưng Google chưa thắng toàn diện
Điều đáng nói là chính bảng số liệu của Google cũng không cho thấy 3.7 Flash soán ngôi ở mọi mặt. Nhìn kỹ sẽ thấy một ranh giới khá rõ:
- Google thắng ở "viết code và tự động hoá": chất lượng code sản xuất (FrontierCode), phát triển web (Code Arena), tự động hoá quy trình (AutomationBench).
- GPT-5.6 Terra thắng ở "làm việc dài hơi và điều khiển hệ thống": DeepSWE (69,6% so với 65,3% — cách 4,3 điểm), Terminal-bench 2.1 (87,4% so với 85,8%) và OSWorld-2.0 (50,2% so với 47,9%). Đáng chú ý: các khoảng cách này đều hẹp, trong khi giá của Terra cao gấp hơn ba lần ở đầu ra.
- Ở công việc tri thức tổng quát, Gemini 3.7 Flash lại xếp cuối trong nhóm: GDPval-AA v2 chỉ 1525 Elo, thua cả ba đối thủ (Muse Spark 1.2 dẫn đầu với 1628).
Nói cách khác: đây là một model chuyên biệt cho lập trình, không phải model mạnh nhất về mọi mặt. Cách Google đặt tên "workhorse" — ngựa thồ — khá chính xác.
Cái bẫy giá: hãy đọc kỹ chữ "giới thiệu"
Mức giá $0,75 / $3,75 đang được quảng bá rầm rộ là giá ưu đãi có thời hạn, chỉ áp dụng đến 31/12/2026. Từ 1/1/2027, giá chính thức sẽ là $1,50 đầu vào và $7,50 đầu ra — tức tăng gấp đôi.
Ở mức giá chính thức, khoảng cách với Claude Sonnet 5 ($2,00 / $10,00) thu hẹp đáng kể. Doanh nghiệp nào đang tính bài toán chi phí dài hạn nên lập kế hoạch trên mức giá sau ưu đãi, đừng lấy giá hiện tại làm cơ sở — nếu không, hoá đơn tháng 1/2027 sẽ là một bất ngờ không dễ chịu.
Nhịp phát hành ba tuần nói lên điều gì?
Việc Google ra model mới chỉ ba tuần sau bản trước là tín hiệu về mức độ khốc liệt của cuộc đua hiện tại. Với người dùng, đây là tin tốt: giá giảm, chất lượng tăng, chu kỳ nâng cấp ngắn lại. Nhưng nó cũng đặt ra một vấn đề vận hành thực tế — gắn chặt sản phẩm vào một model cụ thể ngày càng rủi ro, vì chỉ vài tuần sau đã có lựa chọn tốt hơn hoặc rẻ hơn.
Doanh nghiệp Việt Nam nên làm gì?
- Nếu bài toán là viết code, dựng web, tự động hoá quy trình: Gemini 3.7 Flash đang là lựa chọn có tỷ lệ hiệu năng/chi phí tốt nhất hiện nay. Rất đáng thử nghiệm.
- Nếu cần agent chạy dài hơi hoặc điều khiển máy tính: GPT-5.6 Terra vẫn nhỉnh hơn rõ rệt, đặc biệt ở OSWorld-2.0.
- Nếu là công việc tri thức, phân tích, soạn thảo: nhóm Claude và Muse Spark vẫn đang dẫn ở GDPval — đừng chọn model chỉ vì nó rẻ.
- Tính chi phí theo giá sau 1/1/2027, không phải giá ưu đãi hiện tại.
Đây cũng chính là triết lý Locaith theo đuổi khi xây dựng sản phẩm: chọn đúng model cho đúng tác vụ, thay vì gắn chặt vào một nhà cung cấp duy nhất. Các sản phẩm như Compose Word (soạn thảo văn bản chuẩn Nghị định 30/2020/NĐ-CP) hay Design Studio được thiết kế để linh hoạt đổi mô hình phía sau — nên mỗi lần thị trường có bước nhảy như hôm nay, người dùng được hưởng lợi mà không phải làm lại gì.
Nguồn tham khảo:
- Google — Công bố chính thức Gemini 3.7 Flash (13/8/2026) — nguồn của toàn bộ số liệu đối chiếu 3.6 vs 3.7 và bảng giá
- VentureBeat — Gemini 3.7 Flash targets coding and agents with a 50% introductory price cut
- OfficeChai — Bảng benchmark đối chiếu với GPT-5.6 Terra, Claude Sonnet 5, Muse Spark 1.2
- 9to5Google — Gemini 3.7 Flash launches three weeks after last model
Ảnh: Google. Số liệu đối chiếu 3.6 vs 3.7 Flash và bảng giá lấy từ công bố chính thức của Google; các con số so sánh với model của hãng khác do nhà cung cấp tự công bố và được bên thứ ba tổng hợp, mang tính tham khảo và có thể chênh lệch giữa các lần đo. Ô trống trong bảng nghĩa là không có số liệu công bố. Bài viết được Ban Biên Tập Locaith tổng hợp & phân tích, cập nhật 13/8/2026.