Gemini 4 Argon Đứng Đầu Bảng Đo Độc Lập, Nhưng Giá Mở Màn Sẽ Gấp Đôi Và Chưa Bán Rộng

Ngày 30/9/2026, Google DeepMind công bố Gemini 4 Argon. Trên Vals Index của bên thứ ba, Argon đứng đầu với 68,90%, hơn Claude Sonnet 5.5 1,86 điểm. Nhưng hiện chỉ các đơn vị phòng thủ an ninh mạng được duyệt qua chương trình Fairwind dùng được Argon, và mức 2/10 USD mỗi triệu token chỉ là giá giới t

Google DeepMind công bố Gemini 4 Argon ngày 30/9/2026 theo giờ Mỹ. Trên Vals Index, bảng đo do một công ty độc lập chấm, Argon đứng đầu, hơn Claude Sonnet 5.5 1,86 điểm. Nhưng lúc này gần như không doanh nghiệp Việt Nam nào dùng được nó, còn mức 2 USD mỗi triệu token mà các bản tin đưa lên tiêu đề chỉ là giá mở màn.

Google công bố gì

Argon là mô hình tiên phong (frontier) mới của Google, được giới thiệu trong bài viết của Koray Kavukcuoglu, phó chủ tịch cấp cao Google DeepMind. Google nói nó mạnh ở các việc dài, nhiều bước: kỹ thuật phần mềm, công việc tri thức như pháp lý và tài chính, và phòng thủ an ninh mạng. Mô hình đã chạy trong quy trình nội bộ của Google, và hãng nêu vài kết quả: tối ưu một chương trình con của thuật toán lượng tử tốt hơn mức đã công bố 40%; giải phóng hơn 300 TiB bộ nhớ trong hệ thống trung tâm dữ liệu; chuyển mã C/C++ sang Rust ở quy mô tới hơn 800.000 dòng cho nhân Zircon của Fuchsia; và giúp bản Rust của bộ giải mã video libgav1 chạy nhanh gấp 2,7 lần bản Rust trước đó, với đầu ra giống hệt.

Thông số Gemini 4 Argon
Ngày công bố30/9/2026
Ai dùng được lúc nàyĐối tác được duyệt trong chương trình Fairwind (phòng thủ an ninh mạng) và đội nội bộ Google
Mở rộng tiếp theoKhách hàng API trả phí và thuê bao Google AI Ultra, chưa có ngày
Giá giới thiệu2 USD đầu vào, 10 USD đầu ra mỗi triệu token; đầu vào lưu đệm giảm 95%
Giá sau giai đoạn giới thiệu4 USD đầu vào, 20 USD đầu ra
Ngày hết giá giới thiệuChưa công bố
Đầu ra tối đa1 triệu token theo Google (trước đây 64.000); trang mô hình của Vals ghi 262.000
Ngữ cảnh đầu vàoBài công bố không nêu; Vals ghi 1 triệu token

Nguồn: bài công bố của Google DeepMind ngày 30/9/2026, trang Fairwind Program, trang mô hình Gemini 4 Argon trên Vals AI đọc ngày 1/10/2026.

Giá 2 USD là giá mở màn, mức nên dùng để tính là 4 và 20 USD

Câu về giá trong bài công bố viết Argon "sẽ ra mắt với giá giới thiệu" 2 USD đầu vào và 10 USD đầu ra mỗi triệu token. Phần còn lại nằm ở chú thích số 1 cuối trang: "Sau khi giai đoạn giới thiệu kết thúc, giá 4 USD mỗi 1 triệu token đầu vào và 20 USD mỗi 1 triệu token đầu ra sẽ áp dụng." Bài không nói giai đoạn giới thiệu dài bao lâu, và khi Locaith đọc trang giá Gemini API ngày 1/10/2026, Argon chưa có ở đó. Google đã làm tương tự với Gemini 3.8 Flash đầu tháng 9, nhưng lần đó trang giá ghi rõ giá giới thiệu hết hạn ngày 31/12/2026. Với Argon, chưa có mốc nào.

Mô hình Đầu vào Đầu ra
Gemini 4 Argon, giá giới thiệu (chưa mở bán)210
Gemini 4 Argon, giá sau đó (chưa mở bán)420
Claude Sonnet 5.5210
GPT-6.1 Sol210
Claude Opus 5.5420
GPT-6 Astra1050
Claude Fable 5.11050

USD mỗi triệu token. Giá Argon theo bài công bố của Google; giá Claude và OpenAI theo trang giá của hai hãng, đọc ngày 30/9/2026. Đầu vào lưu đệm của Argon giảm 95%, tức 0,10 USD ở giá giới thiệu và 0,20 USD ở giá sau đó.

Ở giá giới thiệu, Argon ngang Claude Sonnet 5.5 và GPT-6.1 Sol, hai mô hình ra trong cùng tuần. Ở giá sau đó, nó ngang Claude Opus 5.5. Giới hạn đầu ra 1 triệu token cũng kéo theo chi phí: riêng phần đầu ra của một lượt trả lời dài tối đa đã là 10 USD ở giá giới thiệu và 20 USD ở giá sau đó. Google nói đây là chủ ý, vì khi mô hình "có khoảng trống để suy nghĩ sâu và sinh ra hàng trăm nghìn token trong một lượt", nó có thể giải bài khó trong một lần.

Bảng điểm của Google: 18 phép đo, dẫn 12, hoà 1, thua 5

Google so Argon với ba mô hình: GPT-6 Astra, Claude Fable 5.1 và Claude Opus 5.5. Theo bảng trong tài liệu phương pháp đo, Argon dẫn 12 phép đo, hoà GPT-6 Astra ở CWE-bench v1 (vá lỗ hổng, cùng 68%), và thua 5: FrontierSWE v2 (55,0% so với 65,5% của Astra), Terminal-bench 4.0 (57,4% so với 66,4% của Opus 5.5), PostTrainBench (45,3% so với 49,3% của Opus 5.5), Terminal-Bench Science 0.1 (57,6% so với 68,1% của Astra) và OSWorld 2.0 (69,2% so với 72,6% của Astra). Khoảng cách lớn nhất nằm ở ngữ cảnh dài: trên GraphWalks với đầu vào từ 256.000 đến 1 triệu token, Argon đạt 84,2%, Astra 71,8%, Opus 5.5 66,8%.

Bảng điểm Google công bố cho Gemini 4 Argon so với GPT-6 Astra, Claude Fable 5.1 và Claude Opus 5.5 trên 18 phép đo về công việc tri thức, lập trình, khoa học, ngữ cảnh dài, điều khiển máy tính, đa phương thức và an ninh mạng
Bảng điểm Google công bố: ô xanh là chỗ Argon dẫn hoặc hoà, ô xám là chỗ mô hình khác dẫn. Điểm của mô hình khác do Google lấy từ công bố của hãng đó hoặc bảng xếp hạng công khai. Ảnh: Google DeepMind, tài liệu "Gemini 4 Argon model evaluation".

Tài liệu phương pháp (PDF năm trang) cho biết điều bảng không thể hiện: mỗi con số đến từ một nguồn khác nhau. Locaith chia 18 phép đo theo nguồn điểm của Argon:

Tức là lợi thế của Argon không đến chủ yếu từ số do Google tự chấm, một điểm cộng cho bảng này. Dù vậy, chính tài liệu ghi ba điều kiện đo có lợi cho Argon:

Đối chiếu với Vals: đứng đầu thật, nhưng hai chữ "dẫn đầu" chỉ đúng trong nhóm Google chọn

Vals Index là chỉ số của Vals AI, gộp các phép đo về tài chính, lập trình, pháp lý và thuế, đánh trọng số theo tỷ trọng từng ngành trong GDP Mỹ; riêng tài chính chiếm 8,0 trên tổng trọng số 15,3, tức hơn một nửa. Trên bảng Locaith đọc ngày 1/10/2026, Argon đứng thứ nhất trong 41 mô hình với 68,90% (sai số chuẩn ±0,97), chạy ở mức suy luận "high". Thứ hai là Claude Sonnet 5.5 với 67,04% (±0,92), rồi Opus 5.5 66,97%, Fable 5.1 65,83% và GPT-6 Astra 63,13%.

Bảng xếp hạng Vals Index ngày 1/10/2026: Gemini 4 Argon đứng đầu với 68,90%, Claude Sonnet 5.5 thứ hai với 67,04%, kèm chi phí mỗi bài kiểm tra, giá token, lượng token và thời gian chạy
Vals Index ngày 1/10/2026: Argon đứng đầu, Sonnet 5.5 thứ hai. Cột chi phí mỗi bài tính theo giá 4/20 USD của Argon, tức giá sau giai đoạn giới thiệu. Ảnh: chụp màn hình vals.ai.

Sonnet 5.5, mô hình xếp thứ hai, không có trong bảng so của Google; nó ra ngày 28/9, hai ngày trước Argon. Vals còn ghi chú rằng điểm của Sonnet 5.5, Opus 5.5 và Fable 5.1 có một số việc được chuyển sang mô hình dự phòng sau khi nhà cung cấp từ chối; nếu tính các việc đó là trượt, ba điểm này còn 65,85%, 65,05% và 64,59%. Argon không có ghi chú này, nên nếu tính chặt thì Argon còn dẫn xa hơn.

Nhưng trên các bảng thành phần của chính Vals, hai hạng mục Google ghi Argon dẫn đầu lại có mô hình khác điểm cao hơn:

Bảng của Google không sai: Argon dẫn trong nhóm bốn mô hình được chọn để so. Chữ "dẫn đầu" chỉ đúng trong nhóm đó. Thêm một chênh lệch: Vals tự chạy Terminal-Bench Science và đo được Argon 44,29%, xếp thứ ba trong 34 mô hình, còn Google công bố 57,6% với thời gian chờ kiểm tra gấp sáu. Hai lần đo không cùng điều kiện nên không thể nói bên nào sai, nhưng mức chênh 13 điểm cho thấy cách đo ảnh hưởng tới kết quả nhiều tới mức nào.

Chi phí mỗi việc: giá token gấp đôi, hoá đơn có thể thấp hơn

Vals tính chi phí của Argon theo giá 4 và 20 USD. Ở mức đó, Argon tốn 15,68 USD mỗi bài kiểm tra trên Vals Index, thấp hơn Sonnet 5.5 (21,34 USD) dù giá mỗi token của Sonnet 5.5 chỉ bằng một nửa. Lý do là lượng token: trên toàn bộ chỉ số, Argon dùng 13,40 tỷ token đầu vào và 142 triệu token đầu ra, Sonnet 5.5 dùng 40,78 tỷ và 608 triệu. Opus 5.5, cùng giá token với Argon, tốn 32,14 USD mỗi bài. Ở phía rẻ, GPT-6.1 Sol đạt 61,15% với 3,24 USD mỗi bài.

Argon không rẻ ở mọi loại việc. Theo trang mô hình của Vals, chi phí của Argon lên 193,78 USD mỗi bài trên CUA-bench (điều khiển máy tính, nơi Argon chỉ đạt 4,83% và xếp thứ bảy trong tám), 57,82 USD trên Code Migration và 44,90 USD trên Terminal-Bench Science.

An ninh mạng: phát hành không rào chắn cho bên phòng thủ được duyệt

Google nói Argon tự tìm, xác minh và vá được lỗ hổng phần mềm nghiêm trọng, và với các đơn vị phòng thủ được tin cậy cùng đội nội bộ, hãng phát hành Argon "không có rào chắn an ninh mạng". Các con số Google đưa ra:

Google kể Wiz dùng Argon trong chương trình Scan for Good và tìm ra một lỗ hổng nghiêm trọng làm lộ dữ liệu cá nhân nhạy cảm trong phần mềm y tế mà các bệnh viện trên thế giới dùng, lỗ hổng mà các mô hình trước bỏ sót. Bài không nêu tên phần mềm, mã CVE hay tình trạng vá, nên Locaith chưa kiểm chứng được.

Trang Fairwind nêu ba nhóm được ưu tiên: chính phủ và cơ quan an ninh mạng quốc gia; đơn vị vận hành hạ tầng trọng yếu như y tế, viễn thông, năng lượng, tài chính; và nền tảng công nghệ cốt lõi. Phòng thí nghiệm học thuật chuyên đánh giá phòng thủ cũng được nộp đơn. Điều kiện gồm xác thực theo từng người dùng, xác thực đa yếu tố chống lừa đảo (phishing-resistant MFA), chỉ cấp quyền cho đội an ninh mạng, ứng cứu sự cố hoặc kiểm thử xâm nhập nội bộ, và phải theo dõi nhân viên nào truy cập. Google kiểm tra lý lịch tổ chức nộp đơn và cấm chia sẻ hay bán lại quyền truy cập. Trang không giới hạn quốc gia, nhưng cũng không nêu thời gian xét duyệt.

Giám sát chuỗi suy nghĩ

Trong bốn nhóm biện pháp Google nói đang củng cố trước khi mở rộng, đáng chú ý nhất là giám sát lệch chuẩn (misalignment). Google theo dõi chuỗi suy nghĩ và hành động của Argon, dừng thực thi khi cần. Hệ thống tương tự đã được dùng trong lúc huấn luyện để gửi cảnh báo cho một đội ứng cứu riêng, và Google nói đã cẩn thận không đưa kết quả giám sát ngược vào huấn luyện để tránh vô tình dạy mô hình né giám sát. Hãng kêu gọi cả ngành giữ minh bạch suy luận. Bài công bố ra một ngày sau khi CEO Google Sundar Pichai ký một cam kết tự giám sát tại Nhà Trắng, mà lớp đầu tiên chính là theo dõi năng lực và mức tuân thủ ý định của mô hình trong lúc huấn luyện và triển khai (Locaith có bài riêng hôm nay).

Cần biết về nguồn tin:

  • Bảng 18 phép đo và các con số an ninh mạng do Google công bố. Điểm của mô hình khác Google lấy từ công bố của hãng đó hoặc bảng xếp hạng công khai, không chạy lại trên cùng hệ thống.
  • Vals Index và các bảng thành phần là đo lường của bên thứ ba, Locaith đọc ngày 1/10/2026; Vals có thể cập nhật sau đó.
  • Google ghi đầu ra tối đa 1 triệu token, trang mô hình của Vals ghi 262.000 token; chưa bên nào giải thích chênh lệch này.
  • Locaith không tự chạy Argon và không thuộc chương trình Fairwind.

Doanh nghiệp và đội kỹ thuật Việt Nam nên làm gì

Các nhận định dưới đây là quan điểm của Locaith:

Nguồn:

  • Google DeepMind — Gemini 4 Argon: our next era of frontier intelligence, Koray Kavukcuoglu, 30/9/2026 — giá giới thiệu và chú thích giá sau đó, phạm vi truy cập, giới hạn đầu ra, kết quả dùng nội bộ, an ninh mạng, giám sát lệch chuẩn, các biểu đồ an ninh mạng, ảnh bìa
  • Google DeepMind — Gemini 4 Argon model evaluation: approach, methodology & results (PDF) — bảng 18 phép đo, nguồn của từng con số, điều kiện LVBench, Terminal-Bench Science, OSWorld 2.0; ảnh bảng điểm trong bài
  • Google DeepMind — Fairwind Program — nhóm được ưu tiên, điều kiện truy cập, không lưu dữ liệu qua Gemini Enterprise; đọc 1/10/2026
  • Vals AI — Vals Index, trang mô hình Gemini 4 Argon, Vibe Code Bench, Harvey's Legal Agent Benchmark — thứ hạng, điểm, chi phí mỗi bài, lượng token, ghi chú về mô hình dự phòng, trọng số chỉ số; đọc 1/10/2026; ảnh chụp màn hình trong bài
  • Google AI for Developers — Gemini API pricing — Argon chưa có trên trang; giá Gemini 3.8 Flash và ngày hết giá giới thiệu 31/12/2026; đọc 1/10/2026
  • Locaith — bài ngày 30/9/2026 về OpenAI DevDay và bảng giá Claude, OpenAI; bài ngày 29/9/2026 về Claude Sonnet 5.5; bài ngày 3/9/2026 về Gemini 3.8 Flash và chương trình Fairwind

Điểm benchmark trong bảng của Google và các con số an ninh mạng là số do Google công bố, chưa được kiểm chứng độc lập; số của Vals AI là đo lường của bên thứ ba. Locaith không tự chạy thử Argon. Các câu trích được Locaith dịch từ tiếng Anh. Ảnh bìa: Google DeepMind, ảnh giới thiệu Gemini 4 Argon; Locaith xoá dòng chữ "Gemini 4 Argon" ở giữa bên trái để không chồng lên tiêu đề bài. Ảnh trong bài: Google DeepMind (bảng điểm) và chụp màn hình vals.ai. Biên soạn và phân tích bởi Ban Biên Tập Locaith, 01/10/2026.

Messenger