Grok 4.6 Ngang GPT-5.6 Sol Với Giá Rẻ Hơn, Nhưng Coi Chừng Mốc 200K Token
Grok 4.6 của SpaceXAI đạt 61 điểm trên bảng chỉ số trí tuệ của Artificial Analysis, ngang GPT-5.6 Sol và chỉ kém Claude Opus 5 hai điểm, trong khi chi phí mỗi tác vụ thuộc nhóm thấp nhất ở tuyến đầu. Nhưng biểu giá có một chi tiết dễ làm hỏng dự toán: khi phần nhập chạm mốc 200K token, toàn bộ yêu c
Grok 4.6 đạt 61 điểm trên bảng chỉ số trí tuệ của Artificial Analysis — ngang GPT-5.6 Sol, kém Claude Opus 5 đúng hai điểm — với chi phí mỗi tác vụ thuộc nhóm thấp nhất ở tuyến đầu. Nhưng biểu giá có một chi tiết dễ làm hỏng dự toán: khi phần nhập chạm mốc 200K token, toàn bộ yêu cầu bị tính giá gấp đôi.
1. Trước Hết: Công Ty Này Giờ Tên Là Gì
Nếu bạn thấy cái tên SpaceXAI và thấy lạ, đây là lý do. Ngày 2/2/2026, SpaceX mua lại xAI trong một giao dịch hoàn toàn bằng cổ phiếu, định giá xAI ở mức 250 tỷ USD và pháp nhân hợp nhất ở 1,25 nghìn tỷ USD — thương vụ sáp nhập tư nhân lớn nhất từng có. Tới tháng 5/2026, xAI bị giải thể với tư cách công ty độc lập, và ngày 6/7/2026 bộ nhận diện mới SpaceXAI được công bố. Pháp nhân này hiện gồm SpaceX, xAI và mạng xã hội X.
Điều này có ý nghĩa thực tế với người mua: dòng sản phẩm Grok giờ nằm trong một tập đoàn có hoạt động chính là hàng không vũ trụ và mạng xã hội. Tài liệu kỹ thuật và API vẫn giữ tên miền cũ, nên bạn sẽ thấy cả hai cách gọi trong tài liệu tham khảo.
2. Điểm Số — Đo Bởi Bên Thứ Ba
Điểm đáng ghi nhận của bản phát hành này là các con số dưới đây đến từ Artificial Analysis, một đơn vị đo đạc độc lập, chứ không phải bảng điểm do nhà cung cấp tự công bố. Mô hình ra mắt ngày 12/8/2026.
| Phép đo | Grok 4.6 | Đối chiếu |
|---|---|---|
| Chỉ số trí tuệ AA | 61 | Ngang GPT-5.6 Sol; Claude Opus 5 đạt 63; Claude Fable 5 đạt 62 |
| So với bản trước | +5 điểm | Grok 4.5 đạt 56; tăng 23 điểm so với Grok 4.3 |
| GDPval-AA v2 (Elo) | 1753 | Chỉ sau Claude Opus 5; chồng lấn khoảng tin cậy với Fable 5 và Qwen3.8 Max |
| Terminal-Bench v2.1 | 88,4% | Ngang nhóm dẫn đầu |
| τ³-Banking | 50,7% | Nhóm hai dẫn đầu, cạnh Qwen3.8 Max (51,3%) |
| Chi phí mỗi tác vụ | 0,84 USD | Bằng Kimi K3; thấp hơn nhiều so với nhóm Claude Opus 5 |
| Tốc độ xuất | 61,3 token/giây | Dưới mức trung vị 78,3 — rẻ nhưng không nhanh |
Một chi tiết về hiệu quả đáng chú ý hơn điểm số: trên bộ đo công việc dài hơi AA-Briefcase, Grok 4.6 hoàn thành tác vụ trong khoảng 53 lượt và 0,5 tỷ token nhập, so với khoảng 103 lượt và 2,0 tỷ token của Claude Opus 5. Nó về đích với ít bước hơn — dù điểm Elo cuối cùng (1577) vẫn xếp sau nhóm Opus 5.
Hoà thống kê không phải dẫn trước
Artificial Analysis ghi rõ rằng ở GDPval-AA v2 và AA-Briefcase, khoảng cách giữa Grok 4.6 với Claude Fable 5 và Qwen3.8 Max nằm trong khoảng tin cậy chồng lấn. Nghĩa là ở các phép đo đó, đây là hoà về mặt thống kê, không phải một thứ hạng thật. Bất kỳ bài viết nào xếp hạng dứt khoát ba mô hình này dựa trên các con số đó đều đang đọc quá mức dữ liệu cho phép.
3. Cái Bẫy Giá Ở Mốc 200K Token
Đây là phần quan trọng nhất bài này với người làm sản phẩm. Biểu giá chính thức có hai bậc:
- Dưới 200K token — 2 USD mỗi triệu token nhập, 0,5 USD cho token nhập đã lưu đệm, 6 USD mỗi triệu token xuất.
- Từ 200K token trở lên — 4 USD, 1 USD và 12 USD tương ứng. Gấp đôi toàn bộ.
Chi tiết quyết định nằm ở cách áp dụng, và tài liệu chính thức ghi rất rõ: yêu cầu nào có phần nhập chạm ngưỡng sẽ bị tính mức giá cao hơn cho toàn bộ token trong yêu cầu đó — không phải chỉ phần vượt ngưỡng. Đây là vách giá, không phải bậc thang.
| Yêu cầu | Token nhập | Token xuất | Chi phí ước tính |
|---|---|---|---|
| Ngay dưới ngưỡng | 199.000 | 2.000 | khoảng 0,41 USD |
| Ngay trên ngưỡng | 201.000 | 2.000 | khoảng 0,83 USD |
Phần nhập chỉ lớn hơn khoảng 1%, còn hoá đơn gấp đôi. Với một hệ thống chạy hàng chục nghìn lượt mỗi ngày và độ dài đầu vào dao động quanh ngưỡng — ví dụ nạp nguyên bộ hồ sơ, nguyên lịch sử hội thoại, hay nguyên tập tài liệu tham chiếu — khoản chênh này đủ để phá vỡ mọi dự toán. Cách xử lý thực tế: đặt một hàng rào cứng dưới 200K trong lớp gọi API, cắt bớt ngữ cảnh trước khi gửi, và ghi log phân bố độ dài đầu vào để biết bao nhiêu phần trăm yêu cầu đang nằm sát mép.
4. Những Thông Số Còn Lại
- Cửa sổ ngữ cảnh 500K token, nhận cả văn bản và ảnh. Con số này không đổi so với Grok 4.5 — phần cải thiện nằm ở chất lượng, không phải độ dài.
- Tham số reasoning_effort có bốn mức: low, medium, high (mặc định) và mức mới xhigh.
- Kênh truy cập: API của nhà cung cấp, Grok Build, Cursor, OpenRouter, Vercel và Cloudflare.
- Không có trọng số mở, không tự vận hành được. Nếu tổ chức của bạn yêu cầu dữ liệu không rời khỏi hạ tầng nội bộ, mô hình này bị loại từ đầu.
5. Ý Nghĩa Với Doanh Nghiệp Việt Nam
- Đáng thử khi bài toán nặng về tác nhân và chi phí. Với mức 2 USD nhập và 6 USD xuất mỗi triệu token, đây hiện là một trong những lựa chọn có tỷ lệ năng lực trên chi phí tốt nhất ở tuyến đầu.
- Cân nhắc lại nếu cần tốc độ. Mức 61,3 token mỗi giây nằm dưới trung vị. Sản phẩm đối thoại trực tiếp với người dùng cuối sẽ cảm nhận rõ điều này.
- Kiểm soát ngưỡng 200K như một hạng mục kỹ thuật. Đây không phải chi tiết kế toán mà là một ràng buộc thiết kế: hệ thống của bạn phải biết độ dài yêu cầu trước khi gửi đi.
- Chưa có dữ liệu riêng về tiếng Việt. Các phép đo trích dẫn trong bài không tách riêng kết quả tiếng Việt. Nếu người dùng của bạn làm việc bằng tiếng Việt, hãy tự dựng tập thử trên chính dữ liệu của mình trước khi chuyển đổi.
Nếu điều bạn cần là kết quả công việc chứ không phải một mô hình để tích hợp — chuẩn hoá văn bản hành chính theo Nghị định 30/2020/NĐ-CP, hay dựng nhanh bộ CV, brochure, slide — thì Compose Word và Design Studio của Locaith cho kết quả ngay, không đòi hỏi bạn tự quản lý biểu giá theo bậc hay hàng rào token.
Nguồn tham khảo:
- Artificial Analysis — Grok 4.6 benchmarks and analysis (chỉ số trí tuệ 61, tăng 5 điểm so với Grok 4.5 và 23 điểm so với Grok 4.3, ngang GPT-5.6 Sol, sau Claude Opus 5 với 63 và Claude Fable 5 với 62, GDPval-AA v2 Elo 1753, τ³-Banking 50,7% cạnh Qwen3.8 Max 51,3%, Terminal-Bench v2.1 88,4%, AA-Briefcase Elo 1577 với khoảng 53 lượt và 0,5 tỷ token nhập so với 103 lượt và 2,0 tỷ token của Claude Opus 5, chi phí mỗi tác vụ 0,84 USD, ghi chú về khoảng tin cậy chồng lấn)
- Artificial Analysis — Trang mô hình Grok 4.6 (xếp hạng 6 trên 188 mô hình được đánh giá, tốc độ 61,3 token xuất mỗi giây so với trung vị 78,3, cửa sổ ngữ cảnh 500K token)
- Tài liệu SpaceXAI — Bảng mô hình và biểu giá (cửa sổ 500K token; dưới 200K: 2 USD nhập, 0,5 USD nhập đã lưu đệm, 6 USD xuất mỗi triệu token; từ 200K: 4 USD, 1 USD, 12 USD; nguyên văn quy định yêu cầu chạm ngưỡng bị tính mức giá cao hơn cho toàn bộ token trong yêu cầu)
- MarkTechPost — SpaceXAI releases Grok 4.6 (ngày ra mắt 12/8/2026, nhận văn bản và ảnh, bốn mức reasoning_effort gồm low medium high và xhigh, các kênh truy cập gồm API và Grok Build và Cursor và OpenRouter và Vercel và Cloudflare, không có trọng số mở)
- CNBC — Musk's xAI, SpaceX combo is the biggest merger of all time (giao dịch toàn cổ phiếu ngày 2/2/2026, định giá xAI 250 tỷ USD và pháp nhân hợp nhất 1,25 nghìn tỷ USD)
- Wikipedia — SpaceXAI (xAI giải thể với tư cách công ty độc lập tháng 5/2026, bộ nhận diện SpaceXAI công bố ngày 6/7/2026, pháp nhân gồm SpaceX và xAI và X)
Lưu ý về số liệu: các điểm số trong bài do Artificial Analysis đo độc lập, không phải bảng điểm nhà cung cấp tự công bố — nhưng vẫn là một đơn vị đo duy nhất với một bộ đề nhất định, và chính đơn vị này ghi nhận nhiều khoảng cách nằm trong khoảng tin cậy chồng lấn, tức hoà thống kê. Biểu giá lấy từ tài liệu chính thức của nhà cung cấp tại thời điểm chúng tôi đọc và có thể thay đổi; hai con số chi phí ví dụ là chúng tôi tự tính từ biểu giá đó, chưa đối chiếu hoá đơn thực tế. Không có dữ liệu công bố nào tách riêng năng lực tiếng Việt của mô hình này. Tổng hợp và phân tích bởi Ban Biên Tập Locaith, ngày 17/8/2026.