Claude Opus 5 vs Sonnet 5 vs Kimi K3: Phân Tích & So Sánh 3 Model AI Mới Nhất Tháng 7/2026
Chỉ trong một tháng, làng AI đón ba model lớn: Claude Sonnet 5 (30/6), Kimi K3 của Moonshot AI (mở trọng số 27/7) và Claude Opus 5 (24/7). Bài viết tổng hợp thông số chính thức, bảng benchmark so sánh, phân tích điểm mạnh từng model và lời khuyên chọn model cho doanh nghiệp Việt Nam — kèm cảnh báo v
Tháng 7/2026 là một tháng dồn dập của làng AI: Claude Sonnet 5 ra mắt ngày 30/6, Kimi K3 của Moonshot AI công bố giữa tháng và mở trọng số ngày 27/7, rồi Claude Opus 5 xuất hiện ngày 24/7. Ba model, ba triết lý hoàn toàn khác nhau. Locaith mổ xẻ từng cái — và chỉ ra những con số mà báo chí đang so sánh sai.
Đính chính tên gọi: "Kimi 3" hay "Kimi K3"?
Tên chính thức của model là Kimi K3 (mã kho moonshotai/Kimi-K3, mã API kimi-k3) — không phải "Kimi 3". Đây là kế thừa dòng Kimi K2, giữ nguyên chữ "K" trong tên.
1. Claude Opus 5 — "Ông vua" lập trình mới
Ra mắt 24/7/2026, Opus 5 là model mạnh nhất của Anthropic ở mảng lập trình và công việc tri thức. Con số gây choáng nhất: 96,0% trên SWE-bench Verified — gần như chạm trần bài kiểm tra sửa lỗi phần mềm thực tế. Ngoài ra, Opus 5 đạt 42/42 điểm tại IMO 2026 (mức huy chương vàng Olympic Toán quốc tế) mà không cần khung agent hỗ trợ.
- Cửa sổ ngữ cảnh: 1 triệu token · Giá: $5 / $25 mỗi triệu token (giữ nguyên như Opus 4.8)
- Thay đổi lớn: chế độ "suy nghĩ" (thinking) nay bật mặc định — đây là thay đổi phá vỡ tương thích với code cũ viết cho Opus 4.8.
- Điểm mạnh tuyệt đối: điều khiển máy tính (OSWorld 2.0: 70,6 — cao nhất hiện nay) và suy luận dài hạn.
2. Claude Sonnet 5 — Cân bằng hiệu năng/chi phí
Ra mắt 30/6/2026, Sonnet 5 đạt 85,2% SWE-bench Verified — tức khoảng 89% sức mạnh của Opus 5 nhưng chỉ tốn một phần giá. Đây vẫn là lựa chọn hợp lý nhất cho phần lớn công việc hằng ngày.
- Giá: $3 / $15 — đang có ưu đãi $2 / $10 đến hết 31/8/2026
- Lưu ý kỹ thuật quan trọng: Sonnet 5 dùng bộ mã hoá (tokenizer) mới, sinh ra nhiều hơn ~30% token cho cùng một đoạn văn bản. Nếu doanh nghiệp đang tính chi phí theo token, phải tính lại toàn bộ ngân sách.
- Hạn chế được công bố: khả năng an ninh mạng thấp hơn hẳn dòng Opus, và ở bài kiểm tra tìm lỗ hổng CyberGym còn yếu hơn cả Sonnet 4.6.
3. Kimi K3 — Cú đấm từ mã nguồn mở
Moonshot AI công bố Kimi K3 giữa tháng 7 và mở trọng số ngày 27/7/2026. Đây là model MoE khổng lồ: 2.800 tỷ tham số tổng, 104 tỷ tham số kích hoạt mỗi token, hỗ trợ 1 triệu token ngữ cảnh và có thị giác gốc. Theo đánh giá độc lập của Artificial Analysis, K3 đứng số 1 trong 98 model mở trọng số.
"Mở trọng số" ≠ "mã nguồn mở"
Kimi K3 dùng giấy phép riêng "Kimi K3 License", không phải MIT hay Apache 2.0 như nhiều nơi đưa tin. Dùng thương mại miễn phí, nhưng: đơn vị cung cấp dịch vụ AI có doanh thu nhóm trên 20 triệu USD phải ký thoả thuận riêng với Moonshot, và sản phẩm trên 100 triệu người dùng/tháng phải hiển thị dòng chữ "Kimi K3" trên giao diện.
Thực tế tự vận hành: trọng số nặng khoảng 1,56 TB, Moonshot khuyến nghị từ 64 GPU trở lên. Nói cách khác, "mở" không có nghĩa là doanh nghiệp vừa và nhỏ chạy được tại chỗ — đa số vẫn sẽ dùng qua API ($3 / $15, riêng input đã lưu đệm chỉ $0,30 — rẻ nhất nhóm).
Bảng So Sánh Tổng Hợp
Bảng dưới chỉ liệt kê những chỉ số thực sự so sánh được. Ô ghi "chưa công bố" là nhà phát triển không đưa ra số — Locaith để trống thay vì lấy số từ nguồn không kiểm chứng.
| Tiêu chí | Claude Opus 5 | Claude Sonnet 5 | Kimi K3 |
|---|---|---|---|
| Ngày ra mắt | 24/7/2026 | 30/6/2026 | 27/7/2026 (mở trọng số) |
| SWE-bench Verified (lập trình) | 96,0% | 85,2% | chưa công bố |
| HLE (có công cụ) | 64,7% | 57,4% | 56,0% |
| BrowseComp (tra cứu web) | 90,8% | 86,6% | 91,2% |
| GDPval-AA v2 (Elo, công việc tri thức) | 1861 | 1618 | 1686 |
| Cửa sổ ngữ cảnh | 1M token | 1M token | 1M token |
| Giá (input / output / 1M token) | $5 / $25 | $2 / $10 (ưu đãi) | $3 / $15 |
| Mở trọng số | Không | Không | Có (giấy phép riêng) |
⚠️ Những Con Số KHÔNG Nên Đem So Sánh
Đây là phần nhiều bài báo đang làm sai, và cũng là lý do bảng trên của chúng tôi ngắn hơn bạn tưởng:
- Terminal-Bench 2.1: Kimi K3 đạt 88,3 còn Sonnet 5 đạt 80,4 — nhưng hai bên chạy trên khung thử nghiệm khác nhau. Bằng chứng: với cùng model Opus 4.8, Moonshot báo 84,6 trong khi Anthropic báo 74,6 — lệch tới 10 điểm. Không thể kết luận K3 mạnh hơn Sonnet 5 ở mảng này.
- AutomationBench: Anthropic dùng bộ đề riêng tư của Zapier, Moonshot dùng bộ công khai 600 tác vụ. Con số 30,8 của K3 không "thắng" 26,0 của Opus 5 — hai bài thi khác nhau.
- GPQA Diamond: chỉ Kimi K3 công bố (93,5%). Hai system card của Anthropic không hề nhắc tới GPQA.
- AIME: Anthropic tuyên bố benchmark này đã "bão hoà" và đã bỏ, chuyển sang USAMO/IMO.
- Quan trọng nhất: Moonshot chưa từng đo Kimi K3 đối đầu Opus 5 hay Sonnet 5 — bảng của họ chỉ so với Fable 5, GPT-5.6, Opus 4.8. Các so sánh trên do Locaith tự đối chiếu, và chỉ giữ lại những chỉ số mà số nền của cả hai bên trùng khớp chính xác (HLE, GDPval, OSWorld).
Ai Mạnh Nhất Ở Mảng Nào?
- Lập trình & suy luận: Opus 5 thắng rõ rệt (96,0 SWE-bench Verified, GDPval 1861, IMO 42/42).
- Điều khiển máy tính / tác nhân: Opus 5 (OSWorld 2.0: 70,6).
- Tra cứu web: Kimi K3 nhỉnh hơn sát nút (91,2 vs 90,8) — chênh lệch nằm trong sai số, coi như hoà.
- Hiệu quả chi phí: Sonnet 5 — 85,2% SWE-bench với giá bằng ~40% Opus 5.
- Mã nguồn mở / tự chủ: Kimi K3, không có đối thủ trong nhóm này.
- Tốc độ: Sonnet 5 nhanh nhất, Kimi K3 chậm nhất (~33 token/giây theo Artificial Analysis).
Lời Khuyên Cho Doanh Nghiệp Việt Nam
- Đa số nhu cầu → Sonnet 5. Soạn thảo, tóm tắt, dịch thuật, chatbot, lập trình thường ngày: mạnh vừa đủ, giá tốt nhất. Tranh thủ ưu đãi trước 31/8/2026.
- Bài toán khó nhất → Opus 5. Refactor hệ thống lớn, agent tự động hoá dài hơi, phân tích chuyên sâu. Đắt nhưng xứng đáng khi độ chính xác quan trọng hơn chi phí.
- Cần tự chủ dữ liệu → cân nhắc Kimi K3. Nhưng phải tỉnh táo: 1,56 TB trọng số và 64+ GPU là rào cản thật. Nếu vẫn gọi API thì lợi thế "mở" gần như không còn ý nghĩa.
- Đừng chạy theo điểm benchmark. Hiệu quả thật đến từ việc ghép đúng model với đúng nghiệp vụ — đó cũng là cách Locaith xây dựng Compose Word (soạn thảo văn bản chuẩn Nghị định 30/2020/NĐ-CP) và Design Studio: chọn model tối ưu cho từng tác vụ thay vì dùng một model đắt nhất cho mọi việc.
Câu Hỏi Thường Gặp
Claude Opus 5 là gì?
Claude Opus 5 là mô hình AI mạnh nhất của Anthropic, ra mắt ngày 24/7/2026. Đây là model dẫn đầu về lập trình và suy luận, đạt 96,0% trên SWE-bench Verified và 42/42 điểm tại kỳ thi Olympic Toán quốc tế IMO 2026, với cửa sổ ngữ cảnh 1 triệu token.
Claude Opus 5 giá bao nhiêu?
Opus 5 có giá 5 USD cho mỗi triệu token đầu vào và 25 USD cho mỗi triệu token đầu ra, giữ nguyên như Opus 4.8. So sánh: Sonnet 5 đang ưu đãi 2 USD / 10 USD đến hết 31/8/2026, còn Kimi K3 là 3 USD / 15 USD.
Nên chọn Claude Opus 5 hay Sonnet 5?
Với đa số công việc hằng ngày như soạn thảo, dịch thuật, chatbot và lập trình thông thường, Sonnet 5 là lựa chọn hợp lý hơn vì đạt 85,2% SWE-bench Verified với giá chỉ khoảng 40% Opus 5. Chỉ nên dùng Opus 5 cho các bài toán khó nhất như refactor hệ thống lớn hay agent tự động hoá dài hơi.
Kimi K3 có miễn phí không?
Kimi K3 mở trọng số và cho phép dùng thương mại miễn phí, nhưng không phải giấy phép mã nguồn mở tiêu chuẩn như MIT hay Apache 2.0. Đơn vị cung cấp dịch vụ AI có doanh thu nhóm trên 20 triệu USD phải ký thoả thuận riêng với Moonshot. Ngoài ra trọng số nặng khoảng 1,56 TB và cần từ 64 GPU trở lên để tự vận hành.
Claude Opus 5 mạnh hơn Kimi K3 ở điểm nào?
Opus 5 vượt trội ở suy luận và công việc tri thức: HLE có công cụ đạt 64,7% so với 56,0% của Kimi K3, và điểm Elo GDPval-AA v2 là 1861 so với 1686. Ngược lại, Kimi K3 nhỉnh hơn sát nút ở tra cứu web (BrowseComp 91,2% so với 90,8%) và là model duy nhất trong ba model mở trọng số.
Nguồn tham khảo:
- Anthropic — Công bố Claude Opus 5 & System Card (24/7/2026)
- Anthropic — Công bố Claude Sonnet 5 & System Card (30/6/2026)
- Moonshot AI — Blog chính thức Kimi K3 & Model card trên Hugging Face
- Anthropic — Tài liệu thông số & giá model
- Artificial Analysis — đánh giá độc lập về tốc độ, giá quy đổi và xếp hạng model mở trọng số
Toàn bộ số liệu benchmark trong bài lấy từ system card / model card chính thức của nhà phát triển, trừ các mục ghi rõ nguồn độc lập. Điểm Elo GDPval thay đổi theo thời gian khi bể so sánh mở rộng (số Sonnet 5 tính đến 6/6/2026). Bài viết được Ban Biên Tập Locaith tổng hợp & phân tích, cập nhật ngày 28/7/2026.