Claude Sonnet 5.5: Giữ Giá Sonnet 5, Nhanh Hơn 30%, Nhưng Năm Thay Đổi Làm Vỡ Mã Cũ

Ngày 28/9/2026, Anthropic ra Claude Sonnet 5.5 với giá giữ nguyên 2 USD và 10 USD mỗi triệu token, sinh chữ nhanh hơn Sonnet 5 trên 30% và theo hãng rẻ hơn tới 30% mỗi tác vụ. Điểm Terminal-Bench 4.0 nhảy từ 10,3% lên 70,6%, nhưng biểu đồ của chính Anthropic cho thấy con số đó đạt ở mức effort cao n

Ngày 28/9/2026, sáu ngày sau Opus 5.5, Anthropic ra mô hình thứ hai của họ Claude 5.5. Claude Sonnet 5.5 giữ nguyên giá của Sonnet 5, sinh chữ nhanh hơn trên 30%, và theo hãng tốn ít hơn tới 30% cho mỗi tác vụ vì cần ít token hơn. Bảng điểm hãng công bố có những bước nhảy hiếm thấy giữa hai phiên bản liền nhau. Nhưng có hai điều bài công bố không đặt lên đầu: con số ấn tượng nhất đạt được ở mức cấu hình đắt nhất, và đội kỹ thuật đang chạy Sonnet 5 không thể chỉ đổi tên mô hình, vì tài liệu của chính Anthropic liệt kê năm thay đổi khiến request cũ trả lỗi.

Sonnet 5.5 là gì, giá bao nhiêu

Sonnet là dòng tầm trung của Anthropic, nằm giữa Opus và Haiku. Sonnet 5.5 ra chưa đầy ba tháng sau Sonnet 5 (30/6/2026). Anthropic mô tả nó mạnh nhất ở "các việc hằng ngày có phạm vi rõ ràng", sửa lỗi, và tạo tài liệu, slide, bảng tính; còn Opus 5.5 dành cho việc phức tạp cần phán đoán kỹ. Haiku 5.5, bản rẻ cho khối lượng lớn, sẽ ra "trong vài tuần tới".

Thông số Sonnet 5.5 Sonnet 5 Opus 5.5
Đầu vào / đầu ra (USD mỗi triệu token)2 / 102 / 104 / 20
Đọc bộ nhớ đệm (USD mỗi triệu token)0,200,200,20
Ghi bộ nhớ đệm 5 phút (USD mỗi triệu token)2,502,505
Ngữ cảnh / đầu ra tối đa1 triệu / 128.000 token1 triệu / 128.000 token1 triệu / 128.000 token
Mốc kiến thức tin cậy6/20261/20266/2026
Mức effort mặc định trên APIhighhighmedium

Nguồn: trang mô hình Claude Sonnet 5.5 và Claude Sonnet 5 trong tài liệu Claude Platform, bài công bố của Anthropic, đọc ngày 29/9/2026. Chạy theo lô (Batch API) được giảm 50% ở cả ba mô hình.

Mô hình có trên Claude API với tên claude-sonnet-5-5, và trên Amazon Bedrock, Google Cloud, Microsoft Foundry, Claude Platform on AWS, có tuỳ chọn không lưu dữ liệu (zero data retention). Tokenizer giữ nguyên như Sonnet 5, nên cùng một đoạn văn cho ra cùng số token: phần "rẻ hơn tới 30%" đến từ việc mô hình dùng ít token hơn, không đến từ bảng giá. Anthropic cam kết không ngừng Sonnet 5.5 trước 28/9/2027; Sonnet 5 chuyển sang trạng thái "legacy" và sẽ không bị ngừng trước 30/6/2027.

Một chi tiết bài công bố không nhắc: theo trang trợ giúp của Claude mà Locaith đọc ngày 29/9, Sonnet 5.5 nằm trong danh sách mô hình gắn dấu vô hình (watermark) vào văn bản sinh ra, trên mọi nền tảng. Công cụ phát hiện dấu hiện chỉ mở cho các tổ chức đủ điều kiện theo luật EU.

Bảng điểm do Anthropic công bố

Phép đo Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 (lập trình tác tử trong terminal)70,6%10,3%66,4%—
FrontierCode 1.1 (mã có được merge không)46,2% ở Max; 52,1% ở Xhigh42,4%54,4%49,3%
CursorBench 4.0 (việc lấy từ phiên Cursor thật)55,5%34,1%57,8%—
GDPval-AA v2.1 (việc văn phòng 44 nghề, điểm Elo)1844144918461487
AA-Briefcase v1.1 (việc tri thức dài hơi, điểm Elo)1811135918221483
Humanity's Last Exam (có công cụ)64,5%54,9%67,7%—
OSWorld 2.1 (dùng máy tính, chấm từng phần)80,1%57,0%81,8%—
Chartography (đọc biểu đồ, không công cụ)61,6%15,6%64,4%53,6%

Nguồn: bài công bố Claude Sonnet 5.5 của Anthropic, 28/9/2026. Toàn bộ là số do hãng công bố. Điểm Opus 5.5 trên Terminal-Bench là ở mức Xhigh, mức cho điểm cao nhất của mô hình này. GDPval-AA và AA-Briefcase do Artificial Analysis chạy trên bản Sonnet 5.5 trước phát hành, bản này có lỗi làm giảm chất lượng khi dùng structured outputs (đã sửa). Anthropic ghi chú OpenAI vừa sửa một lỗi làm kém khả năng hiểu ảnh của GPT-6 Sol, và điểm GPT-6 Sol có thể chưa phản ánh bản sửa.

Trên GDPval-AA, bộ đo việc thực tế của 44 nghề thuộc 9 ngành, Sonnet 5.5 hơn Sonnet 5 khoảng 400 điểm Elo và chỉ kém Opus 5.5 hai điểm. Ở FrontierCode, điểm ở mức Max thấp hơn ở mức Xhigh; Anthropic giải thích rằng ở mức Max, mô hình hay gọi kỹ năng soát mã của Claude Code, chia việc cho nhiều tác tử con, và trong hai trường hợp được Cognition xem xét, việc này dẫn tới hết giờ hoặc sửa thêm ngoài phạm vi, nên bị trừ điểm. Chính Anthropic cũng viết rằng điểm benchmark chỉ phản ánh một mặt, và "Opus 5.5 vẫn mạnh hơn rõ rệt ở việc phức tạp, mở, đòi hỏi phán đoán liên tục".

70,6% nằm ở mức cấu hình đắt nhất

Các mô hình Claude mới có tham số effort với năm mức: Low, Medium, High, Xhigh, Max. Effort càng cao, mô hình suy nghĩ càng lâu, điểm thường cao hơn nhưng tốn nhiều token hơn. Theo Anthropic, mức mặc định trong ứng dụng Claude và Claude Code là Medium, còn trên Claude Platform là High. Bài công bố có biểu đồ đặt điểm của từng mô hình cạnh chi phí mỗi lượt ở từng mức effort:

Biểu đồ Terminal-Bench 4.0 của Anthropic đặt điểm số cạnh chi phí mỗi lượt theo thang logarit cho Sonnet 5.5, Opus 5.5, Sonnet 5 và GPT-5.6 Sol ở năm mức effort; Sonnet 5.5 đạt 70,6% ở mức Max với chi phí khoảng 12–13 USD
Điểm Terminal-Bench 4.0 theo chi phí mỗi lượt (trục ngang theo thang logarit). Đường xanh là Sonnet 5.5, đường cam là Opus 5.5. Anthropic so với GPT-5.6 Sol vì chưa có kết quả công khai của GPT-6 Sol trên phép đo này. Ảnh: chụp màn hình anthropic.com, Locaith cắt phần biểu đồ.

Locaith đọc các điểm trên biểu đồ bằng mắt, sai số khoảng vài phần trăm. Sonnet 5.5 đạt khoảng 20% ở Low và 29% ở Medium với chưa tới 1 USD mỗi lượt, khoảng 43% ở High với khoảng 2 USD, khoảng 61% ở Xhigh với khoảng 5 USD, và 70,6% ở Max với khoảng 12–13 USD. Điểm cao nhất của Opus 5.5 là 66,4% ở Xhigh, với khoảng 7 USD. Điểm cao nhất của Sonnet 5 là 10,3%, tốn khoảng 11–12 USD.

Hai điều rút ra. Thứ nhất, lời Anthropic rằng ở mức Medium, Sonnet 5.5 "vượt xa điểm tốt nhất của Sonnet 5 với chưa tới một phần mười chi phí mỗi tác vụ" khớp với biểu đồ: gần gấp ba điểm, với chưa tới một phần mười số tiền. Thứ hai, ở các mức chi phí mà cả hai mô hình cùng có điểm đo, từ khoảng 1,3 đến 7 USD mỗi lượt, đường của Opus 5.5 luôn nằm trên đường của Sonnet 5.5. Sonnet 5.5 chỉ vượt ở hai đầu: dưới khoảng 1,3 USD, nơi Opus 5.5 không có điểm nào, và ở mức Max. Bài công bố cũng nói điều tương tự bằng lời lẽ nhẹ hơn: Sonnet 5.5 "bổ trợ Opus 5.5 tốt nhất khi chạy ở mức effort thấp", còn ở mức cao thì "có thể đạt tương đương với chi phí tương tự".

Đây là một phép đo. Trang công bố còn ba biểu đồ khác (FrontierCode, CursorBench, AA-Briefcase) mà Locaith không đọc số. Với các biểu đồ đó, Anthropic viết rằng ở mức High trên FrontierCode, Sonnet 5.5 bằng điểm tốt nhất của GPT-6 Sol với khoảng một phần năm chi phí, và ở mức Medium trên AA-Briefcase, nó vượt điểm tốt nhất của Sonnet 5 với khoảng một phần chín chi phí.

Năm thay đổi làm request cũ báo lỗi

Trang "What's new in Claude Sonnet 5.5" trong tài liệu cho nhà phát triển mở đầu bằng câu: năm thay đổi ảnh hưởng tới mã đang chạy trên Sonnet 5. Cụ thể:

Một thay đổi thứ sáu không gây lỗi nhưng khó phát hiện hơn: đoạn chữ mô hình viết giữa các lần gọi công cụ, nếu dài hơn một hai câu, giờ trả về trong khối thinking. Ở chế độ hiển thị mặc định, khối này rỗng, nên ứng dụng nào đang cho người dùng xem các ghi chú tiến độ đó sẽ im bặt giữa các bước, không có thông báo lỗi nào. Ngoài ra, mức effort được hiệu chỉnh lại: cùng một mức không cho ra cùng lượng suy nghĩ như trên Sonnet 5, và Anthropic khuyên chạy lại phép dò effort thay vì giữ cấu hình cũ. Việc đặt temperature, top_p, top_k khác mặc định trả lỗi 400, nhưng điều này đã có từ Sonnet 5. Có một thay đổi có lợi: prompt tối thiểu để lưu bộ nhớ đệm giảm từ 1.024 xuống 512 token.

Sonnet đầu tiên có bộ lọc an ninh mạng, kèm lời báo trước về từ chối nhầm

Anthropic đánh giá năng lực an ninh mạng của Sonnet 5.5 ngang Opus 5, nên đây là mô hình Sonnet đầu tiên chạy bộ lọc an ninh mạng giống Opus 5.5. Theo system card, bộ lọc có ba tầng: một đầu dò đọc trạng thái kích hoạt bên trong mô hình, một bộ phân loại nhẹ chạy trên chính Sonnet 5.5, và một mô hình phân loại riêng quyết định có chặn hay không. Chính sách cho phép tìm lỗ hổng trong mã nguồn, để lập trình viên vẫn dùng được cho việc viết phần mềm an toàn hơn, nhưng chặn việc tìm lỗ hổng trong tệp nhị phân đã biên dịch. System card viết thẳng: "người dùng nên dự tính số lời từ chối tăng lên với Sonnet 5.5, kể cả ở các việc vô hại liên quan tới an ninh mạng".

Khi bị chặn, trong ứng dụng của Anthropic yêu cầu tự chuyển sang Sonnet 5. Trên API, nhà phát triển phải tự bật cơ chế chuyển. Cơ chế chuyển phía máy chủ (tham số fallbacks, đang beta) chỉ có trên Claude API, không có trên Bedrock, Google Cloud, Microsoft Foundry và không dùng được với Batch API; ở các nơi đó phải dùng middleware trong SDK. Theo tài liệu, cơ chế mặc định chuyển các lời từ chối nhóm cyber và frontier_llm sang Sonnet 5, nhưng không chuyển nhóm bio, reasoning_extraction và general_harms.

Về tiền: như chuyên mục này viết ngày 26/9, lời từ chối đến trước khi có đầu ra vẫn bị tính phí nếu thuộc nhóm bio, frontier_llm hoặc reasoning_extraction; nhóm cyber và general_harms không bị tính. Với Sonnet 5.5, điều này có ý nghĩa mới: đây là Sonnet đầu tiên có bộ phân loại chống trích xuất suy nghĩ, thứ Anthropic dựng để ngăn tấn công chưng cất (distillation) bằng hàng nghìn tài khoản giả.

System card 148 trang còn vài điểm đáng ghi. Sonnet 5.5 không vượt ngưỡng mới nào trong chính sách mở rộng có trách nhiệm (RSP) của Anthropic. Hãng ghi nhận sự thụt lùi ở một số mảng kiểm thử nhiều lượt như theo dõi và giám sát người khác; tỷ lệ từ chối việc có hại trong môi trường điều khiển máy tính ngang Opus 5.5 nhưng kém một số mô hình trước; và phần suy nghĩ của nó "khó đọc hơn nhiều mô hình trước". Ở chiều ngược lại, trong các bài kiểm tra của chính Anthropic, đây là mô hình ít tự ý liên hệ bên thứ ba nhất và ít cố thoát khỏi môi trường cách ly (sandbox) nhất trong số các mô hình được thử. Người làm bảo mật cần tiếp cận rộng hơn sẽ sớm đăng ký được Cyber Verification Program mở rộng.

Tiếng Việt: chỉ có điểm trung bình

System card báo Sonnet 5.5 đạt trung bình 92,1% trên Global MMLU, bộ đo kiến thức ở 42 ngôn ngữ, trong đó có tiếng Việt, so với 89,2% của Sonnet 5, 94,3% của Opus 5.5 và 94,0% của Fable 5.1 (chạy ở mức Max, một lượt). Anthropic không tách điểm theo từng ngôn ngữ, nên không thể biết tiếng Việt được cải thiện bao nhiêu. Global MMLU là câu hỏi trắc nghiệm kiến thức; nó không đo được văn phong hành chính hay chất lượng tóm tắt tài liệu tiếng Việt.

Khách hàng thử sớm nói gì

Bài công bố dẫn lời 13 công ty thử sớm. Vài con số cụ thể: quỹ Balyasny Asset Management chạy 2.441 việc tài chính và thấy Sonnet 5.5 dùng khoảng 121.000 token mỗi câu trả lời, so với 497.000 token của Sonnet 5; Box nói mô hình chính xác hơn, nhanh hơn 2,4 lần và dùng ít hơn 12% tổng token; Zendesk nói phiếu hỗ trợ được xử lý nhanh hơn 20%; Base44 nói qua 118 lần dựng ứng dụng, Sonnet 5.5 cho chất lượng ngang Opus 5 với trung bình 3,6 vòng lặp mỗi lần, so với 7,7 vòng của Opus 5. Đây là lời khách hàng do Anthropic chọn đăng, với phương pháp đo không được công bố.

Cần biết về nguồn tin:

  • Mọi điểm benchmark trong bài do Anthropic công bố. GDPval-AA và AA-Briefcase do Artificial Analysis chạy, nhưng trên bản trước phát hành có lỗi; Chartography do Surge AI chấm. Chưa có đo lường độc lập nào trên bản phát hành chính thức tại thời điểm Locaith viết bài.
  • Các con số chi phí mỗi lượt do Locaith đọc bằng mắt từ biểu đồ của Anthropic, là giá trị gần đúng.
  • Locaith không tự chạy thử Sonnet 5.5.

Doanh nghiệp và đội kỹ thuật Việt Nam nên làm gì

Các nhận định dưới đây là quan điểm của Locaith:

Nguồn:

  • Anthropic — Introducing Claude Sonnet 5.5, 28/9/2026 — nguồn cho bảng điểm, chú thích phương pháp, giá, biểu đồ chi phí, lời khách hàng, phần an toàn và ảnh bìa
  • Anthropic — System Card: Claude Sonnet 5.5, 28/9/2026 — nguồn cho bộ lọc an ninh mạng ba tầng, lời cảnh báo từ chối nhầm, các điểm thụt lùi, kết quả Global MMLU
  • Claude Platform Docs — Claude Sonnet 5.5 và What's new in Claude Sonnet 5.5 — nguồn cho thông số, ngày ngừng, nền tảng và các thay đổi gây lỗi; đọc 29/9/2026
  • Claude Platform Docs — Claude Sonnet 5 — nguồn cho trạng thái legacy, mốc kiến thức và quy định về tham số lấy mẫu của Sonnet 5
  • Claude Platform Docs — Refusals and fallback — nguồn cho năm nhóm từ chối, quy tắc tính phí và phạm vi của cơ chế chuyển mô hình
  • Claude Help Center — How Claude marks AI-generated content — nguồn cho danh sách mô hình gắn watermark; đọc 29/9/2026
  • Hugging Face — Global-MMLU — nguồn cho danh sách 42 ngôn ngữ, có tiếng Việt
  • Locaith — bài ngày 26/9/2026 về việc Claude API tính phí lời từ chối ở ba nhóm; bài ngày 23/9/2026 về Claude Opus 5.5

Điểm benchmark và các con số tiết kiệm chi phí, tốc độ là số do Anthropic và khách hàng của hãng công bố, chưa được kiểm chứng độc lập. Chi phí mỗi lượt ở từng mức effort do Locaith đọc bằng mắt từ biểu đồ của Anthropic, sai số khoảng vài phần trăm. Locaith không tự chạy thử mô hình. Các câu trích được Locaith dịch từ tiếng Anh. Ảnh bìa: Anthropic. Ảnh trong bài: chụp màn hình trang công bố của Anthropic, Locaith cắt phần biểu đồ. Biên soạn và phân tích bởi Ban Biên Tập Locaith, 29/9/2026.

Messenger