GLM-5.3: Z.ai Giữ Lại Trọng Số Mở Vì Mô Hình Học Được Cách Tấn Công Mạng
Ngày 14/8/2026, Z.ai ra mắt GLM-5.3 và tự nhận là mô hình trọng số mở mạnh nhất về lập trình. Nhưng tin đáng chú ý hơn là điều hãng không làm: lần đầu tiên Z.ai hoãn phát hành trọng số khoảng hai tuần, vì trong quá trình hậu huấn luyện mô hình phát triển năng lực tấn công mạng nhanh hơn dự kiến. Bản
Ngày 14/8/2026, Z.ai ra mắt GLM-5.3 và tự nhận đây là mô hình trọng số mở mạnh nhất về lập trình mà hãng từng đo. Nhưng tin đáng chú ý hơn là điều hãng không làm: lần đầu tiên Z.ai hoãn phát hành trọng số khoảng hai tuần — vì trong quá trình huấn luyện, mô hình phát triển năng lực tấn công mạng nhanh hơn hãng dự kiến.
1. Toàn Bộ Tiến Bộ Đến Từ Hậu Huấn Luyện
Điểm kỹ thuật đáng chú ý đầu tiên: GLM-5.3 không có mô hình nền mới. Nó chạy trên đúng mô hình cơ sở 744 tỷ tham số của GLM-5.2, không huấn luyện trước lại từ đầu. Cửa sổ context 1 triệu token cũng được kế thừa nguyên vẹn. Toàn bộ mức tăng năng lực đến từ việc mở rộng giai đoạn hậu huấn luyện.
Điều đó có ý nghĩa vượt ra ngoài một bản phát hành đơn lẻ. Nó là bằng chứng cho thấy vẫn còn dư địa đáng kể để rút thêm năng lực từ một mô hình nền có sẵn, mà không phải chịu chi phí khổng lồ của một vòng huấn luyện trước mới. Với các phòng thí nghiệm không có ngân sách tính bằng tỷ đô, đây là con đường thực tế hơn nhiều.
Z.ai cũng công bố một cải thiện về hiệu quả ít được chú ý nhưng có ảnh hưởng trực tiếp tới hoá đơn: mô hình tiêu thụ khoảng 75.000 token đầu ra cho mỗi tác vụ, giảm từ mức 96.000 của GLM-5.2. Nói cách khác, nó làm xong việc với ít chữ hơn — điều đáng giá khi bạn trả tiền theo token đầu ra.
2. Vì Sao Trọng Số Bị Giữ Lại
Đây là phần đáng chú ý nhất của cả bản phát hành, và nó không nằm ở bảng điểm.
Trong quá trình hậu huấn luyện trên các môi trường tìm lỗ hổng bảo mật, Z.ai cho biết mô hình phát triển năng lực khai thác nhanh hơn dự kiến. Theo mô tả của hãng, năng lực đó tiếp tục tăng khi mở rộng quy mô huấn luyện, và mô hình bắt đầu suy luận xuyên qua nhiều giai đoạn của một chuỗi khai thác — tức là không còn dừng ở việc tìm ra từng lỗi riêng lẻ, mà lập được kế hoạch mạch lạc cho cả một chuỗi tấn công hoàn chỉnh.
Con số minh hoạ do Z.ai công bố: mô hình tìm ra 2.436 lỗ hổng trên 269 dự án mã nguồn mở, trong đó 1.097 được xếp mức nghiêm trọng từ trung bình đến cao.
Vì sao đây là một tiền lệ
GLM-5.2 đưa trọng số theo giấy phép MIT lên Hugging Face chỉ vài ngày sau khi ra mắt. Với GLM-5.3, Z.ai nói cần khoảng hai tuần để đánh giá và gia cố an toàn trước khi phát hành. Đây là lần đầu một phòng thí nghiệm trọng số mở của Trung Quốc tự hoãn phát hành trọng số vì lý do năng lực tấn công mạng — chứ không phải do quy định bắt buộc. Điểm mấu chốt khiến quyết định này khác mọi biện pháp an toàn khác: trọng số đã công khai thì không thu hồi được. Một API có thể bị chặn, một tài khoản có thể bị khoá; một tệp trọng số đã tải về thì tồn tại vĩnh viễn.
Cần nói rõ giới hạn của thông tin này: các nguồn chúng tôi đọc không mô tả một khung phân loại rủi ro chính thức hay quy trình đánh giá cụ thể nào đi kèm quyết định. Chúng ta biết hãng hoãn, và biết lý do hãng nêu — nhưng không biết ngưỡng nào được dùng để quyết định, cũng không biết điều gì sẽ khiến hãng hoãn tiếp hoặc không phát hành nữa.
3. Bảng Điểm — Và Chỗ Các Nguồn Không Khớp Nhau
| Bộ đánh giá | GLM-5.3 | GLM-5.2 | Ghi chú |
|---|---|---|---|
| CyberGym | 84,5% | 77,2% | Trên Claude Fable 5 (83,8) và GPT-5.6 Sol (83,6) |
| DeepSWE v1.1 | 66,9 | 46,2 | Một nguồn ghi Kimi K3 ở mức 67,5, tức vẫn trên GLM-5.3 |
| Terminal-Bench 3.0 | 28,3 | 4,6 | Một nguồn ghi GPT-5.6 Sol ở mức 34,6 |
| Z.ai Code Bench | Nguồn không khớp | — | 34,5% hoặc 50,3% tuỳ nguồn — xem giải thích bên dưới |
| Token đầu ra / tác vụ | 75.000 | 96.000 | Ít token hơn cho cùng khối lượng việc |
Về Z.ai Code Bench, các nguồn chúng tôi đọc không thống nhất. Một bản tin ghi 34,5% ở chế độ nỗ lực tối đa, đặt cạnh Claude Fable 5 ở mức 39,5%; một bản tin khác ghi 50,3% và mô tả đó là mức cải thiện khoảng 50% so với bản trước. Hai con số này không thể cùng đúng cho cùng một cấu hình. Nhiều khả năng chúng đo ở các mức nỗ lực hoặc tập con khác nhau, nhưng chúng tôi không xác minh được điều đó, nên ghi lại cả hai thay vì chọn bừa một con số.
Một lưu ý nữa về cách đọc bảng trên. Mức nhảy ở Terminal-Bench 3.0 từ 4,6 lên 28,3 là rất lớn — gấp hơn sáu lần. Với các bộ đánh giá tác tử, kết quả cực kỳ nhạy với khung chạy, cách viết prompt, mức nỗ lực và môi trường công cụ xung quanh. Một mức nhảy cỡ này thường phản ánh cả tiến bộ thật lẫn việc tối ưu riêng cho cách chạy bộ đánh giá đó. Toàn bộ số trong bảng là do Z.ai công bố và chưa có bên thứ ba lặp lại độc lập tại thời điểm chúng tôi viết bài.
Cũng nên giữ đúng tỷ lệ khi đọc thành tích CyberGym: khoảng cách giữa 84,5 với 83,8 của Claude Fable 5 và 83,6 của GPT-5.6 Sol là chưa tới một điểm. Đó là ngang ngửa, không phải vượt trội. Và trên nhiều bộ đánh giá khó khác, GLM-5.3 vẫn xếp sau các mô hình đóng như GPT-5.6 Sol và Claude Fable 5.
4. Giá Và Cách Tiếp Cận
- Hiện có qua GLM Coding Plan và ZCode — ba bậc 18, 72 và 160 USD mỗi tháng; nếu trả theo năm là 12,60, 50,40 và 112 USD.
- Giá theo token: chưa công bố cho GLM-5.3. Bảng giá công khai vẫn đang là của GLM-5.2 — 1,40 USD đầu vào và 4,40 USD đầu ra cho mỗi triệu token.
- API và trọng số tải về — theo Z.ai là khoảng hai tuần kể từ 14/8/2026, tức cuối tháng 8. Hãy coi đây là mốc dự kiến, không phải cam kết.
5. Ý Nghĩa Với Doanh Nghiệp Việt Nam
- Nếu bạn chờ trọng số mở để tự vận hành. Nhiều tổ chức ở Việt Nam chọn mô hình trọng số mở vì lý do dữ liệu không được rời khỏi hạ tầng nội bộ. Nếu đó là trường hợp của bạn, hãy tính lịch theo cuối tháng 8 — và chuẩn bị sẵn phương án nếu mốc đó trượt, vì lý do hoãn lần này là an toàn chứ không phải kỹ thuật.
- Chi phí trên mỗi tác vụ có thể giảm. Việc giảm từ 96.000 xuống 75.000 token đầu ra cho mỗi tác vụ là khoảng 22%. Với hệ thống tác tử chạy khối lượng lớn, đây là khoản tiết kiệm thật — nhưng chỉ kiểm chứng được khi có giá theo token chính thức.
- Với tổ chức làm an ninh mạng. Xu hướng năng lực tấn công tăng nhanh trong các mô hình trọng số mở nên được đưa vào đánh giá rủi ro. Điểm cần nhớ là tính không thể đảo ngược: một khi trọng số công khai, mọi bên đều có, và không có cơ chế thu hồi nào tồn tại.
- Đừng suy ra chất lượng tiếng Việt từ bảng điểm này. Mọi bộ đánh giá được nêu đều là tiếng Anh, và phần lớn là về lập trình. Không có dữ liệu công bố nào về năng lực tiếng Việt của GLM-5.3.
Nếu nhu cầu của tổ chức bạn cụ thể hơn — chuẩn hoá văn bản hành chính theo Nghị định 30/2020/NĐ-CP, hay dựng nhanh bộ CV, brochure, slide — thì các công cụ chuyên biệt như Compose Word và Design Studio của Locaith cho kết quả ngay mà không đòi hỏi bạn tự dựng và vận hành hạ tầng mô hình riêng.
Nguồn tham khảo:
- Decrypt — China's Z.AI Ships GLM-5.3, Calling It the Top Open-Weight Coding Model (ngày ra mắt 14/8/2026, kênh GLM Coding Plan và ZCode, 2.436 lỗ hổng trên 269 dự án mã nguồn mở, 1.097 mức trung bình đến cao, token đầu ra 75.000 so với 96.000, Z.ai Code Bench 34,5% ở chế độ nỗ lực tối đa, Terminal Bench 3.0 và DeepSWE đối chiếu GPT-5.6 Sol và Kimi K3)
- Unite.AI — Z.ai Launches GLM-5.3 With Frontier Coding and a Cyber Capability That Outgrew Its Training (CyberGym 84,5% so với 77,2%, mô tả bộ đánh giá, suy luận qua nhiều giai đoạn khai thác, Z.ai Code Bench 50,3%, đối chiếu Claude Fable 5 39,5% và Claude Opus 4.8 29,5%)
- Fello AI — GLM 5.3: Benchmarks, Pricing and the Held-Back Weights (744 tỷ tham số, context 1 triệu token, không huấn luyện trước mới, giá gói 18/72/160 USD mỗi tháng và 12,60/50,40/112 USD theo năm, xác nhận chưa công bố giá theo token cho 5.3, tiền lệ GLM-5.2 phát hành trọng số MIT trong vài ngày)
- OfficeChai — Z.AI Releases GLM 5.3, Beats Fable 5 And GPT 5.6 Sol On CyberBench (đối chiếu điểm an ninh mạng với Claude Fable 5 83,8 và GPT-5.6 Sol 83,6)
Lưu ý về số liệu: mọi điểm benchmark trong bài là do Z.ai tự công bố, chưa có bên thứ ba lặp lại độc lập tại thời điểm viết. Các nguồn không thống nhất về điểm Z.ai Code Bench (34,5% so với 50,3%) và chúng tôi đã ghi rõ cả hai thay vì chọn một. Mức nhảy ở Terminal-Bench 3.0 rất lớn nên cần đọc thận trọng, vì các bộ đánh giá tác tử nhạy với khung chạy và cấu hình. Các nguồn không mô tả khung phân loại rủi ro chính thức nào đi kèm quyết định hoãn phát hành trọng số. Mốc hai tuần là dự kiến do Z.ai nêu, không phải cam kết. Chưa có giá theo token cho GLM-5.3. Chúng tôi không kiểm thử độc lập mô hình này, và không có dữ liệu nào về năng lực tiếng Việt của nó. Tổng hợp và phân tích bởi Ban Biên Tập Locaith, ngày 15/8/2026.