GLM-5.3: Z.ai Giữ Lại Trọng Số Mở Vì Mô Hình Học Được Cách Tấn Công Mạng

Ngày 14/8/2026, Z.ai ra mắt GLM-5.3 và tự nhận là mô hình trọng số mở mạnh nhất về lập trình. Nhưng tin đáng chú ý hơn là điều hãng không làm: lần đầu tiên Z.ai hoãn phát hành trọng số khoảng hai tuần, vì trong quá trình hậu huấn luyện mô hình phát triển năng lực tấn công mạng nhanh hơn dự kiến. Bản

Ngày 14/8/2026, Z.ai ra mắt GLM-5.3 và tự nhận đây là mô hình trọng số mở mạnh nhất về lập trình mà hãng từng đo. Nhưng tin đáng chú ý hơn là điều hãng không làm: lần đầu tiên Z.ai hoãn phát hành trọng số khoảng hai tuần — vì trong quá trình huấn luyện, mô hình phát triển năng lực tấn công mạng nhanh hơn hãng dự kiến.

1. Toàn Bộ Tiến Bộ Đến Từ Hậu Huấn Luyện

Điểm kỹ thuật đáng chú ý đầu tiên: GLM-5.3 không có mô hình nền mới. Nó chạy trên đúng mô hình cơ sở 744 tỷ tham số của GLM-5.2, không huấn luyện trước lại từ đầu. Cửa sổ context 1 triệu token cũng được kế thừa nguyên vẹn. Toàn bộ mức tăng năng lực đến từ việc mở rộng giai đoạn hậu huấn luyện.

Điều đó có ý nghĩa vượt ra ngoài một bản phát hành đơn lẻ. Nó là bằng chứng cho thấy vẫn còn dư địa đáng kể để rút thêm năng lực từ một mô hình nền có sẵn, mà không phải chịu chi phí khổng lồ của một vòng huấn luyện trước mới. Với các phòng thí nghiệm không có ngân sách tính bằng tỷ đô, đây là con đường thực tế hơn nhiều.

Z.ai cũng công bố một cải thiện về hiệu quả ít được chú ý nhưng có ảnh hưởng trực tiếp tới hoá đơn: mô hình tiêu thụ khoảng 75.000 token đầu ra cho mỗi tác vụ, giảm từ mức 96.000 của GLM-5.2. Nói cách khác, nó làm xong việc với ít chữ hơn — điều đáng giá khi bạn trả tiền theo token đầu ra.

2. Vì Sao Trọng Số Bị Giữ Lại

Đây là phần đáng chú ý nhất của cả bản phát hành, và nó không nằm ở bảng điểm.

Trong quá trình hậu huấn luyện trên các môi trường tìm lỗ hổng bảo mật, Z.ai cho biết mô hình phát triển năng lực khai thác nhanh hơn dự kiến. Theo mô tả của hãng, năng lực đó tiếp tục tăng khi mở rộng quy mô huấn luyện, và mô hình bắt đầu suy luận xuyên qua nhiều giai đoạn của một chuỗi khai thác — tức là không còn dừng ở việc tìm ra từng lỗi riêng lẻ, mà lập được kế hoạch mạch lạc cho cả một chuỗi tấn công hoàn chỉnh.

Con số minh hoạ do Z.ai công bố: mô hình tìm ra 2.436 lỗ hổng trên 269 dự án mã nguồn mở, trong đó 1.097 được xếp mức nghiêm trọng từ trung bình đến cao.

Vì sao đây là một tiền lệ

GLM-5.2 đưa trọng số theo giấy phép MIT lên Hugging Face chỉ vài ngày sau khi ra mắt. Với GLM-5.3, Z.ai nói cần khoảng hai tuần để đánh giá và gia cố an toàn trước khi phát hành. Đây là lần đầu một phòng thí nghiệm trọng số mở của Trung Quốc tự hoãn phát hành trọng số vì lý do năng lực tấn công mạng — chứ không phải do quy định bắt buộc. Điểm mấu chốt khiến quyết định này khác mọi biện pháp an toàn khác: trọng số đã công khai thì không thu hồi được. Một API có thể bị chặn, một tài khoản có thể bị khoá; một tệp trọng số đã tải về thì tồn tại vĩnh viễn.

Cần nói rõ giới hạn của thông tin này: các nguồn chúng tôi đọc không mô tả một khung phân loại rủi ro chính thức hay quy trình đánh giá cụ thể nào đi kèm quyết định. Chúng ta biết hãng hoãn, và biết lý do hãng nêu — nhưng không biết ngưỡng nào được dùng để quyết định, cũng không biết điều gì sẽ khiến hãng hoãn tiếp hoặc không phát hành nữa.

3. Bảng Điểm — Và Chỗ Các Nguồn Không Khớp Nhau

Bộ đánh giá GLM-5.3 GLM-5.2 Ghi chú
CyberGym 84,5% 77,2% Trên Claude Fable 5 (83,8) và GPT-5.6 Sol (83,6)
DeepSWE v1.1 66,9 46,2 Một nguồn ghi Kimi K3 ở mức 67,5, tức vẫn trên GLM-5.3
Terminal-Bench 3.0 28,3 4,6 Một nguồn ghi GPT-5.6 Sol ở mức 34,6
Z.ai Code Bench Nguồn không khớp 34,5% hoặc 50,3% tuỳ nguồn — xem giải thích bên dưới
Token đầu ra / tác vụ 75.000 96.000 Ít token hơn cho cùng khối lượng việc

Về Z.ai Code Bench, các nguồn chúng tôi đọc không thống nhất. Một bản tin ghi 34,5% ở chế độ nỗ lực tối đa, đặt cạnh Claude Fable 5 ở mức 39,5%; một bản tin khác ghi 50,3% và mô tả đó là mức cải thiện khoảng 50% so với bản trước. Hai con số này không thể cùng đúng cho cùng một cấu hình. Nhiều khả năng chúng đo ở các mức nỗ lực hoặc tập con khác nhau, nhưng chúng tôi không xác minh được điều đó, nên ghi lại cả hai thay vì chọn bừa một con số.

Một lưu ý nữa về cách đọc bảng trên. Mức nhảy ở Terminal-Bench 3.0 từ 4,6 lên 28,3 là rất lớn — gấp hơn sáu lần. Với các bộ đánh giá tác tử, kết quả cực kỳ nhạy với khung chạy, cách viết prompt, mức nỗ lực và môi trường công cụ xung quanh. Một mức nhảy cỡ này thường phản ánh cả tiến bộ thật lẫn việc tối ưu riêng cho cách chạy bộ đánh giá đó. Toàn bộ số trong bảng là do Z.ai công bố và chưa có bên thứ ba lặp lại độc lập tại thời điểm chúng tôi viết bài.

Cũng nên giữ đúng tỷ lệ khi đọc thành tích CyberGym: khoảng cách giữa 84,5 với 83,8 của Claude Fable 5 và 83,6 của GPT-5.6 Sol là chưa tới một điểm. Đó là ngang ngửa, không phải vượt trội. Và trên nhiều bộ đánh giá khó khác, GLM-5.3 vẫn xếp sau các mô hình đóng như GPT-5.6 Sol và Claude Fable 5.

Bảng kết quả benchmark chính thức do Z.ai công bố cho GLM-5.3, đặt cạnh GLM-5.2, Kimi K3, DeepSeek-V4 Pro-0813, Qwen3.8-Max, Opus 4.8, Fable 5 và GPT-5.6 Sol trên 16 bộ đánh giá chia ba nhóm CODING, CYBER và AGENTIC. GLM-5.3 đạt CyberGym 84,5 so với 77,2 của GLM-5.2, 83,8 của Fable 5 và 83,6 của GPT-5.6 Sol; Terminal Bench 3.0 28,3 so với 4,6 nhưng vẫn dưới 34,6 của GPT-5.6 Sol; DeepSWE v1.1 66,9 so với 46,2, trong khi Kimi K3 đạt 67,5. Số in đậm đánh dấu mô hình dẫn đầu từng dòng và phần lớn thuộc về GPT-5.6 Sol, Fable 5 hoặc Opus 4.8, không phải GLM-5.3.
Toàn bộ bảng điểm GLM-5.3 do Z.ai công bố — rộng hơn năm dòng chúng tôi trích ở trên. Đây là chỗ kiểm chứng hai nhận định trong mục này: khoảng cách CyberGym với Fable 5 và GPT-5.6 Sol chưa tới một điểm, và trên nhiều dòng khác GLM-5.3 vẫn xếp sau các mô hình đóng, vì số in đậm hầu hết không thuộc về nó. Lưu ý Z.ai Code Bench không có mặt trong bảng này. Ảnh: Z.ai, qua OfficeChai.

4. Giá Và Cách Tiếp Cận

5. Ý Nghĩa Với Doanh Nghiệp Việt Nam

Nếu nhu cầu của tổ chức bạn cụ thể hơn — chuẩn hoá văn bản hành chính theo Nghị định 30/2020/NĐ-CP, hay dựng nhanh bộ CV, brochure, slide — thì các công cụ chuyên biệt như Compose WordDesign Studio của Locaith cho kết quả ngay mà không đòi hỏi bạn tự dựng và vận hành hạ tầng mô hình riêng.

Nguồn tham khảo:

Lưu ý về số liệu: mọi điểm benchmark trong bài là do Z.ai tự công bố, chưa có bên thứ ba lặp lại độc lập tại thời điểm viết. Các nguồn không thống nhất về điểm Z.ai Code Bench (34,5% so với 50,3%) và chúng tôi đã ghi rõ cả hai thay vì chọn một. Mức nhảy ở Terminal-Bench 3.0 rất lớn nên cần đọc thận trọng, vì các bộ đánh giá tác tử nhạy với khung chạy và cấu hình. Các nguồn không mô tả khung phân loại rủi ro chính thức nào đi kèm quyết định hoãn phát hành trọng số. Mốc hai tuần là dự kiến do Z.ai nêu, không phải cam kết. Chưa có giá theo token cho GLM-5.3. Chúng tôi không kiểm thử độc lập mô hình này, và không có dữ liệu nào về năng lực tiếng Việt của nó. Tổng hợp và phân tích bởi Ban Biên Tập Locaith, ngày 15/8/2026.

Messenger