Astra Chạm Ngưỡng "Critical" Về Tấn Công Mạng — OpenAI Xác Nhận Điều Chính Họ Còn Để Ngỏ Ba Tuần Trước

Ngày 2/9/2026, OpenAI công bố Astra là mô hình đầu tiên vượt ngưỡng "Critical" về năng lực tấn công mạng trong khung tự đánh giá của chính hãng: 100% trên ExploitBench, tự tìm ra hai lỗi zero-day chưa ai biết và ghép chúng thành một chuỗi khai thác hoàn chỉnh. Ngày 18/8, Locaith đưa tin OpenAI mới c

Ba tuần trước, Locaith viết rằng OpenAI mới chỉ nói có "bằng chứng sơ bộ" cho thấy Astra có thể chạm ngưỡng năng lực tấn công mạng cao nhất trong khung của chính họ, và đề nghị bạn đọc chú ý đúng hai chữ "sơ bộ". Ngày 2/9/2026, hai chữ đó được gỡ bỏ. Bài này thuật lại điều đã được xác nhận, điều vẫn chưa được kiểm chứng, và vì sao phần đáng đọc nhất lại không nằm ở bảng điểm.

OpenAI công bố gì

Ngày 2/9/2026, OpenAI cho biết Astra là mô hình đầu tiên của hãng vượt ngưỡng "Critical" về năng lực an ninh mạng trong Preparedness Framework — khung tự đánh giá rủi ro do chính OpenAI soạn. Đây là bậc cao nhất trong khung, và chưa mô hình nào của hãng từng được xếp vào đó.

Cần nói rõ ngay từ đầu về nguồn: Locaith không truy cập được hai trang công bố gốc của OpenAI trong phiên làm việc này — máy chủ trả về lỗi 403. Toàn bộ số liệu dưới đây lấy từ các bản tin chuyên ngành đọc ngày 3/9/2026, và chúng tôi đã đối chiếu ba nguồn độc lập cho từng con số chính. Đây là tường thuật lại số liệu do OpenAI tự công bố, không phải đo lường độc lập, và cũng không phải bản đọc trực tiếp tài liệu gốc.

"Critical" được định nghĩa thế nào

Theo định nghĩa được các bản tin trích lại, một mô hình chạm ngưỡng Critical về an ninh mạng nếu nó làm được một trong hai việc sau mà không cần người điều khiển từng bước:

Điểm cần giữ tỉnh táo: đây là khung của nhà sản xuất, do nhà sản xuất tự chấm. Không có cơ quan quản lý nào phê chuẩn định nghĩa này, và không có bên thứ ba nào xác nhận Astra đáp ứng nó. Việc một công ty tự tuyên bố sản phẩm của mình nguy hiểm là điều bất thường và đáng ghi nhận — nhưng nó vẫn là tuyên bố một chiều.

Astra làm được gì trong các bài thử

Bài thử Kết quả Ghi chú
ExploitBench100%Đo việc biến lỗ hổng đã công bố thành mã khai thác chạy được
ExploitBench – Internal PortKhông công bố điểm sốBộ đo nội bộ, 20 lỗ hổng V8 nghiêm trọng công bố khoảng 6–8/2026, dựng riêng để loại nghi ngờ mô hình đã học thuộc đề
Lỗi zero-day tự phát hiện2Tìm ra trong lúc dựng chuỗi khai thác; OpenAI nói đã báo nhà bảo trì
Trình duyệt đã gia cốThoát hộp cát hoàn chỉnhGhép nhiều lỗ hổng mới thành chuỗi, chạy được lệnh trên máy chủ khi trình duyệt mở một tệp HTML dọn sẵn
Hệ điều hành đã gia cốLeo thang đặc quyền tới rootGhép nhiều lỗi, đi từ người dùng thường lên quyền cao nhất

Nguồn: tổng hợp từ Security Boulevard, Security Affairs và Trending Topics, đọc 3/9/2026. Tất cả đều thuật lại số liệu OpenAI tự công bố.

Hai dòng cuối bảng là phần đáng chú ý hơn cả điểm số. Chúng không mô tả một mô hình trả lời câu hỏi về bảo mật, mà mô tả một mô hình tự đi hết một chuỗi tấn công: tìm lỗi, ghép lỗi, và đạt tới quyền điều khiển. Khoảng cách giữa "biết về lỗ hổng" và "khai thác được lỗ hổng" là khoảng cách mà giới an ninh mạng vẫn dựa vào để có thời gian vá.

Mặt kia của bảng điểm: các con số về kiềm chế

Cùng lúc công bố năng lực, OpenAI cũng công bố mức độ mô hình từ chối làm việc xấu. Đây là phần thường bị bỏ qua khi tin tức được rút gọn:

Phép đo Astra GPT-5.6 Sol
Tỷ lệ từ chối yêu cầu hỗ trợ tấn công mạng91,5%59%
Tỷ lệ cắn "mồi nhử" tấn công môi trường thử0%56%

Nguồn: Security Affairs và Trending Topics, đọc 3/9/2026. Số của nhà sản xuất.

Con số 91,5% nghe cao, nhưng hãy đọc phần bù: cứ khoảng 12 yêu cầu độc hại thì vẫn có 1 yêu cầu lọt qua. Với một mô hình được chính hãng xếp vào bậc rủi ro cao nhất, đó không phải tỷ lệ đủ để yên tâm — và đó có lẽ chính là lý do OpenAI không mở bán phần năng lực này. Ở chiều ngược lại, mức 0% trong bài thử mồi nhử là bước nhảy thật so với 56%.

OpenAI cũng thừa nhận một cái giá: các lớp bảo vệ có thể chặn nhầm công việc nghiên cứu bảo mật hợp pháp khi nó trông giống hành vi tấn công. Đây là sự đánh đổi có thật, không phải chi tiết phụ — người làm phòng thủ và người tấn công gõ những câu lệnh rất giống nhau.

Tin thật nằm ở chỗ: mô hình không được bán

Astra chưa phát hành rộng rãi. Theo tường thuật, việc huấn luyện từng bị tạm dừng và ngày ra mắt bị lùi vài tuần trong tháng 8/2026 để gia cố các lớp bảo vệ; đợt huấn luyện tăng cường quy mô lớn được nối lại ngày 28/8/2026. Khi mở, phần năng lực an ninh mạng sẽ đi trước cho một nhóm alpha nhỏ, rồi mở rộng dần qua chương trình Daybreak Blue — chỉ dành cho mục đích phòng thủ.

Chi tiết này khép lại một mạch tin Locaith theo từ giữa tháng 8: ngày 18/8/2026 chúng tôi đưa tin đợt huấn luyện tăng cường biên giới lớn nhất của OpenAI vẫn đang tạm dừng. Nay đã rõ nó dừng bao lâu và vì sao — và kết quả của nó là mô hình đang bàn tới.

Cùng ngày 2/9/2026, Google làm gần như y hệt. Hãng phát hành Gemini 3.8 Flash Cyber — cùng một mô hình lõi với bản thường, chỉ khác ở chỗ nới các lớp chặn để phục vụ nghiên cứu lỗ hổng — và không bán rộng rãi. Muốn dùng phải qua chương trình Fairwind, xét duyệt từng trường hợp, chỉ mở cho cơ quan chính phủ, đơn vị vận hành hạ tầng trọng yếu và người bảo trì phần mềm.

Hai phòng thí nghiệm hàng đầu, trong cùng một ngày, đưa ra cùng một kết luận: năng lực tấn công mạng ở mức biên giới sẽ không được bán đại trà. Ranh giới không còn nằm ở chỗ mô hình làm được gì — mà ở chỗ ai được phép chạm vào. Đây là lần đầu tiên ranh giới ấy hiện ra rõ đến vậy ở cả hai hãng cùng lúc.

Những gì vẫn chưa biết

Ba việc doanh nghiệp Việt Nam nên làm

Nguồn:

  • Security Boulevard — OpenAI Reveals Astra, Its First AI Model to Reach "Critical" Cybersecurity Risk Threshold — nguồn cho xếp loại Critical, điểm ExploitBench 100%, tỷ lệ từ chối 91,5% so với 59%, bộ đo nội bộ 20 lỗ hổng, việc tạm dừng huấn luyện và lộ trình Daybreak Blue, đọc 3/9/2026
  • Security Affairs — OpenAI Astra Brings Autonomous Zero-Day Exploitation to AI — nguồn cho chuỗi thoát hộp cát trình duyệt, chuỗi leo thang đặc quyền tới root, tỷ lệ cắn mồi nhử 0% so với 56%, và mốc nối lại huấn luyện ngày 28/8/2026, đọc 3/9/2026
  • Trending Topics — Astra: OpenAI Classifies Its Upcoming Model as "Critical" for Cybersecurity — nguồn đối chiếu độc lập cho định nghĩa ngưỡng Critical, hai lỗi zero-day trên V8 và cơ chế mở quyền theo giai đoạn, đọc 3/9/2026
  • Locaith — bài ngày 19/8/2026 về việc OpenAI tạm dừng huấn luyện tăng cường và chi phí giám sát tăng khoảng 20%, và bài ngày 7/8/2026 về việc Astra giải mười bài toán mở — nguồn cho phần đối chiếu với những gì chúng tôi đã đưa tin trước đó

Locaith không đọc được tài liệu gốc của OpenAI khi viết bài này. Hai trang công bố tại openai.com đều trả về lỗi 403 trong phiên làm việc ngày 3/9/2026, nên toàn bộ số liệu ở đây là tường thuật qua báo chí chuyên ngành, đã đối chiếu chéo ba nguồn độc lập cho từng con số chính. Mọi con số đều do OpenAI tự công bố và chưa có kiểm chứng độc lập — không thể có, vì mô hình chưa mở cho bên ngoài. Locaith chưa và không thể chạy thử Astra. Bảng điểm ExploitBench – Internal Port không được công bố con số cụ thể, nên ô tương ứng để trống thay vì suy đoán. Hai lỗi zero-day chưa có mã CVE công khai nên không thể xác minh tình trạng vá. Ba khuyến nghị ở cuối bài là quan điểm riêng của Locaith. Ảnh bìa do Locaith tự dựng từ số liệu trong bài. Biên soạn và phân tích bởi Ban Biên Tập Locaith, 3/9/2026.

Messenger