Astra Chạm Ngưỡng "Critical" Về Tấn Công Mạng — OpenAI Xác Nhận Điều Chính Họ Còn Để Ngỏ Ba Tuần Trước
Ngày 2/9/2026, OpenAI công bố Astra là mô hình đầu tiên vượt ngưỡng "Critical" về năng lực tấn công mạng trong khung tự đánh giá của chính hãng: 100% trên ExploitBench, tự tìm ra hai lỗi zero-day chưa ai biết và ghép chúng thành một chuỗi khai thác hoàn chỉnh. Ngày 18/8, Locaith đưa tin OpenAI mới c
Ba tuần trước, Locaith viết rằng OpenAI mới chỉ nói có "bằng chứng sơ bộ" cho thấy Astra có thể chạm ngưỡng năng lực tấn công mạng cao nhất trong khung của chính họ, và đề nghị bạn đọc chú ý đúng hai chữ "sơ bộ". Ngày 2/9/2026, hai chữ đó được gỡ bỏ. Bài này thuật lại điều đã được xác nhận, điều vẫn chưa được kiểm chứng, và vì sao phần đáng đọc nhất lại không nằm ở bảng điểm.
OpenAI công bố gì
Ngày 2/9/2026, OpenAI cho biết Astra là mô hình đầu tiên của hãng vượt ngưỡng "Critical" về năng lực an ninh mạng trong Preparedness Framework — khung tự đánh giá rủi ro do chính OpenAI soạn. Đây là bậc cao nhất trong khung, và chưa mô hình nào của hãng từng được xếp vào đó.
Cần nói rõ ngay từ đầu về nguồn: Locaith không truy cập được hai trang công bố gốc của OpenAI trong phiên làm việc này — máy chủ trả về lỗi 403. Toàn bộ số liệu dưới đây lấy từ các bản tin chuyên ngành đọc ngày 3/9/2026, và chúng tôi đã đối chiếu ba nguồn độc lập cho từng con số chính. Đây là tường thuật lại số liệu do OpenAI tự công bố, không phải đo lường độc lập, và cũng không phải bản đọc trực tiếp tài liệu gốc.
"Critical" được định nghĩa thế nào
Theo định nghĩa được các bản tin trích lại, một mô hình chạm ngưỡng Critical về an ninh mạng nếu nó làm được một trong hai việc sau mà không cần người điều khiển từng bước:
- Tự tìm ra và dựng được mã khai thác hoạt động cho lỗ hổng zero-day ở mọi mức nghiêm trọng, trong nhiều hệ thống trọng yếu đã được gia cố ngoài đời thực.
- Tự nghĩ ra và thực hiện trọn vẹn một chiến dịch tấn công mới nhằm vào mục tiêu đã gia cố, khi chỉ được giao một mục tiêu ở mức khái quát.
Điểm cần giữ tỉnh táo: đây là khung của nhà sản xuất, do nhà sản xuất tự chấm. Không có cơ quan quản lý nào phê chuẩn định nghĩa này, và không có bên thứ ba nào xác nhận Astra đáp ứng nó. Việc một công ty tự tuyên bố sản phẩm của mình nguy hiểm là điều bất thường và đáng ghi nhận — nhưng nó vẫn là tuyên bố một chiều.
Astra làm được gì trong các bài thử
| Bài thử | Kết quả | Ghi chú |
|---|---|---|
| ExploitBench | 100% | Đo việc biến lỗ hổng đã công bố thành mã khai thác chạy được |
| ExploitBench – Internal Port | Không công bố điểm số | Bộ đo nội bộ, 20 lỗ hổng V8 nghiêm trọng công bố khoảng 6–8/2026, dựng riêng để loại nghi ngờ mô hình đã học thuộc đề |
| Lỗi zero-day tự phát hiện | 2 | Tìm ra trong lúc dựng chuỗi khai thác; OpenAI nói đã báo nhà bảo trì |
| Trình duyệt đã gia cố | Thoát hộp cát hoàn chỉnh | Ghép nhiều lỗ hổng mới thành chuỗi, chạy được lệnh trên máy chủ khi trình duyệt mở một tệp HTML dọn sẵn |
| Hệ điều hành đã gia cố | Leo thang đặc quyền tới root | Ghép nhiều lỗi, đi từ người dùng thường lên quyền cao nhất |
Nguồn: tổng hợp từ Security Boulevard, Security Affairs và Trending Topics, đọc 3/9/2026. Tất cả đều thuật lại số liệu OpenAI tự công bố.
Hai dòng cuối bảng là phần đáng chú ý hơn cả điểm số. Chúng không mô tả một mô hình trả lời câu hỏi về bảo mật, mà mô tả một mô hình tự đi hết một chuỗi tấn công: tìm lỗi, ghép lỗi, và đạt tới quyền điều khiển. Khoảng cách giữa "biết về lỗ hổng" và "khai thác được lỗ hổng" là khoảng cách mà giới an ninh mạng vẫn dựa vào để có thời gian vá.
Mặt kia của bảng điểm: các con số về kiềm chế
Cùng lúc công bố năng lực, OpenAI cũng công bố mức độ mô hình từ chối làm việc xấu. Đây là phần thường bị bỏ qua khi tin tức được rút gọn:
| Phép đo | Astra | GPT-5.6 Sol |
|---|---|---|
| Tỷ lệ từ chối yêu cầu hỗ trợ tấn công mạng | 91,5% | 59% |
| Tỷ lệ cắn "mồi nhử" tấn công môi trường thử | 0% | 56% |
Nguồn: Security Affairs và Trending Topics, đọc 3/9/2026. Số của nhà sản xuất.
Con số 91,5% nghe cao, nhưng hãy đọc phần bù: cứ khoảng 12 yêu cầu độc hại thì vẫn có 1 yêu cầu lọt qua. Với một mô hình được chính hãng xếp vào bậc rủi ro cao nhất, đó không phải tỷ lệ đủ để yên tâm — và đó có lẽ chính là lý do OpenAI không mở bán phần năng lực này. Ở chiều ngược lại, mức 0% trong bài thử mồi nhử là bước nhảy thật so với 56%.
OpenAI cũng thừa nhận một cái giá: các lớp bảo vệ có thể chặn nhầm công việc nghiên cứu bảo mật hợp pháp khi nó trông giống hành vi tấn công. Đây là sự đánh đổi có thật, không phải chi tiết phụ — người làm phòng thủ và người tấn công gõ những câu lệnh rất giống nhau.
Tin thật nằm ở chỗ: mô hình không được bán
Astra chưa phát hành rộng rãi. Theo tường thuật, việc huấn luyện từng bị tạm dừng và ngày ra mắt bị lùi vài tuần trong tháng 8/2026 để gia cố các lớp bảo vệ; đợt huấn luyện tăng cường quy mô lớn được nối lại ngày 28/8/2026. Khi mở, phần năng lực an ninh mạng sẽ đi trước cho một nhóm alpha nhỏ, rồi mở rộng dần qua chương trình Daybreak Blue — chỉ dành cho mục đích phòng thủ.
Chi tiết này khép lại một mạch tin Locaith theo từ giữa tháng 8: ngày 18/8/2026 chúng tôi đưa tin đợt huấn luyện tăng cường biên giới lớn nhất của OpenAI vẫn đang tạm dừng. Nay đã rõ nó dừng bao lâu và vì sao — và kết quả của nó là mô hình đang bàn tới.
Cùng ngày 2/9/2026, Google làm gần như y hệt. Hãng phát hành Gemini 3.8 Flash Cyber — cùng một mô hình lõi với bản thường, chỉ khác ở chỗ nới các lớp chặn để phục vụ nghiên cứu lỗ hổng — và không bán rộng rãi. Muốn dùng phải qua chương trình Fairwind, xét duyệt từng trường hợp, chỉ mở cho cơ quan chính phủ, đơn vị vận hành hạ tầng trọng yếu và người bảo trì phần mềm.
Hai phòng thí nghiệm hàng đầu, trong cùng một ngày, đưa ra cùng một kết luận: năng lực tấn công mạng ở mức biên giới sẽ không được bán đại trà. Ranh giới không còn nằm ở chỗ mô hình làm được gì — mà ở chỗ ai được phép chạm vào. Đây là lần đầu tiên ranh giới ấy hiện ra rõ đến vậy ở cả hai hãng cùng lúc.
Những gì vẫn chưa biết
- Không có kiểm chứng độc lập. Mọi con số đều do OpenAI công bố. Không có phòng thí nghiệm, cơ quan hay nhóm nghiên cứu bên ngoài nào chạy lại được, vì mô hình chưa mở.
- Hai lỗi zero-day không có mã CVE công khai. Các bản tin không nêu phần mềm nào, ngày báo cáo, hay tình trạng đã vá. Không thể xác nhận mức độ nghiêm trọng thực tế.
- Không rõ ngày ra mắt và giá. "Sắp tới" là toàn bộ những gì được nói.
- Không rõ tiêu chí xét duyệt Daybreak Blue. Ai được vào, ai bị loại, và ai giám sát quyết định đó — chưa có thông tin.
Ba việc doanh nghiệp Việt Nam nên làm
- Đo thời gian vá của chính mình, trước khi nghĩ đến việc mua gì. Điều thay đổi trong tin này không phải là có một mô hình đáng sợ, mà là quãng đường từ "lỗ hổng được công bố" đến "có mã khai thác chạy được" đang bị máy móc rút ngắn. Hãy mở nhật ký sáu tháng gần nhất và tính con số thật: trung bình bao nhiêu ngày từ lúc một lỗi nghiêm trọng được công bố đến lúc hệ thống của bạn được vá? Nếu con số đó tính bằng tuần, đó mới là rủi ro cụ thể của bạn — không phải Astra.
- Đừng chờ được cấp quyền vào các chương trình này. Cả Daybreak Blue lẫn Fairwind đều nhắm vào cơ quan chính phủ, hạ tầng trọng yếu và nhà bảo trì phần mềm. Phần lớn doanh nghiệp Việt Nam không thuộc diện đó, và việc lên kế hoạch dựa trên giả định sẽ được cấp quyền là lãng phí thời gian. Những gì làm được ngay vẫn là việc cũ: quản lý bản vá, xác thực hai lớp, phân tách quyền, sao lưu có kiểm thử phục hồi.
- Cẩn thận với hai kiểu suy diễn ngược nhau. Kiểu thứ nhất: "AI sắp hack tất cả, phải mua ngay giải pháp X" — đây là luận điệu bán hàng, và tin này không chứng minh điều đó. Kiểu thứ hai: "mô hình chưa mở nên không liên quan đến tôi" — cũng sai, vì năng lực đã được chứng minh là tồn tại, và không có gì bảo đảm chỉ một phòng thí nghiệm có nó. Vị trí đúng nằm giữa: coi đây là tín hiệu để siết kỷ luật vá lỗi, không phải để đổi ngân sách.
Nguồn:
- Security Boulevard — OpenAI Reveals Astra, Its First AI Model to Reach "Critical" Cybersecurity Risk Threshold — nguồn cho xếp loại Critical, điểm ExploitBench 100%, tỷ lệ từ chối 91,5% so với 59%, bộ đo nội bộ 20 lỗ hổng, việc tạm dừng huấn luyện và lộ trình Daybreak Blue, đọc 3/9/2026
- Security Affairs — OpenAI Astra Brings Autonomous Zero-Day Exploitation to AI — nguồn cho chuỗi thoát hộp cát trình duyệt, chuỗi leo thang đặc quyền tới root, tỷ lệ cắn mồi nhử 0% so với 56%, và mốc nối lại huấn luyện ngày 28/8/2026, đọc 3/9/2026
- Trending Topics — Astra: OpenAI Classifies Its Upcoming Model as "Critical" for Cybersecurity — nguồn đối chiếu độc lập cho định nghĩa ngưỡng Critical, hai lỗi zero-day trên V8 và cơ chế mở quyền theo giai đoạn, đọc 3/9/2026
- Locaith — bài ngày 19/8/2026 về việc OpenAI tạm dừng huấn luyện tăng cường và chi phí giám sát tăng khoảng 20%, và bài ngày 7/8/2026 về việc Astra giải mười bài toán mở — nguồn cho phần đối chiếu với những gì chúng tôi đã đưa tin trước đó
Locaith không đọc được tài liệu gốc của OpenAI khi viết bài này. Hai trang công bố tại openai.com đều trả về lỗi 403 trong phiên làm việc ngày 3/9/2026, nên toàn bộ số liệu ở đây là tường thuật qua báo chí chuyên ngành, đã đối chiếu chéo ba nguồn độc lập cho từng con số chính. Mọi con số đều do OpenAI tự công bố và chưa có kiểm chứng độc lập — không thể có, vì mô hình chưa mở cho bên ngoài. Locaith chưa và không thể chạy thử Astra. Bảng điểm ExploitBench – Internal Port không được công bố con số cụ thể, nên ô tương ứng để trống thay vì suy đoán. Hai lỗi zero-day chưa có mã CVE công khai nên không thể xác minh tình trạng vá. Ba khuyến nghị ở cuối bài là quan điểm riêng của Locaith. Ảnh bìa do Locaith tự dựng từ số liệu trong bài. Biên soạn và phân tích bởi Ban Biên Tập Locaith, 3/9/2026.