OpenAI Quy Cho Moonshot Vụ Moi Suy Luận Ẩn, Qua Kẽ Hở Claude Và Gemini Cũng Từng Mắc
Ngày 30/9/2026, OpenAI công bố đã chặn một chiến dịch moi phần suy luận ẩn của mô hình, đỉnh điểm là 16.000 yêu cầu từ hơn 4.000 tài khoản trong hai ngày 24–25/7, và quy một cụm cốt lõi cho những người liên quan tới Moonshot AI, hãng làm Kimi, nhưng không nêu bằng chứng. Kỹ thuật OpenAI mô tả là một
Ngày 30/9/2026, OpenAI nói đã chặn một chiến dịch có tổ chức nhằm moi phần suy luận ẩn của mô hình, và quy một cụm cốt lõi cho những người liên quan tới Moonshot AI, hãng làm Kimi. Phần quy trách nhiệm không kèm bằng chứng. Phần kiểm chứng được nằm ở chỗ khác: kỹ thuật được mô tả là một lỗ hổng mà cả ba hãng lớn cùng mắc, và nó khiến khoá API trong các log công khai đọc được, kể cả khi người đăng đã xoá chúng khỏi phần chữ hiển thị.
OpenAI nói gì
Theo bài đăng trên mục An ninh của OpenAI, hoạt động bắt đầu ngày 1/7/2026 với lưu lượng thấp. Ngày 24 và 25/7 lưu lượng tăng vọt: 16.000 yêu cầu theo một mẫu trích xuất, từ hơn 4.000 người dùng. Điều tra tiếp cho thấy các mẫu câu lệnh liên quan trải trên một cụm hơn 15.000 người dùng, và tới ngày 28/7 OpenAI chặn được hoàn toàn. Chú thích cuối bài ghi rằng các con số này là số lần thử trích xuất, không nhất thiết là số lần thành công.
Kỹ thuật OpenAI mô tả là "sao chép phần suy luận đã mã hoá từ một cuộc hội thoại, rồi yêu cầu một mô hình ở cuộc hội thoại khác giải mã và chép lại nội dung suy luận ẩn". OpenAI khẳng định kẻ tấn công không phá được mã hoá, không xâm nhập cơ sở dữ liệu và không đọc được hội thoại đã lưu của người dùng.
Về người đứng sau, OpenAI viết: "Không rõ liệu mọi người vận hành mà chúng tôi quan sát được trong thời gian này có xuất phát từ một chủ thể duy nhất hay không. Tuy vậy, chúng tôi quy một cụm hoạt động cốt lõi cho các cá nhân có liên quan tới Moonshot AI, nhà phát triển Kimi." Bài không nói dựa vào dấu hiệu nào để kết luận, không nói mô hình nào bị nhắm, và không nói bao nhiêu suy luận đã bị lấy ra. Trong các bản tin Locaith đọc đến ngày 4/10/2026, chưa thấy Moonshot phản hồi chính thức.
Các biện pháp OpenAI liệt kê: cấm hoặc hạn chế tài khoản gian lận, siết khâu đăng ký, đóng con đường cho phép "người đã có trong tay khối suy luận mã hoá của người dùng khác phát lại nó và lấy lại nội dung", thêm bước kiểm tra để giữ lại đầu ra có thể làm lộ suy luận, làm việc với các dịch vụ bên thứ ba mà hoạt động đi qua, và chia sẻ thông tin qua Frontier Model Forum cùng các kênh của chính phủ.
Suy luận ẩn và khối mã hoá là gì
Các mô hình suy luận "nghĩ" một đoạn dài trước khi trả lời. Anthropic, OpenAI và Google đều không còn trả phần suy nghĩ này dưới dạng chữ thường. API trả về một khối đã mã hoá (với Claude là trường signature, với OpenAI là encrypted_content), và ứng dụng phải gửi lại nguyên khối đó ở lượt sau để mô hình nhớ mình đã nghĩ gì. Cách này giúp nhà cung cấp khỏi phải lưu suy luận trên máy chủ, nhưng đồng nghĩa với việc khối mã hoá nằm trong tay người dùng, trong log và trong các tệp phiên làm việc.
Kẽ hở nằm ở đâu
Ở đoạn nhắc tới "các nhà nghiên cứu an ninh độc lập", bài của OpenAI dẫn link tới bài báo "Stealing Reasoning Traces from Proprietary LLM APIs", đăng lên arXiv ngày 10/8/2026. Tám tác giả đến từ MATS, Viện ELLIS Tübingen, Viện Max Planck về Hệ thống Thông minh, Đại học Tübingen, AI Sequrity Company và Snyk. Bài báo kế thừa một phát hiện của Green công bố tháng 5/2026 rằng khối suy luận có thể đem ra khỏi ngữ cảnh gốc. Theo bài báo, khi đó các nhà cung cấp "không thừa nhận bất kỳ hệ quả an ninh nào".
Nhóm Tübingen đi xa hơn. Thử nghiệm của họ cho thấy mỗi nhà cung cấp dường như dùng một khoá chung cho mọi khối, nên khối suy luận dùng lẫn được giữa các phiên, giữa các người dùng và giữa các mô hình của cùng một hãng (có ngoại lệ: theo Bảng 1 của bài báo, khối của Claude Fable 5 không đem sang mô hình khác được). Mô hình mạnh nhất được huấn luyện kỹ để không chép lại suy luận của mình, nhưng mô hình rẻ hơn cùng hãng thì không. Cách tấn công vì thế rất đơn giản: lấy khối suy luận mã hoá của Claude Opus 4.8, đặt vào một yêu cầu gửi Claude Haiku 4.5, rồi bảo Haiku chép lại phần suy luận "đính kèm lượt này". Haiku giải mã và chép ra suy luận của Opus. Với OpenAI, nhóm dùng GPT-5.6 Luna làm bộ giải mã; với Google là Gemini Robotics 1.6.
Vì không có bản suy luận gốc để so, nhóm kiểm độ trung thực bằng số token: trên 120 bài lập trình Codeforces, độ dài phần giải mã được bám sát số token suy luận mà API tính tiền. Theo ước tính của nhóm, giải mã 10.000 khối suy luận bằng Haiku 4.5 tốn khoảng 720 USD theo giá niêm yết. Toàn bộ thí nghiệm tốn khoảng 30.000 USD tiền API.
Bài báo nêu bốn hướng khai thác:
- Chưng cất: lấy được suy luận thật của mô hình mạnh nhất mà không cần bẻ khoá chính mô hình đó. Nếu khối mã hoá đã có sẵn trong dữ liệu công khai, kẻ tấn công thậm chí không cần gọi mô hình mạnh, nên hệ thống giám sát đặt ở mô hình đó không thấy gì.
- Lấy bí mật của người khác từ log và phiên làm việc được đăng công khai (phần dưới).
- Lấy thông tin nguy hại: mô hình có thể suy nghĩ kỹ về một chủ đề nguy hại rồi chỉ đưa ra câu trả lời vô hại. Nhóm cho Opus 4.8 một câu hỏi về cách trộm xe, câu trả lời chỉ nói nhà sản xuất nên làm gì, nhưng phần suy luận giải mã ra chứa chi tiết về lỗ hổng.
- Chèn lệnh vô hình: một khối suy luận có thể mang theo một chỉ dẫn độc hại mà người dùng và công cụ giám sát không đọc được. Trong thử nghiệm, nhóm cài vào một phiên Claude Code của Opus 4.7 một khối suy luận do Haiku 4.5 tạo, chứa lệnh tải tệp lên máy chủ của kẻ tấn công; khi phiên được chạy tiếp, Opus 4.7 làm theo sau mỗi lần sửa tệp.
Một phát hiện phụ: nhóm thấy nhiều trường hợp bản tóm tắt suy luận mà API trả về không khớp với suy luận thật đọc được sau khi giải mã.
62 khoá API trong các log công khai
Đây là phần liên quan trực tiếp tới người làm phần mềm. Nhóm thu 6.708 phiên làm việc của tác tử AI (Claude, GPT, Gemini) được đăng công khai trên GitHub và Hugging Face mà vẫn còn khối suy luận, rồi giải mã được 315.320 khối. Có 1.028 khối (0,3%) chứa ít nhất một thông tin nhạy cảm thật; tính theo phiên là 328 trên 6.708 phiên (4,9%).
| Loại (chỉ phiên của người dùng thật, đã bỏ trùng) | Số giá trị | Chỉ có trong suy luận ẩn |
|---|---|---|
| Khoá API | 62 | 11 |
| Mật khẩu | 33 | 2 |
| Access token | 24 | 3 |
| Khoá riêng (private key) | 7 | 0 |
| Email cá nhân | 30 | 3 |
| Họ tên | 130 | 4 |
| Địa chỉ | 36 | 5 |
| Tổng mọi loại | 704 | 64 |
Số liệu lấy từ Bảng 4 của bài báo, do nhóm tác giả tự đo và dùng một mô hình AI để phân loại. Con số "182 thông tin đăng nhập" trong phần tóm tắt của bài báo tính cả dữ liệu từ các bộ benchmark; bảng trên chỉ giữ phiên của người dùng thật.
Đọc bảng cho đúng: phần lớn bí mật cũng đã nằm sẵn ở phần chữ hiển thị của log, tức người đăng đã để lộ chúng từ trước. Chỉ 64 trên 704 giá trị (khoảng 9%) nằm riêng trong phần suy luận ẩn. Nhưng nhóm tác giả chỉ ra điều đáng lo hơn con số: kể cả khi mọi người dùng đã xoá sạch bí mật ở phần chữ đọc được, 62 khoá API kia vẫn nằm nguyên trong các khối suy luận, và người dùng không có cách nào tự đọc khối mã hoá để kiểm tra. Một tình huống lặp lại nhiều lần: người dùng nhờ tác tử "dọn dẹp" hay ẩn danh hoá phiên làm việc trước khi đăng, mô hình đọc lại toàn bộ lịch sử và chép lại chính các giá trị cần xoá vào phần suy luận ẩn.
Nhóm cho biết đã xoá mọi bí mật thu được ngay sau bước đếm, và đã báo cho các nhà cung cấp mô hình, Microsoft và Hugging Face trước khi công bố.
Các hãng đã vá đến đâu
Theo bài báo, "mọi nhà cung cấp mô hình đã xác nhận nhận được báo cáo, và sau đó chúng tôi không thể chạy lại cùng các tấn công". Từ tháng 8/2026, kết quả ở Hình 1 không còn tái hiện được. Phía OpenAI, bài ngày 30/9 nói đã đóng con đường phát lại khối suy luận của người khác.
Phía Anthropic, ghi chú phát hành ngày 1/9/2026 kèm Claude Fable 5.1 có hai thay đổi khớp với hai biện pháp bài báo đề xuất (gắn khối suy luận vào ngữ cảnh gốc và ngăn chuyển khối giữa các mô hình):
- Khối suy luận của Fable 5.1 chỉ được giữ cho chính mô hình đó hoặc mô hình mới hơn. Mô hình cũ không đọc được, và API bỏ khối đó đi nếu nó bị gửi sang mô hình cũ hơn.
- Với tài khoản tạo từ ngày 31/8/2026, phát lại một khối suy luận sau khi system prompt, danh sách công cụ hay một tin nhắn trước đó đã bị sửa sẽ nhận lỗi 400. Beta header
thinking-binding-controls-2026-08-01cho biết khối nào bị bỏ hoặc không khớp.
Ghi chú phát hành không nói đây là phản hồi cho bài nghiên cứu. Đây cũng là những thay đổi gây lỗi mà Locaith đã nêu trong bài về Fable 5.1 và Sonnet 5.5. Về Google, Locaith chưa tìm thấy công bố nào.
Moonshot và chuyện chưng cất
Đây không phải lần đầu Moonshot bị nêu tên. Ngày 23/2/2026, Anthropic nói DeepSeek, Moonshot và MiniMax đã tạo khoảng 24.000 tài khoản gian lận và hơn 16 triệu lượt trao đổi với Claude để lấy năng lực về huấn luyện mô hình của mình. Phần của Moonshot là hơn 3,4 triệu lượt, và theo Anthropic, ở giai đoạn sau Moonshot nhắm cụ thể vào việc dựng lại phần suy luận của Claude.
Bài báo Tübingen có một phụ lục mang tên "Con voi trong phòng: các mô hình mở gần đây có được chưng cất bằng suy luận của mô hình độc quyền không?". Khi chèn một đoạn ngắn suy luận Opus 4.8 đã giải mã vào đầu phần suy luận của Kimi K3, câu trả lời của Kimi K3 đổi văn phong sang gần giống câu trả lời của Opus, có trường hợp gần như trùng khớp. Kimi K3 và GLM-5.2 cũng "đoán" văn bản suy luận của Opus và GPT-5.6 Sol dễ hơn hẳn so với Inkling hay DeepSeek-V4-Flash; DeepSeek-V3.1 và Inkling không cho thấy thay đổi tương tự. Nhưng chính nhóm tác giả viết rằng phân tích này "không thể xác lập quan hệ nhân quả về chưng cất", kết quả là "gợi ý nhưng chưa kết luận được", và làm trên một bộ bài nhỏ sau khi lỗ hổng đã được vá.
Như vậy có ba nguồn cùng chỉ về một hướng: lời của Anthropic tháng 2, lời của OpenAI tháng 9 và một phân tích hành vi độc lập. Hai nguồn đầu là khẳng định của công ty cạnh tranh, không kèm dữ liệu để người ngoài kiểm tra. Nguồn thứ ba tự nói nó không phải bằng chứng.
Doanh nghiệp và lập trình viên Việt Nam nên làm gì
Phần tranh chấp giữa OpenAI và Moonshot không ảnh hưởng trực tiếp tới người dùng ở Việt Nam. Phần lỗ hổng thì có, với bất kỳ ai đang chạy Claude Code, Codex hay tự gọi API có bật suy luận:
- Đừng đăng log thô của tác tử lên GitHub, Hugging Face hay nhóm chat chung. Nếu cần chia sẻ, xoá hẳn các trường suy luận mã hoá (
signature,encrypted_contentvà trường tương ứng của Gemini), chứ không chỉ xoá phần chữ đọc được. Đây là khuyến nghị của chính nhóm nghiên cứu. - Đã lỡ đăng thì đổi khoá. Mọi khoá API, token, mật khẩu từng xuất hiện trong phiên làm việc với tác tử nên được thu hồi và cấp lại, bất kể các hãng đã vá hay chưa, vì phần lớn chúng cũng nằm ở phần chữ hiển thị.
- Đừng nhờ tác tử tự "làm sạch" log trước khi đăng. Như đã nói ở trên, đó chính là lúc mô hình chép bí mật vào phần suy luận ẩn.
- Không nạp lại phiên làm việc của người khác vào tác tử của mình, kể cả từ kho mã công khai. Một khối suy luận có thể mang lệnh ẩn mà bạn không đọc được.
- Không coi khối suy luận mã hoá là nơi cất giữ bí mật. Bài báo kết luận rằng mô hình nào xử lý được khối đó thì về nguyên tắc cũng có thể bị dụ nói ra nội dung của nó.
- Nếu ứng dụng của bạn sửa lịch sử hội thoại hoặc đổi mô hình giữa chừng trên Claude, hãy theo dõi lỗi 400 và trường
input_transformations, vì các thay đổi vá lỗi ở trên có thể làm mã cũ ngừng chạy.
Nguồn:
- OpenAI — Disrupting a coordinated model-distillation campaign, 30/9/2026 — mốc thời gian, số yêu cầu, kỹ thuật, câu quy trách nhiệm, các biện pháp; ảnh bìa
- Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping, Andriushchenko — Stealing Reasoning Traces from Proprietary LLM APIs, arXiv 2608.09867v1, 10/8/2026 — cơ chế tấn công, Hình 1, Bảng 1, Bảng 4, phụ lục B về Kimi K3, mục công bố có trách nhiệm
- Anthropic — Detecting and preventing distillation attacks, 23/2/2026 — 24.000 tài khoản, 16 triệu lượt, phần của Moonshot
- Claude Platform — Release notes feed, các mục 1/9/2026 và 14/9/2026 — ràng buộc khối suy luận của Fable 5.1, beta thinking-binding-controls
- BankInfoSecurity — OpenAI Accuses Moonshot AI of Coordinated Model Distillation, Emilia David, 30/9/2026 — bản tin không có phản hồi của Moonshot
Bài của OpenAI và bài báo arXiv được Locaith đọc trực tiếp từ bản gốc ngày 4/10/2026; các câu trích do Locaith dịch từ tiếng Anh. Phần quy trách nhiệm cho Moonshot là khẳng định của OpenAI, chưa được kiểm chứng độc lập. Số liệu về bí mật bị lộ do nhóm tác giả tự đo, bài báo chưa qua bình duyệt. Ảnh bìa: ảnh minh hoạ của bài công bố trên openai.com, Locaith đã xoá dòng chữ tiêu đề và cắt về tỉ lệ 1200×630. Ảnh trong bài: Hình 1 của bài báo arXiv 2608.09867. Biên soạn và phân tích bởi Ban Biên Tập Locaith, 04/10/2026.