Meta Muse Glimmer: Mô Hình 30B Mã Nguồn Mở Chạy Trên Một GPU Máy Bàn

Ngày 10/8/2026, Meta phát hành Muse Glimmer — mô hình đa phương thức khoảng 29,6 tỷ tham số theo giấy phép Apache 2.0, tải tự do trên Hugging Face. Điểm đáng chú ý không phải điểm benchmark mà là ngưỡng phần cứng: bản lượng tử hoá 4-bit gọn dưới 20GB, chạy được trên một GPU máy bàn hoặc MacBook. Cần

Ngày 10/8/2026, Meta phát hành Muse Glimmer — mô hình đa phương thức khoảng 29,6 tỷ tham số theo giấy phép Apache 2.0, tải tự do trên Hugging Face. Điều đáng chú ý ở đây không nằm ở bảng điểm benchmark, mà ở ngưỡng phần cứng: bản lượng tử hoá 4-bit gọn dưới 20GB và chạy được trên một chiếc MacBook hoặc một GPU máy bàn. Đó là một thay đổi có ý nghĩa thực tế với những tổ chức không thể gửi dữ liệu ra ngoài.

1. Meta Quay Lại Với Trọng Số Mở — Và Lần Này Là Apache 2.0

Chi tiết dễ bị bỏ qua nhất trong thông báo này lại là chi tiết quan trọng nhất: giấy phép. Các bản Llama trước đây của Meta đi kèm giấy phép riêng có điều kiện — đáng chú ý nhất là ràng buộc với các nền tảng vượt ngưỡng người dùng hàng tháng. Muse Glimmer thì dùng thẳng Apache 2.0, một giấy phép mở tiêu chuẩn cho phép dùng thương mại, sửa đổi và phân phối lại mà không kèm điều kiện về quy mô.

Trong bài luận đi kèm bản phát hành, Mark Zuckerberg đặt lựa chọn này vào một lập luận rộng hơn: "Thay vì tập trung hoá siêu trí tuệ, chúng ta nên phân phối nó rộng rãi và trao cho mỗi người khả năng điều khiển nó."

"Mã nguồn mở" hay "mở trọng số"?

Nên gọi cho đúng: đây là mở trọng số (open-weight). Trọng số được phát hành theo Apache 2.0 — mở thật, không có điều kiện ẩn. Nhưng dữ liệu huấn luyện và mã huấn luyện không được công bố, nên theo định nghĩa mã nguồn mở truyền thống thì chưa đủ điều kiện. Đây là lý do nhiều báo quốc tế đặt cụm từ này trong ngoặc kép. Với phần lớn doanh nghiệp, khác biệt về mặt pháp lý sử dụng là không đáng kể; với ai cần kiểm toán nguồn gốc dữ liệu thì lại là khác biệt quyết định.

2. Ngưỡng Phần Cứng — Phần Thú Vị Nhất, Và Phần Dễ Bị Nói Quá

Meta thiết kế Muse Glimmer để chạy cục bộ, và đưa ra các con số cụ thể: bản lượng tử hoá xuống khoảng 4-bit gọn dưới 20GB, cần tổng bộ nhớ khoảng 24–32GB. Meta cho biết đã thử nghiệm trên MacBook M4-Max, M5-Max và card RTX-5090. Về tốc độ, kỹ thuật giải mã suy đoán với bộ nháp DFlash cho mức tăng 3,1 lần trên RTX-5090, 1,8 lần trên M5-Max và 1,5 lần trên M4-Max.

Nhưng có một chi tiết nằm trong tài liệu kỹ thuật mà các bản tin hầu như không nhắc: bản BF16 đầy đủ vẫn cần một GPU H100 80GB để suy luận, và fine-tune LoRA cũng đòi hỏi đúng cấu hình đó. Nói cách khác, "chạy trên laptop" là đúng — với điều kiện đã nén. Việc nén luôn đánh đổi chất lượng ít nhiều, và mức đánh đổi cụ thể cho tiếng Việt thì chưa ai đo.

3. Kiến Trúc Và Thông Số

Hạng mục Thông số Ghi chú
Tham số ~29,6 tỷ Gồm bộ mã hoá thị giác ~2 tỷ + phần văn bản ~28 tỷ
Kiến trúc Dense Transformer 52 lớp, hidden 6.656, GQA tỉ lệ 16:1
Cơ chế attention Local + global xen kẽ Cửa sổ trượt 2.048 token
Độ dài context 131.072+ Theo thẻ mô hình — blog ra mắt lại ghi 32.768
Ngôn ngữ Hơn 100 Meta lưu ý chất lượng không đồng đều
Giấy phép Apache 2.0 Cho phép dùng thương mại

Dòng "độ dài context" trong bảng trên cần một lời giải thích. Hai tài liệu của chính Meta ghi khác nhau: thẻ mô hình trên Hugging Face ghi 131.072+ token, trong khi bài blog ra mắt liệt kê cửa sổ context 32.768 token với giới hạn sinh 8.192 token. Cách hiểu hợp lý nhất là 131K là giới hạn kiến trúc còn 32K là cấu hình phục vụ mặc định trong ví dụ triển khai — nhưng Meta không nói rõ như vậy ở bất kỳ đâu. Nếu bài toán của bạn phụ thuộc vào context dài, hãy tự đo trước khi cam kết kiến trúc.

Bảng đánh giá của Meta so sánh Muse Glimmer-30B (chế độ High Reasoning) với Gemma4-31B và Qwen3.6-27B (chế độ Thinking) trên 24 bộ benchmark, chia theo năm nhóm: agentic tổng quát, lập trình agentic, đa phương thức, an toàn, và năng lực chung cùng suy luận. Muse Glimmer dẫn đầu ở MCP Atlas 75,5 (so với 54,2 và 62,5), SWE-Bench Pro 51,2 (36,9 và 50,2), Charxiv Reasoning 78,8 (77,7 và 78,4) và AIME 2026 94,7 (89,2 và 94,1); ngược lại Qwen3.6-27B dẫn ở tám dòng, gồm SWE-Bench Verified 77,2, TerminalBench 2.1 60,7, OSWorld-Verified 75,6 và GDPval-AA 1141.
Bảng đánh giá đầy đủ do chính Meta công bố — nguồn của bốn con số trích trong bài. Đọc trọn 24 dòng sẽ thấy bức tranh cân bằng hơn: Muse Glimmer bỏ xa đối thủ ở nhóm agentic, nhưng Qwen3.6-27B mới là mô hình dẫn đầu ở tám dòng, trong đó có SWE-Bench Verified, TerminalBench 2.1 và OSWorld-Verified. Ảnh: Meta AI Research.

4. Điểm Benchmark — Và Ai Là Người Chấm

Meta so sánh Muse Glimmer với hai mô hình cùng phân khúc là Gemma4-31BQwen3.6-27B:

Bộ đánh giá Muse Glimmer Đối thủ cùng cỡ
MCP Atlas (agentic) 75,5 54,2 – 62,5
SWE-Bench Pro (lập trình) 51,2 36,9 – 50,2
Charxiv Reasoning (đa phương thức) 78,8 77,7 – 78,4
AIME 2026 (toán) 94,7 89,2 – 94,1

Đọc bảng này theo chiều ngang sẽ thấy một hình mẫu rõ: khoảng cách lớn nằm ở nhóm agentic — MCP Atlas hơn tới 13 điểm so với đối thủ tốt nhất. Ở nhóm đa phương thức và toán, chênh lệch chỉ 0,4 đến 0,6 điểm, tức là gần như ngang nhau. Điều đó phù hợp với định vị Meta đưa ra: đây là mô hình tối ưu cho gọi công cụ và tác vụ nhiều bước, không phải cho suy luận học thuật.

Ba lưu ý về số liệu

  • Toàn bộ điểm số trên là do Meta tự công bố (vendor-published), lấy từ blog nghiên cứu và tài liệu chính thức.
  • Tại thời điểm viết bài, chưa có bên thứ ba lặp lại độc lập. Vì trọng số đã mở nên việc lặp lại là khả thi — chỉ là chưa xảy ra.
  • Nhà phát hành luôn chọn bộ đối chiếu có lợi cho mình. Việc Gemma4-31B và Qwen3.6-27B được chọn không có nghĩa đó là hai đối thủ mạnh nhất trong phân khúc.

5. Quan Hệ Với Muse Spark 1.2 — Các Nguồn Nói Khác Nhau

Đây là điểm chúng tôi không xác nhận được và cần nói thẳng. Một số nguồn tin đưa rằng Zuckerberg đã xác nhận Meta sẽ mở trọng số của chính Muse Spark 1.2 — mô hình biên giới đóng của hãng — điều sẽ đưa một mô hình hàng đầu vào vùng trọng số mở. Trong khi đó, Engadget mô tả Muse Glimmer là mô hình dựa trên Spark 1.2 đóng. Hai cách diễn đạt này nói về hai chuyện khác nhau.

Bài blog nghiên cứu chính thức của Meta mà chúng tôi đọc không nêu rõ điều nào trong hai điều trên. Cho đến khi Meta công bố cụ thể, nên coi lộ trình Spark 1.2 là chưa xác nhận.

6. Doanh Nghiệp Việt Nam Nên Nhìn Gì Từ Đây

Giá trị thực tế của một mô hình chạy cục bộ không nằm ở bảng điểm, mà ở chỗ dữ liệu nằm đâu:

Cần nói rõ để tránh kỳ vọng sai: triển khai một mô hình cục bộ là một dự án kỹ thuật, không phải một lần cài đặt. Nếu nhu cầu của tổ chức bạn cụ thể hơn — chuẩn hoá văn bản hành chính theo Nghị định 30/2020/NĐ-CP, hay dựng nhanh bộ CV, brochure, slide — thì công cụ chuyên biệt như Compose WordDesign Studio của Locaith cho kết quả ngay mà không cần đội vận hành hạ tầng riêng.

Nguồn tham khảo:

Lưu ý về số liệu: mọi điểm benchmark trong bài là do Meta tự công bố, chưa được bên thứ ba lặp lại độc lập tại thời điểm viết. Có hai mâu thuẫn giữa các nguồn mà chúng tôi giữ nguyên thay vì chọn một bên: (1) độ dài context — thẻ mô hình ghi 131.072+, blog ra mắt ghi 32.768; (2) quan hệ với Muse Spark 1.2 — một số nguồn nói Meta sẽ mở trọng số Spark 1.2, Engadget nói Glimmer dựa trên Spark 1.2, còn blog chính thức không nêu điều nào. Chúng tôi không kiểm thử độc lập mô hình này với tiếng Việt. Tổng hợp và phân tích bởi Ban Biên Tập Locaith, ngày 12/8/2026.

Messenger