Sakana AI Fugu Ultra v2: Thắng 5 Trên 8 Phép Đo Mà Không Có Mô Hình Tiên Phong Nào Trong Tay

Ngày 11/9/2026, Sakana AI phát hành Fugu Max và Fugu Ultra v2 — không phải mô hình đơn lẻ mà là bộ điều phối đã qua huấn luyện, tự chọn mô hình phù hợp trong một kho có cả mô hình mở lẫn mô hình đóng. Trên bảng điểm tự công bố, Ultra v2 đứng đầu hoặc đồng hạng nhất ở 5 trong 8 phép đo, dù kho của nó

Ngày 11/9/2026, Sakana AI phát hành hai sản phẩm mà công ty không gọi là mô hình: Fugu Max và Fugu Ultra v2. Chúng là bộ điều phối — một mô hình được huấn luyện để chọn mô hình khác làm việc thay mình. Bảng điểm tự công bố của Sakana đáng đọc kỹ, cả ở chỗ họ thắng lẫn chỗ họ thua.

Ý tưởng: không thi đấu, mà phân công

Cách làm mặc định của ngành cho tới nay là huấn luyện một mô hình lớn nhất có thể rồi giao mọi việc cho nó. Sakana đề xuất một hướng khác: giữ nguyên các mô hình đã có ngoài thị trường, và huấn luyện một mô hình chuyên đi phân công. Fugu đọc yêu cầu, ước lượng việc đó cần năng lực gì, rồi chuyển cho mô hình gọn nhẹ nhất đủ sức giải — và nó có thể gọi đệ quy chính nó khi việc cần chia nhỏ.

Đồ thị khái niệm với trục ngang là chi phí và trục dọc là năng lực, cho thấy đường biên do các mô hình Fugu tạo ra nằm phía trên đường biên do các mô hình đơn lẻ tạo ra
Lập luận trung tâm của Sakana, vẽ dưới dạng đồ thị chi phí – năng lực. Lưu ý: đây là hình minh hoạ khái niệm, không có số trên hai trục, không phải dữ liệu đo được. Ảnh: Sakana AI.

Kho mô hình mà Fugu điều phối gồm cả mô hình mở lẫn mô hình đóng — đây là chi tiết hay bị tường thuật sai thành "chỉ dùng mô hình mở". Sakana nêu tên dòng NVIDIA Nemotron trong kho, cùng mô hình Namazu của chính họ và bản thân Fugu Max. Danh sách đầy đủ không được công bố.

Sơ đồ cho thấy Fugu Max ở trên cùng phân nhánh xuống một hàng các biểu tượng sinh vật biển đại diện cho kho mô hình, ghi chú là mô hình đóng và mở, gồm cả Sakana Namazu và chính Fugu Max
Sơ đồ kho mô hình của Sakana. Dòng chú thích giữa hình ghi rõ "Closed & open models" — kho có cả mô hình đóng, không chỉ mô hình mở. Ảnh: Sakana AI.

Bảng điểm: thắng 5, thua 3

Sakana công bố tám phép đo, mỗi phép đo so Fugu Ultra v2 với Opus 5, Fable 5, Fable 5.1, GPT 5.6 Sol, Kimi K3 và — ở năm trong tám phép đo — GPT 6 Astra. Bảng dưới đây chép lại đúng các con số trên biểu đồ.

Phép đo Fugu Ultra v2 Opus 5 Fable 5 Fable 5.1 GPT 5.6 Sol GPT 6 Astra Kimi K3
HLE (văn bản)56,354,955,559,149,554,746,9
GDP.pdf34,324,029,827,630,719,0
Chartography48,327,329,546,245,026,6
SWEFish (của Sakana)71,862,364,266,064,269,857,4
DeepSWE74,368,869,767,472,773,067,5
ProgramBench81,082,376,882,777,685,477,8
GPQAD95,593,292,693,794,296,093,5
Toolathon80,680,674,777,874,976,5

Số do Sakana AI tự công bố, chưa có bên thứ ba dựng lại. Dấu "—" nghĩa là biểu đồ gốc không có cột đó. Locaith chép trực tiếp từ biểu đồ chính thức.

Tám biểu đồ cột so sánh Fugu Ultra v2 và v1.1 với Opus 5, Fable 5, Fable 5.1, GPT 5.6 Sol, GPT 6 Astra và Kimi K3 trên các phép đo HLE, GDP.pdf, Chartography, SWEFish, DeepSWE, ProgramBench, GPQAD và Toolathon
Toàn bộ tám phép đo Sakana công bố. Cột đỏ đậm là Fugu Ultra v2, cột đỏ nhạt là v1.1. Ba khung ProgramBench, GPQAD và HLE là nơi Ultra v2 không dẫn đầu. Ảnh: Sakana AI.

Đọc thẳng: Ultra v2 đứng đầu hoặc đồng hạng nhất ở 5 trong 8 phép đo. Khoảng cách lớn nhất nằm ở Chartography — 48,3 so với 27,3 của Opus 5 và 29,5 của Fable 5, tức gần gấp đôi — và đây là phép đo về đọc hiểu biểu đồ và dữ liệu hình ảnh. Ở GDP.pdf, phép đo về trích xuất thông tin từ tài liệu PDF dài, Ultra v2 đạt 34,3 trong khi mô hình tốt nhất còn lại là GPT 5.6 Sol với 30,7.

Ba phép đo Ultra v2 không dẫn đầu cũng nói lên điều gì đó. Ở ProgramBench và GPQAD, GPT 6 Astra đứng đầu; ở HLE bản văn bản, Fable 5.1 đạt 59,1 so với 56,3. Cả ba mô hình thắng ở đây đều là mô hình không có trong kho của Ultra v2. Nói cách khác, việc điều phối khéo thu hẹp được khoảng cách ở nhiều dạng việc, nhưng ở những việc đòi hỏi một lần suy luận sâu và liền mạch thì mô hình tiên phong vẫn hơn.

Một trong năm chiến thắng là phép đo của chính người bán.

SWEFish do Sakana xây dựng. Điều đó không làm con số 71,8 thành sai, nhưng nó thay đổi cách đọc: một phép đo nội bộ phản ánh việc nhà cung cấp coi trọng loại năng lực nào, và họ đã tối ưu theo hướng đó. Khi đối chiếu, con số đáng tin hơn là bốn phép đo bên ngoài — GDP.pdf, Chartography, DeepSWE và Toolathon — trong đó Toolathon là hoà điểm với Opus 5 chứ không phải thắng. Tính chặt, đó là ba chiến thắng rõ ràng ở phép đo bên ngoài.

Giá: một bên rõ, một bên chưa

Fugu Max có giá công bố rõ ràng: 2 USD mỗi triệu token đầu vào và 6 USD mỗi triệu token đầu ra. Sakana định vị mức này thấp hơn 40–60% so với chi phí đầu ra của Sonnet 5, GPT 5.6 Terra và Kimi K3.

Fugu Ultra v2 thì không rõ, và Locaith không muốn lấp chỗ trống này bằng phỏng đoán. Thông báo ngày 11/9 không nêu giá riêng cho bản v2; trang giá của Sakana và trang OpenRouter đều đang hiển thị mức của dòng Ultra v1.x là 5 USD đầu vào và 30 USD đầu ra, kèm ghi chú rằng phần vượt quá 272 nghìn token tính giá cao hơn nhưng không nói cao hơn bao nhiêu. Nếu bạn định lập ngân sách cho Ultra v2, hãy hỏi thẳng Sakana thay vì dựa vào con số đang hiển thị.

Hạng mục Fugu Max Fugu Ultra v2
Đầu vào (1 triệu token)2 USD5 USD (mức v1.x, chưa xác nhận cho v2)
Đầu ra (1 triệu token)6 USD30 USD (mức v1.x, chưa xác nhận cho v2)
Mốc dữ liệu huấn luyệnchưa công bố28/8/2026
Trọng sốkhông phát hànhkhông phát hành

Giá Fugu Max là số Sakana công bố. Giá Ultra v2 là mức đang hiển thị trên trang giá và OpenRouter cho dòng Ultra, không phải mức Sakana xác nhận riêng cho v2.

Chỗ cần đọc kỹ: "điều phối mô hình mở" không có nghĩa là bạn được mở

Đây là điểm dễ hiểu nhầm nhất trong toàn bộ câu chuyện. Fugu điều phối nhiều mô hình có trọng số mở, nhưng bản thân Fugu không phải sản phẩm mở. Trọng số của nó không được phát hành; dịch vụ chỉ tồn tại dưới dạng dịch vụ do Sakana vận hành. Bạn không thể tải Fugu về chạy trong hạ tầng của mình, và bạn cũng không tự chọn được mô hình nào trong kho sẽ xử lý yêu cầu của bạn.

Điều đó dẫn tới một câu hỏi vận hành cụ thể mà bất kỳ doanh nghiệp nào cũng nên đặt trước khi ký: dữ liệu của tôi sẽ đi qua những mô hình nào, và của những nhà cung cấp nào? Khi gọi trực tiếp một nhà cung cấp, bạn biết dữ liệu đi đâu. Khi gọi một bộ điều phối, dữ liệu của bạn có thể được chuyển sang bên thứ ba mà danh sách đầy đủ không được công bố. Với hồ sơ nhân sự, hợp đồng hay dữ liệu khách hàng, đây không phải chi tiết kỹ thuật nhỏ — đây là câu hỏi về tuân thủ.

Điều doanh nghiệp Việt Nam nên rút ra

Nguồn:

Toàn bộ điểm chuẩn trong bài là số do Sakana AI tự công bố; tính đến ngày đăng chưa có phòng đo độc lập nào dựng lại các kết quả này, và bài viết nêu rõ rằng SWEFish — một trong năm phép đo Sakana dẫn đầu — là phép đo nội bộ của chính Sakana. Locaith chép số trực tiếp từ biểu đồ chính thức thay vì qua bản tin trung gian. Giá của Fugu Ultra v2 chưa được Sakana công bố riêng; mức 5/30 USD nêu trong bài là mức đang hiển thị cho dòng Ultra trên trang giá và OpenRouter, và không nên coi là đã xác nhận. Đồ thị chi phí – năng lực là hình minh hoạ khái niệm không có thang số, không phải dữ liệu đo được. Có chênh lệch nhỏ về ngày: trang công bố của Sakana ghi 11/9/2026 trong khi một số bài trong ngành đề ngày 10/9/2026, nhiều khả năng do lệch múi giờ; bài này theo ngày trên trang của Sakana. Danh sách đầy đủ các mô hình trong kho chưa công bố. Các khuyến nghị cuối bài là quan điểm riêng của Locaith. Ảnh bìa, sơ đồ kho mô hình, biểu đồ điểm chuẩn và đồ thị khái niệm: Sakana AI. Biên soạn và phân tích bởi Ban Biên Tập Locaith, 13/9/2026.

Messenger