Sakana AI Fugu Ultra v2: Thắng 5 Trên 8 Phép Đo Mà Không Có Mô Hình Tiên Phong Nào Trong Tay
Ngày 11/9/2026, Sakana AI phát hành Fugu Max và Fugu Ultra v2 — không phải mô hình đơn lẻ mà là bộ điều phối đã qua huấn luyện, tự chọn mô hình phù hợp trong một kho có cả mô hình mở lẫn mô hình đóng. Trên bảng điểm tự công bố, Ultra v2 đứng đầu hoặc đồng hạng nhất ở 5 trong 8 phép đo, dù kho của nó
Ngày 11/9/2026, Sakana AI phát hành hai sản phẩm mà công ty không gọi là mô hình: Fugu Max và Fugu Ultra v2. Chúng là bộ điều phối — một mô hình được huấn luyện để chọn mô hình khác làm việc thay mình. Bảng điểm tự công bố của Sakana đáng đọc kỹ, cả ở chỗ họ thắng lẫn chỗ họ thua.
Ý tưởng: không thi đấu, mà phân công
Cách làm mặc định của ngành cho tới nay là huấn luyện một mô hình lớn nhất có thể rồi giao mọi việc cho nó. Sakana đề xuất một hướng khác: giữ nguyên các mô hình đã có ngoài thị trường, và huấn luyện một mô hình chuyên đi phân công. Fugu đọc yêu cầu, ước lượng việc đó cần năng lực gì, rồi chuyển cho mô hình gọn nhẹ nhất đủ sức giải — và nó có thể gọi đệ quy chính nó khi việc cần chia nhỏ.
Kho mô hình mà Fugu điều phối gồm cả mô hình mở lẫn mô hình đóng — đây là chi tiết hay bị tường thuật sai thành "chỉ dùng mô hình mở". Sakana nêu tên dòng NVIDIA Nemotron trong kho, cùng mô hình Namazu của chính họ và bản thân Fugu Max. Danh sách đầy đủ không được công bố.
Bảng điểm: thắng 5, thua 3
Sakana công bố tám phép đo, mỗi phép đo so Fugu Ultra v2 với Opus 5, Fable 5, Fable 5.1, GPT 5.6 Sol, Kimi K3 và — ở năm trong tám phép đo — GPT 6 Astra. Bảng dưới đây chép lại đúng các con số trên biểu đồ.
| Phép đo | Fugu Ultra v2 | Opus 5 | Fable 5 | Fable 5.1 | GPT 5.6 Sol | GPT 6 Astra | Kimi K3 |
|---|---|---|---|---|---|---|---|
| HLE (văn bản) | 56,3 | 54,9 | 55,5 | 59,1 | 49,5 | 54,7 | 46,9 |
| GDP.pdf | 34,3 | 24,0 | 29,8 | 27,6 | 30,7 | — | 19,0 |
| Chartography | 48,3 | 27,3 | 29,5 | 46,2 | 45,0 | — | 26,6 |
| SWEFish (của Sakana) | 71,8 | 62,3 | 64,2 | 66,0 | 64,2 | 69,8 | 57,4 |
| DeepSWE | 74,3 | 68,8 | 69,7 | 67,4 | 72,7 | 73,0 | 67,5 |
| ProgramBench | 81,0 | 82,3 | 76,8 | 82,7 | 77,6 | 85,4 | 77,8 |
| GPQAD | 95,5 | 93,2 | 92,6 | 93,7 | 94,2 | 96,0 | 93,5 |
| Toolathon | 80,6 | 80,6 | 74,7 | 77,8 | 74,9 | — | 76,5 |
Số do Sakana AI tự công bố, chưa có bên thứ ba dựng lại. Dấu "—" nghĩa là biểu đồ gốc không có cột đó. Locaith chép trực tiếp từ biểu đồ chính thức.
Đọc thẳng: Ultra v2 đứng đầu hoặc đồng hạng nhất ở 5 trong 8 phép đo. Khoảng cách lớn nhất nằm ở Chartography — 48,3 so với 27,3 của Opus 5 và 29,5 của Fable 5, tức gần gấp đôi — và đây là phép đo về đọc hiểu biểu đồ và dữ liệu hình ảnh. Ở GDP.pdf, phép đo về trích xuất thông tin từ tài liệu PDF dài, Ultra v2 đạt 34,3 trong khi mô hình tốt nhất còn lại là GPT 5.6 Sol với 30,7.
Ba phép đo Ultra v2 không dẫn đầu cũng nói lên điều gì đó. Ở ProgramBench và GPQAD, GPT 6 Astra đứng đầu; ở HLE bản văn bản, Fable 5.1 đạt 59,1 so với 56,3. Cả ba mô hình thắng ở đây đều là mô hình không có trong kho của Ultra v2. Nói cách khác, việc điều phối khéo thu hẹp được khoảng cách ở nhiều dạng việc, nhưng ở những việc đòi hỏi một lần suy luận sâu và liền mạch thì mô hình tiên phong vẫn hơn.
Một trong năm chiến thắng là phép đo của chính người bán.
SWEFish do Sakana xây dựng. Điều đó không làm con số 71,8 thành sai, nhưng nó thay đổi cách đọc: một phép đo nội bộ phản ánh việc nhà cung cấp coi trọng loại năng lực nào, và họ đã tối ưu theo hướng đó. Khi đối chiếu, con số đáng tin hơn là bốn phép đo bên ngoài — GDP.pdf, Chartography, DeepSWE và Toolathon — trong đó Toolathon là hoà điểm với Opus 5 chứ không phải thắng. Tính chặt, đó là ba chiến thắng rõ ràng ở phép đo bên ngoài.
Giá: một bên rõ, một bên chưa
Fugu Max có giá công bố rõ ràng: 2 USD mỗi triệu token đầu vào và 6 USD mỗi triệu token đầu ra. Sakana định vị mức này thấp hơn 40–60% so với chi phí đầu ra của Sonnet 5, GPT 5.6 Terra và Kimi K3.
Fugu Ultra v2 thì không rõ, và Locaith không muốn lấp chỗ trống này bằng phỏng đoán. Thông báo ngày 11/9 không nêu giá riêng cho bản v2; trang giá của Sakana và trang OpenRouter đều đang hiển thị mức của dòng Ultra v1.x là 5 USD đầu vào và 30 USD đầu ra, kèm ghi chú rằng phần vượt quá 272 nghìn token tính giá cao hơn nhưng không nói cao hơn bao nhiêu. Nếu bạn định lập ngân sách cho Ultra v2, hãy hỏi thẳng Sakana thay vì dựa vào con số đang hiển thị.
| Hạng mục | Fugu Max | Fugu Ultra v2 |
|---|---|---|
| Đầu vào (1 triệu token) | 2 USD | 5 USD (mức v1.x, chưa xác nhận cho v2) |
| Đầu ra (1 triệu token) | 6 USD | 30 USD (mức v1.x, chưa xác nhận cho v2) |
| Mốc dữ liệu huấn luyện | chưa công bố | 28/8/2026 |
| Trọng số | không phát hành | không phát hành |
Giá Fugu Max là số Sakana công bố. Giá Ultra v2 là mức đang hiển thị trên trang giá và OpenRouter cho dòng Ultra, không phải mức Sakana xác nhận riêng cho v2.
Chỗ cần đọc kỹ: "điều phối mô hình mở" không có nghĩa là bạn được mở
Đây là điểm dễ hiểu nhầm nhất trong toàn bộ câu chuyện. Fugu điều phối nhiều mô hình có trọng số mở, nhưng bản thân Fugu không phải sản phẩm mở. Trọng số của nó không được phát hành; dịch vụ chỉ tồn tại dưới dạng dịch vụ do Sakana vận hành. Bạn không thể tải Fugu về chạy trong hạ tầng của mình, và bạn cũng không tự chọn được mô hình nào trong kho sẽ xử lý yêu cầu của bạn.
Điều đó dẫn tới một câu hỏi vận hành cụ thể mà bất kỳ doanh nghiệp nào cũng nên đặt trước khi ký: dữ liệu của tôi sẽ đi qua những mô hình nào, và của những nhà cung cấp nào? Khi gọi trực tiếp một nhà cung cấp, bạn biết dữ liệu đi đâu. Khi gọi một bộ điều phối, dữ liệu của bạn có thể được chuyển sang bên thứ ba mà danh sách đầy đủ không được công bố. Với hồ sơ nhân sự, hợp đồng hay dữ liệu khách hàng, đây không phải chi tiết kỹ thuật nhỏ — đây là câu hỏi về tuân thủ.
Điều doanh nghiệp Việt Nam nên rút ra
- Ý tưởng phân công việc theo độ khó là thứ bạn tự làm được, không cần mua. Đây là bài học đáng giá nhất ở đây. Phần lớn hệ thống nội bộ hiện gửi mọi yêu cầu tới cùng một mô hình đắt nhất, kể cả những yêu cầu chỉ là phân loại hay trích xuất một trường dữ liệu. Định tuyến đơn giản theo loại yêu cầu — việc dễ giao cho mô hình rẻ, việc khó mới đẩy lên mô hình mạnh — thường cắt được phần lớn hoá đơn mà không cần công nghệ mới nào.
- Hỏi phép đo nào là của người bán trước khi tin bảng điểm. Trong bảng của Sakana, một trong năm chiến thắng là phép đo nội bộ. Đây không phải hành vi cá biệt của Sakana; gần như mọi nhà cung cấp đều có ít nhất một phép đo của riêng mình trong bộ tài liệu bán hàng. Câu hỏi cần đặt luôn là: bỏ các phép đo do chính anh làm ra thì bảng này còn lại gì.
- Khoảng cách năng lực vẫn còn ở những việc suy luận sâu. Bảng điểm cho thấy điều phối thu hẹp khoảng cách ở đọc tài liệu, đọc biểu đồ và sửa mã, nhưng không thu hẹp được ở ProgramBench và GPQAD. Nếu công việc chính của bạn thuộc nhóm sau, tiết kiệm bằng cách điều phối có thể không đáng.
- Với dịch vụ điều phối, điều khoản dữ liệu quan trọng hơn bảng giá. Hãy yêu cầu danh sách các nhà cung cấp mà yêu cầu của bạn có thể được chuyển tới, và điều khoản của từng bên về việc dùng dữ liệu để huấn luyện. Nếu không có câu trả lời rõ ràng, đừng đưa dữ liệu nhạy cảm vào.
Nguồn:
- Sakana AI — Trang công bố Fugu Max và Fugu Ultra v2 — nguồn sơ cấp cho ngày phát hành 11/9/2026, cho giá Fugu Max 2/6 USD, cho mức so sánh 40–60%, cho mốc dữ liệu huấn luyện 28/8/2026, cho việc kho của Ultra v2 không có Fable 5, Fable 5.1 và GPT-6 Astra, và cho toàn bộ biểu đồ điểm chuẩn; Locaith đọc 13/9/2026
- Sakana AI — Biểu đồ tám phép đo của Fugu Ultra v2, sơ đồ kho mô hình và đồ thị chi phí – năng lực — nguồn cho toàn bộ số trong bảng điểm và cho chú thích "Closed & open models"; Locaith chép trực tiếp từ hình
- MarkTechPost — Sakana AI Launches Fugu Max and Fugu Ultra v2 — nguồn cho việc dòng NVIDIA Nemotron nằm trong kho mô hình
- BuildFastWithAI — Fugu Max & Fugu Ultra v2 Review — nguồn cho việc thông báo không nêu giá riêng cho v2 trong khi trang giá vẫn hiển thị mức v1.x, cho việc dịch vụ là sản phẩm lưu trữ không phát hành trọng số, và cho ghi chú rằng SWEFish là phép đo nội bộ của Sakana
- OpenRouter — Trang mô hình sakana/fugu-ultra-v2 — nguồn cho mức 5 USD đầu vào và 30 USD đầu ra đang hiển thị, và cho ghi chú về phần vượt 272 nghìn token
Toàn bộ điểm chuẩn trong bài là số do Sakana AI tự công bố; tính đến ngày đăng chưa có phòng đo độc lập nào dựng lại các kết quả này, và bài viết nêu rõ rằng SWEFish — một trong năm phép đo Sakana dẫn đầu — là phép đo nội bộ của chính Sakana. Locaith chép số trực tiếp từ biểu đồ chính thức thay vì qua bản tin trung gian. Giá của Fugu Ultra v2 chưa được Sakana công bố riêng; mức 5/30 USD nêu trong bài là mức đang hiển thị cho dòng Ultra trên trang giá và OpenRouter, và không nên coi là đã xác nhận. Đồ thị chi phí – năng lực là hình minh hoạ khái niệm không có thang số, không phải dữ liệu đo được. Có chênh lệch nhỏ về ngày: trang công bố của Sakana ghi 11/9/2026 trong khi một số bài trong ngành đề ngày 10/9/2026, nhiều khả năng do lệch múi giờ; bài này theo ngày trên trang của Sakana. Danh sách đầy đủ các mô hình trong kho chưa công bố. Các khuyến nghị cuối bài là quan điểm riêng của Locaith. Ảnh bìa, sơ đồ kho mô hình, biểu đồ điểm chuẩn và đồ thị khái niệm: Sakana AI. Biên soạn và phân tích bởi Ban Biên Tập Locaith, 13/9/2026.