Gemini 3.8 TTS Dẫn Bảng Giọng Nói Tiếng Việt Do Người Bản Ngữ Chấm, Nhưng Giá Gấp Đôi Từ 2027
Ngày 23/9/2026, Google phát hành Gemini 3.8 Flash TTS và Flash-Lite TTS, hai mô hình chuyển văn bản thành giọng nói hỗ trợ hơn 100 ngôn ngữ, có nhân bản giọng từ 30 giây ghi âm kèm bản ghi đồng ý của chủ giọng. Trên bảng xếp hạng tiếng Việt của Voice Arena, do người bản ngữ chấm, hai mô hình đứng hạ
Google nói hai mô hình giọng nói mới của họ dẫn đầu nhiều bảng xếp hạng. Một phần các bảng đó do Google hoặc một đơn vị có quan hệ với Google công bố. Có một bảng Locaith kiểm tra trực tiếp được ngày 24/9/2026: bảng tiếng Việt của Voice Arena, nơi người bản ngữ nghe hai mẫu giọng giấu tên và chọn mẫu nghe tự nhiên hơn. Ở đó, Gemini 3.8 Flash-Lite TTS và Gemini 3.8 Flash TTS đứng hạng 1 và 2. Doanh nghiệp cần đọc tiếp hai phần: những gì bảng đó không đo, và giá sau ngày 31/12/2026.
Hai mô hình, hai mức giá, và một ngày đổi giá
Google phát hành hai mô hình ngày 23/9/2026. Gemini 3.8 Flash TTS hướng tới sáng tạo: thiết kế giọng mới bằng mô tả ngôn ngữ tự nhiên, đạo diễn từng câu thoại, dựng cảnh hai người nói. Gemini 3.8 Flash-Lite TTS hướng tới khối lượng lớn: lồng tiếng, sản xuất nội dung, tổng đài bằng giọng nói. Cả hai có trên Gemini API và Google AI Studio từ ngày phát hành; bản cho Gemini Enterprise "sắp có". Mã mô hình trong tài liệu là gemini-3.8-flash-tts và gemini-3.8-flash-lite-tts.
| USD / triệu token | Đầu vào văn bản (đến 31/12 → từ 1/1/2027) |
Đầu ra âm thanh (đến 31/12 → từ 1/1/2027) |
Đầu ra, chế độ batch (đến 31/12 → từ 1/1/2027) |
|---|---|---|---|
| Gemini 3.8 Flash TTS | 0,50 → 1,00 | 9 → 18 | 4,50 → 9 |
| Gemini 3.8 Flash-Lite TTS | 0,50 → 1,00 | 6 → 12 | 3 → 6 |
| Gemini 3.1 Flash TTS Preview (đời trước) | 1,00 | 20 | 10 |
Nguồn: trang giá Gemini Developer API, Locaith đọc ngày 24/9/2026. Cả hai mô hình 3.8 có gói miễn phí. Toàn bộ là giá niêm yết của Google.
Đọc bảng theo hai mốc cho ra hai câu chuyện khác nhau. Tới hết năm 2026, đầu ra âm thanh của Flash TTS rẻ hơn đời 3.1 55% (9 so với 20 USD). Từ 1/1/2027, mức chênh chỉ còn 10% (18 so với 20 USD). Flash-Lite sau khi tăng giá vẫn rẻ hơn đời 3.1 40%. Đây là cùng kiểu định giá Google áp cho Gemini 3.8 Flash hôm 2/9: giá khởi điểm có hạn dùng, mức gấp đôi đã được niêm yết sẵn.
Một con số doanh nghiệp cần nhưng chưa có: giá mỗi phút giọng nói. Google tính theo token âm thanh, nhưng trang giá và tài liệu TTS không nêu mỗi giây giọng nói tương ứng bao nhiêu token. Con số 25 token mỗi giây xuất hiện trên trang giá Google Cloud được ghi cho mô hình dịch trực tiếp Live Translate, không phải cho TTS, nên Locaith không dùng nó để quy đổi.
Bảng tiếng Việt: dẫn đầu, nhưng hạng 1 và hạng 2 là hoà
Voice Arena xếp hạng bằng so sánh từng cặp. Người chấm nghe hai mẫu đọc cùng một câu, không biết mẫu nào của hãng nào, và trả lời một câu hỏi: mẫu nào nghe tự nhiên hơn, như người thật nói? Theo trang phương pháp, mỗi ngôn ngữ có 100 câu viết thẳng bằng ngôn ngữ đó, không dịch, chia theo bốn tình huống: 36 câu tổng đài và chăm sóc khách hàng, 23 câu truyền thông và giải trí, 21 câu trợ lý hội thoại, 20 câu nội dung và giáo dục. Người chấm phải qua bài kiểm tra tiếng mẹ đẻ, và bảng hiện chỉ tính phiếu của nhóm chấm được trả công.
Trên bảng tiếng Việt, Flash-Lite đạt 1156 điểm (±19), Flash đạt 1135 (±17), đời 3.1 đạt 1099, và ElevenLabs Eleven v3, đối thủ gần nhất ngoài Google, đạt 1043. Khoảng cách giữa hai mô hình Gemini 3.8 và Eleven v3 lớn hơn nhiều so với sai số. Khoảng cách giữa chính hai mô hình Gemini 3.8 thì không, nên nói "Flash-Lite hay hơn Flash" là đọc quá mức số liệu.
Những gì bảng này không nói.
- Voice Arena tự ghi là không đo độ trễ, chi phí mỗi ký tự hay mỗi phút, độ giống của giọng nhân bản, hay hiệu năng của cả hệ tác tử giọng nói (ngắt lời, luân phiên lượt nói).
- Chỉ giọng có sẵn trong thư viện của từng hãng được chấm; tính năng nhân bản giọng không được đánh giá.
- Bảng tiếng Việt có chín mô hình, không có nhà cung cấp TTS nào của Việt Nam. Kết quả cho thấy Gemini 3.8 nghe tự nhiên hơn ElevenLabs, OpenAI, Microsoft và các hãng quốc tế khác trong bảng, chưa cho thấy nó hơn các dịch vụ trong nước như FPT.AI hay Viettel AI.
- Trang phương pháp không nói câu mẫu tiếng Việt được đọc bằng giọng vùng nào.
Bảng điểm Google đăng, và một mối quan hệ cần biết
Trong bài công bố, Google dẫn các kết quả của Hume AI: hạng 1 trên bộ đo thiết kế giọng Voice Design Benchmark (71,4 điểm), dẫn đầu ở mô phỏng giọng địa phương (60,8), và giữ hạng 1, hạng 2 trên chỉ số chất lượng tổng thể. Bảng điểm Google đăng lại cho thấy điểm tổng thể 0,920 của Flash và 0,914 của Flash-Lite, so với 0,840 của Cartesia Sonic 3.6 và 0,706 của ElevenLabs v3. Cùng bảng đó có một hàng Gemini không dẫn: ở mức độ biến hoá giống người qua các lượt nói, ElevenLabs v3 đạt 5,00, còn Flash đạt 4,58.
Người đọc nên biết bối cảnh của các con số này. Tháng 1/2026, theo TechCrunch, Google DeepMind ký thoả thuận cấp phép với Hume AI và tuyển CEO Alan Cowen cùng khoảng bảy kỹ sư chủ chốt. Hume AI vẫn là công ty độc lập, và Google có quyền không độc quyền với toàn bộ tài sản trí tuệ của Hume. Bài công bố ngày 23/9 do Leland Rechis và Alan Cowen, nay là giám đốc nghiên cứu khoa học, đồng ký tên. Điều đó không làm các con số sai đi, nhưng Locaith xếp chúng gần với số do hãng công bố hơn là số đo độc lập. Bảng Voice Arena ở trên là phép kiểm tra của một bên thứ ba có công bố phương pháp.
Nhân bản giọng từ 30 giây: có rào chắn, nhưng chỉ trong công cụ của Google
Flash TTS tạo lại một giọng nói từ 30 giây ghi âm. Để làm vậy, người dùng phải nộp một bản ghi lời đồng ý của chính chủ giọng, và hệ thống kiểm tra bản ghi đó có khớp với giọng mẫu không. Mọi đoạn âm thanh do các mô hình Gemini Audio tạo ra đều gắn thuỷ vân SynthID, kèm chứng nhận nguồn gốc C2PA. Theo tài liệu API, mỗi dự án lưu được tối đa 200 giọng tuỳ chỉnh, mỗi giọng tồn tại một năm. Nhân bản giọng trong AI Studio chưa mở ở Illinois, Texas, Khu vực Kinh tế châu Âu, Anh, Thuỵ Sĩ và Ấn Độ.
Nhận định của Locaith: các rào này bảo vệ người dùng công cụ của Google, không bảo vệ người nghe khỏi giọng giả tạo bằng công cụ khác. Với doanh nghiệp muốn nhân bản giọng người phát ngôn hay nhân viên tổng đài, rủi ro nằm ở phía pháp lý nhiều hơn kỹ thuật: hãy lưu bản ghi đồng ý và một hợp đồng bằng văn bản, và lưu ý giọng tuỳ chỉnh hết hạn sau một năm.
Doanh nghiệp Việt Nam nên làm gì
- Thử bằng câu của chính bạn. Voice Arena chấm 100 câu chung. Hãy thử những thứ hay làm TTS vấp: số điện thoại, số tiền, ngày tháng, tên riêng, từ tiếng Anh chen giữa câu tiếng Việt, và giọng vùng miền của khách hàng bạn. "Lỗi chuyển ngữ giữa câu" là một trong các nhãn lỗi Voice Arena yêu cầu người chấm gắn.
- Lập dự toán theo giá năm 2027. Một hệ thống tổng đài dựng hôm nay sẽ chạy phần lớn đời của nó ở mức 18 USD (Flash) hoặc 12 USD (Flash-Lite) mỗi triệu token âm thanh, không phải 9 hay 6.
- Tự đo giá mỗi phút. Gọi thử 10 câu có độ dài quen thuộc với bạn, đọc số token trong phần usage của phản hồi API, rồi quy ra giá mỗi phút. Đó là con số để so với nhà cung cấp hiện tại.
- Bắt đầu từ Flash-Lite cho khối lượng lớn. Trên bảng tiếng Việt, hai mô hình ngang nhau về độ tự nhiên, còn Flash-Lite rẻ hơn một phần ba ở đầu ra.
- So với dịch vụ trong nước bằng phép chấm mù nội bộ. Bảng quốc tế không có họ. Nếu bạn đang dùng một dịch vụ TTS của Việt Nam, cho vài đồng nghiệp nghe cùng một bộ câu từ hai hệ mà không biết hệ nào là hệ nào.
Nguồn:
- Google — Gemini 3.8 text-to-speech says hello, Leland Rechis và Alan Cowen, 23/9/2026 — nguồn sơ cấp cho tính năng, hơn 100 ngôn ngữ, hơn 2.000 giọng, nhân bản 30 giây và bản ghi đồng ý, SynthID và C2PA, các vùng bị loại trừ, kết quả Hume AI và câu về tiếng Việt trên Voice Arena; Locaith đọc 24/9/2026
- Google AI for Developers — Gemini Developer API pricing — nguồn cho toàn bộ bảng giá và mốc 31/12/2026, 1/1/2027; Locaith đọc 24/9/2026
- Google AI for Developers — Speech generation (text-to-speech) — nguồn cho mã mô hình, tiếng Việt trong danh sách ngôn ngữ, giới hạn 200 giọng và thời hạn một năm
- Google Cloud — Agent Platform pricing — nguồn cho việc con số 25 token mỗi giây được ghi cho Gemini 3.5 Live Translate
- Voice Arena — TTS Leaderboard, Vietnamese — Locaith đọc và chụp màn hình ngày 24/9/2026; nguồn cho điểm, sai số, số lượt chấm và hạng
- Voice Arena — TTS Leaderboard Methodology — nguồn cho cách chấm, 100 câu mỗi ngôn ngữ, người chấm, và danh sách những gì không đo
- TechCrunch, đăng lại trên Yahoo Finance — Google reportedly snags team behind AI voice startup Hume AI, 22/1/2026 — nguồn cho thoả thuận giữa Google DeepMind và Hume AI
Giá, tính năng và các kết quả Hume AI là do Google công bố; kết quả Hume AI được đăng bởi một bài có đồng tác giả là cựu CEO của Hume AI. Bảng Voice Arena là số đo của bên thứ ba, Locaith đọc trực tiếp ngày 24/9/2026, và có thể thay đổi khi có thêm lượt chấm. Locaith không tự nghe thử hay đo token của hai mô hình. Các câu trích được Locaith dịch từ tiếng Anh. Phần nhận định và khuyến nghị là quan điểm riêng của Locaith. Ảnh bìa: khung hình từ video giới thiệu của Google. Ảnh trong bài: chụp màn hình Voice Arena và bảng điểm do Google đăng. Biên soạn và phân tích bởi Ban Biên Tập Locaith, 24/9/2026.