GPT-5.6 Sol Ultrafast: OpenAI Chạy Nhanh Gấp 14 Lần Nhờ Chip Cerebras

Ngày 13/8/2026, OpenAI mở bản xem trước Ultrafast — chế độ chạy GPT-5.6 Sol với tốc độ tới 750 token đầu ra mỗi giây, nhanh gấp 14 lần chế độ tiêu chuẩn. Điểm đáng chú ý không nằm ở mô hình mà ở phần cứng: OpenAI dùng chip wafer-scale của Cerebras thay vì hạ tầng quen thuộc. Chế độ này hiện chỉ mở c

Ngày 13/8/2026, OpenAI mở bản xem trước Ultrafast — chế độ chạy GPT-5.6 Sol ở tốc độ tới 750 token đầu ra mỗi giây, nhanh gấp 14 lần chế độ tiêu chuẩn. Nhưng tin thật sự không nằm ở con số tốc độ: nó nằm ở chỗ OpenAI chạy mô hình này trên chip của Cerebras, chứ không phải hạ tầng quen thuộc của mình.

1. Cùng Một Mô Hình, Phần Cứng Khác

Điều đầu tiên cần nói rõ, vì rất dễ hiểu nhầm: Ultrafast không phải một mô hình mới. Đây là một chế độ phục vụ của GPT-5.6 Sol — cùng mô hình, cùng trọng số, chạy trên nền phần cứng khác. OpenAI diễn đạt mục tiêu là làm được nhiều việc hữu ích hơn trên mỗi giây mà không phải hạ năng lực mô hình xuống.

Đó là một cách đóng khung đáng chú ý. Trong hai năm qua, cách phổ biến để có phản hồi nhanh là dùng một mô hình nhỏ hơn — Flash, Mini, Lite. Ultrafast đề xuất một trục khác: giữ nguyên mô hình đầu bảng, đổi phần cứng bên dưới. Nếu cách này chạy được ở quy mô lớn, nó tách rời hai thứ lâu nay bị buộc chặt vào nhau là tốc độnăng lực.

2. Vì Sao Cerebras Làm Được Điều Đó

Nút thắt của việc sinh token không phải là phép tính, mà là băng thông bộ nhớ. Mỗi token sinh ra đòi hỏi đọc lại trọng số mô hình từ bộ nhớ; với mô hình lớn, thời gian chờ dữ liệu di chuyển mới là phần chiếm chủ yếu, không phải thời gian tính toán.

Cerebras đi theo hướng wafer-scale: thay vì cắt tấm bán dẫn thành hàng trăm con chip nhỏ rồi nối lại với nhau, họ giữ gần như nguyên tấm làm một bộ xử lý duy nhất. Điều đó cho phép chứa trọng số ngay trên chip, thay vì phải kéo qua lại giữa chip và bộ nhớ ngoài. Nút thắt băng thông vì thế giảm đi đáng kể — và đó là lý do kỹ thuật đằng sau con số 750 token mỗi giây.

Chi tiết đáng chú ý về mặt ngành

OpenAI là cái tên gắn chặt nhất với hạ tầng GPU quy mô lớn. Việc hãng chọn một kiến trúc phần cứng khác để giải riêng bài toán độ trễ là một tín hiệu thực tế: không có một loại phần cứng nào tối ưu cho mọi tác vụ AI. Huấn luyện, phục vụ khối lượng lớn, và phục vụ độ trễ thấp là ba bài toán khác nhau, và ngành đang bắt đầu dùng ba loại phần cứng khác nhau cho chúng.

3. Thông Số Đã Công Bố

Hạng mục Thông số Ghi chú
Tốc độ sinh Tới 750 token/giây Token đầu ra
So với chế độ tiêu chuẩn Nhanh tới 14 lần Số do OpenAI công bố
Mô hình GPT-5.6 Sol Không phải mô hình mới
Phần cứng Cerebras Kiến trúc wafer-scale
Kênh phân phối Chỉ OpenAI API Chưa có trên ChatGPT hay Codex
Mức mở Xem trước giới hạn Một nhóm khách hàng được chọn
Giá Chưa công bố Không có trong mọi nguồn chúng tôi đọc

Về khách hàng đầu tiên, các nguồn không thống nhất. Một số bản tin nêu tên Jane Street, Basis, RogoPodium là những đơn vị đã đưa Ultrafast vào quy trình; trong khi bản tin của TechCrunch không nêu tên khách hàng nào. Chúng tôi ghi lại cả hai để bạn biết mức độ chắc chắn của thông tin này.

4. Điều Chưa Được Trả Lời

5. Ý Nghĩa Với Doanh Nghiệp Việt Nam

Nguồn tham khảo:

Lưu ý về số liệu: các con số 14 lần và 750 token/giây là do OpenAI công bố, chưa có bên thứ ba đo lại độc lập tại thời điểm viết. OpenAI chưa công bố giá cho chế độ Ultrafast, cũng chưa công bố số đo chất lượng đối chiếu với chế độ tiêu chuẩn — tuyên bố không đánh đổi năng lực hiện là tuyên bố của nhà cung cấp. Danh sách khách hàng đầu tiên khác nhau giữa các nguồn và chúng tôi đã ghi rõ điều đó trong bài. Chúng tôi không có quyền truy cập để kiểm thử độc lập chế độ này. Tổng hợp và phân tích bởi Ban Biên Tập Locaith, ngày 15/8/2026.

Messenger