WEBSITE ĐANG PHÁT TRIỂN

OpenAI và Cerebras ra mắt GPT-5.6 Sol Ultrafast – 750 token/giây, nhanh gấp 11 lần đối thủ

Ngày 14/8/2026, OpenAI và Cerebras chính thức ra mắt GPT-5.6 Sol Ultrafast, tầng dịch vụ API mới chạy trên phần cứng Cerebras với tốc độ 750 output token/giây, nhanh gấp 11 lần Fable 5 và gấp 5 lần Opus 4.8 ở chế độ Fast mode. Trong benchmark Humanity's Last Exam (2.500 câu hỏi cấp độ tiến sĩ), mô hình này hoàn thành chỉ trong hơn 11 giờ, nhanh gấp gần 7 lần đối thủ gần nhất. Cùng ngày, OpenAI cũng bổ nhiệm Dali Rajic (cựu President/COO của Wiz) làm CRO mới, thay thế Denise Dresser (cựu CEO Slack) vừa rời đi. Hiện tại, Ultrafast Mode chỉ mở cho một nhóm khách hàng chọn lọc qua OpenAI API.

Nội dung chính

Bài viết này tập trung vào ba chuyển động đáng chú ý nhất trong thông báo ngày 14/8/2026 của OpenAI: (1) thông số 750 token/giây được giải mã theo ngữ cảnh thực tế, (2) benchmark Humanity's Last Exam và ý nghĩa của nó, (3) thay đổi nhân sự cấp cao tại bộ máy doanh thu OpenAI.

750 token/giây – con số này có nghĩa là gì?

Dữ liệu từ VentureBeat ngày 14/8/2026 cho thấy GPT-5.6 Sol Ultrafast chạm mốc 750 output token/giây khi vận hành trên phần cứng Cerebras. Con số này có nghĩa là một đoạn văn dài khoảng 1.500 token – tương đương một trang A4 – có thể được sinh ra chỉ trong khoảng 2 giây. Để đặt vào bối cảnh: thông lệ phổ biến của các mô hình hàng đầu trước đó là 60–150 token/giây, tức là cùng một trang văn bản sẽ mất từ 10 đến 25 giây. Đây là cú nhảy 5–12 lần về tốc độ phản hồi thực tế.

Thông báo của OpenAI còn ghi rõ mức tăng 14 lần so với tốc độ xử lý tiêu chuẩn trên cùng mô hình. Trong khi đó, VentureBeat đối chiếu thêm: nhanh hơn 11 lần so với Fable 5 và 5 lần so với Opus 4.8 ở chế độ Fast mode – hai cái tên thường xuất hiện trong các bảng benchmark thương mại nửa đầu năm 2026.

Tại sao con số này lại quan trọng? Vì khi một mô hình ngôn ngữ phản hồi quá chậm, người dùng văn phòng sẽ tự động chuyển sang thói quen "hỏi một lần, đợi lâu, dùng lại lần nữa" – tức là giảm số lượng câu hỏi AI mỗi ngày. Khi tốc độ đạt 750 token/giây, vòng lặp "hỏi – đáp – chỉnh – hỏi tiếp" trở nên gần như liền mạch như đang chat với một đồng nghiệp thật. Đó là lý do OpenAI nhấn mạnh Ultrafast được thiết kế cho các workflow "mission-critical và time-sensitive" – dịch thuật thời gian thực, hỗ trợ khách hàng trực tiếp, hoặc phân tích log/dữ liệu theo lô lớn.

Humanity's Last Exam trong 11 giờ – nhanh gấp gần 7 lần

Benchmark Humanity's Last Exam gồm 2.500 câu hỏi ở cấp độ tiến sĩ (PhD-level) – bộ đề được giới nghiên cứu AI dùng để "vặn" các mô hình ở mức suy luận sâu nhất. Theo VentureBeat, GPT-5.6 Sol Ultrafast hoàn thành toàn bộ bộ đề trong hơn 11 giờ, nhanh gấp gần 7 lần so với đối thủ gần nhất.

Con số này có nghĩa là gì trong thực tế? Nếu lấy mốc trung bình của các mô hình frontier đầu 2026 (khoảng 70–80 giờ để hoàn thành cùng bộ đề), thì Ultrafast rút ngắn thời gian từ 3 ngày liên tục xuống còn nửa ngày làm việc. Với nhóm nghiên cứu, đội ngũ data analyst, hay các engineer chạy evaluation loop (vòng đánh giá mô hình), mỗi lần chạy benchmark tiết kiệm được 2–3 ngày đồng nghĩa với việc tăng gấp đôi số lần lặp trong một sprint.

Điều này quan trọng vì trong ngành AI, tốc độ suy luận và tốc độ đánh giá là hai yếu tố quyết định nhịp ra sản phẩm mới. Khi một mô hình chạy benchmark nhanh hơn gấp 7 lần, các phòng thí nghiệm có thể thử nhiều biến thể hơn trong cùng một khung thời gian, rút ngắn đường đua tới production.

OpenAI đổi CRO: Dali Rajic thay Denise Dresser

Trong cùng ngày 14/8/2026, OpenAI công bố bổ nhiệm Dali Rajic – hiện đang là President và COO của Wiz, công ty bảo mật đám mây – làm Chief Revenue Officer (CRO) mới. Người tiền nhiệm là Denise Dresser, cựu CEO Slack, người gia nhập OpenAI hồi tháng 12/2025 và vừa thông báo rời đi qua một bài đăng trên LinkedIn.

Dữ liệu từ VentureBeat cho thấy đây là lần thứ hai trong vòng một tuần OpenAI chứng kiến một nhân sự cấp cao rời đi – một tín hiệu cho thấy giai đoạn chuyển đổi mạnh mẽ trong bộ máy thương mại. Việc chọn một người từ lĩnh vực bảo mật doanh nghiệp (Wiz) thay vì công cụ cộng tác (Slack) gợi ý OpenAI đang ưu tiên câu chuyện AI cho doanh nghiệp lớn, nơi khách hàng cần mua theo hợp đồng nhiều triệu USD và có yêu cầu tuân thủ nghiêm ngặt.

Nếu bạn là một trong những nhà cung cấp giải pháp AI tại Việt Nam đang nhắm vào khách hàng doanh nghiệp, sự thay đổi này có nghĩa là: trong 6–12 tháng tới, cách tiếp cận từ phía OpenAI có thể thiên về bảo mật, governance, và compliance nhiều hơn là "dùng thử rồi quyết định". Bạn nên chuẩn bị sẵn case study về bảo mật dữ liệu và kiểm toán mô hình nếu muốn cạnh tranh ở phân khúc này.

Số liệu & thống kê

Chỉ số Giá trị Nguồn
Tốc độ GPT-5.6 Sol Ultrafast 750 output token/giây VentureBeat / OpenAI (14/8/2026)
So với tốc độ tiêu chuẩn nhanh hơn 14 lần OpenAI announcement (14/8/2026)
So với Fable 5 nhanh hơn 11 lần VentureBeat (14/8/2026)
So với Opus 4.8 (Fast mode) nhanh hơn 5 lần VentureBeat (14/8/2026)
Thời gian hoàn thành Humanity's Last Exam hơn 11 giờ VentureBeat (14/8/2026)
Tốc độ gấp đối thủ gần nhất gần 7 lần VentureBeat (14/8/2026)
Số câu hỏi Humanity's Last Exam 2.500 câu cấp độ tiến sĩ VentureBeat (14/8/2026)
Phần cứng vận hành Cerebras OpenAI / VentureBeat
CRO mới Dali Rajic (cựu President/COO Wiz) OpenAI / VentureBeat (14/8/2026)
CRO rời đi Denise Dresser (cựu CEO Slack) OpenAI / VentureBeat (14/8/2026)
Phạm vi phát hành ban đầu nhóm khách hàng chọn lọc qua OpenAI API OpenAI (14/8/2026)

Điều này ảnh hưởng gì đến bạn?

  • Nếu bạn là nhân viên văn phòng tại Việt Nam đang dùng AI mỗi ngày: Con số 750 token/giây là lý do bạn sẽ sớm thấy phản hồi gần như tức thì khi yêu cầu ChatGPT viết lại email, tóm tắt báo cáo dài, hoặc dịch tài liệu. Hiện tại bản Ultrafast chỉ mở cho nhóm chọn lọc, nhưng theo lịch sử phát hành của OpenAI (GPT-4o, GPT-5), khoảng cách từ "preview chọn lọc" tới "mở rộng cho tất cả người dùng API" thường là 4–8 tuần. Nếu workflow của bạn phụ thuộc nhiều vào tốc độ (chat hỗ trợ khách, xử lý log, viết nội dung hàng loạt), hãy theo dõi lịch mở rộng từ OpenAI trong tháng 9–10/2026.
  • Nếu bạn là founder hoặc CTO đang xây sản phẩm AI: Mức tăng 14 lần về tốc độ có nghĩa là chi phí suy luận (inference cost) trên mỗi token có thể giảm đáng kể, vì phần cứng Cerebras xử lý được nhiều token hơn trong cùng một đơn vị thời gian. Khi OpenAI chính thức công bố bảng giá cho Ultrafast, hãy so sánh với giá API hiện tại của bạn. Đây có thể là thời điểm tốt để đàm phán lại hợp đồng hoặc dịch chuyển workload sang Cerebras-backed endpoint.
  • Nếu bạn làm kinh doanh và đang cân nhắc tích hợp AI vào vận hành: Việc OpenAI đặt một người từ ngành bảo mật doanh nghiệp (Wiz) vào vị trí CRO là tín hiệu: OpenAI sẽ bán AI cho doanh nghiệp lớn theo hướng "bảo mật trước, giá trị sau". Nếu bạn đang pitch giải pháp AI cho khách hàng là ngân hàng, bảo hiểm, hay doanh nghiệp nhà nước, hãy chuẩn bị tài liệu về data residency (nơi lưu trữ dữ liệu), kiểm toán mô hình, và quy trình red-team. Đó sẽ là ngôn ngữ mà khách hàng lớn muốn nghe trong 6–12 tháng tới.
  • Nếu bạn là nhà phân tích hoặc người đánh giá AI: Con số gần 7 lần trên Humanity's Last Exam là một dấu mốc benchmark quan trọng. Nếu bạn đang theo dõi tiến độ của các frontier model, hãy ghi nhận rằng từ đầu 2026 đến nay, tốc độ xử lý trên bộ đề này đã được cải thiện theo cấp số nhân – nhưng điểm chính xác (accuracy) vẫn cần được kiểm chứng qua nguồn độc lập.

Sources

# Nguồn URL Ngày
1 VentureBeat - OpenAI and Cerebras Launch GPT-5.6 Sol Ultrafast: 750 Tokens Per Second https://venturebeat.com/ai/openai-and-cerebras-launch-gpt-5-6-sol-ultrafast-a-new-frontier-in-750-tokens-per-second-ai-performance/ 14/8/2026
2 OpenAI Blog - Ultrafast Mode for GPT-5.6 Sol Featuring 14x Speed Increase via Cerebras Hardware https://openai.com/blog/ultrafast-mode-gpt-5-6-sol-cerebras 14/8/2026
3 OpenAI Blog - Dali Rajic Appointed Chief Revenue Officer https://openai.com/blog/dali-rajic-chief-revenue-officer 14/8/2026

Bài viết liên quan

Xem thêm
Tin tức AI

Xiaomi ra mắt MiMo Code mã nguồn mở, vượt Claude Code ở nhiệm vụ siêu dài

Hãy nói thẳng: Xiaomi vừa tung ra MiMo Code, một trợ lý AI viết code chạy trong terminal (dòng lệnh), mã nguồn mở, miễn phí dùng model đi kèm trong thời gian giới hạn, và tuyên bố vượt Claude Code của Anthropic ở các nhiệm vụ dài hơn 200 bước thao tác. Điểm hay nhất không phải model AI bên trong, mà là cách nó "ghi nhớ" xuyên suốt phiên làm việc dài, thứ mà hầu hết AI coding assistant hiện nay vẫn làm rất tệ. Nhưng số liệu là do Xiaomi tự công bố, chưa ai kiểm chứng độc lập, nên đọc kỹ trước khi tin.

Tin tức AI

Wikipedia đình công vì AI: hàng trăm biên tập viên đe dọa ngừng sửa bài

Hàng trăm biên tập viên Wikipedia – những người tình nguyện duy trì chất lượng nội dung – đang đe dọa đình công sau khi Wikimedia Foundation sa thải toàn bộ nhóm Community Tech vào tháng 5 năm 2026. Đây là nhóm kỹ sư xây dựng công cụ kiểm duyệt và chống phá hoại mà biên tập viên dựa vào hàng ngày. Nghiêm trọng hơn: Wikipedia là nguồn dữ liệu training chính cho hầu hết mô hình AI lớn. Nếu chất lượng Wikipedia suy giảm, chất lượng AI cũng sẽ bị ảnh hưởng theo.