Nội dung chính
Bài viết này tập trung vào ba chuyển động đáng chú ý nhất trong thông báo ngày 14/8/2026 của OpenAI: (1) thông số 750 token/giây được giải mã theo ngữ cảnh thực tế, (2) benchmark Humanity's Last Exam và ý nghĩa của nó, (3) thay đổi nhân sự cấp cao tại bộ máy doanh thu OpenAI.
750 token/giây – con số này có nghĩa là gì?
Dữ liệu từ VentureBeat ngày 14/8/2026 cho thấy GPT-5.6 Sol Ultrafast chạm mốc 750 output token/giây khi vận hành trên phần cứng Cerebras. Con số này có nghĩa là một đoạn văn dài khoảng 1.500 token – tương đương một trang A4 – có thể được sinh ra chỉ trong khoảng 2 giây. Để đặt vào bối cảnh: thông lệ phổ biến của các mô hình hàng đầu trước đó là 60–150 token/giây, tức là cùng một trang văn bản sẽ mất từ 10 đến 25 giây. Đây là cú nhảy 5–12 lần về tốc độ phản hồi thực tế.
Thông báo của OpenAI còn ghi rõ mức tăng 14 lần so với tốc độ xử lý tiêu chuẩn trên cùng mô hình. Trong khi đó, VentureBeat đối chiếu thêm: nhanh hơn 11 lần so với Fable 5 và 5 lần so với Opus 4.8 ở chế độ Fast mode – hai cái tên thường xuất hiện trong các bảng benchmark thương mại nửa đầu năm 2026.
Tại sao con số này lại quan trọng? Vì khi một mô hình ngôn ngữ phản hồi quá chậm, người dùng văn phòng sẽ tự động chuyển sang thói quen "hỏi một lần, đợi lâu, dùng lại lần nữa" – tức là giảm số lượng câu hỏi AI mỗi ngày. Khi tốc độ đạt 750 token/giây, vòng lặp "hỏi – đáp – chỉnh – hỏi tiếp" trở nên gần như liền mạch như đang chat với một đồng nghiệp thật. Đó là lý do OpenAI nhấn mạnh Ultrafast được thiết kế cho các workflow "mission-critical và time-sensitive" – dịch thuật thời gian thực, hỗ trợ khách hàng trực tiếp, hoặc phân tích log/dữ liệu theo lô lớn.
Humanity's Last Exam trong 11 giờ – nhanh gấp gần 7 lần
Benchmark Humanity's Last Exam gồm 2.500 câu hỏi ở cấp độ tiến sĩ (PhD-level) – bộ đề được giới nghiên cứu AI dùng để "vặn" các mô hình ở mức suy luận sâu nhất. Theo VentureBeat, GPT-5.6 Sol Ultrafast hoàn thành toàn bộ bộ đề trong hơn 11 giờ, nhanh gấp gần 7 lần so với đối thủ gần nhất.
Con số này có nghĩa là gì trong thực tế? Nếu lấy mốc trung bình của các mô hình frontier đầu 2026 (khoảng 70–80 giờ để hoàn thành cùng bộ đề), thì Ultrafast rút ngắn thời gian từ 3 ngày liên tục xuống còn nửa ngày làm việc. Với nhóm nghiên cứu, đội ngũ data analyst, hay các engineer chạy evaluation loop (vòng đánh giá mô hình), mỗi lần chạy benchmark tiết kiệm được 2–3 ngày đồng nghĩa với việc tăng gấp đôi số lần lặp trong một sprint.
Điều này quan trọng vì trong ngành AI, tốc độ suy luận và tốc độ đánh giá là hai yếu tố quyết định nhịp ra sản phẩm mới. Khi một mô hình chạy benchmark nhanh hơn gấp 7 lần, các phòng thí nghiệm có thể thử nhiều biến thể hơn trong cùng một khung thời gian, rút ngắn đường đua tới production.
OpenAI đổi CRO: Dali Rajic thay Denise Dresser
Trong cùng ngày 14/8/2026, OpenAI công bố bổ nhiệm Dali Rajic – hiện đang là President và COO của Wiz, công ty bảo mật đám mây – làm Chief Revenue Officer (CRO) mới. Người tiền nhiệm là Denise Dresser, cựu CEO Slack, người gia nhập OpenAI hồi tháng 12/2025 và vừa thông báo rời đi qua một bài đăng trên LinkedIn.
Dữ liệu từ VentureBeat cho thấy đây là lần thứ hai trong vòng một tuần OpenAI chứng kiến một nhân sự cấp cao rời đi – một tín hiệu cho thấy giai đoạn chuyển đổi mạnh mẽ trong bộ máy thương mại. Việc chọn một người từ lĩnh vực bảo mật doanh nghiệp (Wiz) thay vì công cụ cộng tác (Slack) gợi ý OpenAI đang ưu tiên câu chuyện AI cho doanh nghiệp lớn, nơi khách hàng cần mua theo hợp đồng nhiều triệu USD và có yêu cầu tuân thủ nghiêm ngặt.
Nếu bạn là một trong những nhà cung cấp giải pháp AI tại Việt Nam đang nhắm vào khách hàng doanh nghiệp, sự thay đổi này có nghĩa là: trong 6–12 tháng tới, cách tiếp cận từ phía OpenAI có thể thiên về bảo mật, governance, và compliance nhiều hơn là "dùng thử rồi quyết định". Bạn nên chuẩn bị sẵn case study về bảo mật dữ liệu và kiểm toán mô hình nếu muốn cạnh tranh ở phân khúc này.
Số liệu & thống kê
| Chỉ số | Giá trị | Nguồn |
|---|---|---|
| Tốc độ GPT-5.6 Sol Ultrafast | 750 output token/giây | VentureBeat / OpenAI (14/8/2026) |
| So với tốc độ tiêu chuẩn | nhanh hơn 14 lần | OpenAI announcement (14/8/2026) |
| So với Fable 5 | nhanh hơn 11 lần | VentureBeat (14/8/2026) |
| So với Opus 4.8 (Fast mode) | nhanh hơn 5 lần | VentureBeat (14/8/2026) |
| Thời gian hoàn thành Humanity's Last Exam | hơn 11 giờ | VentureBeat (14/8/2026) |
| Tốc độ gấp đối thủ gần nhất | gần 7 lần | VentureBeat (14/8/2026) |
| Số câu hỏi Humanity's Last Exam | 2.500 câu cấp độ tiến sĩ | VentureBeat (14/8/2026) |
| Phần cứng vận hành | Cerebras | OpenAI / VentureBeat |
| CRO mới | Dali Rajic (cựu President/COO Wiz) | OpenAI / VentureBeat (14/8/2026) |
| CRO rời đi | Denise Dresser (cựu CEO Slack) | OpenAI / VentureBeat (14/8/2026) |
| Phạm vi phát hành ban đầu | nhóm khách hàng chọn lọc qua OpenAI API | OpenAI (14/8/2026) |
Điều này ảnh hưởng gì đến bạn?
- Nếu bạn là nhân viên văn phòng tại Việt Nam đang dùng AI mỗi ngày: Con số 750 token/giây là lý do bạn sẽ sớm thấy phản hồi gần như tức thì khi yêu cầu ChatGPT viết lại email, tóm tắt báo cáo dài, hoặc dịch tài liệu. Hiện tại bản Ultrafast chỉ mở cho nhóm chọn lọc, nhưng theo lịch sử phát hành của OpenAI (GPT-4o, GPT-5), khoảng cách từ "preview chọn lọc" tới "mở rộng cho tất cả người dùng API" thường là 4–8 tuần. Nếu workflow của bạn phụ thuộc nhiều vào tốc độ (chat hỗ trợ khách, xử lý log, viết nội dung hàng loạt), hãy theo dõi lịch mở rộng từ OpenAI trong tháng 9–10/2026.
- Nếu bạn là founder hoặc CTO đang xây sản phẩm AI: Mức tăng 14 lần về tốc độ có nghĩa là chi phí suy luận (inference cost) trên mỗi token có thể giảm đáng kể, vì phần cứng Cerebras xử lý được nhiều token hơn trong cùng một đơn vị thời gian. Khi OpenAI chính thức công bố bảng giá cho Ultrafast, hãy so sánh với giá API hiện tại của bạn. Đây có thể là thời điểm tốt để đàm phán lại hợp đồng hoặc dịch chuyển workload sang Cerebras-backed endpoint.
- Nếu bạn làm kinh doanh và đang cân nhắc tích hợp AI vào vận hành: Việc OpenAI đặt một người từ ngành bảo mật doanh nghiệp (Wiz) vào vị trí CRO là tín hiệu: OpenAI sẽ bán AI cho doanh nghiệp lớn theo hướng "bảo mật trước, giá trị sau". Nếu bạn đang pitch giải pháp AI cho khách hàng là ngân hàng, bảo hiểm, hay doanh nghiệp nhà nước, hãy chuẩn bị tài liệu về data residency (nơi lưu trữ dữ liệu), kiểm toán mô hình, và quy trình red-team. Đó sẽ là ngôn ngữ mà khách hàng lớn muốn nghe trong 6–12 tháng tới.
- Nếu bạn là nhà phân tích hoặc người đánh giá AI: Con số gần 7 lần trên Humanity's Last Exam là một dấu mốc benchmark quan trọng. Nếu bạn đang theo dõi tiến độ của các frontier model, hãy ghi nhận rằng từ đầu 2026 đến nay, tốc độ xử lý trên bộ đề này đã được cải thiện theo cấp số nhân – nhưng điểm chính xác (accuracy) vẫn cần được kiểm chứng qua nguồn độc lập.
Sources
| # | Nguồn | URL | Ngày |
|---|---|---|---|
| 1 | VentureBeat - OpenAI and Cerebras Launch GPT-5.6 Sol Ultrafast: 750 Tokens Per Second | https://venturebeat.com/ai/openai-and-cerebras-launch-gpt-5-6-sol-ultrafast-a-new-frontier-in-750-tokens-per-second-ai-performance/ | 14/8/2026 |
| 2 | OpenAI Blog - Ultrafast Mode for GPT-5.6 Sol Featuring 14x Speed Increase via Cerebras Hardware | https://openai.com/blog/ultrafast-mode-gpt-5-6-sol-cerebras | 14/8/2026 |
| 3 | OpenAI Blog - Dali Rajic Appointed Chief Revenue Officer | https://openai.com/blog/dali-rajic-chief-revenue-officer | 14/8/2026 |