WEBSITE ĐANG PHÁT TRIỂN

\"Hóa đơn token\" của AI: cuộc chạy đua kiểm soát chi phí compute trong ngành công nghệ

500 triệu USD. Đó là hóa đơn Claude mà một công ty (giấu tên) nhận được sau khi quên đặt giới hạn sử dụng cho nhân viên. Uber tiêu hết toàn bộ ngân sách AI coding cho cả năm 2026 chỉ trong 4 tháng đầu năm. Microsoft phải rút lại giấy phép Claude Code đã cấp cho lập trình viên. Con số này có nghĩa là: ngành công nghệ đang bước vào giai đoạn "hóa đơn đến hạn" của cuộc cách mạng AI agent, và doanh nghiệp buộc phải học cách quản lý token như quản lý tiền điện.

\

Nội dung chính

1. Khi ngân sách AI "bốc hơi" nhanh hơn dự tính

Con số này có nghĩa là: chi phí vận hành AI agent năm 2026 đã vượt xa mọi dự báo tài chính đặt ra hồi cuối 2025. Theo TechCrunch, Uber đã tiêu hết toàn bộ ngân sách dành cho AI coding của cả năm 2026 chỉ trong tháng 4, dù giá mỗi token đang giảm dần theo thời gian. Nghịch lý này cho thấy vấn đề không nằm ở giá, mà ở khối lượng sử dụng tăng nhanh hơn tốc độ giảm giá.

Priceline gặp tình huống tương tự khi hợp đồng gia hạn với Cursor (công cụ AI coding) tăng 4-5 lần chi phí so với hợp đồng cũ, buộc công ty phải áp giới hạn token cho một số nhóm nhân viên. Trường hợp cực đoan nhất được ghi nhận: một công ty (không được nêu tên) tích lũy hóa đơn Claude lên tới 500 triệu USD sau khi không đặt giới hạn sử dụng (usage limit) cho nhân viên, để AI agent tự do "chạy" mà không ai theo dõi chi phí.

Để đặt vào bối cảnh: J.R. Storment, giám đốc điều hành tổ chức FinOps Foundation, chuyên theo dõi chi phí tài chính vận hành công nghệ, cho biết nhiều công ty báo cáo đã tiêu gấp 3 lần toàn bộ ngân sách token dự kiến cho cả năm 2026, chỉ tính đến tháng 4 và 5. Microsoft, sau khi cấp giấy phép Claude Code cho lập trình viên, đã phải thu hồi lại chỉ vài tháng sau vì chi phí vượt kiểm soát, một sự kiện đủ lớn để báo chí Việt Nam như CafeF cũng đưa tin dưới góc "giàu như Microsoft cũng không chịu nổi hóa đơn Claude Code".

2. Tại sao chi phí tăng nhanh đến vậy?

Dữ liệu từ Jellyfish cho thấy một hiện tượng đáng chú ý: những lập trình viên tiêu tốn nhiều token nhất không tương xứng năng suất. Nhóm dùng token nhiều nhất chỉ năng suất gấp đôi so với nhóm dùng mức trung bình, nhưng lại tiêu tốn gấp 10 lần lượng token để đạt kết quả đó. Nói cách khác, hiệu suất trên mỗi token đang giảm dần khi mức sử dụng tăng, một dạng "quy luật lợi tức giảm dần" quen thuộc trong kinh tế học, giờ áp dụng cho AI agent.

Tính trên đầu người, lượng token tiêu thụ mỗi lập trình viên đã tăng khoảng 18,6 lần chỉ trong 9 tháng, chủ yếu do các tính năng "agentic" (AI agent tự thực hiện nhiều bước liên tiếp thay vì trả lời một câu hỏi đơn) ngày càng phổ biến. Một AI agent hiện đại có thể tự đọc code, tự viết, tự kiểm tra, tự sửa lỗi, lặp lại vòng này nhiều lần cho một tác vụ, mỗi vòng lặp đều tiêu tốn token. Càng agent "thông minh" và tự chủ, càng dễ tiêu tốn compute mà không ai kiểm soát trực tiếp.

Người đứng đầu khối doanh nghiệp của OpenAI mô tả sự thay đổi trong các buổi họp với khách hàng: "Trước đây các cuộc trò chuyện luôn xoay quanh năng lực, AI làm được gì, có đủ tốt không. Giờ không còn như vậy nữa, mọi cuộc trò chuyện xoay quanh chi tiêu, khả năng theo dõi, khả năng kiểm toán, kiểm soát token, và hiệu quả mô hình."

3. Ngành công nghệ đang xây dựng "kế toán" cho token

Dữ liệu thị trường cho thấy phản ứng đang diễn ra nhanh: một loạt công ty mới nổi như Pay-i, Paid, Jellyfish và Faros AI hiện cung cấp dịch vụ theo dõi token, đo lường mức sử dụng, và tối ưu chi phí AI, tương tự cách các công ty FinOps từng giúp doanh nghiệp kiểm soát chi phí cloud một thập kỷ trước.

Một hướng đi khác là "định tuyến mô hình" (model routing): công ty Factory ra mắt công cụ tự động chọn mô hình AI phù hợp nhất cho từng tác vụ, thay vì luôn dùng mô hình đắt nhất. Nhiều hóa đơn Claude doanh nghiệp hiện được định tuyến sang các mô hình rẻ hơn như Sonnet hoặc Haiku thay vì mô hình cao cấp Opus cho các tác vụ không cần độ chính xác tối đa.

Đáng chú ý, Linux Foundation, tổ chức phi lợi nhuận đứng sau nhiều tiêu chuẩn mở của ngành công nghệ, vừa công bố sáng lập "Tokenomics Foundation" nhằm xây dựng định nghĩa và chỉ số chung cho kinh tế học token, dự kiến hoàn thiện vào tháng 7/2026. Đây là dấu hiệu ngành đã thừa nhận: chi phí token cần được chuẩn hóa như cách ngành viễn thông từng chuẩn hóa cách tính cước data.

Bối cảnh chi phí này không tách rời khỏi bối cảnh nhân sự đã nói ở các bài trước: theo TechTimes, chỉ trong 6 tháng đầu 2026, ngành công nghệ Mỹ đã công bố cắt giảm 139.156 việc làm, tăng 83% so với cùng kỳ. Một phần lý do là ngân sách công nghệ đang dịch chuyển, từ chi cho nhân sự sang chi cho hạ tầng compute và công cụ AI, đúng loại chi phí đang "bốc hơi" nhanh mà bài viết này mô tả.

Chris Reed của Priceline mô tả tình huống bằng một so sánh dễ hiểu: "Mọi công nghệ mới đều đi kèm lỗi tính cước và cơ hội tối ưu, giống hệt ngành viễn thông." Dữ liệu thực tế cho thấy hướng đi hiệu quả nhất không phải là hạn chế AI, mà là mở rộng việc dùng AI ở mức vừa phải cho nhiều người, thay vì đẩy một nhóm nhỏ dùng ngày càng nhiều, cách làm này cho ROI tốt hơn so với chỉ tập trung vào "power user".

Điều này ảnh hưởng gì đến bạn?

Nếu doanh nghiệp của bạn tại Việt Nam đang hoặc sắp trang bị công cụ AI agent (từ trợ lý coding như Cursor, Claude Code, đến chatbot chăm sóc khách hàng tự động), con số này có nghĩa là: đừng đợi hóa đơn về mới bắt đầu quan tâm đến ngân sách. Ngay cả với mức giá token đang giảm dần, khối lượng sử dụng agentic tăng theo cấp lũy tiến khi công cụ càng "thông minh" và được nhân viên dùng nhiều hơn. Để dễ hình dung quy mô: hóa đơn 500 triệu USD của công ty ẩn danh nói trên tương đương khoảng 12.500 tỷ đồng, gần bằng ngân sách công nghệ cả năm của nhiều tập đoàn lớn tại Việt Nam, chỉ vì thiếu một dòng cấu hình giới hạn sử dụng.

Vấn đề này không còn xa với thị trường lao động công nghệ Việt Nam. Một kỹ sư công nghệ Việt Nam có ảnh hưởng, Duy Luân, chia sẻ trên Threads rằng một công ty nước ngoài trả lương thuộc hàng cao nhất tại Việt Nam đang bắt đầu giới hạn loại mô hình AI mà lập trình viên được dùng, nhiều khả năng vì chi phí quá cao, trong khi một công ty lớn khác đang triển khai Cursor rất thận trọng, theo từng nhóm nhỏ thay vì đồng loạt toàn công ty, vì lo ngại đúng vấn đề chi phí mà bài viết này mô tả.

Điều này càng đáng chú ý khi đặt cạnh dữ liệu lương của TopDev, nền tảng tuyển dụng IT hàng đầu Việt Nam: senior engineer có khả năng thiết kế hệ thống AI phức tạp tại Việt Nam năm 2026 có thể chạm ngưỡng lương 80-120 triệu đồng/tháng. Nếu chi phí nhân sự AI đã cao đến vậy, doanh nghiệp càng không thể để chi phí công cụ AI "chạy" không kiểm soát phía sau, biến khoản đầu tư nhân tài thành khoản lỗ kép.

Ba việc cụ thể doanh nghiệp Việt Nam đang cấp Cursor hoặc Claude Code cho lập trình viên nên làm ngay:

  1. Đặt giới hạn sử dụng (usage limit/rate limit) cho mọi tài khoản AI agent trước khi triển khai rộng, không đợi đến khi hóa đơn về mới xử lý. Một giới hạn hợp lý ban đầu có thể là vài trăm nghìn token/người/ngày, rồi điều chỉnh dần theo thực tế.
  2. Theo dõi mức tiêu thụ token định kỳ hàng tuần, tương tự cách theo dõi hóa đơn điện, nước, vì mức tăng có thể diễn ra rất nhanh trong vài tuần.
  3. Ưu tiên mô hình rẻ hơn (Sonnet, Haiku, hoặc các mô hình mã nguồn mở) cho tác vụ đơn giản, chỉ dùng mô hình cao cấp cho tác vụ thật sự cần độ chính xác cao.

Một lập trình viên Việt Nam đã chia sẻ trên Viblo trải nghiệm thực tế so sánh hiệu quả chi phí giữa Claude Code và Cursor sau một tuần sử dụng, cho thấy đây không còn là vấn đề riêng của các hãng công nghệ lớn ở Mỹ, mà đã lan tới cả developer Việt Nam.

Với doanh nghiệp mới tập làm AI, hãy nhớ nguyên tắc từ dữ liệu Jellyfish: dùng AI nhiều hơn không đồng nghĩa hiệu quả hơn, đôi khi ngược lại.

Số liệu & thống kê

  • 500 triệu USD: hóa đơn Claude của một công ty ẩn danh do không đặt giới hạn sử dụng.
  • Uber tiêu hết ngân sách AI coding cả năm 2026 chỉ trong 4 tháng đầu năm.
  • Hợp đồng Cursor của Priceline tăng 4-5 lần chi phí khi gia hạn.
  • Nhiều công ty báo cáo tiêu gấp 3 lần ngân sách token dự kiến cho cả năm, chỉ tính đến tháng 4-5/2026 (FinOps Foundation).
  • Lượng token tiêu thụ mỗi lập trình viên tăng khoảng 18,6 lần trong 9 tháng.
  • Nhóm dùng token nhiều nhất: năng suất gấp đôi nhưng tiêu tốn gấp 10 lần token so với nhóm trung bình (Jellyfish).
  • Tokenomics Foundation (Linux Foundation) dự kiến ra mắt chuẩn chung về kinh tế token vào tháng 7/2026.
  • Ngành công nghệ Mỹ cắt 139.156 việc làm trong 6 tháng đầu 2026, tăng 83% so với cùng kỳ (TechTimes).

Sources

# Title URL Ghi chú
1 The token bill comes due: Inside the industry scramble to manage AI's runaway costs https://techcrunch.com/2026/06/05/the-token-bill-comes-due-inside-the-industry-scramble-to-manage-ais-runaway-costs/ TechCrunch, 5/6/2026
2 AI leads US job cuts for record 4th month as tech claims 31% of H1 layoffs https://www.techtimes.com/articles/319588/20260703/ai-leads-us-job-cuts-record-4th-month-tech-claims-31-h1-layoffs.htm TechTimes, 3/7/2026, bối cảnh chi tiêu AI thay thế chi tiêu nhân sự
3 Giàu như Microsoft cũng không chịu nổi hóa đơn Claude Code https://cafef.vn/giau-nhu-microsoft-cung-khong-chiu-noi-hoa-don-claude-code-phai-huy-goi-cua-hang-nghin-ky-su-du-duoc-ua-thich-188260522133606132.chn CafeF, nguồn tiếng Việt, xác nhận case Microsoft
4 Trải nghiệm thực tế Claude Code và Cursor: hiệu quả chi phí sau một tuần sử dụng https://viblo.asia/p/trai-nghiem-thuc-te-claude-code-va-cursor-hieu-qua-chi-phi-thuc-su-sau-mot-tuan-su-dung-pgjLNgwEV32 Viblo, chia sẻ từ developer Việt Nam
5 Tóm tắt tình hình dùng AI cho việc code ở một số công ty https://www.threads.com/@duyluannice/post/DaScFCFCTDa/ Threads, kỹ sư Duy Luân, case công ty tại Việt Nam giới hạn model AI vì chi phí
6 Báo cáo thị trường IT Việt Nam https://topdev.vn/page/bao-cao-it-viet-nam TopDev, số liệu lương senior AI engineer Việt Nam 2026

Bài viết liên quan

Xem thêm
Tin tức AI

Xiaomi ra mắt MiMo Code mã nguồn mở, vượt Claude Code ở nhiệm vụ siêu dài

Hãy nói thẳng: Xiaomi vừa tung ra MiMo Code, một trợ lý AI viết code chạy trong terminal (dòng lệnh), mã nguồn mở, miễn phí dùng model đi kèm trong thời gian giới hạn, và tuyên bố vượt Claude Code của Anthropic ở các nhiệm vụ dài hơn 200 bước thao tác. Điểm hay nhất không phải model AI bên trong, mà là cách nó "ghi nhớ" xuyên suốt phiên làm việc dài, thứ mà hầu hết AI coding assistant hiện nay vẫn làm rất tệ. Nhưng số liệu là do Xiaomi tự công bố, chưa ai kiểm chứng độc lập, nên đọc kỹ trước khi tin.

Tin tức AI

Wikipedia đình công vì AI: hàng trăm biên tập viên đe dọa ngừng sửa bài

Hàng trăm biên tập viên Wikipedia – những người tình nguyện duy trì chất lượng nội dung – đang đe dọa đình công sau khi Wikimedia Foundation sa thải toàn bộ nhóm Community Tech vào tháng 5 năm 2026. Đây là nhóm kỹ sư xây dựng công cụ kiểm duyệt và chống phá hoại mà biên tập viên dựa vào hàng ngày. Nghiêm trọng hơn: Wikipedia là nguồn dữ liệu training chính cho hầu hết mô hình AI lớn. Nếu chất lượng Wikipedia suy giảm, chất lượng AI cũng sẽ bị ảnh hưởng theo.