WEBSITE ĐANG PHÁT TRIỂN

Cuộc chiến \"bộ nhớ\" AI agent: MRAgent tiết kiệm token gấp 27 lần so với LangMem

Nhìn rộng hơn: cuộc đua AI agent đang dần chuyển trọng tâm, từ câu hỏi "mô hình nào thông minh hơn" sang câu hỏi ít được nói tới nhưng quyết định hóa đơn vận hành nhiều hơn, đó là "ai quản lý bộ nhớ rẻ hơn". 118.000 so với 3.260.000, đó là số token mà hai framework bộ nhớ AI agent tiêu tốn để trả lời cùng một câu hỏi phức tạp trong bài kiểm tra LongMemEval. MRAgent, framework mới từ nhóm nghiên cứu Đại học Quốc gia Singapore (NUS), chỉ dùng 118.000 token, trong khi LangMem, một framework phổ biến, đốt tới 3,26 triệu token, gấp khoảng 27 lần. Đặt trong bối cảnh chi phí vận hành: cách một AI agent "nhớ" thông tin cũ đang trở thành yếu tố quyết định hóa đơn API hàng tháng, không kém gì việc chọn mô hình AI nào.

Cuộc chiến \

Nội dung chính

1. Vấn đề: AI agent "quên" hoặc "nhớ nhầm" khi hội thoại kéo dài

Nhìn rộng hơn, điểm yếu cốt lõi của AI agent hiện nay không nằm ở khả năng suy luận, mà ở bộ nhớ. Khi một AI agent phải xử lý hội thoại dài, hàng chục phiên làm việc, hàng trăm lượt trao đổi, cửa sổ ngữ cảnh (context window) của mô hình sẽ đầy rất nhanh. Cách giải quyết cũ, gọi là "truy xuất rồi suy luận" (retrieve-then-reason), tìm tài liệu liên quan bằng tìm kiếm vector (một kỹ thuật so khớp theo ý nghĩa câu chữ, không phải so khớp từ khóa đơn giản) hoặc dò theo sơ đồ liên kết dữ liệu, rồi đưa hết cho mô hình xử lý. Cách này đang lộ ra ba lỗ hổng lớn theo nhóm nghiên cứu NUS.

Thứ nhất, hệ thống không thể điều chỉnh lại chiến lược tìm kiếm giữa đường. Nếu agent lấy được một tài liệu và phát hiện thiếu một chi tiết quan trọng (một ngày cụ thể, một cái tên), nó không có cách nào tự đặt câu hỏi tìm kiếm mới dựa trên phát hiện đó.

Thứ hai, các điểm tương đồng cố định và cách mở rộng dữ liệu định trước thường trả về kết quả chỉ giống bề mặt, làm ngập cửa sổ ngữ cảnh của mô hình bằng nhiễu không liên quan, khiến khả năng suy luận giảm.

Thứ ba, hệ thống hiện tại phụ thuộc nặng vào cấu trúc dựng sẵn như "chỉ lấy N kết quả giống nhất" (top-k, một quy tắc tìm kiếm cố định số lượng), thiếu linh hoạt để mở rộng cho các tương tác dài, khó đoán trước.

2. MRAgent hoạt động như bộ não con người tái tạo ký ức

Dữ liệu từ nhóm nghiên cứu NUS cho thấy cách giải quyết vấn đề này lấy cảm hứng từ khoa học thần kinh nhận thức: thay vì đọc dữ liệu tĩnh, con người tái tạo ký ức theo kiểu liên tưởng, bắt đầu từ một gợi ý nhỏ (một cái tên, một hành động, một địa điểm), rồi từng bước lần ra các mảnh thông tin liên quan, cho đến khi ghép được câu chuyện đầy đủ.

MRAgent (Memory Reasoning Architecture for LLM Agents) áp dụng đúng nguyên lý đó. Framework tổ chức bộ nhớ theo cơ chế ba lớp gọi là "Cue-Tag-Content": Cue là các từ khóa nhỏ, cụ thể (tên người, hành động, thuộc tính ngữ cảnh); Content là các đơn vị ký ức thực tế được lưu trữ, chia theo nhiều lớp như ký ức sự kiện cụ thể và ký ức ngữ nghĩa (sự thật, sở thích ổn định); Tag đóng vai trò cầu nối ngữ nghĩa, tóm tắt mối liên hệ giữa Cue và Content.

Cách vận hành cụ thể: khi nhận một câu hỏi phức tạp, ví dụ "Nate đã dùng tiền thưởng thế nào sau khi thắng giải đấu game lần thứ ba?", mô hình trước tiên trích các gợi ý nhỏ như "Nate", "giải đấu game", "thắng". Từ các gợi ý này, agent dò tới các Tag liên quan như "Chiến thắng giải đấu" và "Tham gia giải đấu", rồi tự loại bỏ nhánh không liên quan (ở đây là tham gia, vì câu hỏi chỉ quan tâm sau khi thắng), chỉ theo nhánh chiến thắng. Nó tiếp tục lấy các ký ức sự kiện cụ thể gắn với nhánh đó, đánh giá, loại bỏ ký ức không liên quan, rồi lặp lại vòng dò tìm mới dựa trên thông tin vừa tìm được, cho đến khi đủ dữ kiện trả lời.

Điểm mấu chốt: mô hình đánh giá Tag (bản tóm tắt ngắn) trước khi quyết định có cần mở Content (dữ liệu chi tiết, nặng) hay không, nhờ vậy tránh được việc tiêu tốn token và năng lực xử lý (compute, tài nguyên tính toán của máy chủ) vào những nhánh dữ liệu hóa ra không liên quan.

3. Con số cụ thể: tiết kiệm token gấp 27 lần, giảm gần một nửa thời gian chạy

Đặt trong bối cảnh kiểm chứng thực tế: nhóm nghiên cứu kiểm tra MRAgent trên hai benchmark ngành là LoCoMo và LongMemEval, các bài kiểm tra khả năng xử lý hội thoại dài hàng chục phiên, hàng trăm lượt trao đổi, dùng hai mô hình nền là Gemini 2.5 Flash và Claude Sonnet 4.5, đối chiếu với các framework RAG chuẩn (Retrieval-Augmented Generation, kỹ thuật truy xuất tài liệu rồi đưa cho AI đọc trước khi trả lời), A-Mem, MemoryOS, LangMem và Mem0.

Kết quả trong bài kiểm tra LongMemEval: MRAgent chỉ tiêu tốn 118.000 token cho mỗi câu hỏi. A-Mem tiêu tốn 632.000 token, gấp khoảng 5,4 lần. LangMem tiêu tốn 3,26 triệu token, gấp khoảng 27,6 lần so với MRAgent. Về thời gian xử lý, MRAgent giảm gần một nửa so với A-Mem, từ 1.122 giây xuống còn 586 giây. Trên cả hai mô hình nền và mọi dạng câu hỏi, MRAgent vượt qua toàn bộ các framework đối chiếu với biên độ đáng kể, theo công bố của nhóm nghiên cứu.

Điểm đáng chú ý nằm ở hành vi "biết khi nào nên dừng" của MRAgent: mô hình tự đánh giá lượng ngữ cảnh đã tích lũy và ngừng tìm kiếm khi đủ dữ liệu, nhờ vậy tránh hoàn toàn việc quét dữ liệu dư thừa, một trong những nguyên nhân chính khiến các framework cũ đốt token vô tội vạ.

Điều này ảnh hưởng gì đến bạn?

Việt Nam đã có ví dụ thực tế về AI agent cần bộ nhớ dài hạn. FPT AI Agents, nền tảng trợ lý AI của FPT, đã được triển khai cho VnExpress để tự động tư vấn thông tin các sự kiện marathon (từ đăng ký đến nhận mã QR), và cho Tổng cục Thống kê để hỗ trợ Tổng điều tra Nông thôn - Nông nghiệp. Cả hai đều là AI agent phải xử lý hàng loạt câu hỏi lặp lại, kéo dài theo thời gian, đúng loại bài toán mà hiệu quả bộ nhớ quyết định chi phí vận hành.

Nếu doanh nghiệp Việt Nam đang xây dựng chatbot chăm sóc khách hàng, trợ lý nội bộ, hay bất kỳ AI agent nào cần "nhớ" lịch sử tương tác với người dùng qua nhiều lần trò chuyện, cách chọn framework quản lý bộ nhớ (memory) sẽ ảnh hưởng trực tiếp đến hóa đơn API hàng tháng, không kém gì việc chọn mô hình AI nào. Con số gấp 27 lần giữa MRAgent và LangMem không phải khác biệt nhỏ, đó là khác biệt giữa hóa đơn vài trăm nghìn đồng và vài triệu đồng cho cùng một khối lượng câu hỏi.

Ví dụ cụ thể: một chatbot chăm sóc khách hàng xử lý 10.000 câu hỏi phức tạp mỗi tháng, nếu dùng framework kiểu LangMem sẽ tốn khoảng 32,6 tỷ token/tháng. Dùng framework hiệu quả kiểu MRAgent chỉ tốn khoảng 1,18 tỷ token. Chênh lệch hóa đơn API tương ứng có thể lên tới hàng chục triệu đồng mỗi tháng, tùy mô hình nền đang dùng.

Đặt trong bối cảnh khu vực: Indonesia và Philippines cũng đang chạy đua xây dựng AI agent cho thị trường nội địa, nơi biên lợi nhuận trên mỗi khách hàng thấp hơn nhiều so với Mỹ hay Singapore. Việt Nam có lợi thế chi phí nhân sự kỹ thuật cạnh tranh, nhưng đang bị cản bởi việc phần lớn đội phát triển AI agent trong nước chưa coi hiệu quả bộ nhớ (memory efficiency) là một tiêu chí kỹ thuật bắt buộc khi chọn framework. Đây chính là biến số quyết định một startup có sống được qua giai đoạn scale hay không.

Với các thị trường nhạy cảm về chi phí như Việt Nam, khoảng cách hiệu quả token giữa các framework không còn là chi tiết kỹ thuật. Đây không phải câu hỏi về công nghệ nào tiên tiến hơn, đây là câu hỏi về ai kiểm soát được chi phí vận hành khi số lượng người dùng tăng lên gấp 10, gấp 100 lần.

Lưu ý quan trọng cho đội kỹ thuật: MRAgent yêu cầu chuẩn bị cấu trúc dữ liệu Cue-Tag-Content trước khi agent có thể truy vấn hiệu quả. Nhóm nghiên cứu đã thiết kế một quy trình tự động dùng chính LLM để xử lý lịch sử tương tác thô và tự động điền vào sơ đồ bộ nhớ, nghĩa là đội phát triển không cần gán nhãn dữ liệu thủ công.

Về mặt vận hành, việc này chỉ cần thiết lập một tiến trình xử lý chạy định kỳ ở phía sau hệ thống (tương tự một job tự động dọn dữ liệu mỗi đêm), đưa dữ liệu thô qua các mẫu câu lệnh trích xuất trước khi lưu vào cơ sở dữ liệu. Với doanh nghiệp Việt Nam mới bắt đầu xây AI agent như trường hợp FPT AI Agents nói trên, đây không phải là công việc bạn cần tự làm ngay hôm nay. Đây là tiêu chí bạn nên hỏi đối tác công nghệ hoặc nhà cung cấp giải pháp AI agent: "framework bộ nhớ của các anh dùng cơ chế gì, và đã benchmark chi phí token chưa?"

Số liệu & thống kê

  • MRAgent: 118.000 token/câu hỏi trong benchmark LongMemEval.
  • LangMem: 3.260.000 token/câu hỏi, gấp khoảng 27,6 lần MRAgent.
  • A-Mem: 632.000 token/câu hỏi, gấp khoảng 5,4 lần MRAgent.
  • Thời gian xử lý: MRAgent 586 giây so với A-Mem 1.122 giây (giảm gần 48%).
  • Benchmark: LoCoMo và LongMemEval; mô hình nền: Gemini 2.5 Flash, Claude Sonnet 4.5.
  • Nhóm phát triển: nhóm nghiên cứu tại Đại học Quốc gia Singapore (NUS).

Sources

# Title URL Ghi chú
1 AI agent memory: MRAgent cuts token use up to 27x https://venturebeat.com/orchestration/new-agentic-memory-framework-uses-118k-tokens-per-query-langmem-burns-through-3-26m VentureBeat, 9/7/2026
2 Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents https://arxiv.org/abs/2606.06036 arXiv:2606.06036, bài báo khoa học gốc, 4/6/2026
3 AI Agents Workspace: "Cơ hội vàng" để doanh nghiệp Việt bứt phá trong kỷ nguyên AI https://fpt.ai/vi/bai-viet/ai-agents-workspace-co-hoi-vang-de-doanh-nghiep-viet-but-pha-trong-ky-nguyen-ai/ FPT.AI, case triển khai FPT AI Agents tại VnExpress và Tổng cục Thống kê

Bài viết liên quan

Xem thêm
Tin tức AI

Xiaomi ra mắt MiMo Code mã nguồn mở, vượt Claude Code ở nhiệm vụ siêu dài

Hãy nói thẳng: Xiaomi vừa tung ra MiMo Code, một trợ lý AI viết code chạy trong terminal (dòng lệnh), mã nguồn mở, miễn phí dùng model đi kèm trong thời gian giới hạn, và tuyên bố vượt Claude Code của Anthropic ở các nhiệm vụ dài hơn 200 bước thao tác. Điểm hay nhất không phải model AI bên trong, mà là cách nó "ghi nhớ" xuyên suốt phiên làm việc dài, thứ mà hầu hết AI coding assistant hiện nay vẫn làm rất tệ. Nhưng số liệu là do Xiaomi tự công bố, chưa ai kiểm chứng độc lập, nên đọc kỹ trước khi tin.

Tin tức AI

Wikipedia đình công vì AI: hàng trăm biên tập viên đe dọa ngừng sửa bài

Hàng trăm biên tập viên Wikipedia – những người tình nguyện duy trì chất lượng nội dung – đang đe dọa đình công sau khi Wikimedia Foundation sa thải toàn bộ nhóm Community Tech vào tháng 5 năm 2026. Đây là nhóm kỹ sư xây dựng công cụ kiểm duyệt và chống phá hoại mà biên tập viên dựa vào hàng ngày. Nghiêm trọng hơn: Wikipedia là nguồn dữ liệu training chính cho hầu hết mô hình AI lớn. Nếu chất lượng Wikipedia suy giảm, chất lượng AI cũng sẽ bị ảnh hưởng theo.