Nội dung chính
1. OCR 4 không chỉ đọc chữ, nó "hiểu" cấu trúc trang giấy
Ngày 23/6/2026, Mistral AI ra mắt OCR 4, thế hệ thứ tư trong vòng khoảng 15 tháng. Điểm khác biệt lớn nhất so với các đời trước: OCR 4 không trả về một dòng chữ liền mạch, mà trả về "bản đồ" của cả trang tài liệu.
Mỗi khối nội dung được khoanh vùng bằng bounding box (tọa độ vị trí), phân loại theo loại khối (tiêu đề, bảng, công thức, chữ ký...), và gắn điểm tin cậy (confidence score) ở cả cấp trang và cấp từng từ. Theo mô tả của Mistral (tôi chưa tự kiểm chứng bằng tài liệu thật), điều này giải quyết đúng vấn đề mà dân làm document processing hay gặp: biết chữ nằm ở đâu trên trang để trích dẫn lại, biết khối nào là bảng để đưa vào pipeline dữ liệu riêng, biết khối nào là chữ ký để tự động đẩy vào luồng xác minh.
Theo Mistral, bounding box là tính năng khách hàng yêu cầu nhiều nhất trong các phiên bản trước. Lý do dễ hiểu: không có tọa độ, hệ thống downstream không thể trả lời câu hỏi "số liệu này lấy từ đâu trong tài liệu gốc", một câu hỏi bắt buộc phải trả lời được trong các workflow tuân thủ (compliance) hay RAG (retrieval-augmented generation) doanh nghiệp.
Model hỗ trợ 170 ngôn ngữ trên 10 nhóm ngôn ngữ, nhận nhiều định dạng phổ biến gồm PDF, DOC, PPT, OpenDocument. Mistral không công bố danh sách 170 ngôn ngữ chi tiết, nên tiếng Việt có được hỗ trợ hay không tôi chưa xác nhận được, và chất lượng thực tế trên hóa đơn, hợp đồng viết tay tiếng Việt vẫn là câu hỏi mở.
2. Có thể tự triển khai trên máy chủ riêng, đúng bài cho doanh nghiệp ngại đưa dữ liệu ra nước ngoài
Điểm tôi thích nhất ở OCR 4: model đủ nhỏ để chạy trong một container duy nhất, nghĩa là doanh nghiệp có thể tự host trên hạ tầng riêng, không phải gửi hóa đơn hay hợp đồng nhạy cảm qua API của bên thứ ba.
Đây không phải tính năng ngẫu nhiên. Mistral đang định vị rõ ràng: doanh nghiệp châu Âu (và bất kỳ nơi nào lo ngại luật pháp Mỹ có thể ảnh hưởng tới dữ liệu lưu ở cloud Mỹ) giờ có lựa chọn giữ toàn bộ tài liệu trong hạ tầng của chính họ. Bối cảnh này càng rõ nét sau vụ Anthropic bị buộc ngừng cung cấp mô hình Fable 5, Mythos 5 cho người dùng ngoài Mỹ từ 12/6/2026 theo lệnh xuất khẩu của Bộ Thương mại Mỹ, một sự kiện khiến nhiều doanh nghiệp giật mình về rủi ro phụ thuộc nhà cung cấp AI nước ngoài.
Với doanh nghiệp Việt Nam xử lý hợp đồng có điều khoản bảo mật nghiêm ngặt (ngân hàng, bảo hiểm, y tế), khả năng tự host là điểm cộng thực tế, không chỉ là chiêu marketing về "chủ quyền dữ liệu". Đây cũng đúng lúc: quy định hóa đơn điện tử hiện hành (Thông tư 32/2025/TT-BTC, thay thế Thông tư 78/2021/TT-BTC từ 1/6/2025) khiến nhiều doanh nghiệp Việt đang ngồi trên núi hóa đơn PDF/XML cần trích xuất dữ liệu để đối chiếu, và phần mềm kế toán như MISA hay FAST vẫn chủ yếu xử lý theo mẫu cố định, chưa mạnh ở việc đọc hợp đồng hay biên bản dạng tự do.
3. Benchmark Mistral công bố: 72% thắng trong đánh giá của con người, nhưng bảng xếp hạng công khai thì phức tạp hơn
Mistral báo cáo OCR 4 đạt tỷ lệ thắng trung bình 72% trong đánh giá trực tiếp của con người, dựa trên hơn 600 tài liệu thực tế ở hơn 12 ngôn ngữ, so với các hệ thống OCR và document-AI hàng đầu khác. Model cũng đạt điểm cao nhất trên OlmOCRBench (85,20) và 93,07 trên OmniDocBench.
Điều tôi đánh giá cao: Mistral chủ động công khai các lỗi đo lường trong benchmark tự động của chính họ, gồm lỗi trong dữ liệu tham chiếu, công thức LaTeX tương đương nhưng bị tính sai là không khớp, giả định thứ tự đọc cột sai, và lỗi gán tiêu đề/chân trang. Họ nói thẳng: "chúng tôi coi điểm tổng hợp là mang tính định hướng, không phải kết luận cuối cùng". Rất hiếm nhà cung cấp AI thừa nhận điều này công khai, và đó là lý do tôi tin số liệu 72% hơn nhiều benchmark PR thông thường.
Nhưng quảng cáo nói một chuyện, bảng xếp hạng công khai lại nói chuyện khác. Trên OlmOCRBench công khai, một số nhà nghiên cứu ghi nhận OCR 4 hiện xếp thứ ba, sau các model mã nguồn mở như Chandra OCR 2. Một số model mở khác như PaddleOCR-VL-1.6 tự báo cáo điểm OmniDocBench cao hơn (96,33), tuy chưa được xác minh độc lập trên bảng xếp hạng công khai.
Phản hồi từ khách hàng doanh nghiệp thực tế khá tích cực. Aidan Donohue, kỹ sư AI tại công ty tài chính Rogo, cho biết họ benchmark OCR 4 với các bộ phân tích tài liệu agentic hàng đầu trên tập dữ liệu tài chính nhiều bảng biểu, đạt độ chính xác tương đương nhưng chi phí thấp hơn khoảng 8 lần và độ trễ thấp hơn khoảng 17 lần. Ivan Mihailov, kỹ sư AI tại công ty quản lý sở hữu trí tuệ Anaqua, nói OCR 4 nhanh hơn khoảng 4 lần mỗi trang so với nhà cung cấp cũ họ dùng.
4. So với Google Document AI và các mô hình vision đa năng như GPT/Claude thì sao?
Đây là câu hỏi thực tế nhất với người đọc không chuyên: nên chọn OCR chuyên dụng hay dùng luôn tính năng "đọc ảnh" tích hợp trong ChatGPT, Gemini, Claude?
Không có phép màu ở đây. Bối cảnh thị trường mà VentureBeat mô tả cho thấy hai nhóm sản phẩm khác hẳn nhau. Nhóm mã nguồn mở như Unlimited-OCR của Baidu (ra mắt chỉ một ngày trước OCR 4, giấy phép MIT cho phép dùng miễn phí cả cho mục đích thương mại, chạy trên GPU thông thường) phù hợp cho team kỹ thuật muốn tự host, không cần SLA doanh nghiệp (cam kết chất lượng dịch vụ bằng hợp đồng, ví dụ thời gian phản hồi, độ chính xác tối thiểu). Nhóm còn lại, gồm OCR 4, Document AI của Google Cloud, Amazon Textract, Azure Document Intelligence, ABBYY Vantage, là sản phẩm thương mại có SLA, hợp đồng xử lý dữ liệu, hỗ trợ audit (kiểm tra, truy vết lại toàn bộ quá trình xử lý khi có sai sót), đúng đối tượng cho phòng IT hoặc kế toán cần một quy trình ổn định, có trách nhiệm rõ ràng khi có lỗi.
Với các mô hình vision đa năng như GPT vision hay Claude, một bình luận thực tế trên Hacker News đáng chú ý: một người dùng cho biết dùng Claude để OCR hàng trăm trang tài liệu viết tay, kết quả "không cần sửa gì" và model còn tự phát hiện một lỗi logic trong văn bản gốc. Ngược lại, một người có 10 năm làm document parsing nhận xét thẳng: "OCR vẫn tệ vào năm 2026". Nói cách khác: chất lượng OCR, dù là công cụ chuyên dụng hay model vision đa năng, phụ thuộc rất nhiều vào loại tài liệu, ngôn ngữ, và chất lượng bản gốc. Không có công cụ nào thắng tuyệt đối ở mọi loại tài liệu.
Tốt cho: doanh nghiệp cần pipeline OCR ổn định, có audit trail, xử lý khối lượng lớn hóa đơn/hợp đồng, cần bounding box để trích dẫn nguồn. Không phù hợp với: người dùng cá nhân chỉ cần đọc nhanh một, hai trang, việc đó dùng thẳng ChatGPT hay Gemini chụp ảnh vẫn nhanh và rẻ hơn nhiều.
Điểm tôi không thích: Mistral tự nhận đạt "điểm tổng thể cao nhất" trên OlmOCRBench, nhưng đó là theo cách họ tự trình bày benchmark. Trên bảng xếp hạng công khai của chính OlmOCRBench, OCR 4 hiện chỉ xếp thứ ba, sau các model mã nguồn mở như Chandra OCR 2. Khoảng cách giữa "hãng nói" và "bảng xếp hạng công khai nói" này là điều bất kỳ ai định mua công cụ này cũng nên biết trước, không phải đọc lướt qua trang thông báo sản phẩm rồi tin luôn.
Điều này ảnh hưởng gì đến bạn?
Nếu bạn là chủ doanh nghiệp nhỏ hoặc kế toán viên đang xử lý hàng trăm hóa đơn, hợp đồng mỗi tháng bằng tay, đây là tín hiệu công cụ OCR AI đang tiến gần tới mức "đủ tin cậy để giao việc thật", không chỉ demo cho vui. Tính năng phân loại khối (bảng, chữ ký, tiêu đề) đặc biệt hữu ích khi bạn cần tách riêng bảng số liệu trong hóa đơn điện tử (theo Thông tư 32/2025/TT-BTC) để nhập vào phần mềm kế toán như MISA hay FAST, hoặc tự động phát hiện chữ ký trên hợp đồng để đưa vào luồng phê duyệt. Với một doanh nghiệp xử lý khoảng 2.000 hóa đơn/tháng, chi phí OCR 4 qua batch API (2 USD/1.000 trang) rơi vào khoảng 4 USD mỗi tháng, tức khoảng 105.000 VNĐ theo tỷ giá hiện tại, một con số nhỏ so với thời gian nhân viên bỏ ra để nhập liệu tay.
Lời khuyên thực tế: đừng tin số liệu benchmark của bất kỳ nhà cung cấp nào, kể cả Mistral. Trước khi chọn, hãy tự test trên đúng loại tài liệu bạn dùng hàng ngày, ví dụ 20-30 hóa đơn hoặc hợp đồng tiếng Việt thật, chữ viết tay xen chữ in, xem tỷ lệ sai sót thực tế thế nào. Nếu budget hạn chế và chỉ xử lý vài chục trang mỗi tuần, dùng thử tính năng vision có sẵn trong ChatGPT hoặc Gemini trước, chưa cần đầu tư vào công cụ OCR chuyên dụng có phí theo trang.
Ví dụ thực tế / Bảng so sánh tính năng
| Tiêu chí | Mistral OCR 4 | Document AI của Google Cloud | ChatGPT/Claude vision (tính năng đọc ảnh có sẵn) |
|---|---|---|---|
| Bounding box + phân loại khối | Có, chi tiết (tiêu đề, bảng, công thức, chữ ký) | Có, nhưng cấu hình riêng theo use case | Không có sẵn, phải tự yêu cầu bằng prompt |
| Tự host trên máy chủ riêng | Có (single container) | Không, chạy trên Google Cloud | Không |
| Giá | 4 USD/1.000 trang qua API (2 USD/1.000 trang qua batch API); 5 USD/1.000 trang qua Document AI riêng của Mistral trong Mistral Studio | Khoảng 1,5-30 USD/1.000 trang, tùy loại processor (OCR cơ bản, custom extractor, invoice parser) | Trả theo gói ChatGPT Plus/Gemini Advanced hàng tháng, không tính riêng theo trang |
| Phù hợp nhất cho | Doanh nghiệp xử lý khối lượng lớn, cần audit trail | Doanh nghiệp đã dùng sẵn Google Cloud | Cá nhân, xử lý vài trang lẻ tẻ |
Số liệu & thống kê
- Tỷ lệ thắng trung bình trong đánh giá con người: 72%, trên hơn 600 tài liệu, hơn 12 ngôn ngữ (Mistral công bố)
- Điểm OlmOCRBench: 85,20 (cao nhất tổng thể theo Mistral, nhưng xếp thứ 3 trên bảng công khai)
- Điểm OmniDocBench: 93,07 (PaddleOCR-VL-1.6 tự báo cáo 96,33, chưa xác minh độc lập)
- Giá OCR 4: 4 USD/1.000 trang qua API, giảm còn 2 USD/1.000 trang qua batch; 5 USD/1.000 trang qua Document AI riêng của Mistral trong Mistral Studio (khác với Document AI của Google Cloud)
- Thị trường xử lý tài liệu thông minh toàn cầu: khoảng 2,3 tỷ USD (2024), dự báo đạt 12,35 tỷ USD vào 2030, tăng trưởng 33,1%/năm (Grand View Research)
- Rogo: chi phí thấp hơn 8 lần, độ trễ thấp hơn 17 lần so với các bộ phân tích agentic khác trên dữ liệu tài chính
- Anaqua: nhanh hơn 4 lần mỗi trang so với nhà cung cấp cũ
Sources
| # | Title | URL | Ghi chú |
|---|---|---|---|
| 1 | Mistral launches OCR 4, turning document extraction into a full enterprise AI play | https://venturebeat.com/data/mistral-launches-ocr-4-turning-document-extraction-into-a-full-enterprise-ai-play | VentureBeat, 24/6/2026 |
| 2 | Mistral OCR 4: SOTA OCR for Document Intelligence | https://mistral.ai/news/ocr-4/ | Thông báo chính thức từ Mistral AI |
| 3 | Intelligent Document Processing Market Report | https://www.grandviewresearch.com/industry-analysis/intelligent-document-processing-market-report | Grand View Research, nguồn số liệu quy mô thị trường |
| 4 | Document AI pricing | https://cloud.google.com/document-ai/pricing | Google Cloud, nguồn giá Document AI của Google |
| 5 | Thông tư 32/2025/TT-BTC về hóa đơn, chứng từ (thay thế Thông tư 78/2021/TT-BTC từ 1/6/2025) | https://xaydungchinhsach.chinhphu.vn/mot-so-noi-dung-moi-cua-thong-tu-so-32-2025-tt-btc-ve-hoa-don-chung-tu-119250608110422544.htm | Cổng thông tin điện tử Chính phủ |