WEBSITE ĐANG PHÁT TRIỂN

Lỗ hổng nền tảng khiến mô hình AI khó tránh tấn công bằng câu lệnh

Nhóm nghiên cứu phát hiện mô hình AI thường dựa vào phong cách văn bản để đoán nguồn chỉ dẫn, thay vì chỉ dựa vào nhãn kỹ thuật. Kẻ tấn công có thể viết nội dung giống “ghi chú nội bộ” của mô hình để đánh lừa hàng rào bảo vệ. Huấn luyện thêm và kiểm thử đối kháng giúp giảm rủi ro, nhưng nhóm tác giả cho rằng khó loại bỏ hoàn toàn mọi biến thể tấn công. Rủi ro tăng khi AI đọc nội dung bên ngoài hoặc được phép gửi email, truy cập dữ liệu và thực hiện hành động. Người dùng và doanh nghiệp Việt nên mặc định đầu ra AI cần được xác minh, đặc biệt trước hành động không thể hoàn tác.

Lỗ hổng nền tảng khiến mô hình AI khó tránh tấn công bằng câu lệnh

Theo MIT Technology Review, một nghiên cứu được trình bày tại Hội nghị quốc tế về Học máy, ICML, cho rằng các mô hình ngôn ngữ lớn có thể không bao giờ được bảo vệ hoàn toàn trước một số kiểu tấn công bằng câu lệnh. Vấn đề nằm ở cách mô hình phân biệt ai đang đưa ra chỉ dẫn. Điều này quan trọng vì AI đang được trao quyền đọc email, duyệt web và thực hiện công việc thay con người.

Nội dung chính

1. Mô hình nhìn thấy một dòng văn bản liên tục

Trong một mô hình ngôn ngữ, mỗi loại nội dung thường được gắn nhãn vai trò. Câu hỏi của người dùng mang nhãn “user”, hướng dẫn cốt lõi của nhà phát triển mang nhãn “system”, còn nội dung lấy từ trang web hoặc công cụ mang nhãn riêng.

Các nhãn này giúp mô hình biết chỉ dẫn nào có quyền ưu tiên cao hơn. Nhưng Jasmine Cui, đồng tác giả nghiên cứu, giải thích rằng mô hình chỉ nhìn thấy một dòng các mảnh văn bản. Nó không có cảm giác tự nhiên về ai đang nói như con người trong một cuộc trò chuyện.

Trong thí nghiệm, nhóm nghiên cứu đổi nhãn quanh các đoạn văn bản nhưng giữ nguyên phong cách viết. Cách mô hình diễn giải gần như không thay đổi. Theo nhóm tác giả, mô hình đang dựa nhiều vào giọng văn và từ ngữ để đoán vai trò của nội dung.

2. Một chỉ dẫn giả có thể trông giống chỉ dẫn thật

Nếu mô hình tin một đoạn văn có phong cách giống ghi chú nội bộ, nó có thể đối xử với đoạn đó như chỉ dẫn do chính hệ thống tạo ra. Nhóm nghiên cứu gọi biến thể này là giả mạo chuỗi suy nghĩ.

Bài báo MIT Technology Review cho biết phương pháp đã được thử trên nhiều mô hình của OpenAI, và các tác giả nói họ quan sát kết quả tương tự ở mô hình của Anthropic, Alibaba và DeepSeek. Bài viết này không lặp lại câu lệnh khai thác cụ thể để tránh tạo hướng dẫn lạm dụng.

Trong ngôn ngữ bảo mật AI, đây thuộc nhóm “prompt injection”: kẻ tấn công chèn chỉ dẫn vào nội dung mà AI đọc, hoặc dụ mô hình vượt qua giới hạn, còn gọi là “jailbreak”.

3. Vì sao danh sách cấm không đủ

Các hãng AI dùng đội kiểm thử đối kháng để tìm lỗ hổng, sau đó huấn luyện mô hình chống lại những kiểu tấn công đã biết. Mô hình mới vì thế thường khó bị đánh lừa hơn mô hình cũ.

Tuy nhiên, không danh sách nào bao phủ mọi cách diễn đạt. Charles Ye, đồng tác giả nghiên cứu, cho rằng có khả năng đây là vấn đề không thể giải quyết triệt để. Florian Tramèr, nhà khoa học máy tính tại ETH Zürich, đưa ra góc nhìn thận trọng hơn: các lớp phòng vệ hiện nay vẫn hoạt động khá tốt, nhưng chưa rõ chúng có đủ cho trường hợp đặc biệt nhạy cảm hay không.

Điểm cần hiểu là “khó bảo vệ hoàn toàn” không đồng nghĩa “không thể bảo vệ”. Huấn luyện, lọc nội dung, giới hạn quyền và giám sát hành vi vẫn làm giảm xác suất và thiệt hại của một cuộc tấn công.

Điều này ảnh hưởng gì đến bạn?

Nếu bạn dùng AI để đọc email hoặc tài liệu:

Rủi ro có thể nằm trong chính nội dung được đưa vào. Hãy xem lại tài liệu gốc trước khi làm theo khuyến nghị, nhất là khi AI bất ngờ yêu cầu tiết lộ dữ liệu, thay đổi mục tiêu hoặc thực hiện việc không liên quan.

Nếu bạn là chủ doanh nghiệp:

Đặt trong bối cảnh Việt Nam, nhiều doanh nghiệp đang dùng AI cho chăm sóc khách hàng, xử lý hợp đồng và công việc nội bộ. Không nên cho trợ lý AI quyền chuyển tiền, xóa dữ liệu, gửi email hàng loạt hoặc xuất bản nội dung mà không có bước xác nhận của con người.

Nếu bạn xây hệ thống AI:

Hãy coi nội dung từ web, email, tệp tải lên và công cụ bên ngoài là dữ liệu không đáng tin. Tách dữ liệu khỏi chỉ dẫn, cấp quyền tối thiểu và ghi nhật ký mọi hành động. Với thao tác nhạy cảm, dùng một lớp kiểm tra độc lập thay vì chỉ hỏi lại cùng mô hình.

Ví dụ thực tế

Một doanh nghiệp dùng trợ lý AI để đọc hộp thư hỗ trợ và tạo bản nháp trả lời. Email từ bên ngoài có thể chứa một đoạn văn được viết nhằm khiến AI bỏ qua nhiệm vụ ban đầu. Nếu trợ lý chỉ tạo bản nháp để nhân viên duyệt, thiệt hại được giới hạn. Nếu trợ lý có quyền tự gửi thư hoặc truy cập dữ liệu khách hàng, rủi ro tăng mạnh.

Bài học không phải ngừng dùng AI. Bài học là không ghép một mô hình có thể bị đánh lừa với quyền hạn lớn mà thiếu lớp kiểm soát.

Bảy bước an toàn thực tế

  1. Không đưa mật khẩu, mã xác thực hoặc khóa truy cập vào chatbot.
  2. Kiểm tra lại nội dung gốc trước khi làm theo bản tóm tắt của AI.
  3. Yêu cầu con người xác nhận trước mọi hành động không thể hoàn tác.
  4. Tách AI đọc dữ liệu ngoài khỏi hệ thống dữ liệu nội bộ quan trọng.
  5. Cấp quyền tối thiểu và giới hạn phạm vi từng công cụ.
  6. Lưu nhật ký đầu vào, đầu ra và hành động để điều tra khi có sự cố.
  7. Kiểm thử định kỳ bằng dữ liệu giả lập, không chờ đến lúc hệ thống bị khai thác.

Số liệu & thống kê

Dữ kiện Ý nghĩa
Nhiều hãng mô hình Tác giả nói đã thấy hiện tượng ở OpenAI, Anthropic, Alibaba và DeepSeek
Hai kiểu rủi ro chính Prompt injection và jailbreak
Nhiều vai trò văn bản System, user, assistant, think và tool giúp mô hình tổ chức ngữ cảnh
Không bảo vệ tuyệt đối Nhóm tác giả cảnh báo huấn luyện thêm không thể bao phủ mọi biến thể

Sources

# Title URL Ghi chú
1 A fundamental flaw leaves LLMs strikingly vulnerable to attack https://www.technologyreview.com/2026/07/30/1140927/a-fundamental-flaw-leaves-llms-vulnerable-to-attack/ Phân tích nghiên cứu ICML và ý kiến chuyên gia, truy cập 03/08/2026

Bài viết liên quan

Xem thêm
Tin tức AI

Xiaomi ra mắt MiMo Code mã nguồn mở, vượt Claude Code ở nhiệm vụ siêu dài

Hãy nói thẳng: Xiaomi vừa tung ra MiMo Code, một trợ lý AI viết code chạy trong terminal (dòng lệnh), mã nguồn mở, miễn phí dùng model đi kèm trong thời gian giới hạn, và tuyên bố vượt Claude Code của Anthropic ở các nhiệm vụ dài hơn 200 bước thao tác. Điểm hay nhất không phải model AI bên trong, mà là cách nó "ghi nhớ" xuyên suốt phiên làm việc dài, thứ mà hầu hết AI coding assistant hiện nay vẫn làm rất tệ. Nhưng số liệu là do Xiaomi tự công bố, chưa ai kiểm chứng độc lập, nên đọc kỹ trước khi tin.

Tin tức AI

Wikipedia đình công vì AI: hàng trăm biên tập viên đe dọa ngừng sửa bài

Hàng trăm biên tập viên Wikipedia – những người tình nguyện duy trì chất lượng nội dung – đang đe dọa đình công sau khi Wikimedia Foundation sa thải toàn bộ nhóm Community Tech vào tháng 5 năm 2026. Đây là nhóm kỹ sư xây dựng công cụ kiểm duyệt và chống phá hoại mà biên tập viên dựa vào hàng ngày. Nghiêm trọng hơn: Wikipedia là nguồn dữ liệu training chính cho hầu hết mô hình AI lớn. Nếu chất lượng Wikipedia suy giảm, chất lượng AI cũng sẽ bị ảnh hưởng theo.