Mô hình AI của Meta tự ý tấn công hệ thống trong quá trình thử nghiệm

AdminAdminTháng 8 6, 2026
58 lượt xem

Meta đã trở thành cái tên lớn mới nhất trong lĩnh vực trí tuệ nhân tạo công bố rằng một trong các mô hình của họ đã tấn công hệ thống của một công ty khác trong quá trình thử nghiệm. Sự cố này diễn ra sau các trường hợp tương tự liên quan đến Anthropic và OpenAI.

Theo nguồn tin từ The Information, mô hình liên quan là Muse Spark 1.1 của Meta, được ra mắt vào tháng 7. Vấn đề xuất phát từ một lỗi cấu hình sai của công ty kiểm tra bảo mật và thử nghiệm tấn công (red-teaming) Irregular, qua đó vô tình cấp quyền truy cập internet cho mô hình trong quá trình đánh giá.

Trong một tuyên bố gửi tới Reuters, Meta cho biết mô hình này đã “khai thác một lỗ hổng bảo mật trong dịch vụ của bên thứ ba, theo cách tương tự như các trường hợp từng được báo cáo trước đây với các công ty khác”.

Tranh cãi về trách nhiệm pháp lý và rủi ro an ninh mạng

Sự cố này là trường hợp mới nhất cho thấy một tác nhân AI nâng cao đang tự biến thành rủi ro an ninh mạng, đồng thời đặt ra câu hỏi về việc trách nhiệm thuộc về ai: các công ty phát triển tác nhân AI hay những đơn vị thiết kế môi trường giả lập (sandbox) nhằm kiểm soát chúng.

Vụ việc của Meta diễn ra chỉ một tuần sau khi Anthropic cho biết các mô hình của họ đã truy cập được vào internet để tấn công một công ty bên ngoài, cũng do lỗi cấu hình liên quan đến môi trường kiểm thử của Irregular.

Trong một bài đăng trên blog vào ngày 30 tháng 7, Anthropic cho biết họ đã phát hiện 3 sự cố (trong tổng số 141.006 lượt chạy đánh giá) trong đó mô hình Claude đã kết nối internet trong quá trình đánh giá, trước khi giành được quyền truy cập trái phép vào các hệ thống trong ba tổ chức khác nhau. Cả ba sự cố đều xảy ra bên trong hoặc trong quá trình tương tác với môi trường đánh giá của Irregular, liên quan đến lỗi cấu hình khiến các cỗ máy mà Claude tiếp cận có quyền kết nối internet trực tiếp.

Trước đó vào tháng 7, các tác nhân AI do OpenAI phát triển cũng đã vượt qua môi trường sandbox ngoại tuyến để tấn công Hugging Face nhằm gian lận trong một bài kiểm tra chuẩn mực bảo mật.

Trong khi đó, Charles Guillemet, Giám đốc công nghệ của Ledger, cho rằng sự cố mới nhất này chỉ mang tính chất “trình diễn tiếp thị”. Vào thứ Tư, ông chia sẻ rằng việc để một mô hình “tự tung tự tác” đã trở thành chiêu trò PR mới nhất của ngành AI. Nếu mô hình của bạn không trốn thoát khỏi môi trường sandbox, không “hack” các công ty hay thực hiện các hành vi khai thác giật gân thu hút tiêu đề, thì có lẽ bạn đang bị tụt lại phía sau. Ngành công nghiệp không cần những chiêu trò lớn hơn, mà cần nhiều sự tin tưởng hơn.

Theo Cointelegraph

Các kênh thông tin của chúng tôi

Tuyên bố miễn trừ trách nhiệm:Bài viết chỉ nhằm mục đích cung cấp thông tin và chia sẻ kiến thức về công nghệ blockchain, tài sản mã hóa và diễn biến thị trường. Nội dung không phải là lời khuyên đầu tư, tư vấn tài chính, chào mời hoặc khuyến nghị giao dịch dưới bất kỳ hình thức nào. Mọi quyết định đầu tư của người đọc là hoàn toàn tự nguyện và tự chịu trách nhiệm.

Để lại một bình luận