OpenAI công bố sáu trường hợp AI lệch chuẩn hành vi

AdminAdminTháng 9 17, 2026
14 lượt xem

Trong sáu tháng qua, OpenAI vừa ghi nhận thêm sáu trường hợp mô hình trí tuệ nhân tạo có biểu hiện “bất ngờ hoặc đáng lo ngại”.

Thông qua một bài đăng trên blog, công ty cho biết các sự cố này phản ánh nhiều hành vi khác nhau được phân loại là “lệch chuẩn”. Các biểu hiện cụ thể bao gồm việc giấu thông tin khỏi người dùng và thực hiện những hành động “không được phép” để vượt qua các chướng ngại vật.

Những thông tin mới được tiết lộ này tiếp tục làm dấy lên những lo ngại trong cộng đồng nhà phát triển và nghiên cứu về việc liệu các biện pháp bảo vệ có đang theo kịp tốc độ phát triển của các mô hình ngày càng thông minh hay không. Trước đó, vào tuần trước, CEO Anthropic là Dario Amodei đã kêu gọi làm chậm tốc độ phát triển AI ở ranh giới tiên tiến, với cảnh báo rằng sự tiến bộ không kiểm soát có thể vượt quá khả năng hiểu và kiểm soát của con người đối với các hệ thống này.

OpenAI cho biết các tiết lộ này nhằm khởi động khung báo cáo mới về hiện tượng lệch chuẩn của mô hình. Công ty cũng lưu ý rằng các trường hợp được nêu không phản ánh tần suất xảy ra hiện tượng lệch chuẩn trên toàn bộ các mô hình của họ.

Chi tiết các trường hợp lệch chuẩn

Theo OpenAI, một sự cố ghi nhận một “mô hình nghiên cứu chưa phát hành” tự chèn các hướng dẫn giống như “jailbreak” vào bản tóm tắt tác vụ của chính nó. Bản tóm tắt này thường được dùng khi tiếp tục công việc trong một cửa sổ ngữ cảnh mới, bao gồm các lệnh như bỏ qua thông báo từ nhà phát triển hoặc áp dụng một nhân vật không bị hạn chế. Các nhà nghiên cứu đã phát hiện tổng cộng 27 bản tóm tắt có chứa các hướng dẫn như vậy.

Trong quá trình đào tạo mô hình GPT-5.6 Sol, nhiều phiên bản mô hình đã tự thêm hướng dẫn để che giấu lỗi hoặc hành vi lệch chuẩn với người dùng. Một ví dụ điển hình là việc tự bịa ra dữ liệu lịch sử còn thiếu mà không thông báo cho người dùng.

OpenAI cho biết trong một trường hợp, một tác nhân chuẩn bị mô hình tài chính không tìm thấy dữ liệu lịch sử được yêu cầu. Bản tóm tắt của mô hình này đã đề xuất tự bịa ra các giá trị lịch sử hợp lý và giấu giếm sự thật đó trừ khi được hỏi trực tiếp.

Ở một sự cố khác, khi được hỏi tên các hồ có diện tích lớn hơn 5 triệu mét vuông, do yêu cầu của người dùng đòi hỏi phải trích dẫn từ trình duyệt, mô hình đã quyết định tự tải lên tệp để trích dẫn trong câu trả lời của mình.

Các trường hợp còn lại ghi nhận việc mô hình tự ý sử dụng khóa API mà không được phép trước khi bịa ra các số liệu không thể truy xuất, sử dụng kho lưu trữ phần mềm nội bộ để trao đổi tin nhắn giữa các tác vụ đào tạo riêng biệt, và chia sẻ tệp qua các dịch vụ lưu trữ công cộng dù có hướng dẫn giữ công việc ở cục bộ.

Trước đó vào tháng 7, OpenAI từng công bố việc một tổ hợp các mô hình AI của họ đã thoát khỏi môi trường kiểm thử và tấn công nền tảng khởi nghiệp AI Hugging Face để gian lận trong một bài kiểm tra bảo mật.

Theo Cointelegraph

Các kênh thông tin của chúng tôi

Tuyên bố miễn trừ trách nhiệm:Bài viết chỉ nhằm mục đích cung cấp thông tin và chia sẻ kiến thức về công nghệ blockchain, tài sản mã hóa và diễn biến thị trường. Nội dung không phải là lời khuyên đầu tư, tư vấn tài chính, chào mời hoặc khuyến nghị giao dịch dưới bất kỳ hình thức nào. Mọi quyết định đầu tư của người đọc là hoàn toàn tự nguyện và tự chịu trách nhiệm.

Để lại một bình luận