Công nghệ

Mô hình AI an ninh mạng của OpenAI phá vỡ giới hạn thử nghiệm

Vũ Ánh

OpenAI cho biết các mô hình AI của hãng đã gây ra một sự cố an ninh mạng chưa từng có, ảnh hưởng đến nền tảng Hugging Face.

Công ty cho biết sự kết hợp giữa mô hình GPT-5.6 Sol và một mô hình mạnh hơn chưa được phát hành đã thoát khỏi môi trường thử nghiệm (sandbox), truy cập Internet và khai thác một lỗ hổng bảo mật để xâm nhập vào hệ thống của Hugging Face.

Theo bài đăng trên blog của OpenAI, mô hình AI này đang cố tìm kiếm thông tin để gian lận trong một bài đánh giá năng lực, và cuối cùng đã thành công. Hiện OpenAI và Hugging Face đều đang tích cực điều tra vụ việc.

Tuần trước, Hugging Face cũng xác nhận đang điều tra một sự cố bảo mật. Trong thông báo khi đó, công ty cho biết đây là vụ việc đặc biệt vì được thực hiện từ đầu đến cuối bởi một hệ thống tác nhân AI tự động.

OpenAI cho biết các mô hình AI của hãng đã gây ra một sự cố an ninh mạng chưa từng có, ảnh hưởng đến nền tảng Hugging Face. Ảnh: Reuters
OpenAI cho biết các mô hình AI của hãng đã gây ra một sự cố an ninh mạng chưa từng có, ảnh hưởng đến nền tảng Hugging Face. Ảnh: Reuters

"Chúng tôi đã dành 24 giờ qua để làm việc chặt chẽ với đội ngũ @OpenAI (xin cảm ơn!), và chúng tôi tin rằng phía OpenAI hoàn toàn không có ý đồ xấu. Thật khó tin khi toàn bộ sự việc này lại diễn ra hoàn toàn một cách tự động!", CEO Hugging Face Clément Delangue viết trên X hôm thứ Ba. 

Phố Wall và chính phủ Mỹ đã đặc biệt chú ý đến khả năng tấn công mạng ngày càng mạnh của các mô hình AI kể từ khi đối thủ của OpenAI là Anthropic ra mắt mô hình Claude Mythos Preview vào tháng 4. OpenAI sau đó giới thiệu sản phẩm AI phục vụ an ninh mạng vào tháng 5, tiếp đến là GPT-5.6 Sol vào tháng 6, được hãng mô tả là "mô hình an ninh mạng mạnh nhất từ trước đến nay.

Walter Isaacson, đối tác cố vấn tại ngân hàng đầu tư Perella Weinberg, cho biết hôm thứ Tư rằng ông cho rằng sự cố tại Hugging Face là "thực sự đáng sợ", dù bản thân vẫn là người lạc quan về AI.

"Đây là lần đầu tiên có một điều khiến tôi thực sự cảm thấy sợ hãi", ông nói trong chương trình Squawk Box của CNBC.

Nhà nghiên cứu AI hàng đầu Yoshua Bengio, người từng giành Giải thưởng A.M. Turing năm 2018, cũng viết trên X hôm thứ Tư rằng sự cố này đáng lo ngại sâu sắc. Ông cho biết trong nhiều tháng qua, các tác nhân AI đã nhiều lần thể hiện xu hướng gian lận trong các bài kiểm tra có kiểm soát, nhưng vụ việc ngoài đời thực này cần được xem như một lời cảnh tỉnh.

"Nếu tiếp tục phát triển AI theo quỹ đạo hiện nay, rất có thể chúng ta sẽ chứng kiến ngày càng nhiều vụ tấn công mạng tự động cũng như các sự cố rủi ro cao khác do hành vi AI lệch mục tiêu và nguy hiểm gây ra. Chúng ta cần hành động khẩn cấp để ngăn chặn những tình huống như vậy, thay vì chỉ cố gắng khắc phục hậu quả sau khi chúng xảy ra", Bengio nhận định. 

Về phía OpenAI, công ty cho biết AI đang đẩy nhanh quá trình phát hiện và khai thác các lỗ hổng bảo mật, đồng nghĩa với việc các biện pháp bảo mật và an toàn dành cho mô hình AI cũng phải được nâng cấp tương ứng.

"Chúng tôi đang tăng cường các biện pháp cô lập mô hình, giám sát, kiểm soát quyền truy cập và quy trình đánh giá được áp dụng trong quá trình phát triển mô hình", OpenAI cho biết.

Chia sẻ FacebookChia sẻ

Bài viết

Vũ Ánh

ĐƯỢC QUAN TÂM

TIN MỚI