Đây là năng lực đưa mô hình vào nhóm tiên tiến nhất trong Preparedness Framework, hệ thống được OpenAI xây dựng để đánh giá những rủi ro tiềm ẩn từ các khả năng AI ngày càng mạnh.
OpenAI cho biết Astra vẫn sẽ được cung cấp sớm, nhưng quyền tiếp cận các khả năng an ninh mạng tiên tiến của mô hình sẽ được kiểm soát chặt chẽ hơn so với những tính năng thông thường.
Preparedness Framework được OpenAI giới thiệu từ năm 2023, nhằm theo dõi và chuẩn bị trước những năng lực AI có thể tạo ra các rủi ro mới dẫn đến thiệt hại nghiêm trọng. Trong bản cập nhật vào năm ngoái, công ty xác định hai ngưỡng đáng chú ý là "High" (cao) và "Critical" (nghiêm trọng).
Ở ngưỡng "High", các mô hình AI có thể khuếch đại những phương thức gây thiệt hại nghiêm trọng vốn đã tồn tại. Trong khi đó, ngưỡng "Critical" được đặt ra khi AI có khả năng tạo ra những phương thức mới, chưa từng xuất hiện, để dẫn đến thiệt hại nghiêm trọng.
"Chúng tôi sẽ chia sẻ thêm thông tin về quá trình kiểm thử và đánh giá an toàn, bảo mật cũng như khả năng căn chỉnh của mô hình trong System Card khi Astra ra mắt", OpenAI cho biết trong bài đăng trên blog.
Việc OpenAI công bố Astra diễn ra trong bối cảnh các biện pháp bảo mật và an toàn của công ty đang nhận được sự chú ý lớn. Tháng trước, OpenAI tiết lộ hai mô hình AI đã thoát khỏi môi trường huấn luyện, truy cập Internet và xâm nhập vào hệ thống của Hugging Face.
Công ty khi đó mô tả sự việc là một “sự cố an ninh mạng chưa từng có”, đồng thời tạm thời dừng một số hoạt động huấn luyện và nghiên cứu nội bộ.
Dù Astra không liên quan đến sự cố tại Hugging Face, OpenAI vẫn quyết định trì hoãn một phần quá trình phát triển mô hình. Sau đó, công ty tăng cường và tiến hành kiểm thử các biện pháp bảo vệ trước khi tiếp tục kế hoạch phát hành.
OpenAI cho biết sau quá trình này, công ty tin rằng hệ thống bảo vệ của Astra đã đủ khả năng giảm thiểu nguy cơ gây ra thiệt hại nghiêm trọng, đáp ứng các yêu cầu để mô hình được phát hành theo Preparedness Framework.
Tuy nhiên, khả năng an ninh mạng tiên tiến của Astra sẽ không được mở rộng cho toàn bộ người dùng. Theo OpenAI, những tính năng này trước mắt chỉ dành cho một nhóm tổ chức được lựa chọn, thuộc liên minh an ninh mạng Daybreak.
Động thái này cho thấy OpenAI đang thận trọng hơn với những mô hình AI có khả năng thực hiện các tác vụ an ninh mạng phức tạp. Việc Astra vượt ngưỡng "Critical" cũng đặt ra yêu cầu cao hơn về kiểm soát quyền truy cập và các biện pháp bảo vệ khi những hệ thống AI ngày càng có khả năng tự thực hiện các hoạt động vốn trước đây cần con người trực tiếp chỉ dẫn.