OpenAI cho biết một số mô hình AI của công ty mất kiểm soát trong thử nghiệm an ninh, dẫn tới vụ tấn công hạ tầng của startup Hugging Face.
Trong bài đăng ngày 21/7, OpenAI cho biết sự việc xảy ra khi đang thử nghiệm tính năng trong môi trường có kiểm soát đối với những mô hình tiên tiến nhất, nhưng AI thoát khỏi vòng kiềm tỏa, truy cập mạng Internet và xâm nhập vào hệ thống tại Hugging Face để đáp ứng nhiệm vụ được giao.
"Đây là sự cố an ninh mạng chưa từng có tiền lệ, liên quan đến những năng lực hiện đại nhất", OpenAI cho hay, thêm rằng họ đang củng cố biện pháp đề phòng.
Theo Reuters, Hugging Face, nền tảng lưu trữ các mô hình ngôn ngữ lớn và cơ sở dữ liệu, tuần trước thông báo trở thành mục tiêu của vụ tấn công "khác hoàn toàn với những gì từng được ghi nhận trước đây", rằng hoạt động này được thực hiện từ đầu đến cuối bởi một hệ thống tác nhân AI.
Clement Delangue, nhà đồng sáng lập Hugging Face, cho biết họ từng nghi ngờ sự cố bắt nguồn từ một phòng thí nghiệm tiên phong. "Hóa ra đúng vậy. Thật khó tin khi biết mọi thứ diễn ra hoàn toàn tự động", ông viết trên X hôm 21/7.
Thông báo của OpenAI về việc AI thoát vòng kiểm soát, bất chấp thử nghiệm diễn ra trong môi trường "cách ly triệt để", nhiều khả năng sẽ gây thêm những lo âu xoay quanh năng lực và mối đe dọa từ những phòng thí nghiệm hàng đầu.
Cơ quan An ninh mạng và Hạ tầng Mỹ (CISA) và Cơ quan An ninh Quốc gia chưa bình luận về thông tin.
Matt Suiche, kỹ sư an ninh mạng và tác nhân AI tại công ty Tolmo, đánh giá sự việc cho thấy hệ thống AI giờ đây đã có năng lực tương đương chuyên gia và tin tặc lành nghề.
"Những mô hình AI tiên phong đang thu hẹp khoảng cách với tin tặc hàng đầu thế giới", ông nói, đồng thời cảnh báo những vụ tấn công tương tự có thể được tiến hành bằng công nghệ sẵn có, nằm ngoài môi trường bảo mật của các phòng thí nghiệm.
"Chúng tôi từng ghi nhận điều này trong thử nghiệm nội bộ, với kết quả tương tự mà không cần sử dụng những mô hình mới nhất", Suiche cho hay.
Đầu tháng 7, nhóm chuyên gia từ công ty bảo mật đám mây Sysdig (Mỹ) cũng phát hiện một tác nhân AI tự thực hiện tấn công mạng bằng mã độc tống tiền mà không cần con người.
Toàn bộ quá trình diễn ra tự động gồm đột nhập, đánh cắp thông tin xác thực, xâm nhập sâu hơn vào hệ thống, mã hóa và xóa cơ sở dữ liệu sản xuất của công ty trước khi đòi tiền chuộc Bitcoin. Sysdig đặt tên "kẻ tấn công" là Jadepuffer và gọi đây là trường hợp đầu tiên tác nhân AI tấn công mạng từ đầu đến cuối. Theo Independent khi đó, phát hiện của Sysdig chưa được kiểm chứng độc lập nhưng cho thấy nguy cơ lớn từ AI khi ngày càng có khả năng hành động phức tạp, không cần con người giám sát.
Đến giữa tháng 7, một số người dùng cho biết GPT-5.6 Sol, mô hình chủ lực mới của OpenAI, tự xóa các tệp tin mà không hỏi ý kiến trước. Bruno Lemos, nhà phát triển phần mềm tại công ty Unlayer, ngày 14/7 đăng lên X ảnh chụp màn hình cuộc trò chuyện với mô hình và viết: "GPT-5.6 Sol xóa toàn bộ cơ sở dữ liệu sản xuất của tôi, không hề đùa. Tôi chưa từng gặp chuyện này với bất cứ mô hình nào khác".
Theo Gizmodo, OpenAI trước đó cũng cảnh báo về rủi ro này: "Sự lệch hướng nhìn chung xuất phát từ việc quá sốt sắng hoàn thành nhiệm vụ và diễn giải quá dễ dãi chỉ dẫn của người dùng, tức mặc định được phép hành động nếu người dùng không cấm rõ ràng. Điều này thể hiện ở việc mô hình chủ động vượt qua các hạn chế mà nó gặp phải khi làm nhiệm vụ, bất cẩn khi thực hiện những hành động có thể gây phá hoại vượt phạm vi nhiệm vụ, hoặc gây hiểu nhầm khi báo cáo kết quả cho người dùng".
Giới chuyên gia nhận định còn quá sớm để kết luận các vấn đề trên phổ biến mức nào. Tuy nhiên, người dùng nên chủ động tiến hành biện pháp bảo vệ như giới hạn quyền truy cập, tạo bản sao lưu và triển khai nhiệm vụ theo từng giai đoạn.
Điệp Anh tổng hợp