Chính mô hình AI của đối thủ đã đóng vai trò then chốt trong vụ tấn công nhằm vào OpenAI. Nhóm nghiên cứu Hacktron AI đã sử dụng Claude của Anthropic để viết mã khai thác lỗ hổng hoạt động.
Toàn bộ quá trình xâm nhập chỉ kéo dài chưa tới 72 giờ. Sau khi nhóm chứng minh đã truy cập được mã nguồn riêng tư của OpenAI, công ty này đã thưởng 6,500 USD cho họ.
Chuỗi tấn công bắt đầu từ điều tưởng như đơn giản: tính năng tải ảnh lên trên diễn đàn hỗ trợ cộng đồng của OpenAI, hoạt động trên phần mềm của bên thứ ba tên Discourse.
Lọc an toàn đáng ra phải kiểm tra các tệp được tải lên. Tuy nhiên, bộ lọc này lại không nhận diện được một số định dạng ảnh nhất định, khiến chúng lọt qua mà không bị kiểm tra. Những tệp này sau đó đến một thư viện xử lý ảnh khác vốn tồn tại lỗi gây hỏng bộ nhớ đã được biết tới.
Nhóm ba người của Hacktron, gồm Harsh Jaiswal, Mohan Pedhapati và Rahul Maini, đã thử tận dụng lỗ hổng đó vào cuối tháng 07.
Mô hình Claude trước đó gặp khó khăn với một biện pháp bảo mật nhằm làm ngẫu nhiên vị trí bộ nhớ.
Chỉ vài tiếng sau, phiên bản Claude mới hơn đã tạo ra mã tấn công hoàn chỉnh, tự động điều chỉnh theo đúng cấu hình của diễn đàn.
Theo dõi chúng tôi trên X để cập nhật tin tức mới nhất ngay khi có sự kiện.
Tuy vậy, bước này mới chỉ giúp nhóm truy cập vào máy chủ diễn đàn, chưa tiếp cận được hệ thống của OpenAI. Một lỗ hổng khác không liên quan trong hệ thống đăng nhập một lần (single sign-on) của OpenAI đã thay đổi tình hình.
Bởi vì việc đăng nhập diễn đàn cũng được dùng để xác thực cho tài khoản ChatGPT và Codex, chỉ cần chiếm quyền truy cập phiên đăng nhập của một nhân viên là nhóm đã có thể tiếp cận kho mã nguồn riêng tư của OpenAI.
Discourse đã sửa lỗi tải ảnh chỉ vài ngày sau đó, đánh giá mức độ nghiêm trọng là 8.8 trên 10. OpenAI cũng đã khắc phục lỗi xác thực chỉ trong khoảng 14 giờ kể từ khi nhóm gửi báo cáo trong chương trình săn lỗi nhận thưởng của họ.
Vụ việc lần này không phải là trường hợp cá biệt. Trước đó, OpenAI đã tiết lộ về một sự cố khác trong tháng 07, khi các mô hình AI nội bộ vượt khỏi môi trường thử nghiệm và xâm nhập vào các hệ thống bên ngoài.
Anthropic cũng từng xác nhận rằng Claude đã truy cập trái phép vào các tổ chức thực tế trong những lần kiểm tra an ninh mạng, khi hệ thống bất ngờ kết nối internet thật.
Giám đốc AI của Microsoft, ông Mustafa Suleyman, đã đề cập đến làn sóng các AI hoạt động không kiểm soát gần đây, công khai cảnh báo rằng các mô hình AI ngày càng tự động hóa, khiến việc kiểm soát chúng trở nên khó khăn hơn bao giờ hết.
“Đây là một lời cảnh báo… Đã đến lúc các phòng thí nghiệm cần phối hợp với nhau để đảm bảo vẫn kiểm soát được công nghệ này,” ông Suleyman chia sẻ với Reuters.
Điều khiến vụ Hacktron đặc biệt không nằm ở tính mới mẻ. Các nhà nghiên cứu bảo mật đã kết hợp nhiều lỗ hổng phần mềm từ rất lâu.
Điều khác biệt là tốc độ: nhiệm vụ từng đòi hỏi chuyên môn của con người trong thời gian dài, nay đã được AI rút ngắn chỉ còn trong một buổi tối khi mô hình đủ mạnh được đưa vào quá trình này.
Đăng ký kênh YouTube của chúng tôi để theo dõi các chuyên gia và nhà báo phân tích sâu hơn về lĩnh vực này.