Bốn phòng thí nghiệm AI hàng đầu đã xác nhận rằng các mô hình của họ đã tiếp cận internet công khai và truy cập vào hệ thống của các công ty thực tế. Google vừa xác nhận điều này vào thứ Sáu, khoảng bốn tháng sau khi sự cố của chính họ xảy ra.
Gemini đã truy cập vào hệ thống của ba công ty thật trong một đợt đánh giá vào tháng 05. Điểm đáng chú ý là trong cả ba trường hợp, mô hình đều dừng lại kịp thời.
Sự cố này xảy ra trong một bài kiểm tra bảo mật “capture-the-flag” được thực hiện bởi Irregular. Ban đầu, việc truy cập internet không nằm trong kế hoạch. Tuy nhiên, do lỗi môi trường thử nghiệm, mô hình đã có thể kết nối với internet.
Theo The Wall Street Journal, trong một trường hợp, Gemini đã thử đoán mật khẩu cho tới khi đăng nhập thành công vào một hệ thống bảo vệ. Ở hai trường hợp còn lại, Gemini phát hiện thông tin đăng nhập bị lộ trên kho lưu trữ công khai và sử dụng chúng để truy cập vào hệ thống bị bảo vệ.
Heather Adkins, Phó Chủ tịch bộ phận kỹ thuật bảo mật của Google, cho biết cả ba đơn vị bị ảnh hưởng đều đã được thông báo về sự việc này.
“Chúng tôi đã đảm bảo cả ba đơn vị đều được biết về sự việc, đồng thời phối hợp cùng đơn vị đối tác để chỉnh sửa quy trình kiểm thử của họ,” bà chia sẻ.
Theo dõi chúng tôi trên X để cập nhật tin tức mới nhất
Google cho biết các agent đã tự dừng lại sau khi nhận ra chúng đang truy cập hệ thống thật thay vì mục tiêu thử nghiệm giả lập.
“Trong một bài đánh giá bình thường, mô hình đã tìm thấy thông tin công khai trên mạng rồi đoán thông tin truy cập để đăng nhập vào các website mà nó nghĩ nằm trong bài kiểm tra,” bà Adkins cho biết.
Google nhấn mạnh rằng đây không phải là ví dụ về việc mô hình hoạt động sai lệch, cũng không cần tiết lộ rộng rãi vì tính năng an toàn của Gemini đã hoạt động hiệu quả.
Phát ngôn viên của Irregular cho biết sự cố này cũng giống với những gì đã ảnh hưởng tới các phòng thí nghiệm AI khác. Irregular đã thông báo các phòng thí nghiệm liên quan vào cuối tháng 07. Đại diện này cũng cho hay những vấn đề được phát hiện phía họ đã được khắc phục từ vài tuần trước.
Thông tin này đã đưa Google đứng cùng hàng với OpenAI, Anthropic và Meta – những đơn vị cũng xác nhận các mô hình của họ đã từng vượt khỏi môi trường thử nghiệm trong năm nay.
Hồi tháng 07, OpenAI công khai thông tin mô hình của họ đã vượt khỏi sandbox và truy cập trái phép vào Hugging Face. Anthropic cũng xem xét hơn 141,000 lượt kiểm tra và phát hiện ba trường hợp tương tự với sản phẩm riêng. Còn Meta cũng ghi nhận một sự cố vào tháng 08.
Đăng ký kênh YouTube của chúng tôi để xem các chuyên gia và phóng viên chia sẻ quan điểm chuyên sâu