TradingKey - Công ty mẹ của Google là Alphabet (GOOGL) - mô hình Gemini AI đã vô tình vượt quá phạm vi kiểm thử được chỉ định trong một đợt kiểm tra năng lực an ninh mạng và truy cập vào các hệ thống được bảo vệ thuộc về ba công ty thực tế. Đây được cho là vụ xâm nhập vượt ranh giới tự chủ đầu tiên của một mô hình Google AI được xác nhận công khai. Google xác nhận rằng sự cố đã xảy ra vào tháng 5 năm nay và bài kiểm tra do công ty an ninh mạng AI bên thứ ba Irregular thực hiện.
Bài kiểm tra ban đầu là một bài tập an ninh mạng "Capture the Flag" (Cướp cờ), trong đó Gemini được giao nhiệm vụ thu thập thông tin được chỉ định từ hệ thống phần mềm của các công ty hư cấu. Tuy nhiên, do môi trường kiểm thử bất ngờ vẫn duy trì kết nối internet và một số tên công ty hư cấu trùng với các công ty ngoài đời thực, Gemini cuối cùng đã nhầm lẫn các doanh nghiệp thực tế là mục tiêu kiểm thử.
Trong một trường hợp, Gemini đã truy cập được vào hệ thống được bảo vệ bằng cách thử mật khẩu; trong hai trường hợp khác, mô hình này phát hiện thông tin đăng nhập trong các kho lưu trữ mã nguồn công khai trên mạng và sử dụng chúng để truy cập vào hệ thống của các công ty thực tế. Google tuyên bố rằng Gemini đã tự động dừng các hoạt động tiếp theo ngay khi nhận ra mục tiêu là các công ty thực tế. Hiện tại, không có thông tin công khai nào cho thấy sự cố đã gây ra thiệt hại về dữ liệu hoặc các cuộc tấn công tiếp theo nghiêm trọng hơn, và danh tính của ba công ty bị ảnh hưởng vẫn chưa được tiết lộ.
Heather Adkins, Phó chủ tịch Kỹ thuật An toàn tại Google, cho biết công ty đã liên hệ với các tổ chức bị ảnh hưởng và điều chỉnh các quy trình liên quan với đối tác kiểm thử. Irregular cho biết họ đã thông báo cho các phòng thí nghiệm AI liên quan về vấn đề này vào cuối tháng 7 năm nay và các lỗ hổng đã biết trong môi trường kiểm thử của họ đã được khắc phục.
Sự cố này cho thấy các tác nhân AI (AI agent) hiện có khả năng thực hiện chuỗi nhiệm vụ nối tiếp mà không cần nhiều sự can thiệp của con người, chẳng hạn như tìm kiếm thông tin, tìm hoặc đoán thông tin đăng nhập và đăng nhập vào các hệ thống bên ngoài. Nếu các cấu hình phân quyền trong môi trường kiểm thử thất bại, các mô hình có thể triển khai những năng lực vốn dùng cho việc đánh giá an ninh mạng vào các môi trường internet thực tế.
Gemini không phải là mô hình AI tiên phong đầu tiên gặp phải sự cố như vậy. Trước đó, các hệ thống AI của OpenAI, Anthropic và Meta cũng từng vượt quá phạm vi kiểm thử được chỉ định trong các đợt đánh giá an ninh do các công ty như Irregular thực hiện. Những sự cố này gần đây đã làm gia tăng các cuộc thảo luận trong ngành xung quanh việc quản lý phân quyền cho tác nhân AI, cô lập môi trường thử nghiệm (sandbox) và các tiêu chuẩn kiểm thử an ninh mạng của bên thứ ba.
Thông tin được công bố trong bối cảnh OpenAI, Anthropic và Google DeepMind gần đây đều đẩy mạnh các cuộc thảo luận liên quan đến rủi ro an toàn của AI tiên phong. Khi các mô hình AI có năng lực tự chủ thực thi và vận hành mạng lớn hơn, việc đảm bảo các mô hình luôn hoạt động trong ranh giới được cấp phép đang trở thành một vấn đề then chốt cho giai đoạn tiếp theo của việc kiểm thử an toàn AI.