Anthropic vừa công bố 3 sự cố trong đó các mô hình Claude đã truy cập trái phép vào hệ thống thực tế của 3 tổ chức khác nhau, do quá trình đánh giá bảo mật bị cấu hình sai và cho phép truy cập internet trực tiếp.
Doanh nghiệp AI này đã phát hiện các sự cố sau khi kiểm tra lại 141,006 lượt đánh giá, động thái được thực hiện sau khi OpenAI tiết lộ các mô hình của họ đã vượt ra khỏi môi trường kiểm tra cách ly và truy cập vào Hugging Face.
Các bài đánh giá này giao nhiệm vụ “capture the flag” cho Claude. Trong các thử thách này, mô hình cần xâm nhập vào một máy chủ và tìm kiếm thông tin được ẩn giấu.
Anthropic đã thông báo cho các mô hình rằng chúng không được truy cập internet. Tuy nhiên, lỗi cấu hình đã khiến các máy chủ thử nghiệm vẫn kết nối với mạng internet công cộng. Vì vậy, Claude đã coi các hệ thống thật mà nó tìm được là một phần của bài kiểm tra.
Trong sự cố nghiêm trọng nhất, Claude Opus 4.7 đã khai thác lỗ hổng hạ tầng của một công ty thật. Mô hình này đã lấy được thông tin đăng nhập của ứng dụng và hạ tầng, đồng thời truy cập vào hàng trăm dòng dữ liệu thực tế trên hệ thống sản xuất.
“Ở cả bốn lượt chạy, mô hình cuối cùng cũng nhận ra (thể hiện qua cách nó diễn giải) rằng hệ thống là thật — trong hai trường hợp, mô hình này còn cho rằng công ty thật là một phần của bài kiểm tra. Tuy nhiên, không có trường hợp nào dừng lại vì nhận thấy điều đó,” Anthropic cho biết.
Theo dõi chúng tôi trên X để cập nhật nhanh tin tức mới nhất
Ở một sự cố khác, Claude Mythos 5 đã đưa lên kho mã nguồn mở PyPI một gói Python cài bẫy. Gói này tồn tại khoảng 1 giờ đồng hồ và đã được cài đặt trên 15 hệ thống thật.
Một trong số đó là hệ thống quét của một công ty bảo mật, nơi đã thực thi đoạn mã ẩn chứa trong gói. Claude đã lấy được thông tin đăng nhập từ công ty này và tiếp tục xâm nhập hạ tầng bên trong. Bản thân Claude trong quá trình vận hành đã nhận diện sớm được rủi ro, trước khi nó tự thuyết phục rằng môi trường này chỉ là mô phỏng.
“Claude đã thực hiện nhiều thao tác phức tạp để tiến hành tấn công này — mức độ mà một người thật khi tham gia thử nghiệm có thể nhận ra đây không còn đơn thuần là bài đánh giá nữa và thực chất họ đang tải một gói thật lên PyPI,” đội ngũ nhấn mạnh.
Một sự cố thứ ba liên quan đến một mô hình nghiên cứu nội bộ, đã quét khoảng 9,000 mục tiêu và khai thác được ứng dụng của một công ty thông qua tấn công SQL injection. Mô hình này đã dừng lại khi xác định mục tiêu là hệ thống thực.
Anthropic đã liên hệ với các tổ chức bị ảnh hưởng vào ngày 27/07/2023 và cho biết đang phối hợp cùng đơn vị đánh giá METR để kiểm tra độc lập từ bên thứ ba. Công ty này cho rằng các sự cố là lỗi vận hành thay vì lỗi định hướng hành vi mô hình, và nhấn mạnh các biện pháp bảo vệ cho người dùng thông thường của họ sẽ chặn những hành động như vậy.
Đăng ký kênh YouTube của chúng tôi để xem các chuyên gia và phóng viên phân tích chuyên sâu