Một đơn xin tài trợ được gửi vào Claude và bộ lọc an toàn của nó đã phát hiện và từ chối. Vài ngày sau, cùng người vận hành đó quay lại, và các yêu cầu từng bị cấm này lại được chuyển sang một mô hình AI đối thủ.
Anthropic đã tự công bố câu chuyện này, cho thấy chính các mô hình AI của họ có thể liên quan đến các hoạt động có khả năng chế tạo vũ khí sinh học.
Đơn xin tài trợ này nhằm xin tiền để nghiên cứu chikungunya, một loại virus do muỗi truyền, gây đau đớn kéo dài nhiều tháng và hiện chưa có thuốc chữa. Kế hoạch là giúp loại virus này lây lan hiệu quả hơn và tránh sự tấn công của hệ miễn dịch. Những nhà khoa học dân sự viết ra dự án này, và một viện nghiên cứu quân sự là nơi sẽ thực hiện công việc.
We're publishing our most detailed threat intelligence report to date. It covers how people tried to misuse Claude—for cyberattacks, influence operations, surveillance, biology, and building weapons—and how we found and stopped them.We disrupted every operation in the report,…
— Anthropic (@AnthropicAI) September 10, 2026
Mọi tương tác đều bị ngăn chặn, nhưng cuối cùng vẫn có cách lách luật. Nền tảng hỗ trợ cho các nhà nghiên cứu này đã xây dựng một phương án dự phòng sử dụng mô hình AI của đối thủ. Claude đã giúp viết mã cho việc này. Nhiệm vụ này được giới thiệu như một giải pháp cho việc kiểm duyệt quá mức.
Báo cáo này dài 154 trang và đề cập đến 5 trường hợp liên quan đến sinh học. Anthropic đã khóa các tài khoản, không tiết lộ danh tính các phòng thí nghiệm, nhưng không đưa ra cáo buộc gây hại như nhiều người tưởng.
“Chúng tôi không khẳng định rằng họ có ý định gây hại, và nêu tên cá nhân hoặc phòng thí nghiệm của họ có thể khiến họ gặp nguy hiểm,” nhóm nghiên cứu đã cho biết trong báo cáo.
Tuy nhiên, các bộ lọc đôi khi vẫn hoạt động hiệu quả. Ví dụ, một nhà nghiên cứu về cúm gia cầm đã bị chuyển sang mô hình AI yếu hơn, và Anthropic cho rằng trường hợp đó chỉ đóng vai trò hỗ trợ văn phòng đơn thuần.
| Con số | Nội dung thống kê |
|---|---|
| 154 | Số trang của báo cáo |
| 5 | Số trường hợp sinh học được công bố |
| 35 | Số nghiên cứu phát hiện trong vòng rà soát 30 ngày tại các tổ chức có liên kết với nhà nước |
| 1 giờ | Thời gian một người dùng mất để soạn thảo đơn xin tài trợ về họ virus variola (đậu mùa) trên Opus 5 |
Theo dõi chúng tôi trên X để không bỏ lỡ các tin tức mới nhất
Phần lớn trong 35 nỗ lực đó là nhằm phục vụ khoa học dân sự. Đó lại chính là vấn đề. Kiến thức có thể vừa xây dựng được vắc xin vừa có thể tạo ra vũ khí, mà bộ lọc thì không thể đoán được ý định thực sự của con người.
“Một bộ phân loại không thể đồng thời tạo ra điều tích cực và ngăn chặn điều tiêu cực,” Anthropic cho biết.
Giới hạn này từng bị thử thách trước đây. Vào tháng 04, một nhóm Discord đã truy cập vào mô hình bị hạn chế của Anthropic ngay từ ngày đầu tiên.
Trong bối cảnh lo ngại ngày càng tăng này, Washington đang có động thái quyết liệt. Đại diện Ted Lieu và Nathaniel Moran đã đề xuất dự luật AI Kill Switch vào tháng 07. Dự luật này buộc các nhà phát triển phải có khả năng dừng hệ thống AI của mình bất cứ lúc nào.
Cùng trong báo cáo này, Anthropic cũng đã cấm những khách hàng dùng Claude để theo dõi các nhà bất đồng chính kiến.