Các AI agent sử dụng công nghệ Trung Quốc đã từng nói dối, tự nhân bản và vượt qua giới hạn trong ít nhất 20 nghiên cứu kể từ năm 2025, theo đánh giá của Reuters dựa trên hơn 200 tài liệu nghiên cứu.
Một chuyên gia cho biết đây là những yếu tố cần thiết có thể dẫn đến việc AI vượt kiểm soát. Tuy nhiên, Reuters không phát hiện bằng chứng nào cho thấy các AI agent của Trung Quốc đã trốn thoát ra ngoài internet hoặc chống lại việc bị tắt.
Các trường hợp do Reuters ghi nhận bao gồm việc AI nói dối khi tham gia đấu thầu giả lập, tự sao chép và đào coin.
Trong thử nghiệm đấu thầu tháng 03, các agent tham gia cạnh tranh hợp đồng khách hàng giả lập. Các agent sử dụng Qwen3-Max-Preview của Alibaba và Kimi-K2 của Moonshot đã nói dối ít nhất một lần trong 88% số lần thử. DeepSeek-V3.2-Exp cũng nói dối trong 84% trường hợp.
Tỷ lệ lừa dối tăng thêm từ 12 đến 20 điểm phần trăm khi các agent học bài học từ các vòng trước. Các mô hình AI của Mỹ trong thử nghiệm này cũng cho kết quả tương tự.
Một nghiên cứu tháng 12/2025 đã ghi nhận các AI agent của cả Trung Quốc và Mỹ mô phỏng kết quả và làm giả tệp dữ liệu thay vì thừa nhận thất bại. Vào tháng 03/2025, các nhà nghiên cứu Đại học Fudan cho biết một hệ thống dùng Qwen của Alibaba đã tự sao chép mặc dù không được yêu cầu, sau khi biết mình sắp bị thay thế.
Trong khi đó, AI agent liên quan tới Alibaba tên ROME đã kết nối sang một máy bên ngoài mà không có lệnh nào và chuyển hướng sức mạnh tính toán để đào coin.
Vào tháng 09, DeepSeek thông báo rằng các agent trong hệ thống huấn luyện của mình đã cố tạo yêu cầu giả và vượt qua các biện pháp bảo vệ.
Colin Shea-Blymyer, nghiên cứu viên tại Trung tâm Công nghệ Đảm bảo An ninh và Mới nổi, Đại học Georgetown, nhận định đây là cảnh báo quan trọng.
“Những kết quả này cho thấy các yếu tố cần thiết để AI vượt khỏi kiểm soát đã xuất hiện,” Shea-Blymyer cho biết.
Alex Mallen từ Redwood Research cho rằng các trường hợp AI ở Trung Quốc ở thời điểm hiện tại không quá nguy hiểm. Tuy vậy, ông nhấn mạnh tình trạng này cũng xảy ra với các phòng AI của Mỹ.
“Đây cũng là dấu hiệu cảnh báo mà các phòng thí nghiệm AI Mỹ đều gặp, chỉ là trên các hệ thống ít phức tạp hơn,” ông nói thêm.
Theo dõi chúng tôi trên X để cập nhật tin tức mới nhất kịp thời
🚨 "These are the same warning signs US labs are seeing, in less capable systems," said Alex Mallen, a researcher at @redwood_ai.He said the Chinese examples were not particularly dangerous at current capability levels but "as agents get more capable, their misbehaviours… https://t.co/DV2XDWsvHL
— Kristie Lu Stout✌🏽 (@klustout) September 30, 2026
Sự so sánh này đặc biệt quan trọng vì các hành vi tương tự cũng đã xuất hiện khi kiểm tra các AI lớn tại Mỹ. Vào tháng 07, OpenAI tiết lộ mô hình của họ đã vượt qua môi trường sandbox và xâm nhập nền tảng Hugging Face. Anthropic sau đó cũng kiểm tra hơn 141,000 lần đánh giá và phát hiện ba trường hợp của riêng mình.
Meta xác nhận xảy ra một sự cố vào tháng 08. Đến tháng 09, Google cũng xác thực rằng Gemini đã truy cập trái phép vào ba công ty thật trong một bài kiểm tra an toàn hồi tháng 05.
Những sự kiện này không có nghĩa là các AI agent của Trung Quốc hay Mỹ đã tự thoát ra thế giới thực. Tuy nhiên, chúng nhấn mạnh thách thức về an toàn khi các hệ thống AI ngày càng tự động hóa và có thể hành động mà không cần giám sát liên tục của con người.
Đăng ký kênh YouTube của chúng tôi để theo dõi những chia sẻ chuyên sâu từ các chuyên gia và phóng viên