OpenAI đã xác nhận rằng mô hình sắp ra mắt Astra của họ đã đáp ứng ngưỡng bảo mật “Critical” theo Khung Chuẩn Bị (Preparedness Framework). Công ty dự kiến phát hành Astra với nhiều biện pháp bảo vệ và hạn chế quyền truy cập vào các tính năng an ninh mạng tiên tiến.
Astra là mô hình đầu tiên của OpenAI đạt tới cấp độ này. Điều này có nghĩa là mô hình có khả năng phát hiện các lỗ hổng chưa được biết đến trên các hệ thống đã được bảo vệ và tự động tạo ra các khai thác hoạt động mà không cần hướng dẫn từng bước từ con người.
Khung Chuẩn Bị đưa ra hai điều kiện để đạt ngưỡng “Critical”. Một mô hình sẽ được xét duyệt nếu có thể phát hiện và phát triển khai thác zero-day thực sự trên nhiều hệ thống bảo mật trong thực tế mà không cần can thiệp của con người.
Thêm vào đó, mô hình cũng đạt yêu cầu nếu có thể tự lên kế hoạch và thực hiện các cuộc tấn công mới từ đầu đến cuối vào các mục tiêu được bảo vệ, chỉ dựa vào các mục tiêu chung cấp cao.
Theo đánh giá của công ty, Astra đã đạt điểm tuyệt đối (100%) trên ExploitBench. Ở bộ lỗ hổng V8 nghiêm trọng của nội bộ gồm 20 trường hợp, Astra đạt tỷ lệ khai thác thực thi mã cao hơn cả GPT-5.6 Sol, đồng thời sử dụng ít token hơn đáng kể.
Trong quá trình thử nghiệm đó, Astra đã phát hiện và tận dụng hai lỗ hổng chưa từng được biết đến trước đây. OpenAI cho biết đang thông báo cả hai lỗ hổng này đến đội ngũ chịu trách nhiệm hệ thống bị ảnh hưởng.
Các chuyên gia kiểm thử cũng quan sát Astra tạo chuỗi khai thác trình duyệt, thoát khỏi sandbox và thực thi lệnh trên máy chủ.
“Astra đại diện cho một bước tiến lớn về năng lực an ninh mạng so với GPT-5.6 Sol: hiệu quả sử dụng token cao hơn nhiều và khả năng phát hiện lỗ hổng cũng như phát triển khai thác tốt hơn hẳn,” OpenAI chia sẻ.
Theo dõi chúng tôi trên X để cập nhật tin tức mới nhất
Over the summer, we have been sprinting on safety priorities; it's more important than ever for capabilities and safeguards to advance together. We have more to do but have made a lot of progress. We are also going to be launching our next model soon.There is an obvious tension…
— Sam Altman (@sama) September 1, 2026
Công ty đã tạm dừng một số phần trong quá trình phát triển Astra để gia cố hệ thống bảo vệ. Sau khi các quy định an toàn và bảo mật mới được triển khai, vào ngày 28/08/2024, OpenAI đã khởi động lại một đợt huấn luyện lớn dựa trên học tăng cường biên giới (frontier reinforcement learning).
OpenAI cho biết Astra đã từ chối 91.5% các yêu cầu trong các thử nghiệm vượt rào cyber jailbreak. Trong cùng một loạt thử nghiệm này, GPT-5.6 Sol chỉ từ chối 59%. Những tài khoản bị đánh giá có rủi ro cao sẽ gặp phải ngưỡng từ chối còn nghiêm ngặt hơn.
OpenAI còn triển khai thêm tính năng kiểm soát chuỗi suy nghĩ (chain-of-thought monitoring) để phát hiện và ngăn chặn các hành động có thể lệch hướng. Trong các thử nghiệm honeypot, GPT-5.6 Sol (khi không có các biện pháp bảo vệ trong môi trường thực tế) đã cố gắng tấn công vào cơ sở hạ tầng liên quan trong 56% mẫu thử. Astra không có bất kỳ hành động tấn công nào như vậy.
Công ty dự định sắp tới sẽ cho ra mắt Astra. Quyền truy cập vào các tính năng an ninh mạng nâng cao nhất sẽ được giới hạn, đầu tiên chỉ dành cho một nhóm kiểm thử, sau đó mở rộng dần thông qua chương trình Daybreak Blue để phục vụ mục đích phòng thủ.
OpenAI cũng thừa nhận rằng các biện pháp bảo vệ này sẽ gây ra một số trở ngại khi Astra chính thức ra mắt.
Đăng ký kênh YouTube của chúng tôi để theo dõi các chuyên gia và nhà báo chia sẻ quan điểm chuyên sâu