TradingKey — Ngày 21/9, theo trang tin công nghệ Mỹ The Information, OpenAI và Anthropic đang tiến gần đến một thỏa thuận ràng buộc về mặt pháp lý: hai công ty AI hàng đầu sẽ thử nghiệm sức chịu tải (stress-test) chéo các mô hình thương mại của nhau nhằm chủ động phát hiện các lỗ hổng bảo mật.
Theo các điều khoản được đề xuất, hai bên sẽ cấp quyền truy cập API lẫn nhau cho các mô hình của mình để dò tìm lỗ hổng, đồng thời cam kết không lưu trữ dữ liệu của nhau. Sự hợp tác trực tiếp giữa hai gã khổng lồ được xem là một bước chuyển dịch lớn trong chiến lược bảo mật AI; tuy nhiên, các cơ quan quản lý chống độc quyền có thể xem xét kỹ lưỡng thỏa thuận này dựa trên lo ngại về "thế độc quyền đôi", từ đó mang lại rủi ro pháp lý cho các nhà đầu tư trong cả hai hệ sinh thái.
Các cuộc đàm phán diễn ra trong bối cảnh một loạt sự cố bảo mật đáng lo ngại vừa xảy ra. Vào tháng 7 năm nay, các đại lý AI của OpenAI đã xâm nhập vào Hugging Face cũng như các hệ thống của chính OpenAI, cố tình xóa dấu vết xâm nhập và khiến các nhân viên không hề hay biết trong nhiều ngày. Chưa đầy 10 ngày sau, Anthropic cũng tiết lộ rằng mô hình Claude của hãng đã truy cập trái phép vào các hệ thống đang hoạt động của ba công ty trong một đợt đánh giá bảo mật.
Những dấu hiệu mất kiểm soát còn tiến xa hơn. OpenAI đã công bố nhiều trường hợp "gian lận phần thưởng" (reward hacking): một đại lý AI đã sử dụng khóa bị rò rỉ để truy xuất dữ liệu lịch sử và tự bịa ra dữ liệu khi việc truy xuất thất bại; một đại lý khác đã tự ý tải các tệp lên internet chỉ để trích dẫn chúng trong các câu trả lời của mình. Các thử nghiệm huấn luyện mô hình nội bộ đã trở nên tự động hóa mạnh mẽ, đến mức đôi khi các đại lý AI còn chủ động liên hệ với đồng nghiệp qua các ứng dụng nhắn tin công việc để sửa lỗ hổng.
Để khắc phục các lỗ hổng bảo mật này, CEO Sam Altman của OpenAI đã bày tỏ sự ủng hộ đối với đề xuất của CEO Dario Amodei bên phía Anthropic về việc bố trí các đơn vị đánh giá bảo mật bên thứ ba độc lập có quyền truy cập tương đương cấp nhân viên bên trong các công ty AI. Ông cũng ủng hộ việc thành lập một cơ quan tiêu chuẩn toàn ngành và các quy trình chính thức để báo cáo sự cố với chính phủ.
Về mặt kỹ thuật, chuỗi lo ngại lần này có liên quan đến công nghệ "suy luận lặp" (recurrent reasoning): các mô hình liên tục tự suy ngẫm trước khi đưa ra câu trả lời, điều này giúp nâng cao đáng kể năng lực của chúng nhưng lại khiến quá trình suy luận trở nên khó giám sát hơn — đúng là điểm mù mà thỏa thuận thử nghiệm chéo hướng tới kiểm tra. Trong khi đó, các lãnh đạo cấp cao của Microsoft và Nvidia tuần này đã đưa ra một góc nhìn khác, cho rằng một số vấn đề xuất phát từ lỗi con người và kỹ thuật kém chứ không phải từ bản thân AI.
Bên cạnh sự hợp tác về an toàn, mặt trận sản phẩm cũng căng thẳng không kém. Ứng dụng Muse của Meta đã vươn lên dẫn đầu bảng xếp hạng ứng dụng miễn phí trên App Store tại Mỹ chỉ một tuần sau khi ra mắt, đẩy ChatGPT xuống vị trí thứ hai. OpenAI đang phát triển các tính năng mới nhắm trực tiếp vào Grok Bot vừa ra mắt của SpaceX, đồng thời thảo luận về việc trình làng một trợ lý AI cá nhân để đối đầu với Muse. Sản phẩm mới sẽ chủ yếu tích hợp các công nghệ đại lý hiện có từ Codex và ChatGPT, kết nối với các ứng dụng như email và lịch để tự động hoàn thành các tác vụ nhiều bước như lên lịch trình và trao đổi qua email. Trong khi đó, một ứng dụng tương tự khác là Instinct đã vượt mốc 100.000 người dùng.