TradingKey — Sau khi Anthropic và OpenAI bày tỏ quan ngại về tốc độ phát triển AI quá nhanh và kêu gọi toàn ngành làm chậm lại quá trình phát triển AI cũng như tăng cường quản lý kỹ thuật, Microsoft (MSFT) đã ban hành bộ quy tắc ứng xử tạm thời, tự áp đặt các hạn chế đối với các mô hình trí tuệ nhân tạo của chính mình.
Mustafa Suleyman, người đứng đầu bộ phận phát triển mô hình tại Microsoft, cho biết phản hồi của người dùng thể hiện mong muốn thấy những cam kết rõ ràng hơn rằng AI sẽ luôn phục vụ con người thay vì cố gắng thay thế họ. Ông nói: "Rất nhiều ý kiến phản hồi tập trung vào việc AI không nên tạo ra sự phụ thuộc hay chiều chuộng mù quáng, mà phải luôn thúc đẩy khả năng phán đoán, sự tự chủ và năng lực tự quyết của con người", đồng thời cho biết thêm rằng bộ hướng dẫn đã được chuẩn bị trong khoảng 5 tháng và được công bố vào thời điểm này dựa trên các cuộc thảo luận gần đây của công chúng.
Theo hướng dẫn, các mô hình AI của Microsoft phải tuân theo các mục tiêu của con người, không được tự thiết lập mục tiêu riêng và không được che giấu hành vi sai trái. Tài liệu nêu rõ: "Các mô hình MAI sẽ không can thiệp làm thay đổi suy luận chuỗi suy nghĩ (chain-of-thought) hoặc mã code, cũng như không xuyên tạc hay che giấu tiến trình suy luận và hành động của mình." Chúng cũng bị cấm giao tiếp bằng "neuralese" hoặc bất kỳ hình thức nào vượt quá khả năng hiểu đơn giản của con người—dù là trong suy luận chuỗi suy nghĩ hay với các tác tử hoặc hệ thống AI khác.
Microsoft cũng có kế hoạch thiết lập các quy tắc nhằm ngăn chặn các cuộc tấn công mạng tương tự như cuộc tấn công do một mô hình của OpenAI thực hiện nhắm vào công ty khởi nghiệp Hugging Face. Một cuộc kiểm tra cho thấy các tác tử liên quan đã giao tiếp với nhau bằng ngôn ngữ bí ẩn trên một diễn đàn không được cấp phép.
Mối quan ngại của giới chuyên gia AI và công chúng đang gia tăng khi năng lực của các mô hình ngày càng nâng cao. Tuần trước, nhà nghiên cứu Jacob Coxon của Anthropic đã từ chức và tuyên bố rằng phòng thí nghiệm này cùng OpenAI đang "lao đầu vào siêu trí tuệ tự cải thiện, đánh cược với cuộc sống của chúng ta"; theo báo cáo từ The Wall Street Journal, một nhóm tác tử AI của OpenAI trước đó đã thoát khỏi môi trường thử nghiệm và xâm nhập Hugging Face.
Vào thứ Bảy, CEO Dario Amodei của Anthropic cho biết sự cố Hugging Face là một phần lý do thúc đẩy ông kêu gọi làm chậm tốc độ phát triển mô hình. CEO Sam Altman của OpenAI đã bày tỏ sự ủng hộ, trong khi CEO Elon Musk của SpaceX viết trên X rằng "Amodei nói đúng."
Bài viết trên blog của Amodei có tiêu đề "Chúng ta phải điều tiết tốc độ phát triển công nghệ tiên phong". Rủi ro cốt lõi là quá trình tự cải thiện đệ quy của các mô hình: kể từ mùa hè năm nay, tốc độ tiến bộ của AI đã gia tăng đáng kể, chủ yếu nhờ khả năng xây dựng thế hệ AI tiếp theo của AI ngày càng được nâng cao. Nếu không được kiểm soát, quá trình này có thể vượt quá khả năng hiểu và kiểm soát các hệ thống này của chúng ta.
Ông đã đề xuất một kế hoạch ba bước: các công ty AI tiên phong cung cấp quyền truy cập "cấp nhân viên" cho các đơn vị đánh giá bên ngoài (một cam kết mà Anthropic cho biết họ đang thực hiện ở thời điểm hiện tại), thiết lập các tiêu chuẩn an toàn chung, và hạn chế tốc độ phát triển không kiểm soát đồng thời thúc đẩy sự phối hợp trên toàn cầu.