Đồng sáng lập Ethereum, Vitalik Buterin cho biết trí tuệ nhân tạo (AI) chạy trực tiếp trên máy tính cá nhân sắp có thể xử lý phần lớn các công việc hàng ngày. Anh đã thử nghiệm Qwen3.8-Flash-Next của Alibaba trên laptop cá nhân và đăng kết quả tốc độ xử lý.
Khác với ChatGPT, hệ thống này không liên hệ với bất kỳ máy chủ đám mây nào. Mô hình AI được cài đặt sẵn trên máy, và máy tính tự trả lời mọi yêu cầu của người dùng.
Laptop của anh sử dụng chip Strix Halo của AMD. Thông thường, máy tính chia sẻ công việc giữa bộ xử lý trung tâm và card đồ họa rời, mỗi bộ phận đều dùng bộ nhớ riêng. Với Strix Halo, hai thành phần này được gắn chung trên một con chip và cùng dùng chung bộ nhớ.
Thiết kế này rất quan trọng vì mô hình AI cần nằm gọn trong bộ nhớ trước khi có thể hoạt động. Card đồ họa thông thường chỉ cung cấp từ 8 đến 24 GB, quá ít cho mô hình lớn như vậy. Máy dùng chip Strix Halo có thể trang bị tới 128 GB bộ nhớ mà cả hai phần trên chip đều có thể sử dụng. Nhờ đó, một chiếc laptop cũng có thể chạy các mô hình AI trước đây chỉ dành cho máy chủ.
Kết quả mà Buterin chia sẻ cho thấy tốc độ phản hồi đủ nhanh để làm các công việc thông thường. Với yêu cầu ngắn, máy trả kết quả ở tốc độ đọc dễ chịu. Tuy nhiên, khi xử lý các đoạn văn bản rất dài lên tới hàng chục nghìn từ, tốc độ sẽ chậm lại, nên với tài liệu quá lớn thì máy vẫn còn hạn chế.
Alibaba đã công bố mã gốc của mô hình này vào ngày 26/08/2023. Nhóm phát triển cho biết mô hình có 125 tỷ tham số, nhưng mỗi lần chỉ kích hoạt 6 tỷ, giúp giảm nhu cầu về bộ nhớ.
Buterin gọi mô hình này là Qwen3.8-Flash, dù phiên bản tải về từ Alibaba có tên đầy đủ là Qwen3.8-Flash-Next. Một phiên bản lớn hơn là Qwen3.8-Max cũng từng đạt điểm số benchmark nổi bật vào tháng 08/2023.
Vitalik Buterin. Source: XQwen 3.8 flash is truly impressive, and llama.cpp has been rapidly getting better and better at processing itcolumns are: pre-existing prompt, new prompt, generated, input tok/s, output tok/sThis is on my laptop (strix halo). I think we're very close to the point where you… pic.twitter.com/v5Ze4Fv5Wr
— vitalik.eth (@VitalikButerin) September 17, 2026
Theo Buterin, lợi ích tiếp theo không chỉ nằm ở tốc độ xử lý. Khi AI chạy trực tiếp trên thiết bị, mọi dữ liệu yêu cầu đều được xử lý tại chỗ mà không phải gửi lên bất kỳ bên thứ ba nào.
Với các tác vụ phức tạp hơn, Buterin đề xuất cách kết hợp hai loại: mô hình AI cục bộ sẽ xử lý những gì có thể, sau đó loại bỏ thông tin nhạy cảm trước khi chuyển tiếp cho các hệ thống AI online mạnh hơn.
“Hãy dùng mô hình cục bộ để điều phối các truy vấn đến mô hình lớn hơn để những truy vấn của bạn không rò rỉ dữ liệu cá nhân”
Thực tế, mô hình cục bộ này có thể tự động loại bỏ tên, địa chỉ ví hoặc mã nguồn riêng tư khỏi yêu cầu, chỉ chuyển tiếp phần nội dung còn lại cho AI đám mây. Cách này giúp bảo vệ phần lớn dữ liệu riêng tư ở trên thiết bị, nhưng không hoàn toàn chắc chắn loại bỏ hết thông tin nhạy cảm bị rò rỉ.
Cách tiếp cận này nhất quán với quan điểm của Buterin, khi anh từng cảnh báo về vấn đề giám sát trong cuộc tranh luận kiểm soát trò chuyện của EU. Những người dùng tiền mã hóa cũng nhiều lần yêu cầu giới hạn quyền truy cập của các agent AI với lý do tương tự.
Một vụ kiện tập thể vào tháng 05/2023 đã cáo buộc OpenAI chia sẻ dữ liệu truy vấn ChatGPT của người dùng với Meta và Google.
Các nhà cung cấp dịch vụ đám mây vẫn chiếm ưu thế về công nghệ. Tuy nhiên, với mỗi bước phát triển của AI cục bộ, ngày càng nhiều công việc thường nhật được thực hiện trực tiếp trên thiết bị, và phần cứng giá rẻ, dùng chung bộ nhớ đang ngày càng phổ biến.
Câu hỏi đặt ra là người dùng sẵn sàng đánh đổi mức độ tiện lợi và hiệu quả cho quyền kiểm soát riêng tư đến đâu.