TradingKey - Các mô hình ngôn ngữ lớn AI của Trung Quốc một lần nữa trở thành tâm điểm chú ý của thị trường toàn cầu.
Gần đây, nhà phát triển AI Trung Quốc Moonshot AI đã chính thức ra mắt mô hình lớn thế hệ mới nhất của mình mang tên Kimi K3. Với kiến trúc trọng số mở (open-weights), hiệu suất tiệm cận với các mô hình hàng đầu thế giới và chi phí suy luận cạnh tranh hơn, Kimi K3 đã nhanh chóng khơi dậy các cuộc thảo luận sôi nổi trong giới công nghệ và thị trường vốn nước ngoài.
Sau thông báo này, thị trường đã lo ngại trong ngắn hạn về việc liệu logic tiếp tục đầu tư hàng trăm tỷ USD vào xây dựng cơ sở hạ tầng AI của các gã khổng lồ công nghệ toàn cầu có bị ảnh hưởng hay không khi ngày càng nhiều mô hình AI hiệu suất cao, chi phí thấp xuất hiện, đồng thời lĩnh vực chip AI của Mỹ cũng ghi nhận một đợt điều chỉnh rõ rệt.
Tuy nhiên, ngày càng nhiều nhà phân tích tin rằng Kimi K3 không nhất thiết là một yếu tố tiêu cực đối với ngành chip AI. Thay vào đó, hiệu suất mô hình được cải thiện và chi phí sử dụng thấp hơn có thể hạ thấp rào cản đối với các ứng dụng AI, mang lại nhiều người dùng hơn, tần suất gọi lệnh cao hơn và nhu cầu suy luận ở quy mô lớn hơn. "Nghịch lý Jevons" trong kinh tế học có thể đang một lần nữa diễn ra trong ngành AI.
Kimi K3 là mô hình chủ lực được Moonshot AI ra mắt vào tháng 7 năm 2026, chủ yếu hướng tới các kịch bản ứng dụng như lập trình chu kỳ dài, công việc tri thức phức tạp và các tác nhân AI.
Theo công bố từ Moonshot AI, Kimi K3 áp dụng kiến trúc Mixture-of-Experts (MoE), sở hữu tổng cộng 2,8 nghìn tỷ tham số và cửa sổ ngữ cảnh 1 triệu token, đồng thời hỗ trợ gốc khả năng hiểu thị giác. Trong số 896 mô-đun chuyên gia của mô hình, chỉ có 16 mô-đun được kích hoạt cho mỗi lần tính toán nhằm nâng cao năng lực mô hình và hiệu quả suy luận. Đáng chú ý là con số 2,8 nghìn tỷ là tổng quy mô tham số, điều này không đồng nghĩa với việc mỗi token được tạo ra đều kích hoạt tất cả các tham số.
Kimi K3 đã thể hiện hiệu suất vượt trội trong các bài đánh giá lập trình frontend, từng xếp gần vị trí dẫn đầu trên bảng xếp hạng Frontend Code Arena với điểm số 1.679. Tuy nhiên, thành tựu này chỉ giới hạn ở các bài kiểm tra lập trình cụ thể và không đồng nghĩa với việc vượt trội toàn diện so với các mô hình đầu bảng của OpenAI và Anthropic xét về mặt năng lực tổng thể.
Giá cả cũng là một lý do cốt lõi khiến Kimi K3 thu hút nhiều sự chú ý. Biểu giá API chính thức cho thấy mức phí là 3 USD trên mỗi triệu token đầu vào—giảm xuống còn 0,30 USD khi trúng bộ nhớ đệm (cache hit)—và 15 USD trên mỗi triệu token đầu ra. Đối với các tác nhân AI cần truy xuất lặp đi lặp lại các kho mã nguồn, tài liệu doanh nghiệp và ngữ cảnh dài, cơ chế lưu bộ nhớ đệm có thể giảm đáng kể chi phí đầu vào.
Tuy nhiên, một "đơn giá trên mỗi token thấp hơn" không đồng nghĩa với việc chi phí thực tế của tất cả các tác vụ sẽ giảm theo tỷ lệ tương ứng. Độ dài đầu ra của mô hình, thời gian suy luận, tỷ lệ trúng bộ nhớ đệm và tỷ lệ hoàn thành tác vụ đều sẽ ảnh hưởng đến chi phí cuối cùng.
Do đó, sự thay đổi thực sự mà Kimi K3 mang lại không đơn thuần là khơi mào một cuộc chiến giá cả, mà là thúc đẩy việc ứng dụng rộng rãi hơn các mô hình tiên tiến có tỷ lệ hiệu năng trên giá thành cao hơn.
Sau khi ra mắt Kimi K3, một số nhà đầu tư lo ngại rằng hiệu suất mô hình được cải thiện sẽ làm giảm nhu cầu sử dụng GPU. Tuy nhiên, đánh giá từ thực tế vận hành, việc chi phí suy luận trên mỗi đơn vị giảm đi không đồng nghĩa với việc tổng nhu cầu về chip sẽ sụt giảm.
Kimi K3 áp dụng kiến trúc Mixture of Experts (MoE) dạng thưa, chỉ kích hoạt một tập hợp con các mô-đun chuyên gia trong mỗi lần suy luận, giúp kiểm soát chi phí tính toán phát sinh trên mỗi lượt chạy. Tuy nhiên, mô hình này vẫn cần lưu trữ và điều phối lượng dữ liệu trọng số khổng lồ, đồng thời xử lý các ngữ cảnh lên tới 1 triệu token. Trong các đợt triển khai quy mô lớn, các tác vụ này vẫn phụ thuộc vào GPU, bộ tăng tốc AI, bộ nhớ băng thông rộng, mạng tốc độ cao và các cụm máy chủ.
Quan trọng hơn, khi chi phí mô hình giảm xuống, số lượng người dùng và tần suất sử dụng có thể tăng trưởng nhanh hơn nữa. Sau khi Kimi K3 ra mắt, lượng yêu cầu của người dùng đã nhanh chóng tiếp cận giới hạn công suất của các cụm tính toán hiện tại. Moonshot AI đã tạm thời đình chỉ một số lượt đăng ký của người dùng mới để ưu tiên tài nguyên sức mạnh tính toán cho người dùng hiện tại. Điều này cho thấy khi các mô hình trở nên rẻ hơn và dễ sử dụng hơn, nhu cầu mới có thể nhanh chóng tiêu thụ lượng sức mạnh tính toán tiết kiệm được nhờ hiệu suất nâng cao.
Đây chính là cốt lõi của "Nghịch lý Jevons": khi hiệu suất sử dụng tài nguyên được cải thiện, chi phí đơn vị sẽ giảm xuống, nhưng vì phạm vi ứng dụng được mở rộng, tổng mức tiêu thụ của nó trên thực tế có thể lại tăng lên.
Trong ngành AI, những cải tiến về hiệu suất mô hình có thể hạ thấp rào cản cho các doanh nghiệp trong việc triển khai dịch vụ chăm sóc khách hàng thông minh, trợ lý lập trình, trợ lý văn phòng, phân tích tài chính và hệ thống hỗ trợ y tế. Khi ngày càng có nhiều ứng dụng chạy liên tục, lượng yêu cầu suy luận hàng ngày sẽ tăng vọt, cuối cùng thúc đẩy nhu cầu về sức mạnh tính toán, bộ nhớ và cơ sở hạ tầng trung tâm dữ liệu tiếp tục tăng trưởng.
Dù nghịch lý Jevons đưa ra một lời giải thích lạc quan cho nhu cầu chip AI, đây không phải là một kết quả tất yếu. Về lâu dài, nếu tốc độ cải thiện hiệu suất mô hình vượt quá tốc độ tăng trưởng của người dùng và ứng dụng, sự sụt giảm sức mạnh tính toán yêu cầu trên mỗi tác vụ vẫn có thể thu hẹp một phần nhu cầu phần cứng.
Đầu tư cơ sở hạ tầng AI cuối cùng phải đối mặt với thử thách về hiệu quả thương mại. Nếu các công ty đổ lượng vốn khổng lồ vào xây dựng trung tâm dữ liệu nhưng không thể tạo ra đủ doanh thu thông qua các gói đăng ký, quảng cáo, dịch vụ đám mây hoặc phần mềm doanh nghiệp, tốc độ tăng trưởng của chi phí vốn có thể chậm lại. Mức độ hưởng lợi của các công ty chip khác nhau cũng sẽ phân hóa, và không phải tất cả cổ phiếu khái niệm AI đều tăng trưởng đồng thời.
Kimi K3 cũng có thể làm gia tăng cạnh tranh về giá trên thị trường mô hình. Khi các mô hình nguồn mở hoặc mô hình trọng số mở ngày càng thu hẹp khoảng cách về năng lực với các mô hình nguồn đóng, biên lợi nhuận API của các công ty AI có thể chịu áp lực. Để giảm chi phí, các nhà phát triển mô hình sẽ chú trọng hơn vào các chip tùy chỉnh, công nghệ lượng tử hóa, tối ưu hóa suy luận và chiến lược đa nhà cung cấp, điều này có thể làm suy yếu vị thế đàm phán của các nhà sản xuất GPU đa dụng tại một số thị trường nhất định.
Do đó, tác động của các mô hình chi phí thấp đối với ngành chip AI không phải là tác động tích cực một chiều. Một mặt, nó mở rộng thị trường ứng dụng AI, mặt khác, nó cũng buộc các công ty cơ sở hạ tầng phải nâng cao hiệu quả năng lượng và giảm chi phí tính toán trên mỗi đơn vị.