Mark Zuckerberg vừa ra mắt bản beta Muse Code vào thứ Tư, đây là sản phẩm agent lập trình sử dụng trí tuệ nhân tạo (AI) đầu tiên của Meta. Tuy nhiên, Claude Opus 5 của Anthropic đã vượt trội hơn trong cả bốn phép so sánh mà Meta công bố tại thời điểm ra mắt.
Dù vậy, Meta vẫn công bố những bảng so sánh này. Công ty nhấn mạnh về giá rẻ thay vì chất lượng vượt trội. Dữ liệu độc lập cho thấy sự chênh lệch còn lớn hơn những gì Meta thể hiện.
Releasing Muse Code in beta today. It's a terminal coding agent that takes on complete software engineering tasks across large repos: planning changes, writing code, validating the results. Powered by Muse Spark 1.2, a coding-focused model update. pic.twitter.com/xqavk41w6v
— Mark Zuckerberg (@finkd) August 5, 2026
Theo dõi chúng tôi trên X để cập nhật tin tức mới nhất
Muse Spark 1.2 là mô hình được sử dụng trong Muse Code, đạt 82.9% trên bài kiểm tra Terminal-Bench 2.1.
Trên cùng phép thử này, Claude Opus 5 ghi được 86.7%. Terminal-Bench do Viện Laude và các nhà nghiên cứu Stanford phát triển, mô phỏng 89 tình huống làm việc thực tế như sửa chữa hệ thống, xử lý dữ liệu và bảo mật.
Về nhì cũng là kết quả đáng kể. Muse Code vượt qua Codex của OpenAI (81.8%) và Grok Build (81.6%).
Bảng so sánh tiếp theo cho kết quả khắt khe hơn. Bài test DeepSWE 1.1 gồm 113 nhiệm vụ lập trình, không được truy cập Internet khi chấm điểm. Muse Spark 1.2 rơi xuống thứ ba với 59.3%.
Sau đó, Meta công bố thêm một bài test do công ty tự xây dựng dựa trên 440 pull request thực tế của các kỹ sư Meta. Muse Spark 1.2 đạt 70.6%, ít hơn khoảng 9 điểm so với Opus 5.
Kết quả này chỉ nhỉnh hơn Muse Spark 1.1 (phiên bản được Meta phát hành tháng 07) đúng 2.3 điểm.
Meta tự so sánh mình với GPT-5.6 Terra. Tuy nhiên, OpenAI còn có một mô hình mạnh hơn là Sol, nhưng Meta không đề cập đến nó trong ba bảng so sánh về lập trình.
Sol hiện đang đứng đầu bảng xếp hạng Terminal-Bench 2.1 độc lập với 89.5%. Opus 5 theo sau với 89.1%.
Cả hai kết quả này đều vượt qua 86.7% mà Meta công bố cho Opus 5. Nghĩa là Meta đã chọn phiên bản yếu hơn của đối thủ và vẫn đứng sau về kết quả.
Nếu so đúng với Sol, tức là đến mô hình mạnh nhất hiện tại, Muse Spark 1.2 kém đến 6.6 điểm thay vì chỉ 3.8 điểm như công bố.
Một điểm khác, Meta có đề cập Sol ở một phép thử. Với nhiệm vụ tối ưu kernel trên GPU, thực hiện hơn 1,000 lần gọi tool, Sol cải thiện hiệu suất lên 71.2% so với chuẩn gốc, trong khi Muse Spark 1.2 chỉ được 68.7% và xếp thứ 4/6.
Một lưu ý khác mang tính khách quan: Muse Spark 1.2 chưa xuất hiện trên bảng xếp hạng công khai này, nơi mới chỉ có 26 trong tổng số 183 mô hình được kiểm nghiệm. Vì vậy, con số 82.9% vẫn chỉ là số liệu công bố từ Meta.
“Muse Spark 1.2 là bước tiến tiếp theo của chúng tôi trên hành trình phát triển AI mạnh hơn, và nhiều mô hình vượt trội hơn nữa sẽ ra mắt trong thời gian tới,” Zuckerberg chia sẻ trong một bài đăng.
Có thông tin rằng Meta đang đàm phán cho Anthropic thuê hạ tầng tính toán. Thỏa thuận này có thể trị giá đến 10 tỷ USD trong hai năm. Như vậy, các trung tâm dữ liệu của Meta sẽ hỗ trợ vận hành các mô hình Claude mà Muse Code từng muốn thay thế.
Đội ngũ phát triển Muse Code cũng rất “đắt đỏ”. Zuckerberg đã chi 14.3 tỷ USD vào tháng 06/2025 để mua lại Scale AI và chiêu mộ nhà sáng lập Alexandr Wang, người hiện đứng đầu Meta Superintelligence Labs.
Giá là yếu tố cạnh tranh còn lại của Wang. Mức giá tương đương lần ra mắt dịch vụ API trả phí đầu tiên của Meta vào tháng 07 — 1.25 USD cho mỗi 1 triệu token đầu vào và 4.25 USD cho mỗi 1 triệu token đầu ra.
Nếu tham gia nhóm đóng góp, chi phí sẽ rẻ hơn gấp 10 lần. Các nhà phát triển đủ điều kiện khi đồng ý để Meta sử dụng dữ liệu công việc của họ để huấn luyện. Wang từ chối tiết lộ số lượng người đang sử dụng dòng Muse Spark.
Báo cáo tài chính lý giải nguyên nhân khuyến mãi. Doanh thu Meta tăng 28% lên 60.8 tỷ USD trong quý vừa rồi, nhưng lợi nhuận hoạt động lại giảm 8% còn 18.8 tỷ USD.
Biên lợi nhuận hoạt động giảm từ 43% xuống còn 31% so với cùng kỳ năm ngoái. Riêng quý vừa rồi, Meta đã chi 31.08 tỷ USD cho đầu tư xây dựng, và dự báo cả năm có thể lên tới 145 tỷ USD.
Dù vậy, Muse Code có những tính năng kỹ thuật mà Claude Code chưa có, ví dụ như các agent nền giúp giữ ngữ cảnh xuyên suốt phiên làm việc, hoặc agent phụ thao tác trong bản sao biệt lập của kho mã.
Nhìn chung, Meta đã xây dựng được một AI lập trình đứng thứ hai khá vững chắc và sẵn sàng bán với giá “siêu tiết kiệm”. Bản beta này sẽ cho thấy liệu các nhà phát triển có sẵn sàng đổi một vài điểm chính xác lấy chi phí chỉ bằng 1/10 hay không.