Mẫu Sonnet mới của Anthropic gần đạt hiệu suất Opus nhưng sử dụng nhiều token hơn

Nguồn Beincrypto

Anthropic đã ra mắt Claude Sonnet 5.5 vào ngày 28/09 với mức giá như Sonnet 5. Theo công ty, mẫu AI này hoạt động nhanh hơn hơn 30% và chi phí thấp hơn tối đa 30% cho mỗi nhiệm vụ.

Một công ty kiểm định độc lập lại có kết luận khác về chi phí khi thử đẩy hiệu suất mẫu AI này lên mức tối đa.

Theo dõi chúng tôi trên X để nhận tin tức mới nhất ngay khi vừa có

Anthropic giới thiệu mẫu 5.5 thứ hai chỉ sau vài ngày ra mắt Opus

Sonnet 5.5 là mẫu AI thứ hai trong dòng Claude 5.5. Anthropic đã ra mắt Opus 5.5 vào ngày 22/09. Cùng ngày đó, OpenAI cũng chính thức trình làng GPT-6 Sol và Luna.

Mẫu AI mới vẫn giữ mức giá của Sonnet 5, là 2 USD cho mỗi triệu input token và 10 USD cho mỗi triệu output token. Theo Anthropic, Sonnet 5.5 đạt điểm 70.6% trên bài kiểm tra Terminal-Bench 4.0, đây là bài đánh giá năng lực lập trình. Sonnet 5 chỉ đạt 10.3%, trong khi Opus 5.5 đạt 66.4%.

“Nếu Opus 5.5 được thiết kế cho công việc phức tạp cần đánh giá kỹ, thì Sonnet 5.5 phù hợp nhất với các tác vụ hàng ngày, sửa lỗi nhanh và tạo tài liệu, slide, hay bảng tính chỉn chu,” đội ngũ bình luận.

Anthropic cho biết Sonnet 5.5 không mở rộng biên giới về khả năng của dòng Claude. Vì vậy, việc kiểm tra độ an toàn tập trung vào các rủi ro như gây hiểu lầm cho người dùng hoặc bị lợi dụng cho những mục đích lớn và nguy hiểm.

Sonnet 5.5 còn được tích hợp các bộ lọc bảo mật mạng và bộ nhận diện chống sao chép nhằm ngăn chặn việc trích xuất suy luận của mô hình để huấn luyện cho các hệ thống cạnh tranh. Trong vài tuần tới, Claude Haiku 5.5 cũng sẽ được trình làng.

Trong khi đó, OpenAI đã hoãn ra mắt mẫu GPT-6.1 Astra vì lý do an toàn. CNBC xác nhận vào thứ Hai vừa qua rằng mẫu này chưa đáp ứng được chuẩn của công ty.

Artificial Analysis phát hiện Sonnet 5.5 tiêu tốn token nhiều hơn khi làm việc hết công suất

Artificial Analysis, đơn vị kiểm định từng xếp Grok 4.7 ở vị trí thứ tư, đã cho Sonnet 5.5 56 điểm trên Chỉ số Thông minh của họ. Con số này đặt Sonnet 5.5 ở vị trí thứ hai, kém Opus 5.5 hai điểm khi chạy hết mức tối đa.

Đơn vị này ghi nhận Sonnet 5.5 đạt 64% trên bài test Terminal-Bench 4.0, so với 60% ở Opus 5.5 và GPT-6 Astra. Ở các bài kiểm tra dạng kiến thức như GDPval-AA, Sonnet 5.5 có hiệu suất gần bằng Opus 5.5.

Theo họ, Sonnet 5.5 dùng số lượng token đáng kể hơn để đạt kết quả như trên.

“Khi hoạt động hết công suất, đạt hiệu suất gần bằng Opus 5.5, Claude Sonnet 5.5 sử dụng khoảng 193,000 Output token cho mỗi tác vụ của Chỉ số Thông minh,” đơn vị này chia sẻ.

Số lượng này cao hơn khoảng 60% so với Opus 5.5 và Sonnet 5 ở mức tối đa. Thậm chí còn gấp khoảng 7 lần so với GPT-6 Astra khi làm việc hết công suất.

Tuy nhiên, theo chia sẻ các khách hàng dùng thử sớm từ Anthropic, Sonnet 5.5 lại tiêu tốn ít token hơn Sonnet 5 ở các nhiệm vụ khác nhau. Đơn cử, Balyasny Asset Management cho biết lượng token cần thiết cho các tác vụ tài chính giảm hẳn.

“Trong bộ 2,441 tác vụ tài chính riêng tư gồm hỏi đáp, trích xuất, phân tích và dự báo, Claude Sonnet 5.5 không chỉ vượt điểm Sonnet 5 mà còn chỉ dùng khoảng 121,000 token mỗi câu trả lời, trong khi Sonnet 5 cần đến 497,000,” Joe Poirier, Kỹ sư AI cao cấp tại Balyasny Asset Management chia sẻ.

Artificial Analysis đã thử nghiệm bản tiền phát hành của Sonnet 5.5 có lỗi xuất dữ liệu cấu trúc mà Anthropic đã khắc phục. Đơn vị này sẽ tiến hành đánh giá lại trong thời gian tới.

Đăng ký kênh YouTube của chúng tôi để xem các chuyên gia và nhà báo nhận định sâu sắc về lĩnh vực này

Tuyên bố miễn trừ trách nhiệm: Chỉ dành cho mục đích thông tin. Hiệu suất trong quá khứ không đảm bảo cho kết quả trong tương lai.
placeholder
Dự đoán tỷ giá Yên Nhật 2024: Đã đến lúc giao dịch USD/JPY? Bắt đầu tư đầu tháng 3/2022 giá đồng Yên Nhật bắt đầu suy giảm nhanh chóng so với đồng đô la Mỹ. Ngày 20/4/2022 tỷ giá USD/JPY thậm chí chạm mốc 129, tỷ giá cao nhất trong vòng 20 năm trở lại đây, khiến cho cả nhà đầu tư lẫn các nhà chính sách tiền tệ của hai nước phải quan ngại.
Tác giả  Nhóm Traderins
ngày22 tháng 3 năm 2024
Bắt đầu tư đầu tháng 3/2022 giá đồng Yên Nhật bắt đầu suy giảm nhanh chóng so với đồng đô la Mỹ. Ngày 20/4/2022 tỷ giá USD/JPY thậm chí chạm mốc 129, tỷ giá cao nhất trong vòng 20 năm trở lại đây, khiến cho cả nhà đầu tư lẫn các nhà chính sách tiền tệ của hai nước phải quan ngại.
placeholder
WTI giữ vững trên mức 84,50$ khi lo ngại gia tăng về các lệnh trừng phạt của Mỹ đối với IranGiá dầu West Texas Intermediate (WTI) tăng sau khi ghi nhận mức giảm hơn 2% trong ngày trước đó, giao dịch quanh mức 84,70$/thùng trong giờ châu Á vào thứ Ba.
Tác giả  FXStreet
8 tháng 25 ngày Thứ Ba
Giá dầu West Texas Intermediate (WTI) tăng sau khi ghi nhận mức giảm hơn 2% trong ngày trước đó, giao dịch quanh mức 84,70$/thùng trong giờ châu Á vào thứ Ba.
placeholder
Forex hôm nay: Bất ổn địa chính trị khiến thị trường đứng ngồi không yênĐây là những gì bạn cần biết vào thứ Ba, ngày 22 tháng 9:
Tác giả  FXStreet
9 tháng 22 ngày Thứ Ba
Đây là những gì bạn cần biết vào thứ Ba, ngày 22 tháng 9:
placeholder
Dự báo giá bạc: XAG/USD giảm như nhà bài trên cát trước lập trường diều hâu của FedGiá bạc (XAG/USD) giảm 4,3% xuống gần 61,50$ trong phiên giao dịch châu Âu vào thứ Hai. Kim loại trắng lao dốc khi lãi suất trái phiếu chính phủ Mỹ cao đã làm giảm sức hấp dẫn của nó.
Tác giả  FXStreet
20 giờ trước
Giá bạc (XAG/USD) giảm 4,3% xuống gần 61,50$ trong phiên giao dịch châu Âu vào thứ Hai. Kim loại trắng lao dốc khi lãi suất trái phiếu chính phủ Mỹ cao đã làm giảm sức hấp dẫn của nó.
placeholder
Đô la Úc tích luỹ trên mức 0,7000 so với USD khi phe đầu cơ giá xuống chờ quyết định lãi suất của RBACặp AUD/USD kéo dài các biến động giá tích lũy trong phiên châu Á vào thứ Ba, giao dịch ngay trên mốc tâm lý 0,7000, gần mức thấp nhất kể từ ngày 4 tháng 8 trước quyết định của Ngân hàng Dự trữ Úc (RBA)
Tác giả  FXStreet
3 giờ trước
Cặp AUD/USD kéo dài các biến động giá tích lũy trong phiên châu Á vào thứ Ba, giao dịch ngay trên mốc tâm lý 0,7000, gần mức thấp nhất kể từ ngày 4 tháng 8 trước quyết định của Ngân hàng Dự trữ Úc (RBA)
goTop
quote