Anthropic ra mắt Claude Sonnet 5.5, nhấn mạnh hiệu năng và chi phí thấp hơn

Anthropic ra mắt Claude Sonnet 5.5, nhấn mạnh hiệu năng và chi phí thấp hơn

Hình ảnh giúp hiểu rõ bài viết

Claude Sonnet 5.5 có mặt trên nhiều nền tảng đám mây

Anthropic ngày 28/9/2026, theo giờ địa phương, công bố Claude Sonnet 5.5 với mã mô hình claude-sonnet-5-5. Công ty giới thiệu sản phẩm mới như một bước nâng cấp về điểm chuẩn, tốc độ và hiệu quả chi phí so với thế hệ Sonnet trước.

Mô hình được cung cấp qua Claude Platform, AWS, Google Cloud và Microsoft Azure, đồng thời hỗ trợ cấu hình không lưu giữ dữ liệu. Giá API là 2 USD cho mỗi một triệu token đầu vào và 10 USD cho mỗi một triệu token đầu ra. Phí đọc bộ nhớ đệm là 0,20 USD, còn phí ghi là 2,50 USD cho mỗi một triệu token.

Theo VentureBeat, mức giá này tương đương GPT-6 Sol và thấp hơn Claude Opus 5.5, vốn có giá 4 USD cho đầu vào và 20 USD cho đầu ra. Anthropic cho biết Sonnet 5.5 khi chạy ở mức nỗ lực thấp hoặc trung bình vẫn có thể vượt điểm cao nhất của Sonnet 5 với chi phí cho mỗi tác vụ chỉ khoảng một phần mười. SiliconANGLE đưa tin tốc độ đầu ra tăng 30%, trong khi số token cần sử dụng giảm, giúp chi phí thực tế thấp hơn khoảng 30% so với thế hệ trước.

Kết quả điểm chuẩn cho thấy vị trí giữa Sonnet và Opus

Trong số liệu do Anthropic công bố, Sonnet 5.5 đạt 70,6% trên Terminal-Bench 4.0, cao hơn mức 10,3% của Sonnet 5 và 66,4% của Opus 5.5. Trên FrontierCode 1.1 Main, mô hình đạt 46,2% ở thiết lập Max effort, vượt Sonnet 5 với 42,4% nhưng thấp hơn Opus 5.5 ở mức 54,4% và GPT-6 Sol với 49,3%.

Ở GDPval-AA v2.1, Sonnet 5.5 đạt 1.844 điểm, gần ngang Opus 5.5 với 1.846 điểm và cao hơn Sonnet 5 cùng GPT-6 Sol, lần lượt đạt 1.449 và 1.487 điểm. Trong Humanity's Last Exam, Sonnet 5.5 đạt 64,5%, so với 54,9% của Sonnet 5 và 67,7% của Opus 5.5. Kết quả OSWorld 2.1 cũng cho thấy Sonnet 5.5 đạt 80,1%, cao hơn đáng kể mức 57% của Sonnet 5 nhưng vẫn thấp hơn 81,8% của Opus 5.5.

Bảng đánh giá của Anthropic cho thấy Opus 5.5 tiếp tục dẫn trước Sonnet 5.5 tại FrontierCode, CursorBench, GDPval-AA, AA-Briefcase và Humanity's Last Exam. Anthropic thừa nhận Opus 5.5 vẫn mạnh hơn rõ rệt trong các nhiệm vụ phức tạp, có tính mở và đòi hỏi khả năng phán đoán liên tục.

Đánh giá độc lập ghi nhận hiệu năng cao nhưng đầu ra dài

Artificial Analysis chấm Claude Sonnet 5.5 đạt 56 điểm Intelligence Index, đứng thứ ba trong 216 mô hình và cao hơn mức trung vị 26 điểm. Chi phí mỗi tác vụ được đơn vị này đo ở mức 7,60 USD. Tổng lượng đầu ra đạt 410 triệu token, cao hơn nhiều so với mức trung vị 88 triệu token, khiến mô hình bị đánh giá là có xu hướng trả lời rất dài.

Tốc độ đầu ra đo được là 141,9 token mỗi giây, xếp thứ 28 trong 216 mô hình. Tuy nhiên, thời gian chờ đến token đầu tiên lên tới 353,32 giây.

Trong đánh giá của Vals AI, Sonnet 5.5 đạt Vals Index 69,22% ± 0,96, đứng thứ hai trong 66 mô hình. Opus 5.5 dẫn trước 0,47 điểm phần trăm với kết quả 69,69%. Chi phí mỗi bài kiểm tra của Sonnet 5.5 là 20,80 USD, thấp hơn mức 32,77 USD của Opus 5.5.

Dù vậy, kết quả của Sonnet 5.5 không đồng đều ở một số lĩnh vực chuyên biệt. Mô hình chỉ đạt 59,58% trên CyberBench, đứng thứ 31 trong 41 mô hình; tại Harvey's Legal Agent Benchmark, điểm số là 2,92%, xếp thứ 36 trong 70 mô hình.

Doanh nghiệp ghi nhận tốc độ xử lý được cải thiện

Yashodha Bhavnani, Phó chủ tịch Box, được VentureBeat dẫn lời cho biết Sonnet 5.5 nhanh hơn 2,4 lần và sử dụng ít hơn 12% tổng lượng token. Một giám đốc phụ trách AI tại Zendesk nói với SiliconANGLE rằng tốc độ xử lý phiếu hỗ trợ tăng 20%, giúp khách hàng nhận trợ giúp mà không phải chờ đợi. SiliconANGLE cũng cho biết đây là mô hình Sonnet đầu tiên hoàn thành trò chơi Pokémon Red chỉ bằng dữ liệu từ ảnh chụp màn hình.

Cơ chế an toàn có thể chặn nhầm một số yêu cầu

Anthropic cảnh báo các biện pháp bảo vệ sinh học của Sonnet 5.5 có thể nhận diện sai và chặn một số yêu cầu liên quan đến vi sinh học hoặc virus học. Theo SiliconANGLE, cơ chế an toàn cũng có thể được kích hoạt với nội dung về an ninh mạng, sinh học và các chủ đề nhạy cảm, nhưng phần lớn công việc phát triển phần mềm và khoa học sự sống không bị ảnh hưởng.

Source: Original Korean article - Trendy News Korea

Nhận xét