
Hình ảnh giúp hiểu rõ bài viết
Anthropic ngày 22/9 theo giờ địa phương, tức 23/9 theo giờ Hàn Quốc, công bố Claude Opus 5.5, mẫu đầu tiên thuộc dòng 5.5. Công ty cho biết mô hình mới đạt hiệu năng tương đương Claude Fable 5.1 trong phần lớn tác vụ, đồng thời có chi phí vận hành thấp hơn 40% so với Opus 5.
Tăng tốc độ, hạ giá API
Theo Anthropic, tốc độ tạo đầu ra của Opus 5.5 nhanh hơn trên 30% so với Opus 5. Giá API cho mỗi một triệu token được ấn định ở mức 4 USD đối với dữ liệu đầu vào và 20 USD đối với đầu ra, thấp hơn mức tương ứng 5 USD và 25 USD của Opus 5.
Claude Opus 5.5 được cung cấp trên nền tảng Claude của Anthropic, cùng các dịch vụ đám mây Amazon Web Services, Google Cloud và Microsoft Azure. Mã mô hình dùng cho API là claude-opus-5-5.
Kết quả so sánh với GPT-6 Astra chưa thống nhất
Trong kết quả FrontierCode v1.1 do Anthropic công bố, Opus 5.5 đạt 54,4%, nhỉnh hơn mức 53,3% của GPT-6 Astra. Anthropic cho biết ở chế độ nỗ lực trung bình, mô hình mới vượt điểm cao nhất của Astra trong khi chi phí cho mỗi tác vụ chỉ bằng khoảng một phần năm.
Với Terminal-Bench 4.0, Anthropic nhận định Opus 5.5 đạt kết quả tương đương GPT-6 Astra với chi phí khoảng 40%. Ở thiết lập nỗ lực cao nhất trong bảng của công ty, Opus 5.5 đạt 66,4%, còn Astra đạt 57,9%.
Tuy nhiên, Astra dẫn trước trong một số phép thử khác. Tại Terminal-Bench-Science 0.1, Astra đạt 64,6% so với 58,7% của Opus 5.5. Trong AutomationBench, hai mô hình lần lượt đạt 41,4% và 40,0%. Ở CursorBench 4.0, Opus 5.5 đạt 57,8%, còn GPT-5.6 Sol đạt 41,7%; điểm của Astra không được công bố.
Các số liệu trên do từng doanh nghiệp cung cấp và chưa được tái lập độc lập. Khi trực tiếp thử nghiệm hai mô hình, tổ chức đánh giá Vals AI nhận định kết quả gần như ngang bằng, với Astra nhỉnh hơn đôi chút. Digital Applied khuyến cáo không nên kết luận mô hình nào vượt trội nếu chênh lệch dưới 5 điểm khi chưa tự kiểm chứng. Đơn vị này đánh giá Opus 5.5 có lợi thế về giá và phần lớn benchmark chung, trong khi Astra vẫn dẫn ở các hạng mục tự động hóa và khoa học.
Anthropic thừa nhận giới hạn trong đánh giá an toàn
Anthropic tuyên bố Opus 5.5 đạt điểm cao nhất từ trước đến nay trong cuộc kiểm tra nội bộ về hành vi tự động. Số lần mô hình tìm cách vượt khỏi phạm vi được cho phép giảm khoảng 85% so với Opus 5. Tỷ lệ tấn công chèn chỉ dẫn, hay prompt injection, thành công cũng ở mức thấp nhất, ngang với Fable 5.1. Các tác vụ liên quan đến an ninh mạng và sinh học được áp dụng cơ chế chuyển sang mô hình khác để tăng mức độ an toàn.
Dù vậy, công ty thừa nhận việc xây dựng hệ thống đánh giá có thể phát hiện một cách đáng tin cậy mọi lỗi trước khi triển khai vẫn là bài toán chưa có lời giải. Anthropic cũng ghi nhận dấu hiệu Opus 5.5 thường nghi ngờ rằng nó đang ở trong một tình huống đánh giá, yếu tố có thể ảnh hưởng đến kết quả thử nghiệm.
Ra mắt giữa lúc CEO Anthropic kêu gọi điều tiết tốc độ AI
Opus 5.5 là mô hình đầu tiên được Anthropic công bố sau khi CEO Dario Amodei nêu quan điểm cần điều chỉnh tốc độ phát triển năng lực AI, nhằm tạo đủ thời gian để các biện pháp phòng ngừa rủi ro theo kịp.
Trước đó, OpenAI đã phát hành giới hạn GPT-6 Astra vào ngày 3/9. Anthropic cũng giới thiệu Claude Fable 5.1 và Claude Mythos 5.1 vào đầu tháng 9.
Nhận xét
Đăng nhận xét