
Hình ảnh giúp hiểu rõ bài viết
Google ngày 30/9/2026, theo giờ địa phương, công bố mô hình trí tuệ nhân tạo mới Gemini 4 Argon. Hãng giới thiệu đây là mô hình có hiệu năng hàng đầu trong các nhiệm vụ phức tạp như kỹ thuật phần mềm thực tế, xử lý tri thức doanh nghiệp trong lĩnh vực pháp lý và tài chính, cũng như phòng thủ an ninh mạng.
Thông tin được đăng dưới tên ông Koray Kavukcuoglu, Phó chủ tịch cấp cao Google DeepMind kiêm kiến trúc sư trưởng về AI của Google.
Dẫn đầu một số bài kiểm tra phần mềm và video
Theo số liệu Google công bố, Gemini 4 Argon đạt 77,9% trên DeepSWE v1.1. VentureBeat dẫn kết quả so sánh cho thấy Claude Opus 5.5 đạt 74,2%, còn GPT-6 Astra đạt 74,1%. Trên AutomationBench, bài kiểm tra năng lực tự động hóa công việc, Argon đứng đầu với 51,3%.
Google cũng cho biết mô hình mới đạt 91,7% trên LVBench, benchmark đánh giá khả năng xử lý video. Các số liệu do VentureBeat nêu cho GPT-6 Astra và Claude Opus 5.5 lần lượt là 87,5% và 83,7%.
Ở bài kiểm tra Legal Agent của Harvey, Argon được ghi nhận đạt 19,6%, cao hơn GPT-6 Astra ở mức 5,4% và Claude Opus 5.5 ở mức 3,8%.
Không dẫn đầu mọi bài đánh giá lập trình
Kết quả của Argon không vượt các đối thủ trong toàn bộ phép thử liên quan đến phát triển phần mềm. Theo bảng so sánh của VentureBeat, GPT-6 Astra đạt 65,5% trên FrontierSWE v2, trong khi Argon đạt 55%. Tại Terminal-Bench Science 0.1, hai mô hình lần lượt đạt 68,1% và 57,6%.
Trên Terminal-bench 4.0, Claude Opus 5.5 dẫn trước với 66,4%, so với 57,4% của Argon. Riêng bài đánh giá an ninh mạng CWE-bench v1, Google cho biết Argon và mô hình 3.8 Flash Cyber cùng đứng đầu với 68%.
Google dự kiến cung cấp phiên bản Argon không áp dụng các rào chắn an ninh mạng cho những tổ chức phòng thủ đáng tin cậy và các nhóm nội bộ của hãng.
Đứng đầu bảng xếp hạng của Vals AI
Tổ chức đánh giá độc lập Vals AI xếp Gemini 4 Argon đứng đầu Vals Index với 68,90% trong tổng số 41 mô hình, chi phí 15,68 USD cho mỗi lượt kiểm tra. Claude Sonnet 5.5 đạt 67,04% với chi phí 21,34 USD, Claude Opus 5.5 đạt 66,97% với 32,14 USD, còn Claude Fable 5.1 đạt 65,83%.
Vals AI ghi nhận độ chính xác của Argon ở mức 68,90% ± 0,97 và thời gian phản hồi 46 phút 33 giây. Mô hình đạt 100% trên benchmark IOI, ngang GPT-6 Astra, nhưng chỉ đứng thứ hai ở Vibe Code Bench và Code Migration.
Argon cũng đứng đầu bảng xếp hạng Text của Arena với cấp độ “High”. Tuy nhiên, tại hạng mục Best Overall của Top 10 Agents, mô hình chỉ xếp thứ tám với 7,92%. Trong danh sách Pareto Optimal Models, Argon được ghi nhận có chi phí 0,62 USD cho mỗi tác vụ và hiệu năng 7,92%.
Giá ưu đãi bằng một nửa mức tiêu chuẩn
Google tuyên bố nâng giới hạn đầu ra của Argon từ 64.000 lên 1 triệu token. Tuy nhiên, Vals AI ghi nhận cửa sổ ngữ cảnh của mô hình là 1 triệu token và đầu ra tối đa 262.000 token, thấp hơn con số Google công bố.
Trong giai đoạn đầu, Google áp dụng mức giá 2 USD cho mỗi 1 triệu token đầu vào và 10 USD cho mỗi 1 triệu token đầu ra. Dữ liệu đầu vào đã được lưu trong bộ nhớ đệm được giảm 95% so với giá đầu vào thông thường. Sau thời gian ưu đãi, giá sẽ tăng lên lần lượt 4 USD và 20 USD. VentureBeat nhận định mức giá mở bán của Argon chỉ bằng một phần năm giá API niêm yết của GPT-6 Astra.
Gemini 4 Argon hiện được cung cấp từng bước cho một số tổ chức phòng thủ an ninh mạng đáng tin cậy thông qua chương trình Fairwind, chưa mở rộng cho số đông. Google cho biết sẽ lần lượt triển khai mô hình tới khách hàng API trả phí và người đăng ký Google AI Ultra, sau đó mở rộng cho các nhà phát triển, doanh nghiệp và người tiêu dùng. Phần lớn khách hàng vẫn phải chờ đến khi quyền truy cập API được mở rộng.
Nhận xét
Đăng nhận xét