
Hình ảnh giúp hiểu rõ bài viết
Công ty trí tuệ nhân tạo Pháp Mistral AI ngày 6/10/2026 công bố Mistral Large 4, mô hình có biệt danh “le Chonk”, hướng đến các tác vụ như lập trình tự động, xử lý công việc tri thức, an ninh mạng và suy luận vị trí từ hình ảnh.
Mistral Large 4 sử dụng kiến trúc hỗn hợp chuyên gia, với 49 tỷ tham số được kích hoạt trong tổng số 1.000 tỷ tham số. Mô hình hỗ trợ hơn 160 ngôn ngữ, tiếp nhận dữ liệu đa phương thức nhưng chỉ xuất nội dung dạng văn bản.
Mở API trước, chưa phát hành trọng số
Mô hình có mã định danh mistral-large-4-0 và được cung cấp dưới dạng API thử nghiệm trên nền tảng Mistral Studio. Mức phí là 1,36 USD cho mỗi một triệu token đầu vào và 4,18 USD cho mỗi một triệu token đầu ra.
Tại thời điểm công bố, Mistral AI chưa phát hành trọng số mô hình. Công ty dự kiến thực hiện việc này vào ngày 27/10, sau khoảng ba tuần thử nghiệm an toàn với các đối tác tin cậy và cơ quan chính phủ. Trong giai đoạn hiện tại, người dùng chỉ có thể tiếp cận bản xem trước công khai hoặc các điểm cuối API có cơ chế bảo vệ.
Theo Mistral AI, cách triển khai theo từng bước nhằm bảo đảm mô hình có thể phục vụ hoạt động phòng thủ, đặc biệt trong lĩnh vực an ninh mạng, nhưng hạn chế nguy cơ bị sử dụng cho các cuộc tấn công có chủ đích. Khi được phát hành, mô hình sẽ áp dụng giấy phép riêng của Mistral.
Mistral Large 4 được huấn luyện trong khoảng hai tháng bằng 4.000 GPU Nvidia Grace Blackwell. Trước đó, Mistral AI huy động 3 tỷ euro trong vòng gọi vốn tháng 9, với mức định giá doanh nghiệp 21 tỷ euro.
Kết quả lập trình có sự chênh lệch giữa các thước đo
Theo số liệu do Mistral AI công bố, Mistral Large 4 đạt 61,7% trên DeepSWE v1.1, cao hơn DeepSeek V4 Pro 0813. Mô hình cũng đạt 28,3% trên Terminal Bench 4.0, 59,4% trên SWE-Atlas-QnA và tổng điểm 49,8% trong Coding Agent Index, vượt DeepSeek V4 Pro và Qwen3.8 Max theo hệ thống so sánh của công ty.
Tuy nhiên, kết quả đánh giá mù do con người thực hiện trên nền tảng Surge AI cho thấy Mistral Large 4 đạt 3,74/5 điểm, thấp hơn mức 4,22 điểm của Claude Opus 5. Một bảng tổng hợp khác của DeepSWE v1.1 ghi nhận Mistral Large 4 ở mức 62%, cao hơn GLM-5.3, DeepSeek V4 Pro 0813 và Qwen 3.8 Max, nhưng vẫn thấp hơn khoảng 74% của GPT-6 Astra, Gemini 3.8 Flash và Claude Opus 5 khi các mô hình này chạy với cấu hình tối ưu được công bố.
Hướng đến tự động hóa công việc
Trong các bài kiểm tra do Mistral AI công bố, Mistral Large 4 đạt 59,9% trên AutomationBench và 1.393 điểm Elo trên AA-Briefcase, thước đo dành cho công việc tri thức. Ở bài đánh giá Harvey Legal Agent, mô hình đạt 15%, so với 12,92% của Kimi K3 và 8,33% của GLM-5.3. Trong Finch Finance, Mistral Large 4 và DeepSeek V4 Pro 0813 cùng đạt 67%.
Về an ninh mạng, công ty cho biết mô hình nằm trong nhóm năm vị trí dẫn đầu của AA Cyber Index và đạt 93% trên Cybench. Điểm chống chịu trước tấn công trong B3 Security Benchmark là 93,3%, còn đánh giá phản hồi có trách nhiệm trên KORA Benchmark đạt 1,691/2 điểm.
Kết quả về hình ảnh và khoa học
Mistral Large 4 đạt 42% trên Dense 200, bài kiểm tra suy luận vị trí trực quan, nhỉnh hơn mức 41% của GPT-6 Astra theo số liệu của Mistral AI. Mô hình đạt 73% trong bài đánh giá hình ảnh DIOR-RSVG và được công ty mô tả là một trong những mô hình trọng số mở tốt nhất trên SciCode-Verified.
Giám đốc điều hành Mistral AI Arthur Mensch nhận định mô hình mới vượt các mô hình Trung Quốc ở một số phương diện, trong đó có an ninh mạng. Tuy nhiên, ông không nêu rõ mô hình nào được dùng để đối chiếu cũng như phương pháp so sánh.
Đánh giá độc lập cho kết quả thận trọng hơn
Trong Vals Index của tổ chức đánh giá độc lập Vals AI, Mistral Large 4 đạt 48,05% ± 1,11 và đứng thứ 32 trong 44 mô hình. Mô hình xếp thứ 6 trong 75 sản phẩm ở Harvey Legal Agent, thứ 22 trong 75 ở Finance Agent v2, thứ 25 trong 66 ở Tax Agent Bench, thứ 43 trong 71 ở EMB và thứ 25 trong 109 ở Vibe Code Bench v1.1.
Trên Artificial Analysis Intelligence Index, Mistral Large 4 đạt 38,4 điểm, đứng thứ 8 trong nhóm mô hình trọng số mở. Kết quả này thấp hơn Xiaomi MiMo-V2.6-Pro với 46,3 điểm, Z.ai GLM-5.3 với 44,8 điểm và Moonshot AI Kimi K3 với 43,6 điểm, nhưng cao hơn DeepSeek V4 Pro, GLM-5.2 và Motif 3 của Hàn Quốc.
Các mô hình đóng như Claude Opus 5.5, GPT-6 Astra và Gemini 4 Argon lần lượt đạt 57,6 điểm, 52,7 điểm và 52,6 điểm, đều cao hơn Mistral Large 4. Artificial Analysis ước tính chi phí cho mỗi tác vụ của mô hình Mistral là 1,13 USD, tương đương 1 euro.
Mistral kỳ vọng mô hình còn cải thiện
Mistral AI cho biết quá trình học tăng cường dành cho bản thử nghiệm vẫn đang tiếp diễn và mô hình chưa xuất hiện dấu hiệu bão hòa. Pierre Stock, Phó chủ tịch phụ trách khoa học của công ty, nói lượng tài nguyên tính toán được sử dụng thấp hơn đáng kể so với các đối thủ mô hình đóng và chỉ bằng khoảng một phần hai đến một phần ba so với các đối thủ Trung Quốc.
Dù vậy, một số kết quả đánh giá và điểm số chính xác của một số mô hình cạnh tranh vẫn chưa được công bố. Hiệu năng thực tế của Mistral Large 4 vì thế cần được kiểm chứng thêm sau khi trọng số được phát hành và các tổ chức độc lập có điều kiện đánh giá đầy đủ.
Nhận xét
Đăng nhận xét