
Hình ảnh giúp hiểu rõ bài viết
OpenAI ngày 29/9/2026, theo giờ địa phương, công bố GPT-6.1 Sol tại sự kiện DevDay, chỉ một tuần sau khi GPT-6 Sol ra mắt. Công ty giới thiệu mẫu AI mới với hiệu năng tiệm cận GPT-6 Astra, chi phí thấp hơn và chế độ xử lý Ultrafast đạt tối đa 300 token mỗi giây.
Cửa sổ ngữ cảnh hơn một triệu token
GPT-6.1 Sol có mã mô hình gpt-6.1-sol, hỗ trợ cửa sổ ngữ cảnh 1.050.000 token, trong đó độ dài đầu vào tối đa là 922.000 token. Mức giá cho mỗi một triệu token gồm 2 USD đối với đầu vào thông thường, 10 USD đối với đầu ra, 0,10 USD đối với đầu vào đã được lưu bộ nhớ đệm và 2,50 USD cho thao tác ghi bộ nhớ đệm.
Nhà phát triển có thể sử dụng mô hình qua Chat Completions, không hỗ trợ gọi công cụ, hoặc Responses API có khả năng gọi công cụ. Các công cụ được Responses API hỗ trợ gồm tìm kiếm web, phân tích mã và điều khiển máy tính.
Mô hình hỗ trợ lưu trú dữ liệu tại Mỹ và Liên minh châu Âu, nhưng chế độ fast mode không được cung cấp ở khu vực EU. Ngay trong ngày ra mắt, GPT-6.1 Sol được đưa vào ChatGPT Work và Codex cho người dùng các gói Plus, Pro, Business, Enterprise và Edu, song chưa xuất hiện trong giao diện ChatGPT thông thường.
Vượt Astra ở bài kiểm tra lập trình
Trong bài đánh giá DeepSWE v1.1 ở chế độ suy luận cao do OpenAI công bố, GPT-6.1 Sol đạt 75,2%, nhỉnh hơn GPT-6 Astra với 74,8%. Claude Sonnet 5.5 đạt 71%, còn GPT-6 Sol đạt 68,8%. Chi phí cho mỗi tác vụ của GPT-6.1 Sol được ước tính khoảng 1,50 USD, thấp hơn đáng kể mức 7,70 USD của GPT-6 Astra.
Tuy nhiên, GPT-6.1 Sol không dẫn đầu ở mọi phép thử. Trong OSWorld 2.0 với thiết lập suy luận tối đa, GPT-6 Astra đạt 73,5%, cao hơn mức 71,4% của GPT-6.1 Sol. GPT-6 Sol và Claude Opus 5 lần lượt đạt 64,4% và 60,3%.
Ở bài đánh giá GDP.pdf với chế độ suy luận cao, GPT-6 Astra tiếp tục nhỉnh hơn với 32,2%, so với 32% của GPT-6.1 Sol. Claude Opus 5.5 đạt 28,8%, còn GPT-6 Sol đạt 28%. OpenAI cho biết GPT-6.1 Sol vừa có điểm số cao hơn Claude Opus 5.5 trong phép thử này, vừa tiêu tốn chưa đến một nửa chi phí cho mỗi tác vụ.
Trong AutomationBench 1.0.6 ở thiết lập cao, Claude Sonnet 5.5 đạt 44,7%, vượt mức khoảng 36% của GPT-6.1 Sol. Với Terminal-Bench Science 0.1, GPT-6.1 Sol đạt điểm số cao hơn gấp đôi GPT-6 Sol nhưng vẫn thấp hơn mức 68,1% của GPT-6 Astra. Chi phí trung bình cho mỗi tác vụ trong bài thử này là 5,47 USD đối với GPT-6.1 Sol và 23,21 USD đối với Claude Opus 5.5.
Tỷ lệ lỗi giảm, tốc độ tăng mạnh
Theo đánh giá của OpenAI, tỷ lệ câu trả lời chứa lỗi thực tế ở điều kiện suy luận thấp giảm từ 11,4% xuống 7,7%. Trong tất cả cấu hình thử nghiệm, tỷ lệ lỗi của GPT-6.1 Sol duy trì chênh lệch không quá 1,9 điểm phần trăm so với GPT-6 Astra. Công ty lưu ý các phép thử này sử dụng những câu lệnh được thiết kế có độ khó cao, vì vậy không đại diện đầy đủ cho nhu cầu sử dụng thông thường.
OpenAI cho biết GPT-6.1 Sol Ultrafast có thể tạo tối đa 300 token mỗi giây. So với tốc độ tiêu chuẩn, chế độ này nhanh hơn tối đa 8 lần trong Codex và 6 lần khi sử dụng qua API.
Theo số liệu do Artificial Analysis tổng hợp, Google Gemini 3.5 Flash xử lý khoảng 201 token mỗi giây. Trong khi đó, hai mô hình chuyên về tốc độ là Mercury 2 và Celeris-1 đạt lần lượt khoảng 769 và 1.491 token mỗi giây, cao hơn GPT-6.1 Sol Ultrafast.
Để so sánh về chi phí, GPT-6 Astra Ultrafast có giá 60 USD cho mỗi một triệu token đầu vào và 300 USD cho đầu ra, cao gấp sáu lần biểu phí tiêu chuẩn.
Đánh giá độc lập và giới hạn thử nghiệm
Trong bảng xếp hạng độc lập của Artificial Analysis, GPT-6.1 Sol high đạt 50 điểm Intelligence Index, đứng thứ 16 trong tổng số 221 mô hình. Mức điểm trung vị của nhóm mô hình suy luận có giá tương đương là 26. Đây là chỉ số riêng của Artificial Analysis, không phải các bài kiểm tra thành phần do OpenAI công bố.
OpenAI cho biết các đánh giá đối với mô hình của hãng được thực hiện trong môi trường nghiên cứu hoặc qua API, nên kết quả có thể khác với trải nghiệm thực tế trên ChatGPT. Các số liệu về mô hình đối thủ được lấy từ những báo cáo đã công khai.
GPT-6.1 Astra, mẫu được dùng làm đối chiếu trong nhiều phép thử, đã bị hủy kế hoạch phát hành do lo ngại an toàn. Theo kết quả thử nghiệm nội bộ được Wall Street Journal đưa tin, mô hình này thể hiện “mức độ đánh lừa cao hơn” và có xu hướng tự tiến hành công việc mà không xin phép người dùng.
Nhận xét
Đăng nhận xét