
Hình ảnh giúp hiểu rõ bài viết
OpenAI ngày 22/9/2026 (giờ địa phương) công bố hai mô hình GPT-6 Sol và GPT-6 Luna, đồng thời hạ giá API nhằm mở rộng khả năng ứng dụng AI vào lập trình và công việc văn phòng.
Theo OpenAI, hai mô hình mới sử dụng phương pháp huấn luyện tương tự GPT-6 Astra, qua đó chuyển các cải tiến về tác vụ chuyên môn, độ chính xác, lập trình, điều khiển máy tính và căn chỉnh sang những mô hình nhanh hơn, có chi phí thấp hơn. GPT-6 Sol tập trung vào các nhiệm vụ lập trình phức tạp, trong khi GPT-6 Luna hướng tới công việc văn phòng, tóm tắt và trích xuất thông tin.
Giá API giảm, mở rộng kênh sử dụng
API của GPT-6 Sol có giá 2 USD cho mỗi một triệu token đầu vào và 10 USD cho mỗi một triệu token đầu ra. OpenAI cho biết mức này thấp hơn 50% so với giá khuyến mại của GPT-5.6.
Với GPT-6 Luna, giá đầu vào giảm từ 0,20 USD xuống 0,10 USD cho mỗi một triệu token, còn giá đầu ra giảm từ 1,20 USD xuống 0,50 USD. Hai mã mô hình dành cho nhà phát triển lần lượt là gpt-6-sol và gpt-6-luna, được cung cấp từ ngày công bố.
GPT-6 Sol và Luna cũng xuất hiện trên ChatGPT Work và Codex dành cho người dùng các gói Plus, Pro, Business, Enterprise và Edu. Người dùng Free và Go có thể sử dụng GPT-6 Luna trên ứng dụng máy tính. Tuy nhiên, MacRumors cho biết tại thời điểm phát hành, cả hai mô hình chưa được cung cấp trong chế độ Chat.
GitHub sẽ triển khai hai mô hình theo từng giai đoạn trên GitHub Copilot dành cho VS Code, Visual Studio, Copilot CLI, tác nhân đám mây, ứng dụng Copilot, github.com, GitHub Mobile, JetBrains, Xcode và Eclipse. Sol được dành cho các gói Copilot Pro+, Max, Business và Enterprise; Luna có thêm gói Pro.
OpenAI nhấn mạnh hiệu quả chi phí
Theo số liệu do OpenAI công bố, GPT-6 Sol đạt 33,2% trên AutomationBench ở mức suy luận xhigh, với chi phí 0,27 USD cho mỗi tác vụ. Mô hình đạt 56,4% trên Agents' Last Exam ở mức max và 68,8% trên DeepSWE v1.1. GPT-6 Luna đạt 66,6% ở bài kiểm tra DeepSWE v1.1.
Trong cùng phép đánh giá DeepSWE v1.1, Claude Fable 5 đạt 69,9% ở mức xhigh, cao hơn kết quả 68,8% của GPT-6 Sol ở mức max.
OpenAI cho biết GPT-6 Sol đạt 60,5% trên OSWorld 2.0 offline, gần tương đương mức 60,3% của Claude Opus 5, trong khi chi phí cho mỗi tác vụ thấp hơn khoảng 80%. Công ty cũng tuyên bố GPT-6 Luna ở cấu hình max có thể vượt GPT-5.6 Sol ở cấu hình medium với chi phí chỉ bằng một phần mười.
Trong đánh giá nội bộ về độ chính xác, OpenAI cho rằng số lỗi của Sol thấp hơn khoảng một nửa so với GPT-5.6 Sol. Phép thử sử dụng các cuộc hội thoại thực đã được loại bỏ thông tin nhận dạng, nhưng công bố không kèm kết quả kiểm chứng từ bên thứ ba.
OpenAI lưu ý những cuộc hội thoại dùng để đánh giá được lựa chọn vì dễ phát sinh lỗi, không đại diện cho việc sử dụng thông thường, nơi sai sót thực tế hiếm hơn. Các bài kiểm tra về tác nhân AI và lập trình cũng được thiết kế với tình huống khó, không phản ánh trực tiếp tỷ lệ thất bại trong sử dụng hằng ngày.
Đánh giá độc lập cho kết quả trái chiều
Trong Coding Agent Index của tổ chức đánh giá độc lập Artificial Analysis, GPT-6 Sol ở cấu hình max đạt 57 điểm, tăng từ 55 điểm của GPT-5.6 Sol. Trái lại, GPT-6 Luna đạt 41 điểm, thấp hơn mức 43 điểm của thế hệ trước.
Trên AA-Omniscience Index, Sol tăng từ 22 lên 27 điểm, còn Luna tăng từ -10 lên 1 điểm. Tỷ lệ ảo giác được chỉ số này ghi nhận giảm từ 92% xuống 60% đối với Sol và từ 93% xuống 77% đối với Luna.
Hai mô hình cũng cải thiện trên Terminal-Bench 4.0 và AutomationBench-AA. Tuy nhiên, ở GDPval-AA v2.1, Sol giảm khoảng 100 điểm Elo và Luna giảm khoảng 75 điểm Elo. Trên AA-Briefcase v1.1, Luna mất khoảng 45 điểm Elo, còn Sol gần như không thay đổi.
Artificial Analysis nhận định kết quả đi xuống ở GDPval-AA và AA-Briefcase không xuất phát từ việc suy giảm năng lực nền tảng, mà chủ yếu do chất lượng trình bày thấp hơn và câu trả lời thiếu một số yếu tố trong tiêu chí chấm điểm.
Theo tổ chức này, chi phí trung bình cho mỗi tác vụ ở cấu hình max của Sol giảm còn 1,06 USD, tương đương khoảng một nửa trước đây. Chi phí của Luna còn 0,07 USD, giảm khoảng 60%. Dù vậy, chỉ số Intelligence Index tổng hợp của Sol chỉ tăng một điểm, còn Luna không thay đổi.
Cạnh tranh gia tăng với Anthropic
Khoảng 90 phút trước khi OpenAI giới thiệu GPT-6 Sol và Luna, Anthropic công bố Claude Opus 5.5. MacRumors cho biết mô hình của Anthropic đạt kết quả cao hơn GPT-6 Astra trong một số nhiệm vụ lập trình và công việc tri thức, khiến việc so sánh trực tiếp chi phí trên mỗi tác vụ giữa các mô hình trở nên phức tạp hơn.
Các kết quả hiện có cho thấy GPT-6 Sol cải thiện ở một số chỉ số lập trình độc lập và giảm đáng kể chi phí so với thế hệ trước. Tuy nhiên, GPT-6 Luna lại giảm điểm trong Coding Agent Index, cả hai mô hình đều lùi bước trên GDPval-AA, còn Claude Fable 5 vẫn dẫn trước Sol trong kết quả DeepSWE v1.1 do OpenAI công bố.
Nhận xét
Đăng nhận xét