Mô hìnhKinh doanh & Thị trường 🇷🇺 14.08.2026 09:03

Grok 4.6 được phát hành: Mô hình đạt trình độ GPT-5.6 với giá chỉ bằng một nửa

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
SpaceXAI đã phát hành Grok 4.6, theo công ty, mô hình này đạt trình độ của các mô hình mạnh nhất trên thị trường với giá chỉ bằng một nửa: 2 đô la cho mỗi triệu token đầu vào và 6 đô la cho mỗi triệu token đầu ra. Mô hình đạt 61 điểm trên Chỉ số thông minh của Artificial Analysis, ngang bằng với GPT-5.6 Sol, và đã trở nên khả dụng trong Grok Build, Cursor, Grok Bot và qua API.
SpaceXAI đã giới thiệu Grok 4.6, tuyên bố rằng nó đạt đến trình độ của các mô hình mạnh nhất với chi phí chỉ bằng một nửa so với đối thủ cạnh tranh: giá là 2 đô la cho mỗi triệu token đầu vào và 6 đô la cho mỗi triệu token đầu ra. Mô hình này đã có sẵn trong agent Grok Build, trong Cursor, trong Grok Bot và thông qua API, với giới hạn sử dụng gấp đôi trong tuần đầu tiên trên Cursor và Grok Build. Con số quan trọng là 61 điểm trên Chỉ số Thông minh (Intelligence Index) của nền tảng phân tích độc lập Artificial Analysis, nền tảng này tổng hợp chín bài kiểm tra chuẩn. Điểm số này ngang bằng với GPT-5.6 Sol ở chế độ suy luận tối đa, kém Claude Fable 5 Max một điểm và cao hơn Grok 4.5 của một tháng trước 5 điểm. Các nhà phân tích cho rằng SpaceXAI đã trở lại vị trí tiên phong về trí tuệ, chỉ có Anthropic là vượt trội hơn. Xét trên các bài kiểm tra chuẩn cụ thể, Grok 4.6 dẫn đầu trên GDPVal-AA v2 về công việc văn phòng tri thức với 1753 điểm so với 1741 của Fable 5 và 1728 của Sol, và trên AA-Briefcase với 1577 so với 1574 và 1502. Nó cũng đứng đầu trên Harvey LAB về luật với 15.8% so với 11.3% của Fable 5 và 2.5% của Sol. Tuy nhiên, nó bị tụt lại đáng kể trên Terminal-Bench v3.0: 26% so với 34.6% của Sol và 34.1% của Fable 5, nhưng trên phiên bản cũ hơn v2.1, nó đạt 88.4%, chỉ sau Claude Opus 5. Nó cũng thua trên một số bài kiểm tra lập trình: trên DeepSWE, nó kém Sol (73%) và Fable 5 (70%), và trên FrontierCode và APEX-SWE, nó thua Fable 5. Điều thú vị nhất là cách đạt được sự ngang bằng: theo Musk, Grok 4.6 được xây dựng trên cùng cơ sở 1,5 nghìn tỷ tham số như Grok 4.5, vì vậy mô hình không tăng kích thước. Thay vì mở rộng quy mô, công ty đã chạy một chu kỳ huấn luyện khác, dài hơn trên cùng cơ sở đó với dữ liệu tổng hợp được tuyển chọn về các chủ đề suy luận và kỹ thuật cùng một bộ tối ưu hóa được cải thiện, sau đó xây dựng lại các giai đoạn tinh chỉnh có giám sát và học tăng cường. Các quỹ đạo tinh chỉnh có giám sát được tạo lại bởi chính Grok 4.5, lọc ra các ví dụ có vấn đề bằng các kiểm tra mô hình – hiệu quả là phiên bản trước đã huấn luyện phiên bản tiếp theo. Trong Cursor, hiện thuộc sở hữu của SpaceXAI, họ lưu ý rằng Grok 4.6 xây dựng cấu trúc và ngôn ngữ hình ảnh của một ứng dụng ngay từ lần đầu tiên dựa trên mô tả ý tưởng, và trên các quỹ đạo dài, nó thể hiện khả năng tự kiểm tra nhiều hơn đáng kể: nó kiểm tra công việc của chính mình trước khi tiến hành. Các nhiệm vụ học tăng cường trong quá trình huấn luyện bao gồm từ tối ưu hóa nhân tính toán đến phát triển web và CAD. Mức giá vẫn giữ nguyên từ Grok 4.5, phát hành ngày 8 tháng 7: vẫn là 2 đô la/6 đô la, theo Artificial Analysis là thấp hơn hơn 60% so với Claude Opus 5 (5 đô la/25 đô la) và GPT-5.6 Sol (5 đô la/30 đô la). Chi phí cho một nhiệm vụ Chỉ số Thông minh là 0,84 đô la cho mô hình, giống như Kimi K3, nhưng với trí tuệ cao hơn một chút, đưa nó nằm chính xác trên ranh giới Pareto về trí tuệ so với giá cả. Hiệu quả token đặc trưng của nó vẫn tồn tại: trên AA-Briefcase, Grok 4.6 hoàn thành một nhiệm vụ agent dài trong trung bình 53 lượt và nửa tỷ token đầu vào, so với 103 lượt và hai tỷ token của Claude Opus 5. Chỉ có giá cache tăng, từ 0,3 đô la lên 0,5 đô la mỗi triệu. SpaceXAI có nhịp độ phát hành mạnh mẽ: Grok 4.5 ra mắt ngày 8 tháng 7, Grok 4.6 ngày 12 tháng 8, và Grok 4.7 với 2,1 nghìn tỷ tham số mà Musk ước tính trong cuộc gọi tháng 8 là cách ba đến bốn tuần, tức là vào cuối mùa hè. Cùng với việc mua Cursor và agent Grok Bot được ra mắt trước đó, Grok đang chuyển mình từ một meme thành một dòng sản phẩm với môi trường phát triển, agent và quy trình mô hình riêng.
Nguồn: Habr — хаб ML — bản gốc
Bài viết liên quan trước đây ↓
Tin mới