Mô hìnhAn toàn AI 🇷🇺 29.07.2026 19:03

Claude Opus 5: Mô hình thông minh nhất theo Artificial Analysis – Điều gì đằng sau điểm số

AnthropicAnthropic OpenAIOpenAI
Anthropic đã phát hành Claude Opus 5 vào ngày 24 tháng 7 năm 2026, tuyên bố rằng nó tiệm cận trí thông minh của Claude Fable 5 hàng đầu của họ với mức giá chỉ bằng một nửa. Chỉ số chuẩn độc lập từ Artificial Analysis xếp Opus 5 đứng đầu (61 điểm), cao hơn Fable 5 một điểm và GPT-5.6 Sol hai điểm. Tuy nhiên, mô hình này được ghi nhận là chậm và dài dòng, với nguy cơ suy nghĩ quá mức ở các cài đặt nỗ lực tối đa.
Ngày 24 tháng 7 năm 2026, Anthropic công bố Claude Opus 5, nằm giữa Sonnet 5 và dòng Fable/Mythos 5 bị hạn chế. Mô hình này có cửa sổ ngữ cảnh 1 triệu token, đầu ra 128 nghìn token, và tính năng suy luận được bật mặc định với năm mức độ nỗ lực: thấp, trung bình, cao, cao thêm, tối đa. Trên các bài kiểm tra nội bộ, Opus 5 đạt 43,3% trên Frontier-Bench v0.1 (mã hóa tác nhân) so với 18,7% của Opus 4.8 và 33,7% của Fable 5; trên ARC-AGI-3 (suy luận trừu tượng) đạt 30,2% so với 7,8% của GPT-5.6 Sol. Tuy nhiên, Chỉ số Trí tuệ Phân tích Nhân tạo độc lập (Artificial Analysis Intelligence Index) chấm Opus 5 điểm 61 (nỗ lực tối đa), chỉ hơn Fable 5 (60) một điểm và hơn GPT-5.6 Sol (59) hai điểm, tuyên bố đây là mô hình thông minh nhất với khoảng cách mong manh. Mô hình được mô tả là chậm và dài dòng đáng kể: thời gian đến token đầu tiên ở mức nỗ lực tối đa vượt quá một phút, và tổng lượng token tiêu thụ cho bộ bài kiểm tra là khoảng 100 triệu so với mức trung bình 63 triệu. Dù có những chiến thắng, Opus 5 vẫn thua trên DeepSWE v1.1 về mã hóa tác nhân (68,8% so với 72,7% của GPT-5.6 Sol), HealthBench Professional (59,8% so với 66,0% của Mythos 5), và Legal Agent Benchmark (11,7% so với 13,3% của Fable 5). Báo cáo của Anthropic nêu bật một trường hợp Opus 5, khi được cung cấp bản thiết kế mà không có thị giác, đã tự viết chương trình thị giác máy tính từ dữ liệu điểm ảnh thô để giải quyết nhiệm vụ, trong khi các đối thủ thất bại. Ở mặt tiêu cực, trong bài kiểm tra thiết kế protein với ngân sách 10.000 đô la và thời gian 24 giờ, Opus 5 không trả về kết quả gì trong một lần chạy và chỉ có 17 biến thể không xếp hạng trong lần khác, rơi vào vòng lặp tự xác minh không hiệu quả. Công ty cảnh báo rằng mức nỗ lực tối đa có thể bị suy nghĩ quá mức, và khuyến nghị bắt đầu ở mức cao thêm cho mã hóa và mức cao cho các tác vụ khác.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới