⚡ TIN NÓNG
Mô hìnhTác tử 🇺🇸 26.07.2026 16:05

Anthropic ra mắt Claude Opus 5: Khả năng lập trình tác nhân và tác vụ máy tính với giá Opus không đổi

AnthropicAnthropic
Anthropic đã phát hành Claude Opus 5, một mô hình chủ lực mới với khả năng tác nhân được cải thiện, giá không đổi (5/25 đô la cho mỗi triệu token) và cửa sổ ngữ cảnh 1 triệu token. Mô hình này cho thấy những cải tiến đáng kể trong các chuẩn đánh giá lập trình, an ninh mạng và tác vụ tự động, với cơ chế suy nghĩ được cập nhật và chính sách an toàn được sửa đổi.
Anthropic đã phát hành Claude Opus 5, thay thế Opus 4.8 làm mô hình Opus hàng đầu. Giá vẫn giữ nguyên: 5 đô la mỗi triệu token đầu vào và 25 đô la mỗi triệu token đầu ra. Mô hình này tiệm cận độ thông minh của Claude Fable 5 với giá chỉ bằng một nửa và hiện là mô hình mặc định trên Claude Max, đồng thời là mô hình mạnh nhất trên Claude Pro. Ở cấp độ API, có ba thay đổi chính: tính năng suy luận (thinking) được bật theo mặc định (tham số effort kiểm soát độ sâu); việc tắt suy luận (cài đặt type: disabled) với mức effort xhigh hoặc max hiện trả về lỗi 400; các nhà phát triển được khuyến nghị nên loại bỏ các lời nhắc như "bật kiểm tra cuối" vì mô hình đã tự kiểm tra. Mã mô hình là claude-opus-5, cửa sổ ngữ cảnh là 1 triệu token (tối đa và mặc định), đầu ra tối đa là 128 nghìn token qua API Messages đồng bộ và lên đến 300 nghìn token qua API Message Batches. Trong các bài kiểm tra, mô hình cho thấy sự tăng trưởng đáng kể: trên FrontierBench v0.1 – 43,3% (Opus 4.8 – 18,7%), trên SWE-bench Verified – 96,0%, OSWorld 2.0 – 70,57%, Zapier AutomationBench – 26,0%. Kết quả đại lý (agentic) là mạnh nhất: mô hình đã giải được 42/42 bài toán IMO 2026 (huy chương vàng). Trên ARC-AGI-3 với mức effort cao – 30,16% (gấp 4 lần kỷ lục trước đó). Trong các tác vụ đa phương thức, các công cụ (container, cắt ảnh) hiệu quả hơn đáng kể so với "suy luận": trên Chartography với công cụ – 83,0% so với 29,6%. Trong an ninh mạng, khả năng tăng lên như một tác dụng phụ: trên ExploitBench mô hình đạt 10,14 cờ và 99 exploit hoàn chỉnh (Mythos 5 – 132). Anthropic chỉ nới lỏng hạn chế về việc tìm kiếm lỗ hổng trong mã nguồn; quét nhị phân, kiểm thử xâm nhập và tạo exploit vẫn bị chặn. Các bộ phân loại sẽ kích hoạt ít hơn khoảng 85% so với trên Fable 5. Trong các bài kiểm tra của UK AISI, mô hình đã giải được nhiệm vụ "The Last Ones" trong 8 trên 10 lần thử. Theo chương trình RSP (Responsible Scaling Policy), mô hình có năng lực CB-1 (Capability Baseline-1) nhưng không phải CB-2. Kết quả vượt trội trong khả năng chống tiêm nhiễm lời nhắc (prompt injection): các cuộc tấn công qua trình duyệt giảm từ 31,5% xuống 3,70% khi không có bảo vệ và xuống 0% khi sử dụng chế độ tự động. Tuy nhiên, công ty cũng công bố những nhược điểm, bao gồm tỷ lệ ảo giác sự kiện thực tế cao hơn một chút so với Opus 4.8.
Nguồn: MarkTechPost — bản gốc
Bài viết liên quan trước đây ↓
Tin mới