Mô hìnhNghiên cứu 🇷🇺 03.08.2026 23:02

Claude Fable 5 vượt trội GPT-5.6 trong việc viết lại mã từ đầu. Đây là lý do

AnthropicAnthropic OpenAIOpenAI
Chuẩn đánh giá MirrorCode của Epoch AI cho thấy Claude Fable 5 giải quyết 64% nhiệm vụ so với 20% của GPT-5.6 Sol. Khoảng cách này xuất phát từ độ tin cậy, không phải năng lực thô: Sol thường giải quyết một phần nhiệm vụ, trong khi Fable hoàn thành chúng một cách nhất quán. Hiệu suất mạnh mẽ của Fable trong Ada, một ngôn ngữ có dữ liệu huấn luyện khan hiếm, cho thấy kỹ năng thực sự chứ không phải ghi nhớ.
Epoch AI đã cập nhật bảng xếp hạng MirrorCode của mình, cho thấy Claude Fable 5 của Anthropic giải được 64% nhiệm vụ, trong khi GPT-5.6 Sol của OpenAI chỉ giải được 20%. Sự chênh lệch gấp ba lần này trông có vẻ bất thường vì các mô hình hoạt động tương đương nhau trong các bài kiểm tra khác, nhưng Epoch AI và Anthropic không đưa ra lời giải thích chính thức nào. MirrorCode, được phát triển cùng với METR, yêu cầu các mô hình viết lại toàn bộ chương trình từ đầu, chỉ nhìn thấy một 'hộp đen' thực thi được, tài liệu và các bài kiểm tra hiển thị; các giải pháp phải vượt qua tất cả các bài kiểm tra ẩn. Điểm chuẩn bao gồm 15 chương trình thực tế như sed và Ruff, mỗi chương trình được triển khai bằng hai ngôn ngữ, với ngân sách 10 tỷ token và 7 ngày cho mỗi lần thử. Phân tích bản đồ nhiệt cho thấy Sol thường giải quyết một phần nhiệm vụ (tỷ lệ thành công 50%, 33%, 17%), trong khi Fable gần như luôn hoàn thành chúng (100%, 83%). Một manh mối khác: hiệu suất của Fable chỉ giảm nhẹ trên Ada (61% so với 64% trên Go), trong khi các mô hình OpenAI giảm đáng kể trên Ada — Sol giảm từ 24% xuống 19%, GPT-5.4 từ 21% xuống 12%, và GPT-5.5 từ 17% xuống 5%. Vì gần như không có triển khai Ada nào của các chương trình này trong dữ liệu huấn luyện, khả năng duy trì trên Ada của Fable cho thấy kỹ năng thực sự chứ không phải là ghi nhớ. Tuy nhiên, kiểm tra ô nhiễm của chính Epoch đã tìm thấy dấu hiệu ghi nhớ trong 17 trên 25 chương trình, và cài đặt đặc tả chính xác của điểm chuẩn khác với phát triển phần mềm trong thế giới thực.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới