Nghiên cứu 🇩🇪 15.08.2026 09:01

Tiêu chuẩn đánh giá mới xác nhận: Các mô hình trí tuệ nhân tạo vẫn nhìn kém

Moonshot AIMoonshot AI OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Moonshot AI đã giới thiệu PerceptionBench, một tiêu chuẩn đánh giá tách biệt khả năng nhận thức thị giác khỏi khả năng suy luận và tri thức thế giới. Trong các bài kiểm tra, tất cả các mô hình hàng đầu bao gồm GPT-5.6 Sol, Kimi K3 và Claude Fable 5 đều cho thấy những điểm yếu đáng kể, không có mô hình nào vượt quá 60% độ chính xác. Các tác giả kết luận rằng nhiều lỗi suy luận được cho là thực chất do nhận thức thị giác sai lệch, xác nhận các nghiên cứu trước đó.
Moonshot AI, đội ngũ đứng sau Kimi, đã phát hành PerceptionBench, một bộ tiêu chuẩn (benchmark) được thiết kế để kiểm tra khả năng nhận thức thị giác trong các mô hình ngôn ngữ đa phương thức một cách riêng lẻ. Không giống như các bộ tiêu chuẩn thông thường, PerceptionBench chia nhỏ thị giác thành mười kỹ năng phụ cơ bản (atomic sub-skills), với mỗi câu hỏi có thể trả lời chỉ bằng cách nhìn, không cần suy luận hay kiến thức bên ngoài. Sự phân loại này được rút ra từ các lỗi thực tế của mô hình, được phân loại thành các lĩnh vực như Quan hệ thị giác (Visual Relation), Đếm (Counting), Thuộc tính (Attribute), Độ sâu & 3D (Depth & 3D), Định vị (Localization), So sánh (Comparison), Nhận dạng chi tiết (Fine-grained Recognition), Tích hợp ngữ cảnh (Context Integration), Nhận dạng ký tự quang học (OCR) và Ảo giác (Hallucination). Moonshot AI đã công bố 3.000 câu hỏi từ một kho nội bộ hơn 17.000 câu hỏi đã được xác minh. Trên 16 mô hình tiên tiến, độ chính xác tổng thể cao nhất là 59,7% thuộc về GPT-5.6 Sol, tiếp theo là Kimi K3 với 58,5%, Claude Fable 5 với 57,2% và Gemini 3.1 Pro với 56,2%. Các mô hình mã nguồn mở tụt hậu đáng kể. Hạng mục ảo giác là yếu nhất trung bình: GPT-5.6 Sol chỉ đạt 26,9% ở đó, trong khi Gemini 3.5 Flash yếu hơn đạt 50,6%. Các tác giả lập luận rằng nhiều lỗi suy luận được nhận thấy thực chất xảy ra ở cấp độ nhận thức. Moonshot AI trước đó đã phát hành WorldVQA và đóng góp vào BabyVision, cũng cho thấy các mô hình tiên tiến thất bại trong các nhiệm vụ thị giác cơ bản, trong khi con người vượt trội hơn chúng. Các nhà nghiên cứu cho rằng nguyên nhân là do nút thắt về ngôn ngữ hóa.
Nguồn: The Decoder (DE) — bản gốc
Bài viết liên quan trước đây ↓
Tin mới