Các Nhà Phát Triển Mô Hình AI: Họ Có Đang Tối Ưu Hóa Cho Hình Ảnh Bồ Nông Không?
OpenAI
Anthropic
Google/DeepMind
xAI
Alibaba/Qwen
DeepSeek
Một nhà nghiên cứu đã kiểm tra bảy mô hình AI hiện đại bằng một tiêu chuẩn đánh giá không chính thức phổ biến: tạo ra tệp SVG mô tả một con bồ nông đi xe đạp. Kết quả cho thấy không có bằng chứng nào cho thấy các mô hình được tối ưu hóa cho câu lệnh cụ thể này, giải quyết những nghi ngờ về việc tối đa hóa điểm số của các bài kiểm tra.
Simon Willison đã thử nghiệm các bản phát hành LLM lớn với lời nhắc 'Generate an SVG of a pelican on a bicycle', trở thành một chuẩn đánh giá không chính thức nổi tiếng. Để điều tra xem các phòng thí nghiệm AI có đang tham gia vào 'pelicanmaxing' (tối ưu hóa mô hình cho các chuẩn đánh giá phổ biến) hay không, một nhà nghiên cứu đã tiến hành một thí nghiệm. Họ đã tạo ra 1008 SVG trên bảy mô hình: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 và DeepSeek V4 Pro, sử dụng 48 lời nhắc (8 động vật × 6 phương tiện). Mỗi SVG được kết xuất và đánh giá bởi một trọng tài LLM. Phân tích cho thấy không có bằng chứng nào cho thấy hình ảnh bồ nông trên xe đạp có điểm số cao hơn dự kiến, gợi ý rằng không có sự tối ưu hóa có chủ đích cho chuẩn đánh giá này.
Nguồn: Habr — хаб ИИ —
bản gốc
