AraştırmaMedya Üretimi 🇷🇺 28.07.2026 08:04

Yapay Zekâ Model Geliştiricileri: Pelikan Optimizasyonu mu Yapıyor?

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
Bir araştırmacı, popüler bir resmi olmayan kıyaslama yöntemi olan bisiklet üzerinde pelikan SVG'si oluşturma görevini kullanarak yedi modern yapay zekâ modelini test etti. Sonuçlar, modellerin bu belirli istem için optimize edildiğine dair hiçbir kanıt göstermiyor ve kıyaslama maksimizasyonu şüphelerini ele alıyor.
Simon Willison, büyük dil modeli sürümlerini 'Bir bisikletin üzerinde bir pelikanın SVG'sini oluştur' komutuyla test ediyordu; bu komut, iyi bilinen bir resmi olmayan kıyaslama haline geldi. Yapay zeka laboratuvarlarının 'pelikan maksimizasyonu' (popüler kıyaslamalar için modelleri optimize etme) yapıp yapmadığını araştırmak için bir araştırmacı bir deney gerçekleştirdi. Yedi model üzerinde 1008 SVG oluşturdular: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 ve DeepSeek V4 Pro; 48 komut kullanarak (8 hayvan × 6 araç). Her SVG işlendi ve bir LLM yargıcı tarafından değerlendirildi. Analiz, bisiklet üzerinde pelikan görsellerinin beklenenden daha yüksek puan aldığına dair hiçbir kanıt bulamadı; bu da bu kıyaslama için hedefli bir optimizasyon olmadığını düşündürüyor.
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler