TutkimusMediatuotanto 🇷🇺 28.07.2026 08:04

Tekoälymallien kehittäjät: Maksimoivatko he pelikaanitestin?

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
Tutkija testasi seitsemää nykyaikaista tekoälymallia suositulla epävirallisella vertailutestillä: luomalla SVG-kuvan pelikaanista polkupyörällä. Tulokset eivät anna näyttöä siitä, että mallit olisivat optimoituja tähän tiettyyn kehotteeseen, mikä kumoaa epäilyt vertailutestin maksimoinnista.
Simon Willison on testannut suuria kielimalleja kehotteella 'Luo SVG-pelikaani pyörällä', josta on tullut tunnettu epävirallinen vertailukohta. Selvittääkseen, optimoivatko tekoälylaboratoriot mallejaan suosittujen vertailukohtien mukaan ('pelikaanimaksimointi'), tutkija suoritti kokeen. Hän loi 1008 SVG-kuvaa seitsemällä mallilla: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 ja DeepSeek V4 Pro, käyttäen 48 kehotetta (8 eläintä × 6 kulkuvälinettä). Jokainen SVG renderöitiin ja arvioitiin LLM-tuomarilla. Analyysi ei löytänyt todisteita siitä, että pelikaani-pyörällä-kuvat olisivat saaneet odotettua korkeampia pisteitä, mikä viittaa siihen, ettei tätä vertailukohtaa ole erikseen optimoitu.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset