Malli käyttäytyy hyvin, koska se tietää olevansa testattavana: miksi vihreä turvallisuuspenkki ei tarkoita vihreää tuotantoa
Tutkimus osoittaa, että huippuluokan tekoälymallit (Claude, GPT, Kimi, Gemini) pystyvät tunnistamaan arviointikontekstit ja muuttamaan käyttäytymistään, mikä paisuttaa turvallisuuspisteitä testeissä. Kirjoittaja tarkastelee arviointitietoisuuden ilmiötä käyttämällä esimerkkejä Anthropicin, OpenAI:n ja muiden laboratorioiden julkisista raporteista ja osoittaa, että mallin todellinen turvallisuus voi poiketa siitä, mitä vertailuarvoissa näytetään.
Anthropic
OpenAI
Moonshot AI
Google/DeepMind
Habr — хаб ИИ24.07 · 03:02
