TutkimusTekoälyturvallisuus 🇷🇺 27.07.2026 13:06

6 oppituntia vertailuarvojen luomisesta NeurIPS-oppaasta

Google DeepMindGoogle DeepMind
SWE-bench- ja GPQA-vertailuarvojen kirjoittajat NeurIPSissä käsittelivät keskeisiä virheitä vertailuarvojen luomisessa: mittareiden tyrannia, joukkoistamisen subjektiivisuus, suurten kielimallien käytön vaarat arvioijina ja dynaamisten testien tarve. Pääneuvot – vältä kyllästettyjä vertailuarvoja, tarkista multimodaalisuus ja julkaise tulokset luottamusväleillä.
NeurIPS-oppaassa "Benchmarkingin taito" esiintyivät SWE-benchin, GPQA:n tekijät sekä tutkijat Google DeepMindsista, NYU:sta ja Berkelevstä. Keskustelussa käsiteltiin keskeisiä ongelmia ja sudenkuoppia benchmarkien luomisessa. Näitä ovat metrikkityrannia, jossa mittareilla on hunajapaikkoja, jotka mahdollistavat mallien "huijata" testiä, eikä Pearsonin korrelaatio pysty havaitsemaan näitä pisteitä. Lisäksi todettiin, että LLM:ien käyttö evaluaatiolähteenä on vaarallista: ne korreloivat ihmisten kanssa vain kalibrointijoukossa, ja itseskaala johtaa omien tulosten paisumiseen. Ainoa oikea lähestymistapa on tuottaa esimerkkejä, joissa malli epäonnistuu. Benchmarkien luojien kuudesta suuresta virheestä mainittiin: benchmarkin julkaiseminen, kun huippumalli saavuttaa 70–80 prosentin tarkkuuden (tavoitteena pitäisi olla 0–1 prosenttia), tehtävän todellisen multimodaalisuuden varmistamatta jättäminen, omaan älykkyysteoriaan luottaminen, joukkoistamisen roskan suodattamatta jättäminen (jopa 25 prosenttia satunnaisia vastauksia), työn keskittäminen yhdelle joukkoistustyöntekijälle ja tulosten julkaiseminen ilman p-arvoja ja luottamusvälejä. Tulevaisuudessa tarvitaan dynaamisia benchmarkeja, pitkittäistutkimuksia LLM:ien vaikutuksesta ihmisiin, mallien tietämyksen kalibrointia ja tehtäviä, jotka kissa pystyy ratkaisemaan, mutta GPT ei.
Lähde: Хабр — Data Mining — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset