TutkimusTekoälyturvallisuus 🇺🇸 28.07.2026 01:05

Lyhyt katsaus sukupuoliharhaan tekoälyssä

Google/DeepMindGoogle/DeepMind MicrosoftMicrosoft IBMIBM OpenAIOpenAI Stability AIStability AI RunwayRunway
Tekoälymallit heijastavat ja usein vahvistavat todellisen maailman sukupuolistereotypioita. Tämä artikkeli tarkastelee keskeistä tutkimusta, joka tunnistaa ja mittaa sukupuoliharhaa eri tekoälyjärjestelmissä sanaveistoksista ja kasvojentunnistuksesta suuriin kielimalleihin ja kuvantamismalleihin. Se käsittelee nykytutkimuksen puutteita ja tarvetta huomioida intersektionaalisuus ja tekijät, jotka ylittävät sukupuolibinaarin.
Artikkelissa korostetaan, että ihmisten datalla koulutetut tekoälymallit perivät ja jopa vahvistavat olemassa olevia sukupuolistereotypioita. Siinä viitataan vaikutusvaltaisiin teoksiin: Bolukbasi ja kollegat (2016) osoittivat, että sanavektoreissa on seksistisiä analogioita (esim. "mies on ohjelmoija niin kuin nainen on kotirouva") ja ehdottivat harhanpoistomenetelmää; Buolamwini ja Gebru (2018) Gender Shades -projektissa havaitsivat, että kaupallisilla kasvojentunnistusjärjestelmillä oli suurimmat virheprosentit tummaihoisilla naisilla (jopa 34,7 %), mikä johti korjauksiin Microsoftilla ja IBM:llä; Rudinger ja kollegat (2018) havaitsivat sukupuoliharhaa korferenssiresoluutiossa, jossa mallit liittivät useammin maskuliinisia pronomineja tiettyihin ammatteihin; Parrish ja kollegat (2021) esittelivät BBQ-vertailuarvon, joka osoitti, että suuret kielimallit (LLM:t) toistivat haitallisia stereotypioita 77 prosentissa tapauksista epäselvissä yhteyksissä; Luccioni ja kollegat (2023) osoittivat, että kuvageneraattorimallit (DALL-E 2, Stable Diffusion, Midjourney) kuvasivat suhteettoman usein valkoisia miehiä auktoriteettirooleissa (esim. 97 % kyselyssä "toimitusjohtaja"). Artikkelissa huomautetaan, että suurin osa tutkimuksesta keskittyy binäärisukupuoleen ja englannin kieleen, ja että olemassa olevat vertailuarvot saattavat johtaa optimointiin vain mitattujen harhatyyppien osalta, jättäen monet muut huomiotta. Kirjoittaja esittelee myös omia kokeitaan, jotka osoittavat, että nykyaikaiset mallit (esim. GPT-4) voivat ylikompensoida ja luoda uusia vääristymiä, ja että DALL-E 3 toistaa tiettyjä kliseitä (esim. "nuoret aasialaiset naiset") muokatessaan kehotteita.
Lähde: The Gradient — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset