Kort overzicht van genderbias in AI
Google/DeepMind
Microsoft
IBM
OpenAI
Stability AI
Runway
AI-modellen weerspiegelen en versterken vaak echte genderstereotypen. Dit artikel bespreekt belangrijk onderzoek dat genderbias identificeert en meet in verschillende AI-systemen, van word embeddings en gezichtsherkenning tot grote taalmodellen en beeldgeneratiemodellen. Het behandelt hiaten in het huidige onderzoek en de noodzaak om intersectionaliteit en factoren buiten het genderbinair te overwegen.
Het artikel benadrukt dat AI-modellen die getraind zijn op menselijke data, bestaande genderstereotypen overnemen en zelfs versterken. Het citeert invloedrijke werken: Bolukbasi et al. (2016) toonden aan dat woordembeddings seksistische analogieën bevatten (bijvoorbeeld 'man is voor programmeur wat vrouw is voor huisvrouw') en stelden een debiasing-methode voor; Buolamwini en Gebru (2018) ontdekten in het Gender Shades-project dat commerciële gezichtsherkenningssystemen de hoogste foutpercentages hadden bij donkergetinte vrouwen (tot 34,7%), wat leidde tot aanpassingen door Microsoft en IBM; Rudinger et al. (2018) vonden genderbias in coreferentieresolutie, waarbij modellen mannelijke voornaamwoorden vaker koppelden aan bepaalde beroepen; Parrish et al. (2021) introduceerden de BBQ-benchmark, waaruit bleek dat grote taalmodellen (LLM's) in 77% van de gevallen in ambigue contexten schadelijke stereotypen reproduceerden; Luccioni et al. (2023) toonden aan dat beeldgeneratiemodellen (DALL-E 2, Stable Diffusion, Midjourney) onevenredig vaak witte mannen in gezaghebbende rollen afbeelden (bijvoorbeeld 97% voor de zoekopdracht 'CEO'). Het artikel merkt op dat het meeste onderzoek zich richt op binair gender en Engels, en dat bestaande benchmarks kunnen leiden tot optimalisatie voor alleen gemeten soorten bias, waardoor veel andere soorten onaangeroerd blijven. De auteur presenteert ook eigen experimenten, waaruit blijkt dat moderne modellen (bijvoorbeeld GPT-4) kunnen overcompenseren en nieuwe vervormingen creëren, en dat DALL-E 3 bij het transformeren van prompts bepaalde clichés herhaalt (bijvoorbeeld 'jonge Aziatische vrouwen').
Bron: The Gradient —
origineel
