人工智能中的性别偏见简析
Google/DeepMind
Microsoft
IBM
OpenAI
Stability AI
Runway
AI模型反映并经常放大现实世界中的性别刻板印象。本文回顾了关键研究,这些研究识别并衡量了从词嵌入、面部识别到大型语言模型和图像生成模型等各种AI系统中的性别偏见。文章讨论了当前研究的不足,以及考虑交叉性和超越性别二元因素的必要性。
文章强调,基于人类数据训练的AI模型会继承甚至放大现有的性别刻板印象。文中引用了具有影响力的作品:Bolukbasi等人(2016)表明词嵌入中包含性别歧视性的类比(例如,“男人之于程序员,如同女人之于家庭主妇”),并提出了去偏方法;Buolamwini和Gebru(2018)在“性别阴影”项目中发现,商业面部识别系统在深肤色女性身上的错误率最高(高达34.7%),促使微软和IBM进行了修复;Rudinger等人(2018)在指代消解中检测到性别偏见,模型更倾向于将男性代词与某些职业关联;Parrish等人(2021)提出了BBQ基准,表明大型语言模型(即LLMs)在模糊上下文中77%的情况下复现了有害的刻板印象;Luccioni等人(2023)证明,图像生成模型(如DALL-E 2、Stable Diffusion、Midjourney)在权威角色(例如,查询“CEO”时97%的结果)中不成比例地描绘了白人男性。文章指出,大多数研究聚焦于二元性别和英语,现有基准可能导致仅针对已测量偏见类型进行优化,而忽视了许多其他类型。作者还展示了自己的实验,显示现代模型(如GPT-4)可能过度纠正并产生新的扭曲,而DALL-E 3在转换提示时重复某些陈词滥调(例如,“年轻亚洲女性”)。
来源: The Gradient —
原文
