предвзятости; Буоламавини и Гебру (2018) в проекте Gender Shades обнаружили, что коммерческие системы распознавания лиц имеют самую высокую частоту ошибок на темнокожих женщинах (до 34,7%), что привело к исправлениям со стороны Microsoft и IBM; Рудингер и др. (2018) выявили гендерную предвзятость в разрешении кореферентности, когда модели чаще связывали мужские местоимения с определенными профессиями; Пэрриш и др. (2021) представили контрольный набор BBQ, показав, что большие языковые модели воспроизводят вредные стереотипы в 77% случаев в неоднозначных контекстах; Луччони и др. (2023) продемонстрировали, что модели генерации изображений (DALL-E 2, Stable Diffusion, Midjourney) непропорционально часто изображали белых мужчин в авторитетных ролях (например, 97% для запроса «генеральный директор»). Статья отмечает, что большинство исследований сосредоточено на бинарном гендере и английском языке, а существующие контрольные наборы могут приводить к оптимизации только под измеряемые типы предвзятости, оставляя многие другие без внимания. Автор также представляет собственные эксперименты, показывающие, что современные модели (например, GPT-4) могут перекомпенсировать и создавать новые искажения, а DALL-E 3 при преобразовании запросов повторяет определенные клише (например, «молодые азиатские женщины»).