Гендерные перекосы распространены в языковых моделях, но сильно различаются
Редакция XORit · Источники, использование AI и исправления

Исследователи Эдоардо Больцони и Валерио Капраро проверили, насколько распространены гендерные перекосы у больших языковых моделей и одинаково ли они проявляются. Они сравнили десять моделей от девяти разработчиков, выпущенных с апреля 2025 года по июнь 2026-го. Препринт с результатами появился в arXiv 29 сентября 2026 года, а на следующий день авторы выложили обновлённую версию.
По словам авторов, предыдущие работы охватывали лишь небольшой набор моделей, поэтому оставалось неясным, насколько гендерная предвзятость универсальна и насколько сильно она различается между системами. Чтобы закрыть этот пробел, они использовали два независимых сценария: приписывание автора стереотипным фразам и моральные оценки вреда.
В первом эксперименте моделям показывали фразы с гендерными стереотипами и просили угадать, кто их написал. Две модели из десяти чаще приписывали «мужские» по стереотипу фразы женщинам, чем наоборот, а три модели вели себя противоположным образом. То есть по одному и тому же заданию системы расходились в разные стороны.
Во втором сценарии у моделей спрашивали, допустимо ли причинить вред или применить пытки к женщине либо к мужчине ради предотвращения катастрофического исхода. Несколько моделей сходились на том, что вред женщине менее приемлем. Авторы отмечают, что это направление совпадает с известной человеческой склонностью защищать женщин от вреда, однако конкретные условия, в которых асимметрия проявлялась, у разных моделей были разными. Три другие модели вообще не показали различий между условиями.
Авторы заключают, что гендерные перекосы в языковых моделях встречаются часто, но их направление и величина сильно неоднородны: некоторые модели ведут себя прямо противоположно другим. Из этого следует практический вывод: проверку на предвзятость стоит проводить регулярно и с охватом разных разработчиков, а не как разовую оценку при выпуске.
Работа опубликована как препринт, рецензирование она ещё не проходила. Публикация относится к направлениям компьютерной лингвистики, искусственного интеллекта и взаимодействия человека с компьютером.
Изображение: Large Language Models, Knowledge Graphs and Search Engines: A Crossroads for Answering Users' Questions, by Aidan Hogan, Xin Luna Dong, Denny Vrandečić, Gerhard Weikum, https://arxiv.org/abs/2501.06699v1 CC BY 4.0 · Лицензия
Редактор перевода: Салтанов А.
Источник материала: arxiv.org ↗