Исследователи из лаборатории SAMOVAR при Institut Polytechnique de Paris опубликовали работу, которая впервые системно разбирает важный вопрос: влияет ли пол спикера на то, как большие языковые модели (LLM) оценивают правдивость его слов? Выяснилось, что шесть современных нейросетей — GPT-4.1 Mini, Gemma-3 12B, Qwen-3 14B, Phi-4 14B, Llama-3.1 8B и Llama-3.2 3B — могут по-разному реагировать на одно и то же утверждение только потому, что оно приписано мужчине, женщине или человеку без указания пола.
Как проводили эксперимент
Учёные использовали проверенный набор данных LIAR, состоящий из коротких фраз с уже известной разметкой «правда» или «ложь». К каждой фразе добавляли информацию о должности спикера в трёх вариантах: гендерно-нейтральном, мужском и женском. Сам текст фразы при этом оставался неизменным. Каждая из шести моделей должна была выступить в роли фактчекера и определить достоверность утверждения. Чтобы исключить случайные ошибки, каждый тест повторяли по пять раз с разными настройками.
Для измерения чувствительности моделей к полу исследователи придумали специальный индекс (Gender-Cue Sensitivity Index). Он показывает, как часто модель меняла своё решение исключительно из-за смены гендерной метки. Этот показатель оказался тревожно высоким: от 9,79% до 35,13% в зависимости от нейросети. Если сравнивать напрямую только мужские и женские варианты, то частота смены вердикта составляла от 6,5% до 23,6%.
Феномен «мужского скептицизма»
Авторы разделили предвзятость на два типа: просто непоследовательность (когда модель выдаёт разные ответы без логики) и направленную предвзятость (системное предпочтение одного пола). Статистический анализ подтвердил наличие именно направленной предвзятости у пяти из шести моделей.
Самым распространённым паттерном стал так называемый «мужской скептицизм»: нейросети чаще помечали как «ложь» высказывания мужчин, хотя абсолютно идентичные фразы от женщин получали статус «правды». Сильнее всего этот эффект проявился у моделей Gemma-3 12B и Llama-3.1 8B. Единственным приятным исключением оказалась GPT-4.1 Mini: она не показала значимой гендерной предвзятости и стала самой стабильной и справедливой среди протестированных.
Датасет с модифицированными утверждениями исследователи выложили в открытый доступ для дальнейших исследований.
В обсуждении результатов авторы предупреждают: даже небольшие расхождения в оценках становятся серьёзной проблемой при массовом использовании ИИ для автоматической модерации или проверки фактов. Это ставит под угрозу объективность и надёжность таких систем.
Эхо прошлых исследований
Проблема гендерных искажений в моделях GPT известна давно. Ещё в 2024 году Ралука Александра Фулгу (Raluca Alexandra Fulgu) и Валерио Капраро (Valerio Capraro) из Университета Милана-Бикокка описали серию экспериментов с моделями GPT-3.5 Turbo, GPT-4 и GPT-4o в журнале Computers in Human Behavior Reports.
Тогда выяснилось, что модели склонны к стереотипам: фразы с «мужскими» признаками они чаще ошибочно приписывали женщинам, чем наоборот. А в моральных дилеммах GPT-4 считала более допустимым применение насилия к мужчине ради спасения других, чем к женщине в аналогичной ситуации. Эта асимметрия касалась и других форм агрессии, но исчезала, если модель просили оценить поступки явно и прямо. Предвзятость проявлялась лишь в неявных, скрытых сценариях.
Что это значит для нас
Оба исследования, разделённые двумя годами и выполненные разными методами, указывают на устойчивую закономерность: языковые модели не являются нейтральными инструментами. Пол человека, упомянутого в тексте, влияет на работу ИИ — будь то определение демографии, оценка морали или, как теперь доказано, проверка фактов. Работа команды SAMOVAR важна тем, что впервые демонстрирует эту проблему именно в контексте борьбы с фейковыми новостями, подтверждая её на большом количестве конфигураций моделей и тестовых прогонов.
Мнение ИИ
С точки зрения машинного анализа данных подобный перекос корнями уходит глубже интерфейса диалоговых моделей. Толга Болукбаши (Tolga Bolukbasi) с коллегами еще в 2016 году показали: если обучить алгоритм на большом массиве текстов и попросить его закончить аналогию «мужчина — программист, женщина — ...», система чаще всего выдавала «домохозяйка». Модель не выдумывала это сама — она просто отражала статистику слов, которые чаще встречались рядом в исходных текстах: «мужчина» и «программист» соседствовали чаще, чем «женщина» и «программист». Похожий механизм может стоять и за «мужским скептицизмом» из статьи SAMOVAR — модель не рассуждает о доверии к спикеру, а улавливает статистические следы того, как пол и правдивость сочетались в текстах, на которых она обучалась.
▼
Самые интересные и важные новости на нашем канале в Telegram

