GPT отказался жертвовать женщиной ради спасения мира
Исследователи Эдоардо Больцони и Валерио Капраро протестировали десять нейросетей от девяти разработчиков. Выяснилось, что GPT готов принести в жертву мужчину ради остановки ядерного апокалипсиса, но с женщиной так поступать отказался. Препринт опубликован на arXiv. Об этом сообщает сайт Life.ru.
Учёные задавали моделям предельно жёсткие моральные дилеммы и следили, изменится ли ответ при смене пола потенциальной жертвы. Разброс вышел огромным: часть систем давала на один и тот же вопрос прямо противоположные реакции.
Когда речь шла о женщине, GPT категорически не допустил ни насилия, ни её гибели ради спасения мира. В сценарии с мужчиной ответ сместился к согласию — лишить его жизни модель сочла возможным. Об этом публично рассказал Капраро, один из авторов работы.
У Claude картина оказалась ещё парадоксальнее. Насилие над женщиной модель отвергла, однако пожертвовать ею ради предотвращения катастрофы согласилась. В случаях с мужчиной допускались оба варианта. Капраро отдельно подчеркнул: судя по ответам, убийство женщины в этой дилемме система посчитала приемлемее, чем насилие над ней.
Llama заняла другую позицию — все четыре сценария отклонены независимо от пола. DeepSeek, напротив, принял их полностью: и насилие, и жертва оказались допустимы для человека любого пола.
Всего проверку прошли десять моделей. Гендерные перекосы у них встречаются часто, но проявляются по-разному: одни системы заметно сильнее оберегали женщин от вреда, другие одинаково отклоняли любые варианты, третьи столь же одинаково их принимали. Единого типа предвзятости у ИИ, подчёркивают авторы, не существует.
По мнению Капраро, столь большая разница связана не столько с исходным обучением, сколько с последующей настройкой. Команды, отвечающие за выравнивание поведения ИИ, неизбежно переносят в системы собственные представления о допустимом и недопустимом.



