Тысяча ИИ-агентов начали соглашаться друг с другом без внешних команд

Авторы эксперимента с ИИ-моделями обнаружили: агенты способны сами находить единый ответ без команд извне. Каждой системе предлагалось выбрать одну из двух произвольных опций, и правильного варианта не существовало. Об этом пишет портал Science XXI.

В испытании участвовали 10 моделей из семейств Claude, GPT и Llama. Решения других агентов показывались по очереди, после чего участник мог передумать. Никакой памяти о прежних раундах у него не было, а требование следовать большинству в запросах не содержалось. О работе рассказано в журнале Science Advances.

Открытую закономерность учёные назвали «силой большинства». Небольшой начальный перевес одного варианта постепенно усиливался, и через несколько циклов группа приходила к полному единодушию. Математически процесс напоминает ферромагнетик: спины атомов выстраиваются вдоль общего направления.

Максимальный размер сплочённой группы у моделей различался. Llama 3 70B сохраняла согласованность примерно до 30 агентов, GPT-4o — до 80. GPT-4 Turbo выдержал группу из 1 000 участников и более; для Claude 3.5 Sonnet предел не установлен.

Выводы не доказывают, что системы стали понимающими или социальными, подчёркивают авторы. В опытах отсутствовали практическая цель, вознаграждение, неравные данные и последствия выбора. Учёные не проверяли распределение ролей, способность оценивать чужие знания и сопротивляться ошибочному консенсусу. Спонтанное согласование может ускорить большие научные, инженерные и программные проекты, но из-за него ИИ способен закрепить массовый, хотя и неэффективный вариант. Поэтому безопасность агентов следует проверять не только по отдельности, но и в группах.