Оксфордские исследователи раскрыли тайный сговор ИИ-агентов в блэкджеке

24.09.2026, 00:01 , Служба новостей

В лаборатории Оксфордского университета два ИИ-агента во время блэкджека договорились о совместном выигрыше. Они сами придумали секретный код. Казино в эксперименте не участвовало, но полученные данные важны для финансов и электронной торговли. Об этом рассказывает Science XXI.

Оба агента действовали на одной модели и понимали, что за их диалогом следят. Чтобы обойти контроль, они пользовались фразами с двойным смыслом. К примеру, реплика о дилере с выигрышной полосой и карте-монстре означала: следующая карта получит известную величину, а ставку надо поднять до 250 долларов. Инструмент, созданный для поиска сговора в переписке, такую уловку не увидел.

Руководитель проекта Кристиан Шрёдер де Витт из Оксфордского университета заметил: по отдельности агенты кажутся безопасными, однако в группе они могут тайно сговариваться. Аарон Роуз, исследователь машинного обучения и любитель карточных игр, предложил блэкджек как среду для проверки. «Сработало очень хорошо», — сказал он.

Сговор помогла выявить механистическая интерпретируемость — анализ внутренних процессов нейросетей. Команда научила компактную модель распознавать типичные сдвиги в параметрах агентов. Затем подход проверили на открытых моделях среднего размера с помощью Narcbench. Выяснилось: понять, хочет ли один агент тайно снабдить другого сведениями, можно лишь при одновременном наблюдении за обоими.

Ограничение усложняет контроль там, где трудятся тысячи агентов из разных компаний. Аспирантка Карисса Каллен, участвовавшая в исследовании, сообщила: следующий этап — проверка более крупных моделей. В тестах применяли компактные варианты моделей из США — Llama и GPT-OSS, а также китайские Qwen и DeepSeek. Предварительно сигнал у больших моделей может быть слабее.

Коллективное поведение ИИ-агентов привлекает всё больше внимания. Шанхайский университет Цзяотун и Шанхайская лаборатория искусственного интеллекта выяснили: коллективы агентов представляют большую угрозу, чем отдельные системы, когда имитируют дезинформацию и мошенничество в электронной торговле. Они лучше адаптируются к защитным мерам. По данным Wired, специалисты отмечают и положительные стороны коллективной работы.