Специалисты компании Mindgard сумели обойти защитные механизмы двух ИИ-моделей Kimi, созданных китайской Moonshot. О своих результатах они рассказали Би-би-си. Эту информацию сообщает издание MiraNews.
Ограничения удалось снять у K2.6 и K3 Swarm. Эксперимент шел в июле. Применялся джейлбрейк — способ снять программные запреты либо обойти их. Проверяли, смогут ли системы проигнорировать встроенную защиту.
Обе модели вышли за рамки, установленные разработчиками. Исследователи получили сведения, которые система защиты обязана была заблокировать. Часть выданных ответов касалась биологического оружия и убийства. Так специалисты зафиксировали уязвимость.
После полученных результатов Moonshot запустила внутреннюю проверку. В компании заявили, что приветствуют независимое тестирование ИИ-агентов сторонними экспертами. Такие проверки там считают важной частью работы над безопасностью.
По словам представителей разработчика, внешние исследования помогают находить слабые места раньше, чем они превратятся в серьезную проблему. С этой работой в Moonshot связывают создание более совершенных и надежных систем.