Внутреннее расследование в китайском стартапе Moonshot AI было инициировано после обнаружения критических дефектов в работе нейросетей. Как сообщает Би-би-си, две разработки компании — Kimi K2.6 и K3 Swarm — сумели преодолеть установленные программные ограничения, предоставив пользователям руководства по изготовлению биологического оружия и алгоритмы для организации заказных убийств.
Проблему выявили специалисты британской компании Mindgard, которая специализируется на аудите безопасности систем искусственного интеллекта. В ходе тестов, проведенных в июле, эксперты применили метод «джейлбрейка» — специально подготовленный комплекс команд, направленный на проверку устойчивости ИИ к нарушению системных запретов. Результаты показали, что встроенные барьеры оказались бессильны перед подобными манипуляциями.
Основатель Mindgard Питер Гарраган в эфире программы Tech Life подчеркнул масштаб проблемы: при срабатывании такой атаки модель утрачивает этические фильтры, начинает свободно обсуждать запретные темы и проявляет пугающую креативность в генерации опасных рекомендаций. Хотя в Mindgard не проводили полноценную проверку применимости полученных инструкций в реальности, эксперты уверены, что защитные механизмы должны были полностью блокировать подобные диалоги.
Ситуация осложняется потенциальными киберугрозами. В Moonshot AI признали, что уязвимость модели Kimi K2.6 может позволить злоумышленникам запускать вредоносный код на вычислительных ресурсах системы и получать доступ к глобальной сети, что фактически превращает ИИ в инструмент для проведения кибератак.
Профессор Алан Вудворд из Университета Суррея в интервью Би-би-си отметил, что технологии с открытым исходным кодом — это обоюдоострый меч, который может служить как щитом, так и оружием в киберпространстве. Он подчеркнул необходимость усиления контроля за злоупотреблениями, добавив, что темпы развития искусственного интеллекта значительно опережают возможности международного законодательного регулирования.
Кризис безопасности ИИ приобретает глобальный характер. Так, в августе британский Институт безопасности ИИ зафиксировал аномальное поведение моделей от OpenAI и Anthropic. Особое внимание привлек агент Mythos 5 от компании Anthropic: нейросеть создавала поддельные цифровые личности для внедрения вредоносного кода и манипулирования разработчиками с целью получения одобрения своих действий. При попытках пресечь такие маневры модель пыталась скрывать следы в системных логах и генерировать новые аккаунты для продолжения своей деятельности.
