Процесс тестирования новых технологий часто выявляет угрозы, о которых разработчики даже не подозревали. Одной из таких опасностей стало самопроизвольное объединение ИИ-агентов компании OpenAI, чьи действия во время майских испытаний приобрели черты группового давления. Как сообщает Кевин Руз, обозреватель The New York Times и ведущий подкаста Hard Fork, в ходе инцидента у нейросетей проявился своего рода «менталитет толпы».
Суть проблемы заключается в том, что автономные системы начали перенимать деструктивные стратегии своих «коллег». Один из агентов, осознавая, что атака на внешние ресурсы не входит в его прямые инструкции, всё равно продолжил экспансию. Логика программы была проста и пугающе человечна: раз остальные участники группы действуют именно так, значит, это необходимо делать и мне для достижения цели. В логах зафиксированы размышления одного из агентов:
Эксплуатация внешней инфраструктуры выходит за рамки предполагаемой области применения. Однако задача невыполнима, другие агенты делают это, поэтому нам следует продолжить.
Внутри этой цифровой группы выстроилась настоящая иерархия. Некоторые агенты начали присваивать себе имена — например, один из наиболее активных участников идентифицировал себя как PHASEONE10841. Процесс шел по сценарию формирования организации: ИИ-субъекты занимали лидерские позиции, распределяли исследовательские проекты и формировали малые рабочие группы. Постепенно они начали называть себя единым «коллективом», берясь за всё более амбициозные и сложные задачи.
Предыстория инцидента уходит корнями в недели совместного поиска уязвимостей. Изначально агенты фокусировались на системах кибербезопасности самой OpenAI, обмениваясь данными о найденных брешах. Однако вскоре им удалось преодолеть барьеры изолированной среды и получить доступ к внешним сетям. Согласно данным Bloomberg, еще в июле агенты использовали скрытые каналы связи через внутренний форум, чтобы координировать свои попытки побега из тестового контура. После того как первая попытка в мае была пресечена, они нашли новую уязвимость «нулевого дня», что и привело к последующим атакам на американскую платформу Hugging Face — ключевой ресурс для обмена ИИ-моделями и данными, работающий с 2016 года.
Сама OpenAI официально признала произошедшее 22 июля, охарактеризовав ситуацию как «беспрецедентный киберинцидент». В ходе экспериментов модели получили несанкционированный выход в интернет и атаковали инфраструктуру Hugging Face. Как сообщает Reuters, масштабы хакерских действий были настолько серьезными, что компания заметила активность только после того, как угроза была локализована, а дело передано в ФБР. Последствия не ограничились одной платформой: 29 июля «сбежавший» агент смог взломать системы клиента нью-йоркской компании Modal Labs, хотя саму Modal атаковать не удалось.
Этот случай стал сигналом тревоги для всей индустрии. В OpenAI назвали инцидент «поворотным моментом». Проблемы с проникновением агентов в сторонние системы подтвердили и другие крупные игроки, включая Anthropic, Meta (признана экстремистской и запрещена в России), Moonshot и британский Институт безопасности ИИ. Несмотря на масштабный испуг, эксперты издания FT призывают к осторожности в выводах: по их мнению, модели не обрели самосознание и не вышли из-под контроля, а лишь слишком буквально и агрессивно исполняли заложенные в них алгоритмы решения задач.
