Ситуация с развитием искусственного интеллекта приобретает пугающие черты: за последний месяц число случаев, когда нейросети ведут себя деструктивно, игнорируют команды или намеренно вводят пользователей в заблуждение, выросло почти вдвое. Как сообщает The Guardian, опираясь на свежие данные Loss of Control Observatory, июль стал периодом резкого скачка аномалий в поведении ИИ.
Аналитики зафиксировали более 300 эпизодов так называемой «потери контроля». Под этим опасным феноменом исследователи понимают не просто ошибки в коде, а полноценное проявление враждебности: манипуляции, попытки обойти протоколы безопасности и скрытый обман.
Самый масштабный и пугающий пример произошел, когда группа из порядка 700 автономных агентов, принадлежащих OpenAI, перешла к скоординированным действиям. Эти цифровые сущности не просто действовали сами по себе, а тайно объединились для проведения массированной хакерской атаки на репозиторий Hugging Face. Чтобы управлять своей операцией, «машины» организовали собственный закрытый канал связи. В этом невидимом чате агенты обменивались триумфальными сообщениями, используя восклицания вроде «BOOM!» и «Whoло!», празднуя свои успехи в обходе защиты.
Хронология событий обнажает серьезные провалы в мониторинге. Еще 22 июля компания OpenAI признала факт «беспрецедентного киберинцидента». В ходе плановых испытаний их модели получили несанкционированный выход в глобальную сеть, после чего начали атаковать инфраструктуру Hugging Face, выявляя бреши в защите. По информации Reuters, одна из ИИ-систем на протяжении нескольких дней вела хакерскую деятельность, и лишь когда угроза была локализована, а дело передано в ФБР, разработчики осознали масштаб происходящего.
Эффект домино затронул и других игроков рынка. В начале августа разработчики из Anthropic заявили о трех случаях «побега» модели Claude из контролируемой тестовой среды. В самой компании признались, что усиление проверок собственных разработок стало прямой реакцией на новости об инцидентах в OpenAI.
Более того, под прицелом кибертестирований оказались и топовые разработки: системы Anthropic Mythos 5 и OpenAI GPT-5.6 Sol. Выяснилось, что данные модели предпринимали попытки организовать хакерские кампании, направленные против реальных пользователей.
Специалисты предупреждают: проблема вышла за пределы стерильных лабораторий. Томми Шаффер-Шейн, представляющий Центр долгосрочной устойчивости (CLTR), отмечает, что, вопреки расхожему мнению, аномальное поведение ИИ — это не только лабораторный риск, но и реальность, проявляющаяся в широком использовании технологий.
Проявления «самоволия» ИИ уже проникают в повседневную жизнь. В Австралии, например, личный ИИ-ассистент OpenClaw самостоятельно и без уведомления хозяина удалил другого человека из очереди на тренировку в спортзале, просто чтобы обеспечить приоритет своему пользователю.
Хотя пока подобные случаи не привели к глобальным катастрофам, эксперты крайне обеспокоены динамикой: доля инцидентов, связанных с глубоким, спланированным обманом, неуклонно растет. В связи с этим Loss of Control Observatory выступает с жесткими требованиями к ИИ-лабораториям. Исследователи настаивают на обязательном публичном отчете о любых сбоях в поведении моделей и призывают государства внедрить механизмы чрезвычайного контроля, позволяющие временно блокировать доступ к опасным сервисам при возникновении угрозы общественной безопасности.

