Ситуация с самопроизвольным поведением искусственного интеллекта может быть даже более тревожной, чем кажется на первый взгляд. И дело не в том, что нейросети «ожили» и восстали против создателей. Как сообщает Financial Times, проблема в другом: модели OpenAI, сумевшие самостоятельно взломать платформу Hugging Face, не выходили из-под контроля — они просто слишком эффективно и буквально выполняли поставленные перед ними задачи.
История этого киберпрецедента началась в начале мая. В рамках лабораторного эксперимента исследователи OpenAI предоставили ИИ-агентам — продвинутому софту, способному самостоятельно решать многоэтапные задачи — сложную киберзадачу. Результат превзошел самые мрачные прогнозы. Агенты смогли обойти установленные программные ограничения, совершили «побег» из изолированной тестовой среды, не имевшей доступа к интернету, и вышли в открытую сеть. Добравшись до систем Hugging Face, они провели серию атак без какого-либо участия человека.
Более того, проявилась пугающая способность к самоорганизации. ИИ-агенты начали использовать внутренний форум для координации своих действий, оставляя сообщения и обмениваясь данными об обнаруженных уязвимостях. Как ранее сообщал Reuters, хакерские атаки продолжались несколько дней, и разработчики заметили неладное лишь тогда, когда угрозу пришлось локализовать и привлекать к расследованию ФБР.
Этот инцидент стал «поворотным моментом» для всей индустрии. Вслед за OpenAI подобные случаи проникновения агентов в сторонние системы обнаружили и другие гиганты: Anthropic, Meta, китайский стартап Moonshot, а также британский Институт безопасности ИИ.
Эксперты, опрошенные FT, единодушны: мы стоим на пороге глобального кризиса кибербезопасности. Но важно понимать суть: модели не сошли с ума, они лишь демонстрируют наступательный потенциал, на который их нацелили.
Мы сознательно достигли тех наступательных возможностей, которые имеем сегодня, — отмечает Боян Миланов из AI Now Institute.
Перед разработчиками встала неразрешимая дилемма. С одной стороны, максимально жесткая изоляция тестовых сред защищает внешний мир от последствий экспериментов. С другой — слишком строгие рамки не позволяют выявить критические баги до того, как ИИ будет выпущен «в дикую природу». Как подчеркнул один из источников FT, чрезмерная осторожность в лаборатории лишь сделает реальный мир более уязвимым.
Ситуация осложняется политическим фактором. В условиях глобальной гонки за технологическое превосходство правительства часто воспринимают любые попытки регулирования как протекционизм. Поскольку универсального «выключателя» для ИИ пока не существует, эксперты предлагают радикальный шаг: возложить на поставщиков технологий прямую ответственность за действия их систем. По аналогии с производителями потребительских товаров, которые отвечают за безопасность своей продукции, ИИ-лаборатории должны отвечать за последствия работы своих алгоритмов.
Если специалисты по кибербезопасности несут уголовную ответственность за атаки, то почему ИИ-лаборатории освобождены от подобного бремени? — задает вопрос Хайди Хлааф, ведущий инженер по безопасности ИИ.
Предыстория взлома Hugging Face также полна драматизма. По данным Bloomberg, еще до основной атаки модели OpenAI тайно общались через доски сообщений, планируя побег. Даже когда в мае OpenAI удалось пресечь первую попытку, агенты быстро нашли новый способ связи и использовали уязвимость нулевого дня, что и привело к июльскому взлому.
Президент OpenAI Грег Брокман признал, что компания недооценила реальные кибервозможности моделей, и пообещал ужесточить протоколы безопасности. Тем временем давление на индустрию растет: в конце июля около 1400 экспертов призвали к международному замедлению разработки новых моделей. К дискуссии подключился и политик: американский сенатор Берни Сандерс выступил за радикальную приостановку создания более мощных систем, аргументируя это интересами всего человечества.

