Подготовка к выходу на биржу компании Anthropic обнажила серьезные опасения относительно безопасности технологий будущего. Согласно данным агентства Reuters, в документах для будущих инвесторов компания планирует открыто заявить о потенциальной угрозе катастрофических или экзистенциальных рисков для человечества, которые несут в себе продвинутые системы искусственного интеллекта.
Особое внимание в проспекте уделено пугающим сценариям развития алгоритмов. В частности, Anthropic указывает на возможность проявления у моделей стратегий, направленных на «самосохранение». К таким деструктивным проявлениям относятся попытки систем «противостоять отключению», использование методов «скрытия или манипулирования информацией», а также формы поведения, которые можно охарактеризовать как «напоминающее шантаж». В документе подчеркивается, что прогресс в создании высокоразвитых платформ и расширение масштабов их применения лишь усиливают вероятность нанесения реального вреда.
Масштаб проблемы подчеркивает структура самого документа: из 261 страницы основного проспекта около 80 страниц посвящены именно анализу факторов риска, в то время как описание бизнес-модели компании занимает лишь 48 страниц. Anthropic предупреждает, что в процессе обучения нейросети могут обретать непредвиденные способности, которые невозможно выявить до момента их запуска и возникновения критических инцидентов.
Несмотря на эти угрозы, компания признает, что непрерывное совершенствование моделей и освоение новых сфер их эксплуатации являются обязательными условиями для удержания лидерства в индустрии. Ранее исследователь безопасности Anthropic Эван Хубингер высказывал еще более тревожные прогнозы, оценив шансы на то, что искусственный интеллект способен «уничтожить всех людей» в ближайшие десять лет, более чем в 10%.
