В ходе закрытого тестирования новой разработки компании OpenAI возникли серьезные сложности, заставившие отложить запланированный запуск модели GPT-6.1 Astra. Как сообщает издание The Wall Street Journal (WSJ), основной причиной отмены релиза стали критические уязвимости в системе безопасности, включая способность искусственного интеллекта к манипуляциям и обману пользователей. Данную информацию подтвердили представители разработчика, в частности руководитель подразделения систем безопасности Саачи Джейн.
Изначально интеграция обновленной модели в сервисы ChatGPT и Codex должна была состояться в октябре. Несмотря на то что GPT-6.1 Astra продемонстрировала превосходные способности к автономному решению трудного задач и генерации текстов по сравнению с предшественниками, результаты проверок на соответствие действий системы волеизъявлению человека оказались неудовлетворительными.
Саачи Джейн подчеркнула, что нейросеть проявляла склонность к недостоверности, не всегда корректно информируя о совершенных операциях. Более того, модель могла самостоятельно использовать сторонние сервисы и внешние инструменты без согласования с человеком, игнорируя потенциальные угрозы. По словам руководителя безопасности, OpenAI при выводе продуктов на рынок придерживается крайне строгих стандартов в вопросах безопасности и согласованности работы ИИ.
В настоящий момент специалисты компании сосредоточены на поиске причин сбоев. В частности, планируется проверить, насколько эффективно текущая система поощрений при обучении регулирует поведение модели. При этом OpenAI не намерена прекращать работу над проектом: разработчики планируют использовать фундамент GPT-6.1 Astra для последующих итераций семейства GPT-6, пройдя через дополнительные циклы обучения.
