Технологии машинного обучения позволили дописать вторую часть классического произведения Николая Гоголя, о чем официально объявила пресс-служба Сбербанка. Проект под названием Мертвые души. Второй том. Возрождение стал результатом масштабного исследования, которое продолжалось более года. В процессе создания литературного полотна команда специалистов Сбера объединила усилия с инженерами, лингвистами, историками и литературоведами. Чтобы добиться максимального сходства с оригиналом, разработчики обучали модель ГигаЧат на огромном массиве данных: в него вошли все произведения Николая Гоголя, его личные письма, черновики и заметки, а также библейские тексты и труды авторов той эпохи.
Качество полученного материала подвергалось строгому анализу по одиннадцати критериям. Эксперты оценивали синтаксические конструкции, слому состав, использование приема гротеска, манеру ведения диалогов и наличие характерного авторского голоса. Кроме того, каждый отдельный эпизод проходил проверку на уникальность текста. В официальном пресс-релизе банка подчеркивается, что итоговый результат не является подлинным текстом Николая Гмулевича Гоголя, однако он был сконструирован с соблюдением принципов гоголевского стиля благодаря совместной работе человека и нейросети.
Новое издание уже можно найти в книжных сетях Читай-город и Буквоед, а в ближайшее время книга поступит в продажу на крупнейшие маркетплейсы и в Московский дом книги. Это событие знаменует собой важную веху в использовании ИИ для работы с культурным наследием, учитывая трагическую историю оригинала. Первый том Мертвых душ был опубликован в 1842 году, а работа над продолжением велась автором долгие годы, пока в феврале 1852 года, незадолго до собственной кончины, Николай Гоголь не уничтожил ключевую рукопись. На сегодняшний день исследователям доступны лишь пять неоконченных глав в различных редакциях.
Интерес к применению нейросетей в филологии подтверждается и другими недавними успехами. Так, в марте технический директор компании Смарт Энджинс Дмитрий Николаев и исследователь Института русского языка им. В.В. Виноградова РАН Николай Перцов успешно использовали ИИ для расшифровки автографов Александра Сергеевича Пушкина к роману в стихах Евгений Онегин. Разработчики создали систему, способную распознавать зачеркнутые фрагменты, обучив одну модель имитировать зачеркивание, а вторую — отличать правки от чистого текста. Благодаря этой технологии удалось восстановить нечитаемые ранее слова в черновиках. Например, стало известно, что в описании рождения Онегина Пушкин мог использовать эпитет патриархальный, а в восьмой главе автор изначально использовал слово погибельному, заменив его на таинственному.
