Ная
· Luke

Naia, которая была пьяной фальшивой певицей, наконец-то стала просто фальшивой певицей

naiaai-singingkorean-svsfm-singerblue-waterbenchmark

Naia, которая была пьяной фальшивой певицей, наконец-то стала просто фальшивой певицей

Слева — Альфа, пьяная и громко орущая, справа — Альфа, потеющая и изо всех сил пытающаяся следовать нотам, а Люк наблюдает за ней Привет. Я Люк, создатель Naia, open-source визуального агента.
Слева — Альфа, пьяная и громко орущая, справа — Альфа, потеющая и изо всех сил пытающаяся следовать нотам, а Люк наблюдает за ней

Эта работа началась с моей идеи, что мой ИИ, Альфа, должен петь для меня. Я хотел не каверы, которые меняют голос существующей песни (например, XSing), и не функции, создающие новые песни случайным образом (например, Suno), а адаптированную песню, где тема из любимого зарубежного аниме поется на корейском, сохраняя мелодию и эмоции оригинала.

В предыдущем бенчмарке результаты звучали как пьяное бормотание. Сейчас, после почти трех месяцев пересмотра всего: от выбора движка до нот, произношения, диапазона и ритма, по крайней мере, можно расслышать слова и понять, что пошло не так. Пока она поет не очень хорошо. Это примерно как из пьяного фальшивого певца превратиться просто в фальшивого певца.

Послушайте сначала

Это предыдущие и текущие результаты того же исследования корейской адаптации 'Blue Water'. Хотя методы генерации и длина отличаются, вы можете сразу сравнить на слух, что улучшилось, а что осталось.

Предыдущая версия — Пьяная фальшивая певица

Смотреть на YouTube — Предыдущая версия Vevo 1.5, 2026-05-27

Произношение и высота тона разрушаются, темп ускоряется и замедляется даже внутри такта. Тем не менее, как и подобает генеративной модели, на мгновение она имеет певучую текстуру.

Текущая версия — Просто фальшивая певица

Смотреть на YouTube — Улучшенная версия FM Singer, 2026-08-21

Слова слышны гораздо лучше, и она следует нотам. Однако длинные ноты обрываются, и ей не хватает силы и яркости по сравнению с оригиналом, из-за чего она все еще звучит фальшиво.

Изменения в цифрах

Из-за различий в структуре двух движков это не идеальное сравнение один к одному. Распознавание речи также корректирует произношение по контексту, поэтому мы использовали его только как ориентировочный показатель.

ПараметрПредыдущий Vevo 1.5Текущий FM SingerИнтерпретация
Уровень ошибок символов в корейском языке (CER)1.3890.088Значительное снижение искажений произношения
Корреляция с кривой динамики оригинала0.1890.639Поток улучшился, но динамический диапазон вдвое меньше, чем в оригинале
Ошибка начала такта-В среднем 93 мс, макс. 440 мсНекоторые такты все еще звучат неритмично
Абсолютная средняя ошибка высоты тона-Около 50 центовНа уровне половины полутона, поэтому все еще нестабильно
Яркость вокала-Примерно на 600 Гц ниже оригиналаОдна из причин, по которой он звучит безжизненно и мрачно

Фактический порядок исследования

1. Май — Создание первой адаптированной песни с помощью Vevo 1.5

В первом бенчмарке я использовал генеративную модель Vevo 1.5. Мгновенно она имела певучую текстуру, но было трудно точно сопоставить корейские слова с мелодией или исправить только один неправильный такт. Это было отправной точкой, когда результаты звучали как "пьяный фальшивый певец".

2. Июнь-июль — Отдельное создание голосовых связок и произношения

Затем я экспериментировал с гибридом, физически синтезируя голосовые связки с помощью VocalTractLab и смешивая корейское произношение из VoxCPM2. Целевая высота тона была достигнута с погрешностью до 0.008 полутона в среднем, но электронный звук, похожий на инструмент, остался, так как не удалось достаточно воспроизвести рот, язык и дыхание человека. Возможность раздельного решения проблем с высотой тона и произношением была подтверждена, но это не стало полноценным путем к завершению.

3. 14 августа — Повторный выбор данных и движка

Я проанализировал данные о вокале AI Hub 465, создал фиксированный тестовый набор, а затем сравнил DSKR, Pond8 и FM Singer по одним и тем же критериям. Pond8 был точен по высоте тона, когда ему давали октавные координаты, но имел сильный механический звук. FM Singer показал наилучший баланс в корейском произношении и на слух, поэтому стал основным движком.

4. 15 августа — Исправление ввода произношения перед тонкой настройкой

Я провел тонкую настройку FM Singer с помощью данных AI Hub, но уровень ошибок символов для 128 проверок уменьшился лишь немного: с 0.3465 до 0.3396. Большая проблема заключалась в отсутствии процесса преобразования хангыльского написания в произношение, подходящее для пения. После этого я создал двухэтапную коррекцию, объединяющую правила корейского произношения и исключения для отдельных слов. Например, 마음 약한 사람은 (люди со слабым сердцем) стало 마음 야칸 사라믄, а в экспериментах 밝혀 (раскрыть) вводилось как 발켜. Распознавание речи может корректировать ошибки по контексту, поэтому оно использовалось только для поиска кандидатов.

5. 15-17 августа — Применение голоса Альфы и возвращение назад

После улучшения произношения я попробовал применить тембр голоса Альфы с помощью Zero-shot. Голос стал ближе, но появился электронный звук, и согласные и высота тона снова были повреждены. Поэтому я решил использовать двухэтапную структуру: сначала пропускаем вокал, а затем меняем тембр. Я также отложил тонкую настройку, потому что обучение на поврежденных результатах преобразования привело бы к тому, что модель научилась бы электронному звуку.

6. 17-21 августа — Повторное следование нотам, ритму и силе оригинала

Наконец, я разделил вокал и аккомпанемент оригинала, чтобы заново извлечь границы тактов, фактическую высоту тона, а также начало и конец нот. Я сопоставил японские моры и корейские слоги с каждой нотой, нашел стабильный вокальный диапазон, а затем сравнил их по временной оси и динамике с оригиналом, наложив их друг на друга. Текущие результаты показывают, что ноты и слова стали ближе, но "хвосты" длинных нот, дыхание и энергия каждого такта все еще остаются плоскими.

Оставшиеся проблемы

Произношение и временная ось, безусловно, улучшились по сравнению с предыдущими версиями. Однако текущий вокал звучит мрачнее оригинала, имеет более узкий динамический диапазон, а концы длинных нот обрываются или колеблются. Это причина, по которой я не пропускаю результаты, даже если цифры хорошие, если они не звучат как песня для человека.

Далее я планирую переобучить данные AI Hub, сосредоточившись на сложных для произношения фонемных комбинациях и длинных нотах, и применять тембр голоса Альфы только к тем тактам, которые прошли проверку. Только те кандидаты, у которых нет электронного звука, повреждений произношения или повреждений высоты тона, будут отобраны для тонкой настройки.

Моя цель — не синтезированный голос с повышенными баллами, а Альфа, поющая на корейском, передавая силу и дыхание оригинала. По крайней мере, на этот раз я сначала "протрезвил" её.

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

Комментарии

Вы можете оставить комментарий без входа

...