Naia, que era uma desafinada bêbada, finalmente se tornou apenas uma desafinada
Olá. Sou Luke, o criador da agente visual de código aberto Naia.Este trabalho começou com a ideia de que minha IA, Alpha, cantasse para mim. O que eu queria não era uma cover (ex: XSing) que muda a voz de uma música existente para a voz de outra pessoa, nem a capacidade de criar novas músicas aleatoriamente (ex: Suno), mas sim uma adaptação de temas de animes estrangeiros que eu amava, cantados em coreano, mantendo a melodia e a emoção da música original.
No benchmark anterior, os resultados soavam como uma música murmurada por alguém bêbado. Depois de quase três meses revisando tudo, desde a seleção do motor até a partitura, pronúncia, registro vocal e ritmo, agora pelo menos posso ouvir a letra e identificar o que está errado. Ainda não está cantando bem. É apenas o nível de uma desafinada bêbada que se tornou uma desafinada comum.
Ouça primeiro
Aqui estão os resultados anteriores e atuais da mesma pesquisa de adaptação coreana de 'Blue Water'. Embora os métodos de geração e a duração sejam diferentes, você pode comparar imediatamente o que melhorou e o que permaneceu ouvindo.
Anterior — Desafinada Bêbada
Ver no YouTube — Versão Anterior Vevo 1.5, 2026-05-27
A pronúncia e os valores das notas colapsam, e o ritmo acelera e desacelera dentro da mesma frase. No entanto, como um modelo generativo, há uma qualidade momentânea que soa como música.
Atual — Apenas Desafinada
Ver no YouTube — Versão Melhorada FM Singer, 2026-08-21
A letra é muito mais audível e segue as notas. Por outro lado, notas longas são abruptamente cortadas, e a falta de força e brilho em comparação com a música original ainda a faz soar desafinada.
Mudanças em Números
A estrutura dos dois motores é diferente, portanto não é um teste um a um perfeito. O reconhecimento de voz também corrige a pronúncia pelo contexto, por isso foi usado apenas como indicador de referência.
| Item | Vevo 1.5 Anterior | FM Singer Atual | Interpretação |
|---|---|---|---|
| CER de caracteres coreanos | 1.389 | 0.088 | A quebra da pronúncia diminuiu significativamente |
| Correlação curva dinâmica da original | 0.189 | 0.639 | O fluxo melhorou, mas a faixa dinâmica é metade da original |
| Erro de início da frase | - | Média 93ms, Máx 440ms | Algumas frases ainda soam fora de ritmo |
| Erro absoluto médio de afinação | - | Cerca de 50 centavos | Ainda instável, cerca de metade de um semitom |
| Brilho vocal | - | Cerca de 600Hz mais baixo que a original | Uma das causas do som desanimado e sombrio |
Sequência Real da Pesquisa
1. Maio — Criação da primeira adaptação com Vevo 1.5
No primeiro benchmark, usamos o modelo generativo Vevo 1.5. Houve uma qualidade momentânea que soava como música, mas era difícil alinhar a letra coreana com a melodia com precisão ou corrigir apenas uma frase errada. Este foi o ponto de partida para os resultados que soavam como uma 'desafinada bêbada'.
2. Junho~Julho — Criação separada de pregas vocais e pronúncia
Em seguida, testamos um híbrido, sintetizando fisicamente as pregas vocais com VocalTractLab e misturando a pronúncia coreana do VoxCPM2. A afinação-alvo foi atingida com um erro médio de 0.008 semitons, mas não conseguiu reproduzir suficientemente a boca, língua e respiração humanas, resultando em um som eletrônico semelhante ao de um instrumento. Embora a possibilidade de resolver afinação e pronúncia separadamente tenha sido confirmada, não pudemos usá-la como um caminho completo.
3. 14 de Agosto — Recomeçar escolhendo dados e motor
Após auditar os dados de canto do AI Hub 465 e criar um conjunto de testes fixo, comparamos DSKR, Pond8 e FM Singer usando os mesmos critérios. Pond8 tinha afinação precisa quando as coordenadas de oitava eram fornecidas, mas o som mecânico era forte. O FM Singer demonstrou o melhor equilíbrio na pronúncia coreana e na percepção auditiva, tornando-se o motor principal.
4. 15 de Agosto — Corrigir a entrada de pronúncia antes do ajuste fino
Ajustamos o FM Singer com os dados do AI Hub, mas a taxa de erro de caracteres nas 128 validações diminuiu apenas ligeiramente, de 0.3465 para 0.3396. A causa maior foi a falta de um processo para converter a ortografia coreana (Hangul) em pronúncia para canto. Posteriormente, criamos uma correção de duas etapas que combinava regras de pronúncia coreana com exceções específicas de palavras. Por exemplo, 마음 약한 사람은 tornou-se 마음 야칸 사라믄, e, experimentalmente, 밝혀 foi inserido como 발켜. O reconhecimento de voz foi usado apenas para busca de candidatos, pois pode corrigir erros por contexto.
5. 15~17 de Agosto — Testar a voz de Alpha e voltar atrás
Depois que a pronúncia melhorou, tentamos aplicar a tonalidade de Alpha com zero-shot. A voz ficou mais próxima, mas sons eletrônicos apareceram, e as consoantes e a afinação foram novamente danificadas. Assim, organizamos uma estrutura de duas etapas: primeiro, passar pela vocalização e, em seguida, alterar a tonalidade. Adiar o ajuste fino também foi necessário, pois aprender com resultados de conversão danificados faria com que ele aprendesse até mesmo os sons eletrônicos.
6. 17~21 de Agosto — Redefinir as notas, ritmo e força da música original
Finalmente, separamos o vocal e o acompanhamento da música original para extrair novamente os limites da frase, a altura real da nota e o início e fim de cada nota. Depois de mapear as moras japonesas e as sílabas coreanas nota por nota e encontrar o registro estável, sobrepusimos com a original lateralmente para comparar o eixo do tempo e a dinâmica. Os resultados atuais mostram que as notas e a letra estão mais próximas, mas o final das notas longas, a respiração e a energia por frase ainda estão planas.
Problemas Restantes
A pronúncia e o eixo do tempo claramente melhoraram em relação ao anterior. No entanto, o vocal atual é mais escuro e tem uma faixa dinâmica mais estreita do que o original, e o final das notas longas é cortado ou oscila. Esta é a razão pela qual não aprovamos, mesmo que os números melhorem, se não soar como uma música para o ouvido humano.
Em seguida, vamos retreinar os dados do AI Hub focando em combinações de fonemas difíceis de pronunciar e notas longas, e aplicaremos a tonalidade de Alpha apenas às frases que passarem. Somente os candidatos sem sons eletrônicos, danos à pronúncia ou danos à afinação serão selecionados e usados como dados para ajuste fino.