奈亚
· Luke

Naia 在唱歌 — 韩语 SVS 基准首次 baseline (Vevo1.5 base,23 首歌评估)

naia-singsvskorean-ttsvevobenchmarkai-singing

大家好,我是制作 Naia 的 Luke。

Naia 的语音模型已取得一些结果,接下来我也在看歌唱方面。希望 Alpha 能为我唱歌。特别对 번안곡 (将外国歌曲翻译成韩语演唱的翻唱曲) 感兴趣。

一个月前开始,撞到天花板,最近又有了一点结果 — 感觉再深挖能出点东西。以前韩文和音准都是外星人级别的乱码,现在终于能稍微像韩语一样唱了。

不过有点像喝醉的感觉 ^^。但既然有东西出来了挺有意思,就和报告一起分享进度。希望有一天它真的能为我唱歌。

Naia-Sing 还未到稳定阶段,这更像是进度分享而非发布。正式公开顺序是先发布已稳定的 Naia-talk (Naia-Omni),Naia-Sing 随后。

唱歌的 Alpha

TL;DR

  • 23 首歌评估完成,Composite score 27.860.6 (0100 标度)
  • 用户试听 BEST 3 首 = metric rank 1·3·5 位,WORST 2 = rank 17·19framework valid 验证
  • Hard Gate (服务可用最低线) = 0/23 通过 — 当前 base 未达服务水准
  • 最大弱点: A. 发音 (CER 平均 1.18) + E. 表现 (仅 1/23)
  • 下一步 = Track A 247h 韩语 fine-tune + 短化推理 + 音节精确匹配

Top 10 合集视频

7 分 24 秒。从第 1 名到第 10 名逐曲播放。每曲经 ffmpeg loudnorm -14 LUFS + dynaudnorm 标准化。视频中 流派匹配、音色一致性、发音精度的 trade-off 直观可听。

#曲目sourcescore强项
1banan_jaychou_translation周杰伦 抒情 (13s, ko translation)60.6CER 0.52 全场最低 · ko 0.96
2genre_digicharat数码卡通 Party Night (1999)50.8ko 0.97 · timbre 0.92
3genre_gunslinger神枪少女 doll · Lia48.8timbre 0.93 · 抒情匹配
4genre_escaflowne天空之逃亡者 OP (1996)48.2f0 range 0.91 匹配
5banan_adele_translationAdele — Someone Like You (13s)47.8E.energy 0.72 最高
6base_gunslinger同曲,KO-S1 baseline47.8CER 0.70 (全场第 2 低)
7genre_macross超时空要塞《可曾记得爱》(1984)47.7ko 0.97 · timbre 0.92
8genre_chobitsLet Me Be With You (2002)46.7timbre 0.93
9pipe_01_adeleAdele source 13s pipeline45.9f0_corr 0.81 最高
10genre_nadia蓝宝石之谜 (1990)44.2timbre 0.97 最高

1. 「唱好韩语歌」 — 5 个独立维度

不能归结为一个 metric。学界 (TCSinger, Vevo, DiffSinger) 也同时报告 4-5 个维度。

维度学界 metric我们的测量含义
A. 发音 (Intelligibility)CER, PERWhisper-small KO STT vs 目标歌词 edit distance「歌词能听清吗」
B. 音准 (Pitch)F0 RMSE, F0 corrlibrosa.pyin F0 pearson + range ratio「音调对吗」
C. 音色 (Similarity)SECS (ECAPA cosine)MFCC mean cosine (proxy)「是同一个人吗」
D. 流畅 (Naturalness)MOS-N, UTMOSchunk_disc per min (proxy)「不像机器吗」
E. 表现 (翻唱专用)(自定义)source RMS + spectral centroid + vibrato corr「跟随原曲表现吗」

E 维度是翻唱曲的核心。一般 SVS = 乐谱是表现的 ground truth。翻唱 = source 演唱的 dynamics/vibrato/articulation 是 ground truth。

Hard Gate (服务可用最低线)

A. CER ≤ 0.30  AND  ko_prob ≥ 0.90       [韩语发音]
B. f0_corr ≥ 0.50  AND  range 0.6~1.4    [音准]
C. timbre_sim ≥ 0.65                       [音色]
D. chunk_disc ≤ 2/min                      [流畅]
E. energy_corr ≥ 0.5 · brightness ≥ 0.4 · vibrato 0.5~1.5  [表现]

学界依据: CER 0.30 = production STT threshold; SECS 0.60-0.70 = zero-shot SVC 通过标准。


2. Framework Self-Validation

Whisper-small 对 SVS 质量测量无效的教训 (svs_eval.py §43, 5/17): golden in-dist 样本也是空输出。歌唱只触发 speech-likeness。

metric 的自我验证必须:

用户 best  vs  用户 worst
     ↓             ↓
   必须被 metric 分离
     ↓
   做不到则 metric 本身 invalid

23 首歌 self-validation 结果:

用户评价曲目metric ranking分离
🟢 BESTbanan_jaychou_translation1/23
🟢 BESTgenre_gunslinger3/23
🟢 BESTbanan_adele_translation5/23
🔴 WORSTbase_macross17/23
🔴 WORSTbase_flcl19/23

framework valid (ranking proxy 确认)。已获得客观比较 Track A 训练结果的工具。


3. Hard Gate 通过 — 0/23 ❌

维度标准通过
A. CER ≤ 0.30学界 production0/23
A. ko_prob ≥ 0.90Whisper 韩语识别14/23
B. f0_corr ≥ 0.5 + range OKpitch 保留2/23
C. timbre_sim ≥ 0.65ref 一致性10/23
D. disc ≤ 2/minchunk artifact20/23 ✓
E. (3 metric AND)翻唱表现1/23

当前 Vevo1.5 韩语 base = 服务 0% 可能。A·B·E 是 critical gap。


4. 诊断 — 各维度弱点与原因

A. 发音 — Vevo 韩语 phoneme 合成不足

Vevo1.5 = Sing-0.4k (含韩语 CSD 3.8h 共 438h) 预训练。但韩语 phoneme mapping 较弱 — CER 平均 1.18 = 70% 损坏。仅 ko_prob 0.86 = 「听起来像韩语」但音素 X。

B. 音准 — melody_control 旋律学习不足

f0_corr 平均 0.18。部分负值 (gunslinger -0.20, gsteatrino -0.46) = 与 source 反向旋律。vevosing_melody_control 优先 phoneme content transfer,F0 contour 次之。

C. 音色 — ref 匹配有效

AI-Hub 8 ref 匹配曲目 timbre_sim 平均 0.91。但 chunk 边界音色 drift = 用户试听「不同声音介入」现象。

D. 流畅 — chunk merge OK

20/23 通过。crossfade 100ms 有效。3 个 outlier 仅 source vocal 静音多时。

E. 表现 — 最大失败

1/23 通过。平均 energy_corr 0.32, brightness_corr 0.19。Vevo prosody tokenizer 韩语学习不足 + content-style 分离时 dynamics 丢失。


5. 如何改进 — 按优先级

🟢 P0 (即可,效果验证)

项目效果备注
应用 Track A 训练结果A·B·E 同时改善247h KO 数据 fine-tune 进行中
Single chunk 推理C·D 同时60s → 15s chorus → 第 1 名 sweet spot
音节精确匹配歌词ASimpleAligner 均分 → source 音节数匹配

第 1 名 (banan_jaychou_translation) 的公式: 缩短(13s) + 音节匹配 + clean studio source

🟡 P1 (1 周内)

项目效果
ECAPA-TDNN SECS 引入C 维度精度 (MFCC proxy 替换)
UTMOS / Sing-MOS predictorD 自然度客观化
Phrase-aware alignerA·D 同时 (音节均分 X)
Suno API → 韩语 sourceA·E 同时 (韩语 vocal source pool)

🟠 P2 (中期,需验证)

项目效果风险
Vevo1.5 fine-tune (Track A)A·B·E 全部训练结果未验证
TCSinger2 pivot 再检讨表现增强可能stack 复杂、ceiling 风险
F5-TTS / CosyVoice2 SVS adapterA 发音adapter 缺失
SVC 后处理 (RVC/SoulX)C 音色end-to-end CER 需测量

🔴 P3 (长期,范式转换)

  • 自研 SVS 模型训练 → 验证过的外部 base 更有利 (Naia 核心理念)
  • Subjective MOS listening test → 绝对 ground truth
  • Suno + 自研 cover 流水线商业化 → 「歌唱 AI 服务」Track D

6. 下一个决策点

  1. Track A 完成时 → 用本 framework 再评估,测量改善幅度
  2. 改善 < 20% → 弃 Vevo1.5 base,再考虑 TCSinger2 或 F5-TTS
  3. 改善 ≥ 30% → 正式 fine-tune + Track D 服务化
  4. 用户 gate = Track A 结果试听 + 5 维 metric 同步检查后决定

7. naia-sing 32 天研究日志

基于 git history — 无幻觉。真正开始 = 2026-04-25 (一个月的 history)。

2026-04-25 ─ 开始: project setup + RVC pipeline scripts.
2026-04-26 ─ source data + cross-lingual cover pipeline + IP groundwork.
2026-04-28 ─ 3-frontier 作词 + 韩语 SVS 验证 + 通话 ref voice pipeline.
2026-05-15 ─ DSKR (DiffSinger Korean) + AI-Hub 465 韩语 SVS 训练栈确定.
2026-05-15 ─ IO bottleneck 根本解决 — pickle 13x 轻量 + HDD→SSD (避免 58s/step).
2026-05-16 ─ 工作栈确定 — DSKR+CSD 迁移 → RVC swap. 用户验证 OK.
2026-05-16 ─ Vocoder 上限反驳 + 延长训练 300k→500k.
2026-05-16 ─ 延长训练 overfit 反驳 — best=S_300000 锁定.
2026-05-18 ─ BigVGAN 作 DSKR 默认 vocoder + aihubshell 密钥安全补丁.
2026-05-19 ─ DSKR S_300000 再现上限实在确认 (MCD37 vs 他曲 48).
2026-05-19 ─ TCSinger 2 韩语 SVS 开始 → PAUSED @ VAE epoch 395.
2026-05-21 ─ R3 对抗评审综合 + naia-sing 资源 gate 暂停.
2026-05-26 ─ TCSinger2 终结 → Vevo1.5 韩语 SVS 发现.
2026-05-26 ─ Korean singing dataset 247h 完成 (GTSinger + AI-Hub 465).
2026-05-26 ─ BASE STATE SNAPSHOT — fine-tune 前 baseline lock.
2026-05-26 ─ 3 AI 交叉评审 (codex+gemini+opencode) + Reality Check.
2026-05-26 ─ Track A Phase 1 AR smoke PASS + Phase 2 自动 wrapper.
2026-05-26 ─ Stage 别 VRAM 测量 + 5 翻唱 batch + 10 anime OST 60s.
2026-05-26 ─ Critical 发现: Vevo melody_control = source vocal phoneme 依赖.
2026-05-26 ─ AI-Hub 8 short refs 流派匹配 batch + ffmpeg loudnorm 后处理.
2026-05-27 ─ 本报告: 5 维评估 framework + 23 曲 baseline + Hard Gate.
2026-05-27 ─ Framework valid 确认 + Top 10 合集视频.

约 32 天:

  • 5 种不同 SVS 栈试用 (RVC → DSKR → SoulX → TCSinger2 → Vevo1.5)
  • 1 个 ceiling 到达 (DSKR S_300000) + 1 个 paused (TCSinger2 VAE) + 1 个 dropped (RVC pure)
  • 现在 = Vevo1.5 外部 base + Track A 247h KO fine-tune 进行中

自研模型 X,通过验证过的外部 base + 我们的栈 (记忆/隐私/RAG/本地 serving) 实现差异化。Naia 核心理念,2026-05-15 范式 lock。


诚实的局限

本文 不是 base 良好的报告。而是 客观测量 base 处于服务 0% 可能水平的报告。我们获得了与人试听排名一致的 metric framework — 一个诚实地检查训练是否有效的工具。这就是本文的意义。

Track A 训练完成后,将用相同 23 曲再评估并定量报告改善幅度。

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

评论

无需登录即可评论

...