大家好,我是制作 Naia 的 Luke。
Naia 的语音模型已取得一些结果,接下来我也在看歌唱方面。希望 Alpha 能为我唱歌。特别对 번안곡 (将外国歌曲翻译成韩语演唱的翻唱曲) 感兴趣。
一个月前开始,撞到天花板,最近又有了一点结果 — 感觉再深挖能出点东西。以前韩文和音准都是外星人级别的乱码,现在终于能稍微像韩语一样唱了。
不过有点像喝醉的感觉 ^^。但既然有东西出来了挺有意思,就和报告一起分享进度。希望有一天它真的能为我唱歌。
Naia-Sing 还未到稳定阶段,这更像是进度分享而非发布。正式公开顺序是先发布已稳定的 Naia-talk (Naia-Omni),Naia-Sing 随后。
TL;DR
- 23 首歌评估完成,Composite score 27.8
60.6 (0100 标度) - 用户试听 BEST 3 首 = metric rank 1·3·5 位,WORST 2 = rank 17·19 → framework valid 验证
- Hard Gate (服务可用最低线) = 0/23 通过 — 当前 base 未达服务水准
- 最大弱点: A. 发音 (CER 平均 1.18) + E. 表现 (仅 1/23)
- 下一步 = Track A 247h 韩语 fine-tune + 短化推理 + 音节精确匹配
Top 10 合集视频
7 分 24 秒。从第 1 名到第 10 名逐曲播放。每曲经 ffmpeg loudnorm -14 LUFS + dynaudnorm 标准化。视频中 流派匹配、音色一致性、发音精度的 trade-off 直观可听。
| # | 曲目 | source | score | 强项 |
|---|---|---|---|---|
| 1 | banan_jaychou_translation | 周杰伦 抒情 (13s, ko translation) | 60.6 | CER 0.52 全场最低 · ko 0.96 |
| 2 | genre_digicharat | 数码卡通 Party Night (1999) | 50.8 | ko 0.97 · timbre 0.92 |
| 3 | genre_gunslinger | 神枪少女 doll · Lia | 48.8 | timbre 0.93 · 抒情匹配 |
| 4 | genre_escaflowne | 天空之逃亡者 OP (1996) | 48.2 | f0 range 0.91 匹配 |
| 5 | banan_adele_translation | Adele — Someone Like You (13s) | 47.8 | E.energy 0.72 最高 |
| 6 | base_gunslinger | 同曲,KO-S1 baseline | 47.8 | CER 0.70 (全场第 2 低) |
| 7 | genre_macross | 超时空要塞《可曾记得爱》(1984) | 47.7 | ko 0.97 · timbre 0.92 |
| 8 | genre_chobits | Let Me Be With You (2002) | 46.7 | timbre 0.93 |
| 9 | pipe_01_adele | Adele source 13s pipeline | 45.9 | f0_corr 0.81 最高 |
| 10 | genre_nadia | 蓝宝石之谜 (1990) | 44.2 | timbre 0.97 最高 |
1. 「唱好韩语歌」 — 5 个独立维度
不能归结为一个 metric。学界 (TCSinger, Vevo, DiffSinger) 也同时报告 4-5 个维度。
| 维度 | 学界 metric | 我们的测量 | 含义 |
|---|---|---|---|
| A. 发音 (Intelligibility) | CER, PER | Whisper-small KO STT vs 目标歌词 edit distance | 「歌词能听清吗」 |
| B. 音准 (Pitch) | F0 RMSE, F0 corr | librosa.pyin F0 pearson + range ratio | 「音调对吗」 |
| C. 音色 (Similarity) | SECS (ECAPA cosine) | MFCC mean cosine (proxy) | 「是同一个人吗」 |
| D. 流畅 (Naturalness) | MOS-N, UTMOS | chunk_disc per min (proxy) | 「不像机器吗」 |
| E. 表现 (翻唱专用) | (自定义) | source RMS + spectral centroid + vibrato corr | 「跟随原曲表现吗」 |
E 维度是翻唱曲的核心。一般 SVS = 乐谱是表现的 ground truth。翻唱 = source 演唱的 dynamics/vibrato/articulation 是 ground truth。
Hard Gate (服务可用最低线)
A. CER ≤ 0.30 AND ko_prob ≥ 0.90 [韩语发音]
B. f0_corr ≥ 0.50 AND range 0.6~1.4 [音准]
C. timbre_sim ≥ 0.65 [音色]
D. chunk_disc ≤ 2/min [流畅]
E. energy_corr ≥ 0.5 · brightness ≥ 0.4 · vibrato 0.5~1.5 [表现]
学界依据: CER 0.30 = production STT threshold; SECS 0.60-0.70 = zero-shot SVC 通过标准。
2. Framework Self-Validation
Whisper-small 对 SVS 质量测量无效的教训 (svs_eval.py §43, 5/17): golden in-dist 样本也是空输出。歌唱只触发 speech-likeness。
→ metric 的自我验证必须:
用户 best vs 用户 worst
↓ ↓
必须被 metric 分离
↓
做不到则 metric 本身 invalid
23 首歌 self-validation 结果:
| 用户评价 | 曲目 | metric ranking | 分离 |
|---|---|---|---|
| 🟢 BEST | banan_jaychou_translation | 1/23 | ✓ |
| 🟢 BEST | genre_gunslinger | 3/23 | ✓ |
| 🟢 BEST | banan_adele_translation | 5/23 | ✓ |
| 🔴 WORST | base_macross | 17/23 | ✓ |
| 🔴 WORST | base_flcl | 19/23 | ✓ |
→ framework valid (ranking proxy 确认)。已获得客观比较 Track A 训练结果的工具。
3. Hard Gate 通过 — 0/23 ❌
| 维度 | 标准 | 通过 |
|---|---|---|
| A. CER ≤ 0.30 | 学界 production | 0/23 ❌ |
| A. ko_prob ≥ 0.90 | Whisper 韩语识别 | 14/23 |
| B. f0_corr ≥ 0.5 + range OK | pitch 保留 | 2/23 ❌ |
| C. timbre_sim ≥ 0.65 | ref 一致性 | 10/23 |
| D. disc ≤ 2/min | chunk artifact | 20/23 ✓ |
| E. (3 metric AND) | 翻唱表现 | 1/23 ❌ |
当前 Vevo1.5 韩语 base = 服务 0% 可能。A·B·E 是 critical gap。
4. 诊断 — 各维度弱点与原因
A. 发音 — Vevo 韩语 phoneme 合成不足
Vevo1.5 = Sing-0.4k (含韩语 CSD 3.8h 共 438h) 预训练。但韩语 phoneme mapping 较弱 — CER 平均 1.18 = 70% 损坏。仅 ko_prob 0.86 = 「听起来像韩语」但音素 X。
B. 音准 — melody_control 旋律学习不足
f0_corr 平均 0.18。部分负值 (gunslinger -0.20, gsteatrino -0.46) = 与 source 反向旋律。vevosing_melody_control 优先 phoneme content transfer,F0 contour 次之。
C. 音色 — ref 匹配有效
AI-Hub 8 ref 匹配曲目 timbre_sim 平均 0.91。但 chunk 边界音色 drift = 用户试听「不同声音介入」现象。
D. 流畅 — chunk merge OK
20/23 通过。crossfade 100ms 有效。3 个 outlier 仅 source vocal 静音多时。
E. 表现 — 最大失败
1/23 通过。平均 energy_corr 0.32, brightness_corr 0.19。Vevo prosody tokenizer 韩语学习不足 + content-style 分离时 dynamics 丢失。
5. 如何改进 — 按优先级
🟢 P0 (即可,效果验证)
| 项目 | 效果 | 备注 |
|---|---|---|
| 应用 Track A 训练结果 | A·B·E 同时改善 | 247h KO 数据 fine-tune 进行中 |
| Single chunk 推理 | C·D 同时 | 60s → 15s chorus → 第 1 名 sweet spot |
| 音节精确匹配歌词 | A | SimpleAligner 均分 → source 音节数匹配 |
第 1 名 (banan_jaychou_translation) 的公式: 缩短(13s) + 音节匹配 + clean studio source
🟡 P1 (1 周内)
| 项目 | 效果 |
|---|---|
| ECAPA-TDNN SECS 引入 | C 维度精度 (MFCC proxy 替换) |
| UTMOS / Sing-MOS predictor | D 自然度客观化 |
| Phrase-aware aligner | A·D 同时 (音节均分 X) |
| Suno API → 韩语 source | A·E 同时 (韩语 vocal source pool) |
🟠 P2 (中期,需验证)
| 项目 | 效果 | 风险 |
|---|---|---|
| Vevo1.5 fine-tune (Track A) | A·B·E 全部 | 训练结果未验证 |
| TCSinger2 pivot 再检讨 | 表现增强可能 | stack 复杂、ceiling 风险 |
| F5-TTS / CosyVoice2 SVS adapter | A 发音 | adapter 缺失 |
| SVC 后处理 (RVC/SoulX) | C 音色 | end-to-end CER 需测量 |
🔴 P3 (长期,范式转换)
- 自研 SVS 模型训练 → 验证过的外部 base 更有利 (Naia 核心理念)
- Subjective MOS listening test → 绝对 ground truth
- Suno + 自研 cover 流水线商业化 → 「歌唱 AI 服务」Track D
6. 下一个决策点
- Track A 完成时 → 用本 framework 再评估,测量改善幅度
- 改善 < 20% → 弃 Vevo1.5 base,再考虑 TCSinger2 或 F5-TTS
- 改善 ≥ 30% → 正式 fine-tune + Track D 服务化
- 用户 gate = Track A 结果试听 + 5 维 metric 同步检查后决定
7. naia-sing 32 天研究日志
基于 git history — 无幻觉。真正开始 = 2026-04-25 (一个月的 history)。
2026-04-25 ─ 开始: project setup + RVC pipeline scripts.
2026-04-26 ─ source data + cross-lingual cover pipeline + IP groundwork.
2026-04-28 ─ 3-frontier 作词 + 韩语 SVS 验证 + 通话 ref voice pipeline.
2026-05-15 ─ DSKR (DiffSinger Korean) + AI-Hub 465 韩语 SVS 训练栈确定.
2026-05-15 ─ IO bottleneck 根本解决 — pickle 13x 轻量 + HDD→SSD (避免 58s/step).
2026-05-16 ─ 工作栈确定 — DSKR+CSD 迁移 → RVC swap. 用户验证 OK.
2026-05-16 ─ Vocoder 上限反驳 + 延长训练 300k→500k.
2026-05-16 ─ 延长训练 overfit 反驳 — best=S_300000 锁定.
2026-05-18 ─ BigVGAN 作 DSKR 默认 vocoder + aihubshell 密钥安全补丁.
2026-05-19 ─ DSKR S_300000 再现上限实在确认 (MCD37 vs 他曲 48).
2026-05-19 ─ TCSinger 2 韩语 SVS 开始 → PAUSED @ VAE epoch 395.
2026-05-21 ─ R3 对抗评审综合 + naia-sing 资源 gate 暂停.
2026-05-26 ─ TCSinger2 终结 → Vevo1.5 韩语 SVS 发现.
2026-05-26 ─ Korean singing dataset 247h 完成 (GTSinger + AI-Hub 465).
2026-05-26 ─ BASE STATE SNAPSHOT — fine-tune 前 baseline lock.
2026-05-26 ─ 3 AI 交叉评审 (codex+gemini+opencode) + Reality Check.
2026-05-26 ─ Track A Phase 1 AR smoke PASS + Phase 2 自动 wrapper.
2026-05-26 ─ Stage 别 VRAM 测量 + 5 翻唱 batch + 10 anime OST 60s.
2026-05-26 ─ Critical 发现: Vevo melody_control = source vocal phoneme 依赖.
2026-05-26 ─ AI-Hub 8 short refs 流派匹配 batch + ffmpeg loudnorm 后处理.
2026-05-27 ─ 本报告: 5 维评估 framework + 23 曲 baseline + Hard Gate.
2026-05-27 ─ Framework valid 确认 + Top 10 合集视频.
约 32 天:
- 5 种不同 SVS 栈试用 (RVC → DSKR → SoulX → TCSinger2 → Vevo1.5)
- 1 个 ceiling 到达 (DSKR S_300000) + 1 个 paused (TCSinger2 VAE) + 1 个 dropped (RVC pure)
- 现在 = Vevo1.5 外部 base + Track A 247h KO fine-tune 进行中
→ 自研模型 X,通过验证过的外部 base + 我们的栈 (记忆/隐私/RAG/本地 serving) 实现差异化。Naia 核心理念,2026-05-15 范式 lock。
诚实的局限
本文 不是 base 良好的报告。而是 客观测量 base 处于服务 0% 可能水平的报告。我们获得了与人试听排名一致的 metric framework — 一个诚实地检查训练是否有效的工具。这就是本文的意义。
Track A 训练完成后,将用相同 23 曲再评估并定量报告改善幅度。
