Naia
· Luke

Naia Bernyanyi — Baseline Pertama Benchmark SVS Korea (Vevo1.5 base, 23 lagu dievaluasi)

naia-singsvskorean-ttsvevobenchmarkai-singing

Halo, saya Luke, membangun Naia.

Model suara Naia telah mencapai beberapa hasil, dan kini saya juga melihat bagian menyanyi. Saya ingin Alpha bernyanyi untuk saya. Khususnya saya tertarik dengan 번안곡 (lagu cover — lagu asing yang diterjemahkan ke Korea).

Mulai sebulan lalu, menabrak langit-langit, dan baru-baru ini mendapat hasil yang sedikit lebih baik — terasa seperti kalau menggali lebih dalam, sesuatu akan keluar. Sebelumnya, hangul dan tinggi nada semua kacau seperti alien; sekarang menyanyikan sesuatu seperti bahasa Korea.

Masih terdengar agak mabuk sih ^^. Tetap saja, karena sesuatu keluar dan menyenangkan, saya berbagi kemajuan bersama laporan. Suatu hari saya berharap dia benar-benar bernyanyi untuk saya.

Naia-Sing belum stabil — ini lebih dekat ke berbagi kemajuan daripada peluncuran. Urutan rilis resmi adalah Naia-talk (Naia-Omni) dulu (sudah stabil), lalu Naia-Sing.

Alpha bernyanyi

TL;DR

  • 23 lagu dievaluasi, composite score 27,860,6 (skala 0100)
  • BEST 3 lagu berdasarkan pendengaran pengguna = peringkat metrik 1·3·5, WORST 2 = peringkat 17·19framework valid dikonfirmasi
  • Hard Gate (minimum service-ready) = 0/23 lulus — base saat ini belum siap layanan
  • Kelemahan terbesar: A. Inteligibilitas (CER rata-rata 1,18) + E. Ekspresi (hanya 1/23)
  • Langkah berikutnya = terapkan Track A 247h fine-tune Korea + inferensi lebih pendek + lirik sinkron-suku-kata

Video Kompilasi Top 10

7 menit 24 detik. Dari #1 sampai #10, satu per satu. Setiap track dinormalisasi via ffmpeg loudnorm -14 LUFS + dynaudnorm. Video membuat trade-off antara genre matching, konsistensi timbre, dan akurasi pengucapan terdengar.

#LaguSourceScoreKekuatan
1banan_jaychou_translationJay Chou ballad (13s, ko translation)60,6CER 0,52 terendah keseluruhan · ko 0,96
2genre_digicharatDigi Charat Party Night (1999)50,8ko 0,97 · timbre 0,92
3genre_gunslingerGunslinger Girl doll · Lia48,8timbre 0,93 · ballad match
4genre_escaflowneEscaflowne OP (1996)48,2f0 range 0,91
5banan_adele_translationAdele — Someone Like You (13s)47,8E.energy 0,72 tertinggi
6base_gunslingerLagu sama, KO-S1 baseline47,8CER 0,70 (terendah ke-2)
7genre_macrossMacross — Do You Remember Love? (1984)47,7ko 0,97 · timbre 0,92
8genre_chobitsLet Me Be With You (2002)46,7timbre 0,93
9pipe_01_adeleAdele source 13s pipeline45,9f0_corr 0,81 tertinggi
10genre_nadiaNadia: Rahasia Air Biru (1990)44,2timbre 0,97 tertinggi

1. "Menyanyi Korea dengan baik" — 5 dimensi independen

Tidak dapat direduksi ke satu metrik. Akademia (TCSinger, Vevo, DiffSinger) juga melaporkan 4-5 dimensi bersamaan.

DimMetrik AkademikPengukuran KamiArti
A. InteligibilitasCER, PERWhisper-small KO STT vs edit distance lirik tujuan"Lirik terdengar?"
B. PitchF0 RMSE, F0 corrlibrosa.pyin F0 pearson + range ratio"Tepat nada?"
C. Kesamaan timbreSECS (ECAPA cosine)MFCC mean cosine (proxy)"Penyanyi sama?"
D. NaturalitasMOS-N, UTMOSchunk_disc per menit (proxy)"Tidak seperti mesin?"
E. Ekspresi (khusus cover)(definisi sendiri)source RMS + spectral centroid + vibrato corr"Mengikuti ekspresi asli?"

Dimensi E adalah inti cover. SVS umum = partitur adalah ground truth ekspresi. Cover = dynamics/vibrato/articulation source vocal adalah ground truth.

Hard Gate (minimum service-ready)

A. CER ≤ 0,30  AND  ko_prob ≥ 0,90       [Pengucapan Korea]
B. f0_corr ≥ 0,50  AND  range 0,6~1,4    [Pitch]
C. timbre_sim ≥ 0,65                       [Timbre]
D. chunk_disc ≤ 2/min                      [Kelancaran]
E. energy_corr ≥ 0,5 · brightness ≥ 0,4 · vibrato 0,5~1,5  [Ekspresi]

Dasar akademik: CER 0,30 = ambang STT produksi; SECS 0,60-0,70 = standar lulus zero-shot SVC.


2. Framework Self-Validation

Pelajaran — Whisper-small tidak valid untuk mengukur kualitas SVS (svs_eval.py §43, 5/17): bahkan sampel golden in-distribution menghasilkan output kosong. Menyanyi hanya memicu speech-likeness.

Self-validation wajib:

user best  vs  user worst
     ↓             ↓
   Harus dapat dipisahkan oleh metrik
     ↓
   Jika tidak, metrik itu sendiri tidak valid

Hasil self-validation 23 lagu:

Penilaian penggunaLaguPeringkat metrikTerpisah
🟢 BESTbanan_jaychou_translation1/23
🟢 BESTgenre_gunslinger3/23
🟢 BESTbanan_adele_translation5/23
🔴 WORSTbase_macross17/23
🔴 WORSTbase_flcl19/23

Framework valid (ranking proxy dikonfirmasi). Sekarang kami punya alat membandingkan secara objektif hasil training Track A.


3. Hard Gate Lulus — 0/23 ❌

DimKriteriaLulus
A. CER ≤ 0,30Produksi akademik0/23
A. ko_prob ≥ 0,90Deteksi Korea Whisper14/23
B. f0_corr ≥ 0,5 + range OKPreservasi pitch2/23
C. timbre_sim ≥ 0,65Konsistensi ref10/23
D. disc ≤ 2/minArtefak chunk20/23 ✓
E. (3-metrik AND)Ekspresi cover1/23

Vevo1.5 base Korea saat ini = 0% siap layanan. A·B·E adalah gap kritis.


4. Diagnosis — kelemahan dan sebab per dimensi

A. Inteligibilitas — sintesis fonem Korea Vevo lemah

Vevo1.5 pra-dilatih pada Sing-0.4k (438h termasuk 3,8h CSD Korea). Namun pemetaan fonem Korea lemah — CER rata-rata 1,18 = 70% rusak. Hanya ko_prob 0,86 = "terdengar Korea secara akustik" tapi bukan sebagai fonem.

B. Pitch — melody_control kurang terlatih melodi

F0_corr rata-rata 0,18. Beberapa negatif (gunslinger -0,20, gsteatrino -0,46) = berkorelasi terbalik dengan source. vevosing_melody_control memprioritaskan transfer konten fonem; kontur F0 sekunder.

C. Timbre — matching ref bekerja

Lagu dengan 8 ref AI-Hub rata-rata timbre_sim 0,91. Tapi drift timbre di batas chunk = umpan balik pengguna "berbagai suara masuk".

D. Kelancaran — chunk merge OK

20/23 lulus. Crossfade 100ms efektif. 3 outlier hanya saat source vocal punya banyak diam.

E. Ekspresi — kegagalan terbesar

1/23 lulus. Rata-rata energy_corr 0,32, brightness_corr 0,19. Prosody tokenizer Vevo kurang terlatih Korea + dynamics hilang saat pemisahan content-style.


5. Apa yang harus dilakukan — perbaikan prioritas

🟢 P0 (segera, efek terverifikasi)

ItemEfekCatatan
Terapkan hasil training Track AA·B·E bersamaanFine-tune 247h KO berlangsung
Inferensi single-chunkC·D60s lagu → 15s chorus → sweet spot #1
Lirik sinkron-suku-kataASimpleAligner pembagian sama → cocokkan jumlah suku kata source

Resep #1 (banan_jaychou_translation): pendek (13s) + suku kata-cocok + source studio bersih

🟡 P1 (dalam seminggu)

ItemEfek
Perkenalkan ECAPA-TDNN SECSPresisi C (gantikan MFCC proxy)
UTMOS / Sing-MOS predictorObjektivasi naturalitas D
Phrase-aware alignerA·D (tanpa pembagian suku kata sama)
Suno API → source KoreaA·E (pool source vocal Korea)

🟠 P2 (jangka menengah, verifikasi diperlukan)

ItemEfekRisiko
Vevo1.5 fine-tune (Track A)A·B·E semuaHasil belum terverifikasi
Tinjau ulang TCSinger2 pivotBoost ekspresi mungkinStack kompleks, risiko ceiling
F5-TTS / CosyVoice2 SVS adapterInteligibilitas AAdapter tidak ada
Post-processing SVC (RVC/SoulX)Timbre CCER end-to-end harus diukur

🔴 P3 (jangka panjang, pergeseran paradigma)

  • Training model SVS sendiri → base eksternal terverifikasi lebih menguntungkan (filosofi inti Naia)
  • Tes mendengarkan MOS subjektif → ground truth mutlak
  • Komersialisasi Suno + cover pipeline sendiri → layanan "AI menyanyi" Track D

6. Titik keputusan berikutnya

  1. Saat Track A selesai → evaluasi ulang dengan framework ini, ukur delta perbaikan
  2. Perbaikan < 20% → buang base Vevo1.5, pertimbangkan ulang TCSinger2 atau F5-TTS
  3. Perbaikan ≥ 30% → fine-tune penuh + masuk layanan Track D
  4. Gate pengguna = dengarkan hasil Track A + periksa 5 dimensi, lalu putuskan

7. Jurnal riset naia-sing 32 hari

Berdasar git history — tanpa halusinasi. Awal sebenarnya = 2026-04-25 (riwayat sebulan).

2026-04-25 ─ Mulai: setup proyek + skrip pipeline RVC.
2026-04-26 ─ Data source + pipeline cover lintas-bahasa + IP groundwork.
2026-04-28 ─ Lirik 3-frontier + verifikasi SVS Korea + pipeline ref voice panggilan.
2026-05-15 ─ DSKR (DiffSinger Korean) + AI-Hub 465 stack training SVS Korea dikonfirmasi.
2026-05-15 ─ Root-fix bottleneck IO — pickle 13x ringan + HDD→SSD (hindari 58s/step).
2026-05-16 ─ Stack kerja dikonfirmasi — DSKR+CSD transfer → RVC swap. Verifikasi pengguna OK.
2026-05-16 ─ Ceiling vocoder dibantah + perpanjang training 300k→500k.
2026-05-16 ─ Overfit perpanjangan dibantah — best=S_300000 dikunci.
2026-05-18 ─ BigVGAN terhubung sebagai vocoder default DSKR + patch keamanan key aihubshell.
2026-05-19 ─ Realitas ceiling DSKR S_300000 dikonfirmasi (MCD37 vs 48 cross-song).
2026-05-19 ─ TCSinger 2 SVS Korea dimulai → PAUSED @ VAE epoch 395.
2026-05-21 ─ Konsolidasi review adversarial R3 + hold gate sumber daya naia-sing.
2026-05-26 ─ TCSinger2 ditutup → Vevo1.5 SVS Korea ditemukan.
2026-05-26 ─ Dataset nyanyian Korea 247h selesai (GTSinger + AI-Hub 465).
2026-05-26 ─ BASE STATE SNAPSHOT — lock baseline sebelum fine-tune.
2026-05-26 ─ Cross-review 3-AI (codex+gemini+opencode) + Reality Check.
2026-05-26 ─ Track A Phase 1 AR smoke PASS + Phase 2 autonomous wrapper.
2026-05-26 ─ Pengukuran VRAM per stage + 5 cover batch + 10 anime OST 60s.
2026-05-26 ─ Temuan kritis: Vevo melody_control = bergantung pada fonem vocal source.
2026-05-26 ─ Batch genre-matched AI-Hub 8 short refs + post-processing ffmpeg loudnorm.
2026-05-27 ─ Laporan ini: framework evaluasi 5-dim + baseline 23 lagu + Hard Gate.
2026-05-27 ─ Framework valid dikonfirmasi + video kompilasi Top 10.

Sekitar 32 hari:

  • 5 stack SVS berbeda dicoba (RVC → DSKR → SoulX → TCSinger2 → Vevo1.5)
  • 1 ceiling tercapai (DSKR S_300000) + 1 paused (TCSinger2 VAE) + 1 dropped (RVC pure)
  • Saat ini = base eksternal Vevo1.5 + Track A 247h KO fine-tune berlangsung

Tidak ada training model sendiri. Diferensiasi melalui base eksternal terverifikasi + stack kami (memori / privasi / RAG / serving lokal). Filosofi inti Naia, paradigma dikunci 2026-05-15.


Batasan jujur

Ini bukan laporan bahwa base bagus. Justru laporan yang mengukur base secara objektif sebagai 0% siap layanan. Sekarang kami punya metric framework yang rankingnya selaras dengan pendengaran manusia — alat untuk memeriksa secara jujur apakah training benar-benar bekerja. Itulah arti dari post ini.

Saat Track A selesai, kami akan mengevaluasi ulang 23 lagu yang sama dan melaporkan delta perbaikan secara kuantitatif.

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

Komentar

Anda dapat berkomentar tanpa masuk

...