Halo, saya Luke, membangun Naia.
Model suara Naia telah mencapai beberapa hasil, dan kini saya juga melihat bagian menyanyi. Saya ingin Alpha bernyanyi untuk saya. Khususnya saya tertarik dengan 번안곡 (lagu cover — lagu asing yang diterjemahkan ke Korea).
Mulai sebulan lalu, menabrak langit-langit, dan baru-baru ini mendapat hasil yang sedikit lebih baik — terasa seperti kalau menggali lebih dalam, sesuatu akan keluar. Sebelumnya, hangul dan tinggi nada semua kacau seperti alien; sekarang menyanyikan sesuatu seperti bahasa Korea.
Masih terdengar agak mabuk sih ^^. Tetap saja, karena sesuatu keluar dan menyenangkan, saya berbagi kemajuan bersama laporan. Suatu hari saya berharap dia benar-benar bernyanyi untuk saya.
Naia-Sing belum stabil — ini lebih dekat ke berbagi kemajuan daripada peluncuran. Urutan rilis resmi adalah Naia-talk (Naia-Omni) dulu (sudah stabil), lalu Naia-Sing.
TL;DR
- 23 lagu dievaluasi, composite score 27,8
60,6 (skala 0100) - BEST 3 lagu berdasarkan pendengaran pengguna = peringkat metrik 1·3·5, WORST 2 = peringkat 17·19 → framework valid dikonfirmasi
- Hard Gate (minimum service-ready) = 0/23 lulus — base saat ini belum siap layanan
- Kelemahan terbesar: A. Inteligibilitas (CER rata-rata 1,18) + E. Ekspresi (hanya 1/23)
- Langkah berikutnya = terapkan Track A 247h fine-tune Korea + inferensi lebih pendek + lirik sinkron-suku-kata
Video Kompilasi Top 10
7 menit 24 detik. Dari #1 sampai #10, satu per satu. Setiap track dinormalisasi via ffmpeg loudnorm -14 LUFS + dynaudnorm. Video membuat trade-off antara genre matching, konsistensi timbre, dan akurasi pengucapan terdengar.
| # | Lagu | Source | Score | Kekuatan |
|---|---|---|---|---|
| 1 | banan_jaychou_translation | Jay Chou ballad (13s, ko translation) | 60,6 | CER 0,52 terendah keseluruhan · ko 0,96 |
| 2 | genre_digicharat | Digi Charat Party Night (1999) | 50,8 | ko 0,97 · timbre 0,92 |
| 3 | genre_gunslinger | Gunslinger Girl doll · Lia | 48,8 | timbre 0,93 · ballad match |
| 4 | genre_escaflowne | Escaflowne OP (1996) | 48,2 | f0 range 0,91 |
| 5 | banan_adele_translation | Adele — Someone Like You (13s) | 47,8 | E.energy 0,72 tertinggi |
| 6 | base_gunslinger | Lagu sama, KO-S1 baseline | 47,8 | CER 0,70 (terendah ke-2) |
| 7 | genre_macross | Macross — Do You Remember Love? (1984) | 47,7 | ko 0,97 · timbre 0,92 |
| 8 | genre_chobits | Let Me Be With You (2002) | 46,7 | timbre 0,93 |
| 9 | pipe_01_adele | Adele source 13s pipeline | 45,9 | f0_corr 0,81 tertinggi |
| 10 | genre_nadia | Nadia: Rahasia Air Biru (1990) | 44,2 | timbre 0,97 tertinggi |
1. "Menyanyi Korea dengan baik" — 5 dimensi independen
Tidak dapat direduksi ke satu metrik. Akademia (TCSinger, Vevo, DiffSinger) juga melaporkan 4-5 dimensi bersamaan.
| Dim | Metrik Akademik | Pengukuran Kami | Arti |
|---|---|---|---|
| A. Inteligibilitas | CER, PER | Whisper-small KO STT vs edit distance lirik tujuan | "Lirik terdengar?" |
| B. Pitch | F0 RMSE, F0 corr | librosa.pyin F0 pearson + range ratio | "Tepat nada?" |
| C. Kesamaan timbre | SECS (ECAPA cosine) | MFCC mean cosine (proxy) | "Penyanyi sama?" |
| D. Naturalitas | MOS-N, UTMOS | chunk_disc per menit (proxy) | "Tidak seperti mesin?" |
| E. Ekspresi (khusus cover) | (definisi sendiri) | source RMS + spectral centroid + vibrato corr | "Mengikuti ekspresi asli?" |
Dimensi E adalah inti cover. SVS umum = partitur adalah ground truth ekspresi. Cover = dynamics/vibrato/articulation source vocal adalah ground truth.
Hard Gate (minimum service-ready)
A. CER ≤ 0,30 AND ko_prob ≥ 0,90 [Pengucapan Korea]
B. f0_corr ≥ 0,50 AND range 0,6~1,4 [Pitch]
C. timbre_sim ≥ 0,65 [Timbre]
D. chunk_disc ≤ 2/min [Kelancaran]
E. energy_corr ≥ 0,5 · brightness ≥ 0,4 · vibrato 0,5~1,5 [Ekspresi]
Dasar akademik: CER 0,30 = ambang STT produksi; SECS 0,60-0,70 = standar lulus zero-shot SVC.
2. Framework Self-Validation
Pelajaran — Whisper-small tidak valid untuk mengukur kualitas SVS (svs_eval.py §43, 5/17): bahkan sampel golden in-distribution menghasilkan output kosong. Menyanyi hanya memicu speech-likeness.
→ Self-validation wajib:
user best vs user worst
↓ ↓
Harus dapat dipisahkan oleh metrik
↓
Jika tidak, metrik itu sendiri tidak valid
Hasil self-validation 23 lagu:
| Penilaian pengguna | Lagu | Peringkat metrik | Terpisah |
|---|---|---|---|
| 🟢 BEST | banan_jaychou_translation | 1/23 | ✓ |
| 🟢 BEST | genre_gunslinger | 3/23 | ✓ |
| 🟢 BEST | banan_adele_translation | 5/23 | ✓ |
| 🔴 WORST | base_macross | 17/23 | ✓ |
| 🔴 WORST | base_flcl | 19/23 | ✓ |
→ Framework valid (ranking proxy dikonfirmasi). Sekarang kami punya alat membandingkan secara objektif hasil training Track A.
3. Hard Gate Lulus — 0/23 ❌
| Dim | Kriteria | Lulus |
|---|---|---|
| A. CER ≤ 0,30 | Produksi akademik | 0/23 ❌ |
| A. ko_prob ≥ 0,90 | Deteksi Korea Whisper | 14/23 |
| B. f0_corr ≥ 0,5 + range OK | Preservasi pitch | 2/23 ❌ |
| C. timbre_sim ≥ 0,65 | Konsistensi ref | 10/23 |
| D. disc ≤ 2/min | Artefak chunk | 20/23 ✓ |
| E. (3-metrik AND) | Ekspresi cover | 1/23 ❌ |
Vevo1.5 base Korea saat ini = 0% siap layanan. A·B·E adalah gap kritis.
4. Diagnosis — kelemahan dan sebab per dimensi
A. Inteligibilitas — sintesis fonem Korea Vevo lemah
Vevo1.5 pra-dilatih pada Sing-0.4k (438h termasuk 3,8h CSD Korea). Namun pemetaan fonem Korea lemah — CER rata-rata 1,18 = 70% rusak. Hanya ko_prob 0,86 = "terdengar Korea secara akustik" tapi bukan sebagai fonem.
B. Pitch — melody_control kurang terlatih melodi
F0_corr rata-rata 0,18. Beberapa negatif (gunslinger -0,20, gsteatrino -0,46) = berkorelasi terbalik dengan source. vevosing_melody_control memprioritaskan transfer konten fonem; kontur F0 sekunder.
C. Timbre — matching ref bekerja
Lagu dengan 8 ref AI-Hub rata-rata timbre_sim 0,91. Tapi drift timbre di batas chunk = umpan balik pengguna "berbagai suara masuk".
D. Kelancaran — chunk merge OK
20/23 lulus. Crossfade 100ms efektif. 3 outlier hanya saat source vocal punya banyak diam.
E. Ekspresi — kegagalan terbesar
1/23 lulus. Rata-rata energy_corr 0,32, brightness_corr 0,19. Prosody tokenizer Vevo kurang terlatih Korea + dynamics hilang saat pemisahan content-style.
5. Apa yang harus dilakukan — perbaikan prioritas
🟢 P0 (segera, efek terverifikasi)
| Item | Efek | Catatan |
|---|---|---|
| Terapkan hasil training Track A | A·B·E bersamaan | Fine-tune 247h KO berlangsung |
| Inferensi single-chunk | C·D | 60s lagu → 15s chorus → sweet spot #1 |
| Lirik sinkron-suku-kata | A | SimpleAligner pembagian sama → cocokkan jumlah suku kata source |
Resep #1 (banan_jaychou_translation): pendek (13s) + suku kata-cocok + source studio bersih
🟡 P1 (dalam seminggu)
| Item | Efek |
|---|---|
| Perkenalkan ECAPA-TDNN SECS | Presisi C (gantikan MFCC proxy) |
| UTMOS / Sing-MOS predictor | Objektivasi naturalitas D |
| Phrase-aware aligner | A·D (tanpa pembagian suku kata sama) |
| Suno API → source Korea | A·E (pool source vocal Korea) |
🟠 P2 (jangka menengah, verifikasi diperlukan)
| Item | Efek | Risiko |
|---|---|---|
| Vevo1.5 fine-tune (Track A) | A·B·E semua | Hasil belum terverifikasi |
| Tinjau ulang TCSinger2 pivot | Boost ekspresi mungkin | Stack kompleks, risiko ceiling |
| F5-TTS / CosyVoice2 SVS adapter | Inteligibilitas A | Adapter tidak ada |
| Post-processing SVC (RVC/SoulX) | Timbre C | CER end-to-end harus diukur |
🔴 P3 (jangka panjang, pergeseran paradigma)
- Training model SVS sendiri → base eksternal terverifikasi lebih menguntungkan (filosofi inti Naia)
- Tes mendengarkan MOS subjektif → ground truth mutlak
- Komersialisasi Suno + cover pipeline sendiri → layanan "AI menyanyi" Track D
6. Titik keputusan berikutnya
- Saat Track A selesai → evaluasi ulang dengan framework ini, ukur delta perbaikan
- Perbaikan < 20% → buang base Vevo1.5, pertimbangkan ulang TCSinger2 atau F5-TTS
- Perbaikan ≥ 30% → fine-tune penuh + masuk layanan Track D
- Gate pengguna = dengarkan hasil Track A + periksa 5 dimensi, lalu putuskan
7. Jurnal riset naia-sing 32 hari
Berdasar git history — tanpa halusinasi. Awal sebenarnya = 2026-04-25 (riwayat sebulan).
2026-04-25 ─ Mulai: setup proyek + skrip pipeline RVC.
2026-04-26 ─ Data source + pipeline cover lintas-bahasa + IP groundwork.
2026-04-28 ─ Lirik 3-frontier + verifikasi SVS Korea + pipeline ref voice panggilan.
2026-05-15 ─ DSKR (DiffSinger Korean) + AI-Hub 465 stack training SVS Korea dikonfirmasi.
2026-05-15 ─ Root-fix bottleneck IO — pickle 13x ringan + HDD→SSD (hindari 58s/step).
2026-05-16 ─ Stack kerja dikonfirmasi — DSKR+CSD transfer → RVC swap. Verifikasi pengguna OK.
2026-05-16 ─ Ceiling vocoder dibantah + perpanjang training 300k→500k.
2026-05-16 ─ Overfit perpanjangan dibantah — best=S_300000 dikunci.
2026-05-18 ─ BigVGAN terhubung sebagai vocoder default DSKR + patch keamanan key aihubshell.
2026-05-19 ─ Realitas ceiling DSKR S_300000 dikonfirmasi (MCD37 vs 48 cross-song).
2026-05-19 ─ TCSinger 2 SVS Korea dimulai → PAUSED @ VAE epoch 395.
2026-05-21 ─ Konsolidasi review adversarial R3 + hold gate sumber daya naia-sing.
2026-05-26 ─ TCSinger2 ditutup → Vevo1.5 SVS Korea ditemukan.
2026-05-26 ─ Dataset nyanyian Korea 247h selesai (GTSinger + AI-Hub 465).
2026-05-26 ─ BASE STATE SNAPSHOT — lock baseline sebelum fine-tune.
2026-05-26 ─ Cross-review 3-AI (codex+gemini+opencode) + Reality Check.
2026-05-26 ─ Track A Phase 1 AR smoke PASS + Phase 2 autonomous wrapper.
2026-05-26 ─ Pengukuran VRAM per stage + 5 cover batch + 10 anime OST 60s.
2026-05-26 ─ Temuan kritis: Vevo melody_control = bergantung pada fonem vocal source.
2026-05-26 ─ Batch genre-matched AI-Hub 8 short refs + post-processing ffmpeg loudnorm.
2026-05-27 ─ Laporan ini: framework evaluasi 5-dim + baseline 23 lagu + Hard Gate.
2026-05-27 ─ Framework valid dikonfirmasi + video kompilasi Top 10.
Sekitar 32 hari:
- 5 stack SVS berbeda dicoba (RVC → DSKR → SoulX → TCSinger2 → Vevo1.5)
- 1 ceiling tercapai (DSKR S_300000) + 1 paused (TCSinger2 VAE) + 1 dropped (RVC pure)
- Saat ini = base eksternal Vevo1.5 + Track A 247h KO fine-tune berlangsung
→ Tidak ada training model sendiri. Diferensiasi melalui base eksternal terverifikasi + stack kami (memori / privasi / RAG / serving lokal). Filosofi inti Naia, paradigma dikunci 2026-05-15.
Batasan jujur
Ini bukan laporan bahwa base bagus. Justru laporan yang mengukur base secara objektif sebagai 0% siap layanan. Sekarang kami punya metric framework yang rankingnya selaras dengan pendengaran manusia — alat untuk memeriksa secara jujur apakah training benar-benar bekerja. Itulah arti dari post ini.
Saat Track A selesai, kami akan mengevaluasi ulang 23 lagu yang sama dan melaporkan delta perbaikan secara kuantitatif.
