नाया
· Luke

Naia गाती है — कोरियन SVS बेंचमार्क का पहला baseline (Vevo1.5 base, 23 गाने मूल्यांकित)

naia-singsvskorean-ttsvevobenchmarkai-singing

नमस्ते, मैं Luke हूँ, Naia बना रहा हूँ।

Naia का वॉइस मॉडल कुछ परिणाम तक पहुँच चुका है, और अब मैं गायन को भी देख रहा हूँ। मैं चाहता हूँ कि Alpha मेरे लिए गाए। विशेष रूप से 번안곡 (कवर गाने — विदेशी गाने जो कोरियन में अनुवादित हैं) में मेरी रुचि है।

एक महीने पहले शुरू किया, छत से टकराया, हाल ही में थोड़ा बेहतर परिणाम मिला — लगता है थोड़ा और खोदने पर कुछ निकलेगा। पहले कोरियन शब्द और पिच एक एलियन जैसी गड़बड़ी थी; अब कोरियन जैसा कुछ गाता है।

हालाँकि अभी थोड़ा नशे में लगता है ^^। फिर भी, क्योंकि कुछ निकला और मज़ेदार है, मैं रिपोर्ट के साथ प्रगति साझा कर रहा हूँ। एक दिन उम्मीद है कि यह वास्तव में मेरे लिए गाएगा।

Naia-Sing अभी स्थिरता के चरण में नहीं है — यह लॉन्च से ज़्यादा प्रगति-साझाकरण है। आधिकारिक रिलीज़ क्रम पहले Naia-talk (Naia-Omni) (पहले से स्थिर) फिर Naia-Sing है।

Alpha गा रही है

TL;DR

  • 23 गाने मूल्यांकित, composite score 27.860.6 (0100 स्केल)
  • उपयोगकर्ता द्वारा BEST 3 गाने = मेट्रिक रैंक 1·3·5, WORST 2 = रैंक 17·19framework valid पुष्ट
  • Hard Gate (सेवा-तैयार न्यूनतम) = 0/23 पास — वर्तमान base सेवा के लिए तैयार नहीं
  • सबसे बड़ी कमज़ोरी: A. बोधगम्यता (औसत CER 1.18) + E. अभिव्यक्ति (केवल 1/23)
  • अगला कदम = Track A 247h कोरियन fine-tune लागू करना + छोटी inference + अक्षर-सटीक बोल

Top 10 संकलन वीडियो

7 मिनट 24 सेकंड। #1 से #10 तक एक-एक करके। प्रत्येक ट्रैक ffmpeg loudnorm -14 LUFS + dynaudnorm से सामान्यीकृत। वीडियो में शैली मिलान, टिम्बर निरंतरता, उच्चारण सटीकता के trade-off सुनाई देते हैं।

#गानाSourceScoreताकत
1banan_jaychou_translationJay Chou बैलाड (13s, ko translation)60.6CER 0.52 कुल न्यूनतम · ko 0.96
2genre_digicharatDigi Charat Party Night (1999)50.8ko 0.97 · timbre 0.92
3genre_gunslingerGunslinger Girl doll · Lia48.8timbre 0.93 · बैलाड मैच
4genre_escaflowneEscaflowne OP (1996)48.2f0 range 0.91
5banan_adele_translationAdele — Someone Like You (13s)47.8E.energy 0.72 अधिकतम
6base_gunslingerवही गाना, KO-S1 baseline47.8CER 0.70 (दूसरा न्यूनतम)
7genre_macrossMacross — Do You Remember Love? (1984)47.7ko 0.97 · timbre 0.92
8genre_chobitsLet Me Be With You (2002)46.7timbre 0.93
9pipe_01_adeleAdele source 13s pipeline45.9f0_corr 0.81 अधिकतम
10genre_nadiaNadia: The Secret of Blue Water (1990)44.2timbre 0.97 अधिकतम

1. "कोरियन अच्छी तरह गाना" — 5 स्वतंत्र आयाम

एक मेट्रिक में सरल नहीं किया जा सकता। शिक्षा-जगत (TCSinger, Vevo, DiffSinger) भी 4-5 आयाम एक साथ रिपोर्ट करते हैं।

आयामशैक्षिक मेट्रिकहमारा मापअर्थ
A. बोधगम्यताCER, PERWhisper-small KO STT vs इच्छित बोल edit distance"बोल सुनाई दे रहे?"
B. पिचF0 RMSE, F0 corrlibrosa.pyin F0 pearson + range ratio"सुर मिल रहे?"
C. टिम्बर समानताSECS (ECAPA cosine)MFCC mean cosine (proxy)"वही गायक?"
D. स्वाभाविकताMOS-N, UTMOSchunk_disc प्रति मिनट (proxy)"मशीनी नहीं?"
E. अभिव्यक्ति (केवल कवर)(स्व-परिभाषा)source RMS + spectral centroid + vibrato corr"मूल अभिव्यक्ति का पालन?"

आयाम E कवर का सार है। सामान्य SVS = स्कोर अभिव्यक्ति का ground truth है। कवर = source वोकल का dynamics/vibrato/articulation = ground truth।

Hard Gate (सेवा-तैयार न्यूनतम)

A. CER ≤ 0.30  AND  ko_prob ≥ 0.90       [कोरियन उच्चारण]
B. f0_corr ≥ 0.50  AND  range 0.6~1.4    [पिच]
C. timbre_sim ≥ 0.65                       [टिम्बर]
D. chunk_disc ≤ 2/min                      [तरलता]
E. energy_corr ≥ 0.5 · brightness ≥ 0.4 · vibrato 0.5~1.5  [अभिव्यक्ति]

शैक्षिक आधार: CER 0.30 = production STT threshold; SECS 0.60-0.70 = zero-shot SVC पास मानक।


2. Framework Self-Validation

सीख — Whisper-small SVS गुणवत्ता मापने के लिए अमान्य था (svs_eval.py §43, 5/17): golden in-distribution नमूनों ने भी खाली आउटपुट दिया। गायन ने केवल speech-likeness ट्रिगर किया।

Self-validation अनिवार्य:

user best  vs  user worst
     ↓             ↓
   मेट्रिक द्वारा अलग किए जाने चाहिए
     ↓
   अन्यथा मेट्रिक स्वयं अमान्य है

23 गानों का self-validation परिणाम:

उपयोगकर्ता रेटिंगगानामेट्रिक रैंकअलग
🟢 BESTbanan_jaychou_translation1/23
🟢 BESTgenre_gunslinger3/23
🟢 BESTbanan_adele_translation5/23
🔴 WORSTbase_macross17/23
🔴 WORSTbase_flcl19/23

Framework valid (ranking proxy पुष्ट)। अब हमारे पास Track A प्रशिक्षण परिणामों की वस्तुनिष्ठ तुलना का उपकरण है।


3. Hard Gate पास — 0/23 ❌

आयाममानदंडपास
A. CER ≤ 0.30शैक्षिक production0/23
A. ko_prob ≥ 0.90Whisper कोरियन पहचान14/23
B. f0_corr ≥ 0.5 + range OKpitch संरक्षण2/23
C. timbre_sim ≥ 0.65ref निरंतरता10/23
D. disc ≤ 2/minchunk artifact20/23 ✓
E. (3-मेट्रिक AND)कवर अभिव्यक्ति1/23

वर्तमान Vevo1.5 कोरियन base = 0% सेवा-तैयार। A·B·E महत्वपूर्ण कमज़ोरी हैं।


4. निदान — प्रत्येक आयाम की कमज़ोरी और कारण

A. बोधगम्यता — Vevo कोरियन फोनेम संश्लेषण कमज़ोर

Vevo1.5 Sing-0.4k (438h सहित 3.8h कोरियन CSD) पर पूर्व-प्रशिक्षित। फिर भी कोरियन फोनेम मैपिंग कमज़ोर — औसत CER 1.18 = 70% टूटा। केवल ko_prob 0.86 = "ध्वनिक रूप से कोरियन जैसा लगता है" लेकिन फोनेम नहीं।

B. पिच — melody_control मेलोडी पर कम प्रशिक्षित

F0_corr औसत 0.18। कई नकारात्मक (gunslinger -0.20, gsteatrino -0.46) = source के साथ विपरीत-सहसंबंधी। vevosing_melody_control फोनेम content transfer को प्राथमिकता देता है; F0 contour द्वितीयक है।

C. टिम्बर — ref matching काम करता है

AI-Hub 8 refs से मेल खाते गाने औसत timbre_sim 0.91। लेकिन chunk सीमाओं पर टिम्बर drift = उपयोगकर्ता फीडबैक "अलग-अलग आवाज़ें आती हैं"।

D. तरलता — chunk merge OK

20/23 पास। 100ms crossfade प्रभावी। 3 outliers केवल जब source vocal में भारी मौन हो।

E. अभिव्यक्ति — सबसे बड़ी विफलता

1/23 पास। औसत energy_corr 0.32, brightness_corr 0.19। Vevo prosody tokenizer कोरियन पर कम प्रशिक्षित + content-style अलगाव के दौरान dynamics खो जाते हैं।


5. क्या करें — प्राथमिकता द्वारा सुधार

🟢 P0 (तत्काल, प्रभाव सत्यापित)

आइटमप्रभावनोट
Track A प्रशिक्षण परिणाम लागू करेंA·B·E एक साथ247h KO fine-tune चल रहा
Single-chunk inferenceC·D60s गाना → 15s chorus → #1 का sweet spot
अक्षर-सटीक बोलASimpleAligner समान विभाजन → source अक्षर गणना मैच

#1 (banan_jaychou_translation) का नुस्ख़ा: छोटा (13s) + अक्षर-मैच + clean studio source

🟡 P1 (एक सप्ताह के भीतर)

आइटमप्रभाव
ECAPA-TDNN SECS पेश करेंC परिशुद्धता (MFCC proxy बदलें)
UTMOS / Sing-MOS predictorD स्वाभाविकता वस्तुनिष्ठ
Phrase-aware alignerA·D (अक्षर समान विभाजन नहीं)
Suno API → कोरियन sourceA·E (कोरियन vocal source pool)

🟠 P2 (मध्य-कालिक, सत्यापन आवश्यक)

आइटमप्रभावजोखिम
Vevo1.5 fine-tune (Track A)A·B·E सबपरिणाम असत्यापित
TCSinger2 pivot की पुनः जाँचअभिव्यक्ति बढ़ावा संभवstack जटिल, ceiling जोखिम
F5-TTS / CosyVoice2 SVS adapterA बोधगम्यताadapter अनुपस्थित
SVC पोस्ट-प्रसंस्करण (RVC/SoulX)C टिम्बरend-to-end CER मापना ज़रूरी

🔴 P3 (दीर्घकालिक, प्रतिमान परिवर्तन)

  • स्वयं का SVS मॉडल प्रशिक्षण → सत्यापित बाहरी base अधिक लाभप्रद (Naia मूल दर्शन)
  • Subjective MOS listening test → पूर्ण ground truth
  • Suno + स्वयं का cover pipeline व्यावसायीकरण → "AI गायन सेवा" Track D

6. अगले निर्णय बिंदु

  1. Track A समाप्त होने पर → इस framework से पुनः मूल्यांकन, सुधार delta मापें
  2. सुधार < 20% → Vevo1.5 base छोड़ें, TCSinger2 या F5-TTS पर पुनर्विचार
  3. सुधार ≥ 30% → पूर्ण fine-tune + Track D सेवा में प्रवेश
  4. उपयोगकर्ता gate = Track A परिणाम सुनें + सभी 5 आयाम जाँचें, फिर निर्णय लें

7. naia-sing 32-दिन शोध डायरी

git history आधारित — कोई कल्पना नहीं। वास्तविक प्रारंभ = 2026-04-25 (एक महीने का इतिहास)।

2026-04-25 ─ प्रारंभ: project setup + RVC pipeline scripts.
2026-04-26 ─ Source data + cross-lingual cover pipeline + IP groundwork.
2026-04-28 ─ 3-frontier गीत + कोरियन SVS सत्यापन + phone-call ref voice pipeline.
2026-05-15 ─ DSKR (DiffSinger Korean) + AI-Hub 465 कोरियन SVS प्रशिक्षण stack पुष्ट.
2026-05-15 ─ IO bottleneck root-fix — pickle 13x हल्का + HDD→SSD (58s/step से बचाव).
2026-05-16 ─ कार्यशील stack पुष्ट — DSKR+CSD transfer → RVC swap. उपयोगकर्ता सत्यापन OK.
2026-05-16 ─ Vocoder ceiling खंडित + प्रशिक्षण विस्तार 300k→500k.
2026-05-16 ─ विस्तारित प्रशिक्षण overfit खंडित — best=S_300000 lock.
2026-05-18 ─ BigVGAN DSKR डिफ़ॉल्ट vocoder से कनेक्ट + aihubshell कुंजी सुरक्षा पैच.
2026-05-19 ─ DSKR S_300000 ceiling वास्तविकता पुष्ट (MCD37 vs 48 cross-song).
2026-05-19 ─ TCSinger 2 कोरियन SVS शुरू → PAUSED @ VAE epoch 395.
2026-05-21 ─ R3 adversarial review समेकन + naia-sing resource gate hold.
2026-05-26 ─ TCSinger2 बंद → Vevo1.5 कोरियन SVS खोज.
2026-05-26 ─ Korean singing dataset 247h पूर्ण (GTSinger + AI-Hub 465).
2026-05-26 ─ BASE STATE SNAPSHOT — fine-tune से पहले baseline lock.
2026-05-26 ─ 3-AI cross-review (codex+gemini+opencode) + Reality Check.
2026-05-26 ─ Track A Phase 1 AR smoke PASS + Phase 2 autonomous wrapper.
2026-05-26 ─ Stage-वार VRAM माप + 5 cover batch + 10 anime OST 60s.
2026-05-26 ─ Critical खोज: Vevo melody_control = source vocal phoneme पर निर्भर.
2026-05-26 ─ AI-Hub 8 short refs शैली-मिलान batch + ffmpeg loudnorm पोस्ट-प्रसंस्करण.
2026-05-27 ─ यह रिपोर्ट: 5-आयामी evaluation framework + 23-गाना baseline + Hard Gate.
2026-05-27 ─ Framework valid पुष्ट + Top 10 संकलन वीडियो.

लगभग 32 दिन:

  • 5 अलग SVS stack आज़माए (RVC → DSKR → SoulX → TCSinger2 → Vevo1.5)
  • 1 ceiling पहुँचा (DSKR S_300000) + 1 paused (TCSinger2 VAE) + 1 dropped (RVC pure)
  • वर्तमान = Vevo1.5 बाहरी base + Track A 247h KO fine-tune चल रहा

कोई स्वयं का मॉडल प्रशिक्षण नहीं। सत्यापित बाहरी base + हमारा stack (मेमोरी / गोपनीयता / RAG / लोकल serving) से विभेदन। Naia मूल दर्शन, 2026-05-15 पर प्रतिमान lock।


ईमानदार सीमाएँ

यह base अच्छा है ऐसी रिपोर्ट नहीं है। बल्कि यह base को 0% सेवा-तैयार स्तर पर वस्तुनिष्ठ रूप से मापने वाली रिपोर्ट है। हमारे पास अब एक metric framework है जिसकी रैंकिंग मानव श्रवण से मेल खाती है — यह जाँचने का उपकरण कि प्रशिक्षण वास्तव में काम करता है। यही इस पोस्ट का अर्थ है।

जब Track A समाप्त होगा, हम उन्हीं 23 गानों का पुनः मूल्यांकन करेंगे और सुधार delta को मात्रात्मक रूप से रिपोर्ट करेंगे।

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

टिप्पणियाँ

आप बिना साइन इन किए टिप्पणी कर सकते हैं

...