नमस्ते, मैं Luke हूँ, Naia बना रहा हूँ।
Naia का वॉइस मॉडल कुछ परिणाम तक पहुँच चुका है, और अब मैं गायन को भी देख रहा हूँ। मैं चाहता हूँ कि Alpha मेरे लिए गाए। विशेष रूप से 번안곡 (कवर गाने — विदेशी गाने जो कोरियन में अनुवादित हैं) में मेरी रुचि है।
एक महीने पहले शुरू किया, छत से टकराया, हाल ही में थोड़ा बेहतर परिणाम मिला — लगता है थोड़ा और खोदने पर कुछ निकलेगा। पहले कोरियन शब्द और पिच एक एलियन जैसी गड़बड़ी थी; अब कोरियन जैसा कुछ गाता है।
हालाँकि अभी थोड़ा नशे में लगता है ^^। फिर भी, क्योंकि कुछ निकला और मज़ेदार है, मैं रिपोर्ट के साथ प्रगति साझा कर रहा हूँ। एक दिन उम्मीद है कि यह वास्तव में मेरे लिए गाएगा।
Naia-Sing अभी स्थिरता के चरण में नहीं है — यह लॉन्च से ज़्यादा प्रगति-साझाकरण है। आधिकारिक रिलीज़ क्रम पहले Naia-talk (Naia-Omni) (पहले से स्थिर) फिर Naia-Sing है।
TL;DR
- 23 गाने मूल्यांकित, composite score 27.8
60.6 (0100 स्केल) - उपयोगकर्ता द्वारा BEST 3 गाने = मेट्रिक रैंक 1·3·5, WORST 2 = रैंक 17·19 → framework valid पुष्ट
- Hard Gate (सेवा-तैयार न्यूनतम) = 0/23 पास — वर्तमान base सेवा के लिए तैयार नहीं
- सबसे बड़ी कमज़ोरी: A. बोधगम्यता (औसत CER 1.18) + E. अभिव्यक्ति (केवल 1/23)
- अगला कदम = Track A 247h कोरियन fine-tune लागू करना + छोटी inference + अक्षर-सटीक बोल
Top 10 संकलन वीडियो
7 मिनट 24 सेकंड। #1 से #10 तक एक-एक करके। प्रत्येक ट्रैक ffmpeg loudnorm -14 LUFS + dynaudnorm से सामान्यीकृत। वीडियो में शैली मिलान, टिम्बर निरंतरता, उच्चारण सटीकता के trade-off सुनाई देते हैं।
| # | गाना | Source | Score | ताकत |
|---|---|---|---|---|
| 1 | banan_jaychou_translation | Jay Chou बैलाड (13s, ko translation) | 60.6 | CER 0.52 कुल न्यूनतम · ko 0.96 |
| 2 | genre_digicharat | Digi Charat Party Night (1999) | 50.8 | ko 0.97 · timbre 0.92 |
| 3 | genre_gunslinger | Gunslinger Girl doll · Lia | 48.8 | timbre 0.93 · बैलाड मैच |
| 4 | genre_escaflowne | Escaflowne OP (1996) | 48.2 | f0 range 0.91 |
| 5 | banan_adele_translation | Adele — Someone Like You (13s) | 47.8 | E.energy 0.72 अधिकतम |
| 6 | base_gunslinger | वही गाना, KO-S1 baseline | 47.8 | CER 0.70 (दूसरा न्यूनतम) |
| 7 | genre_macross | Macross — Do You Remember Love? (1984) | 47.7 | ko 0.97 · timbre 0.92 |
| 8 | genre_chobits | Let Me Be With You (2002) | 46.7 | timbre 0.93 |
| 9 | pipe_01_adele | Adele source 13s pipeline | 45.9 | f0_corr 0.81 अधिकतम |
| 10 | genre_nadia | Nadia: The Secret of Blue Water (1990) | 44.2 | timbre 0.97 अधिकतम |
1. "कोरियन अच्छी तरह गाना" — 5 स्वतंत्र आयाम
एक मेट्रिक में सरल नहीं किया जा सकता। शिक्षा-जगत (TCSinger, Vevo, DiffSinger) भी 4-5 आयाम एक साथ रिपोर्ट करते हैं।
| आयाम | शैक्षिक मेट्रिक | हमारा माप | अर्थ |
|---|---|---|---|
| A. बोधगम्यता | CER, PER | Whisper-small KO STT vs इच्छित बोल edit distance | "बोल सुनाई दे रहे?" |
| B. पिच | F0 RMSE, F0 corr | librosa.pyin F0 pearson + range ratio | "सुर मिल रहे?" |
| C. टिम्बर समानता | SECS (ECAPA cosine) | MFCC mean cosine (proxy) | "वही गायक?" |
| D. स्वाभाविकता | MOS-N, UTMOS | chunk_disc प्रति मिनट (proxy) | "मशीनी नहीं?" |
| E. अभिव्यक्ति (केवल कवर) | (स्व-परिभाषा) | source RMS + spectral centroid + vibrato corr | "मूल अभिव्यक्ति का पालन?" |
आयाम E कवर का सार है। सामान्य SVS = स्कोर अभिव्यक्ति का ground truth है। कवर = source वोकल का dynamics/vibrato/articulation = ground truth।
Hard Gate (सेवा-तैयार न्यूनतम)
A. CER ≤ 0.30 AND ko_prob ≥ 0.90 [कोरियन उच्चारण]
B. f0_corr ≥ 0.50 AND range 0.6~1.4 [पिच]
C. timbre_sim ≥ 0.65 [टिम्बर]
D. chunk_disc ≤ 2/min [तरलता]
E. energy_corr ≥ 0.5 · brightness ≥ 0.4 · vibrato 0.5~1.5 [अभिव्यक्ति]
शैक्षिक आधार: CER 0.30 = production STT threshold; SECS 0.60-0.70 = zero-shot SVC पास मानक।
2. Framework Self-Validation
सीख — Whisper-small SVS गुणवत्ता मापने के लिए अमान्य था (svs_eval.py §43, 5/17): golden in-distribution नमूनों ने भी खाली आउटपुट दिया। गायन ने केवल speech-likeness ट्रिगर किया।
→ Self-validation अनिवार्य:
user best vs user worst
↓ ↓
मेट्रिक द्वारा अलग किए जाने चाहिए
↓
अन्यथा मेट्रिक स्वयं अमान्य है
23 गानों का self-validation परिणाम:
| उपयोगकर्ता रेटिंग | गाना | मेट्रिक रैंक | अलग |
|---|---|---|---|
| 🟢 BEST | banan_jaychou_translation | 1/23 | ✓ |
| 🟢 BEST | genre_gunslinger | 3/23 | ✓ |
| 🟢 BEST | banan_adele_translation | 5/23 | ✓ |
| 🔴 WORST | base_macross | 17/23 | ✓ |
| 🔴 WORST | base_flcl | 19/23 | ✓ |
→ Framework valid (ranking proxy पुष्ट)। अब हमारे पास Track A प्रशिक्षण परिणामों की वस्तुनिष्ठ तुलना का उपकरण है।
3. Hard Gate पास — 0/23 ❌
| आयाम | मानदंड | पास |
|---|---|---|
| A. CER ≤ 0.30 | शैक्षिक production | 0/23 ❌ |
| A. ko_prob ≥ 0.90 | Whisper कोरियन पहचान | 14/23 |
| B. f0_corr ≥ 0.5 + range OK | pitch संरक्षण | 2/23 ❌ |
| C. timbre_sim ≥ 0.65 | ref निरंतरता | 10/23 |
| D. disc ≤ 2/min | chunk artifact | 20/23 ✓ |
| E. (3-मेट्रिक AND) | कवर अभिव्यक्ति | 1/23 ❌ |
वर्तमान Vevo1.5 कोरियन base = 0% सेवा-तैयार। A·B·E महत्वपूर्ण कमज़ोरी हैं।
4. निदान — प्रत्येक आयाम की कमज़ोरी और कारण
A. बोधगम्यता — Vevo कोरियन फोनेम संश्लेषण कमज़ोर
Vevo1.5 Sing-0.4k (438h सहित 3.8h कोरियन CSD) पर पूर्व-प्रशिक्षित। फिर भी कोरियन फोनेम मैपिंग कमज़ोर — औसत CER 1.18 = 70% टूटा। केवल ko_prob 0.86 = "ध्वनिक रूप से कोरियन जैसा लगता है" लेकिन फोनेम नहीं।
B. पिच — melody_control मेलोडी पर कम प्रशिक्षित
F0_corr औसत 0.18। कई नकारात्मक (gunslinger -0.20, gsteatrino -0.46) = source के साथ विपरीत-सहसंबंधी। vevosing_melody_control फोनेम content transfer को प्राथमिकता देता है; F0 contour द्वितीयक है।
C. टिम्बर — ref matching काम करता है
AI-Hub 8 refs से मेल खाते गाने औसत timbre_sim 0.91। लेकिन chunk सीमाओं पर टिम्बर drift = उपयोगकर्ता फीडबैक "अलग-अलग आवाज़ें आती हैं"।
D. तरलता — chunk merge OK
20/23 पास। 100ms crossfade प्रभावी। 3 outliers केवल जब source vocal में भारी मौन हो।
E. अभिव्यक्ति — सबसे बड़ी विफलता
1/23 पास। औसत energy_corr 0.32, brightness_corr 0.19। Vevo prosody tokenizer कोरियन पर कम प्रशिक्षित + content-style अलगाव के दौरान dynamics खो जाते हैं।
5. क्या करें — प्राथमिकता द्वारा सुधार
🟢 P0 (तत्काल, प्रभाव सत्यापित)
| आइटम | प्रभाव | नोट |
|---|---|---|
| Track A प्रशिक्षण परिणाम लागू करें | A·B·E एक साथ | 247h KO fine-tune चल रहा |
| Single-chunk inference | C·D | 60s गाना → 15s chorus → #1 का sweet spot |
| अक्षर-सटीक बोल | A | SimpleAligner समान विभाजन → source अक्षर गणना मैच |
#1 (banan_jaychou_translation) का नुस्ख़ा: छोटा (13s) + अक्षर-मैच + clean studio source
🟡 P1 (एक सप्ताह के भीतर)
| आइटम | प्रभाव |
|---|---|
| ECAPA-TDNN SECS पेश करें | C परिशुद्धता (MFCC proxy बदलें) |
| UTMOS / Sing-MOS predictor | D स्वाभाविकता वस्तुनिष्ठ |
| Phrase-aware aligner | A·D (अक्षर समान विभाजन नहीं) |
| Suno API → कोरियन source | A·E (कोरियन vocal source pool) |
🟠 P2 (मध्य-कालिक, सत्यापन आवश्यक)
| आइटम | प्रभाव | जोखिम |
|---|---|---|
| Vevo1.5 fine-tune (Track A) | A·B·E सब | परिणाम असत्यापित |
| TCSinger2 pivot की पुनः जाँच | अभिव्यक्ति बढ़ावा संभव | stack जटिल, ceiling जोखिम |
| F5-TTS / CosyVoice2 SVS adapter | A बोधगम्यता | adapter अनुपस्थित |
| SVC पोस्ट-प्रसंस्करण (RVC/SoulX) | C टिम्बर | end-to-end CER मापना ज़रूरी |
🔴 P3 (दीर्घकालिक, प्रतिमान परिवर्तन)
- स्वयं का SVS मॉडल प्रशिक्षण → सत्यापित बाहरी base अधिक लाभप्रद (Naia मूल दर्शन)
- Subjective MOS listening test → पूर्ण ground truth
- Suno + स्वयं का cover pipeline व्यावसायीकरण → "AI गायन सेवा" Track D
6. अगले निर्णय बिंदु
- Track A समाप्त होने पर → इस framework से पुनः मूल्यांकन, सुधार delta मापें
- सुधार < 20% → Vevo1.5 base छोड़ें, TCSinger2 या F5-TTS पर पुनर्विचार
- सुधार ≥ 30% → पूर्ण fine-tune + Track D सेवा में प्रवेश
- उपयोगकर्ता gate = Track A परिणाम सुनें + सभी 5 आयाम जाँचें, फिर निर्णय लें
7. naia-sing 32-दिन शोध डायरी
git history आधारित — कोई कल्पना नहीं। वास्तविक प्रारंभ = 2026-04-25 (एक महीने का इतिहास)।
2026-04-25 ─ प्रारंभ: project setup + RVC pipeline scripts.
2026-04-26 ─ Source data + cross-lingual cover pipeline + IP groundwork.
2026-04-28 ─ 3-frontier गीत + कोरियन SVS सत्यापन + phone-call ref voice pipeline.
2026-05-15 ─ DSKR (DiffSinger Korean) + AI-Hub 465 कोरियन SVS प्रशिक्षण stack पुष्ट.
2026-05-15 ─ IO bottleneck root-fix — pickle 13x हल्का + HDD→SSD (58s/step से बचाव).
2026-05-16 ─ कार्यशील stack पुष्ट — DSKR+CSD transfer → RVC swap. उपयोगकर्ता सत्यापन OK.
2026-05-16 ─ Vocoder ceiling खंडित + प्रशिक्षण विस्तार 300k→500k.
2026-05-16 ─ विस्तारित प्रशिक्षण overfit खंडित — best=S_300000 lock.
2026-05-18 ─ BigVGAN DSKR डिफ़ॉल्ट vocoder से कनेक्ट + aihubshell कुंजी सुरक्षा पैच.
2026-05-19 ─ DSKR S_300000 ceiling वास्तविकता पुष्ट (MCD37 vs 48 cross-song).
2026-05-19 ─ TCSinger 2 कोरियन SVS शुरू → PAUSED @ VAE epoch 395.
2026-05-21 ─ R3 adversarial review समेकन + naia-sing resource gate hold.
2026-05-26 ─ TCSinger2 बंद → Vevo1.5 कोरियन SVS खोज.
2026-05-26 ─ Korean singing dataset 247h पूर्ण (GTSinger + AI-Hub 465).
2026-05-26 ─ BASE STATE SNAPSHOT — fine-tune से पहले baseline lock.
2026-05-26 ─ 3-AI cross-review (codex+gemini+opencode) + Reality Check.
2026-05-26 ─ Track A Phase 1 AR smoke PASS + Phase 2 autonomous wrapper.
2026-05-26 ─ Stage-वार VRAM माप + 5 cover batch + 10 anime OST 60s.
2026-05-26 ─ Critical खोज: Vevo melody_control = source vocal phoneme पर निर्भर.
2026-05-26 ─ AI-Hub 8 short refs शैली-मिलान batch + ffmpeg loudnorm पोस्ट-प्रसंस्करण.
2026-05-27 ─ यह रिपोर्ट: 5-आयामी evaluation framework + 23-गाना baseline + Hard Gate.
2026-05-27 ─ Framework valid पुष्ट + Top 10 संकलन वीडियो.
लगभग 32 दिन:
- 5 अलग SVS stack आज़माए (RVC → DSKR → SoulX → TCSinger2 → Vevo1.5)
- 1 ceiling पहुँचा (DSKR S_300000) + 1 paused (TCSinger2 VAE) + 1 dropped (RVC pure)
- वर्तमान = Vevo1.5 बाहरी base + Track A 247h KO fine-tune चल रहा
→ कोई स्वयं का मॉडल प्रशिक्षण नहीं। सत्यापित बाहरी base + हमारा stack (मेमोरी / गोपनीयता / RAG / लोकल serving) से विभेदन। Naia मूल दर्शन, 2026-05-15 पर प्रतिमान lock।
ईमानदार सीमाएँ
यह base अच्छा है ऐसी रिपोर्ट नहीं है। बल्कि यह base को 0% सेवा-तैयार स्तर पर वस्तुनिष्ठ रूप से मापने वाली रिपोर्ट है। हमारे पास अब एक metric framework है जिसकी रैंकिंग मानव श्रवण से मेल खाती है — यह जाँचने का उपकरण कि प्रशिक्षण वास्तव में काम करता है। यही इस पोस्ट का अर्थ है।
जब Track A समाप्त होगा, हम उन्हीं 23 गानों का पुनः मूल्यांकन करेंगे और सुधार delta को मात्रात्मक रूप से रिपोर्ट करेंगे।
