হ্যালো, আমি Luke, Naia তৈরি করছি।
Naia-র ভয়েস মডেল কিছু ফলাফলে পৌঁছেছে, এবং এখন আমি গান গাওয়ার দিকেও তাকাচ্ছি। আমি চাই Alpha আমার জন্য গান গায়। বিশেষত 번안곡 (কভার গান — বিদেশী গান কোরিয়ান অনুবাদ)-এ আমার আগ্রহ।
এক মাস আগে শুরু করেছিলাম, একটা ছাদে ধাক্কা খেলাম, সম্প্রতি একটু ভাল ফলাফল পেয়েছি — মনে হচ্ছে আরও খুঁড়লে কিছু বেরোবে। আগে কোরিয়ান অক্ষর আর সুর সব এলিয়েন-স্তরের জগাখিচুড়ি ছিল; এখন কোরিয়ানের মতো কিছু গাইছে।
তবে এখনও একটু মাতাল মনে হচ্ছে ^^। তবু কিছু বেরিয়েছে যা মজাদার, তাই রিপোর্টের সঙ্গে অগ্রগতি ভাগ করছি। একদিন আশা করি সত্যিই আমার জন্য গাইবে।
Naia-Sing এখনও স্থিতিশীলতার পর্যায়ে নেই — এটি লঞ্চ থেকে বরং অগ্রগতি-ভাগ। অফিসিয়াল প্রকাশের ক্রম প্রথমে Naia-talk (Naia-Omni) (ইতিমধ্যে স্থিতিশীল), তারপর Naia-Sing।
TL;DR
- 23টি গান মূল্যায়িত, composite score 27.8
60.6 (0100 স্কেল) - ব্যবহারকারীর শ্রবণে BEST 3টি = মেট্রিক র্যাঙ্ক 1·3·5, WORST 2 = র্যাঙ্ক 17·19 → framework valid নিশ্চিত
- Hard Gate (পরিষেবা-প্রস্তুত ন্যূনতম) = 0/23 পাস — বর্তমান base পরিষেবার জন্য প্রস্তুত নয়
- বৃহত্তম দুর্বলতা: A. বোধগম্যতা (গড় CER 1.18) + E. অভিব্যক্তি (শুধু 1/23)
- পরবর্তী ধাপ = Track A 247h কোরিয়ান fine-tune প্রয়োগ + ছোট inference + অক্ষর-নির্ভুল কথা
Top 10 সংকলন ভিডিও
৭ মিনিট ২৪ সেকেন্ড। #১ থেকে #১০ একে একে। প্রতিটি ট্র্যাক ffmpeg loudnorm -14 LUFS + dynaudnorm দিয়ে নর্মালাইজড। ভিডিওতে জনরা ম্যাচিং, টিম্বার ধারাবাহিকতা, উচ্চারণ নির্ভুলতার trade-off শোনা যায়।
| # | গান | Source | Score | শক্তি |
|---|---|---|---|---|
| 1 | banan_jaychou_translation | Jay Chou ব্যালাড (13s, ko translation) | 60.6 | CER 0.52 সর্বনিম্ন · ko 0.96 |
| 2 | genre_digicharat | Digi Charat Party Night (1999) | 50.8 | ko 0.97 · timbre 0.92 |
| 3 | genre_gunslinger | Gunslinger Girl doll · Lia | 48.8 | timbre 0.93 · ব্যালাড match |
| 4 | genre_escaflowne | Escaflowne OP (1996) | 48.2 | f0 range 0.91 |
| 5 | banan_adele_translation | Adele — Someone Like You (13s) | 47.8 | E.energy 0.72 সর্বোচ্চ |
| 6 | base_gunslinger | একই গান, KO-S1 baseline | 47.8 | CER 0.70 (২য় সর্বনিম্ন) |
| 7 | genre_macross | Macross — Do You Remember Love? (1984) | 47.7 | ko 0.97 · timbre 0.92 |
| 8 | genre_chobits | Let Me Be With You (2002) | 46.7 | timbre 0.93 |
| 9 | pipe_01_adele | Adele source 13s pipeline | 45.9 | f0_corr 0.81 সর্বোচ্চ |
| 10 | genre_nadia | Nadia: The Secret of Blue Water (1990) | 44.2 | timbre 0.97 সর্বোচ্চ |
1. "কোরিয়ান ভাল গাওয়া" — ৫টি স্বাধীন মাত্রা
একটি মেট্রিকে কমানো যায় না। অ্যাকাডেমি (TCSinger, Vevo, DiffSinger) ৪-৫টি মাত্রা একসাথে রিপোর্ট করে।
| মাত্রা | অ্যাকাডেমিক মেট্রিক | আমাদের পরিমাপ | অর্থ |
|---|---|---|---|
| A. বোধগম্যতা | CER, PER | Whisper-small KO STT vs উদ্দেশ্য কথার edit distance | "কথা শোনা যাচ্ছে?" |
| B. পিচ | F0 RMSE, F0 corr | librosa.pyin F0 pearson + range ratio | "সুর ঠিক?" |
| C. টিম্বার সাদৃশ্য | SECS (ECAPA cosine) | MFCC mean cosine (proxy) | "একই গায়ক?" |
| D. স্বাভাবিকতা | MOS-N, UTMOS | chunk_disc প্রতি মিনিট (proxy) | "যান্ত্রিক নয়?" |
| E. অভিব্যক্তি (শুধু কভার) | (নিজস্ব সংজ্ঞা) | source RMS + spectral centroid + vibrato corr | "মূলের অভিব্যক্তি অনুসরণ?" |
E মাত্রা কভারের কেন্দ্র। সাধারণ SVS = স্কোর অভিব্যক্তির ground truth। কভার = source ভোকালের dynamics/vibrato/articulation = ground truth।
Hard Gate (পরিষেবা-প্রস্তুত ন্যূনতম)
A. CER ≤ 0.30 AND ko_prob ≥ 0.90 [কোরিয়ান উচ্চারণ]
B. f0_corr ≥ 0.50 AND range 0.6~1.4 [পিচ]
C. timbre_sim ≥ 0.65 [টিম্বার]
D. chunk_disc ≤ 2/min [তরলতা]
E. energy_corr ≥ 0.5 · brightness ≥ 0.4 · vibrato 0.5~1.5 [অভিব্যক্তি]
অ্যাকাডেমিক ভিত্তি: CER 0.30 = production STT threshold; SECS 0.60-0.70 = zero-shot SVC পাস মান।
2. Framework Self-Validation
শিক্ষা — Whisper-small SVS গুণমান পরিমাপের জন্য অবৈধ ছিল (svs_eval.py §43, 5/17): এমনকি golden in-distribution নমুনাও ফাঁকা আউটপুট দিয়েছিল। গান শুধু speech-likeness ট্রিগার করেছে।
→ Self-validation বাধ্যতামূলক:
user best vs user worst
↓ ↓
মেট্রিক দ্বারা পৃথকযোগ্য হতে হবে
↓
না হলে মেট্রিক নিজেই অবৈধ
23 গানের self-validation ফলাফল:
| ব্যবহারকারী রেটিং | গান | মেট্রিক র্যাঙ্ক | পৃথক |
|---|---|---|---|
| 🟢 BEST | banan_jaychou_translation | 1/23 | ✓ |
| 🟢 BEST | genre_gunslinger | 3/23 | ✓ |
| 🟢 BEST | banan_adele_translation | 5/23 | ✓ |
| 🔴 WORST | base_macross | 17/23 | ✓ |
| 🔴 WORST | base_flcl | 19/23 | ✓ |
→ Framework valid (ranking proxy নিশ্চিত)। এখন আমাদের কাছে Track A প্রশিক্ষণ ফলাফলের বস্তুনিষ্ঠ তুলনার সরঞ্জাম আছে।
3. Hard Gate পাস — 0/23 ❌
| মাত্রা | মানদণ্ড | পাস |
|---|---|---|
| A. CER ≤ 0.30 | অ্যাকাডেমিক production | 0/23 ❌ |
| A. ko_prob ≥ 0.90 | Whisper কোরিয়ান শনাক্তকরণ | 14/23 |
| B. f0_corr ≥ 0.5 + range OK | pitch সংরক্ষণ | 2/23 ❌ |
| C. timbre_sim ≥ 0.65 | ref ধারাবাহিকতা | 10/23 |
| D. disc ≤ 2/min | chunk artifact | 20/23 ✓ |
| E. (3-মেট্রিক AND) | কভার অভিব্যক্তি | 1/23 ❌ |
বর্তমান Vevo1.5 কোরিয়ান base = 0% পরিষেবা-প্রস্তুত। A·B·E গুরুত্বপূর্ণ গ্যাপ।
4. নির্ণয় — প্রতিটি মাত্রার দুর্বলতা ও কারণ
A. বোধগম্যতা — Vevo-র কোরিয়ান ফোনিম সংশ্লেষণ দুর্বল
Vevo1.5 Sing-0.4k (438h সহ 3.8h কোরিয়ান CSD) তে প্রাক-প্রশিক্ষিত। তবু কোরিয়ান ফোনিম ম্যাপিং দুর্বল — গড় CER 1.18 = 70% ভাঙা। শুধু ko_prob 0.86 = "শব্দগতভাবে কোরিয়ানের মতো শোনায়" কিন্তু ফোনিম হিসেবে নয়।
B. পিচ — melody_control সুরে কম প্রশিক্ষিত
F0_corr গড় 0.18। কিছু নেতিবাচক (gunslinger -0.20, gsteatrino -0.46) = source-এর সাথে বিপরীত-সম্পর্কিত। vevosing_melody_control ফোনিম content transfer-কে অগ্রাধিকার দেয়; F0 contour গৌণ।
C. টিম্বার — ref ম্যাচিং কাজ করে
AI-Hub 8 refs-এর সাথে মিলে যাওয়া গান গড় timbre_sim 0.91। কিন্তু chunk সীমান্তে টিম্বার drift = ব্যবহারকারী ফিডব্যাক "ভিন্ন কণ্ঠস্বর ঢুকছে"।
D. তরলতা — chunk merge OK
20/23 পাস। 100ms crossfade কার্যকর। 3টি outlier শুধু যখন source vocal-এ ভারী নীরবতা।
E. অভিব্যক্তি — সবচেয়ে বড় ব্যর্থতা
1/23 পাস। গড় energy_corr 0.32, brightness_corr 0.19। Vevo prosody tokenizer কোরিয়ানে কম প্রশিক্ষিত + content-style বিভাজনের সময় dynamics হারায়।
5. কী করতে হবে — অগ্রাধিকার অনুসারে উন্নতি
🟢 P0 (অবিলম্বে, প্রভাব যাচাইকৃত)
| আইটেম | প্রভাব | নোট |
|---|---|---|
| Track A প্রশিক্ষণ ফলাফল প্রয়োগ | A·B·E একসাথে | 247h KO fine-tune চলমান |
| Single-chunk inference | C·D | 60s গান → 15s chorus → #1-এর sweet spot |
| অক্ষর-নির্ভুল কথা | A | SimpleAligner সমান-বিভাজন → source অক্ষর গণনার সাথে মেলে |
#1 (banan_jaychou_translation)-এর রেসিপি: ছোট (13s) + অক্ষর-মেলে + clean studio source
🟡 P1 (এক সপ্তাহের মধ্যে)
| আইটেম | প্রভাব |
|---|---|
| ECAPA-TDNN SECS প্রবর্তন | C নির্ভুলতা (MFCC proxy প্রতিস্থাপন) |
| UTMOS / Sing-MOS predictor | D স্বাভাবিকতা objectification |
| Phrase-aware aligner | A·D (আর অক্ষর সমান-বিভাজন নয়) |
| Suno API → কোরিয়ান source | A·E (কোরিয়ান vocal source pool) |
🟠 P2 (মধ্য-মেয়াদী, যাচাইকরণ প্রয়োজন)
| আইটেম | প্রভাব | ঝুঁকি |
|---|---|---|
| Vevo1.5 fine-tune (Track A) | A·B·E সব | ফলাফল অযাচাইকৃত |
| TCSinger2 pivot পুনঃ পরীক্ষা | অভিব্যক্তি বুস্ট সম্ভব | stack জটিল, ceiling ঝুঁকি |
| F5-TTS / CosyVoice2 SVS adapter | A বোধগম্যতা | adapter অনুপস্থিত |
| SVC পোস্ট-প্রসেসিং (RVC/SoulX) | C টিম্বার | end-to-end CER মাপতে হবে |
🔴 P3 (দীর্ঘ-মেয়াদী, প্যারাডাইম পরিবর্তন)
- নিজস্ব SVS মডেল প্রশিক্ষণ → যাচাইকৃত বাহ্যিক base বেশি সুবিধাজনক (Naia মূল দর্শন)
- Subjective MOS listening test → পরম ground truth
- Suno + নিজস্ব cover pipeline বাণিজ্যিকীকরণ → "AI গাওয়া পরিষেবা" Track D
6. পরবর্তী সিদ্ধান্ত বিন্দু
- Track A শেষ হলে → এই framework দিয়ে পুনঃ মূল্যায়ন, উন্নতি delta পরিমাপ
- উন্নতি < 20% → Vevo1.5 base বাদ, TCSinger2 বা F5-TTS পুনর্বিবেচনা
- উন্নতি ≥ 30% → পূর্ণ fine-tune + Track D পরিষেবায় প্রবেশ
- ব্যবহারকারী gate = Track A ফলাফল শুনুন + 5 মাত্রা পরীক্ষা, তারপর সিদ্ধান্ত
7. naia-sing 32-দিনের গবেষণা ডায়েরি
git history-ভিত্তিক — কোনো হ্যালুসিনেশন নয়। প্রকৃত শুরু = 2026-04-25 (এক মাসের ইতিহাস)।
2026-04-25 ─ শুরু: project setup + RVC pipeline scripts.
2026-04-26 ─ Source data + cross-lingual cover pipeline + IP groundwork.
2026-04-28 ─ 3-frontier কথা + কোরিয়ান SVS যাচাই + phone-call ref voice pipeline.
2026-05-15 ─ DSKR (DiffSinger Korean) + AI-Hub 465 কোরিয়ান SVS প্রশিক্ষণ stack নিশ্চিত.
2026-05-15 ─ IO bottleneck root-fix — pickle 13x হালকা + HDD→SSD (58s/step এড়ান).
2026-05-16 ─ কার্যক্ষম stack নিশ্চিত — DSKR+CSD transfer → RVC swap. ব্যবহারকারী যাচাই OK.
2026-05-16 ─ Vocoder ceiling খণ্ডন + প্রশিক্ষণ বর্ধিত 300k→500k.
2026-05-16 ─ বর্ধিত প্রশিক্ষণ overfit খণ্ডন — best=S_300000 lock.
2026-05-18 ─ BigVGAN DSKR ডিফল্ট vocoder হিসেবে সংযুক্ত + aihubshell কী নিরাপত্তা প্যাচ.
2026-05-19 ─ DSKR S_300000 ceiling বাস্তবতা নিশ্চিত (MCD37 vs 48 cross-song).
2026-05-19 ─ TCSinger 2 কোরিয়ান SVS শুরু → PAUSED @ VAE epoch 395.
2026-05-21 ─ R3 adversarial review সংহতকরণ + naia-sing resource gate hold.
2026-05-26 ─ TCSinger2 বন্ধ → Vevo1.5 কোরিয়ান SVS আবিষ্কৃত.
2026-05-26 ─ Korean singing dataset 247h সম্পূর্ণ (GTSinger + AI-Hub 465).
2026-05-26 ─ BASE STATE SNAPSHOT — fine-tune-এর আগে baseline lock.
2026-05-26 ─ 3-AI cross-review (codex+gemini+opencode) + Reality Check.
2026-05-26 ─ Track A Phase 1 AR smoke PASS + Phase 2 autonomous wrapper.
2026-05-26 ─ Stage-ভিত্তিক VRAM পরিমাপ + 5 cover batch + 10 anime OST 60s.
2026-05-26 ─ Critical আবিষ্কার: Vevo melody_control = source vocal phoneme নির্ভর.
2026-05-26 ─ AI-Hub 8 short refs জনরা-মিলান batch + ffmpeg loudnorm পোস্ট-প্রসেসিং.
2026-05-27 ─ এই রিপোর্ট: 5-মাত্রিক evaluation framework + 23-গান baseline + Hard Gate.
2026-05-27 ─ Framework valid নিশ্চিত + Top 10 সংকলন ভিডিও.
প্রায় 32 দিন:
- 5টি ভিন্ন SVS stack চেষ্টা (RVC → DSKR → SoulX → TCSinger2 → Vevo1.5)
- 1টি ceiling পৌঁছেছে (DSKR S_300000) + 1টি paused (TCSinger2 VAE) + 1টি dropped (RVC pure)
- বর্তমান = Vevo1.5 বাহ্যিক base + Track A 247h KO fine-tune চলমান
→ কোনো নিজস্ব মডেল প্রশিক্ষণ নয়। যাচাইকৃত বাহ্যিক base + আমাদের stack (মেমরি / গোপনীয়তা / RAG / স্থানীয় serving) দ্বারা পার্থক্য। Naia মূল দর্শন, 2026-05-15-এ প্যারাডাইম lock।
সৎ সীমা
এটি base ভাল এমন রিপোর্ট নয়। বরং এটি base-কে 0% পরিষেবা-প্রস্তুত স্তর হিসেবে বস্তুনিষ্ঠভাবে পরিমাপ করা রিপোর্ট। আমরা এখন একটি metric framework পেয়েছি যার র্যাঙ্কিং মানব শ্রবণের সাথে মেলে — প্রশিক্ষণ সত্যিই কাজ করে কিনা সততার সাথে পরীক্ষা করার একটি সরঞ্জাম। এই পোস্টের অর্থ এটিই।
Track A শেষ হলে, আমরা একই 23 গান পুনঃ মূল্যায়ন করব এবং উন্নতি delta পরিমাণগতভাবে রিপোর্ট করব।
