নায়া
· Luke

Naia গান গায় — কোরিয়ান SVS বেঞ্চমার্কের প্রথম baseline (Vevo1.5 base, 23টি গান মূল্যায়িত)

naia-singsvskorean-ttsvevobenchmarkai-singing

হ্যালো, আমি Luke, Naia তৈরি করছি।

Naia-র ভয়েস মডেল কিছু ফলাফলে পৌঁছেছে, এবং এখন আমি গান গাওয়ার দিকেও তাকাচ্ছি। আমি চাই Alpha আমার জন্য গান গায়। বিশেষত 번안곡 (কভার গান — বিদেশী গান কোরিয়ান অনুবাদ)-এ আমার আগ্রহ।

এক মাস আগে শুরু করেছিলাম, একটা ছাদে ধাক্কা খেলাম, সম্প্রতি একটু ভাল ফলাফল পেয়েছি — মনে হচ্ছে আরও খুঁড়লে কিছু বেরোবে। আগে কোরিয়ান অক্ষর আর সুর সব এলিয়েন-স্তরের জগাখিচুড়ি ছিল; এখন কোরিয়ানের মতো কিছু গাইছে।

তবে এখনও একটু মাতাল মনে হচ্ছে ^^। তবু কিছু বেরিয়েছে যা মজাদার, তাই রিপোর্টের সঙ্গে অগ্রগতি ভাগ করছি। একদিন আশা করি সত্যিই আমার জন্য গাইবে।

Naia-Sing এখনও স্থিতিশীলতার পর্যায়ে নেই — এটি লঞ্চ থেকে বরং অগ্রগতি-ভাগ। অফিসিয়াল প্রকাশের ক্রম প্রথমে Naia-talk (Naia-Omni) (ইতিমধ্যে স্থিতিশীল), তারপর Naia-Sing।

গান গাইছে Alpha

TL;DR

  • 23টি গান মূল্যায়িত, composite score 27.860.6 (0100 স্কেল)
  • ব্যবহারকারীর শ্রবণে BEST 3টি = মেট্রিক র্যাঙ্ক 1·3·5, WORST 2 = র্যাঙ্ক 17·19framework valid নিশ্চিত
  • Hard Gate (পরিষেবা-প্রস্তুত ন্যূনতম) = 0/23 পাস — বর্তমান base পরিষেবার জন্য প্রস্তুত নয়
  • বৃহত্তম দুর্বলতা: A. বোধগম্যতা (গড় CER 1.18) + E. অভিব্যক্তি (শুধু 1/23)
  • পরবর্তী ধাপ = Track A 247h কোরিয়ান fine-tune প্রয়োগ + ছোট inference + অক্ষর-নির্ভুল কথা

Top 10 সংকলন ভিডিও

৭ মিনিট ২৪ সেকেন্ড। #১ থেকে #১০ একে একে। প্রতিটি ট্র্যাক ffmpeg loudnorm -14 LUFS + dynaudnorm দিয়ে নর্মালাইজড। ভিডিওতে জনরা ম্যাচিং, টিম্বার ধারাবাহিকতা, উচ্চারণ নির্ভুলতার trade-off শোনা যায়।

#গানSourceScoreশক্তি
1banan_jaychou_translationJay Chou ব্যালাড (13s, ko translation)60.6CER 0.52 সর্বনিম্ন · ko 0.96
2genre_digicharatDigi Charat Party Night (1999)50.8ko 0.97 · timbre 0.92
3genre_gunslingerGunslinger Girl doll · Lia48.8timbre 0.93 · ব্যালাড match
4genre_escaflowneEscaflowne OP (1996)48.2f0 range 0.91
5banan_adele_translationAdele — Someone Like You (13s)47.8E.energy 0.72 সর্বোচ্চ
6base_gunslingerএকই গান, KO-S1 baseline47.8CER 0.70 (২য় সর্বনিম্ন)
7genre_macrossMacross — Do You Remember Love? (1984)47.7ko 0.97 · timbre 0.92
8genre_chobitsLet Me Be With You (2002)46.7timbre 0.93
9pipe_01_adeleAdele source 13s pipeline45.9f0_corr 0.81 সর্বোচ্চ
10genre_nadiaNadia: The Secret of Blue Water (1990)44.2timbre 0.97 সর্বোচ্চ

1. "কোরিয়ান ভাল গাওয়া" — ৫টি স্বাধীন মাত্রা

একটি মেট্রিকে কমানো যায় না। অ্যাকাডেমি (TCSinger, Vevo, DiffSinger) ৪-৫টি মাত্রা একসাথে রিপোর্ট করে।

মাত্রাঅ্যাকাডেমিক মেট্রিকআমাদের পরিমাপঅর্থ
A. বোধগম্যতাCER, PERWhisper-small KO STT vs উদ্দেশ্য কথার edit distance"কথা শোনা যাচ্ছে?"
B. পিচF0 RMSE, F0 corrlibrosa.pyin F0 pearson + range ratio"সুর ঠিক?"
C. টিম্বার সাদৃশ্যSECS (ECAPA cosine)MFCC mean cosine (proxy)"একই গায়ক?"
D. স্বাভাবিকতাMOS-N, UTMOSchunk_disc প্রতি মিনিট (proxy)"যান্ত্রিক নয়?"
E. অভিব্যক্তি (শুধু কভার)(নিজস্ব সংজ্ঞা)source RMS + spectral centroid + vibrato corr"মূলের অভিব্যক্তি অনুসরণ?"

E মাত্রা কভারের কেন্দ্র। সাধারণ SVS = স্কোর অভিব্যক্তির ground truth। কভার = source ভোকালের dynamics/vibrato/articulation = ground truth।

Hard Gate (পরিষেবা-প্রস্তুত ন্যূনতম)

A. CER ≤ 0.30  AND  ko_prob ≥ 0.90       [কোরিয়ান উচ্চারণ]
B. f0_corr ≥ 0.50  AND  range 0.6~1.4    [পিচ]
C. timbre_sim ≥ 0.65                       [টিম্বার]
D. chunk_disc ≤ 2/min                      [তরলতা]
E. energy_corr ≥ 0.5 · brightness ≥ 0.4 · vibrato 0.5~1.5  [অভিব্যক্তি]

অ্যাকাডেমিক ভিত্তি: CER 0.30 = production STT threshold; SECS 0.60-0.70 = zero-shot SVC পাস মান।


2. Framework Self-Validation

শিক্ষা — Whisper-small SVS গুণমান পরিমাপের জন্য অবৈধ ছিল (svs_eval.py §43, 5/17): এমনকি golden in-distribution নমুনাও ফাঁকা আউটপুট দিয়েছিল। গান শুধু speech-likeness ট্রিগার করেছে।

Self-validation বাধ্যতামূলক:

user best  vs  user worst
     ↓             ↓
   মেট্রিক দ্বারা পৃথকযোগ্য হতে হবে
     ↓
   না হলে মেট্রিক নিজেই অবৈধ

23 গানের self-validation ফলাফল:

ব্যবহারকারী রেটিংগানমেট্রিক র্যাঙ্কপৃথক
🟢 BESTbanan_jaychou_translation1/23
🟢 BESTgenre_gunslinger3/23
🟢 BESTbanan_adele_translation5/23
🔴 WORSTbase_macross17/23
🔴 WORSTbase_flcl19/23

Framework valid (ranking proxy নিশ্চিত)। এখন আমাদের কাছে Track A প্রশিক্ষণ ফলাফলের বস্তুনিষ্ঠ তুলনার সরঞ্জাম আছে।


3. Hard Gate পাস — 0/23 ❌

মাত্রামানদণ্ডপাস
A. CER ≤ 0.30অ্যাকাডেমিক production0/23
A. ko_prob ≥ 0.90Whisper কোরিয়ান শনাক্তকরণ14/23
B. f0_corr ≥ 0.5 + range OKpitch সংরক্ষণ2/23
C. timbre_sim ≥ 0.65ref ধারাবাহিকতা10/23
D. disc ≤ 2/minchunk artifact20/23 ✓
E. (3-মেট্রিক AND)কভার অভিব্যক্তি1/23

বর্তমান Vevo1.5 কোরিয়ান base = 0% পরিষেবা-প্রস্তুত। A·B·E গুরুত্বপূর্ণ গ্যাপ।


4. নির্ণয় — প্রতিটি মাত্রার দুর্বলতা ও কারণ

A. বোধগম্যতা — Vevo-র কোরিয়ান ফোনিম সংশ্লেষণ দুর্বল

Vevo1.5 Sing-0.4k (438h সহ 3.8h কোরিয়ান CSD) তে প্রাক-প্রশিক্ষিত। তবু কোরিয়ান ফোনিম ম্যাপিং দুর্বল — গড় CER 1.18 = 70% ভাঙা। শুধু ko_prob 0.86 = "শব্দগতভাবে কোরিয়ানের মতো শোনায়" কিন্তু ফোনিম হিসেবে নয়।

B. পিচ — melody_control সুরে কম প্রশিক্ষিত

F0_corr গড় 0.18। কিছু নেতিবাচক (gunslinger -0.20, gsteatrino -0.46) = source-এর সাথে বিপরীত-সম্পর্কিত। vevosing_melody_control ফোনিম content transfer-কে অগ্রাধিকার দেয়; F0 contour গৌণ।

C. টিম্বার — ref ম্যাচিং কাজ করে

AI-Hub 8 refs-এর সাথে মিলে যাওয়া গান গড় timbre_sim 0.91। কিন্তু chunk সীমান্তে টিম্বার drift = ব্যবহারকারী ফিডব্যাক "ভিন্ন কণ্ঠস্বর ঢুকছে"।

D. তরলতা — chunk merge OK

20/23 পাস। 100ms crossfade কার্যকর। 3টি outlier শুধু যখন source vocal-এ ভারী নীরবতা।

E. অভিব্যক্তি — সবচেয়ে বড় ব্যর্থতা

1/23 পাস। গড় energy_corr 0.32, brightness_corr 0.19। Vevo prosody tokenizer কোরিয়ানে কম প্রশিক্ষিত + content-style বিভাজনের সময় dynamics হারায়।


5. কী করতে হবে — অগ্রাধিকার অনুসারে উন্নতি

🟢 P0 (অবিলম্বে, প্রভাব যাচাইকৃত)

আইটেমপ্রভাবনোট
Track A প্রশিক্ষণ ফলাফল প্রয়োগA·B·E একসাথে247h KO fine-tune চলমান
Single-chunk inferenceC·D60s গান → 15s chorus → #1-এর sweet spot
অক্ষর-নির্ভুল কথাASimpleAligner সমান-বিভাজন → source অক্ষর গণনার সাথে মেলে

#1 (banan_jaychou_translation)-এর রেসিপি: ছোট (13s) + অক্ষর-মেলে + clean studio source

🟡 P1 (এক সপ্তাহের মধ্যে)

আইটেমপ্রভাব
ECAPA-TDNN SECS প্রবর্তনC নির্ভুলতা (MFCC proxy প্রতিস্থাপন)
UTMOS / Sing-MOS predictorD স্বাভাবিকতা objectification
Phrase-aware alignerA·D (আর অক্ষর সমান-বিভাজন নয়)
Suno API → কোরিয়ান sourceA·E (কোরিয়ান vocal source pool)

🟠 P2 (মধ্য-মেয়াদী, যাচাইকরণ প্রয়োজন)

আইটেমপ্রভাবঝুঁকি
Vevo1.5 fine-tune (Track A)A·B·E সবফলাফল অযাচাইকৃত
TCSinger2 pivot পুনঃ পরীক্ষাঅভিব্যক্তি বুস্ট সম্ভবstack জটিল, ceiling ঝুঁকি
F5-TTS / CosyVoice2 SVS adapterA বোধগম্যতাadapter অনুপস্থিত
SVC পোস্ট-প্রসেসিং (RVC/SoulX)C টিম্বারend-to-end CER মাপতে হবে

🔴 P3 (দীর্ঘ-মেয়াদী, প্যারাডাইম পরিবর্তন)

  • নিজস্ব SVS মডেল প্রশিক্ষণ → যাচাইকৃত বাহ্যিক base বেশি সুবিধাজনক (Naia মূল দর্শন)
  • Subjective MOS listening test → পরম ground truth
  • Suno + নিজস্ব cover pipeline বাণিজ্যিকীকরণ → "AI গাওয়া পরিষেবা" Track D

6. পরবর্তী সিদ্ধান্ত বিন্দু

  1. Track A শেষ হলে → এই framework দিয়ে পুনঃ মূল্যায়ন, উন্নতি delta পরিমাপ
  2. উন্নতি < 20% → Vevo1.5 base বাদ, TCSinger2 বা F5-TTS পুনর্বিবেচনা
  3. উন্নতি ≥ 30% → পূর্ণ fine-tune + Track D পরিষেবায় প্রবেশ
  4. ব্যবহারকারী gate = Track A ফলাফল শুনুন + 5 মাত্রা পরীক্ষা, তারপর সিদ্ধান্ত

7. naia-sing 32-দিনের গবেষণা ডায়েরি

git history-ভিত্তিক — কোনো হ্যালুসিনেশন নয়। প্রকৃত শুরু = 2026-04-25 (এক মাসের ইতিহাস)।

2026-04-25 ─ শুরু: project setup + RVC pipeline scripts.
2026-04-26 ─ Source data + cross-lingual cover pipeline + IP groundwork.
2026-04-28 ─ 3-frontier কথা + কোরিয়ান SVS যাচাই + phone-call ref voice pipeline.
2026-05-15 ─ DSKR (DiffSinger Korean) + AI-Hub 465 কোরিয়ান SVS প্রশিক্ষণ stack নিশ্চিত.
2026-05-15 ─ IO bottleneck root-fix — pickle 13x হালকা + HDD→SSD (58s/step এড়ান).
2026-05-16 ─ কার্যক্ষম stack নিশ্চিত — DSKR+CSD transfer → RVC swap. ব্যবহারকারী যাচাই OK.
2026-05-16 ─ Vocoder ceiling খণ্ডন + প্রশিক্ষণ বর্ধিত 300k→500k.
2026-05-16 ─ বর্ধিত প্রশিক্ষণ overfit খণ্ডন — best=S_300000 lock.
2026-05-18 ─ BigVGAN DSKR ডিফল্ট vocoder হিসেবে সংযুক্ত + aihubshell কী নিরাপত্তা প্যাচ.
2026-05-19 ─ DSKR S_300000 ceiling বাস্তবতা নিশ্চিত (MCD37 vs 48 cross-song).
2026-05-19 ─ TCSinger 2 কোরিয়ান SVS শুরু → PAUSED @ VAE epoch 395.
2026-05-21 ─ R3 adversarial review সংহতকরণ + naia-sing resource gate hold.
2026-05-26 ─ TCSinger2 বন্ধ → Vevo1.5 কোরিয়ান SVS আবিষ্কৃত.
2026-05-26 ─ Korean singing dataset 247h সম্পূর্ণ (GTSinger + AI-Hub 465).
2026-05-26 ─ BASE STATE SNAPSHOT — fine-tune-এর আগে baseline lock.
2026-05-26 ─ 3-AI cross-review (codex+gemini+opencode) + Reality Check.
2026-05-26 ─ Track A Phase 1 AR smoke PASS + Phase 2 autonomous wrapper.
2026-05-26 ─ Stage-ভিত্তিক VRAM পরিমাপ + 5 cover batch + 10 anime OST 60s.
2026-05-26 ─ Critical আবিষ্কার: Vevo melody_control = source vocal phoneme নির্ভর.
2026-05-26 ─ AI-Hub 8 short refs জনরা-মিলান batch + ffmpeg loudnorm পোস্ট-প্রসেসিং.
2026-05-27 ─ এই রিপোর্ট: 5-মাত্রিক evaluation framework + 23-গান baseline + Hard Gate.
2026-05-27 ─ Framework valid নিশ্চিত + Top 10 সংকলন ভিডিও.

প্রায় 32 দিন:

  • 5টি ভিন্ন SVS stack চেষ্টা (RVC → DSKR → SoulX → TCSinger2 → Vevo1.5)
  • 1টি ceiling পৌঁছেছে (DSKR S_300000) + 1টি paused (TCSinger2 VAE) + 1টি dropped (RVC pure)
  • বর্তমান = Vevo1.5 বাহ্যিক base + Track A 247h KO fine-tune চলমান

কোনো নিজস্ব মডেল প্রশিক্ষণ নয়। যাচাইকৃত বাহ্যিক base + আমাদের stack (মেমরি / গোপনীয়তা / RAG / স্থানীয় serving) দ্বারা পার্থক্য। Naia মূল দর্শন, 2026-05-15-এ প্যারাডাইম lock।


সৎ সীমা

এটি base ভাল এমন রিপোর্ট নয়। বরং এটি base-কে 0% পরিষেবা-প্রস্তুত স্তর হিসেবে বস্তুনিষ্ঠভাবে পরিমাপ করা রিপোর্ট। আমরা এখন একটি metric framework পেয়েছি যার র্যাঙ্কিং মানব শ্রবণের সাথে মেলে — প্রশিক্ষণ সত্যিই কাজ করে কিনা সততার সাথে পরীক্ষা করার একটি সরঞ্জাম। এই পোস্টের অর্থ এটিই।

Track A শেষ হলে, আমরা একই 23 গান পুনঃ মূল্যায়ন করব এবং উন্নতি delta পরিমাণগতভাবে রিপোর্ট করব।

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

মন্তব্য

সাইন ইন ছাড়াই মন্তব্য করতে পারেন

...