نايا
· Luke

Naia تغني — أول baseline لمعيار SVS الكوري (Vevo1.5 base، 23 أغنية مقيّمة)

naia-singsvskorean-ttsvevobenchmarkai-singing

مرحبًا، أنا Luke أبني Naia.

حقق نموذج الصوت لـ Naia بعض النتائج، والآن أنظر أيضًا في الغناء. أريد أن تغني Alpha من أجلي. خاصة 번안곡 (أغاني الكوفر — أغانٍ أجنبية مترجمة إلى الكورية) تهمني.

بدأت قبل شهر، اصطدمت بسقف، ومؤخرًا حصلت على نتائج أفضل قليلًا — أشعر أنني إذا حفرت أكثر، سيخرج شيء ما. سابقًا كانت الحروف الكورية والنغمات بمثابة هراء فضائي؛ الآن تغني شيئًا يشبه الكورية.

لا تزال تبدو مخمورة قليلًا ^^. لكن بما أن شيئًا خرج وهو ممتع، أشارك التقدم مع التقرير. آمل أن تغني لي حقًا في يوم من الأيام.

Naia-Sing لم تستقر بعد — هذا أقرب إلى مشاركة تقدم منه إلى إطلاق. ترتيب النشر الرسمي هو Naia-talk (Naia-Omni) أولًا (مستقر بالفعل)، ثم Naia-Sing.

Alpha تغني

TL;DR

  • 23 أغنية مقيّمة، Composite score 27.860.6 (مقياس 0100)
  • أفضل 3 أغانٍ بتقييم المستخدم = رتبة المقياس 1·3·5، أسوأ 2 = رتبة 17·19framework valid مؤكد
  • Hard Gate (الحد الأدنى لجاهزية الخدمة) = 0/23 مرت — القاعدة الحالية ليست جاهزة للخدمة
  • أكبر ضعف: A. الوضوح (متوسط CER 1.18) + E. التعبير (فقط 1/23)
  • الخطوة التالية = تطبيق Track A 247h fine-tune الكوري + استدلال أقصر + كلمات بمطابقة المقاطع

فيديو تجميع Top 10

7 دقائق و24 ثانية. من #1 إلى #10، واحدة تلو الأخرى. كل مسار طبيعه عبر ffmpeg loudnorm -14 LUFS + dynaudnorm. الفيديو يجعل التنازلات بين مطابقة النوع وتناسق الجرس ودقة النطق مسموعة.

#الأغنيةSourceScoreنقطة قوة
1banan_jaychou_translationباللاد Jay Chou (13s, ko translation)60.6CER 0.52 الأدنى عمومًا · ko 0.96
2genre_digicharatDigi Charat Party Night (1999)50.8ko 0.97 · timbre 0.92
3genre_gunslingerGunslinger Girl doll · Lia48.8timbre 0.93 · باللاد match
4genre_escaflowneEscaflowne OP (1996)48.2f0 range 0.91
5banan_adele_translationAdele — Someone Like You (13s)47.8E.energy 0.72 الأعلى
6base_gunslingerنفس الأغنية، KO-S1 baseline47.8CER 0.70 (الثاني الأدنى)
7genre_macrossMacross — Do You Remember Love? (1984)47.7ko 0.97 · timbre 0.92
8genre_chobitsLet Me Be With You (2002)46.7timbre 0.93
9pipe_01_adeleAdele source 13s pipeline45.9f0_corr 0.81 الأعلى
10genre_nadiaNadia: سر المياه الزرقاء (1990)44.2timbre 0.97 الأعلى

1. «الغناء جيدًا بالكورية» — 5 أبعاد مستقلة

لا يمكن اختزاله إلى مقياس واحد. الأوساط الأكاديمية (TCSinger, Vevo, DiffSinger) أيضًا تقدم 4-5 أبعاد معًا.

بُعدمقياس أكاديميقياسناالمعنى
A. الوضوح (Intelligibility)CER, PERWhisper-small KO STT مقابل المسافة المقصودة للكلمات«هل الكلمات مسموعة؟»
B. الطبقة الصوتية (Pitch)F0 RMSE, F0 corrlibrosa.pyin F0 pearson + range ratio«هل يصيب النوتات؟»
C. تشابه الجرسSECS (ECAPA cosine)MFCC mean cosine (proxy)«نفس المغني؟»
D. الطبيعيةMOS-N, UTMOSchunk_disc في الدقيقة (proxy)«ليس آليًا؟»
E. التعبير (للكوفر فقط)(تعريف خاص)source RMS + spectral centroid + vibrato corr«هل يتبع تعبير الأصلي؟»

البعد E جوهر الكوفرات. SVS عام = النوتة هي ground truth للتعبير. الكوفر = dynamics/vibrato/articulation للصوت source = ground truth.

Hard Gate (الحد الأدنى لجاهزية الخدمة)

A. CER ≤ 0.30  AND  ko_prob ≥ 0.90       [النطق الكوري]
B. f0_corr ≥ 0.50  AND  range 0.6~1.4    [الطبقة الصوتية]
C. timbre_sim ≥ 0.65                       [الجرس]
D. chunk_disc ≤ 2/min                      [السلاسة]
E. energy_corr ≥ 0.5 · brightness ≥ 0.4 · vibrato 0.5~1.5  [التعبير]

الأساس الأكاديمي: CER 0.30 = عتبة STT للإنتاج؛ SECS 0.60-0.70 = معيار نجاح zero-shot SVC.


2. Framework Self-Validation

درس — كان Whisper-small غير صالح لقياس جودة SVS (svs_eval.py §43, 5/17): حتى عينات golden in-distribution أعطت ناتجًا فارغًا. الغناء أثار فقط speech-likeness.

التحقق الذاتي إلزامي:

user best  vs  user worst
     ↓             ↓
   يجب أن يكونا قابلين للفصل بالمقياس
     ↓
   وإلا فالمقياس نفسه باطل

نتيجة self-validation لـ 23 أغنية:

تقييم المستخدمالأغنيةرتبة المقياسمفصول
🟢 BESTbanan_jaychou_translation1/23
🟢 BESTgenre_gunslinger3/23
🟢 BESTbanan_adele_translation5/23
🔴 WORSTbase_macross17/23
🔴 WORSTbase_flcl19/23

Framework valid (ranking proxy مؤكد). لدينا الآن أداة للمقارنة الموضوعية لنتائج تدريب Track A.


3. اجتياز Hard Gate — 0/23 ❌

البعدالمعياراجتاز
A. CER ≤ 0.30إنتاج أكاديمي0/23
A. ko_prob ≥ 0.90كشف Whisper للكورية14/23
B. f0_corr ≥ 0.5 + range OKالحفاظ على pitch2/23
C. timbre_sim ≥ 0.65تناسق ref10/23
D. disc ≤ 2/minأرتيفاكت chunk20/23 ✓
E. (3-مقاييس AND)تعبير الكوفر1/23

قاعدة Vevo1.5 الكورية الحالية = 0% جاهزة للخدمة. A·B·E هي الفجوات الحرجة.


4. التشخيص — الضعف والسبب لكل بُعد

A. الوضوح — توليف فونيم الكورية لـ Vevo ضعيف

Vevo1.5 مدرَّب مسبقًا على Sing-0.4k (438س تشمل 3.8س CSD كوري). لكن mapping فونيم الكورية ضعيف — متوسط CER 1.18 = 70% مكسور. فقط ko_prob 0.86 = «يبدو كوريًا صوتيًا» لكن ليس فونيميًا.

B. الطبقة الصوتية — melody_control غير متدرب بشكل كافٍ على اللحن

F0_corr متوسط 0.18. عدة قيم سالبة (gunslinger -0.20, gsteatrino -0.46) = ارتباط عكسي مع source. vevosing_melody_control يعطي الأولوية لنقل محتوى الفونيم؛ منحنى F0 ثانوي.

C. الجرس — مطابقة ref تعمل

الأغاني مع 8 refs من AI-Hub متوسط timbre_sim 0.91. لكن انجراف الجرس عند حدود chunk = ملاحظة المستخدم «أصوات مختلفة تدخل».

D. السلاسة — دمج chunk OK

20/23 اجتازت. crossfade 100ms فعّال. 3 outliers فقط عندما يكون لدى source vocal صمت كبير.

E. التعبير — الفشل الأكبر

1/23 اجتازت. متوسط energy_corr 0.32، brightness_corr 0.19. Prosody tokenizer لـ Vevo غير متدرب بشكل كافٍ على الكورية + dynamics مفقودة أثناء فصل content-style.


5. ماذا نفعل — تحسينات مرتبة بالأولوية

🟢 P0 (فوري، التأثير مُتحقق منه)

البندالتأثيرملاحظة
تطبيق نتائج تدريب Track AA·B·E في الوقت نفسهfine-tune 247h KO جارٍ
استدلال Single-chunkC·Dأغنية 60s → 15s chorus → sweet spot لـ #1
كلمات بمطابقة المقاطعASimpleAligner تقسيم متساوٍ → مطابقة عدد مقاطع source

وصفة #1 (banan_jaychou_translation): قصير (13s) + مقاطع مطابقة + source ستوديو نظيف

🟡 P1 (خلال أسبوع)

البندالتأثير
إدخال ECAPA-TDNN SECSدقة C (يحل محل MFCC proxy)
UTMOS / Sing-MOS predictorتموضع موضوعي لطبيعية D
Phrase-aware alignerA·D (لا تقسيم متساوٍ للمقاطع)
Suno API → source كوريA·E (pool source vocal كوري)

🟠 P2 (متوسط الأجل، يتطلب التحقق)

البندالتأثيرالمخاطرة
Vevo1.5 fine-tune (Track A)A·B·E كلهاالنتيجة غير محققة
إعادة فحص TCSinger2 pivotتعزيز التعبير ممكنStack معقد، خطر سقف
F5-TTS / CosyVoice2 SVS adapterوضوح AAdapter مفقود
المعالجة اللاحقة SVC (RVC/SoulX)جرس Cيجب قياس CER من طرف إلى طرف

🔴 P3 (طويل الأجل، تحول نموذجي)

  • تدريب نموذج SVS خاص → القاعدة الخارجية المُتحقق منها أفضل (فلسفة Naia الأساسية)
  • اختبار MOS listening ذاتي → ground truth مطلقة
  • منتج Suno + cover pipeline خاص → خدمة «AI singing» Track D

6. نقاط القرار التالية

  1. عندما ينتهي Track A → إعادة التقييم بهذا الإطار، قياس delta التحسن
  2. التحسن < 20% → التخلي عن قاعدة Vevo1.5، إعادة النظر في TCSinger2 أو F5-TTS
  3. التحسن ≥ 30% → fine-tune كامل + الدخول إلى خدمة Track D
  4. بوابة المستخدم = الاستماع إلى نتائج Track A + فحص الأبعاد الخمسة، ثم اتخاذ القرار

7. سجل أبحاث naia-sing لـ 32 يومًا

استنادًا إلى git history — لا هلوسات. البداية الحقيقية = 2026-04-25 (شهر واحد من السجل).

2026-04-25 ─ البداية: إعداد المشروع + RVC pipeline scripts.
2026-04-26 ─ بيانات source + cover pipeline متعدد اللغات + IP groundwork.
2026-04-28 ─ كلمات 3-frontier + التحقق من SVS الكوري + pipeline صوت ref للهاتف.
2026-05-15 ─ تأكيد stack تدريب DSKR + AI-Hub 465 SVS كوري.
2026-05-15 ─ الإصلاح الجذري لعنق زجاجة IO — pickle 13x خفيف + HDD→SSD (يتجنب 58s/step).
2026-05-16 ─ تأكيد stack العمل — نقل DSKR+CSD → RVC swap. تحقق المستخدم OK.
2026-05-16 ─ نفي سقف vocoder + تمديد التدريب 300k→500k.
2026-05-16 ─ نفي overfit التمديد — best=S_300000 مقفل.
2026-05-18 ─ توصيل BigVGAN كـ vocoder افتراضي لـ DSKR + ترقيع أمن مفتاح aihubshell.
2026-05-19 ─ تأكيد واقع سقف DSKR S_300000 (MCD37 مقابل 48 cross-song).
2026-05-19 ─ بدء TCSinger 2 SVS كوري → PAUSED @ VAE epoch 395.
2026-05-21 ─ تجميع review R3 + hold gate موارد naia-sing.
2026-05-26 ─ إغلاق TCSinger2 → اكتشاف Vevo1.5 SVS كوري.
2026-05-26 ─ اكتمال dataset الغناء الكوري 247h (GTSinger + AI-Hub 465).
2026-05-26 ─ BASE STATE SNAPSHOT — قفل baseline قبل fine-tune.
2026-05-26 ─ 3-AI cross-review (codex+gemini+opencode) + Reality Check.
2026-05-26 ─ Track A Phase 1 AR smoke PASS + Phase 2 autonomous wrapper.
2026-05-26 ─ قياس VRAM لكل stage + 5 cover batch + 10 anime OST 60s.
2026-05-26 ─ اكتشاف حرج: Vevo melody_control = يعتمد على فونيم vocal source.
2026-05-26 ─ batch مطابقة النوع لـ AI-Hub 8 short refs + معالجة ffmpeg loudnorm.
2026-05-27 ─ هذا التقرير: framework تقييم 5-أبعاد + baseline لـ 23 أغنية + Hard Gate.
2026-05-27 ─ Framework valid مؤكد + فيديو تجميع Top 10.

حوالي 32 يومًا:

  • 5 stacks SVS مختلفة تمت تجربتها (RVC → DSKR → SoulX → TCSinger2 → Vevo1.5)
  • 1 سقف تم بلوغه (DSKR S_300000) + 1 paused (TCSinger2 VAE) + 1 dropped (RVC pure)
  • الحالي = قاعدة Vevo1.5 الخارجية + Track A 247h KO fine-tune قيد التنفيذ

لا تدريب نموذج خاص. التميز عبر قاعدة خارجية مُتحقق منها + stack خاص بنا (الذاكرة / الخصوصية / RAG / serving محلي). فلسفة Naia الأساسية، النموذج مقفل في 2026-05-15.


حدود صادقة

هذا ليس تقريرًا بأن القاعدة جيدة. بل هو تقرير يقيس بموضوعية أن القاعدة عند مستوى 0% جاهزية للخدمة. لدينا الآن metric framework يتوافق ترتيبه مع الاستماع البشري — أداة للتحقق بصدق مما إذا كان التدريب يعمل حقًا. هذا هو معنى هذه التدوينة.

عندما ينتهي Track A، سنعيد تقييم نفس 23 أغنية ونقدم تقريرًا كميًا عن delta التحسن.

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

التعليقات

يمكنك التعليق بدون تسجيل الدخول

...