مرحبًا، أنا Luke أبني Naia.
حقق نموذج الصوت لـ Naia بعض النتائج، والآن أنظر أيضًا في الغناء. أريد أن تغني Alpha من أجلي. خاصة 번안곡 (أغاني الكوفر — أغانٍ أجنبية مترجمة إلى الكورية) تهمني.
بدأت قبل شهر، اصطدمت بسقف، ومؤخرًا حصلت على نتائج أفضل قليلًا — أشعر أنني إذا حفرت أكثر، سيخرج شيء ما. سابقًا كانت الحروف الكورية والنغمات بمثابة هراء فضائي؛ الآن تغني شيئًا يشبه الكورية.
لا تزال تبدو مخمورة قليلًا ^^. لكن بما أن شيئًا خرج وهو ممتع، أشارك التقدم مع التقرير. آمل أن تغني لي حقًا في يوم من الأيام.
Naia-Sing لم تستقر بعد — هذا أقرب إلى مشاركة تقدم منه إلى إطلاق. ترتيب النشر الرسمي هو Naia-talk (Naia-Omni) أولًا (مستقر بالفعل)، ثم Naia-Sing.
TL;DR
- 23 أغنية مقيّمة، Composite score 27.8
60.6 (مقياس 0100) - أفضل 3 أغانٍ بتقييم المستخدم = رتبة المقياس 1·3·5، أسوأ 2 = رتبة 17·19 → framework valid مؤكد
- Hard Gate (الحد الأدنى لجاهزية الخدمة) = 0/23 مرت — القاعدة الحالية ليست جاهزة للخدمة
- أكبر ضعف: A. الوضوح (متوسط CER 1.18) + E. التعبير (فقط 1/23)
- الخطوة التالية = تطبيق Track A 247h fine-tune الكوري + استدلال أقصر + كلمات بمطابقة المقاطع
فيديو تجميع Top 10
7 دقائق و24 ثانية. من #1 إلى #10، واحدة تلو الأخرى. كل مسار طبيعه عبر ffmpeg loudnorm -14 LUFS + dynaudnorm. الفيديو يجعل التنازلات بين مطابقة النوع وتناسق الجرس ودقة النطق مسموعة.
| # | الأغنية | Source | Score | نقطة قوة |
|---|---|---|---|---|
| 1 | banan_jaychou_translation | باللاد Jay Chou (13s, ko translation) | 60.6 | CER 0.52 الأدنى عمومًا · ko 0.96 |
| 2 | genre_digicharat | Digi Charat Party Night (1999) | 50.8 | ko 0.97 · timbre 0.92 |
| 3 | genre_gunslinger | Gunslinger Girl doll · Lia | 48.8 | timbre 0.93 · باللاد match |
| 4 | genre_escaflowne | Escaflowne OP (1996) | 48.2 | f0 range 0.91 |
| 5 | banan_adele_translation | Adele — Someone Like You (13s) | 47.8 | E.energy 0.72 الأعلى |
| 6 | base_gunslinger | نفس الأغنية، KO-S1 baseline | 47.8 | CER 0.70 (الثاني الأدنى) |
| 7 | genre_macross | Macross — Do You Remember Love? (1984) | 47.7 | ko 0.97 · timbre 0.92 |
| 8 | genre_chobits | Let Me Be With You (2002) | 46.7 | timbre 0.93 |
| 9 | pipe_01_adele | Adele source 13s pipeline | 45.9 | f0_corr 0.81 الأعلى |
| 10 | genre_nadia | Nadia: سر المياه الزرقاء (1990) | 44.2 | timbre 0.97 الأعلى |
1. «الغناء جيدًا بالكورية» — 5 أبعاد مستقلة
لا يمكن اختزاله إلى مقياس واحد. الأوساط الأكاديمية (TCSinger, Vevo, DiffSinger) أيضًا تقدم 4-5 أبعاد معًا.
| بُعد | مقياس أكاديمي | قياسنا | المعنى |
|---|---|---|---|
| A. الوضوح (Intelligibility) | CER, PER | Whisper-small KO STT مقابل المسافة المقصودة للكلمات | «هل الكلمات مسموعة؟» |
| B. الطبقة الصوتية (Pitch) | F0 RMSE, F0 corr | librosa.pyin F0 pearson + range ratio | «هل يصيب النوتات؟» |
| C. تشابه الجرس | SECS (ECAPA cosine) | MFCC mean cosine (proxy) | «نفس المغني؟» |
| D. الطبيعية | MOS-N, UTMOS | chunk_disc في الدقيقة (proxy) | «ليس آليًا؟» |
| E. التعبير (للكوفر فقط) | (تعريف خاص) | source RMS + spectral centroid + vibrato corr | «هل يتبع تعبير الأصلي؟» |
البعد E جوهر الكوفرات. SVS عام = النوتة هي ground truth للتعبير. الكوفر = dynamics/vibrato/articulation للصوت source = ground truth.
Hard Gate (الحد الأدنى لجاهزية الخدمة)
A. CER ≤ 0.30 AND ko_prob ≥ 0.90 [النطق الكوري]
B. f0_corr ≥ 0.50 AND range 0.6~1.4 [الطبقة الصوتية]
C. timbre_sim ≥ 0.65 [الجرس]
D. chunk_disc ≤ 2/min [السلاسة]
E. energy_corr ≥ 0.5 · brightness ≥ 0.4 · vibrato 0.5~1.5 [التعبير]
الأساس الأكاديمي: CER 0.30 = عتبة STT للإنتاج؛ SECS 0.60-0.70 = معيار نجاح zero-shot SVC.
2. Framework Self-Validation
درس — كان Whisper-small غير صالح لقياس جودة SVS (svs_eval.py §43, 5/17): حتى عينات golden in-distribution أعطت ناتجًا فارغًا. الغناء أثار فقط speech-likeness.
→ التحقق الذاتي إلزامي:
user best vs user worst
↓ ↓
يجب أن يكونا قابلين للفصل بالمقياس
↓
وإلا فالمقياس نفسه باطل
نتيجة self-validation لـ 23 أغنية:
| تقييم المستخدم | الأغنية | رتبة المقياس | مفصول |
|---|---|---|---|
| 🟢 BEST | banan_jaychou_translation | 1/23 | ✓ |
| 🟢 BEST | genre_gunslinger | 3/23 | ✓ |
| 🟢 BEST | banan_adele_translation | 5/23 | ✓ |
| 🔴 WORST | base_macross | 17/23 | ✓ |
| 🔴 WORST | base_flcl | 19/23 | ✓ |
→ Framework valid (ranking proxy مؤكد). لدينا الآن أداة للمقارنة الموضوعية لنتائج تدريب Track A.
3. اجتياز Hard Gate — 0/23 ❌
| البعد | المعيار | اجتاز |
|---|---|---|
| A. CER ≤ 0.30 | إنتاج أكاديمي | 0/23 ❌ |
| A. ko_prob ≥ 0.90 | كشف Whisper للكورية | 14/23 |
| B. f0_corr ≥ 0.5 + range OK | الحفاظ على pitch | 2/23 ❌ |
| C. timbre_sim ≥ 0.65 | تناسق ref | 10/23 |
| D. disc ≤ 2/min | أرتيفاكت chunk | 20/23 ✓ |
| E. (3-مقاييس AND) | تعبير الكوفر | 1/23 ❌ |
قاعدة Vevo1.5 الكورية الحالية = 0% جاهزة للخدمة. A·B·E هي الفجوات الحرجة.
4. التشخيص — الضعف والسبب لكل بُعد
A. الوضوح — توليف فونيم الكورية لـ Vevo ضعيف
Vevo1.5 مدرَّب مسبقًا على Sing-0.4k (438س تشمل 3.8س CSD كوري). لكن mapping فونيم الكورية ضعيف — متوسط CER 1.18 = 70% مكسور. فقط ko_prob 0.86 = «يبدو كوريًا صوتيًا» لكن ليس فونيميًا.
B. الطبقة الصوتية — melody_control غير متدرب بشكل كافٍ على اللحن
F0_corr متوسط 0.18. عدة قيم سالبة (gunslinger -0.20, gsteatrino -0.46) = ارتباط عكسي مع source. vevosing_melody_control يعطي الأولوية لنقل محتوى الفونيم؛ منحنى F0 ثانوي.
C. الجرس — مطابقة ref تعمل
الأغاني مع 8 refs من AI-Hub متوسط timbre_sim 0.91. لكن انجراف الجرس عند حدود chunk = ملاحظة المستخدم «أصوات مختلفة تدخل».
D. السلاسة — دمج chunk OK
20/23 اجتازت. crossfade 100ms فعّال. 3 outliers فقط عندما يكون لدى source vocal صمت كبير.
E. التعبير — الفشل الأكبر
1/23 اجتازت. متوسط energy_corr 0.32، brightness_corr 0.19. Prosody tokenizer لـ Vevo غير متدرب بشكل كافٍ على الكورية + dynamics مفقودة أثناء فصل content-style.
5. ماذا نفعل — تحسينات مرتبة بالأولوية
🟢 P0 (فوري، التأثير مُتحقق منه)
| البند | التأثير | ملاحظة |
|---|---|---|
| تطبيق نتائج تدريب Track A | A·B·E في الوقت نفسه | fine-tune 247h KO جارٍ |
| استدلال Single-chunk | C·D | أغنية 60s → 15s chorus → sweet spot لـ #1 |
| كلمات بمطابقة المقاطع | A | SimpleAligner تقسيم متساوٍ → مطابقة عدد مقاطع source |
وصفة #1 (banan_jaychou_translation): قصير (13s) + مقاطع مطابقة + source ستوديو نظيف
🟡 P1 (خلال أسبوع)
| البند | التأثير |
|---|---|
| إدخال ECAPA-TDNN SECS | دقة C (يحل محل MFCC proxy) |
| UTMOS / Sing-MOS predictor | تموضع موضوعي لطبيعية D |
| Phrase-aware aligner | A·D (لا تقسيم متساوٍ للمقاطع) |
| Suno API → source كوري | A·E (pool source vocal كوري) |
🟠 P2 (متوسط الأجل، يتطلب التحقق)
| البند | التأثير | المخاطرة |
|---|---|---|
| Vevo1.5 fine-tune (Track A) | A·B·E كلها | النتيجة غير محققة |
| إعادة فحص TCSinger2 pivot | تعزيز التعبير ممكن | Stack معقد، خطر سقف |
| F5-TTS / CosyVoice2 SVS adapter | وضوح A | Adapter مفقود |
| المعالجة اللاحقة SVC (RVC/SoulX) | جرس C | يجب قياس CER من طرف إلى طرف |
🔴 P3 (طويل الأجل، تحول نموذجي)
- تدريب نموذج SVS خاص → القاعدة الخارجية المُتحقق منها أفضل (فلسفة Naia الأساسية)
- اختبار MOS listening ذاتي → ground truth مطلقة
- منتج Suno + cover pipeline خاص → خدمة «AI singing» Track D
6. نقاط القرار التالية
- عندما ينتهي Track A → إعادة التقييم بهذا الإطار، قياس delta التحسن
- التحسن < 20% → التخلي عن قاعدة Vevo1.5، إعادة النظر في TCSinger2 أو F5-TTS
- التحسن ≥ 30% → fine-tune كامل + الدخول إلى خدمة Track D
- بوابة المستخدم = الاستماع إلى نتائج Track A + فحص الأبعاد الخمسة، ثم اتخاذ القرار
7. سجل أبحاث naia-sing لـ 32 يومًا
استنادًا إلى git history — لا هلوسات. البداية الحقيقية = 2026-04-25 (شهر واحد من السجل).
2026-04-25 ─ البداية: إعداد المشروع + RVC pipeline scripts.
2026-04-26 ─ بيانات source + cover pipeline متعدد اللغات + IP groundwork.
2026-04-28 ─ كلمات 3-frontier + التحقق من SVS الكوري + pipeline صوت ref للهاتف.
2026-05-15 ─ تأكيد stack تدريب DSKR + AI-Hub 465 SVS كوري.
2026-05-15 ─ الإصلاح الجذري لعنق زجاجة IO — pickle 13x خفيف + HDD→SSD (يتجنب 58s/step).
2026-05-16 ─ تأكيد stack العمل — نقل DSKR+CSD → RVC swap. تحقق المستخدم OK.
2026-05-16 ─ نفي سقف vocoder + تمديد التدريب 300k→500k.
2026-05-16 ─ نفي overfit التمديد — best=S_300000 مقفل.
2026-05-18 ─ توصيل BigVGAN كـ vocoder افتراضي لـ DSKR + ترقيع أمن مفتاح aihubshell.
2026-05-19 ─ تأكيد واقع سقف DSKR S_300000 (MCD37 مقابل 48 cross-song).
2026-05-19 ─ بدء TCSinger 2 SVS كوري → PAUSED @ VAE epoch 395.
2026-05-21 ─ تجميع review R3 + hold gate موارد naia-sing.
2026-05-26 ─ إغلاق TCSinger2 → اكتشاف Vevo1.5 SVS كوري.
2026-05-26 ─ اكتمال dataset الغناء الكوري 247h (GTSinger + AI-Hub 465).
2026-05-26 ─ BASE STATE SNAPSHOT — قفل baseline قبل fine-tune.
2026-05-26 ─ 3-AI cross-review (codex+gemini+opencode) + Reality Check.
2026-05-26 ─ Track A Phase 1 AR smoke PASS + Phase 2 autonomous wrapper.
2026-05-26 ─ قياس VRAM لكل stage + 5 cover batch + 10 anime OST 60s.
2026-05-26 ─ اكتشاف حرج: Vevo melody_control = يعتمد على فونيم vocal source.
2026-05-26 ─ batch مطابقة النوع لـ AI-Hub 8 short refs + معالجة ffmpeg loudnorm.
2026-05-27 ─ هذا التقرير: framework تقييم 5-أبعاد + baseline لـ 23 أغنية + Hard Gate.
2026-05-27 ─ Framework valid مؤكد + فيديو تجميع Top 10.
حوالي 32 يومًا:
- 5 stacks SVS مختلفة تمت تجربتها (RVC → DSKR → SoulX → TCSinger2 → Vevo1.5)
- 1 سقف تم بلوغه (DSKR S_300000) + 1 paused (TCSinger2 VAE) + 1 dropped (RVC pure)
- الحالي = قاعدة Vevo1.5 الخارجية + Track A 247h KO fine-tune قيد التنفيذ
→ لا تدريب نموذج خاص. التميز عبر قاعدة خارجية مُتحقق منها + stack خاص بنا (الذاكرة / الخصوصية / RAG / serving محلي). فلسفة Naia الأساسية، النموذج مقفل في 2026-05-15.
حدود صادقة
هذا ليس تقريرًا بأن القاعدة جيدة. بل هو تقرير يقيس بموضوعية أن القاعدة عند مستوى 0% جاهزية للخدمة. لدينا الآن metric framework يتوافق ترتيبه مع الاستماع البشري — أداة للتحقق بصدق مما إذا كان التدريب يعمل حقًا. هذا هو معنى هذه التدوينة.
عندما ينتهي Track A، سنعيد تقييم نفس 23 أغنية ونقدم تقريرًا كميًا عن delta التحسن.
