Hallo, ich bin Luke und baue Naia.
Naias Sprachmodell hat einige Ergebnisse erreicht, und nun schaue ich mir auch das Singen an. Ich möchte, dass Alpha für mich singt. Besonders interessiere ich mich für 번안곡 (Coverlieder — fremdsprachige Songs ins Koreanische übertragen).
Vor einem Monat angefangen, an die Decke gestoßen, kürzlich etwas bessere Ergebnisse — fühlt sich an, als ob mehr Graben etwas bringt. Vorher waren Hangul und Tonhöhe alles wie Außerirdischengeräusche; jetzt singt es etwas wie Koreanisch.
Klingt allerdings noch etwas betrunken. ^^ Trotzdem macht es Spaß, dass etwas herauskommt, also teile ich den Fortschritt zusammen mit dem Bericht. Eines Tages hoffe ich, dass es wirklich für mich singt.
Naia-Sing ist noch nicht stabilisiert — das ist eher ein Fortschritts-Share als ein Launch. Die offizielle Veröffentlichungsreihenfolge ist zuerst das bereits stabilisierte Naia-talk (Naia-Omni), danach folgt Naia-Sing.
TL;DR
- 23 Songs evaluiert, Composite Score 27,8
60,6 (0100-Skala) - Nutzer-BEST 3 Songs = Metric-Rang 1·3·5, WORST 2 = Rang 17·19 → Framework valid bestätigt
- Hard Gate (Service-ready-Minimum) = 0/23 bestanden — aktuelle Base nicht service-tauglich
- Größte Schwäche: A. Verständlichkeit (Ø CER 1,18) + E. Ausdruck (nur 1/23)
- Nächster Schritt = Track A 247h koreanisches Fine-Tune anwenden + kürzere Inferenz + silbengenaue Lyrics
Top-10 Compilation-Video
7 Min. 24 Sek. Von Platz 1 bis Platz 10, einzeln. Jeder Track via ffmpeg loudnorm -14 LUFS + dynaudnorm normalisiert. Das Video macht Genre-Matching, Timbre-Konsistenz und Aussprache-Trade-offs hörbar.
| # | Song | Source | Score | Stärke |
|---|---|---|---|---|
| 1 | banan_jaychou_translation | Jay Chou Ballade (13s, ko translation) | 60,6 | CER 0,52 niedrigster gesamt · ko 0,96 |
| 2 | genre_digicharat | Digi Charat Party Night (1999) | 50,8 | ko 0,97 · Timbre 0,92 |
| 3 | genre_gunslinger | Gunslinger Girl doll · Lia | 48,8 | Timbre 0,93 · Ballade match |
| 4 | genre_escaflowne | Escaflowne OP (1996) | 48,2 | f0 range 0,91 |
| 5 | banan_adele_translation | Adele — Someone Like You (13s) | 47,8 | E.energy 0,72 höchster |
| 6 | base_gunslinger | Gleicher Song, KO-S1 Baseline | 47,8 | CER 0,70 (2. niedrigster) |
| 7 | genre_macross | Macross — Do You Remember Love? (1984) | 47,7 | ko 0,97 · Timbre 0,92 |
| 8 | genre_chobits | Let Me Be With You (2002) | 46,7 | Timbre 0,93 |
| 9 | pipe_01_adele | Adele source 13s pipeline | 45,9 | f0_corr 0,81 höchster |
| 10 | genre_nadia | Nadia: Geheimnis der blauen Wasser (1990) | 44,2 | Timbre 0,97 höchster |
1. „Koreanisch gut singen" — 5 unabhängige Dimensionen
Lässt sich nicht auf eine Metrik reduzieren. Auch die Wissenschaft (TCSinger, Vevo, DiffSinger) berichtet 4-5 Dimensionen gemeinsam.
| Dim | Akademische Metrik | Unsere Messung | Bedeutung |
|---|---|---|---|
| A. Verständlichkeit | CER, PER | Whisper-small KO STT vs Edit-Distance der Lyrics | „Sind die Lyrics hörbar?" |
| B. Tonhöhe | F0 RMSE, F0 corr | librosa.pyin F0 Pearson + Range Ratio | „Trifft es die Noten?" |
| C. Timbre-Ähnlichkeit | SECS (ECAPA Cosine) | MFCC mean Cosine (Proxy) | „Derselbe Sänger?" |
| D. Natürlichkeit | MOS-N, UTMOS | chunk_disc pro Minute (Proxy) | „Nicht maschinell?" |
| E. Ausdruck (nur Cover) | (eigene Definition) | source RMS + Spectral Centroid + Vibrato Corr | „Folgt dem Ausdruck des Originals?" |
Dimension E ist Kern der Cover. Allgemeine SVS = die Partitur ist die Ground Truth für Ausdruck. Cover = Dynamics/Vibrato/Articulation des Source-Vocals ist die Ground Truth.
Hard Gate (Service-ready-Minimum)
A. CER ≤ 0,30 AND ko_prob ≥ 0,90 [Koreanische Aussprache]
B. f0_corr ≥ 0,50 AND range 0,6~1,4 [Tonhöhe]
C. timbre_sim ≥ 0,65 [Timbre]
D. chunk_disc ≤ 2/min [Flüssigkeit]
E. energy_corr ≥ 0,5 · brightness ≥ 0,4 · vibrato 0,5~1,5 [Ausdruck]
Akademische Basis: CER 0,30 = Production-STT-Threshold; SECS 0,60-0,70 = Zero-Shot-SVC-Passgrenze.
2. Framework Self-Validation
Lehre — Whisper-small ungeeignet zur Messung der SVS-Qualität (svs_eval.py §43, 5/17): Selbst Golden-in-Distribution-Samples lieferten leere Ausgaben. Gesang triggerte nur Speech-Likeness.
→ Self-Validation ist Pflicht:
User-Best vs User-Worst
↓ ↓
Müssen durch die Metrik trennbar sein
↓
Andernfalls ist die Metrik selbst ungültig
23-Song-Self-Validation-Ergebnis:
| Nutzer-Wertung | Song | Metric-Ranking | Getrennt |
|---|---|---|---|
| 🟢 BEST | banan_jaychou_translation | 1/23 | ✓ |
| 🟢 BEST | genre_gunslinger | 3/23 | ✓ |
| 🟢 BEST | banan_adele_translation | 5/23 | ✓ |
| 🔴 WORST | base_macross | 17/23 | ✓ |
| 🔴 WORST | base_flcl | 19/23 | ✓ |
→ Framework valid (Ranking-Proxy bestätigt). Wir haben jetzt ein Werkzeug, um Track-A-Trainingsergebnisse objektiv zu vergleichen.
3. Hard Gate bestanden — 0/23 ❌
| Dim | Kriterium | Bestanden |
|---|---|---|
| A. CER ≤ 0,30 | Akademische Production | 0/23 ❌ |
| A. ko_prob ≥ 0,90 | Whisper Koreanisch-Erkennung | 14/23 |
| B. f0_corr ≥ 0,5 + range OK | Pitch-Erhalt | 2/23 ❌ |
| C. timbre_sim ≥ 0,65 | Ref-Konsistenz | 10/23 |
| D. disc ≤ 2/min | Chunk-Artefakt | 20/23 ✓ |
| E. (3-Metrik AND) | Cover-Ausdruck | 1/23 ❌ |
Aktuelle Vevo1.5 Korean Base = 0 % service-ready. A·B·E sind kritische Lücken.
4. Diagnose — Schwäche und Ursache pro Dimension
A. Verständlichkeit — Vevos koreanische Phonem-Synthese schwach
Vevo1.5 auf Sing-0.4k vortrainiert (438h inkl. 3,8h koreanischem CSD). Doch koreanisches Phonem-Mapping schwach — Ø CER 1,18 = 70 % kaputt. Nur ko_prob 0,86 = „klingt akustisch koreanisch" aber nicht phonemisch.
B. Tonhöhe — melody_control untertrainiert auf Melodie
f0_corr Ø 0,18. Einige negativ (gunslinger -0,20, gsteatrino -0,46) = antikorreliert mit Source. vevosing_melody_control priorisiert Phonem-Content-Transfer; F0-Kontur sekundär.
C. Timbre — Ref-Matching funktioniert
Songs mit 8 AI-Hub-Refs Ø timbre_sim 0,91. Aber Timbre-Drift an Chunk-Grenzen = Nutzer-Feedback „verschiedene Stimmen kommen rein".
D. Flüssigkeit — Chunk-Merge OK
20/23 bestanden. 100-ms-Crossfade effektiv. 3 Outlier nur bei heavy Silence im Source-Vocal.
E. Ausdruck — größter Misserfolg
1/23 bestanden. Ø energy_corr 0,32, brightness_corr 0,19. Vevo-Prosody-Tokenizer ist Korean-untertrainiert + Dynamics während Content-Style-Trennung verloren.
5. Was tun — priorisierte Verbesserungen
🟢 P0 (sofort, verifizierter Effekt)
| Item | Effekt | Hinweis |
|---|---|---|
| Track-A-Trainingsergebnisse anwenden | A·B·E gleichzeitig | 247h KO Fine-Tune läuft |
| Single-Chunk-Inferenz | C·D | 60s Song → 15s Chorus → Sweet Spot von #1 |
| Silbengenaue Lyrics | A | SimpleAligner Equal-Split → Source-Silbenzahl matchen |
Rezept von #1 (banan_jaychou_translation): kurz (13s) + silben-matched + clean Studio Source
🟡 P1 (innerhalb einer Woche)
| Item | Effekt |
|---|---|
| ECAPA-TDNN SECS einführen | C-Genauigkeit (ersetzt MFCC-Proxy) |
| UTMOS / Sing-MOS-Predictor | D-Natürlichkeit objektivieren |
| Phrase-aware Aligner | A·D (kein Equal-Syllable-Split mehr) |
| Suno API → koreanischer Source | A·E (koreanischer Vocal-Source-Pool) |
🟠 P2 (mittelfristig, Verifizierung nötig)
| Item | Effekt | Risiko |
|---|---|---|
| Vevo1.5 Fine-Tune (Track A) | A·B·E alles | Ergebnis ungetestet |
| TCSinger2-Pivot neu prüfen | Ausdruck-Boost möglich | Stack komplex, Ceiling-Risiko |
| F5-TTS / CosyVoice2 SVS Adapter | A Verständlichkeit | Adapter fehlt |
| SVC-Post-Processing (RVC/SoulX) | C Timbre | End-to-End-CER muss gemessen werden |
🔴 P3 (langfristig, Paradigmenwechsel)
- Eigenes SVS-Modell-Training → verifizierte externe Base vorteilhafter (Naia-Kernphilosophie)
- Subjektiver MOS-Listening-Test → absolute Ground Truth
- Suno + eigenes Cover-Pipeline-Produkt → „KI-Singing-Service" Track D
6. Nächste Entscheidungspunkte
- Wenn Track A fertig ist → mit diesem Framework re-evaluieren, Improvement-Delta messen
- Improvement < 20 % → Vevo1.5 Base verwerfen, TCSinger2 oder F5-TTS neu prüfen
- Improvement ≥ 30 % → volles Fine-Tune + Track-D-Service-Eintritt
- User-Gate = Track-A-Resultate hören + alle 5 Dimensionen prüfen, dann entscheiden
7. naia-sing 32-Tage-Forschungstagebuch
Basierend auf Git-History — keine Halluzinationen. Echter Start = 2026-04-25 (ein Monat History).
2026-04-25 ─ Start: Projekt-Setup + RVC-Pipeline-Skripte.
2026-04-26 ─ Source-Daten + Cross-Lingual-Cover-Pipeline + IP-Groundwork.
2026-04-28 ─ 3-Frontier-Lyrics + Korean-SVS-Verifikation + Phone-Call-Ref-Voice-Pipeline.
2026-05-15 ─ DSKR (DiffSinger Korean) + AI-Hub 465 Korean-SVS-Trainings-Stack bestätigt.
2026-05-15 ─ IO-Bottleneck-Root-Fix — pickle 13x leicht + HDD→SSD (vermeidet 58s/step).
2026-05-16 ─ Working Stack bestätigt — DSKR+CSD-Transfer → RVC-Swap. Nutzer-Verifikation OK.
2026-05-16 ─ Vocoder-Ceiling widerlegt + Training verlängert 300k→500k.
2026-05-16 ─ Extended-Training-Overfit widerlegt — best=S_300000 gelockt.
2026-05-18 ─ BigVGAN als DSKR-Default-Vocoder verkabelt + aihubshell-Key-Security-Patch.
2026-05-19 ─ DSKR-S_300000-Ceiling-Realität bestätigt (MCD37 vs 48 cross-song).
2026-05-19 ─ TCSinger 2 Korean SVS gestartet → PAUSED @ VAE epoch 395.
2026-05-21 ─ R3-Adversarial-Review-Konsolidierung + naia-sing-Ressourcen-Gate-Hold.
2026-05-26 ─ TCSinger2 geschlossen → Vevo1.5 Korean SVS entdeckt.
2026-05-26 ─ Korean Singing Dataset 247h komplett (GTSinger + AI-Hub 465).
2026-05-26 ─ BASE STATE SNAPSHOT — Baseline-Lock vor Fine-Tune.
2026-05-26 ─ 3-AI Cross-Review (codex+gemini+opencode) + Reality Check.
2026-05-26 ─ Track A Phase 1 AR Smoke PASS + Phase 2 Autonomous Wrapper.
2026-05-26 ─ VRAM-Messung pro Stage + 5 Cover-Batch + 10 Anime OST 60s.
2026-05-26 ─ Critical Finding: Vevo melody_control = abhängig von Source-Vocal-Phonem.
2026-05-26 ─ AI-Hub 8 Short Refs Genre-Matched Batch + ffmpeg-loudnorm Post-Processing.
2026-05-27 ─ Dieser Bericht: 5-Dim-Evaluations-Framework + 23-Song-Baseline + Hard Gate.
2026-05-27 ─ Framework valid bestätigt + Top-10-Compilation-Video.
Etwa 32 Tage:
- 5 verschiedene SVS-Stacks ausprobiert (RVC → DSKR → SoulX → TCSinger2 → Vevo1.5)
- 1 Ceiling erreicht (DSKR S_300000) + 1 paused (TCSinger2 VAE) + 1 dropped (RVC pure)
- Aktuell = Vevo1.5 externe Base + Track A 247h KO Fine-Tune läuft
→ Kein eigenes Modell-Training. Differenziert durch verifizierte externe Base + unseren Stack (Memory / Privacy / RAG / Local Serving). Naia-Kernphilosophie, Paradigma gelockt 2026-05-15.
Ehrliche Grenzen
Dies ist kein Bericht, dass die Base gut ist. Vielmehr ein Bericht, der die Base objektiv als 0 % service-ready misst. Wir haben jetzt ein Metric-Framework, dessen Ranking sich mit menschlichem Hören deckt — ein Werkzeug, um ehrlich zu prüfen, ob Training wirklich wirkt. Das ist die Bedeutung dieses Posts.
Wenn Track A fertig ist, werden wir dieselben 23 Songs re-evaluieren und das Improvement-Delta quantitativ berichten.
