Naia
Inhaltsverzeichnis
  1. 1Video-Handbuch
  2. 2Naia OS Live USB
  3. 3Installation und Bereitstellung
  4. 3.1Naia OS Installation (ISO)
  5. 3.2App-Installation
  6. 4Erste Schritte
  7. 4.1Naia Model Pricing
  8. 4.2naia-omni-cascade
  9. 4.3demo
  10. 4.4naia-offline
  11. 4.5naia-model-dev
  12. 4.6naia-online
  13. 5Hauptbildschirm
  14. 6Chatten
  15. 6.1Persönlicher Radio-DJ & Ausstellungsführer
  16. 7Gesprächsverlauf
  17. 8Arbeitsfortschritt
  18. 9Fähigkeiten
  19. 10Kanäle
  20. 11Agenten
  21. 12Diagnose
  22. 13Arbeitsbereich
  23. 14Browser
  24. 15Panel-Verwaltung
  25. 16Sprachgespräch
  26. 17Einstellungen
  27. 18Werkzeugdetails
  28. 19Naia-Konto
  29. 20Fehlerbehebung
  30. 21Open-Source-Nutzung und Beitrag

16. Sprachgespräch

Es gibt zwei Moeglichkeiten, Sprachkonversationen in Naia zu nutzen.

Zwei Ansaetze

Omni-Modus

Ein einzelnes KI-Modell hoert Sprache direkt und antwortet sofort mit Sprache. Da es Tonfall und Emotionen ohne Zwischenkonvertierung versteht, ist es natuerlich und schnell.

STT → LLM → TTS Pipeline

Spracherkennung (STT), Text-KI (LLM) und Sprachsynthese (TTS) werden mit jeweils verschiedenen Anbietern kombiniert. Sie koennen die Anbieter frei waehlen, und auch eine komplett kostenlose Konfiguration ist moeglich.


Omni-Modus

Waehlen Sie unter Einstellungen > KI ein Modell mit dem 🗣️-Symbol in der Modellliste, um den Omni-Modus zu aktivieren.

Gemini Flash Live (Cloud)

AnbieterModellAPI-SchluesselKosten
Naia CloudGemini 3.1 Flash Live 🗣️Nicht erforderlich (Credits)Credit-Abzug
Gemini (direkt)Gemini 2.5 Flash Live 🗣️Google API-Schluessel~$0,03/Min

8 Stimmen: Kore (weiblich, Standard), Puck (maennlich), Charon (maennlich), Aoede (weiblich), Fenrir (maennlich), Leda (weiblich), Orus (maennlich), Zephyr (neutral)

GPT-4o Realtime (Cloud)

AnbieterModellAPI-SchluesselKosten
OpenAIGPT-4o Realtime 🗣️OpenAI API-Schluessel~$0,10/Min

10 Stimmen: Alloy (neutral), Ash (maennlich), Ballad (maennlich), Coral (weiblich), Echo (maennlich), Sage (weiblich), Shimmer (weiblich), Verse (maennlich), Marin (empfohlen), Cedar (empfohlen)

MiniCPM-o 4.5 (Lokal)

Fuehren Sie Omni-Sprachkonversationen vollstaendig lokal ueber den vllm-omni-Server aus. Derzeit das praktisch einzige Omni-Modell, das lokal nutzbar ist.

Waehlen Sie unter Einstellungen > KI den Anbieter vLLM, um die Modellliste automatisch vom Server abzurufen. Modelle mit "minicpm-o" im Namen werden automatisch als 🗣️ erkannt.

Anforderungen: Circa 35 GB VRAM bei BF16. A40 (46 GB) oder hoeher bzw. 48-GB-GPU empfohlen.

Server starten:

vllm serve openbmb/MiniCPM-o-4_5 \
  --omni --port 8091 --host 0.0.0.0 \
  --max-model-len 2048 --skip-mm-profiling

Geben Sie in den Naia-Einstellungen die vLLM-Serveradresse ein (z. B. http://localhost:8091).

Falls Sie keine lokale GPU haben, koennen Sie den Server auf Cloud-GPUs wie RunPod ausfuehren. Siehe RunPod-Anleitung.

Derzeit werden Spracheingabe und -ausgabe in Englisch und Chinesisch unterstuetzt.

Zukunftsplaene: Audio-Referenz-Stimmklonung und Fine-Tuning-Pipeline werden kuenftig unterstuetzt.


STT → LLM → TTS Pipeline

Auch ohne Omni-Modell koennen Sie STT und TTS einzeln konfigurieren, um Sprachkonversationen zu ermoeglichen.

STT (Spracherkennung)

Waehlen Sie unter Einstellungen > Sprache:

AnbieterOfflineAPI-SchluesselKosten
Web Speech APINeinNicht erforderlichKostenlos
VoskJaNicht erforderlichKostenlos
WhisperJaNicht erforderlichKostenlos
Naia CloudNeinNicht erforderlich (Login)Credits
vLLM ASRJa (lokal)Nicht erforderlichKostenlos

TTS (Sprachsynthese)

Waehlen Sie unter Einstellungen > Sprache:

AnbieterOfflineAPI-SchluesselKosten
Naia Cloud TTSNeinNicht erforderlich (Login)Credits
Edge TTSNeinNicht erforderlichKostenlos
Google Cloud TTSNeinErforderlich$0,016/1K Zeichen
OpenAI TTSNeinErforderlich$0,015/1K Zeichen
ElevenLabsNeinErforderlich$0,30/1K Zeichen
vLLM TTSJa (lokal)Nicht erforderlichKostenlos
BenutzerdefiniertVariiertVariiertVariiert

Klicken Sie auf die Vorhoeren-Schaltflaeche, um die ausgewaehlte Stimme zu testen.

Kombinationsbeispiele

UmgebungSTTLLMTTSKosten
Komplett kostenlosVoskOllama (lokal)Edge TTSKostenlos
PreiswertWeb SpeechGemini 2.5 FlashEdge TTS~$0,3/1M Token
Hohe QualitaetWhisperClaude SonnetElevenLabsAPI-Kosten
Naia CloudNaia Cloud STTNaia Cloud LLMNaia Cloud TTSNur Credits
Komplett lokal (GPU)vLLM ASRvLLMvLLM TTSKostenlos