Es gibt zwei Moeglichkeiten, Sprachkonversationen in Naia zu nutzen.
Zwei Ansaetze
Omni-Modus
Ein einzelnes KI-Modell hoert Sprache direkt und antwortet sofort mit Sprache. Da es Tonfall und Emotionen ohne Zwischenkonvertierung versteht, ist es natuerlich und schnell.
STT → LLM → TTS Pipeline
Spracherkennung (STT), Text-KI (LLM) und Sprachsynthese (TTS) werden mit jeweils verschiedenen Anbietern kombiniert. Sie koennen die Anbieter frei waehlen, und auch eine komplett kostenlose Konfiguration ist moeglich.
Omni-Modus
Waehlen Sie unter Einstellungen > KI ein Modell mit dem 🗣️-Symbol in der Modellliste, um den Omni-Modus zu aktivieren.
Gemini Flash Live (Cloud)
| Anbieter | Modell | API-Schluessel | Kosten |
|---|---|---|---|
| Naia Cloud | Gemini 3.1 Flash Live 🗣️ | Nicht erforderlich (Credits) | Credit-Abzug |
| Gemini (direkt) | Gemini 2.5 Flash Live 🗣️ | Google API-Schluessel | ~$0,03/Min |
8 Stimmen: Kore (weiblich, Standard), Puck (maennlich), Charon (maennlich), Aoede (weiblich), Fenrir (maennlich), Leda (weiblich), Orus (maennlich), Zephyr (neutral)
GPT-4o Realtime (Cloud)
| Anbieter | Modell | API-Schluessel | Kosten |
|---|---|---|---|
| OpenAI | GPT-4o Realtime 🗣️ | OpenAI API-Schluessel | ~$0,10/Min |
10 Stimmen: Alloy (neutral), Ash (maennlich), Ballad (maennlich), Coral (weiblich), Echo (maennlich), Sage (weiblich), Shimmer (weiblich), Verse (maennlich), Marin (empfohlen), Cedar (empfohlen)
MiniCPM-o 4.5 (Lokal)
Fuehren Sie Omni-Sprachkonversationen vollstaendig lokal ueber den vllm-omni-Server aus. Derzeit das praktisch einzige Omni-Modell, das lokal nutzbar ist.
Waehlen Sie unter Einstellungen > KI den Anbieter vLLM, um die Modellliste automatisch vom Server abzurufen. Modelle mit "minicpm-o" im Namen werden automatisch als 🗣️ erkannt.
Anforderungen: Circa 35 GB VRAM bei BF16. A40 (46 GB) oder hoeher bzw. 48-GB-GPU empfohlen.
Server starten:
vllm serve openbmb/MiniCPM-o-4_5 \
--omni --port 8091 --host 0.0.0.0 \
--max-model-len 2048 --skip-mm-profiling
Geben Sie in den Naia-Einstellungen die vLLM-Serveradresse ein (z. B. http://localhost:8091).
Falls Sie keine lokale GPU haben, koennen Sie den Server auf Cloud-GPUs wie RunPod ausfuehren. Siehe RunPod-Anleitung.
Derzeit werden Spracheingabe und -ausgabe in Englisch und Chinesisch unterstuetzt.
Zukunftsplaene: Audio-Referenz-Stimmklonung und Fine-Tuning-Pipeline werden kuenftig unterstuetzt.
STT → LLM → TTS Pipeline
Auch ohne Omni-Modell koennen Sie STT und TTS einzeln konfigurieren, um Sprachkonversationen zu ermoeglichen.
STT (Spracherkennung)
Waehlen Sie unter Einstellungen > Sprache:
| Anbieter | Offline | API-Schluessel | Kosten |
|---|---|---|---|
| Web Speech API | Nein | Nicht erforderlich | Kostenlos |
| Vosk | Ja | Nicht erforderlich | Kostenlos |
| Whisper | Ja | Nicht erforderlich | Kostenlos |
| Naia Cloud | Nein | Nicht erforderlich (Login) | Credits |
| vLLM ASR | Ja (lokal) | Nicht erforderlich | Kostenlos |
TTS (Sprachsynthese)
Waehlen Sie unter Einstellungen > Sprache:
| Anbieter | Offline | API-Schluessel | Kosten |
|---|---|---|---|
| Naia Cloud TTS | Nein | Nicht erforderlich (Login) | Credits |
| Edge TTS | Nein | Nicht erforderlich | Kostenlos |
| Google Cloud TTS | Nein | Erforderlich | $0,016/1K Zeichen |
| OpenAI TTS | Nein | Erforderlich | $0,015/1K Zeichen |
| ElevenLabs | Nein | Erforderlich | $0,30/1K Zeichen |
| vLLM TTS | Ja (lokal) | Nicht erforderlich | Kostenlos |
| Benutzerdefiniert | Variiert | Variiert | Variiert |
Klicken Sie auf die Vorhoeren-Schaltflaeche, um die ausgewaehlte Stimme zu testen.
Kombinationsbeispiele
| Umgebung | STT | LLM | TTS | Kosten |
|---|---|---|---|---|
| Komplett kostenlos | Vosk | Ollama (lokal) | Edge TTS | Kostenlos |
| Preiswert | Web Speech | Gemini 2.5 Flash | Edge TTS | ~$0,3/1M Token |
| Hohe Qualitaet | Whisper | Claude Sonnet | ElevenLabs | API-Kosten |
| Naia Cloud | Naia Cloud STT | Naia Cloud LLM | Naia Cloud TTS | Nur Credits |
| Komplett lokal (GPU) | vLLM ASR | vLLM | vLLM TTS | Kostenlos |