Il existe deux facons d'utiliser les conversations vocales dans Naia.
Deux modes
Mode Omni
Un seul modele IA ecoute directement la voix et repond instantanement par la voix. Sans conversion intermediaire, il comprend le ton et les emotions, ce qui le rend naturel et rapide.
Pipeline STT → LLM → TTS
Combine la reconnaissance vocale (STT), l'IA textuelle (LLM) et la synthese vocale (TTS) avec differents fournisseurs. Vous pouvez choisir librement les fournisseurs, et une configuration entierement gratuite est possible.
Mode Omni
Dans Parametres > IA, selectionnez un modele affichant l'icone 🗣️ dans la liste des modeles pour activer le mode Omni.
Gemini Flash Live (cloud)
| Fournisseur | Modele | Cle API | Cout |
|---|---|---|---|
| Naia Cloud | Gemini 3.1 Flash Live 🗣️ | Non requise (credits) | Deduction de credits |
| Gemini (direct) | Gemini 2.5 Flash Live 🗣️ | Cle API Google | ~0,03 $/min |
8 voix : Kore (feminine, par defaut), Puck (masculine), Charon (masculine), Aoede (feminine), Fenrir (masculine), Leda (feminine), Orus (masculine), Zephyr (neutre)
GPT-4o Realtime (cloud)
| Fournisseur | Modele | Cle API | Cout |
|---|---|---|---|
| OpenAI | GPT-4o Realtime 🗣️ | Cle API OpenAI | ~0,10 $/min |
10 voix : Alloy (neutre), Ash (masculine), Ballad (masculine), Coral (feminine), Echo (masculine), Sage (feminine), Shimmer (feminine), Verse (masculine), Marin (recommande), Cedar (recommande)
MiniCPM-o 4.5 (local)
Executez des conversations vocales Omni entierement en local via le serveur vllm-omni. C'est actuellement le seul modele Omni pratiquement utilisable en local.
Dans Parametres > IA, selectionnez vLLM comme fournisseur pour recuperer automatiquement la liste des modeles du serveur. Lorsque le nom du modele contient "minicpm-o", il est automatiquement reconnu comme 🗣️.
Configuration requise : Environ 35 Go de VRAM en BF16. A40 (46 Go) ou GPU de 48 Go ou plus recommande.
Demarrage du serveur :
vllm serve openbmb/MiniCPM-o-4_5 \
--omni --port 8091 --host 0.0.0.0 \
--max-model-len 2048 --skip-mm-profiling
Entrez l'adresse du serveur vLLM dans les parametres de Naia (ex : http://localhost:8091).
Si vous n'avez pas de GPU local, vous pouvez utiliser un GPU cloud comme RunPod. Consultez le guide RunPod.
Actuellement, l'entree/sortie vocale est prise en charge en anglais et en chinois.
Plans futurs : La prise en charge du clonage vocal par reference audio et du pipeline de fine-tuning est prevue.
Pipeline STT → LLM → TTS
Meme sans modele Omni, vous pouvez configurer le STT et le TTS individuellement pour les conversations vocales.
STT (reconnaissance vocale)
Selectionnez dans Parametres > Voix :
| Fournisseur | Hors ligne | Cle API | Cout |
|---|---|---|---|
| Web Speech API | Non | Non requise | Gratuit |
| Vosk | Oui | Non requise | Gratuit |
| Whisper | Oui | Non requise | Gratuit |
| Naia Cloud | Non | Non requise (connexion) | Credits |
| vLLM ASR | Oui (local) | Non requise | Gratuit |
TTS (synthese vocale)
Selectionnez dans Parametres > Voix :
| Fournisseur | Hors ligne | Cle API | Cout |
|---|---|---|---|
| Naia Cloud TTS | Non | Non requise (connexion) | Credits |
| Edge TTS | Non | Non requise | Gratuit |
| Google Cloud TTS | Non | Requise | 0,016 $/1K car. |
| OpenAI TTS | Non | Requise | 0,015 $/1K car. |
| ElevenLabs | Non | Requise | 0,30 $/1K car. |
| vLLM TTS | Oui (local) | Non requise | Gratuit |
| Custom | Variable | Variable | Variable |
Utilisez le bouton Apercu pour tester la voix selectionnee.
Exemples de combinaisons
| Environnement | STT | LLM | TTS | Cout |
|---|---|---|---|---|
| Entierement gratuit | Vosk | Ollama (local) | Navigateur TTS | Gratuit |
| Economique | Web Speech | Gemini 2.5 Flash | Edge TTS | ~0,3 $/1M tokens |
| Haute qualite | Whisper | Claude Sonnet | ElevenLabs | Couts API |
| Naia Cloud | Naia Cloud STT | Naia Cloud LLM | Naia Cloud TTS | Credits uniquement |
| Entierement local (GPU) | vLLM ASR | vLLM | vLLM TTS | Gratuit |