Naia
Table des matières
  1. 1Manuel vidéo
  2. 2Naia OS Live USB
  3. 3Installation et déploiement
  4. 3.1Installation de Naia OS (ISO)
  5. 3.2Installation de l'app
  6. 4Commencer
  7. 4.1Naia Model Pricing
  8. 4.2naia-omni-cascade
  9. 4.3demo
  10. 4.4naia-offline
  11. 4.5naia-model-dev
  12. 4.6naia-online
  13. 5Écran principal
  14. 6Discuter
  15. 6.1DJ radio personnel et guide d’exposition
  16. 7Historique des conversations
  17. 8Avancement des travaux
  18. 9Compétences
  19. 10Canaux
  20. 11Agents
  21. 12Diagnostic
  22. 13Espace de travail
  23. 14Navigateur
  24. 15Gestion des panneaux
  25. 16Conversation vocale
  26. 17Paramètres
  27. 18Détails de l'outil
  28. 19Compte Naia
  29. 20Dépannage
  30. 21Utilisation et contribution open source

16. Conversation vocale

Il existe deux facons d'utiliser les conversations vocales dans Naia.

Deux modes

Mode Omni

Un seul modele IA ecoute directement la voix et repond instantanement par la voix. Sans conversion intermediaire, il comprend le ton et les emotions, ce qui le rend naturel et rapide.

Pipeline STT → LLM → TTS

Combine la reconnaissance vocale (STT), l'IA textuelle (LLM) et la synthese vocale (TTS) avec differents fournisseurs. Vous pouvez choisir librement les fournisseurs, et une configuration entierement gratuite est possible.


Mode Omni

Dans Parametres > IA, selectionnez un modele affichant l'icone 🗣️ dans la liste des modeles pour activer le mode Omni.

Gemini Flash Live (cloud)

FournisseurModeleCle APICout
Naia CloudGemini 3.1 Flash Live 🗣️Non requise (credits)Deduction de credits
Gemini (direct)Gemini 2.5 Flash Live 🗣️Cle API Google~0,03 $/min

8 voix : Kore (feminine, par defaut), Puck (masculine), Charon (masculine), Aoede (feminine), Fenrir (masculine), Leda (feminine), Orus (masculine), Zephyr (neutre)

GPT-4o Realtime (cloud)

FournisseurModeleCle APICout
OpenAIGPT-4o Realtime 🗣️Cle API OpenAI~0,10 $/min

10 voix : Alloy (neutre), Ash (masculine), Ballad (masculine), Coral (feminine), Echo (masculine), Sage (feminine), Shimmer (feminine), Verse (masculine), Marin (recommande), Cedar (recommande)

MiniCPM-o 4.5 (local)

Executez des conversations vocales Omni entierement en local via le serveur vllm-omni. C'est actuellement le seul modele Omni pratiquement utilisable en local.

Dans Parametres > IA, selectionnez vLLM comme fournisseur pour recuperer automatiquement la liste des modeles du serveur. Lorsque le nom du modele contient "minicpm-o", il est automatiquement reconnu comme 🗣️.

Configuration requise : Environ 35 Go de VRAM en BF16. A40 (46 Go) ou GPU de 48 Go ou plus recommande.

Demarrage du serveur :

vllm serve openbmb/MiniCPM-o-4_5 \
  --omni --port 8091 --host 0.0.0.0 \
  --max-model-len 2048 --skip-mm-profiling

Entrez l'adresse du serveur vLLM dans les parametres de Naia (ex : http://localhost:8091).

Si vous n'avez pas de GPU local, vous pouvez utiliser un GPU cloud comme RunPod. Consultez le guide RunPod.

Actuellement, l'entree/sortie vocale est prise en charge en anglais et en chinois.

Plans futurs : La prise en charge du clonage vocal par reference audio et du pipeline de fine-tuning est prevue.


Pipeline STT → LLM → TTS

Meme sans modele Omni, vous pouvez configurer le STT et le TTS individuellement pour les conversations vocales.

STT (reconnaissance vocale)

Selectionnez dans Parametres > Voix :

FournisseurHors ligneCle APICout
Web Speech APINonNon requiseGratuit
VoskOuiNon requiseGratuit
WhisperOuiNon requiseGratuit
Naia CloudNonNon requise (connexion)Credits
vLLM ASROui (local)Non requiseGratuit

TTS (synthese vocale)

Selectionnez dans Parametres > Voix :

FournisseurHors ligneCle APICout
Naia Cloud TTSNonNon requise (connexion)Credits
Edge TTSNonNon requiseGratuit
Google Cloud TTSNonRequise0,016 $/1K car.
OpenAI TTSNonRequise0,015 $/1K car.
ElevenLabsNonRequise0,30 $/1K car.
vLLM TTSOui (local)Non requiseGratuit
CustomVariableVariableVariable

Utilisez le bouton Apercu pour tester la voix selectionnee.

Exemples de combinaisons

EnvironnementSTTLLMTTSCout
Entierement gratuitVoskOllama (local)Navigateur TTSGratuit
EconomiqueWeb SpeechGemini 2.5 FlashEdge TTS~0,3 $/1M tokens
Haute qualiteWhisperClaude SonnetElevenLabsCouts API
Naia CloudNaia Cloud STTNaia Cloud LLMNaia Cloud TTSCredits uniquement
Entierement local (GPU)vLLM ASRvLLMvLLM TTSGratuit