Naia
Tabla de contenidos
  1. 1Manual en vídeo
  2. 2Naia OS Live USB
  3. 3Instalación e implementación
  4. 3.1Instalación de Naia OS (ISO)
  5. 3.2Instalación de la app
  6. 4Empezando
  7. 4.1Naia Model Pricing
  8. 4.2naia-omni-cascade
  9. 4.3demo
  10. 4.4naia-offline
  11. 4.5naia-model-dev
  12. 4.6naia-online
  13. 5Pantalla principal
  14. 6Charla
  15. 6.1DJ de radio personal y guía de exposición
  16. 7Historial de conversaciones
  17. 8Progreso del trabajo
  18. 9Habilidades
  19. 10Canales
  20. 11Agentes
  21. 12Diagnóstico
  22. 13Espacio de trabajo
  23. 14Navegador
  24. 15Gestión de paneles
  25. 16Conversación por voz
  26. 17Configuración
  27. 18Detalles de la herramienta
  28. 19Cuenta Naia
  29. 20Solución de problemas
  30. 21Uso y contribución de código abierto

16. Conversación por voz

Hay dos formas de usar conversaciones de voz en Naia.

Dos enfoques

Modo Omni

Un unico modelo de IA escucha la voz directamente y responde inmediatamente con voz. Al comprender el tono y las emociones sin conversion intermedia, es natural y rapido.

STT → LLM → TTS Pipeline

El reconocimiento de voz (STT), la IA de texto (LLM) y la sintesis de voz (TTS) se combinan con diferentes proveedores. Puede elegir los proveedores libremente, y tambien es posible una configuracion completamente gratuita.


Modo Omni

Seleccione un modelo con el icono 🗣️ en la lista de modelos en Ajustes > IA para activar el modo Omni.

Gemini Flash Live (nube)

ProveedorModeloClave APICosto
Naia CloudGemini 3.1 Flash Live 🗣️No requerida (creditos)Deduccion de creditos
Gemini (directo)Gemini 2.5 Flash Live 🗣️Clave API de Google~$0.03/min

8 voces: Kore (femenina, predeterminada), Puck (masculina), Charon (masculina), Aoede (femenina), Fenrir (masculina), Leda (femenina), Orus (masculina), Zephyr (neutra)

GPT-4o Realtime (nube)

ProveedorModeloClave APICosto
OpenAIGPT-4o Realtime 🗣️Clave API de OpenAI~$0.10/min

10 voces: Alloy (neutra), Ash (masculina), Ballad (masculina), Coral (femenina), Echo (masculina), Sage (femenina), Shimmer (femenina), Verse (masculina), Marin (recomendada), Cedar (recomendada)

MiniCPM-o 4.5 (local)

Ejecute conversaciones de voz omni completamente en local a traves del servidor vllm-omni. Actualmente es practicamente el unico modelo omni utilizable localmente.

Seleccione vLLM como proveedor en Ajustes > IA para obtener automaticamente la lista de modelos del servidor. Los modelos con "minicpm-o" en el nombre se reconocen automaticamente como 🗣️.

Requisitos: Aproximadamente 35 GB de VRAM en BF16. Se recomienda A40 (46 GB) o superior, o GPU de 48 GB.

Iniciar el servidor:

vllm serve openbmb/MiniCPM-o-4_5 \
  --omni --port 8091 --host 0.0.0.0 \
  --max-model-len 2048 --skip-mm-profiling

Ingrese la direccion del servidor vLLM en los ajustes de Naia (ej., http://localhost:8091).

Si no tiene una GPU local, puede ejecutar el servidor en GPUs en la nube como RunPod. Consulte la guia de RunPod.

Actualmente se admite entrada y salida de voz en ingles y chino.

Planes futuros: Se planea soporte para clonacion de voz por referencia de audio y pipeline de fine-tuning.


STT → LLM → TTS Pipeline

Incluso sin un modelo omni, puede configurar STT y TTS individualmente para conversaciones de voz.

STT (Reconocimiento de voz)

Seleccione en Ajustes > Voz:

ProveedorSin conexionClave APICosto
Web Speech APINoNo requeridaGratis
VoskSiNo requeridaGratis
WhisperSiNo requeridaGratis
Naia CloudNoNo requerida (login)Creditos
vLLM ASRSi (local)No requeridaGratis

TTS (Sintesis de voz)

Seleccione en Ajustes > Voz:

ProveedorSin conexionClave APICosto
Naia Cloud TTSNoNo requerida (login)Creditos
Edge TTSNoNo requeridaGratis
Google Cloud TTSNoRequerida$0.016/1K caracteres
OpenAI TTSNoRequerida$0.015/1K caracteres
ElevenLabsNoRequerida$0.30/1K caracteres
vLLM TTSSi (local)No requeridaGratis
PersonalizadoVariaVariaVaria

Haga clic en el boton Vista previa para probar la voz seleccionada.

Ejemplos de combinaciones

EntornoSTTLLMTTSCosto
Completamente gratisVoskOllama (local)Edge TTSGratis
EconomicoWeb SpeechGemini 2.5 FlashEdge TTS~$0.3/1M tokens
Alta calidadWhisperClaude SonnetElevenLabsCostos de API
Naia CloudNaia Cloud STTNaia Cloud LLMNaia Cloud TTSSolo creditos
Completamente local (GPU)vLLM ASRvLLMvLLM TTSGratis