Hay dos formas de usar conversaciones de voz en Naia.
Dos enfoques
Modo Omni
Un unico modelo de IA escucha la voz directamente y responde inmediatamente con voz. Al comprender el tono y las emociones sin conversion intermedia, es natural y rapido.
STT → LLM → TTS Pipeline
El reconocimiento de voz (STT), la IA de texto (LLM) y la sintesis de voz (TTS) se combinan con diferentes proveedores. Puede elegir los proveedores libremente, y tambien es posible una configuracion completamente gratuita.
Modo Omni
Seleccione un modelo con el icono 🗣️ en la lista de modelos en Ajustes > IA para activar el modo Omni.
Gemini Flash Live (nube)
| Proveedor | Modelo | Clave API | Costo |
|---|---|---|---|
| Naia Cloud | Gemini 3.1 Flash Live 🗣️ | No requerida (creditos) | Deduccion de creditos |
| Gemini (directo) | Gemini 2.5 Flash Live 🗣️ | Clave API de Google | ~$0.03/min |
8 voces: Kore (femenina, predeterminada), Puck (masculina), Charon (masculina), Aoede (femenina), Fenrir (masculina), Leda (femenina), Orus (masculina), Zephyr (neutra)
GPT-4o Realtime (nube)
| Proveedor | Modelo | Clave API | Costo |
|---|---|---|---|
| OpenAI | GPT-4o Realtime 🗣️ | Clave API de OpenAI | ~$0.10/min |
10 voces: Alloy (neutra), Ash (masculina), Ballad (masculina), Coral (femenina), Echo (masculina), Sage (femenina), Shimmer (femenina), Verse (masculina), Marin (recomendada), Cedar (recomendada)
MiniCPM-o 4.5 (local)
Ejecute conversaciones de voz omni completamente en local a traves del servidor vllm-omni. Actualmente es practicamente el unico modelo omni utilizable localmente.
Seleccione vLLM como proveedor en Ajustes > IA para obtener automaticamente la lista de modelos del servidor. Los modelos con "minicpm-o" en el nombre se reconocen automaticamente como 🗣️.
Requisitos: Aproximadamente 35 GB de VRAM en BF16. Se recomienda A40 (46 GB) o superior, o GPU de 48 GB.
Iniciar el servidor:
vllm serve openbmb/MiniCPM-o-4_5 \
--omni --port 8091 --host 0.0.0.0 \
--max-model-len 2048 --skip-mm-profiling
Ingrese la direccion del servidor vLLM en los ajustes de Naia (ej., http://localhost:8091).
Si no tiene una GPU local, puede ejecutar el servidor en GPUs en la nube como RunPod. Consulte la guia de RunPod.
Actualmente se admite entrada y salida de voz en ingles y chino.
Planes futuros: Se planea soporte para clonacion de voz por referencia de audio y pipeline de fine-tuning.
STT → LLM → TTS Pipeline
Incluso sin un modelo omni, puede configurar STT y TTS individualmente para conversaciones de voz.
STT (Reconocimiento de voz)
Seleccione en Ajustes > Voz:
| Proveedor | Sin conexion | Clave API | Costo |
|---|---|---|---|
| Web Speech API | No | No requerida | Gratis |
| Vosk | Si | No requerida | Gratis |
| Whisper | Si | No requerida | Gratis |
| Naia Cloud | No | No requerida (login) | Creditos |
| vLLM ASR | Si (local) | No requerida | Gratis |
TTS (Sintesis de voz)
Seleccione en Ajustes > Voz:
| Proveedor | Sin conexion | Clave API | Costo |
|---|---|---|---|
| Naia Cloud TTS | No | No requerida (login) | Creditos |
| Edge TTS | No | No requerida | Gratis |
| Google Cloud TTS | No | Requerida | $0.016/1K caracteres |
| OpenAI TTS | No | Requerida | $0.015/1K caracteres |
| ElevenLabs | No | Requerida | $0.30/1K caracteres |
| vLLM TTS | Si (local) | No requerida | Gratis |
| Personalizado | Varia | Varia | Varia |
Haga clic en el boton Vista previa para probar la voz seleccionada.
Ejemplos de combinaciones
| Entorno | STT | LLM | TTS | Costo |
|---|---|---|---|---|
| Completamente gratis | Vosk | Ollama (local) | Edge TTS | Gratis |
| Economico | Web Speech | Gemini 2.5 Flash | Edge TTS | ~$0.3/1M tokens |
| Alta calidad | Whisper | Claude Sonnet | ElevenLabs | Costos de API |
| Naia Cloud | Naia Cloud STT | Naia Cloud LLM | Naia Cloud TTS | Solo creditos |
| Completamente local (GPU) | vLLM ASR | vLLM | vLLM TTS | Gratis |