O Naia suporta conversas por voz em tempo real através do modo Omni, além do chat por texto. Em vez do pipeline tradicional STT (fala para texto) → LLM (processamento) → TTS (texto para fala), o modo Omni usa modelos que compreendem e respondem diretamente com voz.
O que é o Modo Omni?
Conversas por voz tradicionais passam por três etapas:
- STT: Converter a fala do usuário em texto
- LLM: Compreender o texto e gerar resposta
- TTS: Converter o texto da resposta em fala
O modo Omni processa tudo isso em um único modelo. Ele compreende diretamente o tom vocal, emoção e nuances, respondendo com fala natural para conversas mais rápidas e naturais.
Gemini 2.5 Flash Live
Usa o modelo Gemini 2.5 Flash do Google para conversas por voz em tempo real.
Configuração
- Vá em Configurações > IA e selecione Gemini ou Naia Cloud como provedor
- Escolha Gemini 2.5 Flash Live 🗣️ na lista de modelos
- Conexão direta requer uma chave de API do Google. O uso via Naia Cloud não requer chave separada — apenas créditos
Seleção de Voz
Escolha entre 8 vozes:
| Voz | Característica |
|---|---|
| Kore | Feminina, calma (padrão) |
| Puck | Masculina, animada |
| Charon | Masculina |
| Aoede | Feminina |
| Fenrir | Masculina |
| Leda | Feminina |
| Orus | Masculina |
| Zephyr | Neutra |
Recursos
- Latência muito baixa via conexão WebSocket em tempo real
- Transcrição completa fornecida tanto para a fala do usuário quanto para as respostas da IA
- Custo aproximado de $0,03/min (conexão direta)
- Créditos deduzidos ao usar o Naia Cloud
vLLM + MiniCPM-o 4.5 (Omni Local)
Execute conversas por voz omni totalmente local. Usa o modelo MiniCPM-o 4.5 da OpenBMB através de um servidor vLLM.
Requisitos
| Modo | VRAM | Observações |
|---|---|---|
| BF16 (recomendado) | ~19GB | Suporte completo a entrada/saída de voz |
| INT4 | ~11GB | Apenas texto, sem saída de voz |
Configuração
- Servidor vLLM: Execute o servidor MiniCPM-o em uma máquina com GPU
cd naia-os/voice-server/minicpm-o
bash setup.sh # Baixar modelo + instalar dependências
python server.py # Iniciar servidor no modo BF16
-
App Naia: Vá em Configurações > IA, selecione vLLM como provedor e escolha o modelo MiniCPM-o 🗣️
-
URL do Servidor: Insira o endereço do servidor (ex.:
ws://localhost:8765/wspara local)
GPU Remota (RunPod, etc.)
Se você não tem uma GPU local, use serviços de GPU na nuvem como o RunPod:
# Na instância RunPod
git clone https://github.com/nextain/naia-os.git
cd naia-os/voice-server/minicpm-o
bash setup.sh
python server.py --host 0.0.0.0
Configure a URL do servidor para wss://<pod-id>-8765.proxy.runpod.net nas configurações do Naia.
Limitações Conhecidas
- Atualmente suporta apenas inglês e chinês (sem STT em coreano)
- Apenas half-duplex — não é possível falar e ouvir simultaneamente
- A saída de voz não funciona no modo de quantização INT4
Configuração do Pipeline STT → LLM → TTS
Se você não está usando um modelo omni, pode configurar STT e TTS individualmente para conversas por voz.
STT (Reconhecimento de Fala)
Selecione um provedor de STT em Configurações > Voz:
| Provedor | Offline | Chave API | Custo | Observações |
|---|---|---|---|---|
| Web Speech API | Não | Não necessária | Gratuito | Integrado ao navegador, disponibilidade varia por SO |
| Vosk | Sim | Não necessária | Gratuito | Streaming em tempo real, modelo de ~40-80MB |
| Whisper | Sim | Não necessária | Gratuito | Alta precisão, aceleração por GPU |
| Naia Cloud | Não | Não necessária (login Naia) | Créditos | STT na nuvem |
| vLLM ASR | Sim (local) | Não necessária | Gratuito | Requer servidor próprio |
Provedores offline (Vosk, Whisper) funcionam sem internet.
TTS (Síntese de Fala)
Selecione um provedor de TTS em Configurações > Voz:
| Provedor | Offline | Chave API | Custo | Observações |
|---|---|---|---|---|
| Naia Cloud TTS | Não | Não necessária (login Naia) | Créditos | Vozes Google Chirp3 HD |
| Edge TTS | Não | Não necessária | Gratuito | Vozes do Microsoft Edge |
| Google Cloud TTS | Não | Necessária | $0,016/1K caracteres | Vozes Neural2/WaveNet |
| OpenAI TTS | Não | Necessária | $0,015/1K caracteres | Vozes OpenAI (Alloy + 12 mais) |
| ElevenLabs | Não | Necessária | $0,30/1K caracteres | Síntese premium (50+ vozes) |
| vLLM TTS | Sim (local) | Não necessária | Gratuito | Requer servidor próprio |
| Custom | Varia | Varia | Varia | Endpoint definido pelo usuário |
Pré-visualização
Após selecionar um provedor de TTS, clique no botão Pré-visualizar para testar a voz selecionada.
Combinações de Exemplo
Diversas combinações são possíveis dependendo da sua configuração:
| Ambiente | STT | LLM | TTS | Custo |
|---|---|---|---|---|
| Totalmente Gratuito | Vosk | Ollama (local) | Edge TTS | Gratuito |
| Econômico | Web Speech | Gemini 2.5 Flash | Edge TTS | ~$0,3/1M tokens |
| Alta Qualidade | Whisper | Claude Sonnet | ElevenLabs | Custos de API |
| Naia Cloud | Naia Cloud STT | Naia Cloud LLM | Naia Cloud TTS | Apenas créditos |
| Totalmente Local (GPU) | vLLM ASR | vLLM | vLLM TTS | Gratuito |