Naia
Índice
  1. 1Manual em vídeo
  2. 2Naia OS Live USB
  3. 3Instalação e implantação
  4. 3.1Instalação do Naia OS (ISO)
  5. 3.2Instalação do app
  6. 4Primeiros passos
  7. 4.1Naia Model Pricing
  8. 4.2naia-omni-cascade
  9. 4.3demo
  10. 4.4naia-offline
  11. 4.5naia-model-dev
  12. 4.6naia-online
  13. 5Tela principal
  14. 6Bate-papo
  15. 6.1DJ de rádio pessoal e guia de exposição
  16. 7Histórico de conversas
  17. 8Progresso do Trabalho
  18. 9Habilidades
  19. 10Canais
  20. 11Agentes
  21. 12Diagnóstico
  22. 13Área de Trabalho
  23. 14Navegador
  24. 15Gerenciamento de Painéis
  25. 16Conversa por Voz
  26. 17Configurações
  27. 18Detalhes da ferramenta
  28. 19Conta Naia
  29. 20Solução de problemas
  30. 21Uso e contribuição de código aberto

16. Conversa por Voz

O Naia suporta conversas por voz em tempo real através do modo Omni, além do chat por texto. Em vez do pipeline tradicional STT (fala para texto) → LLM (processamento) → TTS (texto para fala), o modo Omni usa modelos que compreendem e respondem diretamente com voz.

O que é o Modo Omni?

Conversas por voz tradicionais passam por três etapas:

  1. STT: Converter a fala do usuário em texto
  2. LLM: Compreender o texto e gerar resposta
  3. TTS: Converter o texto da resposta em fala

O modo Omni processa tudo isso em um único modelo. Ele compreende diretamente o tom vocal, emoção e nuances, respondendo com fala natural para conversas mais rápidas e naturais.

Gemini 2.5 Flash Live

Usa o modelo Gemini 2.5 Flash do Google para conversas por voz em tempo real.

Configuração

  1. Vá em Configurações > IA e selecione Gemini ou Naia Cloud como provedor
  2. Escolha Gemini 2.5 Flash Live 🗣️ na lista de modelos
  3. Conexão direta requer uma chave de API do Google. O uso via Naia Cloud não requer chave separada — apenas créditos

Seleção de Voz

Escolha entre 8 vozes:

VozCaracterística
KoreFeminina, calma (padrão)
PuckMasculina, animada
CharonMasculina
AoedeFeminina
FenrirMasculina
LedaFeminina
OrusMasculina
ZephyrNeutra

Recursos

  • Latência muito baixa via conexão WebSocket em tempo real
  • Transcrição completa fornecida tanto para a fala do usuário quanto para as respostas da IA
  • Custo aproximado de $0,03/min (conexão direta)
  • Créditos deduzidos ao usar o Naia Cloud

vLLM + MiniCPM-o 4.5 (Omni Local)

Execute conversas por voz omni totalmente local. Usa o modelo MiniCPM-o 4.5 da OpenBMB através de um servidor vLLM.

Requisitos

ModoVRAMObservações
BF16 (recomendado)~19GBSuporte completo a entrada/saída de voz
INT4~11GBApenas texto, sem saída de voz

Configuração

  1. Servidor vLLM: Execute o servidor MiniCPM-o em uma máquina com GPU
cd naia-os/voice-server/minicpm-o
bash setup.sh          # Baixar modelo + instalar dependências
python server.py       # Iniciar servidor no modo BF16
  1. App Naia: Vá em Configurações > IA, selecione vLLM como provedor e escolha o modelo MiniCPM-o 🗣️

  2. URL do Servidor: Insira o endereço do servidor (ex.: ws://localhost:8765/ws para local)

GPU Remota (RunPod, etc.)

Se você não tem uma GPU local, use serviços de GPU na nuvem como o RunPod:

# Na instância RunPod
git clone https://github.com/nextain/naia-os.git
cd naia-os/voice-server/minicpm-o
bash setup.sh
python server.py --host 0.0.0.0

Configure a URL do servidor para wss://<pod-id>-8765.proxy.runpod.net nas configurações do Naia.

Limitações Conhecidas

  • Atualmente suporta apenas inglês e chinês (sem STT em coreano)
  • Apenas half-duplex — não é possível falar e ouvir simultaneamente
  • A saída de voz não funciona no modo de quantização INT4

Configuração do Pipeline STT → LLM → TTS

Se você não está usando um modelo omni, pode configurar STT e TTS individualmente para conversas por voz.

STT (Reconhecimento de Fala)

Selecione um provedor de STT em Configurações > Voz:

ProvedorOfflineChave APICustoObservações
Web Speech APINãoNão necessáriaGratuitoIntegrado ao navegador, disponibilidade varia por SO
VoskSimNão necessáriaGratuitoStreaming em tempo real, modelo de ~40-80MB
WhisperSimNão necessáriaGratuitoAlta precisão, aceleração por GPU
Naia CloudNãoNão necessária (login Naia)CréditosSTT na nuvem
vLLM ASRSim (local)Não necessáriaGratuitoRequer servidor próprio

Provedores offline (Vosk, Whisper) funcionam sem internet.

TTS (Síntese de Fala)

Selecione um provedor de TTS em Configurações > Voz:

ProvedorOfflineChave APICustoObservações
Naia Cloud TTSNãoNão necessária (login Naia)CréditosVozes Google Chirp3 HD
Edge TTSNãoNão necessáriaGratuitoVozes do Microsoft Edge
Google Cloud TTSNãoNecessária$0,016/1K caracteresVozes Neural2/WaveNet
OpenAI TTSNãoNecessária$0,015/1K caracteresVozes OpenAI (Alloy + 12 mais)
ElevenLabsNãoNecessária$0,30/1K caracteresSíntese premium (50+ vozes)
vLLM TTSSim (local)Não necessáriaGratuitoRequer servidor próprio
CustomVariaVariaVariaEndpoint definido pelo usuário

Pré-visualização

Após selecionar um provedor de TTS, clique no botão Pré-visualizar para testar a voz selecionada.

Combinações de Exemplo

Diversas combinações são possíveis dependendo da sua configuração:

AmbienteSTTLLMTTSCusto
Totalmente GratuitoVoskOllama (local)Edge TTSGratuito
EconômicoWeb SpeechGemini 2.5 FlashEdge TTS~$0,3/1M tokens
Alta QualidadeWhisperClaude SonnetElevenLabsCustos de API
Naia CloudNaia Cloud STTNaia Cloud LLMNaia Cloud TTSApenas créditos
Totalmente Local (GPU)vLLM ASRvLLMvLLM TTSGratuito