Naia
Daftar Isi
  1. 1Manual Video
  2. 2Naia OS Live USB
  3. 3Instalasi & Penerapan
  4. 3.1Instalasi Naia OS (ISO)
  5. 3.2Instalasi Aplikasi
  6. 4Memulai
  7. 4.1Naia Model Pricing
  8. 4.2naia-omni-cascade
  9. 4.3demo
  10. 4.4naia-offline
  11. 4.5naia-model-dev
  12. 4.6naia-online
  13. 5Layar Utama
  14. 6Obrolan
  15. 6.1DJ Radio Pribadi & Pemandu Pameran
  16. 7Riwayat Percakapan
  17. 8Kemajuan Pekerjaan
  18. 9Keterampilan
  19. 10Saluran
  20. 11Agen
  21. 12Diagnostik
  22. 13Ruang Kerja
  23. 14Browser
  24. 15Manajemen Panel
  25. 16Obrolan Suara
  26. 17Pengaturan
  27. 18Detail Alat
  28. 19Akun Naia
  29. 20Pemecahan masalah
  30. 21Penggunaan dan kontribusi sumber terbuka

16. Obrolan Suara

Naia mendukung percakapan suara secara real-time melalui mode Omni, selain chat teks. Alih-alih pipeline tradisional STT (speech-to-text) → LLM (pemrosesan) → TTS (text-to-speech), mode Omni menggunakan model yang langsung memahami dan merespons dengan suara.

Apa itu Mode Omni?

Percakapan suara tradisional melewati tiga tahap:

  1. STT: Mengubah ucapan pengguna menjadi teks
  2. LLM: Memahami teks dan menghasilkan respons
  3. TTS: Mengubah teks respons menjadi ucapan

Mode Omni memproses semua ini dalam satu model tunggal. Model ini langsung memahami nada suara, emosi, dan nuansa, merespons dengan ucapan alami untuk percakapan yang lebih cepat dan natural.

Gemini 2.5 Flash Live

Menggunakan model Gemini 2.5 Flash dari Google untuk percakapan suara secara real-time.

Pengaturan

  1. Buka Pengaturan > AI dan pilih Gemini atau Naia Cloud sebagai penyedia
  2. Pilih Gemini 2.5 Flash Live 🗣️ dari daftar model
  3. Koneksi langsung memerlukan kunci API Google. Penggunaan Naia Cloud tidak memerlukan kunci terpisah — cukup kredit

Pemilihan Suara

Pilih dari 8 suara:

SuaraKarakter
KorePerempuan, tenang (default)
PuckLaki-laki, ceria
CharonLaki-laki
AoedePerempuan
FenrirLaki-laki
LedaPerempuan
OrusLaki-laki
ZephyrNetral

Fitur

  • Latensi sangat rendah melalui koneksi WebSocket real-time
  • Transkripsi lengkap disediakan untuk ucapan pengguna dan respons AI
  • Biaya sekitar $0,03/menit (koneksi langsung)
  • Kredit dikurangi saat menggunakan Naia Cloud

vLLM + MiniCPM-o 4.5 (Omni Lokal)

Jalankan percakapan suara omni sepenuhnya secara lokal. Menggunakan model MiniCPM-o 4.5 dari OpenBMB melalui server vLLM.

Persyaratan

ModeVRAMCatatan
BF16 (disarankan)~19GBDukungan penuh input/output suara
INT4~11GBHanya teks, tanpa output suara

Pengaturan

  1. Server vLLM: Jalankan server MiniCPM-o di mesin dengan GPU
cd naia-os/voice-server/minicpm-o
bash setup.sh          # Unduh model + instal dependensi
python server.py       # Mulai server dalam mode BF16
  1. Aplikasi Naia: Buka Pengaturan > AI, pilih vLLM sebagai penyedia, dan pilih model MiniCPM-o 🗣️

  2. URL Server: Masukkan alamat server (misalnya, ws://localhost:8765/ws untuk lokal)

GPU Jarak Jauh (RunPod, dll.)

Jika Anda tidak memiliki GPU lokal, gunakan layanan GPU cloud seperti RunPod:

# Di instance RunPod
git clone https://github.com/nextain/naia-os.git
cd naia-os/voice-server/minicpm-o
bash setup.sh
python server.py --host 0.0.0.0

Atur URL server ke wss://<pod-id>-8765.proxy.runpod.net di pengaturan Naia.

Batasan yang Diketahui

  • Saat ini hanya mendukung bahasa Inggris dan Mandarin (tidak ada STT bahasa Korea)
  • Hanya half-duplex — tidak dapat berbicara dan mendengarkan secara bersamaan
  • Output suara tidak berfungsi dalam mode kuantisasi INT4

Pengaturan Pipeline STT → LLM → TTS

Jika Anda tidak menggunakan model omni, Anda dapat mengonfigurasi STT dan TTS secara individual untuk percakapan suara.

STT (Pengenalan Suara)

Pilih penyedia STT di Pengaturan > Suara:

PenyediaOfflineKunci APIBiayaCatatan
Web Speech APITidakTidak diperlukanGratisBawaan browser, ketersediaan bervariasi per OS
VoskYaTidak diperlukanGratisStreaming real-time, model ~40-80MB
WhisperYaTidak diperlukanGratisAkurasi tinggi, akselerasi GPU
Naia CloudTidakTidak diperlukan (login Naia)KreditSTT cloud
vLLM ASRYa (lokal)Tidak diperlukanGratisMemerlukan server sendiri

Penyedia offline (Vosk, Whisper) berfungsi tanpa internet.

TTS (Sintesis Suara)

Pilih penyedia TTS di Pengaturan > Suara:

PenyediaOfflineKunci APIBiayaCatatan
Naia Cloud TTSTidakTidak diperlukan (login Naia)KreditSuara Google Chirp3 HD
Edge TTSTidakTidak diperlukanGratisSuara Microsoft Edge
Google Cloud TTSTidakDiperlukan$0,016/1K karakterSuara Neural2/WaveNet
OpenAI TTSTidakDiperlukan$0,015/1K karakterSuara OpenAI (Alloy + 12 lainnya)
ElevenLabsTidakDiperlukan$0,30/1K karakterSíntesis premium (50+ suara)
vLLM TTSYa (lokal)Tidak diperlukanGratisMemerlukan server sendiri
CustomBervariasiBervariasiBervariasiEndpoint yang ditentukan pengguna

Pratinjau

Setelah memilih penyedia TTS, klik tombol Pratinjau untuk menguji suara yang dipilih.

Contoh Kombinasi

Berbagai kombinasi dimungkinkan tergantung pada pengaturan Anda:

LingkunganSTTLLMTTSBiaya
Sepenuhnya GratisVoskOllama (lokal)Edge TTSGratis
Hemat BiayaWeb SpeechGemini 2.5 FlashEdge TTS~$0,3/1M token
Kualitas TinggiWhisperClaude SonnetElevenLabsBiaya API
Naia CloudNaia Cloud STTNaia Cloud LLMNaia Cloud TTSHanya kredit
Sepenuhnya Lokal (GPU)vLLM ASRvLLMvLLM TTSGratis