Naia mendukung percakapan suara secara real-time melalui mode Omni, selain chat teks. Alih-alih pipeline tradisional STT (speech-to-text) → LLM (pemrosesan) → TTS (text-to-speech), mode Omni menggunakan model yang langsung memahami dan merespons dengan suara.
Apa itu Mode Omni?
Percakapan suara tradisional melewati tiga tahap:
- STT: Mengubah ucapan pengguna menjadi teks
- LLM: Memahami teks dan menghasilkan respons
- TTS: Mengubah teks respons menjadi ucapan
Mode Omni memproses semua ini dalam satu model tunggal. Model ini langsung memahami nada suara, emosi, dan nuansa, merespons dengan ucapan alami untuk percakapan yang lebih cepat dan natural.
Gemini 2.5 Flash Live
Menggunakan model Gemini 2.5 Flash dari Google untuk percakapan suara secara real-time.
Pengaturan
- Buka Pengaturan > AI dan pilih Gemini atau Naia Cloud sebagai penyedia
- Pilih Gemini 2.5 Flash Live 🗣️ dari daftar model
- Koneksi langsung memerlukan kunci API Google. Penggunaan Naia Cloud tidak memerlukan kunci terpisah — cukup kredit
Pemilihan Suara
Pilih dari 8 suara:
| Suara | Karakter |
|---|---|
| Kore | Perempuan, tenang (default) |
| Puck | Laki-laki, ceria |
| Charon | Laki-laki |
| Aoede | Perempuan |
| Fenrir | Laki-laki |
| Leda | Perempuan |
| Orus | Laki-laki |
| Zephyr | Netral |
Fitur
- Latensi sangat rendah melalui koneksi WebSocket real-time
- Transkripsi lengkap disediakan untuk ucapan pengguna dan respons AI
- Biaya sekitar $0,03/menit (koneksi langsung)
- Kredit dikurangi saat menggunakan Naia Cloud
vLLM + MiniCPM-o 4.5 (Omni Lokal)
Jalankan percakapan suara omni sepenuhnya secara lokal. Menggunakan model MiniCPM-o 4.5 dari OpenBMB melalui server vLLM.
Persyaratan
| Mode | VRAM | Catatan |
|---|---|---|
| BF16 (disarankan) | ~19GB | Dukungan penuh input/output suara |
| INT4 | ~11GB | Hanya teks, tanpa output suara |
Pengaturan
- Server vLLM: Jalankan server MiniCPM-o di mesin dengan GPU
cd naia-os/voice-server/minicpm-o
bash setup.sh # Unduh model + instal dependensi
python server.py # Mulai server dalam mode BF16
-
Aplikasi Naia: Buka Pengaturan > AI, pilih vLLM sebagai penyedia, dan pilih model MiniCPM-o 🗣️
-
URL Server: Masukkan alamat server (misalnya,
ws://localhost:8765/wsuntuk lokal)
GPU Jarak Jauh (RunPod, dll.)
Jika Anda tidak memiliki GPU lokal, gunakan layanan GPU cloud seperti RunPod:
# Di instance RunPod
git clone https://github.com/nextain/naia-os.git
cd naia-os/voice-server/minicpm-o
bash setup.sh
python server.py --host 0.0.0.0
Atur URL server ke wss://<pod-id>-8765.proxy.runpod.net di pengaturan Naia.
Batasan yang Diketahui
- Saat ini hanya mendukung bahasa Inggris dan Mandarin (tidak ada STT bahasa Korea)
- Hanya half-duplex — tidak dapat berbicara dan mendengarkan secara bersamaan
- Output suara tidak berfungsi dalam mode kuantisasi INT4
Pengaturan Pipeline STT → LLM → TTS
Jika Anda tidak menggunakan model omni, Anda dapat mengonfigurasi STT dan TTS secara individual untuk percakapan suara.
STT (Pengenalan Suara)
Pilih penyedia STT di Pengaturan > Suara:
| Penyedia | Offline | Kunci API | Biaya | Catatan |
|---|---|---|---|---|
| Web Speech API | Tidak | Tidak diperlukan | Gratis | Bawaan browser, ketersediaan bervariasi per OS |
| Vosk | Ya | Tidak diperlukan | Gratis | Streaming real-time, model ~40-80MB |
| Whisper | Ya | Tidak diperlukan | Gratis | Akurasi tinggi, akselerasi GPU |
| Naia Cloud | Tidak | Tidak diperlukan (login Naia) | Kredit | STT cloud |
| vLLM ASR | Ya (lokal) | Tidak diperlukan | Gratis | Memerlukan server sendiri |
Penyedia offline (Vosk, Whisper) berfungsi tanpa internet.
TTS (Sintesis Suara)
Pilih penyedia TTS di Pengaturan > Suara:
| Penyedia | Offline | Kunci API | Biaya | Catatan |
|---|---|---|---|---|
| Naia Cloud TTS | Tidak | Tidak diperlukan (login Naia) | Kredit | Suara Google Chirp3 HD |
| Edge TTS | Tidak | Tidak diperlukan | Gratis | Suara Microsoft Edge |
| Google Cloud TTS | Tidak | Diperlukan | $0,016/1K karakter | Suara Neural2/WaveNet |
| OpenAI TTS | Tidak | Diperlukan | $0,015/1K karakter | Suara OpenAI (Alloy + 12 lainnya) |
| ElevenLabs | Tidak | Diperlukan | $0,30/1K karakter | Síntesis premium (50+ suara) |
| vLLM TTS | Ya (lokal) | Tidak diperlukan | Gratis | Memerlukan server sendiri |
| Custom | Bervariasi | Bervariasi | Bervariasi | Endpoint yang ditentukan pengguna |
Pratinjau
Setelah memilih penyedia TTS, klik tombol Pratinjau untuk menguji suara yang dipilih.
Contoh Kombinasi
Berbagai kombinasi dimungkinkan tergantung pada pengaturan Anda:
| Lingkungan | STT | LLM | TTS | Biaya |
|---|---|---|---|---|
| Sepenuhnya Gratis | Vosk | Ollama (lokal) | Edge TTS | Gratis |
| Hemat Biaya | Web Speech | Gemini 2.5 Flash | Edge TTS | ~$0,3/1M token |
| Kualitas Tinggi | Whisper | Claude Sonnet | ElevenLabs | Biaya API |
| Naia Cloud | Naia Cloud STT | Naia Cloud LLM | Naia Cloud TTS | Hanya kredit |
| Sepenuhnya Lokal (GPU) | vLLM ASR | vLLM | vLLM TTS | Gratis |