Naia hỗ trợ hội thoại bằng giọng nói theo thời gian thực thông qua chế độ Omni, ngoài chat văn bản. Thay vì pipeline truyền thống STT (chuyển giọng nói thành văn bản) → LLM (xử lý) → TTS (chuyển văn bản thành giọng nói), chế độ Omni sử dụng các mô hình trực tiếp hiểu và phản hồi bằng giọng nói.
Chế Độ Omni Là Gì?
Hội thoại giọng nói truyền thống đi qua ba giai đoạn:
- STT: Chuyển đổi giọng nói của người dùng thành văn bản
- LLM: Hiểu văn bản và tạo phản hồi
- TTS: Chuyển đổi văn bản phản hồi thành giọng nói
Chế độ Omni xử lý tất cả trong một mô hình duy nhất. Nó trực tiếp hiểu ngữ điệu, cảm xúc và sắc thái giọng nói, phản hồi bằng giọng nói tự nhiên cho các cuộc hội thoại nhanh hơn và tự nhiên hơn.
Gemini 2.5 Flash Live
Sử dụng mô hình Gemini 2.5 Flash của Google cho hội thoại giọng nói theo thời gian thực.
Thiết Lập
- Vào Cài đặt > AI và chọn Gemini hoặc Naia Cloud làm nhà cung cấp
- Chọn Gemini 2.5 Flash Live 🗣️ từ danh sách mô hình
- Kết nối trực tiếp yêu cầu khóa API Google. Sử dụng Naia Cloud không cần khóa riêng — chỉ cần tín dụng
Chọn Giọng Nói
Chọn từ 8 giọng nói:
| Giọng | Đặc Điểm |
|---|---|
| Kore | Nữ, điềm tĩnh (mặc định) |
| Puck | Nam, sôi nổi |
| Charon | Nam |
| Aoede | Nữ |
| Fenrir | Nam |
| Leda | Nữ |
| Orus | Nam |
| Zephyr | Trung tính |
Tính Năng
- Độ trễ rất thấp qua kết nối WebSocket thời gian thực
- Cung cấp bản phiên âm đầy đủ cho cả giọng nói người dùng và phản hồi AI
- Chi phí khoảng $0,03/phút (kết nối trực tiếp)
- Tín dụng bị trừ khi sử dụng Naia Cloud
vLLM + MiniCPM-o 4.5 (Omni Cục Bộ)
Chạy hội thoại giọng nói omni hoàn toàn cục bộ. Sử dụng mô hình MiniCPM-o 4.5 của OpenBMB thông qua máy chủ vLLM.
Yêu Cầu
| Chế Độ | VRAM | Ghi Chú |
|---|---|---|
| BF16 (khuyến nghị) | ~19GB | Hỗ trợ đầy đủ đầu vào/đầu ra giọng nói |
| INT4 | ~11GB | Chỉ văn bản, không có đầu ra giọng nói |
Thiết Lập
- Máy chủ vLLM: Chạy máy chủ MiniCPM-o trên máy có GPU
cd naia-os/voice-server/minicpm-o
bash setup.sh # Tải mô hình + cài đặt phụ thuộc
python server.py # Khởi động máy chủ ở chế độ BF16
-
Ứng dụng Naia: Vào Cài đặt > AI, chọn vLLM làm nhà cung cấp, và chọn mô hình MiniCPM-o 🗣️
-
URL Máy Chủ: Nhập địa chỉ máy chủ (ví dụ:
ws://localhost:8765/wscho cục bộ)
GPU Từ Xa (RunPod, v.v.)
Nếu bạn không có GPU cục bộ, hãy sử dụng dịch vụ GPU đám mây như RunPod:
# Trên instance RunPod
git clone https://github.com/nextain/naia-os.git
cd naia-os/voice-server/minicpm-o
bash setup.sh
python server.py --host 0.0.0.0
Đặt URL máy chủ thành wss://<pod-id>-8765.proxy.runpod.net trong cài đặt Naia.
Hạn Chế Đã Biết
- Hiện chỉ hỗ trợ tiếng Anh và tiếng Trung (không có STT tiếng Hàn)
- Chỉ half-duplex — không thể nói và nghe cùng lúc
- Đầu ra giọng nói không hoạt động ở chế độ lượng tử hóa INT4
Thiết Lập Pipeline STT → LLM → TTS
Nếu bạn không sử dụng mô hình omni, bạn có thể cấu hình STT và TTS riêng lẻ cho hội thoại giọng nói.
STT (Nhận Dạng Giọng Nói)
Chọn nhà cung cấp STT trong Cài đặt > Giọng nói:
| Nhà Cung Cấp | Offline | Khóa API | Chi Phí | Ghi Chú |
|---|---|---|---|---|
| Web Speech API | Không | Không cần | Miễn phí | Tích hợp trình duyệt, khả dụng tùy hệ điều hành |
| Vosk | Có | Không cần | Miễn phí | Streaming thời gian thực, mô hình ~40-80MB |
| Whisper | Có | Không cần | Miễn phí | Độ chính xác cao, tăng tốc GPU |
| Naia Cloud | Không | Không cần (đăng nhập Naia) | Tín dụng | STT đám mây |
| vLLM ASR | Có (cục bộ) | Không cần | Miễn phí | Cần máy chủ riêng |
Các nhà cung cấp offline (Vosk, Whisper) hoạt động không cần internet.
TTS (Tổng Hợp Giọng Nói)
Chọn nhà cung cấp TTS trong Cài đặt > Giọng nói:
| Nhà Cung Cấp | Offline | Khóa API | Chi Phí | Ghi Chú |
|---|---|---|---|---|
| Naia Cloud TTS | Không | Không cần (đăng nhập Naia) | Tín dụng | Giọng Google Chirp3 HD |
| Edge TTS | Không | Không cần | Miễn phí | Giọng Microsoft Edge |
| Google Cloud TTS | Không | Cần | $0,016/1K ký tự | Giọng Neural2/WaveNet |
| OpenAI TTS | Không | Cần | $0,015/1K ký tự | Giọng OpenAI (Alloy + 12 khác) |
| ElevenLabs | Không | Cần | $0,30/1K ký tự | Tổng hợp cao cấp (50+ giọng) |
| vLLM TTS | Có (cục bộ) | Không cần | Miễn phí | Cần máy chủ riêng |
| Custom | Khác nhau | Khác nhau | Khác nhau | Endpoint do người dùng xác định |
Xem Trước
Sau khi chọn nhà cung cấp TTS, nhấp nút Xem trước để thử giọng nói đã chọn.
Các Tổ Hợp Ví Dụ
Nhiều tổ hợp khác nhau có thể thực hiện tùy thuộc vào thiết lập của bạn:
| Môi Trường | STT | LLM | TTS | Chi Phí |
|---|---|---|---|---|
| Hoàn Toàn Miễn Phí | Vosk | Ollama (cục bộ) | Edge TTS | Miễn phí |
| Tiết Kiệm | Web Speech | Gemini 2.5 Flash | Edge TTS | ~$0,3/1M token |
| Chất Lượng Cao | Whisper | Claude Sonnet | ElevenLabs | Chi phí API |
| Naia Cloud | Naia Cloud STT | Naia Cloud LLM | Naia Cloud TTS | Chỉ tín dụng |
| Hoàn Toàn Cục Bộ (GPU) | vLLM ASR | vLLM | vLLM TTS | Miễn phí |