Naia
Mục lục
  1. 1Hướng dẫn video
  2. 2Naia OS Live USB
  3. 3Cài đặt & Triển khai
  4. 3.1Cài đặt Naia OS (ISO)
  5. 3.2Cài đặt ứng dụng
  6. 4Bắt đầu
  7. 4.1Naia Model Pricing
  8. 4.2naia-omni-cascade
  9. 4.3demo
  10. 4.4naia-offline
  11. 4.5naia-model-dev
  12. 4.6naia-online
  13. 5Màn hình chính
  14. 6Trò chuyện
  15. 6.1DJ radio cá nhân và hướng dẫn triển lãm
  16. 7Lịch sử hội thoại
  17. 8Tiến độ công việc
  18. 9Kỹ năng
  19. 10Kênh
  20. 11Đại lý
  21. 12Chẩn đoán
  22. 13Không gian làm việc
  23. 14Trình duyệt
  24. 15Quản lý bảng điều khiển
  25. 16Trò chuyện bằng giọng nói
  26. 17Cài đặt
  27. 18Chi tiết công cụ
  28. 19Tài khoản Naia
  29. 20Khắc phục sự cố
  30. 21Sử dụng và đóng góp mã nguồn mở

16. Trò chuyện bằng giọng nói

Naia hỗ trợ hội thoại bằng giọng nói theo thời gian thực thông qua chế độ Omni, ngoài chat văn bản. Thay vì pipeline truyền thống STT (chuyển giọng nói thành văn bản) → LLM (xử lý) → TTS (chuyển văn bản thành giọng nói), chế độ Omni sử dụng các mô hình trực tiếp hiểu và phản hồi bằng giọng nói.

Chế Độ Omni Là Gì?

Hội thoại giọng nói truyền thống đi qua ba giai đoạn:

  1. STT: Chuyển đổi giọng nói của người dùng thành văn bản
  2. LLM: Hiểu văn bản và tạo phản hồi
  3. TTS: Chuyển đổi văn bản phản hồi thành giọng nói

Chế độ Omni xử lý tất cả trong một mô hình duy nhất. Nó trực tiếp hiểu ngữ điệu, cảm xúc và sắc thái giọng nói, phản hồi bằng giọng nói tự nhiên cho các cuộc hội thoại nhanh hơn và tự nhiên hơn.

Gemini 2.5 Flash Live

Sử dụng mô hình Gemini 2.5 Flash của Google cho hội thoại giọng nói theo thời gian thực.

Thiết Lập

  1. Vào Cài đặt > AI và chọn Gemini hoặc Naia Cloud làm nhà cung cấp
  2. Chọn Gemini 2.5 Flash Live 🗣️ từ danh sách mô hình
  3. Kết nối trực tiếp yêu cầu khóa API Google. Sử dụng Naia Cloud không cần khóa riêng — chỉ cần tín dụng

Chọn Giọng Nói

Chọn từ 8 giọng nói:

GiọngĐặc Điểm
KoreNữ, điềm tĩnh (mặc định)
PuckNam, sôi nổi
CharonNam
AoedeNữ
FenrirNam
LedaNữ
OrusNam
ZephyrTrung tính

Tính Năng

  • Độ trễ rất thấp qua kết nối WebSocket thời gian thực
  • Cung cấp bản phiên âm đầy đủ cho cả giọng nói người dùng và phản hồi AI
  • Chi phí khoảng $0,03/phút (kết nối trực tiếp)
  • Tín dụng bị trừ khi sử dụng Naia Cloud

vLLM + MiniCPM-o 4.5 (Omni Cục Bộ)

Chạy hội thoại giọng nói omni hoàn toàn cục bộ. Sử dụng mô hình MiniCPM-o 4.5 của OpenBMB thông qua máy chủ vLLM.

Yêu Cầu

Chế ĐộVRAMGhi Chú
BF16 (khuyến nghị)~19GBHỗ trợ đầy đủ đầu vào/đầu ra giọng nói
INT4~11GBChỉ văn bản, không có đầu ra giọng nói

Thiết Lập

  1. Máy chủ vLLM: Chạy máy chủ MiniCPM-o trên máy có GPU
cd naia-os/voice-server/minicpm-o
bash setup.sh          # Tải mô hình + cài đặt phụ thuộc
python server.py       # Khởi động máy chủ ở chế độ BF16
  1. Ứng dụng Naia: Vào Cài đặt > AI, chọn vLLM làm nhà cung cấp, và chọn mô hình MiniCPM-o 🗣️

  2. URL Máy Chủ: Nhập địa chỉ máy chủ (ví dụ: ws://localhost:8765/ws cho cục bộ)

GPU Từ Xa (RunPod, v.v.)

Nếu bạn không có GPU cục bộ, hãy sử dụng dịch vụ GPU đám mây như RunPod:

# Trên instance RunPod
git clone https://github.com/nextain/naia-os.git
cd naia-os/voice-server/minicpm-o
bash setup.sh
python server.py --host 0.0.0.0

Đặt URL máy chủ thành wss://<pod-id>-8765.proxy.runpod.net trong cài đặt Naia.

Hạn Chế Đã Biết

  • Hiện chỉ hỗ trợ tiếng Anh và tiếng Trung (không có STT tiếng Hàn)
  • Chỉ half-duplex — không thể nói và nghe cùng lúc
  • Đầu ra giọng nói không hoạt động ở chế độ lượng tử hóa INT4

Thiết Lập Pipeline STT → LLM → TTS

Nếu bạn không sử dụng mô hình omni, bạn có thể cấu hình STT và TTS riêng lẻ cho hội thoại giọng nói.

STT (Nhận Dạng Giọng Nói)

Chọn nhà cung cấp STT trong Cài đặt > Giọng nói:

Nhà Cung CấpOfflineKhóa APIChi PhíGhi Chú
Web Speech APIKhôngKhông cầnMiễn phíTích hợp trình duyệt, khả dụng tùy hệ điều hành
VoskKhông cầnMiễn phíStreaming thời gian thực, mô hình ~40-80MB
WhisperKhông cầnMiễn phíĐộ chính xác cao, tăng tốc GPU
Naia CloudKhôngKhông cần (đăng nhập Naia)Tín dụngSTT đám mây
vLLM ASRCó (cục bộ)Không cầnMiễn phíCần máy chủ riêng

Các nhà cung cấp offline (Vosk, Whisper) hoạt động không cần internet.

TTS (Tổng Hợp Giọng Nói)

Chọn nhà cung cấp TTS trong Cài đặt > Giọng nói:

Nhà Cung CấpOfflineKhóa APIChi PhíGhi Chú
Naia Cloud TTSKhôngKhông cần (đăng nhập Naia)Tín dụngGiọng Google Chirp3 HD
Edge TTSKhôngKhông cầnMiễn phíGiọng Microsoft Edge
Google Cloud TTSKhôngCần$0,016/1K ký tựGiọng Neural2/WaveNet
OpenAI TTSKhôngCần$0,015/1K ký tựGiọng OpenAI (Alloy + 12 khác)
ElevenLabsKhôngCần$0,30/1K ký tựTổng hợp cao cấp (50+ giọng)
vLLM TTSCó (cục bộ)Không cầnMiễn phíCần máy chủ riêng
CustomKhác nhauKhác nhauKhác nhauEndpoint do người dùng xác định

Xem Trước

Sau khi chọn nhà cung cấp TTS, nhấp nút Xem trước để thử giọng nói đã chọn.

Các Tổ Hợp Ví Dụ

Nhiều tổ hợp khác nhau có thể thực hiện tùy thuộc vào thiết lập của bạn:

Môi TrườngSTTLLMTTSChi Phí
Hoàn Toàn Miễn PhíVoskOllama (cục bộ)Edge TTSMiễn phí
Tiết KiệmWeb SpeechGemini 2.5 FlashEdge TTS~$0,3/1M token
Chất Lượng CaoWhisperClaude SonnetElevenLabsChi phí API
Naia CloudNaia Cloud STTNaia Cloud LLMNaia Cloud TTSChỉ tín dụng
Hoàn Toàn Cục Bộ (GPU)vLLM ASRvLLMvLLM TTSMiễn phí