नाया
सामग्री तालिका
  1. 1वीडियो मैनुअल
  2. 2Naia OS Live USB
  3. 3स्थापना एवं परिनियोजन
  4. 3.1Naia OS स्थापना (ISO)
  5. 3.2ऐप स्थापना
  6. 4आरंभ करना
  7. 4.1Naia Model Pricing
  8. 4.2naia-omni-cascade
  9. 4.3demo
  10. 4.4naia-offline
  11. 4.5naia-model-dev
  12. 4.6naia-online
  13. 5मुख्य स्क्रीन
  14. 6बातचीत
  15. 6.1व्यक्तिगत रेडियो डीजे और प्रदर्शनी गाइड
  16. 7बातचीत का इतिहास
  17. 8कार्य प्रगति
  18. 9कौशल
  19. 10चैनल
  20. 11एजेंट
  21. 12निदान
  22. 13वर्कस्पेस
  23. 14ब्राउज़र
  24. 15पैनल प्रबंधन
  25. 16वॉइस चैट
  26. 17सेटिंग्स
  27. 18उपकरण विवरण
  28. 19Naia खाता
  29. 20समस्या निवारण
  30. 21ओपन सोर्स उपयोग और योगदान

16. वॉइस चैट

Naia टेक्स्ट चैट के अलावा Omni मोड के माध्यम से रियल-टाइम वॉइस कन्वर्सेशन को सपोर्ट करता है। पारंपरिक STT (स्पीच-टू-टेक्स्ट) → LLM (सोच) → TTS (टेक्स्ट-टू-स्पीच) पाइपलाइन के बजाय, Omni मोड ऐसे मॉडल का उपयोग करता है जो सीधे आवाज़ को समझते और उत्तर देते हैं।

Omni मोड क्या है?

पारंपरिक वॉइस कन्वर्सेशन तीन चरणों से गुज़रते हैं:

  1. STT: उपयोगकर्ता की बोली को टेक्स्ट में बदलना
  2. LLM: टेक्स्ट को समझना और प्रतिक्रिया उत्पन्न करना
  3. TTS: प्रतिक्रिया टेक्स्ट को बोली में बदलना

Omni मोड यह सब एक ही मॉडल में प्रोसेस करता है। यह सीधे आवाज़ की टोन, भावना और बारीकियों को समझता है, और तेज़, अधिक स्वाभाविक बातचीत के लिए प्राकृतिक भाषण से प्रतिक्रिया देता है।

Gemini 2.5 Flash Live

रियल-टाइम वॉइस कन्वर्सेशन के लिए Google के Gemini 2.5 Flash मॉडल का उपयोग करता है।

सेटअप

  1. सेटिंग्स > AI में जाएं और प्रोवाइडर के रूप में Gemini या Naia Cloud चुनें
  2. मॉडल सूची से Gemini 2.5 Flash Live चुनें
  3. डायरेक्ट कनेक्शन के लिए Google API कुंजी आवश्यक है। Naia Cloud उपयोग के लिए अलग कुंजी की ज़रूरत नहीं — बस क्रेडिट

वॉइस चयन

8 आवाज़ों में से चुनें:

आवाज़चरित्र
Koreमहिला, शांत (डिफ़ॉल्ट)
Puckपुरुष, जीवंत
Charonपुरुष
Aoedeमहिला
Fenrirपुरुष
Ledaमहिला
Orusपुरुष
Zephyrतटस्थ

विशेषताएं

  • रियल-टाइम WebSocket कनेक्शन के माध्यम से बहुत कम लेटेंसी
  • उपयोगकर्ता की बोली और AI प्रतिक्रियाओं दोनों का पूर्ण ट्रांसक्रिप्शन
  • लगभग $0.03/मिनट लागत (डायरेक्ट कनेक्शन)
  • Naia Cloud उपयोग करते समय क्रेडिट कटते हैं

vLLM + MiniCPM-o 4.5 (लोकल Omni)

Omni वॉइस कन्वर्सेशन पूरी तरह लोकली चलाएं। vLLM सर्वर के माध्यम से OpenBMB के MiniCPM-o 4.5 मॉडल का उपयोग करता है।

आवश्यकताएं

मोडVRAMनोट्स
BF16 (अनुशंसित)~19GBपूर्ण वॉइस I/O सपोर्ट
INT4~11GBकेवल टेक्स्ट, कोई वॉइस आउटपुट नहीं

सेटअप

  1. vLLM सर्वर: GPU वाली मशीन पर MiniCPM-o सर्वर चलाएं
cd naia-os/voice-server/minicpm-o
bash setup.sh          # मॉडल डाउनलोड + डिपेंडेंसी इंस्टॉल
python server.py       # BF16 मोड में सर्वर शुरू करें
  1. Naia ऐप: सेटिंग्स > AI में जाएं, प्रोवाइडर के रूप में vLLM चुनें, और MiniCPM-o मॉडल चुनें

  2. सर्वर URL: सर्वर का पता दर्ज करें (उदा., लोकल के लिए ws://localhost:8765/ws)

रिमोट GPU (RunPod, आदि)

यदि आपके पास लोकल GPU नहीं है, तो RunPod जैसी क्लाउड GPU सेवाओं का उपयोग करें:

# RunPod इंस्टेंस पर
git clone https://github.com/nextain/naia-os.git
cd naia-os/voice-server/minicpm-o
bash setup.sh
python server.py --host 0.0.0.0

Naia सेटिंग्स में सर्वर URL wss://<pod-id>-8765.proxy.runpod.net पर सेट करें।

ज्ञात सीमाएं

  • वर्तमान में केवल अंग्रेज़ी और चीनी सपोर्ट (कोई कोरियन STT नहीं)
  • केवल हाफ़-डुप्लेक्स — एक साथ बोल और सुन नहीं सकते
  • INT4 क्वांटाइज़ेशन मोड में वॉइस आउटपुट काम नहीं करता

STT → LLM → TTS पाइपलाइन सेटअप

यदि आप Omni मॉडल का उपयोग नहीं कर रहे हैं, तो आप वॉइस कन्वर्सेशन के लिए STT और TTS को अलग-अलग कॉन्फ़िगर कर सकते हैं।

STT (स्पीच रिकग्निशन)

सेटिंग्स > वॉइस में STT प्रोवाइडर चुनें:

प्रोवाइडरऑफ़लाइनAPI कुंजीलागतनोट्स
Web Speech APIनहींआवश्यक नहींमुफ़्तब्राउज़र बिल्ट-इन, OS अनुसार उपलब्धता भिन्न
Voskहांआवश्यक नहींमुफ़्तरियल-टाइम स्ट्रीमिंग, ~40-80MB मॉडल
Whisperहांआवश्यक नहींमुफ़्तउच्च सटीकता, GPU एक्सेलेरेटेड
Naia Cloudनहींआवश्यक नहीं (Naia लॉगिन)क्रेडिटक्लाउड STT
vLLM ASRहां (लोकल)आवश्यक नहींमुफ़्तसेल्फ़-होस्टेड सर्वर आवश्यक

ऑफ़लाइन प्रोवाइडर (Vosk, Whisper) बिना इंटरनेट के काम करते हैं।

TTS (स्पीच सिंथेसिस)

सेटिंग्स > वॉइस में TTS प्रोवाइडर चुनें:

प्रोवाइडरऑफ़लाइनAPI कुंजीलागतनोट्स
Naia Cloud TTSनहींआवश्यक नहीं (Naia लॉगिन)क्रेडिटGoogle Chirp3 HD वॉइस
Edge TTSनहींआवश्यक नहींमुफ़्तMicrosoft Edge वॉइस
Google Cloud TTSनहींआवश्यक$0.016/1K अक्षरNeural2/WaveNet वॉइस
OpenAI TTSनहींआवश्यक$0.015/1K अक्षरOpenAI वॉइस (Alloy + 12 और)
ElevenLabsनहींआवश्यक$0.30/1K अक्षरप्रीमियम सिंथेसिस (50+ वॉइस)
vLLM TTSहां (लोकल)आवश्यक नहींमुफ़्तसेल्फ़-होस्टेड सर्वर आवश्यक
Customभिन्नभिन्नभिन्नउपयोगकर्ता-परिभाषित एंडपॉइंट

प्रीव्यू

TTS प्रोवाइडर चुनने के बाद, चयनित वॉइस का परीक्षण करने के लिए प्रीव्यू बटन पर क्लिक करें।

उदाहरण संयोजन

आपके सेटअप के अनुसार विभिन्न संयोजन संभव हैं:

वातावरणSTTLLMTTSलागत
पूरी तरह मुफ़्तVoskOllama (लोकल)Edge TTSमुफ़्त
बजट-फ़्रेंडलीWeb SpeechGemini 2.5 FlashEdge TTS~$0.3/1M टोकन
उच्च गुणवत्ताWhisperClaude SonnetElevenLabsAPI लागत
Naia CloudNaia Cloud STTNaia Cloud LLMNaia Cloud TTSकेवल क्रेडिट
पूरी तरह लोकल (GPU)vLLM ASRvLLMvLLM TTSमुफ़्त