Naia टेक्स्ट चैट के अलावा Omni मोड के माध्यम से रियल-टाइम वॉइस कन्वर्सेशन को सपोर्ट करता है। पारंपरिक STT (स्पीच-टू-टेक्स्ट) → LLM (सोच) → TTS (टेक्स्ट-टू-स्पीच) पाइपलाइन के बजाय, Omni मोड ऐसे मॉडल का उपयोग करता है जो सीधे आवाज़ को समझते और उत्तर देते हैं।
Omni मोड क्या है?
पारंपरिक वॉइस कन्वर्सेशन तीन चरणों से गुज़रते हैं:
- STT: उपयोगकर्ता की बोली को टेक्स्ट में बदलना
- LLM: टेक्स्ट को समझना और प्रतिक्रिया उत्पन्न करना
- TTS: प्रतिक्रिया टेक्स्ट को बोली में बदलना
Omni मोड यह सब एक ही मॉडल में प्रोसेस करता है। यह सीधे आवाज़ की टोन, भावना और बारीकियों को समझता है, और तेज़, अधिक स्वाभाविक बातचीत के लिए प्राकृतिक भाषण से प्रतिक्रिया देता है।
Gemini 2.5 Flash Live
रियल-टाइम वॉइस कन्वर्सेशन के लिए Google के Gemini 2.5 Flash मॉडल का उपयोग करता है।
सेटअप
- सेटिंग्स > AI में जाएं और प्रोवाइडर के रूप में Gemini या Naia Cloud चुनें
- मॉडल सूची से Gemini 2.5 Flash Live चुनें
- डायरेक्ट कनेक्शन के लिए Google API कुंजी आवश्यक है। Naia Cloud उपयोग के लिए अलग कुंजी की ज़रूरत नहीं — बस क्रेडिट
वॉइस चयन
8 आवाज़ों में से चुनें:
| आवाज़ | चरित्र |
|---|---|
| Kore | महिला, शांत (डिफ़ॉल्ट) |
| Puck | पुरुष, जीवंत |
| Charon | पुरुष |
| Aoede | महिला |
| Fenrir | पुरुष |
| Leda | महिला |
| Orus | पुरुष |
| Zephyr | तटस्थ |
विशेषताएं
- रियल-टाइम WebSocket कनेक्शन के माध्यम से बहुत कम लेटेंसी
- उपयोगकर्ता की बोली और AI प्रतिक्रियाओं दोनों का पूर्ण ट्रांसक्रिप्शन
- लगभग $0.03/मिनट लागत (डायरेक्ट कनेक्शन)
- Naia Cloud उपयोग करते समय क्रेडिट कटते हैं
vLLM + MiniCPM-o 4.5 (लोकल Omni)
Omni वॉइस कन्वर्सेशन पूरी तरह लोकली चलाएं। vLLM सर्वर के माध्यम से OpenBMB के MiniCPM-o 4.5 मॉडल का उपयोग करता है।
आवश्यकताएं
| मोड | VRAM | नोट्स |
|---|---|---|
| BF16 (अनुशंसित) | ~19GB | पूर्ण वॉइस I/O सपोर्ट |
| INT4 | ~11GB | केवल टेक्स्ट, कोई वॉइस आउटपुट नहीं |
सेटअप
- vLLM सर्वर: GPU वाली मशीन पर MiniCPM-o सर्वर चलाएं
cd naia-os/voice-server/minicpm-o
bash setup.sh # मॉडल डाउनलोड + डिपेंडेंसी इंस्टॉल
python server.py # BF16 मोड में सर्वर शुरू करें
-
Naia ऐप: सेटिंग्स > AI में जाएं, प्रोवाइडर के रूप में vLLM चुनें, और MiniCPM-o मॉडल चुनें
-
सर्वर URL: सर्वर का पता दर्ज करें (उदा., लोकल के लिए
ws://localhost:8765/ws)
रिमोट GPU (RunPod, आदि)
यदि आपके पास लोकल GPU नहीं है, तो RunPod जैसी क्लाउड GPU सेवाओं का उपयोग करें:
# RunPod इंस्टेंस पर
git clone https://github.com/nextain/naia-os.git
cd naia-os/voice-server/minicpm-o
bash setup.sh
python server.py --host 0.0.0.0
Naia सेटिंग्स में सर्वर URL wss://<pod-id>-8765.proxy.runpod.net पर सेट करें।
ज्ञात सीमाएं
- वर्तमान में केवल अंग्रेज़ी और चीनी सपोर्ट (कोई कोरियन STT नहीं)
- केवल हाफ़-डुप्लेक्स — एक साथ बोल और सुन नहीं सकते
- INT4 क्वांटाइज़ेशन मोड में वॉइस आउटपुट काम नहीं करता
STT → LLM → TTS पाइपलाइन सेटअप
यदि आप Omni मॉडल का उपयोग नहीं कर रहे हैं, तो आप वॉइस कन्वर्सेशन के लिए STT और TTS को अलग-अलग कॉन्फ़िगर कर सकते हैं।
STT (स्पीच रिकग्निशन)
सेटिंग्स > वॉइस में STT प्रोवाइडर चुनें:
| प्रोवाइडर | ऑफ़लाइन | API कुंजी | लागत | नोट्स |
|---|---|---|---|---|
| Web Speech API | नहीं | आवश्यक नहीं | मुफ़्त | ब्राउज़र बिल्ट-इन, OS अनुसार उपलब्धता भिन्न |
| Vosk | हां | आवश्यक नहीं | मुफ़्त | रियल-टाइम स्ट्रीमिंग, ~40-80MB मॉडल |
| Whisper | हां | आवश्यक नहीं | मुफ़्त | उच्च सटीकता, GPU एक्सेलेरेटेड |
| Naia Cloud | नहीं | आवश्यक नहीं (Naia लॉगिन) | क्रेडिट | क्लाउड STT |
| vLLM ASR | हां (लोकल) | आवश्यक नहीं | मुफ़्त | सेल्फ़-होस्टेड सर्वर आवश्यक |
ऑफ़लाइन प्रोवाइडर (Vosk, Whisper) बिना इंटरनेट के काम करते हैं।
TTS (स्पीच सिंथेसिस)
सेटिंग्स > वॉइस में TTS प्रोवाइडर चुनें:
| प्रोवाइडर | ऑफ़लाइन | API कुंजी | लागत | नोट्स |
|---|---|---|---|---|
| Naia Cloud TTS | नहीं | आवश्यक नहीं (Naia लॉगिन) | क्रेडिट | Google Chirp3 HD वॉइस |
| Edge TTS | नहीं | आवश्यक नहीं | मुफ़्त | Microsoft Edge वॉइस |
| Google Cloud TTS | नहीं | आवश्यक | $0.016/1K अक्षर | Neural2/WaveNet वॉइस |
| OpenAI TTS | नहीं | आवश्यक | $0.015/1K अक्षर | OpenAI वॉइस (Alloy + 12 और) |
| ElevenLabs | नहीं | आवश्यक | $0.30/1K अक्षर | प्रीमियम सिंथेसिस (50+ वॉइस) |
| vLLM TTS | हां (लोकल) | आवश्यक नहीं | मुफ़्त | सेल्फ़-होस्टेड सर्वर आवश्यक |
| Custom | भिन्न | भिन्न | भिन्न | उपयोगकर्ता-परिभाषित एंडपॉइंट |
प्रीव्यू
TTS प्रोवाइडर चुनने के बाद, चयनित वॉइस का परीक्षण करने के लिए प्रीव्यू बटन पर क्लिक करें।
उदाहरण संयोजन
आपके सेटअप के अनुसार विभिन्न संयोजन संभव हैं:
| वातावरण | STT | LLM | TTS | लागत |
|---|---|---|---|---|
| पूरी तरह मुफ़्त | Vosk | Ollama (लोकल) | Edge TTS | मुफ़्त |
| बजट-फ़्रेंडली | Web Speech | Gemini 2.5 Flash | Edge TTS | ~$0.3/1M टोकन |
| उच्च गुणवत्ता | Whisper | Claude Sonnet | ElevenLabs | API लागत |
| Naia Cloud | Naia Cloud STT | Naia Cloud LLM | Naia Cloud TTS | केवल क्रेडिट |
| पूरी तरह लोकल (GPU) | vLLM ASR | vLLM | vLLM TTS | मुफ़्त |