Naia টেক্সট চ্যাটের পাশাপাশি Omni মোডের মাধ্যমে রিয়েল-টাইম ভয়েস কথোপকথন সমর্থন করে। প্রচলিত STT (স্পিচ-টু-টেক্সট) → LLM (চিন্তা) → TTS (টেক্সট-টু-স্পিচ) পাইপলাইনের পরিবর্তে, Omni মোড এমন মডেল ব্যবহার করে যা সরাসরি কণ্ঠস্বর বোঝে এবং কণ্ঠস্বরে সাড়া দেয়।
Omni মোড কী?
প্রচলিত ভয়েস কথোপকথন তিনটি ধাপের মধ্য দিয়ে যায়:
- STT: ব্যবহারকারীর কথা টেক্সটে রূপান্তর
- LLM: টেক্সট বোঝা এবং প্রতিক্রিয়া তৈরি
- TTS: প্রতিক্রিয়া টেক্সট কথায় রূপান্তর
Omni মোড এই সবকিছু একটি একক মডেলে প্রক্রিয়া করে। এটি সরাসরি কণ্ঠস্বরের সুর, আবেগ এবং সূক্ষ্মতা বোঝে, দ্রুত এবং আরও স্বাভাবিক কথোপকথনের জন্য প্রাকৃতিক বাক্যে সাড়া দেয়।
Gemini 2.5 Flash Live
রিয়েল-টাইম ভয়েস কথোপকথনের জন্য Google-এর Gemini 2.5 Flash মডেল ব্যবহার করে।
সেটআপ
- সেটিংস > AI-তে যান এবং প্রোভাইডার হিসেবে Gemini বা Naia Cloud নির্বাচন করুন
- মডেল তালিকা থেকে Gemini 2.5 Flash Live বেছে নিন
- সরাসরি সংযোগের জন্য Google API কী প্রয়োজন। Naia Cloud ব্যবহারের জন্য আলাদা কী লাগে না — শুধু ক্রেডিট
ভয়েস নির্বাচন
8টি ভয়েস থেকে বেছে নিন:
| ভয়েস | চরিত্র |
|---|---|
| Kore | মহিলা, শান্ত (ডিফল্ট) |
| Puck | পুরুষ, প্রাণবন্ত |
| Charon | পুরুষ |
| Aoede | মহিলা |
| Fenrir | পুরুষ |
| Leda | মহিলা |
| Orus | পুরুষ |
| Zephyr | নিরপেক্ষ |
বৈশিষ্ট্য
- রিয়েল-টাইম WebSocket সংযোগের মাধ্যমে অত্যন্ত কম বিলম্ব
- ব্যবহারকারীর কথা এবং AI প্রতিক্রিয়া উভয়ের সম্পূর্ণ ট্রান্সক্রিপশন
- আনুমানিক $0.03/মিনিট খরচ (সরাসরি সংযোগ)
- Naia Cloud ব্যবহার করলে ক্রেডিট কাটা হয়
vLLM + MiniCPM-o 4.5 (লোকাল Omni)
Omni ভয়েস কথোপকথন সম্পূর্ণ লোকালভাবে চালান। vLLM সার্ভারের মাধ্যমে OpenBMB-এর MiniCPM-o 4.5 মডেল ব্যবহার করে।
প্রয়োজনীয়তা
| মোড | VRAM | নোট |
|---|---|---|
| BF16 (প্রস্তাবিত) | ~19GB | সম্পূর্ণ ভয়েস I/O সমর্থন |
| INT4 | ~11GB | শুধু টেক্সট, ভয়েস আউটপুট নেই |
সেটআপ
- vLLM সার্ভার: GPU সহ একটি মেশিনে MiniCPM-o সার্ভার চালান
cd naia-os/voice-server/minicpm-o
bash setup.sh # মডেল ডাউনলোড + ডিপেন্ডেন্সি ইনস্টল
python server.py # BF16 মোডে সার্ভার শুরু
-
Naia অ্যাপ: সেটিংস > AI-তে যান, প্রোভাইডার হিসেবে vLLM নির্বাচন করুন, এবং MiniCPM-o মডেল বেছে নিন
-
সার্ভার URL: সার্ভারের ঠিকানা দিন (যেমন, লোকালের জন্য
ws://localhost:8765/ws)
রিমোট GPU (RunPod, ইত্যাদি)
আপনার লোকাল GPU না থাকলে, RunPod-এর মতো ক্লাউড GPU সেবা ব্যবহার করুন:
# RunPod ইনস্ট্যান্সে
git clone https://github.com/nextain/naia-os.git
cd naia-os/voice-server/minicpm-o
bash setup.sh
python server.py --host 0.0.0.0
Naia সেটিংসে সার্ভার URL wss://<pod-id>-8765.proxy.runpod.net সেট করুন।
জ্ঞাত সীমাবদ্ধতা
- বর্তমানে শুধুমাত্র ইংরেজি এবং চীনা সমর্থন করে (কোরিয়ান STT নেই)
- শুধুমাত্র হাফ-ডুপ্লেক্স — একসাথে কথা বলা এবং শোনা যায় না
- INT4 কোয়ান্টাইজেশন মোডে ভয়েস আউটপুট কাজ করে না
STT → LLM → TTS পাইপলাইন সেটআপ
আপনি যদি Omni মডেল ব্যবহার না করেন, তাহলে ভয়েস কথোপকথনের জন্য আলাদাভাবে STT এবং TTS কনফিগার করতে পারেন।
STT (স্পিচ রিকগনিশন)
সেটিংস > ভয়েসে STT প্রোভাইডার নির্বাচন করুন:
| প্রোভাইডার | অফলাইন | API কী | খরচ | নোট |
|---|---|---|---|---|
| Web Speech API | না | প্রয়োজন নেই | বিনামূল্যে | ব্রাউজার বিল্ট-ইন, OS অনুযায়ী উপলব্ধতা ভিন্ন |
| Vosk | হ্যাঁ | প্রয়োজন নেই | বিনামূল্যে | রিয়েল-টাইম স্ট্রিমিং, ~40-80MB মডেল |
| Whisper | হ্যাঁ | প্রয়োজন নেই | বিনামূল্যে | উচ্চ নির্ভুলতা, GPU ত্বরিত |
| Naia Cloud | না | প্রয়োজন নেই (Naia লগইন) | ক্রেডিট | ক্লাউড STT |
| vLLM ASR | হ্যাঁ (লোকাল) | প্রয়োজন নেই | বিনামূল্যে | সেল্ফ-হোস্টেড সার্ভার প্রয়োজন |
অফলাইন প্রোভাইডার (Vosk, Whisper) ইন্টারনেট ছাড়া কাজ করে।
TTS (স্পিচ সিন্থেসিস)
সেটিংস > ভয়েসে TTS প্রোভাইডার নির্বাচন করুন:
| প্রোভাইডার | অফলাইন | API কী | খরচ | নোট |
|---|---|---|---|---|
| Naia Cloud TTS | না | প্রয়োজন নেই (Naia লগইন) | ক্রেডিট | Google Chirp3 HD ভয়েস |
| Edge TTS | না | প্রয়োজন নেই | বিনামূল্যে | Microsoft Edge ভয়েস |
| Google Cloud TTS | না | প্রয়োজন | $0.016/1K অক্ষর | Neural2/WaveNet ভয়েস |
| OpenAI TTS | না | প্রয়োজন | $0.015/1K অক্ষর | OpenAI ভয়েস (Alloy + আরও 12টি) |
| ElevenLabs | না | প্রয়োজন | $0.30/1K অক্ষর | প্রিমিয়াম সিন্থেসিস (50+ ভয়েস) |
| vLLM TTS | হ্যাঁ (লোকাল) | প্রয়োজন নেই | বিনামূল্যে | সেল্ফ-হোস্টেড সার্ভার প্রয়োজন |
| Custom | ভিন্ন | ভিন্ন | ভিন্ন | ব্যবহারকারী-সংজ্ঞায়িত এন্ডপয়েন্ট |
প্রিভিউ
TTS প্রোভাইডার নির্বাচনের পর, নির্বাচিত ভয়েস পরীক্ষা করতে প্রিভিউ বোতামে ক্লিক করুন।
উদাহরণ সংমিশ্রণ
আপনার সেটআপ অনুযায়ী বিভিন্ন সংমিশ্রণ সম্ভব:
| পরিবেশ | STT | LLM | TTS | খরচ |
|---|---|---|---|---|
| সম্পূর্ণ বিনামূল্যে | Vosk | Ollama (লোকাল) | Edge TTS | বিনামূল্যে |
| বাজেট-বান্ধব | Web Speech | Gemini 2.5 Flash | Edge TTS | ~$0.3/1M টোকেন |
| উচ্চ মান | Whisper | Claude Sonnet | ElevenLabs | API খরচ |
| Naia Cloud | Naia Cloud STT | Naia Cloud LLM | Naia Cloud TTS | শুধু ক্রেডিট |
| সম্পূর্ণ লোকাল (GPU) | vLLM ASR | vLLM | vLLM TTS | বিনামূল্যে |