নায়া
সূচিপত্র
  1. 1ভিডিও ম্যানুয়াল
  2. 2Naia OS Live USB
  3. 3ইনস্টলেশন এবং স্থাপনা
  4. 3.1Naia OS ইনস্টলেশন (ISO)
  5. 3.2অ্যাপ ইনস্টলেশন
  6. 4শুরু করা
  7. 4.1Naia Model Pricing
  8. 4.2naia-omni-cascade
  9. 4.3demo
  10. 4.4naia-offline
  11. 4.5naia-model-dev
  12. 4.6naia-online
  13. 5প্রধান পর্দা
  14. 6চ্যাট
  15. 6.1ব্যক্তিগত রেডিও ডিজে ও প্রদর্শনী গাইড
  16. 7কথোপকথনের ইতিহাস
  17. 8কাজের অগ্রগতি
  18. 9দক্ষতা
  19. 10চ্যানেল
  20. 11এজেন্ট
  21. 12ডায়াগনস্টিকস
  22. 13ওয়ার্কস্পেস
  23. 14ব্রাউজার
  24. 15প্যানেল ব্যবস্থাপনা
  25. 16ভয়েস চ্যাট
  26. 17সেটিংস
  27. 18টুলের বিবরণ
  28. 19Naia অ্যাকাউন্ট
  29. 20সমস্যা সমাধান
  30. 21ওপেন সোর্স ব্যবহার ও অবদান

16. ভয়েস চ্যাট

Naia টেক্সট চ্যাটের পাশাপাশি Omni মোডের মাধ্যমে রিয়েল-টাইম ভয়েস কথোপকথন সমর্থন করে। প্রচলিত STT (স্পিচ-টু-টেক্সট) → LLM (চিন্তা) → TTS (টেক্সট-টু-স্পিচ) পাইপলাইনের পরিবর্তে, Omni মোড এমন মডেল ব্যবহার করে যা সরাসরি কণ্ঠস্বর বোঝে এবং কণ্ঠস্বরে সাড়া দেয়।

Omni মোড কী?

প্রচলিত ভয়েস কথোপকথন তিনটি ধাপের মধ্য দিয়ে যায়:

  1. STT: ব্যবহারকারীর কথা টেক্সটে রূপান্তর
  2. LLM: টেক্সট বোঝা এবং প্রতিক্রিয়া তৈরি
  3. TTS: প্রতিক্রিয়া টেক্সট কথায় রূপান্তর

Omni মোড এই সবকিছু একটি একক মডেলে প্রক্রিয়া করে। এটি সরাসরি কণ্ঠস্বরের সুর, আবেগ এবং সূক্ষ্মতা বোঝে, দ্রুত এবং আরও স্বাভাবিক কথোপকথনের জন্য প্রাকৃতিক বাক্যে সাড়া দেয়।

Gemini 2.5 Flash Live

রিয়েল-টাইম ভয়েস কথোপকথনের জন্য Google-এর Gemini 2.5 Flash মডেল ব্যবহার করে।

সেটআপ

  1. সেটিংস > AI-তে যান এবং প্রোভাইডার হিসেবে Gemini বা Naia Cloud নির্বাচন করুন
  2. মডেল তালিকা থেকে Gemini 2.5 Flash Live বেছে নিন
  3. সরাসরি সংযোগের জন্য Google API কী প্রয়োজন। Naia Cloud ব্যবহারের জন্য আলাদা কী লাগে না — শুধু ক্রেডিট

ভয়েস নির্বাচন

8টি ভয়েস থেকে বেছে নিন:

ভয়েসচরিত্র
Koreমহিলা, শান্ত (ডিফল্ট)
Puckপুরুষ, প্রাণবন্ত
Charonপুরুষ
Aoedeমহিলা
Fenrirপুরুষ
Ledaমহিলা
Orusপুরুষ
Zephyrনিরপেক্ষ

বৈশিষ্ট্য

  • রিয়েল-টাইম WebSocket সংযোগের মাধ্যমে অত্যন্ত কম বিলম্ব
  • ব্যবহারকারীর কথা এবং AI প্রতিক্রিয়া উভয়ের সম্পূর্ণ ট্রান্সক্রিপশন
  • আনুমানিক $0.03/মিনিট খরচ (সরাসরি সংযোগ)
  • Naia Cloud ব্যবহার করলে ক্রেডিট কাটা হয়

vLLM + MiniCPM-o 4.5 (লোকাল Omni)

Omni ভয়েস কথোপকথন সম্পূর্ণ লোকালভাবে চালান। vLLM সার্ভারের মাধ্যমে OpenBMB-এর MiniCPM-o 4.5 মডেল ব্যবহার করে।

প্রয়োজনীয়তা

মোডVRAMনোট
BF16 (প্রস্তাবিত)~19GBসম্পূর্ণ ভয়েস I/O সমর্থন
INT4~11GBশুধু টেক্সট, ভয়েস আউটপুট নেই

সেটআপ

  1. vLLM সার্ভার: GPU সহ একটি মেশিনে MiniCPM-o সার্ভার চালান
cd naia-os/voice-server/minicpm-o
bash setup.sh          # মডেল ডাউনলোড + ডিপেন্ডেন্সি ইনস্টল
python server.py       # BF16 মোডে সার্ভার শুরু
  1. Naia অ্যাপ: সেটিংস > AI-তে যান, প্রোভাইডার হিসেবে vLLM নির্বাচন করুন, এবং MiniCPM-o মডেল বেছে নিন

  2. সার্ভার URL: সার্ভারের ঠিকানা দিন (যেমন, লোকালের জন্য ws://localhost:8765/ws)

রিমোট GPU (RunPod, ইত্যাদি)

আপনার লোকাল GPU না থাকলে, RunPod-এর মতো ক্লাউড GPU সেবা ব্যবহার করুন:

# RunPod ইনস্ট্যান্সে
git clone https://github.com/nextain/naia-os.git
cd naia-os/voice-server/minicpm-o
bash setup.sh
python server.py --host 0.0.0.0

Naia সেটিংসে সার্ভার URL wss://<pod-id>-8765.proxy.runpod.net সেট করুন।

জ্ঞাত সীমাবদ্ধতা

  • বর্তমানে শুধুমাত্র ইংরেজি এবং চীনা সমর্থন করে (কোরিয়ান STT নেই)
  • শুধুমাত্র হাফ-ডুপ্লেক্স — একসাথে কথা বলা এবং শোনা যায় না
  • INT4 কোয়ান্টাইজেশন মোডে ভয়েস আউটপুট কাজ করে না

STT → LLM → TTS পাইপলাইন সেটআপ

আপনি যদি Omni মডেল ব্যবহার না করেন, তাহলে ভয়েস কথোপকথনের জন্য আলাদাভাবে STT এবং TTS কনফিগার করতে পারেন।

STT (স্পিচ রিকগনিশন)

সেটিংস > ভয়েসে STT প্রোভাইডার নির্বাচন করুন:

প্রোভাইডারঅফলাইনAPI কীখরচনোট
Web Speech APIনাপ্রয়োজন নেইবিনামূল্যেব্রাউজার বিল্ট-ইন, OS অনুযায়ী উপলব্ধতা ভিন্ন
Voskহ্যাঁপ্রয়োজন নেইবিনামূল্যেরিয়েল-টাইম স্ট্রিমিং, ~40-80MB মডেল
Whisperহ্যাঁপ্রয়োজন নেইবিনামূল্যেউচ্চ নির্ভুলতা, GPU ত্বরিত
Naia Cloudনাপ্রয়োজন নেই (Naia লগইন)ক্রেডিটক্লাউড STT
vLLM ASRহ্যাঁ (লোকাল)প্রয়োজন নেইবিনামূল্যেসেল্ফ-হোস্টেড সার্ভার প্রয়োজন

অফলাইন প্রোভাইডার (Vosk, Whisper) ইন্টারনেট ছাড়া কাজ করে।

TTS (স্পিচ সিন্থেসিস)

সেটিংস > ভয়েসে TTS প্রোভাইডার নির্বাচন করুন:

প্রোভাইডারঅফলাইনAPI কীখরচনোট
Naia Cloud TTSনাপ্রয়োজন নেই (Naia লগইন)ক্রেডিটGoogle Chirp3 HD ভয়েস
Edge TTSনাপ্রয়োজন নেইবিনামূল্যেMicrosoft Edge ভয়েস
Google Cloud TTSনাপ্রয়োজন$0.016/1K অক্ষরNeural2/WaveNet ভয়েস
OpenAI TTSনাপ্রয়োজন$0.015/1K অক্ষরOpenAI ভয়েস (Alloy + আরও 12টি)
ElevenLabsনাপ্রয়োজন$0.30/1K অক্ষরপ্রিমিয়াম সিন্থেসিস (50+ ভয়েস)
vLLM TTSহ্যাঁ (লোকাল)প্রয়োজন নেইবিনামূল্যেসেল্ফ-হোস্টেড সার্ভার প্রয়োজন
Customভিন্নভিন্নভিন্নব্যবহারকারী-সংজ্ঞায়িত এন্ডপয়েন্ট

প্রিভিউ

TTS প্রোভাইডার নির্বাচনের পর, নির্বাচিত ভয়েস পরীক্ষা করতে প্রিভিউ বোতামে ক্লিক করুন।

উদাহরণ সংমিশ্রণ

আপনার সেটআপ অনুযায়ী বিভিন্ন সংমিশ্রণ সম্ভব:

পরিবেশSTTLLMTTSখরচ
সম্পূর্ণ বিনামূল্যেVoskOllama (লোকাল)Edge TTSবিনামূল্যে
বাজেট-বান্ধবWeb SpeechGemini 2.5 FlashEdge TTS~$0.3/1M টোকেন
উচ্চ মানWhisperClaude SonnetElevenLabsAPI খরচ
Naia CloudNaia Cloud STTNaia Cloud LLMNaia Cloud TTSশুধু ক্রেডিট
সম্পূর্ণ লোকাল (GPU)vLLM ASRvLLMvLLM TTSবিনামূল্যে