نايا
جدول المحتويات
  1. 1دليل الفيديو
  2. 2Naia OS Live USB
  3. 3التثبيت والنشر
  4. 3.1تثبيت Naia OS (ISO)
  5. 3.2تثبيت التطبيق
  6. 4البدء
  7. 4.1Naia Model Pricing
  8. 4.2naia-omni-cascade
  9. 4.3demo
  10. 4.4naia-offline
  11. 4.5naia-model-dev
  12. 4.6naia-online
  13. 5الشاشة الرئيسية
  14. 6الدردشة
  15. 6.1منسق راديو شخصي ودليل المعرض
  16. 7تاريخ المحادثة
  17. 8تقدم العمل
  18. 9المهارات
  19. 10القنوات
  20. 11الوكلاء
  21. 12التشخيص
  22. 13مساحة العمل
  23. 14المتصفح
  24. 15إدارة اللوحات
  25. 16المحادثة الصوتية
  26. 17الإعدادات
  27. 18تفاصيل الأداة
  28. 19حساب Naia
  29. 20استكشاف الأخطاء وإصلاحها
  30. 21استخدام المصادر المفتوحة والمساهمة فيها

16. المحادثة الصوتية

يدعم Naia المحادثات الصوتية في الوقت الفعلي من خلال وضع Omni، بالإضافة إلى المحادثة النصية. بدلاً من خط الأنابيب التقليدي STT (تحويل الكلام إلى نص) → LLM (التفكير) → TTS (تحويل النص إلى كلام)، يستخدم وضع Omni نماذج تفهم وتستجيب بالصوت مباشرة.

ما هو وضع Omni؟

المحادثات الصوتية التقليدية تمر بثلاث مراحل:

  1. STT: تحويل كلام المستخدم إلى نص
  2. LLM: فهم النص وتوليد الرد
  3. TTS: تحويل نص الرد إلى كلام

يعالج وضع Omni كل هذا في نموذج واحد. يفهم مباشرة نبرة الصوت والعاطفة والفروق الدقيقة، ويستجيب بكلام طبيعي لمحادثات أسرع وأكثر طبيعية.

Gemini 2.5 Flash Live

يستخدم نموذج Gemini 2.5 Flash من Google للمحادثات الصوتية في الوقت الفعلي.

الإعداد

  1. اذهب إلى الإعدادات > AI واختر Gemini أو Naia Cloud كمزوّد
  2. اختر Gemini 2.5 Flash Live من قائمة النماذج
  3. الاتصال المباشر يتطلب مفتاح Google API. استخدام Naia Cloud لا يتطلب مفتاحاً منفصلاً — فقط أرصدة

اختيار الصوت

اختر من بين 8 أصوات:

الصوتالشخصية
Koreأنثى، هادئ (افتراضي)
Puckذكر، حيوي
Charonذكر
Aoedeأنثى
Fenrirذكر
Ledaأنثى
Orusذكر
Zephyrمحايد

الميزات

  • زمن استجابة منخفض جداً عبر اتصال WebSocket في الوقت الفعلي
  • توفير نسخ كاملة لكلام المستخدم وردود الذكاء الاصطناعي
  • تكلفة تقريبية $0.03/دقيقة (اتصال مباشر)
  • يتم خصم الأرصدة عند استخدام Naia Cloud

vLLM + MiniCPM-o 4.5 (Omni محلي)

شغّل المحادثات الصوتية Omni محلياً بالكامل. يستخدم نموذج MiniCPM-o 4.5 من OpenBMB عبر خادم vLLM.

المتطلبات

الوضعVRAMملاحظات
BF16 (موصى به)~19GBدعم كامل لإدخال وإخراج الصوت
INT4~11GBنص فقط، بدون إخراج صوتي

الإعداد

  1. خادم vLLM: شغّل خادم MiniCPM-o على جهاز مزود بـ GPU
cd naia-os/voice-server/minicpm-o
bash setup.sh          # تحميل النموذج + تثبيت التبعيات
python server.py       # بدء الخادم بوضع BF16
  1. تطبيق Naia: اذهب إلى الإعدادات > AI، اختر vLLM كمزوّد، واختر نموذج MiniCPM-o

  2. عنوان الخادم: أدخل عنوان الخادم (مثلاً، ws://localhost:8765/ws للاتصال المحلي)

GPU عن بُعد (RunPod، إلخ.)

إذا لم يكن لديك GPU محلي، استخدم خدمات GPU السحابية مثل RunPod:

# على مثيل RunPod
git clone https://github.com/nextain/naia-os.git
cd naia-os/voice-server/minicpm-o
bash setup.sh
python server.py --host 0.0.0.0

اضبط عنوان الخادم على wss://<pod-id>-8765.proxy.runpod.net في إعدادات Naia.

القيود المعروفة

  • يدعم حالياً الإنجليزية والصينية فقط (لا يوجد STT كوري)
  • نصف مزدوج فقط — لا يمكن التحدث والاستماع في وقت واحد
  • لا يعمل إخراج الصوت في وضع التكميم INT4

إعداد خط أنابيب STT → LLM → TTS

إذا كنت لا تستخدم نموذج Omni، يمكنك تكوين STT وTTS بشكل منفصل للمحادثات الصوتية.

STT (التعرف على الكلام)

اختر مزوّد STT في الإعدادات > الصوت:

المزوّدبدون إنترنتمفتاح APIالتكلفةملاحظات
Web Speech APIلاغير مطلوبمجانيمدمج في المتصفح، التوفر يختلف حسب نظام التشغيل
Voskنعمغير مطلوبمجانيبث في الوقت الفعلي، نموذج ~40-80MB
Whisperنعمغير مطلوبمجانيدقة عالية، تسريع GPU
Naia Cloudلاغير مطلوب (تسجيل دخول Naia)أرصدةSTT سحابي
vLLM ASRنعم (محلي)غير مطلوبمجانييتطلب خادم مستضاف ذاتياً

المزوّدون بدون إنترنت (Vosk، Whisper) يعملون بدون اتصال.

TTS (تحويل النص إلى كلام)

اختر مزوّد TTS في الإعدادات > الصوت:

المزوّدبدون إنترنتمفتاح APIالتكلفةملاحظات
Naia Cloud TTSلاغير مطلوب (تسجيل دخول Naia)أرصدةأصوات Google Chirp3 HD
Edge TTSلاغير مطلوبمجانيأصوات Microsoft Edge
Google Cloud TTSلامطلوب$0.016/1K حرفأصوات Neural2/WaveNet
OpenAI TTSلامطلوب$0.015/1K حرفأصوات OpenAI (Alloy + 12 أخرى)
ElevenLabsلامطلوب$0.30/1K حرفتركيب صوتي متميز (50+ صوت)
vLLM TTSنعم (محلي)غير مطلوبمجانييتطلب خادم مستضاف ذاتياً
Customيختلفيختلفيختلفنقطة نهاية يحددها المستخدم

معاينة

بعد اختيار مزوّد TTS، انقر على زر معاينة لاختبار الصوت المحدد.

أمثلة على التركيبات

تركيبات متنوعة ممكنة حسب إعدادك:

البيئةSTTLLMTTSالتكلفة
مجاني بالكاملVoskOllama (محلي)Edge TTSمجاني
اقتصاديWeb SpeechGemini 2.5 FlashEdge TTS~$0.3/1M رمز
جودة عاليةWhisperClaude SonnetElevenLabsتكاليف API
Naia CloudNaia Cloud STTNaia Cloud LLMNaia Cloud TTSأرصدة فقط
محلي بالكامل (GPU)vLLM ASRvLLMvLLM TTSمجاني