نايا
· Luke

نقدّم Naia-0.9-Omni-24g الذي يحقّق استنساخ الصوت والمحادثة الفورية والمهارات على بطاقة RTX 3090 (Naia v0.1.5)

naia-osnaia-omnivoice-aicascadeopen-sourcev0.1.5

مرحبًا، أنا لوك، الشخص الذي يعمل على نظام التشغيل الذكي نايا (Naia). بعد المقال السابق الذي أعلنت فيه على عجل خبر الإطلاق وطلبت مساعدتكم، أنقل إليكم هذه المرة أهمّ خبر مع تحديث v0.1.5 — ليس فقط نظام تشغيل ذكي، بل نموذجًا ذكيًا متعدّد الوسائط جديدًا، وبالتحديد خبر الكشف عن وحدة Naia-Omni (naia-0.9-omni-24g).

Naia-0.9-Omni-24g
Naia-0.9-Omni-24g

▎ما يمكنكم تجربته مباشرةً في Naia-OS ضمن إصدار v0.1.5 هذا

  • محادثة صوتية فورية مع أفاتار ثلاثي الأبعاد (بما في ذلك استنساخ الصوت) — هذا هو نجم هذا الإصدار.
  • متصفّح مدمج — يرى الذكاء الاصطناعي معك داخل الشاشة ويساعدك.
  • نظام المهارات — وسّع الوظائف عبر المهارات المدمجة، واربط أدوات MCP (Model Context Protocol).
  • لوحات التطبيقات — يمكنك إضافة لوحات التطبيقات التي تريدها داخل Naia.
  • نموذجك ومفتاحك كما هما — يمكنك ربط مزوّد الذكاء الاصطناعي والمفتاح الذي تريده، أو التشغيل عبر نموذج محلي.
  • الخصوصية — التشغيل المحلي هو الوضع الافتراضي، ولا تُستخدم مدخلاتك ومخرجاتك في تدريب النماذج.
  • دعم واجهة بـ 14 لغة

ليست Naia مجرّد واجهة (Shell) تدّعي أنها نظام تشغيل. جوهر هذا التحديث هو وحدة naia-0.9-omni-24g التي تحقّق على بطاقة رسومات استهلاكية (مثل RTX 3090/4090/5090 بسعة 24GB من VRAM) 30 لغة متعددة إلى جانب محادثة فورية بنظام الإرسال المزدوج الكامل بمستوى ChatGPT وGemini.

هذا مقطع فيديو لمحادثة بصوت حقيقي عبر الاتصال بـ Naia-Omni المثبّت مباشرةً على جهاز الكمبيوتر الخاص بي. (يُرجى ملاحظة أن صوت الميكروفون الخاص بي لم يُسجَّل في الفيديو.)

▎لماذا وحدة 'cascade'

سبق أن ذكرت أنني كنت بصدد نقل MiniCPM-4.5-omni إلى vLLM، وكان ذلك تحديدًا بهدف زرعه في Naia. أكبر ميزة لنموذج Omni هي قدرته على إجراء محادثة طبيعية جدًا في الوقت الفعلي. غير أن ذلك النموذج كان يتطلّب أكثر من 28GB من VRAM، فضلًا عن قصوره على دعم الصينية والإنجليزية فقط. ولتحسين ذلك إلى الكورية، أجريت أبحاثًا متعدّدة بالتوازي مثل ضبط Talker الدقيق (FT)، لكنني اصطدمت في النهاية بسقف تقني، وكانت نماذج Omni الأخرى أثقل بكثير من هذا.

وبعد البحث عن بديل على هذا النحو، كان ما توصّلت إلى صنعه ليس نموذجًا واحدًا بل naia-0.9-omni-24g بأسلوب 'كاسكيد (Cascade)'. إنها وحدة تنسّق عدة نماذج ذكاء اصطناعي وتحسّنها بشكل ملائم، ومع أنها لا تبلغ المعالجة المثالية على مستوى الرمز (token)، فإنها تتباهى بسرعة موازية لذلك وبتكوين أكثر مرونة بكثير. إنها البديل الوحيد فعليًا الذي يدعم على بطاقة رسومات استهلاكية بسعة 24GB كلًّا من 30 لغة متعددة، والإرسال المزدوج الكامل، واستنساخ الصوت الفوري. ونحن نرشدكم إلى استخدامها على مستوى API تمامًا كأنها نموذج مستقلّ واحد، ويمكنكم أن تختبروا مباشرةً قدرةً على استنساخ الصوت أذكى وأوضح بكثير.

نموذج omni واحدcascade (أسلوب Naia)
التكويننموذج موحّد في كيان واحدتجميع أجزاء حسب الدور
تغيير القدراتثابت بمجرد تدريبه — القدرات الجديدة تتطلّب إعادة تدريباستبدال الأجزاء وإضافتها في أي وقت — تحسين دون إعادة تدريب
السرعةسريع لأنه موحّد (تأخير منخفض)قد يحدث تأخير أكبر قليلًا بسبب وجود مراحل
التوسّع متعدّد الوسائطإعادة التدريب من البدايةإدراج أجزاء في المدخلات والمخرجات
اختيار الأجزاءمربوطة ككتلة واحدةانتقاء واستبدال أجزاء مُتحقَّق منها
استخدام النماذجثابت على نموذج واحدعدة نماذج معًا — النموذج الأمثل لكل مرحلة

وهكذا يعمل naia-0.9-omni-24g المكتمل بسلاسة على بيئة الكمبيوتر الاستهلاكية RTX 3090/4090/5090 (24GB).

⚙️ طريقة الاستخدام والمميزات

أُعيد تنظيم طريقة استخدام هذا التحديث على النحو التالي مراعاةً للواقع الفعلي للبنية التحتية.

توفير الحاوية المحلية (ميزة لمشتركي الباقة الأساسية) — أتحنا لأيّ شخص تنزيلها على جهازه الشخصي في صورة حاوية ليصنع تطبيقه الخاص بنفسه مباشرةً.

podman pull ghcr.io/nextain/naia-0.9-omni-24g:latest

غير أنني أنا أيضًا بحاجة إلى إعالة نفسي مع مواصلة هذا المشروع مفتوح المصدر، لذا جعلت نسخة واحدة (1 Copy) متاحة لكل مستخدم من مستخدمي الاشتراك الأساسي (10 دولارات شهريًا). سأكون ممتنًا لو اعتبرتموه أدنى دعم لازم كي ينمو نظام Naia مفتوح المصدر باستمرار. → دليل تنزيل نماذج Naia وتفعيلها

تجربة العرض التوضيحي على الويب (تذوّق لمدة 60 ثانية) — أوفّر حاليًا تجربة تذوّق مدتها 60 ثانية لكل مرة عبر تشغيلها مباشرةً على جهاز كمبيوتر شخصي واحد لديّ. وبما أن الموارد محدودة، فقد يحدث طابور انتظار (Queue) بحسب عدد المتصلين، فأرجو منكم سعة الصدر. → العرض التوضيحي المباشر

شاشة العرض التوضيحي المباشر لـ Naia الاستخدام السحابي (قيد الإعداد) — للأسف أحوّل مؤقتًا النموذج الذي خطّطت له أصلًا بسعر 0.33 دولار للساعة إلى وضع 'قيد الإعداد'. ففي الوقت الراهن الذي يفتقر إلى رأس المال والمعدّات، يصعب الحفاظ على تجمّع GPU يبقى دائمًا في وضع الاستعداد، ويثقل عليّ أن أتحمّل مجانًا تكلفة الخادم لنحو 15 دقيقة من الإقلاع بعد التخصيص. كما طوّرت بالفعل نظامًا قائمًا على RTX 3090 عن بُعد يمكن استخدامه محليًا، لكنني رأيت أن ندرة بطاقات GPU تجعل تقديم خدمة سلسة أمرًا صعبًا. ومتى توافر رأس المال مستقبلًا فسأقدّم حتمًا خدمة سحابية مريحة بلا وقت انتظار.
شاشة العرض التوضيحي المباشر لـ Naia

توافق عالٍ — دعمنا OpenAI Realtime API لتعظيم التوافق مع البيئات القائمة.

نقطة النهايةالاستخدام
GET /healthحالة الجاهزية {"ready":true} (لا تتطلّب مصادقة)
GET /v1/modelsقائمة النماذج
WS /v1/realtimeجلسة صوتية فورية (VAD، المقاطعة، المشاعر)
POST /v1/chat/completionsالمحادثة (يدعم البثّ)
POST /v1/audio/speechتركيب الصوت (TTS)
POST /v1/audio/transcriptionsالتعرّف على الصوت (STT)
POST /v1/embeddingsالتضمين (Embedding)

الاستخدام التفصيلي لنماذج Naia (دليل للمطوّرين)

الأمان والخصوصية — بما أن أداء الوحدة متميّز، فهناك أيضًا مخاوف من إساءة استخدامها في الاحتيال الصوتي ونحوه، لذا طبّقنا تقنية العلامة المائية الصوتية لإضفاء قابلية التتبّع كي تستخدموها باطمئنان.

🧠 المستقبل الذي ترسمه Naia (Naia Cognitive)

الاتجاه النهائي الذي تنشده Naia هو تحقيق 'الذكاء الاصطناعي الخاص بي داخل حاسوبي'، وبناء نظام لتطوير ونشر التطبيقات التي نستخدمها مع الذكاء الاصطناعي. إن تعدّد الوسائط الذي أرسمه ليس مجرّد إدخال وإخراج للبيانات، بل يستهدف قدرة معرفية يختبر بها الذكاء الاصطناعي ويتذكّر ويعبّر بنفسه (Naia Cognitive).

في الإصدار التالي تنتظركم تحديثات للوكيل (Naia-agent)، والذاكرة طويلة الأمد (Naia-memory)، وإطار العمل (Naia-ADK) وغيرها. أما الإصدار التالي الذي سيصدر مع Naia-0.9-Omni-48g فنبحثه ونطوّره بهدف بلوغ تكوين بيئة وملفّ تعريف محلي بمستوى يتيح أعمال البرمجة، وبهدف ذكاء اصطناعي يتذكّر المستخدم ويعمل معه بالصوت الفوري — أي بحقّ شيء أشبه بـ 'جارفيس الرجل الحديدي'.

ما تزال سعة 48GB منطقةً يصعب حشرها في 24GB مهما حاولنا، لكن يكفي تركيب بطاقتين قديمتين من RTX 3090، لذا أرى أن الفرد أيضًا يستطيع أن يحلم بذلك بما يكفي.

🎮 Naia OS هو ذكاء اصطناعي يتذكّرني ويعمل ويلعب معي

الصورة التي ترسمها Naia-OS هي كالتالي:

  • جهاز ألعاب قائم على Steam(Bazzite)/Windows + وكيل ذكي يتذكّرني + واجهة لغة طبيعية قائمة على أفاتار ثلاثي الأبعاد + ملفات تعريف محسّنة حسب VRAM

أُثير مؤخرًا جدل كبير حول صنع MS وNvidia جهاز ذكاء اصطناعي صغير قائم على RTX، أليس كذلك؟ في الواقع لا داعي للانتظار، فـ Naia-OS الذي يعمل للألعاب والذكاء الاصطناعي معًا يستهدف تلك المكانة بالضبط. لو كنت مكانكم لاخترت تكوين Naia-OS بدلًا من ذلك المنتج الجديد — فسعره أغلى حتى من الخط الأعلى الذي نوصي به، وتوافق الألعاب فيه مجهول، وذاكرته الموحّدة بطيئة. في المقابل، فإن Naia-OS الذي يُركَّب فيه GPU استهلاكي مُتحقَّق منه يحقّق الألعاب والذكاء الاصطناعي وقابلية التوسّع معًا.

ليس تأجيل بيئة Mac متعمّدًا، بل لم نتمكّن من المباشرة بها بعد بسبب نقص المعدّات والوقت. وهناك أيضًا أشخاص اتفقوا على مساعدتنا.

ليست Naia-OS وحدة واحدة، بل تتكوّن من مستودعات مفتوحة المصدر منفصلة لكلّ منها دوره، ونحن نركّب هيكلها العظمي خطوة بخطوة. قد تتساءلون "ألا يبدو هذا كثيرًا للغاية؟"، لكن هذا ممكن لأننا نعيش الآن تحديدًا 'عصر التطوير القائم على الذكاء الاصطناعي'.

إذا كان نظام التشغيل التقليدي أداةً لإدارة التطبيقات، فإنني أؤمن بأن نظام التشغيل الذكي سيصبح برمجيةً وروبوتًا يتواصل باللغة الطبيعية ويتذكّر ويعالج العمل بنفسه. لن يكون هذا مجرّد مزايدة، بل سأثبته بالنتائج واحدةً تلو الأخرى.

🤝 لنكن معًا — لقاء حضوري وديسكورد

خلال الأسبوع المقبل، أفكّر في عقد لقاء حضوري أعرّف فيه بما عملت عليه طوال هذه المدة وأبحث فيه عمّن يتبادلون المساعدة معنا. جرّبوا تنزيل الوحدة مرة، ومن كان مهتمًّا فليأتِ إلى ديسكورد أدناه. آمل أن يتطوّر هذا إلى مجتمع مفتوح المصدر حقيقي.

انضمّ إلى Naia Discord

أرجو منكم الكثير من التشجيع والاهتمام بمسيرة نيكستين وNaia القادمة.

#Nextain #Naia

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

التعليقات

يمكنك التعليق بدون تسجيل الدخول

...