নমস্কার, আমি Luke — AI OS Naia তৈরি করছি। গত বার তাড়াহুড়ো করে লঞ্চের খবর জানিয়ে আপনাদের সাহায্য চেয়েছিলাম, সেই লেখার ধারাবাহিকতায় এবার v0.1.5 আপডেটের সঙ্গে সবচেয়ে গুরুত্বপূর্ণ খবরটি নিয়ে এলাম — শুধু AI OS নয়, একটি নতুন AI omni মডেল, আরও সঠিকভাবে বললে Naia-Omni মডিউল (naia-0.9-omni-24g) উন্মোচনের খবর।

▎এই v0.1.5-এর Naia-OS-এ আপনি সরাসরি যা যা অনুভব করতে পারবেন
- 3D অ্যাভাটারের সঙ্গে রিয়েল-টাইম ভয়েস কথোপকথন (ভয়েস ক্লোনিং সহ) — এই সংস্করণের মূল আকর্ষণ।
- এমবেডেড ব্রাউজার — স্ক্রিনের ভেতরেই AI আপনার সঙ্গে দেখে এবং সাহায্যের হাত বাড়ায়।
- স্কিল সিস্টেম — বিল্ট-ইন স্কিল দিয়ে কার্যকারিতা প্রসারিত করুন এবং MCP (Model Context Protocol) টুল সংযুক্ত করুন।
- অ্যাপ প্যানেল — Naia-এর ভেতরে আপনার পছন্দের অ্যাপ প্যানেল যোগ করতে পারবেন।
- আপনার মডেল, আপনার কী যেমন আছে তেমনই — আপনার পছন্দের AI প্রোভাইডার·কী সংযুক্ত করুন, কিংবা একটি লোকাল মডেলে চালান।
- প্রাইভেসি — লোকাল এক্সিকিউশন ডিফল্ট, এবং আপনার ইনপুট·আউটপুট মডেল প্রশিক্ষণে ব্যবহার করা হয় না।
- ১৪টি ভাষার ইন্টারফেস সমর্থন
Naia কেবল OS হওয়ার দাবি করা একটি শেল (Shell) মাত্র নয়। এই আপডেটের মূল বিষয় হলো naia-0.9-omni-24g মডিউল, যা কনজিউমার GPU (RTX 3090/4090/5090 সহ ২৪GB VRAM) পরিবেশে ৩০টি ভাষার পাশাপাশি ChatGPT·Gemini-মানের ফুল-ডুপ্লেক্স রিয়েল-টাইম কথোপকথন বাস্তবায়ন করে দেখিয়েছে।
এটি আমার নিজের PC-তে সরাসরি ইনস্টল করা Naia-Omni-এ সংযুক্ত হয়ে আসল কণ্ঠে কথোপকথনের ভিডিও। (আমার মাইক্রোফোনের কণ্ঠ ভিডিওতে রেকর্ড হয়নি, এটি বিবেচনায় রাখবেন।)
▎কেন একটি 'cascade' মডিউল
আগে একবার বলেছিলাম যে MiniCPM-4.5-omni-কে vLLM-এ পোর্ট করছি — তা ঠিক এই Naia-এ স্থাপন করার জন্যই ছিল। Omni মডেলের সবচেয়ে বড় সুবিধা হলো রিয়েল-টাইমে অত্যন্ত স্বাভাবিক কথোপকথন সম্ভব। তবে সেই মডেলটি ২৮GB-এর বেশি VRAM দাবি করত, আবার শুধু চীনা ও ইংরেজি সমর্থন করত — এই সীমাবদ্ধতা ছিল। এটিকে কোরিয়ান ভাষায় উন্নত করতে Talker ফাইন-টিউনিং (FT) সহ নানা গবেষণা সমান্তরালে চালিয়েছিলাম, কিন্তু শেষমেশ একটি প্রযুক্তিগত সীমায় ধাক্কা খেলাম, আর অন্য Omni মডেলগুলো এর চেয়েও অনেক বেশি ভারী ছিল।
সেইভাবে বিকল্প খুঁজতে খুঁজতে শেষে যা তৈরি করলাম তা একক মডেল নয়, বরং 'ক্যাসকেড (Cascade)' পদ্ধতির naia-0.9-omni-24g। একাধিক AI মডেলকে যথাযথভাবে অর্কেস্ট্রেট ও অপ্টিমাইজ করা একটি মডিউল, যা পুরোপুরি টোকেন-ইউনিট প্রক্রিয়াকরণ না হলেও তার সমতুল্য গতি এবং অনেক বেশি নমনীয় গঠন গর্বের সাথে ধারণ করে। কনজিউমার ২৪GB GPU-তে ৩০ ভাষার মাল্টিলিঙ্গুয়াল, ফুল-ডুপ্লেক্স, রিয়েল-টাইম ভয়েস ক্লোনিং — সবই সমর্থন করে এমন কার্যত একমাত্র বিকল্প। যেন একটি স্বতন্ত্র মডেলের মতোই API স্তরে ব্যবহার করা যায় সেভাবে নির্দেশনা দিচ্ছি, এবং অনেক বেশি স্মার্ট ও স্পষ্ট ভয়েস ক্লোনিং সক্ষমতা আপনি নিজেই সরাসরি অনুভব করতে পারবেন।
| একক omni মডেল | cascade (Naia পদ্ধতি) | |
|---|---|---|
| গঠন | একটিতে সংহত মডেল | ভূমিকা অনুযায়ী অংশ জোড়া দেওয়া |
| সক্ষমতা পরিবর্তন | একবার প্রশিক্ষিত হলে স্থির — নতুন সক্ষমতার জন্য পুনঃপ্রশিক্ষণ দরকার | যেকোনো সময় অংশ প্রতিস্থাপন·যোগ — পুনঃপ্রশিক্ষণ ছাড়াই উন্নতি |
| গতি | সংহত হওয়ায় দ্রুত (কম বিলম্ব) | ধাপ থাকায় বিলম্ব কিছুটা বেশি হতে পারে |
| মাল্টিমোডাল সম্প্রসারণ | শুরু থেকে আবার প্রশিক্ষণ | ইনপুট·আউটপুটে অংশ ঢুকিয়ে দেওয়া |
| অংশ নির্বাচন | পুরোটা একত্রে বাঁধা | যাচাইকৃত অংশ বেছে ব্যবহার·প্রতিস্থাপন |
| মডেল ব্যবহার | এক মডেলে স্থির | একাধিক মডেল একসঙ্গে — প্রতি ধাপে সর্বোত্তম মডেল |
এভাবে সম্পূর্ণ হওয়া naia-0.9-omni-24g কনজিউমার PC পরিবেশের RTX 3090/4090/5090 (24GB)-তে মসৃণভাবে চলে।
⚙️ ব্যবহারের পদ্ধতি ও বৈশিষ্ট্য
এই আপডেটের ব্যবহারের পদ্ধতি বাস্তব অবকাঠামোগত পরিস্থিতি বিবেচনা করে নিম্নরূপে পুনর্গঠন করেছি।
লোকাল কন্টেইনার সরবরাহ (বেসিক সাবস্ক্রাইবার সুবিধা) — যে কেউ যেন নিজের ব্যক্তিগত PC-তে কন্টেইনার আকারে ডাউনলোড করে নিজের অ্যাপ্লিকেশন সরাসরি বানাতে পারেন, সেজন্য উন্মুক্ত করেছি।
podman pull ghcr.io/nextain/naia-0.9-omni-24g:latest
তবে আমাকেও জীবিকা চালিয়ে এই ওপেন-সোর্স প্রকল্পটি টিকিয়ে রাখতে হয় বলে, বেসিক সাবস্ক্রিপশন (মাসে $10) ব্যবহারকারীদের জন্য প্রতিজনে ১ Copy করে ব্যবহারযোগ্য করেছি। Naia ওপেন-সোর্স ইকোসিস্টেম যেন ধারাবাহিকভাবে বেড়ে ওঠে তার জন্য প্রয়োজনীয় ন্যূনতম পৃষ্ঠপোষকতা হিসেবে ভাবলে কৃতজ্ঞ থাকব। → Naia মডেল ডাউনলোড ও অ্যাক্টিভেশন ম্যানুয়াল
ওয়েব ডেমো অভিজ্ঞতা (৬০ সেকেন্ডের ঝলক) — বর্তমানে আমার ব্যক্তিগত PC ১টিতে সরাসরি চালিয়ে ৬০ সেকেন্ড করে ঝলক দেখার অভিজ্ঞতা দিচ্ছি। সীমিত সম্পদ বলে সংযুক্ত হওয়া মানুষের সংখ্যা অনুযায়ী কিউ (Queue) তৈরি হতে পারে — এই বিষয়টি উদারভাবে বুঝে নেবেন। → লাইভ ডেমো
ক্লাউড ব্যবহার (প্রস্তুতি চলছে) — শুরুতে পরিকল্পনা করা ঘণ্টায় $0.33 মডেলটি দুঃখজনকভাবে আপাতত 'প্রস্তুতি চলছে'-এ স্থানান্তর করছি। মূলধন ও সরঞ্জামের ঘাটতি থাকা এই মুহূর্তে সর্বক্ষণ অপেক্ষমাণ GPU পুল বজায় রাখা কঠিন, আর বরাদ্দের পর বুটিংয়ে লাগা প্রায় ১৫ মিনিটের সার্ভার খরচ বিনামূল্যে বহন করা দুঃসাধ্য। দেশে ব্যবহারযোগ্য রিমোট RTX 3090-ভিত্তিক সিস্টেমও ইতিমধ্যে তৈরি করে রেখেছি, কিন্তু GPU-এর সংকটে মসৃণ সেবা দেওয়া কঠিন বলে বিবেচনা করেছি। ভবিষ্যতে মূলধন জোগাড় হলে অপেক্ষার সময়হীন স্বচ্ছন্দ ক্লাউড সেবা অবশ্যই উপস্থাপন করব।উচ্চ সামঞ্জস্যতা — OpenAI Realtime API সমর্থন করে বিদ্যমান পরিবেশের সঙ্গে সামঞ্জস্য সর্বোচ্চ করেছি।
| এন্ডপয়েন্ট | উদ্দেশ্য |
|---|---|
GET /health | প্রস্তুতির অবস্থা {"ready":true} (প্রমাণীকরণ প্রয়োজন নেই) |
GET /v1/models | মডেল তালিকা |
WS /v1/realtime | রিয়েল-টাইম ভয়েস সেশন (VAD·বাধা দেওয়া·আবেগ) |
POST /v1/chat/completions | চ্যাট (স্ট্রিমিং সমর্থিত) |
POST /v1/audio/speech | ভয়েস সংশ্লেষণ (TTS) |
POST /v1/audio/transcriptions | ভয়েস শনাক্তকরণ (STT) |
POST /v1/embeddings | এমবেডিং |
→ Naia মডেল বিস্তারিত ব্যবহার (ডেভেলপারের জন্য ম্যানুয়াল)
নিরাপত্তা ও প্রাইভেসি — মডিউলের কর্মক্ষমতা যত উন্নত, ততই ভয়েস ফিশিং ইত্যাদিতে অপব্যবহারের আশঙ্কাও থাকে বলে, ভয়েস ওয়াটারমার্ক প্রযুক্তি প্রয়োগ করে শনাক্তযোগ্যতা যুক্ত করেছি যাতে আপনি নিশ্চিন্তে ব্যবহার করতে পারেন।
🧠 Naia যে ভবিষ্যৎ আঁকছে (Naia Cognitive)
Naia যে চূড়ান্ত লক্ষ্য অনুসরণ করে তা হলো 'আমার কম্পিউটারের ভেতরে আমার AI' বাস্তবায়ন এবং AI-এর সঙ্গে ব্যবহৃত অ্যাপ্লিকেশনের উন্নয়ন·বিতরণ ইকোসিস্টেম তৈরি করা। আমি যে মাল্টিমোডালিটির কথা ভাবি তা নিছক ডেটা ইনপুট-আউটপুট নয়, বরং AI যেন নিজেই অভিজ্ঞতা নেয়, মনে রাখে এবং প্রকাশ করে — এমন জ্ঞানীয় সক্ষমতাকে (Naia Cognitive) লক্ষ্য করে।
পরবর্তী সংস্করণে এজেন্ট (Naia-agent), দীর্ঘমেয়াদি স্মৃতি (Naia-memory), ফ্রেমওয়ার্ক (Naia-ADK) ইত্যাদির আপডেট অপেক্ষা করছে। Naia-0.9-Omni-48g-এর সঙ্গে যে পরবর্তী সংস্করণ আসবে, তা কোডিং কাজ করার মতো স্তরের লোকাল প্রোফাইল·পরিবেশ কনফিগারেশন এবং ব্যবহারকারীকে মনে রেখে রিয়েল-টাইম ভয়েসে একসঙ্গে কাজ করা — আক্ষরিক অর্থেই 'আয়রনম্যানের জার্ভিস'-এর মতো রূপকে লক্ষ্য করে গবেষণা·উন্নয়ন করছি।
48GB এখনো 24GB-এ যত জোর করেই ঢোকানো হোক না কেন কষ্টকর একটি এলাকা, তবে পুরনো RTX 3090 মাত্র দুটি লাগালেই হয়, তাই ব্যক্তি পর্যায়েও যথেষ্ট স্বপ্ন দেখার মতো বলে মনে করি।
🎮 Naia OS হলো এমন AI যে আমাকে মনে রাখে, আমার সঙ্গে কাজ করে ও খেলে
Naia-OS যে ছবি আঁকছে তা এমন।
- Steam(Bazzite)/Windows-ভিত্তিক গেম মেশিন + আমাকে মনে রাখা বুদ্ধিমান এজেন্ট + 3D অ্যাভাটার-ভিত্তিক স্বাভাবিক ভাষার UI + VRAM-ভিত্তিক অপ্টিমাইজড প্রোফাইল
সম্প্রতি MS ও Nvidia RTX-ভিত্তিক ছোট AI ডিভাইস বানাচ্ছে বলে বেশ আলোচনা হয়েছিল, তাই না? আসলে অপেক্ষা করার দরকার নেই। গেমও চলে আবার AI-ও চলে এমন Naia-OS ঠিক সেই জায়গাটাই লক্ষ্য করছে বলে। আমি হলে সেই নতুন পণ্যের বদলে Naia-OS কনফিগারেশন বেছে নিতাম — দাম আমাদের সুপারিশ করা উপরের লাইনের চেয়েও বেশি, গেম সামঞ্জস্যও অনিশ্চিত, আর ইন্টিগ্রেটেড মেমরি ধীর। বিপরীতে যাচাইকৃত কনজিউমার GPU লাগানো Naia-OS গেম·AI·সম্প্রসারণযোগ্যতা — সবই ধরে রাখে।
Mac পরিবেশকে ইচ্ছে করে পিছিয়ে দিচ্ছি তা নয়, সরঞ্জাম ও সময়ের অভাবে এখনো হাত দিতে পারিনি কেবল। একসঙ্গে সাহায্য করতে রাজি হওয়া কেউ কেউও আছেন।
Naia-OS একক মডিউল নয়, বরং প্রতিটির ভূমিকা পৃথক করা ওপেন-সোর্স রিপোজিটরি দিয়ে গঠিত, এবং ধীরে ধীরে কাঠামো জুড়ে যাচ্ছে। "কিছু একটা অসম্ভব বেশি মনে হচ্ছে?" — এমন লাগতে পারে, কিন্তু এখনই 'AI-ভিত্তিক ডেভেলপমেন্টের যুগ' বলেই এটা সম্ভব হচ্ছে।
বিদ্যমান OS যদি অ্যাপ্লিকেশন ব্যবস্থাপনার একটি টুল হয়ে থাকে, তবে AI OS হবে স্বাভাবিক ভাষায় যোগাযোগ করা, মনে রাখা এবং নিজে নিজে কাজ সামলানো সফটওয়্যার তথা রোবট — এমনটাই বিশ্বাস করি। কেবল ফাঁকা বুলি নয়, একটি একটি করে ফলাফল দিয়ে প্রমাণ করে দেখাব।
🤝 একসঙ্গে চলুন — অফলাইন মিটআপ ও ডিসকর্ড
আগামী সপ্তাহের মধ্যে, এতদিন যা যা কাজ করেছি তা পরিচয় করিয়ে দিতে এবং একসঙ্গে সাহায্য আদান-প্রদান করার মতো মানুষ খুঁজতে একটি অফলাইন মিটআপ করব ভাবছি। মডিউলটিও একবার ডাউনলোড করে দেখুন, আর আগ্রহীরা নিচের ডিসকর্ডে চলে আসুন। সত্যিকারের ওপেন-সোর্স কমিউনিটিতে পরিণত হওয়ার আশা রাখি।
সামনে Nextain ও Naia যে পথ তৈরি করবে তাতে অনেক উৎসাহ ও আগ্রহ চাইছি।
#Nextain #Naia