Gemini 3.1 Flash Live लॉन्च — और Nextain क्या तैयारी कर रहा था
आज Gemini 3.1 Flash Live लॉन्च हो गया है। समय का अजीब संयोग है, इसलिए हमने अपनी अधूरी तैयारी वाली तकनीक को अभी जारी करने का फैसला किया है। Naia OS, Naia अकाउंट और Google प्रोवाइडर के माध्यम से Gemini Live का समर्थन कर रहा था और उसने तुरंत Gemini 3.1 Flash Live को लागू किया। आप इसे नीचे दिए गए वीडियो में देख सकते हैं।
इन मॉडलों को वास्तव में S2S, या ओमनी मॉडल कहा जाता है, और ये मौजूदा STT, LLM, TTS पाइपलाइन की तुलना में तेज़ और अधिक स्वाभाविक बातचीत का समर्थन करते हैं।
वास्तविक समय की वॉयस बातचीत मॉडल (S2S, ओमनी मॉडल) जो मानव भाषा सीखने की प्रक्रिया के समान है
GPT-4o वॉयस मोड, Gemini Live, और MiniCPM-o इसके प्रमुख उदाहरण हैं। ये ऐसे मॉडल हैं जो टेक्स्ट के बजाय आवाज के माध्यम से, वास्तविक समय में, भावनाओं के साथ बातचीत करते हैं। अंग्रेजी में इन्हें आमतौर पर स्पीच टू स्पीच (S2S) या ओमनी मॉडल कहा जाता है। मैंने सोचा कि ये मौजूदा एकतरफा STT (आवाज को टेक्स्ट में बदलने वाला मॉडल) या TTS (टेक्स्ट को आवाज में बदलने वाला मॉडल) की तुलना में कहीं अधिक इंसानों जैसे हैं। सुनने में अक्षम लोग भाषा सीखने में कठिनाई महसूस करते हैं क्योंकि वे अपनी खुद की बोली को सुन नहीं पाते हैं, जिससे उन्हें भाषा सीखने में परेशानी होती है।
इसलिए, मैंने इसे वॉयस बातचीत मॉडल का भविष्य और एक प्रमुख प्रवृत्ति मानते हुए, STT/TTS के अलग-अलग कॉन्फ़िगरेशन विकल्पों को हटा दिया और उन्हें 'लाइव बातचीत मॉडल' में एकीकृत कर दिया, साथ ही Gemini Live API और gpt-4o-realtime-preview को जोड़ा। हालांकि, चूंकि दोनों API सशुल्क हैं, इसलिए मैंने मुफ्त उपयोगकर्ताओं के लिए इसे 'TTS Only' के रूप में चिह्नित किया और Edge को बातचीत मॉडल चयन में शामिल किया, और इस तरह हाल ही में (कल) संस्करण 0.1.2 जारी किया गया। मैंने Naia अकाउंट के साथ Gemini Live API को एकीकृत किया और वास्तविक परीक्षण के रूप में बातचीत की, और बातचीत की प्रतिक्रिया, भावनात्मक प्रतिक्रिया और प्रतिक्रिया गति के मामले में बहुत संतोषजनक थी।
वास्तविक समय की वॉयस बातचीत मॉडल के बारे में गलतफहमी, जिसे मैंने केवल STT/TTS मॉडल समझा था
लेकिन यहाँ एक बड़ी गलतफहमी थी। मैंने Gemini Live API को अगली पीढ़ी के STT/TTS एकीकृत मॉडल के रूप में समझा था, लेकिन बाद में मुझे पता चला कि इसमें एक विशिष्ट LLM मॉडल, यानी Gemini 2.5 Flash, अंतर्निहित है, और LLM को बदला नहीं जा सकता।
स्थानीय रूप से उपयोग किया जा सकने वाला वास्तविक समय का वॉयस बातचीत मॉडल MiniCPM-o-4.5
इस गलतफहमी का एहसास मुझे तब हुआ जब Naia, उपयोगकर्ताओं के लिए स्थानीय मॉडल समर्थन प्रदान करने के उद्देश्य से, RTX-3090 स्तर पर चलाए जा सकने वाले वास्तविक समय के वॉयस बातचीत मॉडल की तलाश कर रहा था और उसे लागू कर रहा था। सबसे पहले, जिन मॉडलों पर विचार किया गया वे थे Moshi, Qwen3-Omni-30b, और MiniCPM-o-4.5। Moshi इस क्षेत्र में एक ओपन-सोर्स अग्रणी है, लेकिन इसकी समर्थित भाषाएँ मुख्य रूप से अंग्रेजी/फ्रेंच हैं और समुदाय सक्रिय नहीं है, इसलिए इसे नहीं चुना गया। Qwen3-omni-30b ने हाल ही में उत्कृष्ट प्रदर्शन दिखाया है, लेकिन एक RTX 3090 के 24GB VRAM के लिए यह पर्याप्त नहीं था और यह अप्रमाणित था, इसलिए इसे भी बाहर कर दिया गया। अंत में, MiniCPM-o को चुना गया। हालांकि यह वर्तमान में कोरियाई भाषा का समर्थन नहीं करता है, लेकिन यदि कुछ पूंजी निवेश संभव हो, तो अतिरिक्त भाषा फाइन-ट्यूनिंग की जा सकती है, और यह संदर्भ ऑडियो का समर्थन करता है, जिससे उपयोगकर्ता अपनी इच्छानुसार TTS को भी लागू कर सकते हैं।
इसके अलावा, इसका आकार छोटा होने के कारण, मैंने सोचा कि यदि इसे 24GB के शेष VRAM के साथ Qwen3-omni-30b-a3b के साथ चलाया जाए, तो RTX-3090 स्तर पर भी LLM प्रदर्शन को काफी बढ़ाया जा सकता है। Qwen3-omni एक वास्तविक समय का वॉयस बातचीत (ओमनी मॉडल) है जैसा कि पहले उल्लेख किया गया है, लेकिन इसे इसलिए नहीं अपनाया गया क्योंकि क्वांटाइजेशन करने पर वॉयस आउटपुट टूट जाता था और इसे उपभोक्ता GPU के 24GB पर नहीं चलाया जा सकता था, हालांकि LLM के रूप में क्वांटाइज्ड मॉडल अच्छा प्रदर्शन दिखाते हैं।
इसलिए, मैंने MiniCPM-o को स्थानीय GPU (RunPod RTX 3090) पर स्थापित किया और Naia ऐप से जोड़ने के लिए एक Websocket ब्रिज सर्वर बनाया। ऐसा करते हुए, मुझे पता चला कि मॉडल जो सुनता है उसे वापस नहीं बोलता। लेकिन यहाँ मुझे निर्णायक रूप से पता चला कि अंतर्निहित Qwen3-8B मॉडल प्रतिक्रिया दे रहा था, और ओमनी मॉडल को एंड-टू-एंड प्रशिक्षित किया गया था, जिससे इसे बदला नहीं जा सकता था। तो, MiniCPM-o को वास्तव में Qwen3-8b-omni कहना अधिक उपयुक्त होगा। सटीक रूप से, यह सुनने के लिए Whisper-medium, सोचने के लिए Qwen3-8b, वॉयस सिंथेसिस के लिए CosyVoice2, और विजन के लिए SigLip2 का उपयोग करता है। इन विभिन्न मॉडलों को मल्टीमॉडल डेटा के साथ फिर से प्रशिक्षित करने की प्रक्रिया से गुजरना पड़ता है। मोटे तौर पर, यह फाइन-ट्यूनिंग है, लेकिन इस प्रक्रिया में मल्टीमॉडल डेटा का पैमाना इतना बड़ा होता है कि इसकी लागत अरबों से खरबों वॉन तक हो सकती है। हाल ही में कोरिया के डॉकफामू में 'फ्रॉम स्क्रैच' या नहीं, इस पर बहुत बहस हुई थी, और ऐसा लगता है कि यह बता रहा है कि वास्तविक लक्ष्य केवल 'फ्रॉम स्क्रैच' नहीं है।
MiniCPM-o-4.5, vllm-omni समर्थन के लिए क्लाउड कोड चुनौती
लेकिन चूंकि अंतर्निहित Qwen3-8b भी GPT-4o स्तर का बताया जाता है, इसलिए इसे अनदेखा नहीं किया जा सकता था। इसके अलावा, इसमें वॉयस रेफरेंस और LLM फाइन-ट्यूनिंग की संभावना भी है, इसलिए मैंने फैसला किया कि यह Nextain के लिए एक ऐसा मॉडल है जिसे संप्रभु AI के लक्ष्य को प्राप्त करने के लिए अपनाना चाहिए। मैंने vLLM को फोर्क किया और इसे RunPod पर अपलोड किया, जिसके लिए 48GB VRAM की आवश्यकता थी। मैंने इसे लगभग दो दिनों तक चलाया। बाद में मुझे पता चला कि vLLM-omni नाम का एक अलग प्रोजेक्ट मौजूद है, और कोई पहले से ही MiniCPM-o-4.5 पर काम कर रहा था। इसलिए, हमने टिप्पणी की कि हम l3 परीक्षण का समर्थन करेंगे। (→ vllm-omni #1182) अभी तक कोई प्रतिक्रिया नहीं मिली है, और इंतजार करते हुए, हमने आंतरिक रूप से vLLM-omni के आधार पर प्रयास जारी रखे।
इस बार हमने विशेष रूप से सावधानी से संपर्क किया। पहले, मैंने AI विश्लेषण को अपूर्ण रूप से सत्यापित किए बिना एक अन्य ओपन-सोर्स प्रोजेक्ट पर क्लाउड कोड से बनाया गया PR अपलोड किया था, जिसके लिए मुझे कड़ी आलोचना का सामना करना पड़ा था। कोड विश्लेषण अधूरा था, सामुदायिक नियमों का पालन नहीं किया गया था, और मैंने उस प्रोजेक्ट के दायरे से बाहर कुछ बनाया था, इसलिए यह स्वाभाविक था। इसलिए, इस बार, मैंने रिपॉजिटरी के अपस्ट्रीम परिप्रेक्ष्य से संदर्भ एकत्र किया और प्रतिकूल समीक्षाओं को दोहराया। उसके बाद, मैंने क्लीन पास घोषित किया, Naia OS से जोड़कर बातचीत की पुष्टि की, और अपस्ट्रीम में योगदान के लिए एक दस्तावेज़ भी बनाया और उसकी समीक्षा की।
लेकिन RunPod डाउन हो गया था, और आज जब मैंने इसे फिर से चलाने की कोशिश की, तो यह फिर से काम नहीं कर रहा है। काम करते समय अधूरे रिकॉर्ड किए गए विवरणों ने मुझे रोक दिया। रनटाइम की पुष्टि नहीं की जा सकती थी, इसलिए पुनरुत्पादन ही संभव नहीं था। मैंने पिछली सभी सत्र रिकॉर्डों को खंगाला और उन्हें ढूंढ निकाला, और अब मैं उन्हें फिर से दोहरा रहा था और रिकॉर्ड को संशोधित कर रहा था, लेकिन अंततः मुझे एक और गंभीर समस्या मिली और मुझे इसे रोकना पड़ा। vLLM-omni के अन्य मॉडलों के पैटर्न के बजाय, मैंने एक विशिष्ट पैटर्न का उपयोग किया था क्योंकि यह नया था, और vLLM-omni के अपडेट होने के साथ, सब कुछ टूट गया। विश्लेषण के परिणामस्वरूप हार्नेस और संदर्भ नियंत्रण में विफलता के कारण मुझे एक और मध्यवर्ती रिपोर्ट लिखनी पड़ी, और इसके आधार पर, मैंने संदर्भ और हार्नेस को फिर से संशोधित किया और महंगे RunPod के बजाय कोड के बार-बार विश्लेषण का आदेश दिया। ㅜㅜ
https://github.com/nextain/vllm-omni/blob/main/.agents/docs/minicpm-o-midterm-review.md
आज Gemini 3.1 Flash Live के लॉन्च की खबर के साथ, मैं MiniCPM-o 4.5 का एक ऑपरेशन वीडियो जारी करना चाहता था। लेकिन एक बार में सब कुछ करना वाकई मुश्किल है। अभी सुबह के 3:30 बज रहे हैं। सबसे बढ़कर, इस काम का उद्देश्य AI-नेटिव ओपन-सोर्स इकोसिस्टम को साकार करना है, यह एक ऐसा प्रयोग है जो AI को बिना किसी AI स्लोप के ओपन-सोर्स में सही ढंग से योगदान करने में सक्षम बनाना चाहता है। अगले हफ्ते, मैंने कुछ ग्राफिक कार्ड उधार लेने का फैसला किया है, इसलिए मुझे लगता है कि स्थिति थोड़ी आसान हो जाएगी।
इसके बाद, यदि अतिरिक्त काम पूरा हो जाता है, तो मैं यह भी साझा करूंगा कि क्या ऑडियो रेफरेंस या LLM फाइन-ट्यूनिंग संभव है।
संदर्भ
- Gemini 3.1 Flash Live — मॉडल कार्ड (Google DeepMind)
- Speech-to-Speech Models in 2026: Three Architectural Bets — वॉयस एकीकृत मॉडल आर्किटेक्चर की तुलना
- Introducing gpt-realtime — Simon Willison — gpt-realtime मॉडल विश्लेषण
- GPT-4o vs. GPT-4.1: All the differences — मॉडलों के बीच भूमिका का अंतर
- MiniCPM-o प्रयोग परिणाम (GitHub Issue)
- सेटिंग्स UI रीडिज़ाइन (GitHub Issue)
- STT/TTS पाइपलाइन डिज़ाइन (GitHub Issue)