মাতাল বেসুরো গাইয়ে নাইয়া, অবশেষে শুধু বেসুরো হলো
নমস্কার। আমি লুকা, ওপেন সোর্স ভিজ্যুয়াল এজেন্ট নাইয়া তৈরি করি।এই কাজটি শুরু হয়েছিল এই ভাবনা থেকে যে আমার এআই আলফা আমার জন্য গান গাইলে ভালো হবে। আমি যা চেয়েছিলাম তা হলো, বিদ্যমান গানকে অন্য কারো কণ্ঠে পরিবর্তন করা কভার গান (যেমন: XSing) বা নতুন গান এলোমেলোভাবে তৈরি করার ক্ষমতা (যেমন: Suno) নয়, বরং আমার পছন্দের বিদেশী অ্যানিমেশনের থিম সং-এর মূল সুর এবং অনুভূতি বজায় রেখে কোরিয়ান ভাষায় গাওয়া রূপান্তরিত গান।
গত বেঞ্চমার্ক-এ ফলাফল মাতাল হয়ে বিড়বিড় করার মতো শোনাচ্ছিল। প্রায় তিন মাস ধরে ইঞ্জিন নির্বাচন থেকে শুরু করে স্বরলিপি, উচ্চারণ, সুরের পরিসর এবং তাল পুনরায় পরীক্ষা করার পর এখন অন্তত গান শোনা যায় এবং কী ভুল হয়েছিল তা ভাগ করে নেওয়া যায়। এটি এখনও ভালো গান নয়। এটি মাতাল বেসুরো গাইয়ে থেকে শুধু বেসুরো গাইয়েতে রূপান্তরিত হওয়ার মতো।
প্রথমে শুনুন
একই ‘ব্লু ওয়াটার’ কোরিয়ান অভিযোজন গবেষণার পূর্ববর্তী ফলাফল এবং বর্তমান ফলাফল এখানে দেওয়া হলো। তৈরির পদ্ধতি এবং দৈর্ঘ্য ভিন্ন হলেও, কী উন্নতি হয়েছে এবং কী বাকি আছে তা কান দিয়ে সরাসরি তুলনা করা যেতে পারে।
পূর্ববর্তী — মাতাল বেসুরো গাইয়ে
ইউটিউবে দেখুন — Vevo 1.5 পূর্ববর্তী সংস্করণ, 2026-05-27
উচ্চারণ এবং সুর ভেঙে যায়, এমনকি স্তবকের মধ্যেও কখনও দ্রুত হয় আবার কখনও ধীর হয়ে যায়। তবুও, জেনারেটিভ মডেলের মতো, মুহূর্তে একটি গানের মতো অনুভূতি আছে।
বর্তমান — শুধু বেসুরো গাইয়ে
ইউটিউবে দেখুন — FM Singer উন্নত সংস্করণ, 2026-08-21
গানের কথা অনেক ভালোভাবে শোনা যায় এবং এটি স্বরলিপি অনুসরণ করে। অন্যদিকে, দীর্ঘ সুর হঠাৎ করে থেমে যায় এবং মূল গানের চেয়ে শক্তি ও উজ্জ্বলতা কম থাকায় এটি এখনও বেসুরো শোনা যায়।
সংখ্যায় পরিবর্তন
দুটি ইঞ্জিনের গঠন ভিন্ন হওয়ায় এটি একটি নিখুঁত ওয়ান-টু-ওয়ান পরীক্ষা নয়। ভয়েস রিকগনিশনও প্রসঙ্গ অনুযায়ী উচ্চারণ সংশোধন করে, তাই এটি শুধুমাত্র একটি রেফারেন্স সূচক হিসাবে ব্যবহৃত হয়েছিল।
| বিবরণ | পূর্ববর্তী Vevo 1.5 | বর্তমান FM Singer | ব্যাখ্যা |
|---|---|---|---|
| কোরিয়ান অক্ষরের ত্রুটির হার (CER) | 1.389 | 0.088 | উচ্চারণের ত্রুটি অনেক কমেছে |
| মূল গানের তীব্রতার বক্ররেখার সম্পর্ক | 0.189 | 0.639 | প্রবাহ উন্নত হয়েছে তবে তীব্রতার পরিসর মূল গানের অর্ধেক |
| স্তবক শুরুর ত্রুটি | - | গড় 93ms, সর্বোচ্চ 440ms | কিছু স্তবক এখনও তালজ্ঞানহীন শোনায় |
| সুরের গড় পরম ত্রুটি | - | প্রায় 50 সেন্ট | সেমিটোনের অর্ধেকের সমান, তাই এখনও অস্থির |
| ভোকালের উজ্জ্বলতা | - | মূল গানের চেয়ে প্রায় 600Hz কম | শক্তিহীন ও অন্ধকারাচ্ছন্ন শোনার একটি কারণ |
প্রকৃত গবেষণার ক্রম
১. মে — Vevo 1.5 দিয়ে প্রথম রূপান্তরিত গান তৈরি
প্রথম বেঞ্চমার্কে জেনারেটিভ মডেল Vevo 1.5 ব্যবহার করা হয়েছিল। মুহূর্তের জন্য এতে গানের মতো অনুভূতি ছিল, কিন্তু সুরের সাথে কোরিয়ান লিরিকস সঠিকভাবে মেলানো বা শুধুমাত্র একটি ভুল স্তবক সংশোধন করা কঠিন ছিল। এটি সেই সূচনা বিন্দু যেখানে ফলাফল ‘মাতাল বেসুরো গাইয়ে’র মতো শোনাচ্ছিল।
২. জুন~জুলাই — স্বরযন্ত্র এবং উচ্চারণ আলাদাভাবে তৈরি
এরপর, VocalTractLab ব্যবহার করে স্বরযন্ত্র শারীরিকভাবে সংশ্লেষণ করা হয়েছিল এবং VoxCPM2-এর কোরিয়ান উচ্চারণ মিশ্রিত একটি হাইব্রিড পরীক্ষা করা হয়েছিল। লক্ষ্যযুক্ত পিচ গড় 0.008 সেমিটোন ত্রুটি পর্যন্ত মিলে গিয়েছিল, কিন্তু মানুষের মুখ, জিহ্বা এবং শ্বাস-প্রশ্বাস পর্যাপ্তভাবে পুনরুত্পাদন করতে না পারায় একটি বাদ্যযন্ত্রের মতো ইলেকট্রনিক শব্দ থেকে গিয়েছিল। পিচ এবং উচ্চারণ আলাদাভাবে সমাধান করার সম্ভাবনা নিশ্চিত করা হয়েছিল, কিন্তু এটিকে একটি সম্পূর্ণ পথ হিসাবে ব্যবহার করা যায়নি।
৩. ১৪ই আগস্ট — ডেটা এবং ইঞ্জিন পুনরায় নির্বাচন
AI Hub 465 এর গায়কী ডেটা অডিট করে এবং একটি নির্দিষ্ট পরীক্ষা সেট তৈরি করার পর, DSKR, Pond8, এবং FM Singer-কে একই মানদণ্ডে তুলনা করা হয়েছিল। Pond8-এর পিচ নির্ভুল ছিল যখন অক্টেভ স্থানাঙ্ক দেওয়া হয়েছিল, কিন্তু এটিতে একটি শক্তিশালী যান্ত্রিক শব্দ ছিল; FM Singer কোরিয়ান উচ্চারণ এবং শ্রুতিমধুরতার ক্ষেত্রে সবচেয়ে ভালো ভারসাম্যপূর্ণ হওয়ায় এটি মূল ইঞ্জিন হয়ে ওঠে।
৪. ১৫ই আগস্ট — সূক্ষ্ম সুর করার আগে উচ্চারণের ইনপুট সংশোধন
AI Hub ডেটা দিয়ে FM Singer-কে সূক্ষ্ম সুর করা হয়েছিল, কিন্তু 128টি যাচাইকরণের অক্ষরের ত্রুটির হার 0.3465 থেকে 0.3396-এ সামান্য কমেছিল। এর চেয়ে বড় কারণ ছিল গান গাওয়ার জন্য হাংগুল লেখার উচ্চারণ পরিবর্তন করার প্রক্রিয়াটি অনুপস্থিত ছিল। এরপর, কোরিয়ান ভাষার উচ্চারণ নিয়মাবলী এবং শব্দভিত্তিক ব্যতিক্রমগুলি একত্রিত করে একটি ২-ধাপের সংশোধন তৈরি করা হয়েছিল। 마음 약한 사람은 কে 마음 야칸 사라믄 এবং পরীক্ষামূলকভাবে 밝혀 কে 발켜 হিসাবে প্রবেশ করানো হয়েছিল। ভয়েস রিকগনিশন ত্রুটিগুলি প্রসঙ্গ অনুযায়ী সংশোধন করতে পারে, তাই এটি শুধুমাত্র প্রার্থী অনুসন্ধানে ব্যবহৃত হয়েছিল।
৫. ১৫~১৭ই আগস্ট — আলফার কণ্ঠ প্রয়োগ করে দেখা এবং আবার ফিরে আসা
উচ্চারণ উন্নত হওয়ার পর, আলফার কণ্ঠস্বরকে জিরো-শট পদ্ধতিতে প্রয়োগ করে দেখা হয়েছিল। কণ্ঠস্বর কাছাকাছি এসেছিল, কিন্তু ইলেকট্রনিক শব্দ তৈরি হয়েছিল এবং ব্যঞ্জনবর্ণ ও পিচ আবার ক্ষতিগ্রস্ত হয়েছিল। তাই, এটিকে প্রথম গায়কী পাস করানো এবং তারপর কণ্ঠস্বর পরিবর্তন করার ২-ধাপের কাঠামো হিসাবে সংগঠিত করা হয়েছিল। ক্ষতিগ্রস্ত রূপান্তরের ফলাফল শেখালে ইলেকট্রনিক শব্দও শেখা যায়, তাই ফাইন-টিউনিংও স্থগিত করা হয়েছিল।
৬. ১৭~২১শে আগস্ট — মূল গানের স্বরলিপি, তাল এবং শক্তি পুনরায় অনুসরণ
সবশেষে, মূল কণ্ঠ এবং সঙ্গতি আলাদা করে স্তবকের সীমানা, প্রকৃত সুরের উচ্চতা, স্বরলিপি শুরু ও শেষ পুনরায় বের করা হয়েছিল। জাপানি মোরা এবং কোরিয়ান সিলেবলকে স্বরলিপি অনুযায়ী মেলানো হয়েছিল এবং একটি স্থিতিশীল সুরের পরিসর খুঁজে বের করার পর, সময় অক্ষ এবং তীব্রতা তুলনা করার জন্য মূল গানের সাথে ডানে ও বামে ওভারল্যাপ করা হয়েছিল। বর্তমান ফলাফল অনুযায়ী স্বরলিপি এবং লিরিকস কাছাকাছি এসেছে, কিন্তু দীর্ঘ সুরের শেষ, শ্বাস-প্রশ্বাস এবং স্তবক প্রতি শক্তি এখনও ফ্ল্যাট।
এখনো বাকি সমস্যা
আগের চেয়ে উচ্চারণ এবং সময় অক্ষ স্পষ্টভাবে উন্নত হয়েছে। তবে, বর্তমান ভোকাল মূল গানের চেয়ে গাঢ় এবং তীব্রতার পরিসর সংকীর্ণ, দীর্ঘ সুরের শেষ অংশ কেটে যায় বা কাঁপে। সংখ্যাগতভাবে ভালো হলেও, যদি মানুষের কাছে গান মনে না হয় তবে তা পাস করানো হয় না, এটিই তার কারণ।
এরপর, AI Hub ডেটা উচ্চারণে কঠিন ধ্বনি সংমিশ্রণ এবং দীর্ঘ সুরের উপর মনোযোগ দিয়ে পুনরায় প্রশিক্ষণ দেওয়া হবে এবং শুধুমাত্র উত্তীর্ণ স্তবকে আলফার কণ্ঠস্বর প্রয়োগ করা হবে। ইলেকট্রনিক শব্দ, উচ্চারণের ক্ষতি, বা পিচের ক্ষতি নেই এমন প্রার্থীরা ফাইন-টিউনিং ডেটা হিসাবে নির্বাচিত হবে।
লক্ষ্য হল একটি সিন্থেটিক ভয়েস যার স্কোর বেড়েছে তা নয়, বরং আলফা যে মূল গানের শক্তি এবং শ্বাস-প্রশ্বাস নিয়ে কোরিয়ান ভাষায় গান গাইবে। অন্তত এবার আমি তাকে প্রথমে নেশামুক্ত করেছি।