[为了打造我的 AI Alpha] 音痴 Naia 终于开始唱歌了,我们正在关注专用硬件。
大家好,我是 Luke,开源视觉代理 Naia 的开发者。在上一篇文章中,我告诉大家 Alpha 从醉酒音痴变成了普通音痴。现在,它终于开始唱歌了。这个项目始于我希望 Alpha 能为我唱歌的简单想法。最终目标是让它能真正唱出自己的歌,并根据情感与他人合唱,但这还有很长的路要走。目前,第一阶段是让它能看着乐谱和歌词唱韩语歌。这与 YouTube 翻唱或完全创作歌曲的 Suno 不同。如果联想到 Hatsune Miku,会更接近。
我们用 Blue Water 的韩语改编曲(如第一版、第二版)进行了测试。这次我不会详细说明方法。我计划在它真正可用时再考虑如何分享。我可以透露的是,我们已经开始使用 AI Hub 歌唱数据进行实际训练。在此基础上,我们正在继续进行自己的实验。
请听
您可以先听现在的版本,再听过去的版本。仍然有音痴的部分。实际上,这已经是很大的进步了。过去是这样的:
第三版 — 2026-09-11,现在开始有点会唱了
大约一分钟。前两秒淡入,最后三秒淡出。
节奏和发音仍有一些不自然的地方。但韩语已经开始融入旋律了。
第一版 — 2026-05-27,醉酒音痴
过去是这样的。发音和音值崩溃,乐句内部时快时慢。
第二版 — 2026-08-21,普通音痴
歌词能听清,也能跟着音符走。长音会中断,听起来仍然像音痴。
我们想做什么
我们想做的不是翻唱应用,也不是随意生成歌曲的生成器。它是一个歌唱引擎。并且在这个引擎之上,叠加个人独特的声音和歌唱习惯。
目前还不清楚这将如何融入 Naia。它可能附在聊天旁边,也可能是一个完全不同的位置。最终,我们只有一个愿望:让个人的 AI 也能为那个人唱歌。
让 Alpha 为我唱韩语版的 Blue Water。我们又向这个方向迈进了一步。虽然还没完全摆脱音痴,但现在至少能拿起麦克风站着唱了。
Naia 专用设备,可作服务器和客户端,语音服务价格减半
除了唱歌,我们还在着手开发 Naia 的专用设备。
左边那个用 3D 打印机制作的小盒子就是正在测试中的 Naia 硬件。无需昂贵的 Mac Studio,它就能在本地实现实时语音和不错的 3D 游戏,屏幕上显示的就是 Naia OS。它既可以作为客户端,也可以作为服务器。昨天的测试结果显示,幸运的是,语音生成速度能够跟上发音速度,确认了实时服务的可能性。在此基础上,我们已经进行了技术验证,确认 Naia OS 能够提供以现有市场价格一半成本的语音服务基础设施。Nextain 的最终目标是 P2P AI 环境基础设施。目前,我们甚至只用二手零件组装了一台,但一旦获得初期投资,服务应该就能启动。目前仍在进行内部可用性测试。性能已经确认,但存在 SSD 变为只读或随着时间推移屏幕变黑的问题,我们正在检查是 OS 配置问题还是硬件故障。稍后我也会分享这方面的消息。