奈亚
· Luke

在RTX 3090上实现声音克隆・实时对话・技能的Naia-0.9-Omni-24g正式公开(Naia v0.1.5)

naia-osnaia-omnivoice-aicascadeopen-sourcev0.1.5

大家好,我是正在打造AI OS Naia的Luke。继上次匆忙分享上线消息并恳请大家帮助的那篇文章之后,这次我要随着v0.1.5更新带来最重要的消息——不仅是AI OS,还有全新的AI omni模型,准确地说是**Naia-Omni模块(naia-0.9-omni-24g)**的公开消息。

Naia-0.9-Omni-24g
Naia-0.9-Omni-24g

▎本次v0.1.5中您可以在Naia-OS里直接体验到的功能

  • 与3D虚拟形象的实时语音对话(含声音克隆) —— 这是本版本的主角。
  • 嵌入式浏览器 —— 在画面之中,AI与您一起观看并提供协助。
  • 技能系统 —— 用内置技能拓展功能,并连接MCP(Model Context Protocol)工具。
  • 应用面板 —— 您可以在Naia内添加想要的应用面板。
  • 我的模型,我的密钥照旧 —— 您可以连接想用的AI供应商・密钥,或以本地模型运行。
  • 隐私 —— 以本地运行为默认,且不会将输入・输出用于模型训练。
  • 支持14种语言界面

Naia并不只是标榜OS的一个外壳(Shell)。本次更新的核心,是在消费级GPU(RTX 3090/4090/5090等24GB VRAM)环境下,连同30种多国语言一起实现了ChatGPT・Gemini级别的全双工实时对话naia-0.9-omni-24g模块。

这是连接到我亲自安装在自己PC上的Naia-Omni,用真实语音进行对话的视频。(请注意,我麦克风里的声音并未录入视频中。)

▎为什么是'cascade'模块

之前我曾说过正在把MiniCPM-4.5-omni移植到vLLM,正是为了将它移植到这个Naia上。Omni模型最大的优点在于能够实时进行极其自然的对话。不过那个模型不仅需要28GB以上的VRAM,还有只支持中文和英文的局限。为了把它改善为支持韩语,我同时进行了Talker微调(FT)等多项研究,但最终还是撞上了技术天花板,而其他Omni模型则比它沉重得多。

如此寻找替代方案的最后,我打造出的不是单一模型,而是采用**'级联(Cascade)'方式的naia-0.9-omni-24g**。这是一个将多个AI模型恰当编排并优化的模块,虽未达到完美的逐token级处理,却拥有与之相当的速度以及灵活得多的构成。它是在消费级24GB GPU上同时支持30国多国语言、全双工、实时声音克隆的、事实上唯一的替代方案。我们正在引导您像使用一个独立模型那样以API级别加以运用,您可以亲自体验远更聪明、远更清晰的声音克隆能力。

单一omni模型cascade(Naia方式)
构成整合为一体的模型按角色组装各个部件
能力变更一旦训练完成即固定 —— 新能力需重新训练随时更换・添加部件 —— 无需重训即可改进
速度整合后快速(低延迟)因有阶段,延迟可能稍多一些
多模态扩展从头重新训练在输入・输出处嵌入部件
部件选择整体捆绑挑选并使用・更换经验证的部件
模型运用固定于一个模型多个模型协同 —— 每个阶段都用最优模型

如此完成的naia-0.9-omni-24g,在消费级PC环境的RTX 3090/4090/5090(24GB)上可流畅运行。

⚙️ 使用方式及特点

本次更新的使用方式,综合考虑现实的基础设施状况,做了如下调整。

本地容器提供(基础订阅者福利) —— 我们开放了让任何人都能以容器形式下载到个人PC、亲手打造属于自己的应用程序。

podman pull ghcr.io/nextain/naia-0.9-omni-24g:latest

不过,我自己也需要维持生计才能持续这个开源项目,因此为基础订阅(每月$10)用户提供每人1 Copy的使用权。还望您把它当作Naia开源生态持续成长所需的最低限度的支持。→ Naia模型下载及激活手册

网页演示体验(60秒尝鲜) —— 目前我在自己的1台个人PC上亲自运行,提供每次60秒的尝鲜体验。由于资源有限,根据接入人数可能会产生排队(Queue),还请多多包涵。→ 实时演示

Naia实时演示画面 云端使用(筹备中) —— 当初规划的每小时$0.33方案,很遗憾暂时转为'筹备中'。在资本与设备都不足的当下,难以维持常时待命的GPU池,而分配后启动所需约15分钟的服务器费用,目前也难以无偿承担。虽然在国内可用的远程RTX 3090系统我已经开发完成,但因GPU紧缺,我判断难以顺畅提供服务。待日后资本到位,我一定会推出无需等待、舒适流畅的云端服务。
Naia实时演示画面

高兼容性 —— 支持OpenAI Realtime API,将与既有环境的兼容性最大化。

端点用途
GET /health就绪状态 {"ready":true}(无需认证)
GET /v1/models模型列表
WS /v1/realtime实时语音会话(VAD・打断・情感)
POST /v1/chat/completions聊天(支持流式)
POST /v1/audio/speech语音合成(TTS)
POST /v1/audio/transcriptions语音识别(STT)
POST /v1/embeddings嵌入

Naia模型详细使用(开发者手册)

安全性及隐私 —— 正因模块性能出色,也存在被滥用于语音诈骗等的隐忧,因此我们应用了语音水印技术以具备可追溯性,让您可以安心使用。

🧠 Naia描绘的未来(Naia Cognitive)

Naia所追求的终极方向,是实现**'我的电脑里的我的AI'**,并打造与AI共同使用的应用程序的开发・发布生态。我所描绘的多模态,不只是单纯的数据输入输出,而是以AI能自行体验、记忆并表达的认知能力(Naia Cognitive)为目标。

下一个版本中,还有代理(Naia-agent)、长期记忆(Naia-memory)、框架(Naia-ADK)等更新在等待着大家。将与Naia-0.9-Omni-48g一同上线的下一个版本,正以可进行编码作业级别的本地配置文件・环境构成,以及记住用户、用实时语音一同工作——名副其实'钢铁侠的贾维斯'般的样貌为目标,进行研究・开发。

48GB目前仍是无论怎么往24GB里硬塞都吃力的领域,但只要插上两张旧款RTX 3090即可,所以我认为个人也完全值得憧憬一番。

🎮 Naia OS是记住我、与我一起工作和玩乐的AI

Naia-OS所描绘的图景是这样的。

  • 基于Steam(Bazzite)/Windows的游戏主机 + 记住我的智能代理 + 基于3D虚拟形象的自然语言UI + 按VRAM优化的配置文件

最近MS和Nvidia要做基于RTX的小型AI设备一事掀起了热议。其实无需等待。因为既能玩游戏又能跑AI的Naia-OS,正瞄准着那个位置。换作是我,我会选择Naia-OS的配置而非那款新产品——它的价格比我们推荐的高端线还要贵,游戏兼容性也是未知数,而且统一内存速度慢。相反,插上经验证的消费级GPU的Naia-OS,则能把游戏・AI・扩展性全部拿下。

并非有意推迟Mac环境,只是因设备与时间不足,至今还未能着手而已。也有几位答应一起帮忙的朋友。

Naia-OS并非单一模块,而是由各自角色分离的开源仓库组成,正一步步搭建骨架。您或许会想"怎么有这么多东西?",但正因为当下正是'基于AI的开发时代',这才得以实现。

如果说过去的OS是应用程序的管理工具,那么我相信AI OS将成为用自然语言沟通、记忆并自主处理事务的软件兼机器人。这绝非单纯的虚张声势,我会一个个用成果来证明。

🤝 一起来吧 —— 线下聚会 & Discord

下周内,我打算办一场线下聚会,介绍这段时间做的东西,并寻找愿意一起互助的伙伴。也欢迎大家把模块下载下来试一试,有兴趣的朋友请通过下面的Discord来找我们。希望它能发展成一个真正的开源社区。

加入Naia Discord

恳请大家为Nextain与Naia今后将走的路,多多给予支持与关注。

#Nextain #Naia

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

评论

无需登录即可评论

...