大家好,我是正在打造AI OS Naia的Luke。继上次匆忙分享上线消息并恳请大家帮助的那篇文章之后,这次我要随着v0.1.5更新带来最重要的消息——不仅是AI OS,还有全新的AI omni模型,准确地说是**Naia-Omni模块(naia-0.9-omni-24g)**的公开消息。

▎本次v0.1.5中您可以在Naia-OS里直接体验到的功能
- 与3D虚拟形象的实时语音对话(含声音克隆) —— 这是本版本的主角。
- 嵌入式浏览器 —— 在画面之中,AI与您一起观看并提供协助。
- 技能系统 —— 用内置技能拓展功能,并连接MCP(Model Context Protocol)工具。
- 应用面板 —— 您可以在Naia内添加想要的应用面板。
- 我的模型,我的密钥照旧 —— 您可以连接想用的AI供应商・密钥,或以本地模型运行。
- 隐私 —— 以本地运行为默认,且不会将输入・输出用于模型训练。
- 支持14种语言界面
Naia并不只是标榜OS的一个外壳(Shell)。本次更新的核心,是在消费级GPU(RTX 3090/4090/5090等24GB VRAM)环境下,连同30种多国语言一起实现了ChatGPT・Gemini级别的全双工实时对话的naia-0.9-omni-24g模块。
这是连接到我亲自安装在自己PC上的Naia-Omni,用真实语音进行对话的视频。(请注意,我麦克风里的声音并未录入视频中。)
▎为什么是'cascade'模块
之前我曾说过正在把MiniCPM-4.5-omni移植到vLLM,正是为了将它移植到这个Naia上。Omni模型最大的优点在于能够实时进行极其自然的对话。不过那个模型不仅需要28GB以上的VRAM,还有只支持中文和英文的局限。为了把它改善为支持韩语,我同时进行了Talker微调(FT)等多项研究,但最终还是撞上了技术天花板,而其他Omni模型则比它沉重得多。
如此寻找替代方案的最后,我打造出的不是单一模型,而是采用**'级联(Cascade)'方式的naia-0.9-omni-24g**。这是一个将多个AI模型恰当编排并优化的模块,虽未达到完美的逐token级处理,却拥有与之相当的速度以及灵活得多的构成。它是在消费级24GB GPU上同时支持30国多国语言、全双工、实时声音克隆的、事实上唯一的替代方案。我们正在引导您像使用一个独立模型那样以API级别加以运用,您可以亲自体验远更聪明、远更清晰的声音克隆能力。
| 单一omni模型 | cascade(Naia方式) | |
|---|---|---|
| 构成 | 整合为一体的模型 | 按角色组装各个部件 |
| 能力变更 | 一旦训练完成即固定 —— 新能力需重新训练 | 随时更换・添加部件 —— 无需重训即可改进 |
| 速度 | 整合后快速(低延迟) | 因有阶段,延迟可能稍多一些 |
| 多模态扩展 | 从头重新训练 | 在输入・输出处嵌入部件 |
| 部件选择 | 整体捆绑 | 挑选并使用・更换经验证的部件 |
| 模型运用 | 固定于一个模型 | 多个模型协同 —— 每个阶段都用最优模型 |
如此完成的naia-0.9-omni-24g,在消费级PC环境的RTX 3090/4090/5090(24GB)上可流畅运行。
⚙️ 使用方式及特点
本次更新的使用方式,综合考虑现实的基础设施状况,做了如下调整。
本地容器提供(基础订阅者福利) —— 我们开放了让任何人都能以容器形式下载到个人PC、亲手打造属于自己的应用程序。
podman pull ghcr.io/nextain/naia-0.9-omni-24g:latest
不过,我自己也需要维持生计才能持续这个开源项目,因此为基础订阅(每月$10)用户提供每人1 Copy的使用权。还望您把它当作Naia开源生态持续成长所需的最低限度的支持。→ Naia模型下载及激活手册
网页演示体验(60秒尝鲜) —— 目前我在自己的1台个人PC上亲自运行,提供每次60秒的尝鲜体验。由于资源有限,根据接入人数可能会产生排队(Queue),还请多多包涵。→ 实时演示
云端使用(筹备中) —— 当初规划的每小时$0.33方案,很遗憾暂时转为'筹备中'。在资本与设备都不足的当下,难以维持常时待命的GPU池,而分配后启动所需约15分钟的服务器费用,目前也难以无偿承担。虽然在国内可用的远程RTX 3090系统我已经开发完成,但因GPU紧缺,我判断难以顺畅提供服务。待日后资本到位,我一定会推出无需等待、舒适流畅的云端服务。高兼容性 —— 支持OpenAI Realtime API,将与既有环境的兼容性最大化。
| 端点 | 用途 |
|---|---|
GET /health | 就绪状态 {"ready":true}(无需认证) |
GET /v1/models | 模型列表 |
WS /v1/realtime | 实时语音会话(VAD・打断・情感) |
POST /v1/chat/completions | 聊天(支持流式) |
POST /v1/audio/speech | 语音合成(TTS) |
POST /v1/audio/transcriptions | 语音识别(STT) |
POST /v1/embeddings | 嵌入 |
安全性及隐私 —— 正因模块性能出色,也存在被滥用于语音诈骗等的隐忧,因此我们应用了语音水印技术以具备可追溯性,让您可以安心使用。
🧠 Naia描绘的未来(Naia Cognitive)
Naia所追求的终极方向,是实现**'我的电脑里的我的AI'**,并打造与AI共同使用的应用程序的开发・发布生态。我所描绘的多模态,不只是单纯的数据输入输出,而是以AI能自行体验、记忆并表达的认知能力(Naia Cognitive)为目标。
下一个版本中,还有代理(Naia-agent)、长期记忆(Naia-memory)、框架(Naia-ADK)等更新在等待着大家。将与Naia-0.9-Omni-48g一同上线的下一个版本,正以可进行编码作业级别的本地配置文件・环境构成,以及记住用户、用实时语音一同工作——名副其实'钢铁侠的贾维斯'般的样貌为目标,进行研究・开发。
48GB目前仍是无论怎么往24GB里硬塞都吃力的领域,但只要插上两张旧款RTX 3090即可,所以我认为个人也完全值得憧憬一番。
🎮 Naia OS是记住我、与我一起工作和玩乐的AI
Naia-OS所描绘的图景是这样的。
- 基于Steam(Bazzite)/Windows的游戏主机 + 记住我的智能代理 + 基于3D虚拟形象的自然语言UI + 按VRAM优化的配置文件
最近MS和Nvidia要做基于RTX的小型AI设备一事掀起了热议。其实无需等待。因为既能玩游戏又能跑AI的Naia-OS,正瞄准着那个位置。换作是我,我会选择Naia-OS的配置而非那款新产品——它的价格比我们推荐的高端线还要贵,游戏兼容性也是未知数,而且统一内存速度慢。相反,插上经验证的消费级GPU的Naia-OS,则能把游戏・AI・扩展性全部拿下。
并非有意推迟Mac环境,只是因设备与时间不足,至今还未能着手而已。也有几位答应一起帮忙的朋友。
Naia-OS并非单一模块,而是由各自角色分离的开源仓库组成,正一步步搭建骨架。您或许会想"怎么有这么多东西?",但正因为当下正是'基于AI的开发时代',这才得以实现。
如果说过去的OS是应用程序的管理工具,那么我相信AI OS将成为用自然语言沟通、记忆并自主处理事务的软件兼机器人。这绝非单纯的虚张声势,我会一个个用成果来证明。
🤝 一起来吧 —— 线下聚会 & Discord
下周内,我打算办一场线下聚会,介绍这段时间做的东西,并寻找愿意一起互助的伙伴。也欢迎大家把模块下载下来试一试,有兴趣的朋友请通过下面的Discord来找我们。希望它能发展成一个真正的开源社区。
恳请大家为Nextain与Naia今后将走的路,多多给予支持与关注。
#Nextain #Naia