奈亚
· Luke Yang

【NAIA 0.1.7更新】实时语音、视频分身、支持韩国原创基础模型、短时/长时记忆、电台DJ、多终端的一体式开源AI你见过吗?

奈亚v0.1.7实时语音北弗吉尼亚州韩国独立财团模式短期记忆长期记忆电台DJ法典克洛德赫尔德开源人工智能

大家好,我的名字是 Luke,我正在我的电脑中创建 Naia,一个人工智能。

自6月5日发布v0.1.5以来的两个月里,添加了相当多的新东西。当时的重点是在 VRAM 24GB 显卡上运行“naia-0.9-omni-24g”的整个配置,而可以用 Naia 帐户选择的云模型实际上集中在 Gemini 系列上。至于 Codex,直接在终端中运行它与将其连接到 Naia 的大脑是不同的。

从 v0.1.7 开始,我们的目标是组织一个结构,允许您在具有 6GB VRAM 的 PC 上创建 Naia 的声音,一起享受头像和音乐,并继续在 Naia 中使用 AI 和实际文件。

该发行版还将首先导出Windows 10/11的可执行文件(EXE)和安装包(MSI),从下一个版本开始将依次检查Linux(Naia OS)和macOS。

Naia 0.1.7 — 说话、记住、一起工作
Naia 0.1.7 — 说话、记住、一起工作

▎本次更新中您可以立即体验到的事情

  • Windows 应用程序本身可以使用从 6GB 图形内存 (VRAM) 开始的实时参考语音,而不是使用我们上次分享的单独的 24GB Cascade 模型。
  • Naia 的记忆和 RAG 已被添加,以提供短期和长期记忆,使其成为真正的 AI Agent 而不仅仅是一个简单的 LLM。
  • 提供两种NIA官方3D头像文件(VRM,人形3D头像格式)和六种自主开发的无需GPU即可播放的视频头像。
  • 添加了广播 DJ 模式,以便 AI 自动推荐 YouTube 歌曲,以便您可以继续播放。
  • Naia 提供的型号已从专注于 Gemini 扩展到高性价比的 DeepSeek V4 闪存和 Pro、高性能 GPT 5.6、Upstage 的 Solar Pro4 以及 Naver 的 Hyper Clova 型号。
  • 通过链接 Naia 中的 Codex 并在 Herdr 工作区中查看多个 AI 会话,在 Naia 中启用多代理编码。 Workspace 和 Naia 之间的集成仍在进行中。

▎1.实时参考语音,现在从 6GB VRAM 开始

v0.1.5 中引入的“naia-0.9-omni-24g”是一个 24GB 完整配置,可在本地运行所有语音识别、语言模型和语音合成。新增加的6GB标准仅适用于以用户参考语音说话的本地语音合成功能,而不适用于整个配置。您可以在语音设置中单独打开此本地语音功能。

在 Windows PC 上,如果您的 NVIDIA GPU 具有 6GB 或更多 VRAM,您可以在语音设置中打开本地语音。我们确认在 RTX 4060 笔记本电脑、RTX 3080 Ti 笔记本电脑和 RTX 2070 台式机上运行。 Windows 安装中包含必要的基于 TensorRT 的语音运行时,用户无需单独安装 TensorRT 或单独的语音服务器。

您可以选择一个语音文件或自己录制,然后在使用前提前收听。此功能与登录 Naia 帐户或选择视频头像是分开的,因此您甚至可以在本地更改您的声音,同时保留现有的 3D VRM。

  • 在未来的计划中,就像我使用Claude或Codex的语音模型来转换和利用各种作品一样,Naia将支持CLI或代理级API,使用户能够使用各种应用程序,大大扩展可用性。

▎2. NIA官方头像和NVA视频头像

奈亚的外观也是我自己设计的。它提供了两个官方的3D VRM,基础版和头发版,并对面部表情和语音条件做出响应。

我们还提供6种会说话的视频头像。您可以为 Minho、Jina 和 Naia 选择基本风格和动画风格。由于它是一种轻量级的播放完整视频剪辑的方法,因此不需要 GPU 来显示和说话化身。

Naia实际应用和使用的NVA视频头像 NVA(Naia Video Avatar)格式是一种开源的头像格式,它将视频的高视觉质量与VRM·Live2D的实时性能相结合。它价格便宜,无需建模或装配即可构建,并且可以在浏览器和桌面上实时说话和做出反应,无需 GPU。文件格式和播放器作为开源发布。
Naia实际应用和使用的NVA视频头像

查看6个视频头像的完整示例

我们将在另一篇文章中更详细地解释这一点,并且 NVA 创建功能将很快发布。

▎3.电台 DJ 继续播放音乐

如果您告诉 Naia,“在编码时播放要听的音乐”,Radio DJ 不会只播放一首歌曲并结束,而是会选择一首符合条件的歌曲,介绍它,然后继续播放下一首歌曲。这是人工智能正在创造的一种自动语音功能,可以自行继续语音。

Naia 确认的电台 DJ 设置屏幕 如果用户在听音乐时说话,则对话优先。返回音乐时,继续之前选择的氛围和播放流程。我试图根据天气和心情提出建议,但该功能还不太好用,所以我正在测试各种东西。
Naia 确认的电台 DJ 设置屏幕

▎4.支持各种AI模型和编码代理

Codex、Claude、DeepSeek V4 Pro、GPT-5.6、国产Solar Pro 4、最高至HCX型号 在6月5日发布的版本中,Naia账户可以选择的机型主要集中在Gemini系列。在 v0.1.7 中,选项显着增加。 **还支持 Codex 和 Claude。使用 Codex 或 Claude 的人可以立即使用它,无需单独的帐户。 **

系列本次主推车型
深度搜索DeepSeek V4 闪存、DeepSeek V4 Pro
GPTGPT-5.6 索尔、GPT-5.6 露娜
格洛克格洛克 4.3
抢戏太阳能 Pro 4、太阳能迷你
纳维尔超级CLOVA

可以从一个设置屏幕中选择连接到您的 Naia 帐户的型号。同一屏幕上还以韩元显示国内型号的价格。

▎5. naia-记得我的记忆

“naia-memory”会挑选出重要的事实并存储它们,而不是随意堆积所有对话。长时间未使用的记忆的重要性会降低,而被回忆起的记忆的重要性会增加。如果新事实与旧事实冲突,您可以使用新事实更新它,而不是将旧信息混合到您的答案中。

默认设置将内存存储在用户 PC 上的本地 JSON 存储中,并在应用程序运行时结合使用语义、关键字和关系搜索。您可以分别选择用于嵌入和事实提取的模型,如果完全在本地配置它们,则不必依赖外部存储服务来进行对话。

Naia 记住之前对话的本地内存设置和响应 当前的默认设置是供桌面/个人使用的本地存储。 SQLite存储方法针对超过100,000个项目,尚未完成到相同的水平。虽然尚未得到应用,但最近经过基准测试的Naia-memory性能已接近全球最高水平。最大的优点不是它记得很多,而是它在记忆积累时更新变化的内容,并且像人类的记忆一样,它具有随着内容变老而衰减的特性。我稍后也会发布这个。
Naia 记住之前对话的本地内存设置和响应

▎6. naia-adk 和 Herdr:在 Naia 中使用 AI

对于开发者来说最大的变化是 Naia 超越了聊天窗口,拥有一个工作空间基础,可以在一个空间中查看多个 AI 会话。

由于Naia的目的是供我作为开发人员使用,它的目标是解决多任务处理时的终端地狱、AI作为其他编码代理的协调者、防漂移工具、令牌成本优化以及远程环境中的Discord机器人连接,其实现是安装Naia时自动设置的Naia-adk工作环境。它包括线束代码,这些代码是我之前解释的 ReZero Harness Book 的基础。

上周进行了开发并取得了一些成功,但由于上下文之间的管理不正确,出现了成本飙升或线束阻塞工作等问题,因此我们现阶段将其撤回并继续进行工作。

另外,我认为我最近使用的 Herdr 功能是一个开源的功能,适合解决我所追求的终端地狱,因此我将其内置到 Naia 中,并从规范中省略了我打算内部开发的多终端管理。

Herdr 是一个任务屏幕,用于在 Naia 中并排查看和管理多个 AI 会话。在左侧的文件树中,您可以查看文件列表并在“空间”和“代理”选项卡之间导航,在右侧,您可以查看哪些代理正在哪些存储库中工作,并导航到相应的 Herdr 会话。用于单击文件查看其内容的查看器尚未连接。 Herdr 包含在 Windows 安装中,因此您无需单独安装。

Naia 工作区内置 Herdr 屏幕

此版本提供文件树·空间·代理导航和内置的 Herdr 任务屏幕。将文件点击查看器和 Naia·Codex·Herdr 连接到一个工作流程的功能尚未实现,正在下一版本的开发范围内。

Naia Workspace Viewer — 计划集成 Herdr

首先,我们将在我们的网站上分发它,我们正在立即为 Steam 和 Windows Store 做准备。

重要的是所有这些都是开源的。

我们将立即准备开源线下会议。在此之前,如果您想在 Discord 上分享新闻、共同创作,请随时联系我们。

#Naia #NVA #RadioDJ #Codex #Herdr #开源人工智能

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

评论

无需登录即可评论

...