Naia
· Luke

Wir stellen Naia-0.9-Omni-24g vor: Stimmklonung, Echtzeit-Konversation und Skills auf einer RTX 3090 (Naia v0.1.5)

naia-osnaia-omnivoice-aicascadeopen-sourcev0.1.5

Hallo, ich bin Luke und arbeite am KI-OS Naia. Im Anschluss an meinen letzten Beitrag, in dem ich kurzfristig vom Launch berichtet und um Unterstützung gebeten habe, teile ich diesmal zusammen mit dem Update auf v0.1.5 die wichtigste Neuigkeit: nicht nur das KI-OS, sondern auch ein neues KI-Omni-Modell, genauer gesagt das Naia-Omni-Modul (naia-0.9-omni-24g).

Naia-0.9-Omni-24g
Naia-0.9-Omni-24g

▎Das könnt ihr in diesem v0.1.5-Naia-OS direkt erleben

  • Echtzeit-Sprachdialog mit einem 3D-Avatar (inklusive Stimmklonung) — der Star dieser Version.
  • Eingebetteter Browser — die KI schaut innerhalb des Bildschirms mit und hilft euch dabei.
  • Skill-System — erweitert Funktionen mit integrierten Skills und verbindet MCP-Werkzeuge (Model Context Protocol).
  • App-Panels — fügt innerhalb von Naia beliebige App-Panels hinzu.
  • Dein Modell, dein Schlüssel, unverändert — verbinde den KI-Anbieter und Schlüssel deiner Wahl oder betreibe lokale Modelle.
  • Datenschutz — lokale Ausführung ist Standard, und Ein- und Ausgaben werden nicht für das Modelltraining verwendet.
  • Unterstützung für 14 Sprachoberflächen

Naia ist nicht bloß eine Shell, die sich als OS ausgibt. Das Herzstück dieses Updates ist das Modul naia-0.9-omni-24g, das in einer Consumer-GPU-Umgebung (RTX 3090/4090/5090 usw. mit 24 GB VRAM) zusammen mit 30 Sprachen eine vollduplexe Echtzeit-Konversation auf dem Niveau von ChatGPT und Gemini umsetzt.

Ein Video, in dem ich mich per echter Stimme mit dem direkt auf meinem PC installierten Naia-Omni unterhalte. (Bitte beachtet, dass meine Mikrofonstimme im Video nicht aufgezeichnet wurde.)

▎Warum ein 'Cascade'-Modul?

Ich hatte früher einmal erwähnt, dass ich MiniCPM-4.5-omni gerade nach vLLM portiere — und zwar genau, um es in dieses Naia zu integrieren. Der größte Vorteil eines Omni-Modells ist, dass es in Echtzeit eine sehr natürliche Konversation ermöglicht. Allerdings hatte jenes Modell die Einschränkung, dass es über 28 GB VRAM benötigte und nur Chinesisch und Englisch unterstützte. Um es für Koreanisch zu verbessern, habe ich parallel mehrere Forschungsansätze wie das Finetuning (FT) des Talker verfolgt, bin aber letztlich an eine technische Decke gestoßen, und die anderen Omni-Modelle waren weitaus schwerer.

Auf der Suche nach einer Alternative entstand schließlich das naia-0.9-omni-24g im 'Cascade'-Verfahren, das kein einzelnes Modell ist. Es ist ein Modul, das mehrere KI-Modelle passend orchestriert und optimiert; zwar reicht es nicht ganz an eine vollständige tokenweise Verarbeitung heran, bietet aber eine vergleichbare Geschwindigkeit und eine weitaus flexiblere Konfiguration. Es ist praktisch die einzige Alternative, die auf einer Consumer-GPU mit 24 GB 30 Sprachen, Vollduplex und Echtzeit-Stimmklonung zugleich unterstützt. Wir leiten euch dabei an, es auf API-Ebene zu nutzen, fast wie ein eigenständiges Modell, und ihr könnt eine deutlich intelligentere und klarere Stimmklonungsfähigkeit selbst erleben.

Einzelnes Omni-ModellCascade (Naia-Verfahren)
AufbauEin in sich vereintes ModellRollenspezifische Bausteine zusammengesetzt
Änderung von FähigkeitenEinmal trainiert, dann fest — neue Fähigkeiten erfordern NeutrainingBausteine jederzeit austausch- und erweiterbar — Verbesserung ohne Neutraining
GeschwindigkeitVereint und schnell (geringe Latenz)Durch Stufen kann etwas mehr Latenz entstehen
Multimodale ErweiterungVon Grund auf neu trainierenBausteine an Ein- und Ausgabe einklinken
BausteinauswahlKomplett gebündeltGeprüfte Bausteine auswählen, nutzen und austauschen
ModellnutzungAn ein Modell gebundenMehrere Modelle gemeinsam — das beste Modell pro Stufe

Das so fertiggestellte naia-0.9-omni-24g läuft in einer Consumer-PC-Umgebung mit RTX 3090/4090/5090 (24 GB) reibungslos.

⚙️ Nutzungsweise und Eigenschaften

Die Nutzungsweise dieses Updates haben wir mit Blick auf die realistische Infrastrukturlage wie folgt überarbeitet.

Bereitstellung als lokaler Container (Vorteil für Basis-Abonnenten) — Wir haben es allen geöffnet, das Modul als Container auf den eigenen PC herunterzuladen und damit eigene Anwendungen direkt zu erstellen.

podman pull ghcr.io/nextain/naia-0.9-omni-24g:latest

Da aber auch ich meinen Lebensunterhalt sichern und dieses Open-Source-Projekt fortführen muss, habe ich es so eingerichtet, dass Basis-Abonnenten (10 $/Monat) jeweils 1 Copy nutzen können. Ich wäre dankbar, wenn ihr es als minimale Unterstützung betrachtet, die nötig ist, damit das Naia-Open-Source-Ökosystem stetig wachsen kann. → Handbuch zum Herunterladen und Aktivieren der Naia-Modelle

Web-Demo ausprobieren (60-Sekunden-Vorgeschmack) — Derzeit betreibe ich es direkt auf einem einzigen privaten PC und biete jeweils 60 Sekunden zum Ausprobieren an. Da die Ressourcen begrenzt sind, kann je nach Andrang eine Warteschlange (Queue) entstehen — dafür bitte ich um euer Verständnis. → Live-Demo

Naia Live-Demo-Bildschirm Cloud-Nutzung (in Vorbereitung) — Das ursprünglich geplante Modell mit 0,33 $ pro Stunde stelle ich leider vorerst auf 'in Vorbereitung'. Bei dem aktuellen Mangel an Kapital und Ausrüstung ist es schwer, einen ständig bereitstehenden GPU-Pool zu unterhalten, und die rund 15 Minuten Serverkosten für das Hochfahren nach der Zuteilung kostenlos zu tragen ist eine Belastung. Ein im Inland nutzbares System auf Basis ferngesteuerter RTX 3090 habe ich zwar bereits entwickelt, aber wegen der GPU-Knappheit ist ein reibungsloser Dienst nach meiner Einschätzung schwierig. Sobald später genügend Kapital vorhanden ist, werde ich euch ganz bestimmt einen angenehmen Cloud-Dienst ohne Wartezeiten präsentieren.
Naia Live-Demo-Bildschirm

Hohe Kompatibilität — Durch Unterstützung der OpenAI Realtime API haben wir die Kompatibilität mit bestehenden Umgebungen maximiert.

EndpunktZweck
GET /healthBereitschaftsstatus {"ready":true} (keine Authentifizierung nötig)
GET /v1/modelsModellliste
WS /v1/realtimeEchtzeit-Sprachsitzung (VAD, Unterbrechen, Emotion)
POST /v1/chat/completionsChat (Streaming unterstützt)
POST /v1/audio/speechSprachsynthese (TTS)
POST /v1/audio/transcriptionsSpracherkennung (STT)
POST /v1/embeddingsEmbeddings

Detaillierte Nutzung der Naia-Modelle (Entwicklerhandbuch)

Sicherheit und Datenschutz — Da die Leistung des Moduls so hoch ist, besteht auch die Gefahr des Missbrauchs etwa für Voice-Phishing. Deshalb haben wir mit der Audio-Wasserzeichen-Technologie für Nachverfolgbarkeit gesorgt, damit ihr es bedenkenlos nutzen könnt.

🧠 Die Zukunft, die Naia zeichnet (Naia Cognitive)

Die ultimative Richtung, die Naia verfolgt, ist es, 'meine KI in meinem Computer' zu verwirklichen und ein Entwicklungs- und Distributions-Ökosystem für Anwendungen zu schaffen, die man gemeinsam mit der KI nutzt. Die Multimodalität, die ich mir vorstelle, zielt nicht auf einfache Datenein- und -ausgabe ab, sondern auf eine kognitive Fähigkeit (Naia Cognitive), bei der die KI selbst erlebt, sich erinnert und sich ausdrückt.

In der nächsten Version warten Updates für den Agenten (Naia-agent), das Langzeitgedächtnis (Naia-memory), das Framework (Naia-ADK) und mehr. Die nächste Version, die zusammen mit Naia-0.9-Omni-48g erscheint, entwickeln und erforschen wir mit dem Ziel eines lokalen Profils und einer Umgebungskonfiguration, die für Coding-Arbeiten taugen, sowie einer KI, die sich an den Nutzer erinnert und per Echtzeitstimme mit ihm zusammenarbeitet — buchstäblich wie 'Iron Mans Jarvis'.

48 GB sind ein Bereich, der sich auch beim besten Hineinquetschen noch nicht in 24 GB pressen lässt, aber da man nur zwei alte RTX 3090 einbauen muss, halte ich es für durchaus erträumbar, auch für Privatpersonen.

🎮 Naia OS ist eine KI, die sich an mich erinnert, mit mir arbeitet und spielt

Das Bild, das Naia-OS zeichnet, sieht so aus:

  • Spielemaschine auf Steam-(Bazzite-)/Windows-Basis + intelligenter Agent, der sich an mich erinnert + natürlichsprachliche UI auf Basis eines 3D-Avatars + nach VRAM optimierte Profile

Kürzlich sorgte es für großes Aufsehen, dass MS und Nvidia ein kleines KI-Gerät auf RTX-Basis bauen wollen. Tatsächlich muss man gar nicht warten. Denn Naia-OS, das sowohl Spiele als auch KI beherrscht, hat es auf genau diese Position abgesehen. An eurer Stelle würde ich statt dieses neuen Produkts eine Naia-OS-Konfiguration wählen — der Preis liegt sogar über unserer empfohlenen Oberklasse, die Spielekompatibilität ist ungewiss, und der Unified Memory ist langsam. Naia-OS hingegen, in das man geprüfte Consumer-GPUs einbaut, vereint Spiele, KI und Erweiterbarkeit zugleich.

Ich schiebe die Mac-Umgebung nicht absichtlich auf, sondern komme aus Mangel an Ausrüstung und Zeit nur noch nicht dazu. Es gibt auch Leute, die mir dabei helfen wollen.

Naia-OS ist kein einzelnes Modul, sondern besteht aus Open-Source-Repositories mit jeweils getrennten Rollen, und wir fügen das Grundgerüst Schritt für Schritt zusammen. Vielleicht denkt ihr "Das ist ja unglaublich viel?", aber genau das ist möglich, weil jetzt das 'Zeitalter der KI-basierten Entwicklung' ist.

Während das bisherige OS ein Verwaltungswerkzeug für Anwendungen war, glaube ich, dass ein KI-OS eine Software und ein Roboter sein wird, der per natürlicher Sprache kommuniziert, sich erinnert und Aufgaben eigenständig erledigt. Das ist kein bloßes Bluffen — ich werde es Stück für Stück mit Ergebnissen beweisen.

🤝 Macht mit — Offline-Treffen & Discord

Im Laufe der nächsten Woche möchte ich ein Offline-Treffen veranstalten, bei dem ich vorstelle, woran ich bisher gearbeitet habe, und Leute suche, mit denen wir uns gegenseitig helfen können. Ladet das Modul gerne einmal herunter, und wer Interesse hat, schaut über den Discord unten vorbei. Ich hoffe, dass daraus eine richtige Open-Source-Community wird.

Tritt dem Naia Discord bei

Ich bitte euch um viel Zuspruch und Interesse für den Weg, den Nextain und Naia künftig gehen werden.

#Nextain #Naia

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

Kommentare

Sie können ohne Anmeldung kommentieren

...