Bonjour, je suis Luke et je développe Naia, un OS d'IA. À la suite de mon précédent article où je vous annonçais à la hâte le lancement et sollicitais votre aide, je vous apporte cette fois, avec la mise à jour v0.1.5, la nouvelle la plus importante : non seulement l'OS d'IA, mais aussi un nouveau modèle omni d'IA, plus précisément la sortie du module Naia-Omni (naia-0.9-omni-24g).

▎Ce que vous pourrez découvrir directement dans cette v0.1.5 de Naia-OS
- Conversation vocale en temps réel avec un avatar 3D (clonage vocal inclus) — c'est la vedette de cette version.
- Navigateur intégré — l'IA regarde l'écran avec vous et vous prête main-forte.
- Système de compétences — étendez les fonctionnalités grâce aux compétences intégrées et connectez des outils MCP (Model Context Protocol).
- Panneaux d'applications — ajoutez les panneaux d'applications de votre choix au sein de Naia.
- Vos modèles, vos clés, tels quels — connectez le fournisseur d'IA et la clé de votre choix, ou faites tourner un modèle en local.
- Confidentialité — l'exécution locale est le mode par défaut, et vos entrées et sorties ne servent pas à entraîner les modèles.
- Interface disponible en 14 langues
Naia ne se contente pas d'être un shell qui se présente comme un OS. Le cœur de cette mise à jour, c'est le module naia-0.9-omni-24g, qui, dans un environnement à GPU grand public (24 Go de VRAM, comme les RTX 3090/4090/5090), réalise une conversation en temps réel en full duplex de niveau ChatGPT/Gemini, avec la prise en charge de 30 langues.
Voici une vidéo où je discute par la voix, en conditions réelles, en me connectant à Naia-Omni installé directement sur mon PC. (Veuillez noter que ma voix au micro n'a pas été enregistrée dans la vidéo.)
▎Pourquoi un module « cascade »
Je vous avais déjà dit que j'étais en train de porter MiniCPM-4.5-omni vers vLLM ; c'était justement pour l'intégrer à ce Naia. Le plus grand atout d'un modèle omni, c'est de permettre une conversation très naturelle en temps réel. Seulement, ce modèle exigeait plus de 28 Go de VRAM et avait pour limite de ne prendre en charge que le chinois et l'anglais. J'ai mené en parallèle plusieurs travaux de recherche, comme le fine-tuning (FT) du Talker, pour l'améliorer en coréen, mais j'ai fini par me heurter à un plafond technique ; quant aux autres modèles omni, ils étaient bien plus lourds encore.
C'est ainsi qu'à force de chercher une alternative, j'ai abouti à naia-0.9-omni-24g, fondé non pas sur un modèle unique mais sur une approche en « cascade ». Il s'agit d'un module qui orchestre et optimise judicieusement plusieurs modèles d'IA ; sans aller jusqu'à un traitement parfaitement token par token, il offre une vitesse équivalente et une configuration bien plus souple. C'est, de fait, la seule alternative qui prenne en charge à la fois 30 langues, le full duplex et le clonage vocal en temps réel sur un GPU grand public de 24 Go. Nous vous guidons pour l'exploiter au niveau d'une API, comme s'il s'agissait d'un modèle unique et autonome, et vous pourrez ainsi expérimenter par vous-même une capacité de reproduction vocale bien plus intelligente et bien plus nette.
| Modèle omni unique | cascade (approche Naia) | |
|---|---|---|
| Composition | Un modèle unifié en un seul bloc | Assemblage de composants par rôle |
| Modification des capacités | Une fois entraîné, c'est figé — toute nouvelle capacité exige un réentraînement | Remplacement ou ajout de composants à tout moment — amélioration sans réentraînement |
| Vitesse | Unifié, donc rapide (faible latence) | Présence d'étapes, donc une latence un peu plus élevée possible |
| Extension multimodale | Tout réapprendre depuis le début | Insérer des composants en entrée et en sortie |
| Choix des composants | Le tout est lié d'un seul bloc | Choisir et remplacer des composants éprouvés |
| Exploitation des modèles | Figé sur un seul modèle | Plusieurs modèles ensemble — le modèle optimal à chaque étape |
Le naia-0.9-omni-24g ainsi finalisé tourne sans accroc sur des environnements PC grand public à base de RTX 3090/4090/5090 (24 Go).
⚙️ Modalités d'utilisation et caractéristiques
Pour cette mise à jour, nous avons revu les modalités d'utilisation comme suit, en tenant compte des réalités de l'infrastructure.
Mise à disposition d'un conteneur local (avantage pour les abonnés Basic) — nous avons ouvert l'accès afin que chacun puisse télécharger le tout sous forme de conteneur sur son PC personnel et créer lui-même ses propres applications.
podman pull ghcr.io/nextain/naia-0.9-omni-24g:latest
Cela dit, comme je dois moi aussi gagner ma vie tout en faisant perdurer ce projet open source, j'ai prévu 1 Copy par utilisateur de l'abonnement de base (10 $/mois). Je vous serais reconnaissant de le considérer comme le soutien minimal nécessaire à la croissance continue de l'écosystème open source de Naia. → Manuel de téléchargement et d'activation des modèles Naia
Démo web à l'essai (aperçu de 60 secondes) — je propose actuellement un aperçu de 60 secondes en faisant tourner le tout directement sur un seul de mes PC personnels. Les ressources étant limitées, une file d'attente (Queue) peut se former selon le nombre de personnes connectées ; je vous remercie de votre indulgence. → Démo en direct
Utilisation dans le cloud (en préparation) — le modèle à 0,33 $ de l'heure que nous avions initialement prévu passe malheureusement en mode « en préparation » pour un temps. Faute de capitaux et d'équipements suffisants à l'heure actuelle, il est difficile de maintenir un pool de GPU en attente permanente, et il m'est trop lourd d'assumer gratuitement le coût serveur des quelque 15 minutes de démarrage qui suivent l'allocation. J'avais déjà développé un système à base de RTX 3090 distantes utilisable au niveau national, mais la pénurie de GPU rendait à mon sens un service fluide impossible. Le jour où les fonds seront réunis, je m'engage à vous proposer un service cloud confortable et sans temps d'attente.Grande compatibilité — la prise en charge de l'OpenAI Realtime API maximise la compatibilité avec les environnements existants.
| Point de terminaison | Usage |
|---|---|
GET /health | État de disponibilité {"ready":true} (aucune authentification requise) |
GET /v1/models | Liste des modèles |
WS /v1/realtime | Session vocale en temps réel (VAD, interruption, émotion) |
POST /v1/chat/completions | Chat (streaming pris en charge) |
POST /v1/audio/speech | Synthèse vocale (TTS) |
POST /v1/audio/transcriptions | Reconnaissance vocale (STT) |
POST /v1/embeddings | Embeddings |
→ Utilisation détaillée des modèles Naia (manuel pour développeurs)
Sécurité et confidentialité — les performances du module étant élevées, il existe un risque qu'il soit détourné à des fins malveillantes (hameçonnage vocal, etc.) ; nous avons donc appliqué une technologie de filigrane vocal pour assurer la traçabilité et vous permettre de l'utiliser en toute sérénité.
🧠 L'avenir que dessine Naia (Naia Cognitive)
L'orientation ultime que poursuit Naia, c'est de concrétiser « mon IA, dans mon ordinateur » et de créer un écosystème de développement et de distribution d'applications que l'on utilise avec l'IA. Le multimodal que j'imagine n'est pas une simple entrée/sortie de données : il vise une capacité cognitive (Naia Cognitive) par laquelle l'IA fait elle-même l'expérience, mémorise et s'exprime.
Dans la prochaine version vous attendent des mises à jour de l'agent (Naia-agent), de la mémoire à long terme (Naia-memory), du framework (Naia-ADK), etc. La prochaine version, qui sortira avec Naia-0.9-Omni-48g, est en cours de recherche et développement avec pour objectif des profils et configurations d'environnement local capables de réaliser des tâches de codage, ainsi qu'une IA qui se souvient de l'utilisateur et travaille avec lui par la voix en temps réel — littéralement, à l'image du « Jarvis » d'Iron Man.
Les 48 Go restent un domaine que l'on ne peut pas, pour l'instant, faire entrer de force dans 24 Go, quels que soient les efforts ; mais il suffit d'installer deux vieilles RTX 3090, si bien qu'un particulier peut tout à fait se prendre à en rêver.
🎮 Naia OS, l'IA qui se souvient de moi, qui travaille et joue avec moi
Voici le tableau que dessine Naia-OS.
- Machine de jeu basée sur Steam (Bazzite)/Windows + agent intelligent qui se souvient de moi + interface en langage naturel fondée sur un avatar 3D + profils optimisés selon la VRAM
Récemment, MS et Nvidia ont beaucoup fait parler d'eux en annonçant qu'ils allaient fabriquer de petits appareils d'IA à base de RTX. En réalité, inutile d'attendre. Naia-OS, qui fait aussi bien tourner les jeux que l'IA, vise précisément cette place. À votre place, plutôt que ce nouveau produit, je choisirais une configuration Naia-OS — son prix est plus élevé encore que la gamme supérieure que nous recommandons, sa compatibilité avec les jeux reste incertaine, et sa mémoire unifiée est lente. À l'inverse, Naia-OS, sur lequel on branche des GPU grand public éprouvés, réussit à tout concilier : jeu, IA et extensibilité.
Ce n'est pas que je retarde volontairement l'environnement Mac : c'est simplement que, faute d'équipement et de temps, je n'ai pas encore pu m'y atteler. Des personnes se sont d'ailleurs proposées pour m'aider.
Naia-OS n'est pas un module unique, mais se compose de dépôts open source aux rôles distincts ; nous en assemblons la charpente, pas à pas. Vous vous direz peut-être « mais il y a une quantité énorme de choses, là ? » ; or, c'est précisément parce que nous sommes à l'« ère du développement assisté par l'IA » que cela devient possible.
Si les OS d'autrefois étaient des outils de gestion des applications, je crois que l'OS d'IA, lui, deviendra un logiciel — et un robot — qui communique en langage naturel, qui mémorise et qui traite les tâches de lui-même. Ce ne sont pas de simples paroles en l'air : je le prouverai en livrant les résultats les uns après les autres.
🤝 Rejoignez-nous — rencontre en présentiel & Discord
Dans le courant de la semaine prochaine, j'aimerais organiser une rencontre en présentiel pour présenter ce sur quoi j'ai travaillé jusqu'ici et trouver des personnes avec qui s'entraider. Essayez aussi de télécharger le module, et si cela vous intéresse, venez nous retrouver sur le Discord ci-dessous. J'espère que cela évoluera vers une véritable communauté open source.
→ Rejoindre le Discord de Naia
Je vous remercie d'avance pour tous vos encouragements et votre intérêt envers le chemin que Nextain et Naia construiront désormais.
#Nextain #Naia