Naia
· Luke

Presentamos Naia-0.9-Omni-24g, que ofrece clonación de voz, conversación en tiempo real y skills en una RTX 3090 (Naia v0.1.5)

naia-osnaia-omnivoice-aicascadeopen-sourcev0.1.5

Hola, soy Luke, el creador del AI OS Naia. Tras aquel artículo en el que les conté apresuradamente la noticia del lanzamiento y les pedí ayuda, esta vez les traigo, junto con la actualización v0.1.5, la noticia más importante: no solo el AI OS, sino también un nuevo modelo de IA omni, más concretamente el anuncio del módulo Naia-Omni (naia-0.9-omni-24g).

Naia-0.9-Omni-24g
Naia-0.9-Omni-24g

▎Lo que podrás experimentar directamente en Naia-OS con esta v0.1.5

  • Conversación de voz en tiempo real con un avatar 3D (incluida la clonación de voz) — es la protagonista de esta versión.
  • Navegador embebido — la IA mira la pantalla contigo y te echa una mano.
  • Sistema de skills — amplía sus funciones con skills integradas y conecta herramientas MCP (Model Context Protocol).
  • Paneles de apps — puedes añadir dentro de Naia los paneles de apps que quieras.
  • Tu modelo, tu clave, tal cual — conecta el proveedor de IA y la clave que prefieras, o ejecútalo con un modelo local.
  • Privacidad — la ejecución local es lo predeterminado, y no usamos tus entradas ni salidas para entrenar modelos.
  • Interfaz disponible en 14 idiomas

Naia no se queda en ser un mero shell que se hace pasar por un OS. El núcleo de esta actualización es el módulo naia-0.9-omni-24g, que en un entorno de GPU de consumo (RTX 3090/4090/5090, 24GB de VRAM) logra 30 idiomas junto con una conversación full dúplex en tiempo real al nivel de ChatGPT o Gemini.

Este es un vídeo en el que converso con voz real conectándome al Naia-Omni que instalé directamente en mi propio PC. (Ten en cuenta que mi voz por el micrófono no quedó grabada en el vídeo.)

▎Por qué un módulo 'cascade'

Hace tiempo les comenté que estaba portando MiniCPM-4.5-omni a vLLM, y era precisamente para integrarlo en Naia. La mayor ventaja de un modelo omni es que permite una conversación muy natural en tiempo real. Sin embargo, ese modelo tenía la limitación de requerir más de 28GB de VRAM y de soportar únicamente chino e inglés. Para mejorarlo al coreano realicé en paralelo varias investigaciones, como el fine-tuning (FT) del Talker, pero finalmente choqué con un techo técnico, y los demás modelos omni eran mucho más pesados.

Tras buscar alternativas de ese modo, lo que terminé creando no es un modelo único, sino naia-0.9-omni-24g, de tipo 'cascade' (cascada). Es un módulo que orquesta y optimiza adecuadamente varios modelos de IA y, aunque no llega a ser un procesamiento perfecto token a token, presume de una velocidad equiparable y de una configuración mucho más flexible. Es prácticamente la única alternativa que soporta a la vez 30 idiomas, full dúplex y clonación de voz en tiempo real en una GPU de consumo de 24GB. Te guiamos para que puedas aprovecharlo a nivel de API, como si fuera un modelo independiente, y podrás experimentar de primera mano una capacidad de clonación de voz mucho más inteligente y nítida.

Modelo omni únicocascade (al estilo Naia)
ComposiciónUn modelo unificado en uno soloEnsamblar piezas según su función
Cambio de capacidadesUna vez entrenado queda fijo — las nuevas capacidades requieren reentrenarReemplaza o añade piezas cuando quieras — mejora sin reentrenar
VelocidadRápido por estar unificado (baja latencia)Al haber etapas puede surgir algo más de latencia
Expansión multimodalVolver a entrenar desde ceroEncajar piezas en la entrada y la salida
Selección de piezasTodo va atado en bloqueElige, usa y reemplaza piezas verificadas
Aprovechamiento de modelosFijado a un solo modeloVarios modelos juntos — el modelo óptimo en cada etapa

El naia-0.9-omni-24g así completado se ejecuta con fluidez en entornos de PC de consumo con RTX 3090/4090/5090 (24GB).

⚙️ Modos de uso y características

Los modos de uso de esta actualización se han reorganizado de la siguiente manera, teniendo en cuenta la situación real de la infraestructura.

Contenedor local disponible (beneficio para suscriptores Basic) — Lo abrimos para que cualquiera pueda descargarlo en su PC personal en forma de contenedor y crear directamente sus propias aplicaciones.

podman pull ghcr.io/nextain/naia-0.9-omni-24g:latest

No obstante, como yo también debo sostener este proyecto de código abierto mientras me gano la vida, he hecho que los usuarios de la suscripción básica (10 $/mes) puedan usar 1 Copy cada uno. Te agradecería que lo consideres el mínimo apoyo necesario para que el ecosistema de código abierto de Naia siga creciendo de forma constante. → Manual de descarga y activación del modelo Naia

Demo web (prueba de 60 segundos) — Actualmente lo ejecuto directamente en 1 PC personal mío y ofrezco una prueba rápida de 60 segundos cada vez. Como los recursos son limitados, te pido tu amplia comprensión por si se forma una cola (Queue) según el número de personas conectadas. → Demo en vivo

Pantalla de la demo en vivo de Naia Uso en la nube (en preparación) — El modelo de 0,33 $ por hora que había planeado inicialmente, lamentablemente, pasa por ahora a estar 'en preparación'. Ahora mismo, con capital y equipo insuficientes, es difícil mantener un pool de GPU siempre en espera, y resulta muy duro asumir gratuitamente el coste del servidor durante los aproximadamente 15 minutos que tarda el arranque tras la asignación. Aunque ya había desarrollado también un sistema remoto basado en RTX 3090 utilizable dentro del país, concluí que la escasez de GPU dificulta ofrecer un servicio fluido. Cuando en el futuro consiga reunir capital, presentaré sin falta un servicio en la nube cómodo y sin tiempos de espera.
Pantalla de la demo en vivo de Naia

Alta compatibilidad — Soporta la OpenAI Realtime API para maximizar la compatibilidad con los entornos existentes.

EndpointUso
GET /healthEstado de preparación {"ready":true} (no requiere autenticación)
GET /v1/modelsLista de modelos
WS /v1/realtimeSesión de voz en tiempo real (VAD, interrupciones, emoción)
POST /v1/chat/completionsChat (con soporte de streaming)
POST /v1/audio/speechSíntesis de voz (TTS)
POST /v1/audio/transcriptionsReconocimiento de voz (STT)
POST /v1/embeddingsEmbeddings

Uso detallado del modelo Naia (manual para desarrolladores)

Seguridad y privacidad — Como el rendimiento del módulo es notable, también existe el riesgo de que se use con fines maliciosos como el phishing de voz, por lo que aplicamos tecnología de marca de agua de voz para dotarlo de trazabilidad y que puedas usarlo con tranquilidad.

🧠 El futuro que Naia dibuja (Naia Cognitive)

La dirección última que Naia persigue es hacer realidad 'mi IA dentro de mi computadora' y crear un ecosistema de desarrollo y despliegue de aplicaciones que usamos junto con la IA. La multimodalidad que yo imagino no es una mera entrada y salida de datos, sino que tiene como meta una capacidad cognitiva en la que la IA experimenta, recuerda y se expresa por sí misma (Naia Cognitive).

En la próxima versión nos esperan actualizaciones del agente (Naia-agent), la memoria a largo plazo (Naia-memory), el framework (Naia-ADK), entre otras. La siguiente versión, que llegará junto con Naia-0.9-Omni-48g, la estamos investigando y desarrollando con la meta de un perfil y una configuración de entorno locales capaces de tareas de programación, y de algo que recuerda al usuario y trabaja con él mediante voz en tiempo real — literalmente, una especie de 'Jarvis de Iron Man'.

Los 48GB siguen siendo un terreno arduo por mucho que se intente embutir en 24GB, pero como basta con conectar dos RTX 3090 antiguas, creo que es algo con lo que un particular también puede soñar perfectamente.

🎮 Naia OS es la IA que me recuerda, trabaja y juega conmigo

La imagen que Naia-OS dibuja es esta:

  • Máquina de juegos basada en Steam(Bazzite)/Windows + un agente inteligente que me recuerda + una interfaz de lenguaje natural basada en avatar 3D + perfiles optimizados según la VRAM

Hace poco se armó un gran revuelo con la noticia de que MS y Nvidia van a fabricar pequeños dispositivos de IA basados en RTX. En realidad, no hace falta esperar. Porque Naia-OS, que sirve tanto para jugar como para la IA, apunta exactamente a ese lugar. Yo, en lugar de ese nuevo producto, elegiría una configuración con Naia-OS — su precio es incluso más alto que la línea superior que recomendamos, la compatibilidad de juegos es una incógnita y la memoria unificada es lenta. En cambio, Naia-OS, en el que se conecta una GPU de consumo verificada, lo abarca todo: juegos, IA y expansibilidad.

No es que esté posponiendo a propósito el entorno Mac, sino que simplemente aún no he podido ponerme a ello por falta de equipo y de tiempo. También hay personas que han decidido echar una mano.

Naia-OS no es un único módulo, sino que está compuesto por repositorios de código abierto con sus roles separados, y poco a poco vamos encajando el esqueleto. Puede que pienses "¿pero esto es muchísimo?", pero esto es posible precisamente porque estamos en plena 'era del desarrollo basado en IA'.

Si los OS tradicionales eran herramientas de gestión de aplicaciones, creo que el AI OS será un software y un robot que se comunica en lenguaje natural, recuerda y resuelve tareas por sí mismo. No es un mero farol; lo iré demostrando con resultados, uno a uno.

🤝 Hagámoslo juntos — encuentro presencial y Discord

A lo largo de la próxima semana, estoy pensando en organizar un encuentro presencial para presentar lo que he estado trabajando y buscar a personas con quienes ayudarnos mutuamente. Descárgate también el módulo una vez, y quienes tengáis interés, venid al Discord de abajo. Espero que llegue a convertirse en una auténtica comunidad de código abierto.

Únete al Discord de Naia

Os pido mucho ánimo e interés en el camino que Nextain y Naia construirán de aquí en adelante.

#Nextain #Naia

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

Comentarios

Puedes comentar sin iniciar sesión

...