Olá, sou o Luke, o criador do Naia, um sistema operativo de IA (AI OS). Dando seguimento ao texto anterior, em que partilhei apressadamente a notícia do lançamento e pedi ajuda, desta vez trago, junto com a atualização v0.1.5, a notícia mais importante: não apenas o AI OS, mas também um novo modelo de IA omni, mais precisamente o módulo Naia-Omni (naia-0.9-omni-24g).

▎O que pode experimentar diretamente no Naia-OS desta v0.1.5
- Conversa por voz em tempo real com um avatar 3D (incluindo clonagem de voz) — a estrela desta versão.
- Navegador embutido — a IA vê o ecrã consigo e dá-lhe uma ajuda.
- Sistema de skills — amplie funcionalidades com skills integradas e ligue ferramentas via MCP (Model Context Protocol).
- Painéis de aplicações — adicione os painéis de aplicações que quiser dentro do Naia.
- O seu modelo, a sua chave — ligue o fornecedor de IA e a chave que preferir, ou rode com um modelo local.
- Privacidade — a execução local é o padrão, e as suas entradas e saídas não são usadas para treinar modelos.
- Interface em 14 idiomas
O Naia não se limita a ser uma shell que se intitula sistema operativo. O coração desta atualização é o módulo naia-0.9-omni-24g, que num ambiente de GPU de consumo (RTX 3090/4090/5090 e outras com 24GB de VRAM) concretiza 30 idiomas a par de uma conversa em tempo real full-duplex ao nível do ChatGPT e do Gemini.
Este é um vídeo em que converso por voz real, ligado ao Naia-Omni instalado diretamente no meu PC. (Note que a minha voz no microfone não ficou gravada no vídeo.)
▎Porquê um módulo 'cascade'
Em tempos mencionei que estava a portar o MiniCPM-4.5-omni para o vLLM, e o objetivo era exatamente integrá-lo neste Naia. A maior vantagem de um modelo omni é permitir uma conversa muito natural em tempo real. No entanto, esse modelo exigia mais de 28GB de VRAM e tinha a limitação de suportar apenas chinês e inglês. Para o melhorar com o coreano, conduzi em paralelo vários estudos, como o fine-tuning (FT) do Talker, mas acabei por esbarrar num teto técnico, e os outros modelos omni eram muito mais pesados do que este.
Depois de procurar alternativas, o que acabei por criar não foi um modelo único, mas sim o naia-0.9-omni-24g, no formato 'cascade'. É um módulo que orquestra e otimiza vários modelos de IA de forma adequada; ainda que não chegue a um processamento perfeito ao nível do token, ostenta uma velocidade equiparável a esse e uma configuração muito mais flexível. É, na prática, a única alternativa que suporta, numa GPU de consumo de 24GB, 30 idiomas, full-duplex e clonagem de voz em tempo real, tudo de uma vez. Disponibilizamos orientações para que o possa usar ao nível de API, como se fosse um modelo independente, e poderá experimentar em primeira mão uma capacidade de clonagem de voz muito mais inteligente e nítida.
| Modelo omni único | cascade (abordagem Naia) | |
|---|---|---|
| Composição | Um modelo unificado num só | Componentes por função, montados |
| Mudar capacidades | Fixo após treinado — novas capacidades exigem retreino | Trocar/adicionar componentes a qualquer momento — melhora sem retreino |
| Velocidade | Unificado e rápido (baixa latência) | Tem etapas, pelo que pode surgir um pouco mais de latência |
| Expansão multimodal | Treinar tudo de novo desde o início | Encaixar componentes na entrada e na saída |
| Escolha de componentes | Tudo num só pacote | Escolher, usar e trocar componentes verificados |
| Uso de modelos | Fixo num único modelo | Vários modelos em conjunto — o melhor modelo em cada etapa |
O naia-0.9-omni-24g assim concluído corre de forma fluida em ambientes de PC de consumo com RTX 3090/4090/5090 (24GB).
⚙️ Modo de utilização e características
Tendo em conta a realidade da infraestrutura, o modo de utilização desta atualização foi reformulado da seguinte forma.
Fornecimento de container local (benefício para subscritores do plano básico) — abrimos para que qualquer pessoa possa descarregar o container para o seu PC pessoal e criar as suas próprias aplicações.
podman pull ghcr.io/nextain/naia-0.9-omni-24g:latest
Como também eu preciso de sustentar o meu dia a dia para manter este projeto de código aberto, disponibilizei 1 Copy a cada utilizador da subscrição básica (10 USD/mês). Agradeço que o encarem como o mínimo apoio necessário para que o ecossistema de código aberto do Naia continue a crescer de forma constante. → Manual de download e ativação do modelo Naia
Demo web (degustação de 60 segundos) — atualmente ofereço uma experiência de degustação de 60 segundos, executada diretamente num único PC pessoal meu. Como o recurso é limitado, peço a vossa compreensão pelo facto de poder surgir uma fila (Queue) consoante o número de utilizadores ligados. → Demo ao vivo
Uso na cloud (em preparação) — o modelo de 0,33 USD por hora que inicialmente planeei passa, infelizmente, para o estado de 'em preparação' por agora. Faltando-me capital e equipamento, é difícil neste momento manter um pool de GPUs sempre em espera, e é exigente suportar gratuitamente o custo de servidor dos cerca de 15 minutos de arranque após a alocação. Já desenvolvi também um sistema remoto baseado em RTX 3090 utilizável no mercado nacional, mas concluí que, com a escassez de GPUs, seria difícil oferecer um serviço sem percalços. Quando houver capital suficiente, hei de apresentar um serviço de cloud confortável e sem tempos de espera.Alta compatibilidade — suporta a OpenAI Realtime API, maximizando a compatibilidade com os ambientes existentes.
| Endpoint | Função |
|---|---|
GET /health | Estado de prontidão {"ready":true} (sem autenticação) |
GET /v1/models | Lista de modelos |
WS /v1/realtime | Sessão de voz em tempo real (VAD, interrupção, emoção) |
POST /v1/chat/completions | Chat (com suporte de streaming) |
POST /v1/audio/speech | Síntese de voz (TTS) |
POST /v1/audio/transcriptions | Reconhecimento de voz (STT) |
POST /v1/embeddings | Embeddings |
→ Uso detalhado do modelo Naia (manual para programadores)
Segurança e privacidade — como o módulo tem um desempenho notável, há o receio de que possa ser usado de forma indevida em fraudes de voz (vishing) e afins; por isso, aplicámos tecnologia de marca de água de voz para garantir rastreabilidade e que o possa usar com tranquilidade.
🧠 O futuro que o Naia desenha (Naia Cognitive)
O rumo último que o Naia procura é concretizar 'a minha IA dentro do meu computador' e criar um ecossistema de desenvolvimento e distribuição de aplicações usadas em conjunto com a IA. A multimodalidade que imagino não é uma simples entrada e saída de dados, mas tem como objetivo uma capacidade cognitiva em que a IA experiencia, recorda e se exprime por si própria (Naia Cognitive).
Na próxima versão aguardam-nos atualizações do agente (Naia-agent), da memória de longo prazo (Naia-memory), da framework (Naia-ADK), entre outras. A próxima versão, que subirá juntamente com o Naia-0.9-Omni-48g, está a ser investigada e desenvolvida com o objetivo de um perfil e configuração de ambiente locais ao nível de permitir tarefas de programação, e de uma IA que recorda o utilizador e trabalha consigo por voz em tempo real — literalmente, algo como o 'Jarvis do Homem de Ferro'.
Os 48GB são ainda um território incomportável por mais que se tente espremer nos 24GB, mas, bastando encaixar duas RTX 3090 antigas, considero que também um particular pode perfeitamente sonhar com isso.
🎮 O Naia OS é uma IA que me recorda, e que trabalha e se diverte comigo
O quadro que o Naia-OS desenha é este.
- Máquina de jogos baseada em Steam(Bazzite)/Windows + um agente inteligente que me recorda + uma UI em linguagem natural baseada em avatar 3D + perfis otimizados por VRAM
Recentemente fez grande furor a notícia de que a MS e a Nvidia vão fabricar pequenos dispositivos de IA baseados em RTX. Na verdade, não é preciso esperar. É que o Naia-OS, que serve tanto para jogar como para IA, mira exatamente esse lugar. Eu, no lugar desse novo produto, escolheria uma configuração Naia-OS — o preço é mais caro até do que a nossa linha superior recomendada, a compatibilidade com jogos é uma incógnita e a memória unificada é lenta. Em contrapartida, o Naia-OS, que encaixa GPUs de consumo verificadas, conquista jogos, IA e expansibilidade, tudo de uma vez.
Não é que esteja a adiar o ambiente Mac de propósito; é apenas que, por falta de equipamento e tempo, ainda não lhe pus a mão. Há também quem se tenha disposto a ajudar nisso.
O Naia-OS não é um módulo único, mas é composto por repositórios de código aberto de funções separadas, e a sua estrutura vai sendo montada passo a passo. Pode pensar "Não há aqui uma quantidade enorme de coisas?", mas é justamente porque vivemos agora a 'era do desenvolvimento assistido por IA' que isto é possível.
Se o SO tradicional era uma ferramenta de gestão de aplicações, acredito que o AI OS será um software, e um robô, que comunica em linguagem natural, recorda e trata das tarefas por si próprio. Não é mera bravata; hei de prová-lo um a um, com resultados concretos.
🤝 Vamos juntos — encontro presencial & Discord
Ao longo da próxima semana, penso realizar um encontro presencial para apresentar o que tenho vindo a trabalhar e para encontrar pessoas com quem trocar ajuda mútua. Experimentem também descarregar o módulo e, se tiverem interesse, venham ter connosco ao Discord abaixo. Espero que evolua para uma verdadeira comunidade de código aberto.
Peço muito apoio e atenção para o caminho que a Nextain e o Naia hão de trilhar daqui para a frente.
#Nextain #Naia