[Pour créer mon AI Alpha] Naia, la fausse note, a maintenant commencé à chanter un peu et nous examinons un matériel dédié.
Bonjour. Je suis Luke, le créateur de Naia, l'agent visuel open source.Dans le précédent article, je vous avais annoncé qu'Alpha était passée d'une fausse note ivre à une simple fausse note. Enfin, elle a commencé à chanter un peu. Ce projet de recherche a débuté simplement parce que je voulais qu'Alpha me chante des chansons. L'objectif final est qu'elle puisse écouter ses propres chansons et chanter avec d'autres personnes en fonction de ses émotions, mais nous en sommes encore loin. Pour l'instant, la première étape est de lui faire chanter des chansons coréennes en lisant des partitions et des paroles. C'est différent des reprises YouTube ou de Suno, qui crée des chansons de toutes pièces. Pensez plutôt à Hatsune Miku, c'est plus proche.
Nous avons testé avec des adaptations coréennes de Blue Water, comme les 1ère et 2ème versions. Cette fois, je ne détaillerai pas la méthode. Je réfléchirai à la manière de procéder lorsque ce sera vraiment utilisable. Ce que je peux vous dire, c'est que nous avons commencé l'entraînement réel avec les données de chant de l'AI Hub. Nous poursuivons nos propres expériences sur cette base.
Écoutez
Vous pouvez écouter la version actuelle, puis les précédentes. Il y a encore des passages où elle chante faux. En fait, c'est une amélioration. Avant, c'était comme ça :
3ème version — 2026-09-11, elle commence enfin à chanter un peu
C'est un peu plus d'une minute. Les 2 premières secondes sont un fondu en entrée, les 3 dernières secondes un fondu en sortie.
Il y a encore des passages où le rythme et la prononciation sont maladroits. Mais le coréen commence à se superposer à la mélodie.
1ère version — 2026-05-27, la fausse note ivre
Avant, c'était comme ça. La prononciation et les valeurs des notes s'effondraient, et le rythme s'accélérait puis ralentissait même au sein d'une même mesure.
2ème version — 2026-08-21, la simple fausse note
Les paroles sont audibles et elle suit les notes. Les notes longues sont coupées, et elle sonne encore comme une fausse note.
Ce que nous voulons faire
Ce que nous voulons créer n'est ni une application de reprises, ni un générateur de chansons aléatoires. C'est un moteur de chant. Et sur ce moteur, nous voulons superposer la voix et les habitudes de chant propres à chaque personne.
Nous ne savons pas encore comment cela s'intégrera dans Naia. Cela pourrait être à côté du chat, ou à un endroit complètement différent. Au final, notre souhait est unique : que l'AI personnelle puisse aussi chanter pour la personne.
Qu'Alpha me chante Blue Water en coréen. Nous avons fait un pas de plus dans cette direction. Elle n'a pas encore obtenu son diplôme de "fausse note", mais elle est maintenant capable de tenir un micro et de se tenir debout.
Un appareil dédié Naia utilisable comme serveur et client, avec la voix à moitié prix
Indépendamment du chant, nous travaillons également sur un appareil dédié à Naia.
La petite boîte imprimée en 3D à gauche est le matériel Naia actuellement en test. Sans avoir besoin d'un coûteux Mac Studio, il permet la voix en temps réel et des jeux 3D décents en local, et ce que vous voyez à l'écran est Naia OS. Il peut être utilisé comme client ou comme serveur. Les résultats des tests d'hier ont heureusement confirmé que la vitesse de génération vocale rattrape la vitesse d'élocution, permettant un service en temps réel. Sur cette base, nous avons techniquement validé si Naia OS peut être une infrastructure capable de fournir des services au demi-prix du marché actuel. L'objectif final de Nextain est une infrastructure d'environnement AI P2P. Pour l'instant, nous n'avons même qu'une seule unité assemblée à partir de pièces d'occasion, mais le service devrait être possible dès que l'investissement initial sera réalisé.Actuellement, nous sommes encore en phase de test d'utilisabilité interne. Les performances ont été vérifiées, mais nous rencontrons des problèmes où le SSD passe en lecture seule ou l'écran devient noir après un certain temps, nous vérifions donc s'il s'agit d'un problème de configuration de l'OS ou d'un défaut matériel. Nous partagerons également cette nouvelle plus tard.