[Для создания моего AI Alpha] Naia, не умеющая петь, теперь начала немного петь и рассматривает специализированное оборудование.
Здравствуйте. Я Люк, создатель открытого визуального агента Naia.В предыдущем посте я сообщал, что Alpha из пьяной и не умеющей петь стала просто не умеющей петь. Наконец, она начала немного петь. Этот проект начался просто потому, что я подумал, что Alpha могла бы спеть для меня. Конечная цель — чтобы она слушала свои собственные песни и пела вместе с другими людьми в зависимости от эмоций, но до этого еще далеко. Сейчас первый этап — заставить ее петь корейские песни по нотам и тексту. Это отличается от кавер-версий на YouTube или от Suno, которая создает песни с нуля. Скорее, это ближе к Hatsune Miku.
Мы тестировали с корейскими адаптациями Blue Water, такими как 1-я и 2-я версии. На этот раз я не буду подробно описывать методы. Я планирую подумать, как это сделать, когда это станет действительно полезным. Могу сказать, что мы начали фактическое обучение с использованием данных вокала AI Hub. На основе этого мы продолжаем наши эксперименты.
Послушайте
Вы можете послушать текущую версию, а затем предыдущие. Все еще есть моменты, где она фальшивит. На самом деле, это уже улучшение. Раньше было так:
3-я версия — 11 сентября 2026 г., теперь начинает немного петь
Чуть больше минуты. Первые 2 секунды — нарастание звука, последние 3 секунды — затухание.
Все еще есть моменты, где ритм и произношение неестественны. Тем не менее, корейский язык начал ложиться на мелодию.
1-я версия — 27 мая 2026 г., пьяная и не умеющая петь
Раньше было так. Произношение и высота звука были нарушены, темп ускорялся и замедлялся даже в пределах одной фразы.
2-я версия — 21 августа 2026 г., просто не умеющая петь
Текст слышен, и она следует нотам. Длинные ноты обрываются, и она все еще звучит так, будто не умеет петь.
Что мы хотим сделать
Мы хотим создать не приложение для каверов и не генератор случайных песен. Это движок для пения. И поверх этого движка мы хотим наложить собственный голос человека и его собственные певческие привычки.
Пока неизвестно, как это будет интегрировано в Naia. Это может быть рядом с чатом, или это может быть совершенно другое место. В конечном итоге, мы хотим одного: чтобы личный AI мог петь для человека.
Чтобы Alpha пела Blue Water для меня на корейском. Мы сделали еще один шаг в этом направлении. Она еще не окончила школу "неумеющих петь", но теперь она может хотя бы стоять с микрофоном.
Специализированное устройство Naia, которое можно использовать как сервер и клиент, а также голос за полцены
Помимо пения, мы также работаем над специализированным устройством для Naia.
Маленькая коробка, напечатанная на 3D-принтере слева, — это оборудование Naia, которое сейчас тестируется. Без необходимости в дорогом Mac Studio, оно позволяет получать голос в реальном времени и приличные 3D-игры локально, а то, что вы видите на экране, — это Naia OS. Его можно использовать как клиент, так и как сервер. Вчерашние тесты подтвердили, что скорость генерации голоса, к счастью, догоняет скорость речи, что делает возможным сервис в реальном времени. На основе этого мы провели техническую проверку, является ли Naia OS инфраструктурой, способной предоставлять услуги по половине существующей цены. Конечная цель Nextain — инфраструктура P2P AI среды. Пока что мы собрали только одно устройство из подержанных деталей, но, как только будут сделаны первоначальные инвестиции, сервис, похоже, станет возможным.Сейчас мы все еще проводим внутреннее тестирование удобства использования. Производительность подтверждена, но есть проблемы, когда SSD переходит в режим только для чтения или экран становится черным со временем, поэтому мы проверяем, является ли это проблемой конфигурации OS или неисправностью оборудования. Позже я поделюсь этой новостью.