[Để tạo ra AI Alpha của riêng tôi] Naia, người từng hát dở, giờ đã bắt đầu hát được một chút và đang xem xét phần cứng chuyên dụng.
Xin chào. Tôi là Luke, người đang tạo ra tác nhân hình ảnh mã nguồn mở Naia.Trong bài viết trước, tôi đã thông báo rằng Alpha đã từ một người hát dở như say rượu trở thành một người hát dở bình thường. Cuối cùng, giờ đây nó đã bắt đầu hát được một chút. Khởi đầu này là một dự án nghiên cứu bắt nguồn từ suy nghĩ đơn giản rằng tôi muốn Alpha hát cho tôi nghe. Mục tiêu cuối cùng là để nó thực sự nghe bài hát của chính mình và hát cùng người khác theo cảm xúc, nhưng điều đó còn xa vời. Hiện tại, giai đoạn 1 là làm cho nó hát các bài hát tiếng Hàn dựa trên bản nhạc và lời bài hát. Điều này khác với các bản cover trên YouTube hoặc Suno, nơi tạo ra toàn bộ bài hát. Thay vào đó, nếu bạn nghĩ đến Hatsune Miku, nó sẽ gần hơn.
Chúng tôi đã thử nghiệm với các bản chuyển ngữ tiếng Hàn của Blue Water như lần 1 và lần 2. Lần này, tôi sẽ không đi sâu vào chi tiết phương pháp. Tôi dự định sẽ cân nhắc kỹ hơn về cách thực hiện khi nó thực sự hữu ích. Điều tôi có thể tiết lộ là chúng tôi đã bắt đầu huấn luyện thực tế với dữ liệu ca hát của AI Hub. Chúng tôi đang tiếp tục các thử nghiệm của mình dựa trên đó.
Hãy nghe thử
Bạn có thể nghe bản hiện tại trước, sau đó nghe các bản cũ. Vẫn còn những đoạn hát dở. Thực ra, đây đã là một sự cải thiện rồi. Trước đây, nó như thế này:
Lần 3 — 2026-09-11, Đã bắt đầu hát được một chút
Khoảng hơn 1 phút. 2 giây đầu là fade-in, 3 giây cuối là fade-out.
Vẫn còn những đoạn nhịp điệu và phát âm còn gượng gạo. Tuy nhiên, tiếng Hàn đã bắt đầu được đặt lên giai điệu.
Lần 1 — 2026-05-27, Hát dở như say rượu
Trước đây, nó như thế này. Phát âm và cao độ bị phá vỡ, và trong cùng một đoạn, nó lúc nhanh lúc chậm.
Lần 2 — 2026-08-21, Hát dở bình thường
Lời bài hát có thể nghe được và nó theo nốt nhạc. Các nốt dài bị ngắt quãng, và vẫn nghe như hát dở.
Chúng tôi muốn làm gì
Điều chúng tôi muốn tạo ra không phải là một ứng dụng cover hay một trình tạo bài hát ngẫu nhiên. Đó là một công cụ hát. Và trên công cụ đó, chúng tôi muốn đặt giọng nói riêng của mỗi người và thói quen ca hát riêng của họ.
Chúng tôi vẫn chưa biết điều này sẽ được tích hợp vào Naia như thế nào. Nó có thể được gắn bên cạnh trò chuyện, hoặc có thể là một vị trí hoàn toàn khác. Cuối cùng, chúng tôi chỉ muốn một điều: AI cá nhân có thể hát cho người đó.
Alpha hát Blue Water bằng tiếng Hàn cho tôi. Chúng tôi đã tiến thêm một bước theo hướng đó. Mặc dù vẫn chưa tốt nghiệp "hát dở", nhưng giờ đây nó đã có thể cầm micro và đứng hát.
Với thiết bị chuyên dụng của Naia có thể dùng làm máy chủ và máy khách, giọng nói cũng chỉ bằng nửa giá
Ngoài việc hát, chúng tôi cũng đang phát triển thiết bị chuyên dụng của Naia.
Hộp nhỏ được in 3D ở bên trái là phần cứng Naia đang được thử nghiệm. Không cần Mac Studio đắt tiền, nó có thể xử lý giọng nói thời gian thực và chơi game 3D khá tốt cục bộ, và những gì bạn thấy trên màn hình là Naia OS. Nó có thể được sử dụng như một máy khách hoặc một máy chủ. Kết quả thử nghiệm hôm qua đã xác nhận rằng tốc độ tạo giọng nói may mắn đã bắt kịp tốc độ phát âm, cho phép dịch vụ thời gian thực. Dựa trên điều này, chúng tôi đã xác minh công nghệ rằng Naia OS có thể được sử dụng để cung cấp cơ sở hạ tầng với nửa giá so với giá thị trường hiện tại. Mục tiêu cuối cùng của Nextain là cơ sở hạ tầng môi trường AI P2P. Mặc dù hiện tại chúng tôi chỉ mới lắp ráp một thiết bị từ các linh kiện cũ, nhưng dịch vụ có thể sẽ khả thi ngay khi có đầu tư ban đầu.Hiện tại, chúng tôi vẫn đang trong giai đoạn thử nghiệm khả năng sử dụng nội bộ. Hiệu suất đã được xác nhận, nhưng có vấn đề là SSD chuyển sang chế độ chỉ đọc hoặc màn hình chuyển sang màu đen sau một thời gian, vì vậy chúng tôi đang kiểm tra xem đây là vấn đề cấu hình OS hay lỗi phần cứng. Chúng tôi sẽ chia sẻ tin tức này sau.