[Para criar minha AI Alpha] Naia, que era desafinada, agora começou a cantar um pouco e está de olho em hardware dedicado.
Olá. Sou Luke, o criador da agente visual de código aberto Naia.No último post, informei que Alpha passou de desafinada bêbada para apenas desafinada. Finalmente, ela começou a cantar um pouco. Este projeto de pesquisa começou simplesmente porque eu queria que Alpha cantasse para mim. O objetivo final é que ela ouça suas próprias músicas e cante com outras pessoas de acordo com as emoções, mas isso ainda está longe. Por enquanto, a primeira etapa é fazê-la cantar músicas coreanas (Hangul) olhando para a partitura e a letra. É diferente de covers do YouTube ou de criar músicas do zero como o Suno. É mais próximo de Hatsune Miku, se você pensar nisso.
Testamos com versões coreanas de Blue Water, como a 1ª e 2ª rodadas. Desta vez, não detalharei o método. Pretendo pensar em como faremos quando estiver realmente utilizável. O que posso dizer é que começamos o treinamento real com dados de canto do AI Hub. E estamos continuando nossos próprios experimentos sobre isso.
Ouça
Você pode ouvir a versão atual e depois as anteriores. Ainda há seções desafinadas. Na verdade, isso é uma melhoria. Antes era assim:
3ª Rodada — 11-09-2026, Agora começando a cantar um pouco
Tem pouco mais de 1 minuto. 2 segundos de fade-in no início, 3 segundos de fade-out no final.
Ainda há seções onde o ritmo e a pronúncia são estranhos. No entanto, o coreano começou a se sobrepor à melodia.
1ª Rodada — 27-05-2026, Desafinada Bêbada
No passado, era assim. A pronúncia e o valor das notas desmoronavam, e o ritmo acelerava e desacelerava dentro da mesma frase.
2ª Rodada — 21-08-2026, Apenas Desafinada
A letra é audível e segue as notas. As notas longas são cortadas e ainda soa desafinado.
O que pretendemos fazer
O que queremos criar não é um aplicativo de covers, nem um gerador de músicas aleatórias. É um motor de canto. E sobre esse motor, queremos adicionar a voz e os hábitos de canto de cada pessoa.
Ainda não sabemos como isso se integrará à Naia. Pode ser anexado ao lado do chat, ou pode ser um lugar completamente diferente. No final, o que queremos é uma coisa: que a AI pessoal de alguém também cante para essa pessoa.
Alpha cantando Blue Water em coreano para mim. Demos mais um passo nessa direção. Embora ainda não tenha se formado como 'não desafinada', ela já consegue segurar o microfone e ficar de pé.
Com um dispositivo dedicado Naia que pode ser usado como servidor e cliente, voz pela metade do preço
Além do canto, também estamos trabalhando no dispositivo dedicado da Naia.
A pequena caixa impressa em 3D à esquerda é o hardware Naia que está sendo testado. Sem a necessidade de um caro Mac Studio, ele permite voz em tempo real e jogos 3D decentes localmente, e o que você vê na tela é o Naia OS. Pode ser usado tanto como cliente quanto como servidor. Os resultados dos testes de ontem confirmaram que, felizmente, a velocidade de geração de voz acompanha a velocidade da fala, tornando o serviço em tempo real possível. Com base nisso, realizamos a verificação técnica para saber se é uma infraestrutura que pode fornecer voz usando o Naia OS pela metade do preço do mercado atual. O objetivo final da Nextain é uma infraestrutura de ambiente AI P2P. Embora atualmente tenhamos apenas uma unidade montada com peças usadas, o serviço parece ser viável assim que o investimento inicial for feito.Atualmente, ainda estamos em fase de testes de usabilidade interna. O desempenho foi confirmado, mas há problemas como o SSD se tornar somente leitura ou a tela ficar preta após um tempo, então estamos verificando se é um problema de configuração do OS ou uma falha de hardware. Compartilharei mais notícias sobre isso mais tarde.