De acordo com Beating, a equipe Kaldi do AI Lab da Xiaomi disponibilizou em código aberto o OmniVoice, um modelo de TTS para clonagem de voz zero-shot que oferece suporte a 646 idiomas. O modelo clona características da voz a partir de apenas segundos de áudio de referência e funciona entre idiomas — uma única voz pode sintetizar fala em mandarim, japonês, coreano e outros idiomas. Todo o código, pesos e dados de treinamento são disponibilizados em código aberto sob licença Apache-2.0.
O OmniVoice usa uma arquitetura simplificada com um único Transformer bidirecional que mapeia diretamente texto para tokens acústicos discretos, alcançando inferência 40x mais rápida que o tempo real no PyTorch. Treinado com 580.000 horas de áudio de 50 conjuntos de dados open-source, o OmniVoice superou sistemas comerciais em similaridade de voz e inteligibilidade em 24 idiomas testados e correspondeu ou superou gravações humanas em 102 idiomas.
Related News
OpenAI lança o ChatGPT Futures: 26 alunos da primeira turma recebem bolsa de US$ 10 mil, abrangendo mais de 20 universidades
Genesis AI lança a plataforma robótica GENE-26.5 com financiamento US$105M
Líder do Claude Code, Boris: agentes de IA aumentam a produtividade humana e reescrevem a história do desenvolvimento de software