Sinal.AI
Tema claro ou escuro
Entrar na minha conta
Criar conta
Foto: Mike Petrucci / StockSnap, domínio público
Modelos abertos(ver a linha do tempo)

Nvidia libera modelo aberto que identifica até oito vozes numa conversa em tempo real

27 set, 08:01Nível de hype: ProdutoOrigem: EUA

Compartilhar
WhatsAppLinkedIn

Segundo o The Decoder, o modelo distingue até oito falantes e detecta fala sobreposta; mais participantes, ruído e eco aumentam os erros. Combinado a um reconhecedor de fala como o Parakeet, gera transcrições com rótulos anônimos, como "falante 2". O buffer de áudio vai de 30,4 a 0,32 segundo, e buffers menores tendem a reduzir a precisão.

No Diarization-Bench, da VoiceArena, lidera com 14,72% de erro, contra 19,3% do segundo colocado. Frente ao antecessor Streaming Sortformer, reduz o erro em 41% em média em oito cenários, com buffer de 1,04 segundo. A licença exata dos pesos não foi detalhada na fonte lida.

Os 5 fatos de IA da semana, toda segunda no seu e-mail

Lidos em 5 minutos. Grátis, e dá para sair com um clique.

O que muda pra você

Dev
Um modelo pequeno de diarização aberto permite rodar legendas com identificação de falantes localmente, inclusive ao vivo.
PM
Atas de reunião e transcrição de atendimento com separação de falantes ficam mais baratas de oferecer.
Executivo
Transcrição com identificação de vozes pode ser feita dentro da empresa, sem enviar áudio a terceiros.
Investidor
Sem efeito direto para investidores.
Educador
Aulas gravadas podem ter transcrições que separam professor e alunos, útil para acessibilidade.
Achou útil? Compartilhe
Reportar um erro
O que há de errado?

Não pedimos nome nem e-mail.

Destaques de hoje no Sinal.AI

Ver tudo o que importa hoje