Pular para o conteúdo
Modelos abertos(ver a linha do tempo)Foto: Mike Petrucci / StockSnap, domínio público

Nvidia libera modelo aberto que identifica até oito vozes numa conversa em tempo real

27 de setembro de 2026Nível de hype: ProdutoOrigem: EUA

Compartilhar
WhatsAppLinkedIn

Segundo o The Decoder, o modelo distingue até oito falantes e detecta fala sobreposta; mais participantes, ruído e eco aumentam os erros. Combinado a um reconhecedor de fala como o Parakeet, gera transcrições com rótulos anônimos, como "falante 2". O buffer de áudio vai de 30,4 a 0,32 segundo, e buffers menores tendem a reduzir a precisão.

No Diarization-Bench, da VoiceArena, lidera com 14,72% de erro, contra 19,3% do segundo colocado. Frente ao antecessor Streaming Sortformer, reduz o erro em 41% em média em oito cenários, com buffer de 1,04 segundo. A licença exata dos pesos não foi detalhada na fonte lida.

O que muda pra você

Dev
Um modelo pequeno de diarização aberto permite rodar legendas com identificação de falantes localmente, inclusive ao vivo.
PM
Atas de reunião e transcrição de atendimento com separação de falantes ficam mais baratas de oferecer.
Ver para outros perfis (Executivo, Investidor, Educador)
Executivo
Transcrição com identificação de vozes pode ser feita dentro da empresa, sem enviar áudio a terceiros.
Investidor
Sem efeito direto para investidores.
Educador
Aulas gravadas podem ter transcrições que separam professor e alunos, útil para acessibilidade.
Achou útil? Compartilhe
Reportar um erro
O que há de errado?

Não pedimos nome nem e-mail.

Destaques de hoje no Sinal.AI

Ver tudo o que importa hoje