Pular para o conteúdo
A corrida dos modelos de fronteira(ver a linha do tempo)Foto: rawpixel, domínio público

Google lança Android Bench 2.0, e melhor taxa de acerto cai de 91% para 28%

26 de setembro de 2026Nível de hype: PesquisaOrigem: EUA

Compartilhar
WhatsAppLinkedIn

O Google publicou o Android Bench 2.0, benchmark que mede a capacidade de modelos e agentes de IA de desenvolver para Android. A versão anterior usava mudanças pequenas e correções de bugs; a nova usa tarefas longas, como atualizar dependências, adicionar funções, criar um aplicativo do zero e portar apps multiplataforma para Android nativo.

Com a mudança, a melhor taxa de aprovação caiu de cerca de 91% para cerca de 28%, segundo o ITmedia. O Google também passou a medir uma taxa de conclusão, que considera funcionalidade, fidelidade da interface e ausência de regressões, em vez de só aprovar ou reprovar. Segundo a reportagem, os modelos vão melhor ao criar código novo do que ao refatorar código existente.

Parte do texto da matéria não pôde ser lida por problema de codificação, e ela não lista nas partes legíveis quais modelos foram avaliados.

O que muda pra você

Dev
Agentes ainda erram muito em refatoração e migração; revise com mais cuidado mudanças em código existente.
PM
Não planeje entregas de semanas inteiras só com agentes; tarefas longas ainda falham na maioria das vezes.
Ver para outros perfis (Executivo, Investidor, Educador)
Executivo
Números altos em benchmarks curtos não se traduzem em projetos longos; peça testes com tarefas reais.
Investidor
Benchmarks de tarefas longas mostram que ainda há espaço grande de melhora nos agentes de código.
Educador
Mostra como a escolha das tarefas muda o resultado de um benchmark.
Achou útil? Compartilhe
Reportar um erro
O que há de errado?

Não pedimos nome nem e-mail.

Destaques de hoje no Sinal.AI

Ver tudo o que importa hoje