Foto: rawpixel, domínio público
A corrida dos modelos de fronteira(ver a linha do tempo)

Google lança Android Bench 2.0, e melhor taxa de acerto cai de 91% para 28%

26 set, 01:00Nível de hype: PesquisaOrigem: EUA

O Google publicou o Android Bench 2.0, benchmark que mede a capacidade de modelos e agentes de IA de desenvolver para Android. A versão anterior usava mudanças pequenas e correções de bugs; a nova usa tarefas longas, como atualizar dependências, adicionar funções, criar um aplicativo do zero e portar apps multiplataforma para Android nativo.

Com a mudança, a melhor taxa de aprovação caiu de cerca de 91% para cerca de 28%, segundo o ITmedia. O Google também passou a medir uma taxa de conclusão, que considera funcionalidade, fidelidade da interface e ausência de regressões, em vez de só aprovar ou reprovar. Segundo a reportagem, os modelos vão melhor ao criar código novo do que ao refatorar código existente.

Parte do texto da matéria não pôde ser lida por problema de codificação, e ela não lista nas partes legíveis quais modelos foram avaliados.

O que muda pra você

Dev
Agentes ainda erram muito em refatoração e migração; revise com mais cuidado mudanças em código existente.
PM
Não planeje entregas de semanas inteiras só com agentes; tarefas longas ainda falham na maioria das vezes.
Executivo
Números altos em benchmarks curtos não se traduzem em projetos longos; peça testes com tarefas reais.
Investidor
Benchmarks de tarefas longas mostram que ainda há espaço grande de melhora nos agentes de código.
Educador
Mostra como a escolha das tarefas muda o resultado de um benchmark.