
Google lança Android Bench 2.0, e melhor taxa de acerto cai de 91% para 28%
26 set, 01:00Nível de hype: PesquisaOrigem: EUA
O Google publicou o Android Bench 2.0, benchmark que mede a capacidade de modelos e agentes de IA de desenvolver para Android. A versão anterior usava mudanças pequenas e correções de bugs; a nova usa tarefas longas, como atualizar dependências, adicionar funções, criar um aplicativo do zero e portar apps multiplataforma para Android nativo.
Com a mudança, a melhor taxa de aprovação caiu de cerca de 91% para cerca de 28%, segundo o ITmedia. O Google também passou a medir uma taxa de conclusão, que considera funcionalidade, fidelidade da interface e ausência de regressões, em vez de só aprovar ou reprovar. Segundo a reportagem, os modelos vão melhor ao criar código novo do que ao refatorar código existente.
Parte do texto da matéria não pôde ser lida por problema de codificação, e ela não lista nas partes legíveis quais modelos foram avaliados.
O que muda pra você
- Dev
- Agentes ainda erram muito em refatoração e migração; revise com mais cuidado mudanças em código existente.
- PM
- Não planeje entregas de semanas inteiras só com agentes; tarefas longas ainda falham na maioria das vezes.
- Executivo
- Números altos em benchmarks curtos não se traduzem em projetos longos; peça testes com tarefas reais.
- Investidor
- Benchmarks de tarefas longas mostram que ainda há espaço grande de melhora nos agentes de código.
- Educador
- Mostra como a escolha das tarefas muda o resultado de um benchmark.