Foto: rawpixel, domínio público
Agentes de IA no dia a dia e no trabalho(ver a linha do tempo)

Sistema da Nvidia corta quase pela metade os tokens de agentes de programação

26 set, 07:30Nível de hype: PesquisaOrigem: EUA

Pesquisadores da Nvidia descreveram num artigo o SoL-Pi, sistema que otimiza de forma automática o "harness", a camada entre o modelo e o ambiente que decide como o agente vê o estado, executa ações e trata respostas, usada por ferramentas como Codex e Claude Code. Um agente de pesquisa analisa os registros de outro agente, propõe mudanças e mantém só as que preservam o desempenho gastando menos.

A busca testou 152 direções em 535 ambientes, com mais de 3 mil execuções. Dela saíram quatro mecanismos, como juntar numa só chamada uma edição de código e o teste seguinte, e enxugar o contexto após cada etapa de planejamento. No benchmark EdgeBench, isolado da busca, o gasto de tokens caiu 50% em relação ao Codex e 54,3% em relação ao Claude Code.

Segundo o The Decoder, os ganhos foram menores em outros benchmarks. Os autores reconhecem o risco de ajustes automáticos funcionarem só nas tarefas usadas no treino; o resultado ainda não foi reproduzido por terceiros.

O que muda pra você

Dev
Antes de trocar de modelo para cortar custo, meça quanto do gasto vem da orquestração do agente.
PM
Custo por tarefa de agentes pode cair sem mudar o modelo; inclua isso no cálculo de preço.
Executivo
Otimizar a camada de controle dos agentes é uma alavanca de custo além da negociação com fornecedores.
Investidor
Ganhos de eficiência de software reduzem o consumo de tokens por tarefa, o que afeta receitas de API.
Educador
Explique a diferença entre o modelo e o "harness" que o transforma em agente.