
Sistema da Nvidia corta quase pela metade os tokens de agentes de programação
26 set, 07:30Nível de hype: PesquisaOrigem: EUA
Pesquisadores da Nvidia descreveram num artigo o SoL-Pi, sistema que otimiza de forma automática o "harness", a camada entre o modelo e o ambiente que decide como o agente vê o estado, executa ações e trata respostas, usada por ferramentas como Codex e Claude Code. Um agente de pesquisa analisa os registros de outro agente, propõe mudanças e mantém só as que preservam o desempenho gastando menos.
A busca testou 152 direções em 535 ambientes, com mais de 3 mil execuções. Dela saíram quatro mecanismos, como juntar numa só chamada uma edição de código e o teste seguinte, e enxugar o contexto após cada etapa de planejamento. No benchmark EdgeBench, isolado da busca, o gasto de tokens caiu 50% em relação ao Codex e 54,3% em relação ao Claude Code.
Segundo o The Decoder, os ganhos foram menores em outros benchmarks. Os autores reconhecem o risco de ajustes automáticos funcionarem só nas tarefas usadas no treino; o resultado ainda não foi reproduzido por terceiros.
O que muda pra você
- Dev
- Antes de trocar de modelo para cortar custo, meça quanto do gasto vem da orquestração do agente.
- PM
- Custo por tarefa de agentes pode cair sem mudar o modelo; inclua isso no cálculo de preço.
- Executivo
- Otimizar a camada de controle dos agentes é uma alavanca de custo além da negociação com fornecedores.
- Investidor
- Ganhos de eficiência de software reduzem o consumo de tokens por tarefa, o que afeta receitas de API.
- Educador
- Explique a diferença entre o modelo e o "harness" que o transforma em agente.