
Inferact roda Kimi K3 57% mais rápido em TPUs do Google do que em GPUs GB200
26 set, 04:12Nível de hype: PesquisaOrigem: EUA
A Inferact, startup fundada pelos criadores do motor de inferência vLLM, publicou testes em que 16 TPUs v7 do Google rodaram o modelo Kimi K3 a 709 tokens por segundo, contra 452 em 16 GPUs GB200 da Nvidia, com o mesmo modelo e o mesmo vLLM. O ganho vem de um "megakernel": as 92 camadas do modelo num único programa, o que permite carregar os pesos da camada seguinte enquanto a atual é calculada.
O resultado usa a técnica de decodificação especulativa DSpark, da DeepSeek. Sem ela, com um pedido por vez, as TPUs chegaram a 249 tokens por segundo, contra 127 no GB200. A empresa diz que a precisão não mudou nos testes GPQA-Diamond e GSM8K. O código foi aberto.
O ajuste foi feito especificamente para a arquitetura do Kimi K3 e precisa ser refeito para outros modelos. Os números são da própria empresa, divulgados pelo QbitAI, e não foram reproduzidos por terceiros.
O que muda pra você
- Dev
- Na inferência, o software pode pesar mais que a ficha técnica do chip; teste com seu modelo antes de escolher hardware.
- PM
- Custos de inferência podem mudar com otimizações de software, não só com chips novos.
- Executivo
- TPUs do Google ganham argumento como alternativa às GPUs da Nvidia para servir modelos.
- Investidor
- Resultados como esse reforçam a concorrência às GPUs da Nvidia no mercado de inferência.
- Educador
- Mostra que o gargalo da inferência é mover dados na memória, não só calcular.