Foto: rawpixel, domínio público
Chips de IA(ver a linha do tempo)

Inferact roda Kimi K3 57% mais rápido em TPUs do Google do que em GPUs GB200

26 set, 04:12Nível de hype: PesquisaOrigem: EUA

A Inferact, startup fundada pelos criadores do motor de inferência vLLM, publicou testes em que 16 TPUs v7 do Google rodaram o modelo Kimi K3 a 709 tokens por segundo, contra 452 em 16 GPUs GB200 da Nvidia, com o mesmo modelo e o mesmo vLLM. O ganho vem de um "megakernel": as 92 camadas do modelo num único programa, o que permite carregar os pesos da camada seguinte enquanto a atual é calculada.

O resultado usa a técnica de decodificação especulativa DSpark, da DeepSeek. Sem ela, com um pedido por vez, as TPUs chegaram a 249 tokens por segundo, contra 127 no GB200. A empresa diz que a precisão não mudou nos testes GPQA-Diamond e GSM8K. O código foi aberto.

O ajuste foi feito especificamente para a arquitetura do Kimi K3 e precisa ser refeito para outros modelos. Os números são da própria empresa, divulgados pelo QbitAI, e não foram reproduzidos por terceiros.

O que muda pra você

Dev
Na inferência, o software pode pesar mais que a ficha técnica do chip; teste com seu modelo antes de escolher hardware.
PM
Custos de inferência podem mudar com otimizações de software, não só com chips novos.
Executivo
TPUs do Google ganham argumento como alternativa às GPUs da Nvidia para servir modelos.
Investidor
Resultados como esse reforçam a concorrência às GPUs da Nvidia no mercado de inferência.
Educador
Mostra que o gargalo da inferência é mover dados na memória, não só calcular.