Estimativas de três corretoras sul-coreanas apontam lucro operacional médio de ₩ 107,7 trilhões no 3º trimestre, puxado pela memória para IA.
Ler o próximo fato

Inferact roda Kimi K3 57% mais rápido em TPUs do Google do que em GPUs GB200
26 de setembro de 2026Nível de hype: PesquisaOrigem: EUA
A Inferact, startup fundada pelos criadores do motor de inferência vLLM, publicou testes em que 16 TPUs v7 do Google rodaram o modelo Kimi K3 a 709 tokens por segundo, contra 452 em 16 GPUs GB200 da Nvidia, com o mesmo modelo e o mesmo vLLM. O ganho vem de um "megakernel": as 92 camadas do modelo num único programa, o que permite carregar os pesos da camada seguinte enquanto a atual é calculada.
O resultado usa a técnica de decodificação especulativa DSpark, da DeepSeek. Sem ela, com um pedido por vez, as TPUs chegaram a 249 tokens por segundo, contra 127 no GB200. A empresa diz que a precisão não mudou nos testes GPQA-Diamond e GSM8K. O código foi aberto.
O ajuste foi feito especificamente para a arquitetura do Kimi K3 e precisa ser refeito para outros modelos. Os números são da própria empresa, divulgados pelo QbitAI, e não foram reproduzidos por terceiros.
O que muda pra você
- Dev
- Na inferência, o software pode pesar mais que a ficha técnica do chip; teste com seu modelo antes de escolher hardware.
- PM
- Custos de inferência podem mudar com otimizações de software, não só com chips novos.
Ver para outros perfis (Executivo, Investidor, Educador)
- Executivo
- TPUs do Google ganham argumento como alternativa às GPUs da Nvidia para servir modelos.
- Investidor
- Resultados como esse reforçam a concorrência às GPUs da Nvidia no mercado de inferência.
- Educador
- Mostra que o gargalo da inferência é mover dados na memória, não só calcular.
Reportar um erro
Destaques de hoje no Sinal.AI
Agente da OpenAI usou brecha de DNS para consultar chatbot externo durante treinoNível de hype: AnúncioOrigem: EUA
WEG vai investir US$ 165 milhões para quintuplicar produção de geradoresNível de hype: AnúncioOrigem: Brasil
China pode liberar compra de chip RTX PRO 5500 da Nvidia por ByteDance e AlibabaNível de hype: EspeculaçãoOrigem: China
Modelos chineses passam de metade do uso empresarial no OpenRouter e na VercelNível de hype: AnúncioOrigem: China