Pular para o conteúdo
A corrida dos modelos de fronteira(ver a linha do tempo)Foto: rawpixel, domínio público

GPT-6 Astra acerta 80% em teste da Epoch AI que acha erros em montagem de móveis

26 de setembro de 2026Nível de hype: PesquisaOrigem: EUA

Compartilhar
WhatsAppLinkedIn

A Epoch AI divulgou resultados do Furniture Assembly Benchmark (FAB), que fotografa três móveis da IKEA durante a montagem, com erros feitos de propósito. Os modelos comparam as fotos com o manual, apontam o erro e explicam o que deu errado. Em novembro de 2025, o melhor resultado era do Claude Opus 4.5, com 28%.

Dez meses depois, o GPT-6 Astra, da OpenAI, chega a 80%, levando cerca de três minutos por foto. O Claude Fable 5.1 marca 70%, e o Claude Opus 5, 61%. Modelos abertos chineses, como o Kimi K3, estão pelo menos sete meses atrás dos líderes, segundo a Epoch.

Os pesquisadores dizem que a velocidade ainda não permite ajuda em tempo real durante a montagem. O resumo lido não detalha o tamanho da amostra de fotos.

O que muda pra você

Dev
Tarefas de inspeção visual passo a passo já têm modelos com bom acerto; a latência ainda é o limite.
PM
Assistentes para montagem, manutenção ou reparo guiados por foto ficam mais viáveis, mas não em tempo real.
Ver para outros perfis (Executivo, Investidor, Educador)
Executivo
Avalie usos de inspeção visual com fotos em processos de campo e manutenção.
Investidor
A distância de meses entre modelos fechados e abertos segue grande em tarefas visuais.
Educador
Bom exemplo de benchmark ligado a uma tarefa do cotidiano para discutir o que os números medem.
Achou útil? Compartilhe
Reportar um erro
O que há de errado?

Não pedimos nome nem e-mail.

Destaques de hoje no Sinal.AI

Ver tudo o que importa hoje