Foto: rawpixel, domínio público
A corrida dos modelos de fronteira(ver a linha do tempo)

GPT-6 Astra acerta 80% em teste da Epoch AI que acha erros em montagem de móveis

26 set, 06:44Nível de hype: PesquisaOrigem: EUA

A Epoch AI divulgou resultados do Furniture Assembly Benchmark (FAB), que fotografa três móveis da IKEA durante a montagem, com erros feitos de propósito. Os modelos comparam as fotos com o manual, apontam o erro e explicam o que deu errado. Em novembro de 2025, o melhor resultado era do Claude Opus 4.5, com 28%.

Dez meses depois, o GPT-6 Astra, da OpenAI, chega a 80%, levando cerca de três minutos por foto. O Claude Fable 5.1 marca 70%, e o Claude Opus 5, 61%. Modelos abertos chineses, como o Kimi K3, estão pelo menos sete meses atrás dos líderes, segundo a Epoch.

Os pesquisadores dizem que a velocidade ainda não permite ajuda em tempo real durante a montagem. O resumo lido não detalha o tamanho da amostra de fotos.

O que muda pra você

Dev
Tarefas de inspeção visual passo a passo já têm modelos com bom acerto; a latência ainda é o limite.
PM
Assistentes para montagem, manutenção ou reparo guiados por foto ficam mais viáveis, mas não em tempo real.
Executivo
Avalie usos de inspeção visual com fotos em processos de campo e manutenção.
Investidor
A distância de meses entre modelos fechados e abertos segue grande em tarefas visuais.
Educador
Bom exemplo de benchmark ligado a uma tarefa do cotidiano para discutir o que os números medem.