← História: Segurança e alinhamento de modelos
Nível de hype: PesquisaOrigem: EUA

Anthropic acha "espaço oculto" em que o Claude elabora conceitos

A Anthropic criou uma ferramenta chamada Jacobian lens (J-lens) e, com ela, encontrou uma área oculta, que chamou de J-space, dentro do Claude Opus 4.6, onde o modelo trabalha conceitos ao responder perguntas ou executar tarefas.

Segundo a MIT Technology Review, é a visão mais clara até agora do que acontece dentro de um modelo de linguagem. O que os pesquisadores encontraram vai do banal ao inquietante.

Termômetro de hype

Pesquisa

Resultado de pesquisa publicado.

Critério: Paper, demo ou resultado verificável, sem produto.

Fontes originais

Resumo escrito com palavras próprias a partir destas fontes. Nenhum trecho é reproduzido.

O que muda pra você

Dev
Técnicas de interpretabilidade podem ajudar a auditar o raciocínio dos modelos.
PM
Sem efeito direto no produto.
Executivo
Entender o que acontece dentro dos modelos ajuda a governar seu uso.
Investidor
Interpretabilidade é diferencial de segurança da Anthropic.
Educador
Discuta por que é difícil entender o que uma IA "pensa".