Nível de hype: PesquisaOrigem: EUA
Anthropic acha "espaço oculto" em que o Claude elabora conceitos
A Anthropic criou uma ferramenta chamada Jacobian lens (J-lens) e, com ela, encontrou uma área oculta, que chamou de J-space, dentro do Claude Opus 4.6, onde o modelo trabalha conceitos ao responder perguntas ou executar tarefas.
Segundo a MIT Technology Review, é a visão mais clara até agora do que acontece dentro de um modelo de linguagem. O que os pesquisadores encontraram vai do banal ao inquietante.
Pesquisa
Resultado de pesquisa publicado.
Critério: Paper, demo ou resultado verificável, sem produto.
Fontes originais
Resumo escrito com palavras próprias a partir destas fontes. Nenhum trecho é reproduzido.
O que muda pra você
- Dev
- Técnicas de interpretabilidade podem ajudar a auditar o raciocínio dos modelos.
- PM
- Sem efeito direto no produto.
- Executivo
- Entender o que acontece dentro dos modelos ajuda a governar seu uso.
- Investidor
- Interpretabilidade é diferencial de segurança da Anthropic.
- Educador
- Discuta por que é difícil entender o que uma IA "pensa".