← História: Segurança e alinhamento de modelos
Nível de hype: AnúncioOrigem: EUA

Anthropic e OpenAI querem avaliadores de segurança dentro dos laboratórios

Num longo ensaio publicado no fim de semana, o CEO da Anthropic, Dario Amodei, propôs colocar avaliadores independentes dentro de todos os laboratórios de IA de ponta, com poder para relatar incidentes de segurança, avaliar se os modelos estão de fato alinhados e divulgar suas conclusões sem filtro. Segundo o TechCrunch, a indústria teria rejeitado a ideia de imediato há um ano.

Amodei disse que a Anthropic daria a avaliadores como METR e Redwood Research um acesso inédito aos seus sistemas, e o CEO da OpenAI, Sam Altman, disse que a empresa também aceitaria. Pesquisadores ouvidos pela reportagem consideram o acesso inédito, mas questionam se os avaliadores terão independência real, já que regras, financiamento e escopo ainda não estão definidos.

Termômetro de hype

Anúncio

Proposta e compromisso público, sem regras nem implementação definidas.

Critério: Promessa oficial com data ou escopo, sem acesso público.

Fontes originais

Resumo escrito com palavras próprias a partir destas fontes. Nenhum trecho é reproduzido.

O que muda pra você

Dev
Avaliações externas podem trazer novos requisitos de registro e auditoria nos sistemas dos laboratórios.
PM
Relatórios independentes de segurança podem virar critério na escolha de fornecedor de modelo.
Executivo
Os grandes laboratórios aceitam fiscalização externa; acompanhe quanta independência ela terá.
Investidor
A autorregulação ganha forma, o que pode adiar ou moldar regras governamentais.
Educador
Discuta o que torna um avaliador independente de fato.