← História: Segurança e alinhamento de modelos
Nível de hype: PesquisaOrigem: EUA

Google testa avaliações de IA duplo-cegas

O Google DeepMind testou o que chama de primeiras avaliações de IA duplo-cegas do mundo, usando ambientes criptograficamente seguros para aumentar a confiança em benchmarks de modelos proprietários.

O objetivo é evitar a contaminação de benchmarks, quando o modelo já viu as questões do teste, o que torna o resultado sem sentido. No sistema, nem o modelo vê as questões antes, nem os avaliadores veem o modelo.

Termômetro de hype

Pesquisa

Piloto de pesquisa publicado.

Critério: Paper, demo ou resultado verificável, sem produto.

Fontes originais

Resumo escrito com palavras próprias a partir destas fontes. Nenhum trecho é reproduzido.

O que muda pra você

Dev
Resultados de benchmarks públicos podem estar inflados por contaminação.
PM
Não escolha modelo só por placares públicos; teste no seu caso.
Executivo
Avaliações mais confiáveis ajudam a comparar fornecedores.
Investidor
Métodos de avaliação independentes podem mudar a percepção sobre os líderes.
Educador
Explique o que é contaminação de benchmarks.