Nível de hype: PesquisaOrigem: EUA
Google testa avaliações de IA duplo-cegas
O Google DeepMind testou o que chama de primeiras avaliações de IA duplo-cegas do mundo, usando ambientes criptograficamente seguros para aumentar a confiança em benchmarks de modelos proprietários.
O objetivo é evitar a contaminação de benchmarks, quando o modelo já viu as questões do teste, o que torna o resultado sem sentido. No sistema, nem o modelo vê as questões antes, nem os avaliadores veem o modelo.
Pesquisa
Piloto de pesquisa publicado.
Critério: Paper, demo ou resultado verificável, sem produto.
Fontes originais
Resumo escrito com palavras próprias a partir destas fontes. Nenhum trecho é reproduzido.
O que muda pra você
- Dev
- Resultados de benchmarks públicos podem estar inflados por contaminação.
- PM
- Não escolha modelo só por placares públicos; teste no seu caso.
- Executivo
- Avaliações mais confiáveis ajudam a comparar fornecedores.
- Investidor
- Métodos de avaliação independentes podem mudar a percepção sobre os líderes.
- Educador
- Explique o que é contaminação de benchmarks.