Instituto britânico de segurança de IA e EvalEval tornam benchmarks reproduzíveis
O instituto britânico de segurança de IA (AI Security Institute) passou a usar a infraestrutura da EvalEval Coalition para compartilhar abertamente resultados de avaliações de modelos, com o objetivo de tornar a ciência de avaliação mais reproduzível e verificável.
As duas organizações colaboram desde um workshop conjunto na NeurIPS 2025, e o retorno do instituto ajudou a definir o formato Every Eval Ever (EEE), um padrão para registrar resultados. Segundo a EvalEval, hoje os resultados aparecem em muitos formatos e canais, quase sempre sem informação suficiente para serem repetidos, e rodar as avaliações de novo pode ser caro demais.
Pesquisa
Iniciativa em uso por instituição pública, com padrão aberto publicado.
Critério: Paper, demo ou resultado verificável, sem produto.
Fontes originais
Resumo escrito com palavras próprias a partir destas fontes. Nenhum trecho é reproduzido.
O que muda pra você
- Dev
- Registrar avaliações num formato comum facilita comparar modelos sem refazer testes caros.
- PM
- Resultados reproduzíveis ajudam a escolher modelos com base em evidência, não em marketing.
- Executivo
- Governos começam a publicar avaliações de modelos em formato aberto.
- Investidor
- Padrões abertos de avaliação reduzem a vantagem de benchmarks proprietários.
- Educador
- Exemplo de reprodutibilidade científica aplicada à IA.