O MentalHealthBench avalia se respostas são úteis e seguras em conversas realistas.
Ler o próximo fato

Instituto britânico de segurança de IA e EvalEval tornam benchmarks reproduzíveis
21 de setembro de 2026Nível de hype: PesquisaOrigem: Europa
O instituto britânico de segurança de IA (AI Security Institute) passou a usar a infraestrutura da EvalEval Coalition para compartilhar abertamente resultados de avaliações de modelos, com o objetivo de tornar a ciência de avaliação mais reproduzível e verificável.
As duas organizações colaboram desde um workshop conjunto na NeurIPS 2025, e o retorno do instituto ajudou a definir o formato Every Eval Ever (EEE), um padrão para registrar resultados. Segundo a EvalEval, hoje os resultados aparecem em muitos formatos e canais, quase sempre sem informação suficiente para serem repetidos, e rodar as avaliações de novo pode ser caro demais.
O que muda pra você
- Dev
- Registrar avaliações num formato comum facilita comparar modelos sem refazer testes caros.
- PM
- Resultados reproduzíveis ajudam a escolher modelos com base em evidência, não em marketing.
Ver para outros perfis (Executivo, Investidor, Educador)
- Executivo
- Governos começam a publicar avaliações de modelos em formato aberto.
- Investidor
- Padrões abertos de avaliação reduzem a vantagem de benchmarks proprietários.
- Educador
- Exemplo de reprodutibilidade científica aplicada à IA.
Reportar um erro
Destaques de hoje no Sinal.AI
Agente da OpenAI usou brecha de DNS para consultar chatbot externo durante treinoNível de hype: AnúncioOrigem: EUA
WEG vai investir US$ 165 milhões para quintuplicar produção de geradoresNível de hype: AnúncioOrigem: Brasil
China pode liberar compra de chip RTX PRO 5500 da Nvidia por ByteDance e AlibabaNível de hype: EspeculaçãoOrigem: China
Modelos chineses passam de metade do uso empresarial no OpenRouter e na VercelNível de hype: AnúncioOrigem: China