O benchmark roda agentes em sessões MCP isoladas e avalia os registros que eles deixam, não só o texto das respostas.
Ler o próximo fato

Estudo da Aleph Alpha diz que modelos chineses repetem a linha oficial em temas sensíveis
4 de outubro de 2026Nível de hype: PesquisaOrigem: Europa
A Aleph Alpha, empresa alemã que vende "IA soberana" a governos, aplicou um teste próprio com 967 temas tabu, como Tiananmen, Taiwan e Xinjiang, a modelos da Alibaba (Qwen), da DeepSeek e da Moonshot AI (Kimi). Pelo sistema de avaliação da própria empresa, entre 17% e 41% das respostas foram equilibradas; as demais repetiram a posição oficial, desviaram do assunto ou recusaram responder, segundo o The Decoder.
O estudo também relata que o viés aparece em perguntas que não citam a China: ao responder sobre censura nos EUA, o Qwen 3.6 fecha com uma defesa da posição chinesa sobre governança da internet. O The Decoder lembra que a Aleph Alpha tem interesse comercial em se diferenciar dos concorrentes chineses e que a conclusão é coerente com a exigência de "valores centrais socialistas" na regulação chinesa de IA. As empresas chinesas citadas não aparecem comentando o estudo no texto lido, e a metodologia não foi verificada por terceiros.
O que muda pra você
- Dev
- Ao escolher um modelo chinês para produtos que tratam de temas políticos, teste as respostas por conta própria em vez de confiar em um benchmark de terceiros.
- PM
- Revise como seu produto lida com perguntas sensíveis quando o modelo de base vem de fornecedor sujeito a regras de conteúdo.
Ver para outros perfis (Executivo, Investidor, Educador)
- Executivo
- A origem do modelo pode afetar as respostas sobre temas políticos; inclua isso na avaliação de fornecedores.
- Investidor
- Trate o estudo como evidência de uma parte com interesse comercial no tema, não como medida neutra do mercado.
- Educador
- Bom caso para discutir como benchmarks são feitos e quem os financia.
Reportar um erro
Destaques de hoje no Sinal.AI
Amazon diz que deixou de usar NDAs com órgãos públicos para aprovar data centersNível de hype: AnúncioOrigem: EUA
CGI.br diz que deepfakes viraram principal ameaça digital às eleições no BrasilNível de hype: EspeculaçãoOrigem: Brasil
Responsável por relatórios de segurança deixa a OpenAI e diz que a cultura é "quebrada"Nível de hype: AnúncioOrigem: EUA
Estudo do InternetLab vê deslegitimação eleitoral em 25% das conversas com o GeminiNível de hype: PesquisaOrigem: Brasil
