Nível de hype: PesquisaOrigem: EUA
OpenAI mostra o GPT-Red, hacker automático para testar seus modelos
A OpenAI apresentou o GPT-Red, sistema automatizado de "red team" que ataca os próprios modelos da empresa em autojogo, para melhorar segurança, alinhamento e resistência à injeção de comandos.
Segundo a MIT Technology Review, treinar o GPT-5.6 contra o GPT-Red fez dele o lançamento mais robusto da OpenAI até agora. As fontes completas não puderam ser lidas.
Pesquisa
Sistema de pesquisa divulgado pela empresa.
Critério: Paper, demo ou resultado verificável, sem produto.
Fontes originais
- OpenAI NewsFonte primária · original em inglês(abre em nova aba)
- MIT Technology Review · IAoriginal em inglês(abre em nova aba)
Resumo escrito com palavras próprias a partir destas fontes. Nenhum trecho é reproduzido.
O que muda pra você
- Dev
- Modelos treinados contra atacantes automáticos resistem melhor a injeção de comandos.
- PM
- Sem efeito direto no produto.
- Executivo
- Testes de segurança automatizados viram parte do treino dos modelos.
- Investidor
- Sem efeito direto para investidores.
- Educador
- Explique o que é um "red team".