← História: Segurança e alinhamento de modelos
Nível de hype: PesquisaOrigem: EUA

OpenAI mostra o GPT-Red, hacker automático para testar seus modelos

A OpenAI apresentou o GPT-Red, sistema automatizado de "red team" que ataca os próprios modelos da empresa em autojogo, para melhorar segurança, alinhamento e resistência à injeção de comandos.

Segundo a MIT Technology Review, treinar o GPT-5.6 contra o GPT-Red fez dele o lançamento mais robusto da OpenAI até agora. As fontes completas não puderam ser lidas.

Termômetro de hype

Pesquisa

Sistema de pesquisa divulgado pela empresa.

Critério: Paper, demo ou resultado verificável, sem produto.

Fontes originais

Resumo escrito com palavras próprias a partir destas fontes. Nenhum trecho é reproduzido.

O que muda pra você

Dev
Modelos treinados contra atacantes automáticos resistem melhor a injeção de comandos.
PM
Sem efeito direto no produto.
Executivo
Testes de segurança automatizados viram parte do treino dos modelos.
Investidor
Sem efeito direto para investidores.
Educador
Explique o que é um "red team".