Foto: rawpixel, domínio público
IA, direitos autorais e imprensa(ver a linha do tempo)

Oxford deixou a OpenAI usar textos da Biblioteca Bodleiana para treinar modelos

26 set, 08:00Nível de hype: AnúncioOrigem: Europa

Atas obtidas pelo Guardian via lei de acesso à informação mostram que textos históricos da Biblioteca Bodleiana, digitalizados com software da OpenAI numa parceria anunciada em março de 2025, foram usados para alimentar a base de treino da empresa. Até junho de 2025, 125 mil imagens de teses dos séculos 19 e 20 tinham sido compartilhadas; outros itens incluem 10 mil baladas impressas do século 16. As atas registram preocupação de funcionários com o risco de reputação e com o impacto ambiental.

A universidade diz que o volume é modesto, que só entra material sem direitos autorais, que a Bodleian mantém os direitos das digitalizações e vai publicá-las abertamente em meses, e que a equipe foi clara sobre o uso para treino. Oxford é o único membro britânico do NextGenAI, projeto da OpenAI com bibliotecas como MIT, Caltech e Universidade de Michigan. O acervo total da Bodleian tem 23 milhões de itens; não há confirmação de que tudo será digitalizado.

O que muda pra você

Dev
Dados históricos em domínio público viram insumo disputado; verifique licenças ao montar bases de treino.
PM
Parcerias de dados precisam dizer com clareza se o material vai para treino, ou geram crise de confiança depois.
Executivo
Instituições com acervos devem negociar direitos, transparência e contrapartidas antes de ceder dados a empresas de IA.
Investidor
Acordos com bibliotecas mostram a busca por dados novos e o custo crescente de conseguir material de qualidade.
Educador
Universidades devem informar alunos e pesquisadores quando o acervo é usado para treinar IA comercial.