
Oxford deixou a OpenAI usar textos da Biblioteca Bodleiana para treinar modelos
26 set, 08:00Nível de hype: AnúncioOrigem: Europa
Atas obtidas pelo Guardian via lei de acesso à informação mostram que textos históricos da Biblioteca Bodleiana, digitalizados com software da OpenAI numa parceria anunciada em março de 2025, foram usados para alimentar a base de treino da empresa. Até junho de 2025, 125 mil imagens de teses dos séculos 19 e 20 tinham sido compartilhadas; outros itens incluem 10 mil baladas impressas do século 16. As atas registram preocupação de funcionários com o risco de reputação e com o impacto ambiental.
A universidade diz que o volume é modesto, que só entra material sem direitos autorais, que a Bodleian mantém os direitos das digitalizações e vai publicá-las abertamente em meses, e que a equipe foi clara sobre o uso para treino. Oxford é o único membro britânico do NextGenAI, projeto da OpenAI com bibliotecas como MIT, Caltech e Universidade de Michigan. O acervo total da Bodleian tem 23 milhões de itens; não há confirmação de que tudo será digitalizado.
O que muda pra você
- Dev
- Dados históricos em domínio público viram insumo disputado; verifique licenças ao montar bases de treino.
- PM
- Parcerias de dados precisam dizer com clareza se o material vai para treino, ou geram crise de confiança depois.
- Executivo
- Instituições com acervos devem negociar direitos, transparência e contrapartidas antes de ceder dados a empresas de IA.
- Investidor
- Acordos com bibliotecas mostram a busca por dados novos e o custo crescente de conseguir material de qualidade.
- Educador
- Universidades devem informar alunos e pesquisadores quando o acervo é usado para treinar IA comercial.