News27 JulhoEmpresas de IA estão comprando e triturando livros raros para treinar modelos
Edição #165·27 de julho de 2026·2 min

📚Empresas de IA estão comprando e triturando livros raros para treinar modelos

Empresas de IA estão comprando livros raros em larga escala, passando por máquinas de alta velocidade que cortam a lombada, escaneiam o conteúdo e depois trituram o original. Um serviço chamado ISBNdb facilita pedidos de até um milhão de livros e mantém os compradores no anonimato. Livros publicados antes de 2022 são considerados premium porque não contêm texto gerado por IA. Um juiz federal americano considerou a prática legal sob a doutrina de "uso justo", porque destruir o original significa que só uma cópia existe de cada vez. --- O que torna isso diferente de outras polêmicas de dados de treinamento é a irreversibilidade. Você pode recolocar um site no ar. Pode reimprimir um best-seller. Mas não dá para substituir as últimas três cópias de um texto botânico do século 18 depois que alguém as triturou. Um vendedor de livros relatou ao site 404 Media que obras com quase nenhuma cópia sobrevivente estão entrando nesse funil. A Anthropic, inclusive, contratou o ex-chefe de parcerias do Google Books para obter, segundo reportagens, "todos os livros do mundo". --- O site do ISBNdb literalmente diz que "'empresa de IA destrói dois milhões de livros' não é uma manchete que gera simpatia" e mesmo assim construiu um negócio inteiro em torno de fazer isso discretamente. Oferecem contratos de confidencialidade como funcionalidade e orientam clientes a chamar o processo de "preservação digital". Difícil inventar algo assim.

Empresas de IA estão comprando e triturando livros raros para treinar modelos

A prática que está extinguindo livros raros para treinar IA

Empresas de inteligência artificial estão comprando livros raros em larga escala, destruindo os originais após escaneá-los para alimentar modelos de linguagem. Um serviço chamado ISBNdb facilita pedidos de até um milhão de títulos e mantém os compradores no anonimato. A prática foi considerada legal por um juiz federal americano sob a doutrina de "uso justo".

O mecanismo por trás da destruição

O processo funciona com máquinas de alta velocidade que cortam a lombada dos livros, escaneiam o conteúdo e depois trituram o original. O site ISBNdb oferece contratos de confidencialidade como funcionalidade e orienta clientes a chamar o processo de "preservação digital" — uma tentativa de suavizar a natureza irreversível da operação.

A empresa reconhece o problema de imagem: o próprio site afirma que "'empresa de IA destrói dois milhões de livros' não é uma Manchete que gera simpatia", mas mesmo assim construiu um negócio em torno da prática.

Por que livros publicados antes de 2022 são premium

Livros anteriores a 2022 são considerados valiosos para treinamento de IA porque não contêm texto gerado por inteligência artificial. Com a proliferação de conteúdo sintético na internet, fontes genuínas de linguagem humana escrita tornam-se escassas e cada vez mais difíceis de obter.

O problema central é a irreversibilidade. Diferente de sites que podem ser recolocados no ar ou best-sellers que podem ser reimpressos, obras com poucas cópias sobreviventes — como textos botânicos do século 18 — desaparecem permanentemente após a trituração. Vendedores de livros relatam que obras com quase nenhuma cópia restante estão entrando nesse funil.

O aspecto legal e a corrida corporativa

Um juiz federal americano decidiu que a prática se enquadra no "uso justo" (fair use), argumentando que destruir o original significa que apenas uma cópia existe de cada vez. A Anthropic contratou o ex-chefe de parcerias do Google Books com o objetivo declarado de obter, segundo reportagens, "todos os livros do mundo".

O que isso significa para devs e builders brasileiros

Para desenvolvedores e empresas que construem soluções com IA no Brasil, este caso levanta questões práticas:

  • **Qualidade de dados**: A escassez de dados humanos genuínos pode pushar a indústria para práticas cada vez mais agressivas de coleta, afetando a qualidade dos modelos disponíveis no mercado.
  • **Custos de licenciamento**: À medida que livros físicos se tornam matéria-prima escassa, o custo de obter dados licenciados para treinamento tende a aumentar.
  • **Reputação e compliance**: O uso de dados obtidos de forma questionável pode expor empresas a riscos reputacionais e legais, especialmente se legislações de proteção de dados evoluírem para cobrir esse tipo de prática.

A ironia é que livros que sobreviveram a guerras, incêndios e séculos de manuseio estão sendo destruídos para que uma IA aprenda a escrever um e-mail de marketing melhor.

livrospráticadadosempresasestãousocadavezobterraros

Mais da mesma edição

@HedgieMarkets

🏗️Nvidia pode bancar US$ 250 bilhões para a OpenAI ter seu mega data center

Segundo o Wall Street Journal, a Nvidia está em negociações para garantir cerca de US$ 250 bilhões em dívida, permitindo que a OpenAI alugue um data center gigantesco em Ohio. Na prática, a Nvidia não desembolsa nada agora: ela só promete aos credores que, se a OpenAI não pagar, ela cobre. Isso transforma empréstimos que ninguém queria aprovar em dinheiro barato. E a OpenAI usa esse dinheiro para alugar poder computacional de um site cheio de chips da própria Nvidia. Nada foi assinado ainda. --- A análise do perfil Hedgie Markets coloca uma lente histórica interessante. Nos anos 1990, a Lucent emprestava dinheiro para startups de telecom comprarem equipamentos da própria Lucent. A receita parecia incrível até os clientes quebrarem e levarem a Lucent junto. O programa inteiro da Lucent girava em torno de US$ 8 bilhões. A Nvidia está falando de trinta vezes mais, para um único cliente. --- O ponto mais delicado: a OpenAI fatura cerca de US$ 25 bilhões por ano, mas espera queimar US$ 27 bilhões em caixa em 2025. Os credores viram esses números e não quiseram financiar o projeto sem alguém mais rico por trás. Se a OpenAI crescer o suficiente, tudo bem. Se não crescer, a Nvidia fica com o problema. E como a Nvidia é a ação de maior peso no S&P 500, o problema respinga em qualquer fundo de aposentadoria americano.

@hsu_steve

🧮Terry Tao diz que a matemática está entrando em crise de fundamentos por causa da IA

Terry Tao, considerado por muitos o maior matemático vivo, apresentou no Congresso Internacional de Matemáticos 2026 uma palestra com um recado direto: "Acredito que estamos entrando em uma crise nos fundamentos dos valores e práticas matemáticas". A preocupação dele é com o que acontece quando a IA passa a resolver problemas de fronteira na matemática. --- Segundo Steve Hsu, que compartilhou a palestra, Tao está adotando uma visão centrada no ser humano. Na definição dele, "matemática" é uma atividade humana, então parte do trabalho deveria ser garantir que teoremas importantes se tornem canônicos na comunidade, sejam amplamente compreendidos e ensinados a estudantes. Isso pode ter pouca relação com a fronteira da matemática praticada por IAs no futuro. É uma pergunta filosófica real: se uma IA prova um teorema que nenhum humano consegue entender, aquilo ainda é matemática?

@artificialguybr

🎙️ChatGPT dubla vídeo em tempo real usando o modo de voz

O desenvolvedor brasileiro conhecido como artificialguybr descobriu um uso bem criativo do modo de voz do ChatGPT: dublar vídeos em tempo real. Ele instruiu a IA a traduzir tudo o que ouve e nunca falar por conta própria. Depois, tocou uma entrevista em espanhol pelo microfone e o ChatGPT foi dublando para inglês em tempo real, acompanhando o ritmo da fala. --- O truque foi rotear o áudio do Mac direto para o ChatGPT, já que não existe API oficial para esse recurso ainda. É um daqueles usos que ninguém planejou, mas que mostra o potencial prático da coisa. Imagine assistir uma palestra em qualquer idioma com tradução simultânea feita pela IA, direto no seu computador, sem pagar por serviço nenhum.

Receba no seu email

Todo dia, grátis pra sempre.

Assinar newsletter