Em resumo

  • Hachette Book Group e Cengage Group solicitaram a um tribunal federal da Califórnia, na quinta-feira, que intervenha em uma ação coletiva acusando o Google de violação de direitos autorais no treinamento de IA.
  • As editoras alegam que o Google baixou seus livros de sites piratas, incluindo Z-Library e OceanofPDF, e depois os copiou repetidamente enquanto treinava seus modelos.
  • O conjunto de dados de treinamento C4 do Google supostamente extrai informações de pelo menos 28 sites ligados à pirataria, com o símbolo de direitos autorais aparecendo mais de 200 milhões de vezes.

Grandes editoras de livros, como Hachette Book Group e Cengage Group, entraram com uma petição na quinta-feira para intervir em uma ação coletiva já existente movida no ano passado contra o Google, acusando o gigante da tecnologia de orquestrar uma “violação histórica de direitos autorais” para construir sua plataforma Gemini.

A denúncia apresentada no tribunal federal da Califórnia alega que o Google "escolheu roubar um enorme acervo de conteúdo dos Autores e do Grupo para treinar seu modelo de IA", ao invés de obter as licenças apropriadas, engajando-se numa infração deliberada "em todas as etapas" do desenvolvimento.

O caso consolidado foi originalmente movido em 2023 por autores individuais como uma proposta de ação coletiva de direitos autorais acusando o Google de copiar livros para treinar seus modelos de IA generativa.

As editoras afirmam que o Google baixou livros de sites piratas e depois os copiou repetidamente durante o processo de treinamento de IA, primeiro para a memória do computador, depois em formatos que os sistemas de IA poderiam ler e novamente em conjuntos de treinamento para cada nova versão do modelo.

O processo alega que o conjunto de dados de treinamento C4 do Google contém obras protegidas por direitos autorais extraídas do Z-Library, uma coleção pirata da qual as autoridades apreenderam mais de 350 sites e domínios.

As editoras destacaram como livros foram copiados do b-ok.org, um domínio do Z-Library que agora exibe um aviso de apreensão federal, além de OceanofPDF e WeLib, "outro site prolífico com acesso a quantidades enormes de conteúdo protegido não autorizado."

O conjunto de dados C4 contém obras de pelo menos 28 sites identificados pelo governo dos EUA como mercados de pirataria e falsificações, observa a denúncia.

"O símbolo de direitos autorais (©) aparece mais de 200 milhões de vezes no conjunto de dados C4", diz a denúncia, observando que o Google supostamente excluiu "avisos de política" e "termos de uso", mas incluiu "vastas categorias de obras protegidas, obras pirateadas e obras retiradas de paywalls".

As editoras alegam que o Google copiou obras de bibliotecas baseadas em assinatura como a Scribd.com, contornando acordos legítimos de licenciamento.

Quando confrontado sobre essa prática, o provedor de conjuntos de dados sem fins lucrativos Common Crawl supostamente respondeu com "uma mentalidade de culpar a vítima, proclamando 'Você não deveria ter colocado seu conteúdo na internet se não quisesse que ele estivesse na internet.'"

O processo alega que o Gemini agora produz resultados que "substituem as obras protegidas", incluindo reproduções literais, resumos detalhados e "cópias que imitam elementos criativos das obras originais".

Decrypt
entrou em contato com o Google e com os advogados das editoras.

IA e editoras

O Google está simultaneamente se defendendo de reivindicações antitruste da Penske Media Corporation sobre seu recurso AI Overviews, com o gigante da tecnologia alegando que exibir resumos gerados por IA constitui "melhoria legal do produto em vez de comportamento anticompetitivo".

As editoras buscam indenizações legais, liminares para interromper novas infrações e uma ordem exigindo que o Google destrua todas as cópias não autorizadas de suas obras e divulgue quais livros foram usados para treinar o Gemini.

A moção para intervir segue uma série de processos de direitos autorais movidos por autores contra empresas de IA em 2023, com juízes federais concedendo vitórias parciais à Meta e Anthropic, decidindo que o uso de livros protegidos por direitos autorais para treinar seus modelos constituía uso justo segundo a lei de direitos autorais, mas criticaram as empresas por manterem bibliotecas permanentes de livros pirateados.