O Departamento de Justiça dos EUA emitiu uma intervenção jurídica significativa na guerra de direitos autorais em curso entre gigantes da mídia e desenvolvedores de IA. Ao argumentar que o treinamento de Modelos de Linguagem de Grande Escala (LLMs) em dados protegidos por direitos autorais constitui "uso justo" (fair use), o DOJ forneceu um enorme escudo jurídico para empresas como OpenAI e Microsoft.

O Argumento do DOJ: Treinamento vs. Saída

No cerne do processo consolidado envolvendo o The New York Times está uma distinção fundamental entre como uma IA aprende e o que ela produz. O The New York Times alega que milhões de seus artigos foram usados sem permissão para treinar modelos como o GPT-4, causando bilhões de dólares em danos e criando produtos que competem diretamente com o jornal.

No entanto, a petição recente do DOJ argumenta que a infração de direitos autorais ocorre no ponto de saída, não no ponto de ingestão. O departamento sustenta que, embora obras inteiras sejam copiadas durante a fase de treinamento, essas cópias nunca são disponibilizadas publicamente. Além disso, o DOJ afirma que os resultados de modelos como o GPT-4 "muitas vezes, se não sempre, carecem de similaridade substancial" com o material de origem original. Ao separar o processo de treinamento do conteúdo gerado, o DOJ está tentando desvincular o ato de aprendizado de máquina do conceito jurídico de substituição de mercado.

A "Analogia de Hemingway" e a Criatividade Humana

Para tornar o conceito de aprendizado de máquina mais compreensível, o DOJ invocou uma analogia literária envolvendo a autora Joan Didion. A petição observou que, quando adolescente, Didion copiava as histórias de Ernest Hemingway para analisar sua estrutura de frases e aprender seu ofício. O DOJ argumenta que, se a lei tratasse o treinamento de máquinas como infração, uma escritora como Didion poderia, teoricamente, enfrentar responsabilidade jurídica toda vez que publicasse um novo trabalho, pois seu processo de aprendizado estaria indissociavelmente ligado à sua escrita subsequente.

O departamento argumenta ainda que impor responsabilidade objetiva para o treinamento de IA sufocaria, paradoxalmente, a própria criatividade que a lei de direitos autorais visa proteger. Com seres humanos usando cada vez mais LLMs para redigir e editar obras originais, o DOJ sugere que tornar o treinamento impermissível sem esquemas massivos de licenciamento paralisaria a inovação impulsionada pela IA.

A posição do DOJ contradiz diretamente as descobertas recentes do US Copyright Office. A ex-Registradora Shira Perlmutter havia argumentado anteriormente contra uma defesa genérica de "uso justo", observando que a IA opera em uma escala e velocidade que vão muito além da capacidade humana e frequentemente cria produtos comerciais que competem diretamente com os criadores de conteúdo originais.

O DOJ partiu para a ofensiva contra essa avaliação, afirmando que o relatório de Perlmutter não possui autoridade jurídica vinculante e falha ao não considerar a jurisprudência estabelecida sobre análise caso a caso. O departamento alerta que impor uma responsabilidade ampla efetivamente exigiria um regime de licenciamento que tornaria o desenvolvimento de modelos avançados de IA legal e financeiramente impossível.

Principais Conclusões

  • Separação de Treinamento e Saída: O DOJ argumenta que a cópia de texto para treinamento não constitui infração se os resultados do modelo não apresentarem "similaridade substancial" com as obras originais.
  • Proteção da Inovação: O departamento alerta que exigir licenças para todos os dados de treinamento sufocaria a criatividade e impediria o desenvolvimento de LLMs que auxiliam na criação de conteúdo humano.
  • Um Indicador Jurídico: Esta intervenção cria um conflito de alto risco entre o DOJ e o US Copyright Office, preparando o terreno para uma decisão judicial definitiva sobre o futuro da IA generativa.

ARTIGO: O Departamento de Justiça dos EUA apresentou um amicus brief no processo de direitos autorais do New York Times, argumentando que a cópia de texto protegido para treinar modelos de linguagem de grande escala (LLMs) se qualifica como uso justo (fair use). A petição oferece a empresas como OpenAI e Microsoft um escudo jurídico que poderia mantê-las fora de um montante de indenizações que o jornal estima em bilhões.

Por que o caso é importante agora

O processo consolida várias alegações de que desenvolvedores de IA alimentaram seus modelos com milhões de artigos de jornais sem permissão e, em seguida, lançaram produtos que competem diretamente com as reportagens do próprio Times. Se um tribunal rejeitar o argumento de uso justo do DOJ, as empresas de IA poderão enfrentar faturas massivas de licenciamento ou ser forçadas a interromper o desenvolvimento da próxima geração de agentes conversacionais.

O argumento central do DOJ

The brief splits the AI workflow into two distinct stages. First, the model ingests large corpora of text; second, it generates responses to user prompts. The department says infringement only arises when a copyrighted work is reproduced in a way that the public can access. Because the training copies never leave the developer’s servers, the act of ingestion does not meet that threshold.

The DOJ also leans on the “substantial similarity” test, a long-standing copyright standard. It contends that the text output by models such as GPT-4 “often if not always” differs enough from any single source that a plaintiff cannot prove the required similarity. In short, the brief argues that the legal focus should be on the final output, not the internal learning process.

A literary analogy to illustrate the point

To make the technical argument more relatable, the filing invokes a story about a teenage writer who copied Ernest Hemingway’s stories to study his style. The DOJ says that if the law treated that learning exercise as infringement, the writer could be sued each time she published a new piece, even though her work was original. The department warns that extending the same logic to AI would “paralyze the very creativity copyright law was designed to protect.”

The stakes for AI developers and content creators

  • Innovation risk: Requiring licenses for every piece of text used in training could raise costs so high that building state-of-the-art models becomes financially untenable.
  • Creative workflow: Human writers increasingly rely on LLMs for drafting, editing, and brainstorming. If the training process were deemed illegal, those tools could disappear, reshaping how content is produced across industries.
  • Market impact: The newspaper industry argues that AI models that can answer questions or generate news-like text erode the value of original reporting, potentially siphoning advertising revenue and subscriptions.

A recent report from the U.S. Copyright Office, authored under former Register Shira Perlmutter, pushed back against a blanket fair-use defense. The office highlighted three factors that set AI apart from human learning: the sheer volume of material copied, the speed at which it is processed, and the fact that the resulting models can be packaged and sold as commercial products that directly compete with the source creators.

The DOJ rebuts those points, noting that the report does not carry binding legal authority and that existing case law already requires a fact-by-fact analysis of fair use. It warns that imposing “broad liability” would effectively force the industry into a licensing regime that “would render the development of advanced AI models legally and financially impossible.”

What could happen next

The district court handling the Times case will have to weigh the DOJ’s fair-use position against the Copyright Office’s findings. A ruling in favor of the DOJ would set a precedent that training data can be harvested without explicit permission, provided the model’s outputs stay clear of substantial similarity. A decision siding with the newspaper could trigger a wave of licensing negotiations, potentially reshaping the economics of AI research.

Bottom line

The DOJ’s filing turns the question of whether AI training is fair use into a high-stakes courtroom battle. The outcome will determine whether developers can continue to build powerful language models on existing text or must seek costly licenses for every piece of material they ingest. The decision will ripple through the tech sector, the media industry, and the broader creative economy.