Inherently, Irredeemably Infringing

要旨

Bartz v. Anthropic の裁判記録から、Anthropicが700万冊を超える海賊版書籍を取得し、Claudeの開発に用いた経緯を確認する。Sunoについても、米国とドイツの訴訟記録から、YouTube音声の無断取得を確認する。そのうえで、問題のある方法で作られたAIを利用することについての当社の立場を述べる。

Anthropicによる大規模な著作権侵害行為

生成AI企業による著作権侵害をめぐる訴訟は数が多い。書籍、画像、新聞記事、音楽、ソフトウェアなど対象も広く、すべてを扱うと長くなりすぎるため、本稿ではAnthropicとSunoに限定する。Anthropicでは、Claudeの開発過程で大量の書籍が取得された経緯が Bartz v. Anthropic の裁判記録から明らかになった。Sunoでは、学習用の音声をYouTubeから取得した方法が米国の訴訟で明らかになり、ドイツでは2026年7月に著作権侵害を認める判決も出ている。

2025年6月23日、米カリフォルニア北部地区連邦地裁は Bartz v. Anthropic で、Anthropicによる書籍の取得とLLM学習について判断を示した。

命令によると、Anthropic共同創業者のBen Mannは2021年6月、Library Genesis(LibGen)から少なくとも500万冊をダウンロードした。2022年7月には、AnthropicがPirate Library Mirror(PiLiMi)から少なくとも200万冊を追加で取得した。裁判所は、Anthropicがこれらの資料が海賊版であることを認識していたと認定している。

裁判所はこの部分について、

“Anthropic thereby pirated over seven million copies of books”

Bartz v. Anthropic 命令(米カリフォルニア北部地区連邦地裁、2025年6月23日)

と記している。合計すると700万冊を超える。ファイルの中身は書籍全文であり、PDF、TXT、EPUBなどの形式で保存されていた。

Anthropicは書籍を中央ライブラリとして保存し、そこから各モデルの学習用データを盗んでいた。将来の学習に使用しないと判断した書籍も盗まれており、このライブラリを “all the books in the world” とする構想があった。

“Such piracy of otherwise available copies is inherently, irredeemably infringing”

Bartz v. Anthropic 命令(米カリフォルニア北部地区連邦地裁、2025年6月23日)

裁判所は、購入可能な書籍を海賊版として取得する行為についてこのように記した。

後から正規版を購入した場合についても、

“a book it earlier stole off the internet”

Bartz v. Anthropic 命令(米カリフォルニア北部地区連邦地裁、2025年6月23日)

という表現を用い、後日の購入によって先の取得についての責任が消えることはないとしている。

この事件はその後15億ドルの集団訴訟和解に進み、2026年7月20日に連邦裁判所が最終承認した。Reutersによると、対象となった適格作品の91%超について請求が提出されている。

ここで重要なのは、書籍がClaudeの開発にとって偶然混入したデータではなかったことである。裁判所は、Anthropicがモデル開発を進める中で、書籍の違法取得が “world-class LLM” を実現するために最も費用対効果の高い方法だと確信するようになったとも記している。
Anthropicは明確に海賊版書籍による学習について法的問題を認識していた。裁判所は、

“Anthropic became ‘not so gung ho about’ training on pirated books ‘for legal reasons.’ It kept them anyway.”

Bartz v. Anthropic 命令(米カリフォルニア北部地区連邦地裁、2025年6月23日)

と記している。

現在のClaudeの性能にはモデル設計、計算資源、その他の学習データ、事後学習など多数の要素が関係しているが、こうした大規模な著作権侵害行為がベースにある。

Sunoによる大規模な著作権侵害行為

Sunoについても、学習データの取得方法が訴訟を通じて具体的になってきた。

レコード会社各社との米国訴訟では、discoveryの過程でSunoがYouTubeから音声ファイルを取得していたことが明らかになった。2025年5月、SunoはYouTubeから音声をダウンロードし、その際にYT-DLやYT-DLPといったオープンソースのツールを使用したと回答している。

2026年8月18日、マサチューセッツ連邦地裁は、レコード会社側がこの取得についてDMCA §1201の請求を追加することを認めた。裁判所は、YouTubeのrolling cipherをYT-DLやYT-DLPで回避して録音物を取得したという原告側の主張について、少なくとも訴訟を継続できるだけの plausible な請求が成立していると判断した。実際に§1201違反が成立するかについては、技術的事実をさらに検討する必要があるとしている。

その後、2026年9月1日に提出されたSunoの答弁書には、次の記載がある。

“Suno admits that audio data was obtained from YouTube for use as training data using YT-DLP.”

Sunoの答弁書(2026年9月1日提出)

Sunoは、YT-DLPを使用してYouTubeから音声データを取得し、学習データとして使用したことを認めた。

一方、ドイツではすでに判決が出ている。2026年7月31日、ミュンヘン地方裁判所はGEMAとの訴訟で、SunoによるGEMA管理楽曲の学習、保存、再生について米国およびドイツの著作権法に反すると判断した。Sunoには侵害によって得た収益の開示と損害賠償が命じられており、Sunoは判決に異議を示している。

Sunoについては判断に迷う部分がほとんどない。大量の既存音楽を無断取得して構築されたサービスであり、現在のSunoを用いられてつくられた"作品"についても、人類の文化とは無関係なAIスロップにすぎないため、Sunoを利用する予定はない。

Claude不使用運動

Anthropicについては事情が異なる。Anthropicによる侵害行為は問題であるが、Claudeはコーディングで実際に役に立つ。「Claudeを使うと、Anthropicの犯罪を承認することになるのではないか」という問いは当然あり得る。生成AIを一切使わないという選択にも理由はある。自分の作品を許可なく取得された創作者が、その企業へ金を払いたくないと考えることも理解できる。大規模な不買運動になれば、企業の収益や事業判断へ影響を与える可能性もある。

当社は生成AI全般についてその選択は取らない。そもそも技術や研究成果の歴史を見れば、その成立過程に現在では認められない行為を含むものはAIに限らない。医学研究で長く利用されてきたHeLa細胞も、1951年にHenrietta Lacks本人の知識や同意なしに得られた組織から作られた。現在も重要な研究資源として利用されており、NIH自身がその経緯を明記している。後にその研究成果を利用することによって、当時の無同意採取が適切だったことにはならない。同じように、Anthropicを批判するためにClaudeの利用を永久に禁止する必要もないと考えている。これは都合よく著作権問題を無視しているという話でもない。そのうえで、すでに存在してしまった技術を利用するかについては別に判断している。日本では、制度や企業を批判する人に対して、その制度や製品を自分では一切利用しないことまで求める考え方が比較的出やすい。ふるさと納税の制度を廃止すべきだと考えている人が、制度の存続中は利用している場合に、「廃止を主張するなら自分も利用するな」と批判されるのと似ている。しかし、制度についてどう評価するかと、現行制度の下で個人が何を利用するかは分けて考えられる。

AIについて「使っている人には企業を批判する資格がない」という基準を採用すると、問題のある方法で作られた製品が有用になるほど、企業に有利な状態になる。利用価値が高くなるほど不使用のコストが高くなり、企業の行為を問題視する人だけがその技術から退出することになる。現在は、反AIを掲げている人がこっそり自宅や仕事でLLMを利用する場面も増えている。ただ、他人のAI利用そのものを非難しながら自分の利用だけを隠すのであれば、詐欺的なふるまいになるだろう。

当社のスタンス

当社は研究・調査・コーディング等で生成AIを利用している。一方で、生成AIが有用であることを理由に、開発企業や利用者に対する規制を緩和すべきだとも考えていない。当社のこれまでの研究は、むしろ生成AIの普及を前提として、その開発・提供・利用をどのように制度的に制御するかを扱ってきた。

The GPT-4o Shock では、特定モデルへの感情的愛着が形成される現象を実証的に扱い、後続研究では、危険な愛着形成の予防、既に形成された関係からの安全な移行、説明を含む「関係ライフサイクル・ガバナンス」へ議論を進めている。 The Supervision Paradox と Flow-by-Flow では、高損失領域において「最後は人間が確認する」という方式だけでは、AIの出力量に人間の監督能力が追いつかなくなり、監督が形骸化する危険を論じた。そのため、医療、法務、金融、重要インフラ等では、AI出力や処理量そのものを人間の監督可能な範囲に制度的に制限する必要があるという立場を取っている。残念ながら、この種の問題はすでに現実の大量死亡事件として現れてしまった。2026年2月28日の米軍によるイラン・ミナーブの小学校への攻撃では、AIの誤分析と人間監督の形骸化により、少なくとも123人の子どもを含む150人以上が殺害された。BAI研究でも、生成AI画像を自由に流通させた後で検出器に任せる方式には限界があるとしている。誤認した場合の損害が大きく、独立した裏付けが取りにくい場面ほど検証を強化し、画像単独に与える証拠価値を低くするという制度設計を提案している。

また当社は、理論研究だけでなく、AIによって実際に生じた被害の継続的な記録も行っている。AI Slop Side Effect Databaseでは、低品質なAI生成物の大量流通によって正規ユーザー、クリエイター、研究者などに生じた間接損害を収集・整理している。 AI Incident DatabaseとAI Attachment Harm Databaseと合わせ、よりよいAIガバナンスの実現へつなげることが当社の活動の一部である。

著作権についても、この基本姿勢は同じである。AI企業が高性能なモデルを作るために違法な手段で取得するのではなく、ライセンス取得、権利者への対価、取得経路の記録、侵害時の損害賠償を含め、その取得コストを企業活動の一部として負担すべきである。無断取得や海賊版取得によって先にモデルを完成させ、その製品が有用になったことを理由に取得行為まで既成事実化することを認めてはならない。

2026年現在、生成AIはパンデミックのように世界中に広がっているが、社会に深く組み込まれるほど、それがもたらす副作用も大きくなる。当社は生成AIを利用しながら、その問題を記録し、規制し、必要な領域では利用そのものを禁止する立場を取っている。