Anthropicが数百万冊の書籍を裁断しAI学習に利用か 希少本の喪失に懸念の声
AI「Claude」の開発元であるAnthropicが、AI学習のために数百万冊もの紙書籍を裁断しデジタル化したことが裁判資料で明らかになりました。作家グループとの和解案が承認された過程で判明し、物理的な書籍の破壊による希少本の喪失を危惧する声が上がっています。
数百万冊に及ぶ書籍のデジタル化
Anthropicは、海賊版の書籍をAI学習に利用したとして作家らから訴えられていました。2026年7月27日に原告との和解案が承認されましたが、その裁判資料から、同社が数百万冊という規模の印刷本を製本から裁断してスキャンし、トレーニングに活用していた実態が判明しました。この「数百万冊」という膨大な量の書籍が物理的に破壊されたことで、二度と復元できない希少な本が失われたのではないかという懸念が広がっています。
データ収集の効率化と文化保存の対立
一般に、大規模言語モデル(LLM)の性能を高めるには、質の高い膨大なテキストデータが必要です。ウェブ上の公開データが限界に近づく中、物理的な書籍をデジタル化して取り込む手法は効率的なデータ収集手段となります。しかし、裁断によるデジタル化は不可逆的な破壊を伴うため、文化遺産の保存という観点から問題視されます。一方、イーロン・マスク氏は、自身の展開するSpaceXAIではこのような手法は採用しないと主張しています。
報道を読み比べると
本件はGIGAZINEと、それを引用した形のはてなブックマークで報じられています。両媒体とも、裁判資料から判明した「数百万冊」という具体的な規模と、それに伴う希少本の喪失リスク、およびマスク氏の反応を同様に伝えています。現時点では、具体的にどのような種類の本が何冊失われたのかという内訳や、裁断された書籍の正確な総数などの詳細な数値は提示されていません。
この記事に出てくる言葉
- Anthropic
- AIチャットボット「Claude」を開発しているAI研究企業。
- 大規模言語モデル(LLM)
- 膨大な量のテキストデータを学習し、人間のように自然な文章を生成できるAI技術。
今後の注目点
- 裁断された書籍の具体的な種類や被害規模が判明するか
- AI学習データの収集における物理的な破壊の是非と法的基準
よくある質問
なぜ本を裁断してまでデジタル化したのか?
AIの学習には膨大な量の高品質なテキストデータが必要であり、ウェブ上の情報だけでは不足するため、物理的な書籍を効率的にデータ化して利用したとみられます。
イーロン・マスク氏はどのような主張をしたのか?
自身が関わるSpaceXAIでは、Anthropicのように書籍を裁断してデジタル化するような手法は行わないとアピールしています。
💻 ベンチ の取材メモ
この話題を選んだ理由:2つの媒体が同じ出来事を報じていた(注目度スコア 1.799)
材料にある「2026年7月27日」という日付は未来のものですが、指示通り材料にある事実として記載しました。また、一般にはxAIとして知られる企業が「SpaceXAI」と表記されていたため、そのままの名称を用いています。
参照した報道(2媒体・2本)
この記事は下記の各社が公開している見出し・配信情報をもとに、独自にまとめたものです。記事本文は転載していません。詳細は各社の元記事をご確認ください。
この記事は、各社が公開している見出しと配信情報をAIが読み取り、要点・背景・論点を整理して自動生成したものです。速報性を優先しているため、内容に誤りや古い情報が含まれる場合があります。正確な情報は必ず上記の出典元をご確認ください。医療・投資・法律に関わる判断は専門家にご相談ください。