全国のオンライン古書店で書籍の不審な買い占めが相次ぎ、背景にAI開発企業による機械学習用データの収集疑惑が浮上しています。1日に100冊以上が買われ売上が5倍に跳ね上がる店舗が出る一方、米国向けに日本の書籍が計50トン以上も輸出されていた記録が判明し、文化財産流出の観点から業界に強い衝撃が走っています。
この不可解な買い占めが急速に拡大した理由は、高性能な生成AIモデルの構築において、校閲を経た信頼性の高い日本語テキストが極端に不足しているためです。ウェブ上のノイズ混じりなデータよりも、紙の出版物は文法や論理構造が極めて正確であり、大規模言語モデルの知能向上を狙う海外テック企業の格好の標的となっています。

実際の現場取材では、哲学や医学、法律などジャンルを問わず無差別に注文され、配送先がいずれも岡山県の物流拠点に集約されている実態が判明しました。過去には米アンソロピック社が世界中の書籍を裁断・スキャンしてデータ化を進めた計画や、アマゾンのスキャン廃棄実態も報じられており、今回も書籍がスキャン後に廃棄される懸念が拭えません。
古書店の在庫が潤い一時的な利益を生む半面、紙の書籍がデータ吸い上げの道具として消費・廃棄される現状は看過できません。早急に知的財産保護や利益還元のルールを整えなければ、貴重な日本の知の蓄積が海外テックの糧として失われかねず、技術と文化継承の共存へ向けた国際的な議論が不可欠です。
ネット上の声5選
- 本が売れるのは店にとってありがたいはずなのに、スキャン後に廃棄されているかもと思うと心が痛む。
- ウェブのテキストだけでは学習データが足りず、ついに紙の書籍まで物理的に買い集め始めたのか。
- 送り先が特定の物流センターに集約されている点が組織的で、いかにも巨大テック企業の手法という印象。
- 法律や医学など専門書が大量に海外へ流出してしまうと、日本の文化的な資産が失われる危機感を覚える。
- 著作権や著作者への対価還元が置き去りのまま、力技でデータ化が進められる現状には法規制が必要だ。
(※引用ではなく、Web上で目立った論調・感想をまとめたものです)
AIの学習目的 の豆知識5選
- 人工知能の学習において紙の出版物は極めて重宝されます。ネット上のテキストに比べて誤字脱字が少なく、校閲・編集を経て論理構成が整っているため、モデルのハルシネーション(もっともらしい嘘)を抑制し推論精度を飛躍的に高める高品質データとして扱われます。
- ウェブ上のテキストデータを巡る著作権訴訟やアクセス遮断が世界中で急増した結果、各開発企業は合法的に入手できる物理的な紙書籍へ目を向けています。中古市場で正規購入して自社内で裁断・スキャンする手法は、ネット巡回規制を回避する迂回策となっています。
- 英語圏のデータに比べて日本語の学術書や専門書はネット上に流通している絶対量が少ないため、日本語特化モデルの開発では激しいデータ争奪戦が起きています。自然な語彙力や日本固有の文脈理解を獲得させるため、紙の古書が格好の学習資源として狙われます。
- 近年の大規模言語モデルは、一般的な日常会話だけでなく医療や法律、哲学といった高度な専門知識の網羅を競い合っています。これらの専門知識は絶版本や学術書の紙媒体にしか存在しないケースが多く、無差別とも思える幅広いジャンルの買い占めにつながっています。
- 一部のAI開発企業はスキャン代行業者などを通じ、書籍の背表紙を断裁して高速スキャナーで一気にOCR処理し、即座に破棄する工業的プロセスを導入しています。デジタル化の手間を最小限に抑え、テラバイト級の言語コーパスを短期間で構築する目的があります。


