谷歌图书

谷歌于2004年启动的大规模图书数字化与全文检索项目,是版权纠纷与合理使用判决的标志性案例。

谷歌图书

概述

谷歌图书(Google Books)是谷歌于2004年10月推出的数字图书检索服务,是一个扫描并数字化全世界印刷图书、使全文可被检索的项目。最初以"谷歌印刷(Google Print)"之名启动,2005年更名为"谷歌图书搜索(Google Book Search)",之后固定为现在的名称。如今已有超过4000万册图书登记在数据库中,被评价为象征着人类知识普遍获取的理想与版权保护这一现实之间紧张关系的代表性案例。

主要内容

创立背景与历史

谷歌图书于2004年法兰克福书展上以拉里·佩奇和玛丽莎·梅耶尔主导的"谷歌印刷"项目首次公开。核心理念是"让搜索引擎像索引网页文档一样,也索引印刷书籍的内容"。2004年12月,宣布与哈佛大学、斯坦福大学、密歇根大学、牛津大学、纽约公共图书馆等5家机构建立合作,此后数十个国家的主要图书馆也参与其中。2010年,可对扫描的5亿多个单词进行时间序列分析的"谷歌N元语法查看器(Ngram Viewer)"公开,从而也确立了其作为语言学、历史学研究工具的地位。

两大支柱:合作伙伴计划与图书馆项目

谷歌图书由性质不同的两个项目运营。第一,合作伙伴计划(Partner Program)是出版社和作者直接登记自己的书,并设定预览范围和销售链接的方式。第二,图书馆项目(Library Project)是大规模扫描主要研究图书馆的藏书,版权已到期的书可以全文阅览,但受保护的书在检索结果中只显示简短的"片段视图(snippet view)"。这一区分是与服务法律正当性直接相关的核心设计。

检索与阅览方式

用户可以用关键词检索书籍正文,并以预览形式查看包含该段落的页面的一部分。版权已消亡的公共领域图书可以PDF、EPUB形式免费下载,正在销售的书则连接到书店、电子书商店。谷歌图书API向外部开发者开放,使他们能够制作利用书目信息的应用程序。

版权纠纷与法律判决

2005年,美国出版商协会(AAP)和作家协会(Authors Guild)以大规模扫描构成版权侵权为由提起集体诉讼。2008年,谷歌支付1.25亿美元并推动"谷歌图书搜索和解(Google Books Settlement)",但2011年法院以竞争对手担忧和权利人未被代表问题为由拒绝批准。2013年,纽约南区联邦地区法院判决片段视图属于合理使用(fair use),2015年第二联邦巡回上诉法院予以维持,历时10年的诉讼由此终结。这一判例此后在AI和文本挖掘的学习数据讨论中也被反复引用。

社会影响

谷歌图书奠定了"数字人文(digital humanities)"的基础。因为它使人们能够对庞大的文本语料库进行统计分析,研究词语使用的长期趋势、文化概念的扩散、翻译文体的变化等。与此同时,存在错误的扫描、错误的元数据、版权未确认的图书所带来的问题也一直被不断提出。

最新动向

进入2024~2025年,谷歌图书的价值正被作为"大规模文本语料库"而非"检索服务"重新审视。随着生成式AI竞争加剧,利用公共领域图书和庞大书目数据进行语言模型训练与评估的案例增多,谷歌也在探索将AI基础检索体验与图书数据相连接的方向。由美国国会图书馆和HathiTrust等主导的数字馆藏联盟事业正以标准元数据和可及性改善为中心扩展。另一方面,在各国版权法修订讨论中,谷歌图书判决作为划分AI训练合理使用范围的标准点再次被援引的趋势明显,在韩国也常被作为与国立中央图书馆数字馆藏事业相对照的案例提及。用户界面正被整理为适合移动端,引用文献自动提取和书目管理工具联动功能也得到加强。

相关主题

  • [[谷歌]]
  • [[数字图书馆]]
  • [[版权]]
  • [[合理使用]]
  • [[HathiTrust]]
  • [[谷歌N元语法查看器]]
  • [[电子书]]
  • [[数字人文]]