著作权与AI搜索
浅谈AI搜索服务的著作权法规制
· 朱思浩
摘要
随着大模型LLM综合性能的提升,AI搜索服务开始普及。与传统搜索相比,AI搜索能提供更智能、更精准的搜索结果。但AI搜索在大模型训练、实时信息检索和结果输出等环节,会涉及一系列复杂的著作权问题。这些问题包括训练数据的采集、使用行为可能构成的侵权,信息检索阶段对技术保护措施的规避可能构成的侵权,以及搜索结果输出阶段可能存在的推荐盗版资源、未经授权呈现第三方……
摘要:随着大模型LLM综合性能的提升,AI搜索服务开始普及。与传统搜索相比,AI搜索能提供更智能、更精准的搜索结果。但AI搜索在大模型训练、实时信息检索和结果输出等环节,会涉及一系列复杂的著作权问题。这些问题包括训练数据的采集、使用行为可能构成的侵权,信息检索阶段对技术保护措施的规避可能构成的侵权,以及搜索结果输出阶段可能存在的推荐盗版资源、未经授权呈现第三方作品内容、输出内容与原作品实质性相似等侵权问题。另外,本文还探讨了用户重度参与的AI搜索结果是否构成作品等问题。针对上述问题,本文提出首先应在现有法律框架下引导AI搜索服务的研发与运营符合社会主流价值观、尊重知识产权,并提供了参考法定许可、著作权集体管理等制度规范大模型训练数据的思路。
关键词:AI搜索;著作权;大模型LLM
引言
自OpenAI发布GPT-3.5模型后,生成式人工智能(AIGC)的浪潮席卷了全世界。此后,AI大模型的更新迭代速度之快惊人,杭州深度求索团队开发了DeepSeek系列模型、阿里团队开发了Qwen系列模型,这两家来自中国杭州的公司在开源模型领域领跑全世界,为全球AI大模型领域的“开源盛世”作出了巨大贡献。同时,在闭源领域,OpenAI的O系列、谷歌的Gemini系列、Anthropic的Claude系列模型继续凭借美国强大的软硬件生态和人才储备在综合性能上压制开源模型。
2025年的今天,包括金融、法律、医疗在内的各行各业都正在被AI技术改造和颠覆,通过“AI+”模式赋能的服务和产品已逐渐被大众所接受。而作为获取互联网内容最重要的入口之一,搜索引擎行业或许是最先被AI技术改造的行业。融合AIGC技术的搜索服务正从传统的关键词匹配到语义理解、从单一的网页链接输出到多模态内容呈现。可以说,搜索引擎这个互联网入口在融合了AIGC技术后变得更宽、更大了。
但纵观历史,一项新技术的诞生和应用必将带来相应的社会治理挑战。AI搜索服务在自然语言处理(NLP)、信息检索(IR)、机器学习(ML)、大模型(LLM)等技术环节会涉及对受著作权法保护的相关内容的采集、处理和呈现,这些应用场景不可避免地会落入到著作权法的控制范围。而本文旨在从技术与法律的双重视角,讨论分析AI搜索服务的著作权法规制问题,希望能为相关司法实践提供参考。
二、AI搜索服务概述
(一)AI搜索与传统搜索在外观上的区别
传统搜索主要使用关键词匹配和权重排序的方式呈现结果,爬虫通过用户输入的关键词与抓取到的内容进行匹配,并通过竞价广告、网页点击率、网页SEO优化情况等因素进行搜索结果的排序和呈现。可以说,传统搜索引擎的搜索结果较为机械,是被动罗列爬虫抓取到的信息,需要用户二次筛选和提炼。
而融合生成式人工智能技术的AI搜索则弥补了传统搜索机械罗列所抓取信息的缺点,借助于大模型LLM的理解和生成能力,可以为用户直接输出经过筛选和归纳总结后的内容,让搜索结果在一定意义上能够所见即所用。同时,部分AI搜索具备多轮互动对话能力,可以让用户通过多轮互动获取更高质量、更有深度的内容。
(二)AI搜索技术原理简要概述
目前要实现真正的AI搜索,通常需要以下几项核心技术的融合协作:
1、自然语言处理(NLP):理解语言自然语言处理技术通过解析用户输入的信息识别用户的真实意图,使AI可以理解人类语言,为AI处理信息提供最基础的理解能力。
2、信息检索(IR):寻找相关数据信息检索技术可以从互联网或者内部数据库中查找自然语言处理技术识别到的用户需求内容(包括文本、图像、音频或者视频等),为AI输出搜索结果提供数据来源基础。
3、机器学习(ML):排序、个性化机器学习技术则主要负责根据用户行为习惯、来源权威性等参数对信息检索技术找到的庞大数据进行筛选和排序,进一步为输出的结果提供更精准、也更精简的数据来源。
4、大模型(LLM):理解和生成内容大模型LLM技术的加入使得AI搜索能够真正区别于传统搜索。但大模型LLM基于本地数据库进行训练,训练数据会存在滞后性等问题,其无法知晓当下实时发生的事情。而配合搜索引擎的实时信息检索技术,大模型LLM可以弥补训练数据时效性问题,与时俱进。大模型LLM凭借其强大的理解和生成能力,基于经过实时信息检索后筛选和排序的信息,生成高相关性和高质量的结果。
当然,具体到大模型LLM这一技术,大模型LLM的训练阶段涉及的著作权问题更为复杂和关键。
(三)常见AI搜索服务类型
本文将目前市场上的AI搜索服务按照交互和呈现方式分为:
1、AI增强的传统搜索服务比如谷歌、必应及百度等传统搜索引擎厂商,在其传统的网页搜索结果中加入了AI提供的归纳总结内容。在用户输入关键词或者问题时,AI增强的传统搜索服务会首先在搜索结果的前排醒目位置显示根据用户输入内容生成的归纳总结内容,其他部分则保留传统的网页搜索结果。
2、独立AI搜索服务比如Perplexity、秘塔AI搜索及纳米AI搜索等类新兴的AI搜索产品,这类产品的呈现方式完全区别于传统搜索引擎,会根据用户输入的内容进行语义理解和意图识别,完全以归纳总结的方式呈现搜索结果,同时在输出的结果中可能还会包含图表、参考资料链接等有助于用户更好理解搜索结果的内容。 同时,用户可以根据搜索结果进行深入追问与互动,生成更高质量的内容。
AI对话助手集成联网搜索服务比如ChatGPT、Gemini、DeepSeek、Kimi等产品官方所提供的联网搜索功能。这类产品的联网搜索功能主要起到的是辅助提供实时信息的作用,相对专业的AI搜索产品在性能上较弱,输出的搜索结果也较为简洁。
此外,由于许多初创的中小企业为了节省成本,会选择使用外接第三方API的方式实现AI搜索功能。在此基础上,又可以分为外接第三方搜索API型AI搜索、外接第三方大模型API型AI搜索与完全自研型AI搜索等类型。实践中,对于出现外接第三方API方式运营的AI搜索产品出现的著作权侵权纠纷,则需要进一步具体分析侵权主体与侵权行为之间的关系。
三、AI搜索服务中的著作权问题
(一)大模型LLM训练阶段的著作权问题
1、训练数据的采集与复制行为训练数据的采集是训练大模型LLM的第一步,也是极其关键的一步。训练数据质量决定着大模型LLM的输出内容质量,即使大模型LLM拥有高效的算法架构,配合着强大的算力基座,但如果数据质量不行,大模型LLM依然不可能会输出高质量内容。
而训练数据的采集通常会涉及对大量受著作权法保护作品的复制、下载和数字化存储,不论是对作品的复制、下载还是数字化存储实际都属于复制行为,需要取得原作品著作权人的复制权许可。
2、训练数据的清洗、删改与改编行为为了便于AI识别和理解,大部分训练数据在被采集后都需要进行进一步的数据清洗、删改等操作,在被采集内容构成作品且这种清洗、删改虽保留了原作品的基本表达但已经被改变或转换成新作品形态的情况下,这种清洗、删改行应当属于改编行为,需要取得原作品著作权人的改编权许可。
3、训练数据的翻译与翻译行为大模型LLM在采集训练数据时不仅会采集中文内容,通常也会采集其他各国语言文字内容,这就涉及到了对采集内容进行翻译的问题。而如果采集的内容构成作品,将该作品从一种语言文字转换成另一种语言文字的行为应当属于翻译行为,需要取得原作品著作权人的翻译权许可。
4、训练数据的编排、集合与汇编行为训练数据往往以数据集的形式分类存储,而这就意味着会对采集的大量作品、片段按照一定规则进行归类和编排,最终以数据集的形式保存。这种数据集如果在内容的选择和编排上具有独创性,就可以构成汇编作品。而这种对于训练数据的编排、集合行为如果属于汇编行为,就需要取得原作品著作权人的汇编权许可。
实践中,大模型LLM的训练、推理也会涉及到著作人身权的侵权问题,比如修改权、保护作品完整权等。由于本文篇幅所限,主要聚焦于常见的著作财产权问题。
AI搜索服务信息检索阶段的著作权问题《著作权法》第49条设置了保护技术措施条款,规定“未经权利人许可,任何组织或者个人不得故意避开或者破坏技术措施,不得以避开或者破坏技术措施为目的制造、进口或者向公众提供有关装置或者部件,不得故意为他人避开或者破坏技术措施提供技术服务。”
AI搜索服务在信息检索阶段与传统搜索引擎一样,也需要通过爬虫技术对网页及相关数据库内容进行抓取。虽然这种爬虫的实时抓取行为可能被视为临时复制行为不需要单独取得复制权许可,但如果相关网页和数据库已经设置了技术保护措施,禁止未经许可的主体对其内容进行获取,此时AI搜索服务商如果通过技术手段破坏或者避开了技术措施获取内容,则仍然会构成著作权侵权。
AI搜索服务结果输出阶段的著作权问题大模型LLM根据实时信息检索和排序整理后的信息生成相应输出结果,AI搜索服务在输出阶段的著作权问题因为最显而易见,所以也最受关注。目前在输出端可能会涉及的著作权问题:
1、AI搜索结果推荐盗版内容或者提供盗版资源的链接实践中,笔者发现许多AI搜索产品会以“什么都能搜”、“搜全网资源”为产品卖点。而在实际使用时,也确实能搜到很多盗版内容。比如在AI搜索应用中输入影视剧名称,某些AI搜索应用就会直接在搜索结果优先提供该影视剧的盗版网盘资源链接或者三无小网站的播放链接,而不是像传统搜索引擎那样根据访问量、权威性等因素优先提供正规视频网站的网页链接。
结合AI搜索的技术原理,AI搜索服务商可能在检索、排序和生成阶段设置了相关的选择、推荐参数,优先向用户提供符合免费、无广告、未删减等特征的资源,而这类资源通常都是盗版资源。根据《最高人民法院关于审理侵害信息网络传播权民事纠纷案件适用法律若干问题的规定》第9条关于网络服务提供者是否构成“应知”的规定,AI搜索服务商的这种筛选、推荐盗版资源链接的行为可能会构成著作权帮助侵权。
2、AI搜索结果页面直接呈现第三方免费公开的内容第三方在其自家网站免费公开部分或者全部其享有著作权的内容,或许是基于吸引用户流量,或许是基于公益目的,但并不代表该第三方放弃了这部分内容的著作权,也不代表AI搜索服务商就可以直接将该部分内容以各种形式呈现到搜索结果页面中。
举个例子,如果AI搜索提供论文搜索功能,那无论AI搜索结果呈现的仅仅是摘要还是其他具有独创性表达的部分,只要通过信息网络将他人具有独创性表达的作品内容呈现到AI搜索服务的输出结果中,都需要取得原作品著作权人的许可。具体到此种情况,因此时复制行为已被信息网络传播行为吸收,这种通过信息网络传播第三方作品的行为属于信息网络传播行为,应当获得原作品著作权人的信息网络传播许可。
3、AI搜索输出与其他著作权人的作品存在近似或者相同的内容AI搜索服务基于大模型LLM训练数据及算法等原因,可能会在AI搜索结果输出阶段直接输出与原作品近似或者相同的内容。如果未经授权,AI搜索服务的输出结果可能会构成改编权或信息网络传播权侵权。
(四)其他值得探讨的问题
1、AI搜索输出的结果是否可以构成作品?(如果构成,权属归谁?)首先,根据笔者使用Perplexity、秘塔AI搜索及Gemini等具备AI搜索功能的产品体验,目前这些主流的AI搜索产品已经可以输出具备较高独创性的结果。
其次,笔者认为“作品须为人类的智力成果”,我国《著作权法》的立法目的是鼓励作品的创作,在当前阶段人工智能没有形成自我意识,并不具备被鼓励而自发创作的能力,而目前也只有人类作为高等动物具备真正的自我意识,可以被《著作权法》鼓励并自发进行创作。
最后,在讨论这种较高独创性内容是否构成著作权法意义上的作品的时候,本文认为应当根据用户参与度分情况讨论:
用户轻度参与的AI生成搜索结果当用户直接输入搜索提示词获取搜索结果,这种情况下虽然结果是由用户的提问而产生,但用户仅仅提供了简单的问题输入,并没有对内容的形成起到实质性的作用,这种简单提问显然不属于创作行为。即使这个提问带来的结果具有较高的独创性或者艺术价值,也不应当构成作品。
用户重度参与的AI生成搜索结果当用户通过多轮深入对话等方式,与AI搜索进行一系列复杂的互动对话,最终形成了用户与AI搜索共同完成的具备较高独创性的内容。在此情况下,我们可以将用户比作访谈节目的主持人,虽然用户只是参与了部分内容的输入和创作,但其通过持续引导对话方向、纠正跑题表达、筛选核心观点等行为,实质上主导了最终内容的形成过程。此时,用户的创造性付出已深深嵌入内容的实质性表达中,可以视为用户与AI搜索共同创作了作品,或者用户使用AI搜索作为工具创作了作品。因AI并不能享有著作权,相应权利应当有用户享有。当然如果AI搜索服务平台在用户协议中对相关内容权利进行了其他有效的约定,则有约定需从约定。
用户在AI搜索输出结果的基础上进行修改、完善等二次加工在此情况下,用户虽然是在AI搜索输出结果的基础上进行二次加工,但如果这种二次加工的过程用户投入了大量独创性表达,并且在加工后形成了与原有内容不同的新表达,那么这个加工过程可以视为创作过程,加工后的内容应当构成作品,用户应当对加工后的内容享有著作权。
四、规制路径与建议
(一)加强对AI搜索服务输出结果的规制
传统搜索引擎服务是大部分人接触互联网使用的第一项服务,而AI搜索服务也正成为普通人接触AI应用的第一项服务。AI搜索服务输出的信息对于普通人价值观的形成存在潜移默化的影响,如果一个刚学会上网的人一开始使用AI搜索获取的就都是盗版侵权信息,那他可能就会觉得盗版就是一种理所当然。再比如当年谷歌中国的搜索联想词事件,如果搜索引擎通过滥用所谓的中立技术引导、帮助用户获取盗版侵权等信息,必将会对整个社会价值观造成负面冲击。
因此,加强对AI搜索服务输出内容的规制,输出结果涉及帮助侵权或者直接侵权的依法及时进行约束,非常有必要。
(二)在立法层面完善大模型LLM训练数据使用规范
首先,《著作权法》第24条规定了合理使用制度,但并未为大模型LLM训练数据预留明确的合理使用空间,因此现阶段相关组织或者公司为大模型LLM训练而采集和处理数据并不构成合理使用。
《著作权法》第25条规定了法定许可制度,基于公益目的,为义务教育和国家教育规划使用他人作品提供了法定的许可。如果将现阶段的AI大模型比作一个个正在成长且对知识极度渴求的学生,且在中国本来硬件算力不占优势的情况下,如果过分苛求训练数据的前置许可,可能会对中国大模型LLM的质量产生影响。参考法定许可制度,让通过行政备案的相关组织或者公司获得部分种类训练数据的法定许可资格,可以不经著作权人许可,但仍需要支付报酬。
同时,《著作权法》第8条规定了著作权集体管理制度。参考著作权集体管理制度,当个体权利人没有能力主动对大模型LLM的训练数据进行许可费用主张时,可以要求大模型LLM训练方在备案时一并将训练数据的采集和使用情况进行定期备案,由国家集体管理部门收取相应法定许可费用,再通过权利人申请登记等方式提取。
五、结语
著作权保护制度创设的目的是鼓励创新,但这种创新应当是建立在不侵害他人或者社会公共利益基础上的,否则不受约束的野蛮生长也将反噬创新本身。不论在立法层面还是司法实践中,当下都不应当给社会传递“只要其产品贴上‘AI’标签,就可以获得不受法律约束的能力”这一错误信号。
在现有法律框架下,引导AI搜索的研发与运营符合社会主流价值观、尊重他人知识产权,是现阶段司法实践亟需做的。同时,对于现有法律框架不能合理规制AI应用的部分,立法层面也可以人工智能特别条款的形式对包括AI搜索服务在内的相关人工智能应用的研发、运营进行更科学精准的规制。
参考文献
[1] 王迁. 著作权法[M]. 2版. 北京: 中国人民大学出版社, 2023.
[2] 杨柏勇. 著作权法原理图释与审判实务[M]. 北京: 法律出版社, 2021.
[3] 王迁. 网络著作权专有权利研究[M]. 北京: 中国人民大学出版社, 2022.
[4] 王迁. 立法修改视角下的技术措施保护范围[J]. 中外法学, 2022(3).
[5] 王迁. 复制权与信息网络传播权的关系[J]. 湖南师范大学社会科学学报, 2022(2).