文化产业

AI时代的版权困局——AI时代,版权会失效吗

0

内容产业与AI技术的深度交融,更像是一场关于技术逻辑与产业规则的重新博弈。

进入2026年,围绕人工智能(AI)的版权争议,正在迅速从零散个案走向系统性冲突。过去一年,美国至少发生了56起AI相关版权诉讼,从《纽约时报》起诉OpenAI及微软,到大英百科全书、韦氏词典,以及出版商“心灵鸡汤”等密集发起诉讼,媒体、学术出版与大众出版相继入场。一连串动作背后,并非单一企业的维权,而是内容产业对一项底层技术的集体反应:当AI成为新的内容入口,原有的版权秩序开始松动。

这一现象并非海外独有。在国内,一家头部出版机构近期发现,其图书被某听书平台通过大模型系统拆解,每本书生成上万字解读文本,并以语音形式分发,通过会员订阅模式与广告实现变现。这种做法并不是传统意义上的“复制”,也难以被简单归类为“改编”。真正棘手的是,这种“理解式生产”已经在功能上替代了阅读本身。当读者不再需要翻开一本书,而是通过AI工具直接获得“书的内容”时,出版的价值链就会被极限压缩。

如果从技术逻辑来看,这一变化并不意外。自2022年生成式人工智能(GenAI)爆发以来,大模型对高质量语料的需求持续攀升。每年数十万种图书与海量学术内容,因其经过编辑筛选、结构稳定,成为最理想的训练资源。但当内容被用于训练时,是否需要授权?如果没有授权,这种使用是否仍然属于既有版权体系可以覆盖的范围?

难点恰恰在这里。与传统盗版不同,AI并不直接复制作品,而是将其拆解、吸收,并转化为模型能力的一部分,再以摘要、解读甚至再创作的形式输出。

这是技术浪潮带来的典型错位:技术已经改变内容的生产与使用方式,而规则仍然停留在传统版权逻辑中。一边是AI对优质内容的高度依赖,一边是规则尚未成形的灰色地带,出版业正处在两者之间的缝隙中。

由此引发的现实冲突已摆在行业面前:当内容不是被侵权复制、盗印,而是被AI阅读吸收时,我们该如何界定合规的边界?这一问题的答案不仅关乎法律边界,更关乎内容产业在AI时代的定价权与位置。

 

冰山一角

AI将出版物作为训练语料,已经是各方默认的事实。中国文字著作权协会(以下简称“文著协”)常务副会长兼总干事张洪波提到,早在GenAI尚未大规模落地之前,就已有AI公司尝试通过文著协解决图书与文章用于AIGC(人工智能生成内容)训练的授权问题,希望以“一揽子授权+版权费转付”的方式,提前规避潜在风险。但这一尝试并未真正落地,原因在于现行法律对AI训练数据的版权属性尚未明确,企业担心即便完成授权,仍难以应对后续权利人持续主张权利的不确定性。

来自一线的反馈更为直观。一位大学出版社相关业务负责人回忆,“在两年前,就已经有编辑代作者来询问我们,可不可以将我们的图书作为语料投喂给人工智能模型进行训练”,当时这一请求被明确拒绝,理由同样简单——版权边界不清、内容安全不可控。彼时,这类问题仍停留在零星试探阶段,出版业对AI的关注,更多集中在校对、编辑等效率工具层面,而非内容本身的再利用。

但仅仅两年时间,问题的性质已经发生变化。随着GenAI的快速演进,大模型对高质量文本数据的需求极速扩大,经过系统编辑加工的图书、百科与学术著作,开始被视为高价值语料。AI对这类语料的需求也并非简单的内容搬运,而是基于一种更底层的资源竞争:谁掌握更优质的语料,谁就更有可能构建更强的模型能力。

在这一背景下,法律层面的版权争议便难以避免。湖南智术律师事务所主任陆刚指出,从现行著作权法出发,大模型在训练过程中对作品进行复制、存储与数字化处理,本身就可能触及复制权;若生成的内容对外发布,则可能进一步涉及信息网络传播权;一旦生成内容在原作基础上形成新的表达,还可能延伸至改编权、汇编权。

但与传统盗版“可见的复制”不同,AI对内容的使用往往发生在不可见的层面——作品被转化为参数的一部分,再以摘要、解读甚至再创作的形式输出。这种介于学习、加工与再生产之间的状态,使出版机构在“输入端”几乎无法判断自身内容是否被使用,更难以据此发起维权。

问题的复杂性远不止于此。中关村智能研究院院长孙明俊指出,大模型的学习方式更接近于构建知识网络,如果一部作品在网络上被广泛讨论、引用或被拆解为读书笔记,模型可以通过这些二阶信息形成对作品的整体认知。这意味着即便未直接接触原文,AI仍可能重建作品的核心结构与表达逻辑。

从现实进展看,国内相关争议仍处于早期阶段,缺乏具有标志性的司法判例;而在海外,不少相关问题引发的冲突已经进入诉讼通道。2023年9月,美国作家协会联合包括乔治·马丁在内的多位作家,对OpenAI提起集体诉讼,指控其在模型训练中使用大量受版权保护的作品。其中一个颇具象征意味的细节是,在庭审过程中,当律师直接询问ChatGPT是否未经许可使用相关作品进行训练时,AI给出了肯定的回答。

这一幕被不少业内人士视为一种隐喻:当机器开始承认自己利用人工编辑的内容,人类却仍无法界定其合规边界,版权问题已经不再只是法律争议,而是一场关于技术逻辑与产业规则的重新博弈。

 

维权困境

面对AI带来的版权冲突,出版机构遇到的核心困难不仅在于发现问题,还在于发现问题后应当如何维权。

中信出版集团(以下简称“中信出版”)较早就意识到了AI可能带来的版权风险,也是业内为数不多的在发现相关情况后迅速采取反击措施的出版社之一。但中信出版相关负责人坦言,现实情况远比单一案例复杂,“目前我们正在持续开展相关监测工作,并积极与相关企业进行前期沟通”。

但问题的关键在于,AI生产内容的过程是一条由多个环节构成的链条——从数据抓取,到模型训练,再到最终生成内容,每一个环节都可能涉及权利使用,但很难形成完整的证据闭环。有可能最终生成的结果并不侵权,但在模型训练和计算的过程中,它已经使用了出版物的内容,中间这个环节没法界定。这使得出版机构在维权时面临一个核心难题:如何证明内容被使用。

从技术层面看,这并非没有路径可循。孙明俊介绍,目前可以通过精确匹配计算出版物原文片段的哈希值,然后在训练数据集中进行搜索比对,或模糊匹配检测语义上的相似性及“金丝雀数据”——这是一种主动检测方法,权利人可以在其作品的数字版本中,故意植入一些独一无二、无意义但难以察觉的“陷阱”文本——如果日后通过查询AI模型,能让其生成这些“陷阱”文本,就构成了其“读过”该作品的强力证据。但问题在于,这些方法要么只能识别完全一致的内容,要么难以满足司法证据标准,整体证据效力有限。此外,提取哈希值比对的做法需要投入大量经费和人力,维权成本也是必须考量的因素。

正是在这一灰色地带,AI企业普遍引入“合理使用”作为抗辩逻辑。在美国,相关判例已经出现松动迹象。2024年,美国三位作家起诉AI独角兽Anthropic,认为其未经许可使用了包含自己作品在内的数十万册书籍,以训练其大语言模型Claude。在判决中,法院认定Anthropic在训练模型过程中使用图书的行为构成合理使用;在《纽约时报》诉OpenAI案中,类似抗辩同样成为争议焦点。“训练行为是否属于合理使用”正在成为全球AI版权博弈的核心问题。

但在中国,这一逻辑并不完全成立。我国《著作权法》采用封闭式列举的合理使用制度,仅限于12种具体情形。尽管AI训练与“个人使用”“科学研究使用”存在一定相似性,但扩展解释空间有限,尚难直接覆盖大模型场景。

在我国现行法律框架中,“合理使用”的定义是在符合特定条件时,他人可以在未经许可的情况下使用受版权保护的已发表作品。我国《著作权法》规定的合理使用制度,还引入了《伯尔尼公约》三步检验法,采用的是封闭式列举,其适用范围仅限于列举的12种作品类型。大模型训练与著作权法规定的“个人使用”“科学研究使用”两类最为接近,但相关条款扩大解释的空间极为有限。

定性难、举证难,使出版机构在面对AI侵权问题时普遍陷入被动。长期以来“打地鼠式”的盗版维权经验,也让不少机构在面对新技术时更加谨慎:与其投入高成本进入不确定诉讼,不如暂时观望,等待司法实践与行业规则逐步清晰。

 

成本困局

“诉讼花费一万,胜诉获赔一千,这事儿还干吗?”

这是出版业打盗维权始终面临的困扰。过去,出版机构尚可以通过打击实体盗版书和网络侵权行为来实现部分止损,这笔账勉强算得过来;但进入AI时代,维权性价比几乎彻底失衡。

变化首先发生在取证环节。对于仅存在于模型训练阶段、未形成外部输出的内容使用,权利人几乎无从感知,更遑论取证;而即便生成内容已经可见、可听,问题也并未因此简化——生成结果是否构成侵权、侵权程度如何界定,仍然充满不确定性。于是,维权从“能不能做”转向“值不值得做”。

出版机构的现实压力通常来自两个层面。

其一,是组织能力的约束。多数出版社并未设立专门的维权体系,版权事务往往由总编室或法务部兼顾,少则两三人,多则四五人。在既有出版任务之外,额外承担侵权监测、证据固定与诉讼推进等工作,人手明显不足。这种结构性短板,使得维权从一开始就难以规模化展开。

其二,是成本与回报的严重错配。陆刚曾以一个简单模型说明这一问题:一本定价50元的图书遭遇盗版,出版社若要以其损失主张赔偿,则须证明自身损失,需要还原“本应销售多少、因侵权而产生的损失是多少”,这一过程在实践中极难实现,无法获知盗版侵权的真实数量,也无从计算盗版损失;若转而以侵权方获利为依据主张赔偿,盗版方通过频繁更换链接规避追踪,最终能够锁定的交易量往往极为有限。例如盗版图书的销售价格为10元/本,原告锁定被告销售了100本,对应的销售收入为1000元,法院原则上只能在1000元的范围内判赔。但当律师费、公证费与时间成本叠加,即便案件胜诉,出版机构所获得的赔偿本身也难以覆盖维权投入。

在这样的压力下,“不维权”或“选择性维权”逐渐成为出版机构的现实选择。

但这并不意味着博弈停止。2025年11月,上海市金山区人民法院一审宣判全国首例人工智能大模型著作权侵权案:阅文集团就《斗破苍穹》中美杜莎形象被用于训练AI模型提起诉讼,法院认定相关行为侵犯复制权与信息网络传播权,并判令停止侵权及赔偿损失。

这起案件的核心价值不在于赔偿金额,而在于其释放出的信号——AI版权纠纷,已经从难以界定的灰色问题,变成可以被司法裁量的现实范畴。

从“算不过账”的沉默,到“以案定界”的尝试,出版机构与AI企业之间的关系,正在悄然变化。当个案不断累积,原本模糊的边界,也将在实践中被一点点勾勒出来。

 

规则博弈

从司法实践看,国内与AI相关的案件目前仍集中在生成内容的可版权性(智力成果能够获得著作权法保护的资格)、平台责任与提示词边界等问题上,而围绕“训练数据使用”与“生成物侵权”的核心争议,尚缺乏具有标志性的公开判例。这并不意味着出版业放弃主张,相反,在规则尚未明确之前,行业更倾向于观望与评估——因为一旦进入博弈,成本与路径都不可预期。

制度层面的滞后同样明显。迄今为止,我国尚未出台专门针对AI的成文法,现有规范主要停留在政策文件与行业标准层面。尽管已有学者提出《人工智能法》《人工智能示范法》等建议稿,但与真正落地仍有距离。

与之形成对比的是,海外的相关政策和规则正在加速成形。2024年欧盟通过《人工智能法》,明确将模型训练纳入授权范畴;此后,意大利、韩国、日本、越南等国相继推进相关立法。2026年,英国发布《AI、版权与创意产业》报告,美国推出《国家人工智能立法框架》,在强调技术发展的同时,将保护创作者权益作为重要前提。

规则尚未统一,但路径已经分化。

在出版机构层面,不同选择背后,是对“内容是否应被视为数据资产”的不同判断。以约翰·威立出版集团、泰勒与弗朗西斯出版集团为代表的学术出版集团,采取“默认授权”(opt-out)模式——默认将图书或期刊内容用于AI训练,且“不为作者提供退出选项”;以剑桥大学出版社为代表的机构,则采用“选择性加入”(opt-in)模式——将作者同意作为授权的前提,向选择加入的作者支付一定版税;而在大众出版领域,企鹅兰登等机构则更为谨慎,直接在版权页中明确禁止其出版的作品被用于AI训练。

与此同时,海外科技公司正在尝试将这一问题市场化。2026年初,微软推出“出版商内容市场”,试图搭建内容授权交易平台;亚马逊AWS亦计划推出类似机制,将训练数据转化为可流通、可定价的资源。当版权从“权利主张”转向“交易标的”,一套新的商业基础设施正在形成。

司法层面的博弈同样在加速。中国新闻出版研究院副院长赵冰披露,截至2025年底,美国已发生至少56起AI版权诉讼,其中绝大多数集中在输入端与输出端的侵权问题上,但真正进入实体裁判的案例仍然有限,“以诉促和”正在成为更常见的路径。

事实上,诉讼不仅是一种维权工具,更是一种谈判筹码。一方面,出版机构通过诉讼提高AI公司的成本,迫使其进入授权谈判;另一方面,AI公司也不得不面对一个事实——如果缺乏优质内容输入,仅依靠技术规避侵权,模型能力将难以维持,从而影响商业价值。

迪士尼的做法具有典型意义:一边向OpenAI授权数百个IP角色,一边起诉谷歌侵权,同时向字节跳动发出停止侵权函,将未经授权的使用称为“虚拟的打砸抢”。合作与对抗并行,边界与底线同步划定。

可见,在立法尚未完成之前,一场围绕规则解释权与定价权的博弈已经展开。不同国家、不同机构、不同企业,正在用各自的方式回答同一个问题:当内容成为AI的“燃料”时,谁来决定它的价格,以及使用的边界。

 

 

困局,也是分水岭

值得关注的是,国内围绕AI与版权的制度回应,已经开始从分散探索走向系统推进。2024年3月全国两会期间,文著协协助完成了《关于加强人工智能领域版权保护、推动产业高质量发展的提案》,同年12月4日,文著协发布了《加强人工智能版权保护,促进产业高质量发展倡议书》,得到很多权利人和群团组织响应。2025年国务院《关于深入实施“人工智能+”行动的意见》要求,完善人工智能法律法规、伦理准则等,推进人工智能健康发展相关立法工作。

这一趋势在2026年进一步强化。“十五五”规划纲要中30次提到“人工智能”,明确提出建设语料库、建立训练数据合理使用制度、完善法律与伦理准则等目标。全国人大常委会、司法部也提出尽快研究人工智能等领域立法。在这样的背景下,《著作权法实施条例》《著作权集体管理条例》等专门行政法规修改有望进入提速阶段,张洪波表示。

与政策层面的加速同向而行的,是行业的自发调整。文著协围绕数据来源追溯、生成内容标志、合理使用边界与集体授权机制提出具体路径,国家社科基金特别委托项目《生成式人工智能语料库建设著作权法律问题研究报告》则进一步将“语料合规”作为核心议题推向台前。与此同时,文著协受国家版权局委托完成修订的新版《图书出版合同(示范文本)》已将AIGC使用纳入条款,为作者与出版机构之间的权利划分预留协商空间。

可以看到,一套围绕“数据来源—使用方式—收益分配”的规则框架正在逐步成形。但从更长的时间维度看,这一过程并不陌生——印刷术曾被质疑破坏知识的神圣性,却最终重塑了传播体系;复印技术曾引发对大规模复制的担忧,也推动版权制度完成从印刷时代向复制时代的跃迁。实际上,每一次信息技术的进步,都会在著作权法上留下新的刻痕。

不同之处在于,这一次的变化更为隐蔽,发生得也更为迅速。

当内容以参数形式被吸收时,当使用行为发生在模型内部时,传统的权利边界不再天然成立。而在规则尚未明确之前,市场的实际选择,往往先于制度形成——谁先行动,谁就更先一步参与定义规则。

这也带来一个无法回避的问题:当图书行业面对侵权选择沉默,是否在无形中完成了某种“默认授权”?如果内容生产方缺乏明确的谈判意向和反制手段,技术公司又为何要为内容付费?陆刚在采访中的一句话,或许点出了问题的本质:“当权利受到侵害时,如果你作为权利所有人不去主张权利,不把对方‘打疼’,他们是难以和你建立商业合作关系的。”

从这个意义上看,AI时代的版权问题,正在从“是否侵权”转向“如何制定版权规则”“如何定价”。制度会逐步完善,规则终将成形,但在此之前,决定图书行业位置的,或许并不是法律文本,而是每一个参与者在这段过渡期内的选择。

对出版业而言,这既是一场困局,也是一道分水岭:是继续停留在“作品保护”的旧逻辑中,还是进入“数据与能力定价”的新体系中。

答案,尚在路上。■

发表回复