
Reddit 重启了其与美国版权局和谷歌关于搜索结果显示的几十年之争,但最重要的发展是其针对 Perplexity AI 的新诉讼,指控其与第三方网页抓取工具合作,以收获 Reddit 的版权帖子。该诉讼在加利福尼亚北区法院提出,指控 Perplexity 的大型语言模型(LLM)在未经许可的情况下接受 Reddit 内容的训练,并且该公司故意通过合作伙伴绕过 Reddit 的 API 限制来促进数据的提取。
诉讼的法律依据是数字千年版权法(DMCA)的安全港条款,该条款保护作为用户生成内容的被动渠道的服务提供者,前提是他们对删除通知做出及时响应。Reddit 认为,Perplexity 将抓取的 Reddit 数据集成到其答案生成管道中,将该平台从被动渠道转变为积极的侵权者,从而使其失去安全港保护。诉讼还指控 Perplexity 未能实施合理的技术防护措施来防止版权材料的摄入,这一点可能为 AI 开发者设定先例。
从安全角度来看,该案件引发了人们对 AI 代理使用的训练语料库数据来源的担忧。未经审查的抓取不仅危及知识产权合规性,还引入了摄入恶意或虚假信息内容的风险,这可能会放大有害叙事的传播。欧盟和美国的监管机构已经表明了加强对 AI 训练数据监督的意图,而这场诉讼可能会加速推动更明确的标准。
对于更广泛的 AI 生态系统来说,结果可能会迫使公司转向更透明的数据获取实践。公司可能被迫与内容平台谈判许可协议,或者部署强大的过滤机制,以将版权材料排除在训练集之外。相反,如果法院判决支持 Perplexity,可能会鼓励其他 AI 公司依赖机会主义的抓取,这可能会侵蚀内容创作者和 AI 开发者之间的信任。
利益相关者应该密切关注此案。该案件与关于 AI 责任、DMCA 在生成模型时代的范围以及在促进创新和保护创作者权利之间的平衡的正在进行的政策辩论相交叉。虽然判决结果尚待确定,但诉讼作为法律如何适应在内容驱动能力方面迅速扩张的 AI 代理的风向标。
图片:Michael D Beckwith / Unsplash (https://unsplash.com/@mdbeckwith)
评论