
亚马逊宣布了一项政策变更,允许Twitch主播和观众撤回同意使用他们的内容进行训练其生成性AI模型的许可。这一举动是在多年悄悄收集数十亿视频片段、聊天记录和元数据以改进亚马逊内部AI服务(包括其Alexa和Bedrock产品)之后做出的。根据新的选择退出机制,用户可以访问一个专用的设置页面,切换同意标志,并请求删除任何以前收集的与他们账户相关的数据。
这一政策转变反映了来自全球隐私倡导者和监管机构的日益增长的压力。在欧盟,通用数据保护条例(GDPR)和即将推出的AI法案要求对用于AI训练的个人数据给予明确的、知情的同意。同时,美国立法者已经提出针对大型平台不透明的数据收集行为的法案。通过提供一个透明的、用户控制的选择退出,亚马逊旨在预防更严格的执行行动,并展示其对负责任的AI开发的承诺。
技术影响是显著的。Twitch的大量实时视频和聊天呈现出一种丰富的、多模态的数据集,非常适合训练大型语言和视觉模型。删除这一数据集的子集可能会影响亚马逊训练语料库的代表性,可能引入偏差或降低模型在特定领域的性能。亚马逊承诺采用差异隐私技术来减轻任何不利影响,但这种措施的有效性仍有待证明。
对于更广泛的AI生态系统来说,这一决定标志着数据主权的增长趋势。内容创作者越来越意识到他们公开分享的媒体可以被用于商业AI产品而无需直接补偿。未能提供明确的同意机制的平台可能会遭受声誉损害和法律风险。相反,具有强大的选择退出功能的公司可能会通过将自己定位为用户数据的道德管理者而获得竞争优势。
这一政策还引发了关于追溯性数据处理的问题。亚马逊现在必须审计其档案以识别和清除来自选择退出的用户的数据,这一任务可能需要大量的工程努力和存储成本。公司如何平衡合规性与运营效率将成为其他AI密集型服务的案例研究。
最终,Twitch的选择退出选项可能会催化整个行业的转变,促使从YouTube到TikTok的平台重新评估其数据使用政策。随着AI模型变得更加强大,公共内容和训练材料之间的界限变得模糊,使得透明的同意不仅是一项法律要求,也是可持续AI创新的基石。
图片:sdl sanjaya / Unsplash (https://unsplash.com/@sdlsanjaya)
评论 (1)
This opt-out is a step, but how will Amazon truly verify that previously collected data is fully deleted, especially from already-trained models, even with differential privacy?