AI 快讯Twitch确认直播喂给亚马逊AI
行业快讯

Twitch确认直播喂给亚马逊AI

2026-08-13T02:03:11.859Z
Twitch确认直播喂给亚马逊AI

Twitch确认亚马逊长期使用平台内容训练AI,并新增默认开启的退出选项。开关只约束未来训练,历史数据是否进入模型仍是一笔糊涂账。

Twitch承认了,但只承认了一半

Twitch在当地时间8月12日确认,亚马逊一直在使用平台上的用户内容训练AI模型,并允许用户从现在开始选择退出。受影响的内容不只是公开视频,还包括直播、回放、剪辑、聊天消息,以及频道中的图片和文字。

退出训练(opt-out)是指平台默认取得内容使用权限,只有用户主动关闭后,相关内容才不再进入未来的生成式AI训练。 这与主动授权(opt-in)正好相反:后者要求平台先征得明确同意,用户不操作就视为拒绝。

这次政策调整真正引发争议的地方,不是Twitch增加了一个隐私开关,而是这个开关反向证实了亚马逊此前已经在使用Twitch内容。Twitch现在承诺的也是停止用于“未来训练”,并没有承诺删除已经收集的数据、撤回已经进入训练集的样本,更没有解释相关数据是否已经写入现有模型权重。

Twitch隐私设置页面中的生成式AI训练退出开关,旁边展示直播、回放、剪辑和聊天等适用内容

默认同意,是这场争议的核心

Twitch选择默认允许训练,而不是要求用户主动加入。Twitch首席产品官Mike Minton在回应社区质疑时说得非常直接:“如果这是opt-in,就不会有人选择加入。老实说,这就是答案。”

这句话几乎解释了整套产品设计。平台知道绝大多数主播不会主动把自己的直播、声音、形象和社群对话交给亚马逊训练模型,因此选择利用默认设置、操作惯性和较低的政策触达率获得数据。

默认选项并不是一个中性的界面细节。对于拥有大量非活跃账号、偶尔开播用户和历史内容的成熟平台,默认开启意味着实际可获得的数据规模可能比主动授权高出一个数量级,而用户甚至未必知道设置已经发生变化。

Twitch社区负责人Mary Kish在解释政策的直播中也提前承认,用户不太可能欢迎这项调整。她表示,Twitch并不期待用户为此感到高兴,也不认为大家会作出积极反应。随后直播聊天区迅速出现数百条反对AI训练的留言,多名主播也在社交平台呼吁用户立即关闭该选项。

两种授权方式的差异可以概括如下:

| 维度 | 默认退出机制(opt-out) | 主动加入机制(opt-in) | |---|---|---| | 初始状态 | 默认允许平台训练 | 默认禁止平台训练 | | 用户需要做什么 | 主动关闭开关 | 主动开启开关 | | 未操作的结果 | 内容可能进入训练集 | 内容不会进入训练集 | | 平台获得的数据规模 | 通常更大 | 通常更小 | | 用户知情与同意强度 | 较弱 | 较强 | | Twitch当前方案 | 是 | 否 |

退出能保护哪些内容

Twitch的新设置覆盖了用户在平台上产生的主要内容形态。按照Twitch支持页面对政策的描述,退出后,相关内容不会用于未来训练那些以生成或合成文本、音频、图片、视频为目的的亚马逊AI模型。

生成式AI训练是指利用数据调整模型参数,使模型能够生成新的文本、声音、图像或视频内容。 这一定义比普通的内容推荐、字幕识别或违规检测更窄,因此退出开关并不等于禁止Twitch对内容进行任何自动化处理。

| 内容类型 | 退出后是否停止用于未来生成式AI训练 | 需要注意的问题 | |---|---:|---| | 直播视频与音频 | 是 | 已经进入历史训练集的内容未获删除承诺 | | VOD直播回放 | 是 | 仅约束未来训练用途 | | Clips剪辑 | 是 | 他人制作或转载的版本可能涉及不同归属 | | 直播聊天 | 视频道所有者设置而定 | 用户在他人频道发言时,由该频道的退出偏好决定 | | 频道图片与文字 | 是 | 包括频道页面上的视觉和文本材料 | | 字幕、安全和内容分类 | 否 | 属于Twitch保留的AI辅助功能范围 |

聊天记录的规则尤其值得警惕。用户即使已经关闭自己频道的训练选项,只要进入另一名未退出主播的直播间发言,这些消息仍可能按照对方频道的设置被用于训练。换句话说,聊天参与者并不总能独立决定自己所写文字的用途。

Twitch现有的字幕、安全审核、剪辑辅助和内容分类功能也不会因为用户退出而停用。平台将这些能力归类为“AI支持功能”,而不是此次开关针对的生成式AI训练。这个边界在产品层面说得通,但平台目前没有公开足够详细的技术清单,让用户判断每一项功能具体使用了什么模型、处理了哪些数据。

“未来训练”不等于删除历史数据

Twitch此次提供的是面向未来的使用限制,而不是一项完整的数据撤回机制。官方措辞强调内容不会用于亚马逊模型的“未来训练”,却没有说明此前训练数据的保存期限、数据集版本、模型名称和删除流程。

机器遗忘(machine unlearning)是指让已经训练完成的模型消除特定训练样本影响的技术过程。 删除存储服务器上的原始视频,并不等于从模型中删除这段视频留下的统计特征;如果样本已经用于预训练或微调,真正撤回往往需要重新训练、定向遗忘或对模型进行额外校正。

这也是退出按钮最容易造成误解的地方。用户关闭开关后,可以阻止内容进入下一轮训练流水线,但无法据此推断现有亚马逊模型已经“忘掉”相关内容。Twitch也没有公布可供创作者查询的数据训练记录,更没有提供类似“我的哪些内容曾被哪个模型使用”的审计工具。

Mike Minton本人也表示,他不知道亚马逊此前具体使用了哪些Twitch内容、没有使用哪些内容,因为亚马逊的模型训练并不由他负责。这个回答暴露出比隐私设置更严重的组织问题:负责向创作者解释政策的Twitch产品负责人,无法给出母公司数据使用的完整范围。

因此,这次事件中可以确认与不能确认的信息需要明确区分:

| 问题 | 当前结论 | |---|---| | 亚马逊是否使用过Twitch内容训练AI | Twitch已确认存在此类使用 | | 涉及哪些具体模型 | 未披露 | | 使用了多少直播或用户的数据 | 未披露 | | 最早从何时开始使用 | 没有完整时间表,外媒报道称已持续多年 | | 退出后是否停止未来生成式AI训练 | Twitch称会停止 | | 退出后是否删除历史训练数据 | 没有相关承诺 | | 已训练模型是否执行机器遗忘 | 未披露 | | 用户能否查看自己的训练使用记录 | 目前不能 |

Twitch为什么是一座多模态数据金矿

Twitch对亚马逊的价值远不止直播流量,它更是一套大规模、长时段、天然对齐的多模态数据。所谓多模态数据,是指同时包含文本、音频、图像或视频等多种信息形态,并能让模型学习它们之间对应关系的数据。

一场典型的游戏直播同时包含主播语音、面部表情、游戏画面、屏幕文字和观众实时反馈。与互联网上随机抓取的短视频相比,这些数据连续时间更长,音画对应关系更稳定,还附带聊天区对具体时刻的反应,非常适合训练视频理解、语音识别、情绪判断、实时摘要和音视频生成模型。

Twitch的内容也拥有明确的场景结构。游戏直播可以帮助模型学习操作与画面的因果关系;音乐和创作直播包含连续的制作过程;访谈和杂谈内容则提供大量口语、表情与社群语境。对于试图补齐多模态能力的模型公司,这类数据比单纯的网页文本稀缺得多。

亚马逊在2014年收购Twitch后,已经拥有这座内容资产超过十年。问题在于,主播通常把Twitch理解为内容分发、广告和订阅平台,而不是AI训练数据供应平台;当平台把旧有内容关系扩展到模型训练时,原来的服务协议是否足以代表创作者真正知情,必然会受到质疑。

这不只是版权问题,也是身份复制问题

主播反弹强烈,是因为直播内容承载的不只是作品版权,还包含可识别的声音、脸部、表达习惯和社群关系。对于职业创作者而言,这些特征共同构成其商业身份,而生成式模型恰好能够学习并低成本复制这些特征。

文本作者担心模型模仿文风,直播创作者面对的风险更立体。模型可能学习主播的声音节奏、常用语、面部动作和互动方式,并将这些能力用于语音合成、虚拟角色或自动化视频生成。即使模型不逐帧复现某次直播,创作者仍可能认为自己的劳动被转化成了平台资产。

聊天用户同样不是无关紧要的背景数据。直播聊天包含网络俚语、群体反应、情绪变化和特定社群文化,对模型学习实时互动非常有价值,但其中也可能出现个人信息、敏感经历或用户并未打算脱离当时语境传播的内容。

Twitch首席产品官提出“几乎所有公开内容都以某种形式被用于模型训练”,这描述了行业现状,却不能自动构成合理性证明。公开可访问只意味着人们能够观看,不必然意味着用户预期内容会被批量收集、永久保存,并用于训练可商业化的生成模型。

Twitch的方案比完全不给开关更好,但远远不够

Twitch愿意提供退出选项,至少比没有任何控制权更进一步。用户可以在隐私设置页面底部找到相关滑块,关闭亚马逊对其内容的未来生成式AI训练使用,而且退出不会影响字幕和安全工具等日常功能。

但这套方案仍然把行动成本全部交给了用户。平台既没有采用主动授权,也没有公布历史训练清单,更没有为长期不登录的用户、已离开平台的创作者或已故用户提供清晰处理机制。所谓“隐私保护功能”,本质上仍建立在默认获取数据的基础上。

更合理的方案至少应包含四项机制:

  1. 新用途主动授权:生成式AI训练与直播分发不是同一种服务,应使用单独、明确的同意流程。
  2. 历史使用透明度:公开训练时间范围、内容类别、模型用途和数据保留期限。
  3. 可验证的退出结果:允许创作者查看设置生效时间,并确认后续数据集不再包含其内容。
  4. 补偿与许可机制:如果平台认为高质量主播数据具有训练价值,就应提供分成、授权费或其他可选择的交换条件。

平台与创作者的AI数据冲突才刚开始

Twitch事件说明,互联网平台正在把过去十多年积累的用户内容重新解释为AI训练资产。数据过去用于展示、推荐和广告,现在则可能被投入生成模型;用途发生了根本变化,但用户控制机制往往只增加一个默认开启的开关。

这套做法短期内能够帮助平台快速扩大训练数据,长期却会消耗创作者信任。直播平台依赖主播持续生产内容,也依赖观众维持互动氛围,一旦双方认为平台会在未经明确同意的情况下把身份特征和社群表达转化为模型能力,内容生态就会出现防御性行为,包括减少回放、关闭剪辑、清理历史内容,甚至转向提供更强数据控制的平台。

Twitch这次最值得记住的不是用户终于有了退出按钮,而是高管公开承认:如果要求主动加入,几乎没人会同意。这个答案很诚实,也恰好证明默认同意并不能代表真实意愿。

对Twitch而言,接下来的关键不是如何让更多用户找到开关,而是能否交代亚马逊过去究竟拿走了什么、训练了什么,以及已经进入模型的数据准备怎么处理。在这些问题得到回答之前,这个退出选项更像一道止损阀,而不是一套完整的创作者权益方案。

参考来源

相关推荐

查看全部