Substack给文章装上AI探针

Substack上线由Pangram驱动的AI文本检测功能,可扫描文章、Notes、回复和评论。它更像风险提示器,而非判断作者是否使用AI的裁判。
Substack把AI检测直接塞进了阅读菜单
Substack今天上线AI文本检测功能,读者可以直接判断一篇文章、Note、回复或评论中,有多少文字可能由AI生成或经过AI辅助。
据The Verge 7月21日报道,这项功能由AI检测公司Pangram提供技术支持,正在向Substack网页版和iOS应用推送,Android版本则将在“近期”上线。用户打开一段超过100个单词的内容后,点击右上角三点菜单,再选择“Scan for AI text”,即可得到一份AI生成可能性的估算结果。
**AI文本检测器是一类通过分析词汇分布、句式规律、文本可预测性和模型生成特征,估算一段文字是否由生成式AI参与创作的分类工具。**它输出的是概率判断,而不是能追溯到某个模型、某次生成记录的数字指纹。
这一区别非常重要。Substack并没有宣布“禁止AI写作”,也没有把检测结果直接接入封号、降权或停止付费订阅等处罚流程。至少从目前公布的产品形态看,它首先是一个由读者主动触发的识别工具,而不是平台自动执行的审核机器。

它能扫描什么,不能证明什么
Substack这次覆盖的不只是长文章,而是平台内部几乎所有主要文字载体。
| 项目 | 当前信息 | |---|---| | 技术提供方 | Pangram | | 支持内容 | Posts、Notes、Replies、Comments | | 最低长度 | 超过100个单词 | | 操作入口 | 内容页右上角三点菜单中的“Scan for AI text” | | 已上线平台 | Web、iOS | | Android | 官方称“soon”,尚未公布具体日期 | | 输出性质 | AI生成或AI辅助比例的估算 | | 是否自动处罚作者 | 当前公开信息未显示检测结果会直接触发处罚 | | 是否等同抄袭检测 | 否,AI文本检测与来源比对是两类技术 | | 单独收费 | 暂未披露独立收费方案 |
**Pangram是为文本来源识别提供模型和检测能力的AI检测公司。**在Substack的场景中,Pangram负责判断文本中可能存在的AI生成特征,Substack则负责提供内容、操作入口和面向读者的结果展示。
100个单词的最低门槛是一项务实限制。文本越短,可供模型分析的统计特征越少,一句“感谢阅读,欢迎订阅”几乎不可能被可靠归类;当样本扩展到数百词后,检测器才有机会观察句长变化、词汇重复、段落节奏和语言模型偏好的稳定结构。
但长度增加并不意味着结果自动成为事实。检测器只能说“这段文本看起来像AI”,不能证明作者打开过ChatGPT、Claude或Gemini,更不能准确还原作者是在生成初稿、修改语法,还是只让AI调整了标题。
这不是一个小插件,而是审核权向读者下放
Substack此次更新的真正变化,是把原本属于学校、出版社和内容团队后台的AI检测能力,放进了普通读者每天都会打开的阅读界面。
过去,用户如果怀疑一篇文章由AI批量生成,需要复制全文,再打开GPTZero、Originality.ai、Copyleaks或其他第三方网站检测。流程很长,绝大多数读者不会这么做。现在,检测入口与举报、分享等操作位于同一个菜单,判断成本被压缩到数次点击。
**平台化AI识别是指内容平台把AI生成检测能力直接嵌入发布、分发或阅读流程,而不再要求用户借助外部工具完成判断。**它的意义不只在于“多了一个功能”,而在于平台开始把内容的生产方式显性化。
Substack尤其适合成为这类工具的试验场。它的核心商品不是短视频播放量,而是作者与读者之间的长期信任:读者可能因为某位作者的行业经验、采访能力和个人判断,每月支付数美元甚至数十美元订阅。如果所谓“个人通讯”实际是模型批量生成、作者只做轻度整理,读者对内容价值的判断就会发生变化。
在这种商业关系里,“是谁写的”有时和“写得怎么样”同样重要。天气摘要、财报整理和资料汇总使用AI并不一定损害价值;但个人经历、调查报道、专业判断和情感叙事如果被包装成纯人工创作,问题就不再只是文风,而是作者是否准确描述了自己的劳动与经验。
Substack做对了一半:先提示风险,没有急着给作者判刑
Substack当前最大的优点,是没有把检测分数直接等同于违规结论。
AI检测行业长期存在一个根本矛盾:产品必须给用户一个清晰答案,但底层模型只能提供不确定的统计结果。一旦平台把“疑似AI”直接翻译成“欺骗”“抄袭”或“低质量”,误判的代价就会落到作者身上。
南都大数据研究院此前对10款国内文本、图片AIGC检测工具进行了抽样测试,共完成40次文本检测。结果显示,同一篇人工文本在不同工具上可能得到截然相反的结论:老舍《林海》被部分工具正确判为接近0% AI,也有工具将其判为99.9% AI;万方则把其中约500字标为AI生成,误判比例达到35.6%。对一篇AI生成散文,不同工具给出的AI比例又从接近0%到100%不等。
这组数据说明,AI检测器目前更适合承担“风险分流”,不适合承担“单点定罪”。Substack让读者主动扫描,而不是默认给每篇文章贴上红色警告,至少避免了检测模型立即成为平台执法系统。
不过,问题并没有因此消失。如果检测结果能被轻易截图传播,一个概率分数仍可能变成舆论意义上的判决。作者即使没有受到平台处罚,也可能需要证明自己“真的写过”。对于付费通讯作者而言,这种声誉损失甚至比一次限流更难恢复。
AI检测为何总会误判
AI文本检测最常见的技术基础,是观察文本的“困惑度”和“突发性”。
**困惑度是语言模型对一段文本可预测程度的统计指标。**如果下一个词总是落在模型最常选择的范围内,文本通常更平滑、困惑度更低;传统检测器因此倾向于把低困惑度内容视为机器生成。
**突发性是句长、结构和用词变化是否呈现不规则波动的特征。**人类写作经常会突然写出一个很短的句子,也会插入偏题、犹豫和不够工整的表达;模型默认输出则更容易保持均匀段落和稳定语气。
问题在于,专业编辑、非母语作者和格式高度规范的写作,同样可能表现得“过于稳定”。经过多轮校对的技术文档、学术摘要、新闻快讯,本来就会删除口语停顿和无关细节,其统计特征很容易接近AI文本。
反过来,AI生成内容只要经过人工重写,也可能迅速摆脱检测。作者可以调整段落长度、替换高频连接词、加入个人案例,或让另一个模型做风格改写。检测器面对的不再是原始模型输出,而是人机混合文本;此时“多少比例由AI写成”本身就很难被严格定义。
模型迭代还会制造持续的分布漂移。检测器可能擅长识别某一代ChatGPT的表达习惯,却未必能及时覆盖新模型、微调模型、长上下文改写工具和特定领域写作助手。生成模型每更新一次,检测模型都要重新收集样本和训练。
Pangram进入Substack,比独立检测网站更有优势
原生集成最大的优势不是检测模型一定更准,而是它更接近真实内容场景。
独立检测网站通常只看到一段被复制过来的纯文本,不知道它何时发布、修改过几次,也不知道作者过往写作风格。Substack作为内容平台,理论上拥有更多上下文:历史文章、编辑记录、发布时间、账号行为以及读者反馈,都可以帮助降低单纯依赖文本分类的误差。
但目前公开信息只确认了Pangram对文本内容进行扫描,并没有说明Substack是否会结合作者历史、版本记录或账号行为判断。因此,不能把平台原生入口自动理解为更高准确率。
与市场上的主流产品相比,Substack的差异首先在工作流,而不是跑分。
| 产品或方案 | 主要场景 | 公开价格或门槛 | 核心特点 | 更适合做什么 | |---|---|---:|---|---| | Substack + Pangram | 内容平台读者判断 | 超过100词;未披露独立价格 | 直接扫描Posts、Notes、回复和评论 | 阅读时快速提示风险 | | GPTZero | 教育、自检、写作过程证明 | 公开资料显示Premium为12.99美元/月 | 句子级标注、Writing Replay等过程证据 | 判断混合文本并辅助作者自证 | | Copyleaks | 企业、多语言内容审核 | Personal月付16.99美元,年付折合13.99美元/月起 | 支持30多种语言,覆盖简繁中文 | 多语言团队和批量流程 | | Originality.ai | 出版、SEO、内容团队 | Pro为14.95美元/月;按量方案30美元起 | 面向编辑和网站生产流程 | 批量审核外包稿件与存量内容 | | Turnitin | 学校和学术机构 | 按机构规模议价 | 与作业提交和相似度检测结合 | 学术场景风险提示 |
这些产品公开的“准确率”不能直接横向比较。不同厂商使用的模型、语言、文本长度、生成模型版本和人工改写比例不同,即使都宣称超过99%,也不意味着它们在Substack文章上的实际误报率一致。
价格也不是Substack最重要的竞争点。Pangram能力被嵌入阅读界面后,读者不需要购买专业检测服务,也不必理解阈值设置。对于独立检测厂商而言,这意味着基础扫描正在从一个单独的SaaS产品,变成内容平台的标准功能。
更大的风险,是检测功能被用来发动“AI猎巫”
平台把检测权交给所有用户,也等于把误判和滥用能力交给了所有用户。
竞争作者可以反复扫描对方文章并截取高风险结果,读者可能把任何高分内容都认定为欺骗,社交媒体账号则可以批量制作“某作者AI率90%”的争议素材。检测器原本只是概率工具,进入传播链条后却会被压缩成真假二选一。
Substack接下来需要补上的不是另一个更醒目的百分比,而是一套结果解释机制。一个负责任的界面至少应该说明:检测存在误报;AI辅助不等于全文生成;结果不能证明使用了具体模型;短文本和人工修改文本的可靠性更低;用户不应仅凭一次扫描发起举报或指控。
作者申诉机制同样重要。如果未来Substack把检测结果用于推荐、广告、变现资格或平台治理,作者必须有权查看触发原因、提交写作过程证据并申请人工复核。否则,平台只是把难以解释的算法分数包装成了看似客观的审核决定。
隐私也是尚未充分公开的问题。目前公开信息没有详细说明扫描内容是否发送给Pangram服务器、检测文本保留多久、是否用于训练,以及付费或私密内容会如何处理。对于公开文章,这类问题的敏感度相对有限;对于订阅专享通讯、未公开草稿和封闭评论区,数据处理边界则需要明确披露。
AI识别不应变成“反AI写作”
内容平台真正要治理的不是AI本身,而是低成本批量生产、虚假身份包装和缺乏责任主体的内容。
如果一名作者使用AI整理采访录音、检查语法、生成摘要,最终观点、事实核查和责任仍由作者承担,这类使用方式与全文自动生成并不相同。相反,即便一篇文章完全由人写成,只要充满拼接、抄袭和虚假信息,它也不会因为“0% AI”就变成优质内容。
Google对AI内容的公开态度也一直强调内容质量,而非生产工具本身:搜索系统关注的是内容是否原创、有帮助、能满足用户需求,而不是简单判断AI是否参与。Turnitin也明确提醒,AI写作报告可能误判,不应成为对学生采取不利措施的唯一依据;其产品甚至不再显示0%至19%区间的具体比例,因为低比例结果更容易产生误解。
Substack的产品设计最终也应沿着这一方向发展:检测负责发现异常,披露负责建立信任,人工判断负责作出结论。
我们的判断:有用,但只能当烟雾报警器
Substack上线Pangram检测器,是内容平台从“允许用户发布AI内容”走向“帮助用户识别AI参与程度”的明确信号。
这项功能有实际价值。它降低了普通读者的检测门槛,也会迫使批量生成内容的账号承担更高的信任成本。对于依赖付费订阅的作者,主动披露AI用于资料整理、语言润色还是初稿生成,可能逐渐成为新的创作规范。
但AI检测器更像烟雾报警器,而不是火灾鉴定报告。它可以告诉你“这里可能有问题”,却不能单独证明火从哪里来、是谁点燃的,更不能据此给作者定性。
Substack接下来的关键,不是让那个AI百分比变得更大、更红,而是明确它会不会影响推荐和变现,给作者提供怎样的解释与申诉渠道,以及如何阻止检测结果被用于骚扰和恶意举报。
如果平台能守住“提示而非定罪”的边界,这会是一项有价值的信任工具;如果未来把概率分数直接接上处罚按钮,Substack可能只是把AI内容泛滥的问题,换成了AI误判泛滥的问题。
参考来源
- GitHub:AI Content Detectors工具整理:汇总GPTZero、Originality.ai、Copyleaks、Turnitin等AI文本检测产品的定位、功能与适用场景。
- Reddit:AI内容检测工具可靠性讨论:SEO与内容从业者围绕误报、漏检和人工改写规避检测的实际讨论。



