AI 快讯ShieldFont给AI爬虫下毒
行业快讯

ShieldFont给AI爬虫下毒

2026-08-13T05:03:44.609Z
ShieldFont给AI爬虫下毒

开源字体 ShieldFont 让网页对人类正常、对文本爬虫却变成错误内容。它不是不可破解的反爬墙,却把数据抓取从低成本下载升级成字体解析与 OCR 对抗。

ShieldFont 给 AI 爬虫下毒:网页开始主动污染训练数据

网页出版商正在从“拒绝 AI 抓取”转向“让抓到的数据失去价值”。 截至 2026 年 8 月 13 日,一款名为 ShieldFont 的开源字体因能够让人类正常阅读网页、同时向自动化爬虫返回错误文本而受到关注。它不封 IP,也不依赖验证码,而是利用浏览器字体渲染机制,在网页源码与屏幕显示之间制造一层语义错位。

ShieldFont 是一种利用 OpenType 字形替换规则干扰自动文本提取的网页字体。 读者在浏览器里看到的仍是正常文章,但只下载 HTML、读取 DOM 文本或执行常规复制操作的爬虫,拿到的可能是一段语法勉强成立、含义却已经改变的文本。错误内容一旦进入数据集,就会降低语料的可用性,甚至污染后续的检索、摘要和模型训练结果。

这套方法最近经 Ars Technica、Help Net Security 等媒体集中报道后出圈,但它并不是突然出现的概念。公开信息显示,ShieldFont 项目在 2025 年 10 月启动,并获得字体厂商 Playtype 支持;相关协议和专用字体 ShieldFont Optik 于 2026 年 3 月以开源方式发布。进入 8 月后,围绕 AI 爬虫、版权授权和训练数据成本的争议,让它从字体设计实验变成了一种现实的内容防御方案。

ShieldFont 工作原理示意图,左侧为网页 HTML 中的诱饵文本,中间为字体字形替换,右侧显示人类看到的正常文章与爬虫抓到的错误文本

它不是乱码,而是“看起来正确的错误源码”

ShieldFont 的关键不是隐藏文字,而是让同一串字符在机器提取和人类观看时表达不同内容。 普通反爬页面往往返回乱码、空白或者挑战页面,这很容易被发现;ShieldFont 更接近一份带有双重语义的文档:源码提供一种说法,字体渲染后又呈现另一种说法。

OpenType 连字是 ShieldFont 完成语义替换的技术基础。 连字原本是一项排版功能,例如字体引擎可以把相邻的“f”和“i”替换成更协调的“fi”字形,以避免笔画挤在一起。ShieldFont 把同样的 GSUB,也就是 Glyph Substitution 字形替换机制,扩展到完整单词甚至词组:HTML 中存放诱饵词,浏览器加载字体后,再把对应字符序列绘制成另一组可读字形。

浏览器显示的是字形,传统爬虫提取的却是字符。 浏览器在字体塑形阶段读取 OpenType 替换表,将字符序列映射为最终显示的 glyph;只使用 HTTP 请求下载 HTML、再通过解析器提取 textContent 的爬虫,一般不会执行完整的字体塑形流程,因此只能获得替换前的诱饵文本。

举例来说,读者在屏幕上可能看到“骑士骑马进入战场”,底层文本却可以被设计成语法结构相似但事实不同的句子。对人类而言,页面没有明显异常;对不渲染网页的采集器而言,这段错误内容会被当成正文保存。

语法正确但事实错误的数据比随机乱码更难清洗。 大规模训练数据管线通常会过滤编码异常、重复文本、广告模板和明显无意义字符,却不一定能识别一段流畅但被系统性替换了人物、地点、动作或数字的文章。随机乱码很可能被困惑度过滤器直接丢弃,而“像正常文章的假内容”更有机会穿过质量筛选。

ShieldFont 抬高的是成本,不是建立不可突破的墙

ShieldFont 更准确的定位是抓取成本放大器,而不是无法破解的数字版权锁。 它能够淘汰最便宜、最常见的 HTML 文本采集方式,但无法阻止愿意执行浏览器渲染、分析字体文件或使用 OCR 的采集者。

普通爬虫只需要完成下载、正文抽取和去重,处理一页文章消耗的网络与计算资源很低。遇到 ShieldFont 后,采集方至少要增加以下一种能力:

  • 字体规则解析可以直接读取 OpenType GSUB 表,尝试还原源码字符与显示字形之间的映射。
  • 无头浏览器渲染可以完整加载 CSS、字体和页面脚本,再从渲染结果中提取内容。
  • 页面截图加 OCR 可以绕过 DOM 文本,但需要额外的浏览器实例、图像存储和视觉识别计算。
  • 视觉模型识别可以理解复杂布局,却会显著增加每页推理延迟与算力支出。
  • 人工校验能够处理映射异常,但无法经济地覆盖数十亿网页。

OCR 是最通用的绕过方式,也是 ShieldFont 希望迫使爬虫采用的高成本路径。 一个只下载 HTML 的采集任务可以并发处理大量页面,而截图意味着必须完成字体下载、页面布局、光栅化和图像识别。单页增加的几百毫秒或数秒看似不多,放大到千万乃至十亿页面后,就会变成可观的 GPU、CPU、存储和调度成本。

开源也让 ShieldFont 的长期防御效果存在上限。 既然字体规则能够被网站部署,采集方同样可以研究其映射方式。对于长期使用同一个静态字体文件的网站,爬虫可能只需解析一次替换表,后续便可批量还原内容。只有定期改变映射、按页面生成字体子集,或者把字体方案与访问控制结合起来,才能继续提高自动还原难度。

这也是 ShieldFont 最矛盾的一点:它选择开源是为了让出版商低门槛部署、公开表达“不授权训练”的立场,但公开规则也降低了大型爬虫适配它的门槛。最终真正被挡住的,可能是个人开发者、小型聚合站和粗放式数据采集器,而不是拥有浏览器集群与视觉模型的大型 AI 公司。

与 robots.txt、WAF 和付费墙相比,它更像主动反制

ShieldFont 与传统反爬方案的最大区别,是它不阻止请求成功,而是降低请求结果的可信度。 robots.txt 依赖采集者自愿遵守,WAF 和验证码试图识别并拦截机器人,付费墙依赖账号和访问权限;ShieldFont 则允许对方拿走页面,只是拿走的内容不再等于读者看到的内容。

| 方案 | 核心机制 | 人类阅读影响 | 对简单爬虫效果 | 主要绕过方式 | 典型副作用 | |---|---|---:|---:|---|---| | robots.txt | 声明禁止特定 User-Agent 抓取 | 无 | 低,依赖自律 | 忽略规则或伪装身份 | 无强制力,难以验证是否被遵守 | | WAF / 速率限制 | 根据 IP、行为和指纹拦截请求 | 中 | 中至高 | 代理池、浏览器自动化、降低频率 | 误伤搜索引擎和正常用户 | | 验证码 | 要求完成交互挑战 | 高 | 高 | 打码平台、视觉模型、人工处理 | 明显破坏阅读体验和转化率 | | 付费墙 / 登录墙 | 通过账户与权限限制正文访问 | 高 | 高 | 共享账户、会话自动化、来源泄露 | 降低内容传播与搜索曝光 | | ShieldFont | 让源码字符与显示字形语义错位 | 页面观看低 | 对纯文本抓取较高 | 字体逆向、无头浏览器、OCR | 搜索、复制、无障碍功能可能异常 | | 图片化正文 | 直接把文章输出为图像 | 中至高 | 高 | OCR、视觉模型 | SEO、可访问性和加载性能较差 |

ShieldFont 的优势在于部署端不需要持续判断访问者究竟是不是 AI。 搜索引擎、普通浏览器和 AI 爬虫可以收到完全相同的 HTML 与字体文件,网站不用参与无休止的 User-Agent、IP 地址和浏览器指纹对抗。这也减少了爬虫伪装成人类浏览器后直接绕过规则的空间。

ShieldFont 的缺点同样来自“所有访问者收到相同内容”。 搜索引擎若直接索引 DOM 文字,可能收录诱饵文本;浏览器页面内查找可能找不到用户眼前的句子;复制粘贴可能得到另一段内容;依赖文本层的翻译、朗读、阅读模式和笔记工具也可能失效。它不是只对 AI 生效,而是对所有不读取最终视觉字形的程序生效。

搜索、无障碍和复制粘贴是最现实的代价

ShieldFont 最大的产品风险不是被破解,而是先伤到网站自己的分发与可用性。 对内容网站来说,搜索流量、站内检索、社交引用和无障碍访问通常比阻挡一个未知爬虫更直接地影响收入。

屏幕阅读器一般读取 DOM 或无障碍树,而不是像人眼一样识别最终绘制的字形。如果 DOM 存放的是诱饵文本,视障用户听到的内容就可能与屏幕显示不同。自动字幕、系统级翻译、浏览器朗读和稍后阅读服务也会遇到同样问题。

搜索引擎优化与 ShieldFont 存在结构性冲突。 Googlebot 等搜索爬虫和 AI 训练爬虫可能接收到相同字节,网站很难在不进行身份区分的情况下,只向搜索引擎提供正常文本。若搜索结果摘要展示错误句子,出版商可能失去排名、点击和品牌可信度;若单独向搜索引擎返回另一版本,又可能被判定为 cloaking,也就是向用户和搜索引擎展示不同内容。

复制粘贴异常会让普通读者最先察觉这层防御。 用户复制一段报道发到聊天软件、做研究笔记或引用到论文时,粘贴结果可能变成诱饵文本。页面看起来没有问题,但内容一离开浏览器就失真,这种体验很难被解释成普通字体故障。

因此,ShieldFont 更适合用于价值高、抓取密集、搜索依赖较低的内容,例如付费研究报告预览、独家数据库、作品集和特定档案页面,而不适合直接覆盖新闻站、百科和开发者文档的全部正文。对于依赖代码复制、站内搜索和辅助阅读的技术网站,这种方案尤其需要谨慎。

“防投毒字体”也可能变成攻击 AI 的工具

同一种字体错位能力既能保护内容,也能欺骗读取网页的 AI Agent。 防御方可以让爬虫读到无价值文本,攻击者也可以反过来让用户看到正常页面,却让 AI 助手读取隐藏指令、虚假安全说明或者被篡改的交易信息。

LayerX Security 在 2026 年 3 月公开的“Poisoned Typeface”研究展示了类似风险。研究者结合替换密码字体与缩小到 1 像素的诱饵文本,让人类和 AI 助手从同一页面读取到不同信息。公开报道显示,测试涉及 ChatGPT、Claude、Gemini、Perplexity 等 11 个助手,这些系统一度都把页面判断为安全;报道还称,微软最终落实了修复,而部分厂商的响应并不完整。

字体现在已经成为网页内容安全边界的一部分。 过去的安全扫描器通常检查 HTML、JavaScript、网络请求和可见文字,却很少验证“DOM 文本”和“屏幕实际显示内容”是否一致。随着浏览器 Agent 能够代替用户阅读邮件、搜索商品、处理后台和确认支付,字体替换可能成为一种新的间接提示注入载体。

面向 AI Agent 的浏览器需要增加多视图比对,包括原始 DOM、无障碍树、字体塑形结果和页面 OCR。当几个视图对同一区域给出明显不同的文本时,系统应降低信任等级,而不是默认源码或截图必然正确。企业安全产品也需要把异常 GSUB 表、超大连字集合和来源可疑的网页字体纳入检测范围。

这场攻防的核心是把“拒绝授权”变成经济信号

ShieldFont 真正有价值的地方不是保证内容永远抓不到,而是让未经许可的批量抓取变得更贵。 网站屏蔽 AI 爬虫一直面临身份识别问题:对方可以更换 User-Agent、分散请求或模拟真实浏览器,而字体投毒不必先确认对方身份,只要采集流程足够廉价,就会收到低质量结果。

项目团队表达的核心原则是:“可被发现,不等于同意用于 AI 训练。”这一判断击中了当前网络协议的空白。HTTP 请求成功只能说明内容可以被访问,并不能自动回答它能否进入商业训练集;robots.txt 又只是约定,不是强制授权系统。ShieldFont 试图用技术摩擦填补许可机制尚未形成的阶段。

对大型模型公司来说,最合理的回应不是继续升级爬虫,而是把授权状态纳入数据管线。 如果采集方需要为每个网站运行浏览器、解析字体、截图 OCR,再额外验证内容是否被投毒,直接购买授权数据可能反而更便宜。ShieldFont 因此更像一种议价工具:它让“无视许可”的成本从接近零,变成一笔能够被财务部门看见的计算费用。

对出版商来说,单独部署 ShieldFont 仍然不够。 更现实的组合是使用清晰的机器可读授权声明、访问日志、速率限制、水印和抽样投毒,同时保留对搜索引擎与辅助技术友好的正常文本通道。字体方案适合承担告警和增加成本的角色,不适合成为唯一防线。

OpenAI Hub 判断:这是好用的减速带,不是护城河

ShieldFont 是目前少数不会立即破坏页面视觉体验的主动反爬思路,但它离通用方案仍有明显距离。 它对只下载 HTML 的低成本爬虫确实有效,也把训练数据争议从法律声明推进到了技术执行层;然而对能够分析开源字体、运行 Chromium 集群或调用视觉模型的采集者,它更多只是增加流程,而非真正阻断访问。

ShieldFont 的短期价值会高于长期价值。新方案刚出现时,大量现有数据管线没有相应检测,诱饵文本可能直接进入数据湖;随着爬虫增加字体异常识别和 OCR 回退,单一静态字体的命中率会下降。双方最终很可能进入字体随机化、视觉抽取、内容验证与反验证的循环。

网页主动污染训练数据标志着开放网络正在失去默认互信。 过去的网站希望机器准确索引内容,以换取搜索流量;现在,一部分内容生产者开始故意让机器读错,以阻止内容未经许可地进入模型。搜索引擎时代形成的“公开页面即可抓取”惯例,正在被生成式 AI 的数据需求重新审视。

ShieldFont 未必会成为反 AI 抓取的最终答案,但它证明了一件事:未来的网页不一定只有“允许访问”和“拒绝访问”两种状态,还可能出现第三种状态——页面对人类开放,对未经授权的机器则主动降低数据质量。

参考来源

  • Ars Technica,2026 年 8 月报道《The web’s newest weapon against AI scrapers is a font》:介绍 ShieldFont 的连字替换机制、项目立场及其对批量抓取成本的影响。因来源域名限制,此处不附站外链接。
  • Help Net Security,2026 年 8 月报道《ShieldFont fights AI scraping by handing crawlers the wrong words》:补充项目时间线、搜索与复制副作用,以及 Poisoned Typeface 安全研究。因来源域名限制,此处不附站外链接。
  • GitHub:检索 ShieldFont 相关开源仓库:用于查找项目代码、字体文件、社区实现与后续分支,下载前应核对仓库所有者及许可证。
  • GitHub:HarfBuzz 字体塑形引擎:理解 OpenType GSUB、连字和浏览器字形塑形过程的权威开源实现。

相关推荐

查看全部