紫东太初GMC砍掉80%视觉Token

紫东太初提出免训练的GMC核心集剪枝方法,可减少约80%输入Token,同时尽量保持多模态能力。它真正解决的是视觉大模型推理阶段的算力浪费,而不是再造一个新模型。
紫东太初把多模态模型的冗余Token砍掉了八成
紫东太初近日提出GMC核心集剪枝方法,在不重新训练模型的前提下,可减少约80%的多模态Token,并尽量保持原有视觉理解与推理能力。对开发者来说,这项工作的价值并不在于刷新某个模型榜单,而在于提供了一条更现实的推理优化路线:模型参数不用动,部署流程不用推倒重来,先把送进Transformer的大量重复视觉信息清掉。
GMC是一种面向多模态大模型的免训练核心集剪枝方法,其目标是从数量庞大的视觉Token中选出一个更小、但仍能代表原始输入的子集。按照目前披露的信息,GMC可将Token数量压缩约80%,也就是只保留原始规模的约20%。

这项方法切中的问题很具体:图像分辨率越来越高,但真正影响回答的区域通常没有同步增加。一张工厂巡检照片可能被切成数百乃至数千个视觉Token,其中大部分只是连续墙面、地板或天空;一页文档截图也可能产生大量背景、边距和重复纹理。模型却需要让这些Token逐层参与注意力计算,等于把算力花在重复阅读上。
紫东太初此次强调的“免训练、开箱即用”,比“减少80% Token”本身更值得关注。训练后剪枝、蒸馏和稀疏化并不新鲜,但它们往往需要额外数据、再训练流程和模型版本管理;GMC试图把优化过程移到推理阶段,让已有多模态模型在不更新权重的情况下直接受益。
核心集不是简单地少看几块图
视觉Token是视觉编码器将图片切分、编码后得到的向量单元,也是多模态大模型理解图像时实际处理的基本输入。常见视觉语言模型不会直接“看见”一张完整图片,而是先把图片转换成一串向量,再与文本Token一起交给语言模型或跨模态模块处理。
Token剪枝是在推理过程中删除低价值Token、减少后续计算量的技术路线。最粗暴的做法是随机删除或均匀采样,但这样很容易把面积很小却决定答案的内容删掉,例如仪表盘上的异常读数、交通标志中的一个数字,或者表格里唯一出现负号的单元格。
核心集则是能够近似代表完整样本集合的一小组样本。把它放到视觉Token场景中,可以理解为:不是机械地每隔几个Token留一个,而是寻找一批具有代表性的Token,让它们尽可能覆盖原图中的语义、区域和特征分布。
GMC的核心判断因此不是“哪些Token看起来显眼”,而是“保留哪些Token后,剩余集合仍能代表原始图像”。这种区别非常重要。显著性方法往往偏爱主体和高对比度区域,核心集方法则更关心覆盖范围与信息多样性;前者像只圈出照片里最醒目的物体,后者更像从整份材料中挑出足以还原全貌的关键页。
从工程逻辑看,GMC需要在剪枝收益与选择开销之间取得平衡。选择核心集本身也要计算相似度、距离或代表性,如果筛选过程比模型省下的计算还贵,方法就失去了部署价值。因此,评价GMC不能只看Token保留率,还要看端到端延迟、首Token时间、峰值显存和吞吐量。
少80% Token,不等于推理成本直接少80%
80%的Token削减首先代表输入序列明显缩短,但不能直接换算成80%的端到端成本下降。多模态模型的实际耗时还包括图片预处理、视觉编码器计算、核心集选择、文本解码、权重读取和通信开销,只有发生在剪枝之后的模块才能完整享受收益。
自注意力的Token两两交互部分具有近似平方复杂度。假设某一计算阶段原本处理1000个视觉Token,剪掉80%后剩200个,那么视觉Token之间的注意力矩阵规模将从约100万项降至约4万项,理论降幅为96%。但这只是局部计算量,不代表整条推理链路也会加速25倍。
端到端收益取决于GMC被插入模型的具体位置。如果剪枝发生在视觉编码器完成之后,前面的图像编码成本不会减少;如果只减少送入大语言模型的视觉Token,那么主要受益的是跨模态投影、预填充阶段以及后续处理视觉上下文的Transformer层。
文本生成阶段也不会按相同比例提速。对于“看图后生成500字说明”这类任务,后半段主要成本来自逐Token解码,视觉Token减少对每一步缓存长度有帮助,但无法消除语言生成本身的串行开销;对于文档分类、视觉问答和目标判断这类短输出任务,输入预填充占比更高,GMC通常更容易体现收益。
| 指标 | Token减少80%后的理论变化 | 是否等同于实际收益 | |---|---:|---| | 视觉Token数量 | 降至原来的20% | 是 | | 纯视觉Token注意力矩阵 | 可降至原来的4% | 仅限相关注意力层 | | KV Cache占用 | 与被保留的上下文规模相关,通常明显下降 | 取决于模型结构与缓存策略 | | 视觉编码耗时 | 可能不变 | 取决于剪枝位置 | | 端到端延迟 | 有望下降 | 不能直接宣称下降80% | | 输出质量 | 目标是尽量保持 | 仍需按任务逐项验证 |
GMC最直接的收益可能不是单请求跑得多快,而是相同硬件能否承载更多并发。企业部署多模态模型时,单张图片增加数百或数千Token,会迅速推高显存占用;将视觉上下文压缩到原来的20%,意味着调度器有机会在同一批次中塞入更多请求,也可能降低长上下文触发显存溢出的概率。
“满血保真”需要拆成不同任务看
所谓保持多模态能力,是指剪枝后模型在图像理解、视觉问答、文档识别或多模态推理等任务上的表现尽量接近原始模型。它不应被理解为所有图片、所有任务和所有指标都能做到绝对零损失。
平均跑分接近原模型,并不能证明长尾场景没有退化。视觉Token高度冗余在自然图片中通常成立,但在密集文字、遥感影像、病理切片、复杂表格和工业缺陷图中,一个面积很小的区域也可能包含决定性信息;核心集如果偏向全局覆盖,仍可能遗漏低频但关键的细节。
“减少80% Token”也必须明确统计口径。它可能指视觉Token、全部输入Token、某一层之后的Token,或者在特定数据集上的平均剪枝比例,这些口径对应的工程意义并不相同。当前公开报道给出了80%这一核心数字,但开发者在正式接入前仍应核对论文或项目材料中的模型结构、任务范围、硬件配置和评测设置。
更可信的验证方式不是只看综合平均分,而是同时报告以下四组结果:
- 能力指标:视觉问答、OCR、图表理解、空间关系和多步推理的准确率变化;
- 效率指标:首Token延迟、预填充耗时、端到端延迟和每秒请求数;
- 资源指标:峰值显存、KV Cache占用、GPU利用率和批处理上限;
- 鲁棒性指标:小目标、密集文字、低对比度目标及超高分辨率图像上的最差性能。
真正有意义的“保真”应当同时约束平均性能和最差性能。假如综合准确率只下降0.2个百分点,但小目标识别下降8个百分点,那么它适合普通图像问答,却未必适合质检、医疗或安全场景。
GMC和已有剪枝路线有什么不同
免训练剪枝是无需更新模型权重、只在推理阶段决定Token去留的压缩方法。它的优势是部署门槛低,缺点则是无法像联合训练那样,让模型提前适应被删除后的信息分布。
2025年复旦团队提出的PTP,也属于免训练视觉Token剪枝路线。PTP即金字塔Token剪枝,重点是融合区域、Token和指令三个层级的重要性;GMC则从目前披露的定位看,更强调通过核心集选择保留具有代表性的多模态信息。
| 路线 | 选择依据 | 是否需要训练 | 主要优势 | 主要风险 | |---|---|---:|---|---| | GMC核心集剪枝 | Token集合的代表性与覆盖能力 | 否 | 可压缩约80% Token,适合接入现有模型 | 核心集搜索开销及细粒度信息遗漏 | | PTP金字塔剪枝 | 区域、Token与指令三层重要性 | 否 | 同时考虑图像结构和用户指令 | 对任务相关性判断较为敏感 | | 注意力分数剪枝 | 模型内部注意力权重 | 通常否 | 实现直观,能复用模型信号 | 注意力高低不一定等于信息价值 | | Token合并 | 将相似Token聚合为更少的Token | 通常否 | 不必完全丢弃重复区域 | 合并可能模糊边界和局部细节 | | 蒸馏或训练式剪枝 | 通过数据和损失函数学习压缩 | 是 | 模型可主动适应压缩 | 训练成本高,维护链路更复杂 |
GMC的实际竞争力将取决于模型无关性。如果它只能适配紫东太初自身架构,价值主要体现在自家产品降本;如果能够稳定迁移到不同视觉编码器、不同投影模块和不同语言模型上,它才有机会成为通用的推理优化组件。
GMC还需要证明自己能处理动态任务。同一张图片面对不同问题,关键区域并不相同:用户问汽车颜色时,车身最重要;用户问车牌号码时,面积很小的车牌才是核心。如果剪枝过程不理解指令,通用核心集可能保留画面代表性,却未必保留问题所需信息。
哪些场景最值得先试
高分辨率文档理解是GMC最值得验证的场景之一。合同、财报和论文页面往往含有大量空白、页边距及重复排版元素,如果核心集能够保留标题、表格、数字和关键段落,Token压缩可以直接缓解长文档多页输入带来的上下文压力。
视频理解也可能获得更高收益。视频会同时产生帧间重复和帧内重复,静止背景、相邻画面和重复动作会生成大量相似Token;核心集方法如果进一步覆盖时间维度,压缩空间可能比单图更大,但也必须避免漏掉只出现一两帧的关键事件。
具身智能和边缘部署则更看重稳定延迟。机器人持续接收相机画面,视觉Token会不断进入推理链路,减少冗余可以降低显存和功耗压力;然而机器人决策对小目标、突发事件和空间关系极其敏感,因此不能只用平均准确率决定是否上线。
普通低分辨率图片未必能获得同等回报。输入本来只有少量视觉Token时,核心集筛选的固定开销可能抵消节省的计算,开发者应设置触发阈值,而不是对每个请求无条件启用剪枝。
开发者应该怎样评估GMC
开发者评估GMC时应先做任务分层,而不是直接用公开平均分替代业务测试。推荐把内部样本分成普通样本、密集信息样本、小目标样本和极端样本,再分别比较不开剪枝、剪枝50%、剪枝70%和剪枝80%的质量与延迟。
业务验收还应关注分位数延迟。平均延迟下降不代表线上体验稳定,核心集搜索如果在复杂图片上耗时波动较大,P95或P99延迟可能反而变差;对实时系统而言,尾延迟通常比平均值更重要。
工程团队也应保留自动回退机制。对于OCR密集页面、医学图片、仪表读数或检测到大量小目标的图片,可以降低剪枝比例或直接走完整Token路径;对背景简单、主体明确的图片,则可以采用更激进的压缩率。
可观测性是这类优化进入生产环境的前提。至少需要记录原始Token数、保留Token数、筛选耗时、预填充耗时、总延迟和任务置信度,才能判断系统究竟是在减少有效成本,还是只把计算从模型内部转移到了预处理环节。
这是一项务实的推理优化,但还不是万能按钮
GMC代表了多模态模型优化方向的一次明显转变:行业不再只追求更大的视觉编码器和更多的视觉Token,也开始认真处理输入冗余。与量化主要压缩参数、KV Cache优化主要压缩历史上下文不同,核心集剪枝直接减少模型必须阅读的视觉信息量,三者可以叠加,而不是相互替代。
GMC目前最有吸引力的地方,是它把“降本”从重新训练模型变成了推理前的选择问题。对已经部署多模态模型的团队,这意味着更低的试验成本,也意味着可以在不更换底座模型的情况下,继续挤出吞吐和显存空间。
GMC目前最需要补齐的证据,则是完整的端到端测试和跨模型验证。80%的Token压缩是一个足够醒目的数字,但只有当首Token延迟、吞吐、峰值显存和长尾任务质量同时公开时,开发者才能判断它究竟是论文层面的漂亮比例,还是可以直接落到生产环境的优化方案。
截至2026年8月12日,紫东太初这项工作值得关注,但更适合被理解为一套有潜力的多模态推理“减负方案”,而不是无条件保持全部能力的魔法开关。它的方向是对的:与其让模型反复处理背景和重复纹理,不如先决定哪些内容真正值得看。
参考来源
- 知乎:复旦提出PTP金字塔Token剪枝——介绍另一种融合区域、Token和指令三层重要性的免训练视觉Token剪枝方法,可用于理解GMC所处的技术路线。



