高分VLM为何删掉关键术语

一项放射报告生成研究发现,常用指标可能奖励模板化、偏正常的输出,却看不见关键临床术语被删除。高分不等于可用,开发者需要重新设计评估体系。
高分模型,可能只是更会迎合评分器
一项针对胸部 X 光放射报告生成的研究近日在开发者社区引发讨论:视觉语言模型可以在 BLEU、ROUGE 等常用指标上拿到不错的分数,同时悄悄删掉具有临床意义的罕见术语,并在报告中加入带有偏差的高频表达。
这项研究题为《Measuring What VLMs Don't Say: Validation Metrics Hide Clinical Terminology Erasure in Radiology Report Generation》,预印本编号为 arXiv:2603.01625。研究者在实际处理胸部 X 光报告生成任务时发现,现有评分方式会奖励重复模板、缺少临床术语以及倾向描述为正常的报告,而这些文本即使读起来流畅,也可能没有足够的临床效用。
视觉语言模型(Vision-Language Model,VLM)是能够联合理解图像与文本,并据此完成问答、描述或生成任务的多模态模型。在放射科场景中,VLM 不只是回答图里有什么,还可能根据 X 光影像直接起草一份包含观察结果和诊断印象的报告。
放射报告生成(Radiology Report Generation,RRG)是根据医学影像自动生成结构化或自然语言检查报告的任务。它看起来像图像描述,但真正的难点不是把句子写顺,而是完整保留部位、程度、侧别、变化趋势和不确定性等临床信息。
截至 2026 年 8 月 1 日,这项工作的价值不在于宣布某个模型又输掉了一项跑分,而在于指出了更麻烦的问题:基准测试本身可能正在系统性地奖励错误行为。

术语擦除,比普通幻觉更隐蔽
术语擦除(terminology erasure)是指模型生成文本时,省略参考报告中具有实际意义的专业词语,尤其是低频、罕见或只在特定病例中出现的术语。它并不一定表现为明显错误,更多时候是把一句具体判断改写成更安全、更常见,也更空洞的句子。
一个典型例子是,参考报告可能写有右下肺局灶性浸润影、少量胸腔积液或心影轻度增大,模型却输出未见明显急性心肺异常。后一句语法正确、风格专业,也很像真实报告模板,但它把决定临床处置的异常信息整个抹掉了。
偏差术语引入(biased term introduction)是指模型在缺乏充分影像依据时,更倾向加入训练数据中常见的词语或结论。它与通常所说的幻觉相关,但关注点更具体:模型不是随机胡说,而是有方向地向高频、模板化或多数类别靠拢。
这种错误之所以危险,是因为它不会像把左肺写成右肺那样立刻刺眼。报告仍然通顺、简洁、符合科室文风,自动评分甚至可能更高,只有熟悉病例和影像的医生才会意识到关键术语消失了。
从产品角度看,这类模型不是偶尔答错,而是在学习一种对评分器最有利、对临床最保守的表达策略。模型发现多写罕见异常会增加与参考文本不一致的风险,于是退回到高概率模板;这和选择题里永远猜出现频率最高的选项没有本质区别。
为什么 BLEU、ROUGE 会奖励一份没用的报告
BLEU 是通过比较候选文本与参考文本之间的 n-gram 重合程度来衡量相似性的指标。ROUGE 是一组以词语或序列召回为核心的文本重合指标,最初主要用于机器翻译和自动摘要评估。
这些指标并不是完全无用,但它们衡量的是文本表面重合,而不是医学事实是否完整。两份报告只要共享大量高频模板,例如心纵隔轮廓、双肺、未见明显、胸腔积液等表达,就可能获得可观分数;一个只出现一次的关键异常词,对总分的影响反而很小。
CIDEr、METEOR 以及基于嵌入的语义相似度也无法自动解决全部问题。语义指标可以减少同义改写带来的误罚,却仍可能把没有急性异常和没有明显异常视为高度接近,而忽略参考报告中被删除的少量积液或局灶性阴影。
常用评估方法与真实风险之间的错位,可以概括为下表:
| 评估方法 | 主要衡量对象 | 容易奖励的输出 | 容易漏掉的问题 | 是否适合单独决定上线 | |---|---|---|---|---| | BLEU | n-gram 精确重合 | 接近参考措辞的模板 | 罕见术语删除、事实冲突 | 不适合 | | ROUGE | 词语或序列召回 | 覆盖大量高频表达的长文本 | 关键概念权重过低 | 不适合 | | METEOR | 词形、同义词与对齐 | 表面改写合理的句子 | 否定、程度和侧别错误 | 不适合 | | 语义相似度 | 向量空间中的整体接近程度 | 主题相近、语言流畅的报告 | 少数关键事实被整体语义淹没 | 不适合 | | 临床术语召回 | 关键医学概念是否保留 | 覆盖参考异常术语的报告 | 无法单独判断术语是否有依据 | 需要与其他指标组合 | | 医学事实图或标签评估 | 实体、属性及关系是否一致 | 临床事实结构完整的报告 | 依赖抽取器质量和标签体系 | 更适合作为核心指标之一 | | 专家盲评 | 临床正确性与可用性 | 真正支持诊疗的输出 | 成本高、速度慢、一致性有限 | 上线前不可缺少 |
关键问题不是某个指标设计得太粗糙,而是开发团队经常把相关性指标当成了任务目标。ROUGE 与报告质量可能相关,却不等于临床完整性;正如代码行数与工程产出可能相关,但不能据此判断程序是否正确。
研究公开摘要没有给出术语擦除的统一百分比、具体模型排名或所有指标的完整效应量,因此不应该凭空补出一个看似精确的性能降幅。这里真正确定的结论是评估方向存在盲区,而不是某个具体 VLM 已被证明在所有数据集上删除了固定比例的术语。
模型为什么总想把病例写成正常
多数类别偏置是模型在类别分布不均衡时,倾向选择出现频率最高答案的行为。胸片数据中的正常或常见描述通常远多于罕见异常,模型只要持续输出保守模板,就能在平均指标上维持体面的结果。
训练目标进一步放大了这种倾向。自回归模型优化的是下一个 token 的概率,高频表达更容易获得稳定梯度;低频术语不仅样本少,而且拼写、缩写和表述方式更加多样,因此更容易在微调、蒸馏或对齐过程中被削弱。
单一参考答案也会把正确的多样表达误判为偏离标准。放射科医生可以用不同句式描述同一征象,但文本指标通常只看到字面差异;开发者为了提升分数,最终会把模型推向训练集里最常见的那套措辞。
解码策略同样可能制造表面上的安全感。较低温度、强束搜索或偏保守的系统提示词可以减少离谱幻觉,却也可能压低罕见术语的生成概率,让模型更频繁地选择无明显异常这一类高概率结论。
这意味着简单要求模型不要幻觉并不足够。一个从不主动描述罕见异常、只会输出正常模板的模型,幻觉率可能很低,但漏诊风险会非常高。
这不只是医疗模型的问题
术语擦除并不是放射报告生成独有的缺陷,而是长文本 VLM 评估中的普遍风险。只要任务包含少量高价值信息和大量低价值模板,平均相似度就可能掩盖关键内容缺失。
在工业巡检中,模型可能正确描述设备、厂房和人员,却省略裂纹、锈蚀或仪表读数异常。在自动驾驶中,模型可能准确概括道路和天气,却漏掉被遮挡的儿童、临时施工标志或逆行车辆。在文档理解中,模型可能复述合同主体和常规条款,却删除违约上限、排他条件或自动续约日期。
现有 VLM 基准已经覆盖 MMMU、MMMU-Pro、OCRBench、DocVQA、ChartQA、MMBench、POPE 等不同能力,但一个模型在多项选择、短答案或通用图像问答中得分领先,并不能推导出它在高风险报告生成中同样可靠。EvalScope 等工具可以降低批量运行公开评测集的工程成本,却不会自动替开发者定义什么才是业务上的严重错误。
VQA 准确率也经常把感知错误与推理错误压成一个数字。模型可能不是不会推理,而是先把导管识别成了其他线状结构;如果评测只记录最终答案错误,团队就无法判断该补视觉数据、知识数据,还是推理链路。
开发者应该怎样重做评估
更可靠的评估体系必须把关键事实保留、错误事实引入和语言质量拆开计算。一个总分无法表达漏掉危急异常与少写一句模板之间的风险差异。
第一步是建立领域术语表,并为术语赋予不同风险权重。普通解剖描述、常见阴性结论、需要复查的异常以及可能触发急诊处置的发现,不应该在评分中拥有同样权重。
第二步是显式计算删除、替换和新增三类错误。开发者至少需要回答三个问题:参考报告中的关键概念保留了多少,模型是否改变了否定、侧别、程度和时间信息,以及模型新增的异常是否能从影像或标签中得到支持。
第三步是把病例级平均分改造成分层报告。建议按正常与异常、常见与罕见、单病灶与多病灶、设备存在与否、图像质量以及不同人群分别统计,避免大量简单样本稀释少数高风险失败。
第四步是为最坏情况设置硬门槛。只看平均值会允许模型用 99 个普通病例的高分抵消 1 个严重漏报,但真实系统不能接受这种交换;危急征象召回率、否定翻转率和无依据异常率应分别设定上线阈值。
第五步是保留人工盲评与错误复盘。专家不应只给整体偏好分,而应标注遗漏实体、错误实体、属性冲突、表达歧义和可能造成的临床后果,再用这些标签反向检查自动指标是否真正有效。
一个可执行的评估清单可以包括:
- 关键术语微平均与宏平均召回率,防止高频术语主导结果;
- 罕见术语召回率,并单独公布样本数和置信区间;
- 否定、侧别、部位、程度和时间变化的属性一致率;
- 无影像依据的术语引入率,以及按风险等级拆分的幻觉率;
- 正常病例与异常病例的性能差值,识别多数类别投机;
- 模板重复度和输出多样性,判断模型是否退化为固定句式;
- 专家判定的临床可用率,以及可能改变处置决策的严重错误率。
重新训练之前,先确认是不是尺子坏了
开发团队面对低质量输出时,通常会先换更大的模型、增加微调数据或调整提示词,但这项研究提醒我们先检查评估尺子。只要目标函数仍然奖励模板重合,更大的模型也可能只是更熟练地生成高分废话。
模型选型也不应直接照搬公开排行榜。通用基准适合回答模型大致能力处于什么位置,却无法替代业务数据上的风险评估;在医疗、制造、金融和自动驾驶场景中,开发者真正需要的是错误分布,而不只是平均得分。
更现实的产品策略是把 VLM 定位为报告草拟与异常提示工具,而不是无监督的最终签署者。系统界面应高亮模型识别到的关键术语、展示对应图像区域,并让审核者快速发现术语缺失和无依据新增,而不是只呈现一段看起来很专业的成文报告。
这项研究最值得记住的判断是:模型没说什么,有时比它说了什么更重要。生成式 AI 的评测长期关注幻觉,即模型凭空加入错误内容;术语擦除则揭示了另一半风险——模型可以一句假话都不说,却通过沉默让输出失去价值。
高分不再是可靠性的充分证据
VLM 基准的下一阶段不该继续追求一个更漂亮的总分,而应解释模型在哪些概念、哪些人群和哪些罕见场景中失效。只有把遗漏、偏差和幻觉分别暴露出来,排行榜才有可能从营销工具变成工程工具。
对开发者而言,最直接的行动不是弃用 BLEU 或 ROUGE,而是降低它们的决策权重。文本相似度可以继续用于监测风格和整体一致性,但涉及关键事实的任务必须增加术语级、属性级、病例级和专家级评估。
对模型厂商而言,公开报告也需要从只报平均分转向公布分层结果。一个真正可信的 VLM,应该说明自己对罕见概念的召回、对否定和侧别的处理、对不同数据分布的稳定性,以及最严重错误会以什么方式发生。
高分模型可能没有更懂影像,只是更懂基准测试的偏好。2026 年的多模态竞争已经不缺会看图写话的模型,真正稀缺的是能够证明自己没有在关键处保持沉默的模型。
参考来源
- Reddit:VLM 高分与临床术语擦除讨论:论文作者介绍胸部 X 光报告生成中的指标缺陷、术语擦除与偏差术语引入问题。
- GitHub:EvalScope:开源模型评估框架,可用于组织和运行包括多模态任务在内的基准测试。
- 知乎:大型视觉语言模型进展综述:梳理 VLM 的对齐、基准、评估方法与主要挑战。



