4B小模型,逼近o3医学答题

瑞典医学考试实验显示,Qwen3.5-4B开启推理后达到87%准确率,仅低于o3参考成绩1个百分点。但数据集口径并不完全一致,真正值得关注的是领域后训练与推理控制正在快速抬高4B模型的能力上限。
4B模型把医学考试做到了87%
一组最新的瑞典医学考试实验,把4B级开放权重模型推到了接近o3的答题水平。当地时间近日,开发者Taro Langner公布了MedQA-SWE上的测试结果:MedGemma-1.5-4B经过监督微调后,在最后一年考试中达到60%的及格线;更新的Gemma4-E4B与Qwen3.5-4B即使不做额外后训练,也能取得77%准确率;Qwen3.5-4B开启推理后进一步达到87%。
这个结果最吸引眼球的地方,是87%距离o3此前公布的88%参考成绩只有1个百分点。作为对照,GPT-4在2024年的相关测试中得到84%,o3在2025年一个规模更小、与MedQA-SWE部分重叠的数据集上得到88%。
但这不是一次可以直接宣布“4B模型追平o3”的严格对决。实验者已经明确指出,o3使用的是更小且仅部分重叠的数据集,测试样本、提示词、推理预算和评分流程都可能不同;在没有置信区间和逐题复核结果的情况下,87%与88%的差距也未必具有统计意义。
更准确的结论是:4B开放权重模型已经能在边界清晰的专业选择题任务上,进入头部闭源推理模型此前所在的分数区间。

先看数字:相差1分,不等于已经追平
MedQA-SWE是一个以瑞典医学执照考试选择题为基础构建的问答数据集,用来评估模型理解瑞典语医学知识、临床情境和考试表达的能力。它的价值不只是“医学题”,还在于语言相对小众:模型既要具备医学知识,也要处理瑞典语术语和本地考试习惯。
目前公开信息可以整理为下表:
| 模型 | 参数规模 | 是否额外后训练 | 是否启用推理 | 准确率 | 结果口径 | |---|---:|---|---|---:|---| | MedGemma-1.5-4B | 4B | 是,使用较早年份数据做SFT | 未特别说明 | 60% | MedQA-SWE最后一年考试,达到及格线 | | Gemma4-E4B | E4B级 | 否 | 默认设置 | 77% | 实验者在同一项目中的近期测试 | | Qwen3.5-4B | 4B | 否 | 关闭 | 77% | 实验者在同一项目中的近期测试 | | Qwen3.5-4B | 4B | 否 | 开启 | 87% | 推理长度受控时的结果 | | GPT-4 | 未公开 | 不适用 | 闭源模型 | 84% | 2024年相关测试 | | o3 | 未公开 | 不适用 | 推理模型 | 88% | 2025年更小且部分重叠的数据集 |
表格里最重要的信息不是4B对o3的“1分之差”,而是同一个Qwen3.5-4B从77%升到87%的10个百分点增益。按相对错误率计算,准确率从77%提升至87%,意味着错误率由23%降至13%,错误数量减少约43.5%。这比单看10个百分点更能说明推理阶段的价值。
这组数据也展示了小模型进步的两条路线。第一条是用领域数据做监督微调,让原本不及格的模型跨过可用门槛;第二条是直接采用更新的基础模型,再通过推理预算和终止策略释放能力。前者把MedGemma-1.5-4B推到60%,后者让更新模型在零额外训练时就达到77%。
SFT能让旧模型及格,但模型代际更替更快
SFT是监督微调,即使用带有标准输入与目标答案的数据继续训练模型,使其适应特定任务的知识分布、输出格式和解题方式。在这次实验中,开发者使用较早年份的考试数据训练MedGemma-1.5-4B,再把最后一年考试留作测试,最终得到60%的及格成绩。
按年份切分训练集和测试集,是这项实验比较合理的设计。随机切分医学考试题很容易让同一知识点、相似题干甚至改写题同时进入训练集与测试集,而按时间留出最后一年,更接近真实部署场景:模型学习过去的考试,再回答未来出现的新题。
领域SFT的实际作用,往往不是给模型“灌入整本医学教材”。它更像是在调整模型的答题接口:学会瑞典医学术语如何出现、临床线索应当如何排序、多个看似合理的选项中哪个更符合考试委员会的预期,以及最终应当用什么格式提交答案。
不过,MedGemma微调后的60%仍被三个月后出现的新模型以77%明显超过,差距达到17个百分点。这意味着开发者不能只问“要不要微调”,还要先问“是不是选错了底座”。当基础模型迭代足够快时,更换模型获得的收益,可能大于为旧模型准备数据、训练和调参的全部收益。
开放权重模型是指模型参数可以被下载、检查并在本地或私有环境部署的模型,但它不必然等同于符合OSI定义的开源软件。对医疗、法律和金融团队而言,开放权重的核心价值是数据不必离开受控环境,并且团队能够固定模型版本、审计推理流程和执行离线评估。
这也是4B模型比大型闭源模型更有现实意义的地方。4B参数在低比特量化后通常可以部署到消费级GPU、工作站甚至部分高内存边缘设备上;团队可以为单一科室或单一语种维护专用版本,而不必把所有问题都交给一个昂贵且不可控的通用模型。
真正的提升来自“会想”,但想太久也会失控
推理轨迹是模型在输出最终答案前生成的中间分析文本或隐式思考序列。Qwen3.5-4B在关闭推理时得到77%,开启推理后达到87%,说明不少题目并非缺少医学事实,而是需要把症状、检查结果、危险因素与选项逐步对应。
医学选择题尤其容易从推理模式中获益。模型可能同时记得多种疾病与某个症状有关,但必须进一步判断患者年龄、病程、化验结果和发病概率;如果直接凭最高相关性作答,模型容易选中“听起来最像”的疾病,而不是临床条件最吻合的答案。
推理长度却不是越长越好。实验者发现,取消思考长度上限后,个别推理轨迹会陷入关于答案格式的重复循环,直到填满整个上下文窗口,最后仍不给出有效答案。这类失败不是知识不足,而是模型的终止控制失灵。
上下文窗口是模型一次推理能够处理的最大token范围。当重复内容占满窗口时,增加推理预算不会带来更准确的判断,只会提高延迟、显存占用和失败概率;对线上系统而言,这种长尾请求甚至比平均准确率低几个点更麻烦。
实验者因此采用了S-GRPO论文提出的early exit thinking干预。Early exit thinking是一种提前终止无效推理的机制:当模型已经得到稳定答案,或推理开始出现重复、格式纠缠等低收益模式时,系统让模型结束思考并提交当前结论。
这类机制的意义类似编译器中的循环保护,而不是简单粗暴地砍掉所有长答案。合理的早停策略要区分“仍在解决问题”与“已经原地打转”:前者需要更多token,后者继续生成只是在消耗计算资源。
后训练正在从“教知识”转向“塑造行为”
后训练是基础预训练完成后,用监督数据、偏好反馈、强化学习或领域任务继续优化模型行为的过程。它过去经常被理解为给通用模型补充专业知识,现在则越来越像一套完整的行为工程:不仅决定模型知道什么,还决定它何时思考、思考多久、如何停止以及怎样交付答案。
这次实验体现了三种不同层次的优化:
- 领域适配:用往年瑞典医学试题做SFT,让模型熟悉任务分布与本地语言。
- 推理激活:让同一模型在回答前展开多步分析,把准确率从77%提高到87%。
- 推理控制:通过early exit限制重复循环,降低无限思考带来的超时与无答案风险。
开发者最容易高估的是第一层,而忽略后两层。一个模型即使掌握相关知识,如果无法稳定地把中间推断收束到规定选项,仍然不是可靠的产品;相反,模型即使参数不大,只要任务边界清楚、输出空间有限、推理流程受控,也可能在单项基准上达到很高的准确率。
这解释了为什么4B模型能在医学选择题上接近o3,却不能据此推出它具备相同的通用医学能力。多项选择题给出了有限候选答案,模型可以利用排除法和选项先验;真实临床工作则要求主动收集病史、识别信息缺口、处理开放式记录,并对不确定性负责,两者难度不是一个量级。
87%仍不足以证明可用于临床决策
基准高分与临床安全之间存在明显鸿沟。MedQA-SWE测量的是考试答题准确率,而不是诊断敏感度、治疗建议安全性、药物剂量可靠性或对罕见病的识别能力;模型答对一道选择题,也不代表它能解释为什么其他选项危险。
医学评估还需要关注准确率掩盖的问题。假设100道题中答对87道,剩余13道错误可能随机分布,也可能集中在急症识别、孕产妇用药或儿童剂量等高风险领域;对考试而言它们都是一分,对医疗系统而言风险完全不同。
数据污染也是必须排查的变量。数据污染是指测试题或高度相似的内容在预训练、微调或公开网页语料中出现,导致模型通过记忆而非泛化取得高分。瑞典执照考试是否公开、题目是否被网页转载、不同年份是否存在近似改写,都会影响最终结论。
目前公开材料还不足以回答几个关键问题:测试集究竟包含多少道题、87%的置信区间多大、推理模式使用了多少平均token、早停前后的超时率如何、不同随机种子是否稳定,以及逐学科错误分布是否一致。缺少这些信息时,这组成绩更适合作为强信号,而不是确定性排名。
对开发者而言,正确顺序不是先微调
这项实验给开发团队最直接的启示,是建立领域模型时应先做底座筛选,再决定是否投入后训练。更新的4B模型在无额外训练时达到77%,比微调后的旧模型高17个百分点;如果团队一开始就锁定MedGemma-1.5-4B,后续很可能在一个已经落后的底座上不断追加成本。
一个更现实的评估顺序是:
- 先建立时间隔离的测试集:优先按年份、机构或来源切分,避免随机切分造成相似样本泄漏。
- 横向测试多个新底座:至少比较默认回答、推理模式和不同量化版本,不能只看模型卡上的通用跑分。
- 记录准确率之外的指标:包括平均推理长度、P95延迟、无答案率、格式错误率和重复循环率。
- 再判断是否需要SFT:如果错误来自术语、格式和任务习惯,SFT通常有效;如果错误来自底层知识与推理能力,更换底座可能更划算。
- 最后加入终止和回退机制:检测重复片段、限制最大推理预算,并在模型未给出有效选项时触发重新回答或人工复核。
小模型的产品优势最终要由总成本证明,而不是由单一准确率证明。Qwen3.5-4B从77%提高到87%很亮眼,但如果推理token增加数倍、长尾请求频繁占满上下文,其吞吐优势可能被部分抵消;early exit的价值就在于把准确率收益保留下来,同时控制推理成本的失控部分。
这不是o3被4B替代,而是专业任务开始重新定价
这次结果真正改变的是专业AI任务的成本预期。过去,接近前沿模型的领域表现通常意味着更大的参数规模、更高的推理费用和对闭源服务的依赖;现在,一个4B级模型在合适的数据、推理模式和早停策略下,已经可能覆盖大量结构化专业问答需求。
但“接近o3”必须加上明确限定:这是瑞典医学考试选择题,是不同年份、不同规模且部分重叠数据集上的参考比较,不是同一盲测环境中的全面胜负。把87%包装成4B模型已经全面追平o3,是营销;把它视为小模型在窄领域具备替代价值的证据,则是更有用的工程判断。
截至2026年7月26日,这组实验尚属于开发者公开的项目结果,而非经过同行评审的大规模医学评测。它值得关注,不是因为又多了一张模型排行榜,而是因为它清楚展示了下一阶段的小模型竞争方式:底座进步负责抬高起点,领域SFT负责适配任务,推理模式负责突破准确率,early exit负责把不可控的思考拉回工程现实。
参考来源
- Reddit:Open-weight 4B models approach o3-level medical question answering in Swedish:实验作者公布MedQA-SWE成绩、推理模式表现与重复循环问题的原始讨论。
- GitHub:medqaswe_medgemma_sft:MedGemma-1.5-4B在瑞典医学考试数据上进行监督微调的实现与实验项目。



