AI 快讯Qwen3-4B少想44%
模型上新

Qwen3-4B少想44%

2026-09-30T10:05:26.560Z
Qwen3-4B少想44%

LessThink-Qwen3-4B在Qwen3-4B基础上做了后训练,让模型用更短的推理过程完成回答。项目作者称推理Token减少44%,且全流程只用一张GPU完成,但目前仍缺少独立基准验证。

LessThink-Qwen3-4B:只用一张 GPU,把模型推理 Token 再压缩 44%

近日,一个名为 LessThink-Qwen3-4B 的开源模型项目引起了开发者社区关注。项目作者称,他在 Qwen3-4B 的基础上进行后训练,让模型在保留原有知识和回答风格的同时,平均减少 44% 的推理 Token;整个训练与处理流程只使用了一张 GPU。

这件事的重点不是又出现了一个更大的模型,而是有人开始直接优化模型的“思考成本”。对于本地部署、边缘设备和高并发推理来说,模型每次回答少生成几百个 Token,往往比参数规模增加几个百分点更有实际价值。

需要先说明的是,截至 2026 年 9 月 30 日,44% 这一数字主要来自项目作者在 Reddit 上的公开介绍,公开资料中还没有看到足够完整的独立复现结果、测试集明细和统一基准报告。因此,LessThink-Qwen3-4B 更适合被看作一个值得关注的后训练实验,而不是已经完成全面验证的生产级替代方案。

LessThink-Qwen3-4B与Qwen3-4B推理Token数量对比示意图

LessThink-Qwen3-4B到底改了什么

推理 Token 是模型在输出最终答案之前,用于分析、拆解问题和组织答案的中间文本单位。 在支持思考模式的模型中,这部分内容通常会被模型先生成,再根据推理结果输出最终回答。

LessThink-Qwen3-4B 的目标并不是重新训练一个拥有更多知识的模型,而是让同一个模型更快结束思考。项目作者的表述是,模型尽量保留 Qwen3-4B 原有的知识能力和回答风格,同时压缩推理过程中的冗余内容。

如果把一次原本需要生成 1000 个推理 Token 的回答作为基准,那么减少 44% 后,理论上只需要约 560 个 Token。对于一次性请求,这意味着生成阶段少走 440 个 Token;对于每天处理 100 万次请求的服务,若任务分布接近这一比例,累计减少的生成量将达到 4.4 亿 Token。

| 项目 | Qwen3-4B基线 | LessThink-Qwen3-4B目标效果 | 实际意义 | |---|---:|---:|---| | 推理Token数量 | 100% | 约56% | 单次回答生成量减少44% | | 模型参数规模 | 约4B | 基于同一基座 | 不依赖更大模型 | | 知识来源 | Qwen3-4B | 继承基座模型 | 重点不在扩充知识 | | 回答风格 | 原始风格 | 作者称尽量保持一致 | 关注输出分布稳定性 | | 训练硬件 | 未适用 | 1张GPU完成项目流程 | 降低实验门槛 |

这里的“减少 44%”应当理解为推理长度压缩,而不是模型推理速度必然提升 44%。实际速度还会受到提示词长度、显存带宽、KV Cache、批处理大小、推理框架和硬件型号影响。模型少生成 44% 的 Token,通常会降低解码阶段的计算量,但不会自动消除输入处理、模型加载和调度开销。

为什么Token更短,部署成本就会下降

KV Cache 是推理过程中保存注意力键值向量的缓存,它会随着上下文长度和生成长度增加而占用更多显存。 对采用自回归生成的模型来说,每生成一个新 Token,都要把对应的中间状态加入缓存。

Qwen3-4B 是一个约 4B 参数的稠密模型,拥有 36 层 Transformer 结构、32 个 Query Attention Head 和 8 个 Key/Value Head,原生上下文长度为 32K。它并不算大,但在本地部署时,显存压力并不只来自模型权重,KV Cache 和运行时缓冲区同样会影响可用并发量。

当一个任务从 2000 个推理 Token 压缩到 1120 个时,模型权重大小不会发生变化,但生成阶段的中间状态会明显减少。对单用户交互而言,收益主要体现在响应更快;对多人并发而言,收益还可能体现为更高的并发数和更少的显存占用。

不过,不能简单地把 44% 的 Token 压缩等同于 44% 的总成本下降。一次请求的总成本可以粗略拆成四部分:

  1. 输入 Token 的预填充计算。
  2. 模型权重读取与矩阵计算。
  3. 推理过程中的逐 Token 解码。
  4. 调度、采样、通信和结果返回。

LessThink-Qwen3-4B 主要影响第三部分,并间接减轻第四部分压力。如果输入上下文很长、输出很短,那么它的收益可能有限;如果任务需要较长的数学推理、代码分析或复杂规划,收益则更明显。

它和量化不是一回事

量化是用更低精度的数据格式存储或计算模型权重,从而减少显存占用;LessThink 则是在模型行为层面减少生成的推理内容。 两者解决的是不同问题,也可以叠加使用。

Qwen 官方公开的推理基准显示,Qwen3-4B 在单卡环境下可以使用 BF16、FP8 和 AWQ-INT4 等不同精度运行。以短输入场景为例,相关测试中 BF16 显存占用约为 7973MB,AWQ-INT4 显存占用约为 2915MB;在 30720 Token 输入场景下,BF16 显存占用约为 12317MB,AWQ-INT4 约为 7742MB。

这些数据说明,量化主要解决“模型能不能放进显存”以及“单位时间能处理多少计算”的问题,而 LessThink 主要解决“模型需要生成多少内容”。一个更现实的组合是:先用 INT4 或 FP8 降低权重和缓存压力,再用 LessThink 缩短推理轨迹。前者像是把行李压缩,后者则是减少旅程本身的长度。

| 优化方式 | 主要优化对象 | 对显存的影响 | 对输出质量的主要风险 | |---|---|---|---| | BF16 | 保持较高计算精度 | 显存占用较高 | 通常较稳定 | | FP8 | 权重或计算精度 | 显存占用下降 | 可能出现精度损失 | | AWQ-INT4 | 权重存储精度 | 显著降低显存 | 复杂任务可能退化 | | LessThink | 推理Token长度 | 降低解码与缓存压力 | 可能跳过必要推理步骤 | | 组合使用 | 权重、计算和行为共同优化 | 综合收益更高 | 需要重新评估质量 |

一张GPU完成,意味着什么

单 GPU 后训练是指模型的训练或后训练流程不依赖多卡集群,而是在一张显卡上完成数据处理、训练和导出。 这不等于任何用户都能用一张低端显卡直接复现全部结果,但它至少说明实验门槛没有大模型训练那么高。

对于 4B 级别模型,单卡实验更容易被个人开发者和小团队接受。开发者可以在有限预算下尝试数据筛选、监督微调、偏好优化或推理轨迹压缩,而不必先搭建多机多卡训练环境。

但“只用一张 GPU”仍然缺少几个关键限定条件:使用的 GPU 型号和显存容量是什么,训练时采用什么精度,数据集规模是多少,训练了多少步,是否使用梯度累积和检查点,以及最终模型是否经过完整的安全性和能力评估。这些信息会直接影响复现成本,也决定“单卡”到底是消费级硬件可行,还是仅代表一张高显存数据中心 GPU。

因此,LessThink 项目最有价值的地方,未必只是最终的 44% 数字,而是它展示了一条低成本的模型优化路线:在不扩张参数规模的前提下,专门针对推理过程做行为压缩。

最大问题:少想之后,模型还会不会做对

推理压缩的核心风险是,模型可能同时删掉冗余步骤和必要步骤,而仅看最终答案无法区分两者。 对简单问答来说,缩短思考过程通常问题不大;但在数学证明、代码调试、长链条规划和多约束决策中,过度压缩可能直接导致错误率上升。

项目作者称 LessThink-Qwen3-4B 保留了基座模型的知识和回答风格,但“知识保留”与“推理能力保留”不是同一个概念。模型可能仍然知道正确事实,却因为推理步骤被压缩而无法稳定地把事实组合成正确结论。

要判断它是否真的有用,至少需要观察以下几类指标:

  • 数学推理准确率是否保持稳定。
  • 代码生成和代码修复的通过率是否下降。
  • 长上下文任务中是否出现更高的遗漏率。
  • 简单任务是否减少了无效思考。
  • 难题上是否出现过早给出答案的情况。
  • 推理长度减少后,答案一致性是否发生变化。
  • 在不同温度、不同最大输出长度下,压缩效果是否稳定。

更严格的评估还应该把“正确率—推理长度”画成曲线,而不是只公布一个平均压缩比例。因为平均减少 44% 可能来自大量简单问题。如果简单问题减少 80%,难题只减少 10%,整体平均值依然会很漂亮,但它并不能说明模型适合复杂任务。

对本地部署开发者的实际意义

对于本地模型用户,LessThink-Qwen3-4B 最值得关注的场景有三个。

第一是个人电脑上的交互式问答。用户通常更在意首字延迟和完整回答时间,而不是模型能否写出很长的思考过程。若压缩后的模型在常见问答、摘要和轻量代码任务上保持稳定,响应体验会比原始思考模式更利落。

第二是显存有限的单卡服务。Qwen3-4B 本身已经适合单卡运行,但长上下文和并发请求会迅速推高 KV Cache 占用。减少输出 Token 后,单请求的缓存增长速度会下降,服务端可以在相同显存下尝试更高并发,或者为每个请求保留更长的上下文空间。

第三是大量短任务的批处理。对于分类、信息抽取、结构化改写这类任务,模型并不需要长篇思考。一个能够主动控制推理长度的 4B 模型,可能比单纯增加参数规模更符合成本约束。

反过来,如果任务是复杂代码代理、长程规划或高风险决策,开发者不应仅凭“Token 少了 44%”就替换原模型。更稳妥的做法是把 LessThink 作为快速路径,把原始 Qwen3-4B 或更大模型保留为复杂问题的兜底路径,再根据任务难度选择模型。

结论:方向正确,但数字还需要更多证据

LessThink-Qwen3-4B 代表了一种越来越重要的模型优化思路:模型效率不只取决于参数量、量化精度和硬件,也取决于它是否会在已经足够确定的问题上继续展开冗长推理。

项目作者披露的 44% Token 压缩具有明确的工程吸引力,尤其适合单卡部署、低延迟交互和高频批处理任务。它的另一个价值在于,4B 级别模型的后训练实验可以由个人开发者或小团队完成,模型行为优化不再完全依赖大规模算力。

但目前最关键的证据仍然缺失:完整评测集、基线对照、不同难度任务的分项结果、训练配置、GPU 型号,以及压缩前后的准确率变化。如果这些数据能够补齐,LessThink-Qwen3-4B 才能从一个有趣的社区实验,进一步成为值得生产部署的轻量推理模型。

编辑判断是:LessThink 的方向比“继续把模型做大”更贴近真实部署问题,但 44% 只是效率指标,不是质量保证。对开发者来说,最值得验证的不是它能少生成多少 Token,而是在少想之后,哪些任务仍然做对,哪些任务已经不能交给它。

参考来源

  1. Reddit:LessThink-Qwen3-4B 项目作者介绍,提供 44% 推理 Token 压缩和单 GPU 完成流程的原始披露。
  2. Hugging Face:Qwen/Qwen3-4B,Qwen3-4B 基础模型页面,可用于核对模型名称与开源模型信息。

相关推荐

查看全部