400万条CoT,专治小模型越想越乱

Scaffold CoT 近日开放约400万条结构化思维链样本,总量约30亿Token,目标是让5B以下小模型推理得更短、更稳。不过项目尚未公布完整跑分,其价值仍需训练实验验证。
Scaffold CoT 近日面向社区发布,这是一套专门针对小语言模型推理失控问题构建的结构化思维链数据集。按照作者在原始发布帖中的说明,数据集包含约400万条样本、合计约30亿Token,每条样本最长2048 Token,主要服务于5B参数以下模型的监督微调与任务专门化。
这次发布最值得关注的地方,不是又多了一套CoT数据,而是它明确把“小模型越想越乱”当作训练目标。作者观察到,5B以下模型使用自由形式思维链时,往往没有获得明显的能力增益,反而会生成更冗长、结构更差、事实错误更多的回答;Scaffold CoT试图用统一的三段式框架,为模型提供一副固定的“推理脚手架”。
不过,Scaffold CoT目前更像一个值得验证的数据工程项目,而不是已经被跑分证明的新训练范式。截至2026年9月2日,作者仍在运行实验,公开材料尚未给出不同基座模型上的基准成绩、消融实验和训练后权重,因此“更简洁、更准确、更可靠”目前是设计目标,不能直接当成已经证实的结论。

Scaffold CoT是什么
Scaffold CoT是一套用固定推理框架组织答案、面向5B以下小语言模型训练的思维链数据集。它不是一个新模型,也不是推理时使用的插件,而是一批可以用于监督微调、继续训练或领域专门化的训练样本。
思维链(Chain of Thought,CoT)是让语言模型在输出最终答案前生成若干中间推理步骤的方法。Jason Wei等人在2022年的经典研究《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》中系统展示了CoT对算术、常识和符号推理任务的帮助,但早期结果也揭示出明显的规模效应:模型必须先具备足够的知识与指令遵循能力,逐步推理才更可能产生收益。
结构化思维链是对自由形式CoT施加固定阶段、长度和表达约束的训练方式。它与一句“请一步一步思考”不同,后者只是要求模型展开过程,前者则进一步规定过程应当如何组织,目的是降低无关展开、重复计算和中途改口的概率。
根据作者披露的信息,Scaffold CoT的关键规模如下:
| 指标 | Scaffold CoT公开数据 | 对训练的直接影响 | |---|---:|---| | 样本数量 | 约400万条 | 能覆盖更多任务类型,也支持抽取子集做领域训练 | | Token总量 | 约30亿 | 已达到中大型指令微调语料规模,完整训练仍有明显算力成本 | | 平均样本长度 | 约750 Token | 由30亿Token除以400万条估算,不是官方单条统计值 | | 单条长度上限 | 2048 Token | 降低长样本造成的显存压力和输出漂移 | | 目标模型 | 正文称5B参数以下 | 对准端侧、本地和消费级硬件可部署模型 | | 推理格式 | 全部样本使用相同三段式结构 | 提供稳定模板,但也可能造成格式过拟合 | | 实验状态 | 仍在进行 | 尚无完整基准成绩,效果不能只凭规模判断 |
原始帖子存在一处需要特别说明的口径冲突。帖子标题括号中写的是“>5B Params”,但正文明确写了“Under 5B parameters”,且整篇描述都围绕小模型展开;本文因此按“5B以下”理解,但这一符号错误仍需要发布者在数据卡或正式论文中澄清。
小模型的问题不是不会写CoT,而是不知道何时停
自由形式CoT是允许模型自行决定推理步骤、顺序和长度的逐步回答方式。对能力足够强的大模型而言,这种自由度可能让模型探索多条路径;对参数更少、知识压缩更激进的小模型而言,自由度却经常变成错误放大器。
小模型生成长推理时面临三个相互叠加的问题。第一,它可能在第一步就调用了错误知识,后续步骤只是在流畅地维护错误前提;第二,每多生成一个Token,就多一次偏离问题的机会;第三,小模型较弱的上下文控制能力容易让它重复已经完成的步骤,甚至在结尾推翻前面的正确答案。
“推理写得更长”也不等于“模型算得更深”。语言模型生成的思维链首先是一段可见文本,它可能对应真实有效的任务分解,也可能只是模型先凭模式得到答案,再补上一段听起来合理的解释;因此,CoT可以增加可读性,却不能自动保证答案正确或过程忠实。
忠实性(faithfulness)是指模型展示的推理过程是否真正支撑并导致最终答案。一个模型完全可能写出逻辑顺滑的错误过程,也可能过程里出现算术错误、最终答案却碰巧正确,所以只评判文字是否像“认真思考”远远不够。
Scaffold CoT的思路,是把开放作文改造成填写结构化答题卡。模型不再被鼓励无限展开,而是反复学习同一套阶段划分:先识别任务与关键信息,再在有限空间内完成推导,最后交付清晰答案。原始发布信息说明每条样本都遵循相同的三个部分,但现有摘要没有完整展示三个区段的准确名称与字段定义,因此不宜凭空补全其Schema。
30亿Token并不意味着消费级显卡可以轻松吃完
2048 Token上限确实降低了单个训练批次的显存门槛,但它没有消除30亿Token带来的总计算量。作者称这一设计有利于在消费级设备上训练,更合理的理解是:开发者可以筛选任务子集、使用LoRA等参数高效微调方法,并把序列长度控制在常见显卡能够处理的范围内,而不是在一张消费级显卡上快速完成全量多轮训练。
监督微调(Supervised Fine-Tuning,SFT)是使用输入与目标输出配对数据继续训练模型、让模型学习特定行为模式的方法。Scaffold CoT最直接的用途就是SFT:把问题作为输入,把遵循脚手架格式的推理与答案作为目标输出,让小模型把统一的解题流程内化为高概率生成模式。
数据规模的工程含义比“400万条”这个数字更复杂。若仅把30亿个Token ID按32位整数保存,理论体积约为12GB;按64位整数保存约为24GB,这还不包含原始文本、索引、元数据和数据集框架开销。真正决定训练门槛的则是模型参数、优化器状态、激活值、精度、批大小以及是否使用参数高效微调,而不是下载文件有多大。
单条2048 Token的上限也体现出一个明确取舍。它牺牲了超长数学证明、复杂代码仓库分析和长文档多跳问答的训练空间,换取更稳定的短程推理、较高的批处理效率和更少的无意义长输出;对3B或4B级本地模型而言,这通常是务实选择。
它与普通CoT、自洽性方法有什么不同
Scaffold CoT解决的是训练数据的组织问题,而自洽性、搜索和验证器解决的是推理阶段的选择问题。它们并不互斥,结构化数据可以先让模型学会稳定地产生候选过程,再由验证器或多次采样筛掉错误答案。
自洽性(self-consistency)是让模型为同一问题生成多条推理路径,再通过多数投票或答案聚合选出结果的方法。它通常比单次CoT更稳,但成本会随采样次数近似线性增加;如果一次回答采样8条路径,生成Token和延迟通常也会接近单路径的8倍。
| 方法 | 主要发生阶段 | 优势 | 主要代价或风险 | 对小模型的适配度 | |---|---|---|---|---| | 直接回答 | 推理阶段 | Token最少、延迟最低 | 复杂任务容易跳步 | 适合简单问答 | | 自由形式CoT | 推理阶段 | 灵活,容易通过提示启用 | 冗长、漂移、错误累积 | 经常不稳定 | | Scaffold CoT式结构化训练 | 训练阶段 | 格式稳定,便于控制长度与任务流程 | 需要高质量数据,可能格式过拟合 | 理论上更适合5B以下模型 | | 自洽性采样 | 推理阶段 | 可通过多路径投票提高鲁棒性 | 生成成本随采样数增加 | 可用,但成本优势会被削弱 | | CoT加验证器 | 训练及推理阶段 | 能检查答案或中间步骤 | 需要额外模型、规则或工具 | 对数学和代码任务更实用 |
Scaffold CoT真正可能带来的收益,是减少“无效思考Token”。如果一个小模型原本需要输出600 Token、期间多次重复和改口,结构化训练后用300 Token完成同一任务,那么输出长度下降50%,实际部署中的生成延迟和推理费用也会随之降低;但这是用于解释产品价值的场景化示例,并非项目已经公布的实测结果。
400万条样本的关键不是数量,而是怎样生成和筛选
合成推理数据最危险的问题是把教师模型的错误批量复制给学生模型。数据量达到400万条后,即使错误率只有1%,也意味着约4万条潜在错误样本;如果某类错误高度集中,模型还可能把它学成稳定规则,而不是随机噪声。
一套可信的CoT数据集至少需要交代五类信息:
- 教师来源:样本由哪些模型生成,是否混合人工数据,是否经过二次改写。
- 答案验证:数学题是否执行计算校验,代码题是否运行测试,事实题是否有来源核对。
- 去重与污染:是否与GSM8K、MATH、HumanEval等评测集进行近似去重。
- 类别分布:400万条数据在数学、代码、逻辑、常识、写作和领域任务之间如何分配。
- 许可与可追溯性:数据能否用于商业训练,原始问题与生成答案的授权边界是否明确。
评测污染是Scaffold CoT后续最需要防范的风险。评测污染是训练数据包含基准题原文、改写题或高度相似解答,导致模型通过记忆而不是泛化获得高分的现象;对于拥有数百万样本的合成数据集,仅做精确字符串去重通常不够,还需要语义近邻检索和人工抽查。
统一三段式结构同样可能产生“脚手架依赖”。模型可能学会稳定输出三个区块,却没有学会判断任务是否需要推理;面对一句简单事实问答,它仍机械地展开三段分析,不仅浪费Token,还可能在额外推导中制造新错误。
数据类别丰富也不自动等于跨任务泛化。作者称数据覆盖大量示例类别,方便提升特定主题表现和做任务专门化,但如果不同类别只是共享输出格式、缺少真正可验证的推理步骤,模型学到的可能只是文风一致性,而不是可迁移的算法能力。
判断它有没有用,至少要看四组实验
Scaffold CoT是否有效,不能只比较微调前后模型,而应比较相同Token预算下的不同数据策略。最有说服力的实验,是在同一个1B、3B和5B以下基座上,分别使用直接答案数据、自由CoT数据、Scaffold CoT数据和随机混合数据进行等量训练。
第一组实验应该测准确率与输出长度的联合变化。一个结果只有在准确率上升、平均推理Token下降或至少不明显增加时,才能支撑“更简洁、更可靠”的定位;如果准确率只提高0.5个百分点,却让输出长度翻倍,部署价值就很有限。
第二组实验应该测格式之外的泛化能力。训练中未出现的任务类别、不同措辞的问题以及更长或更短的输入,都应被纳入评测,否则模型可能只是记住了固定模板。
第三组实验应该做框架消融。研究者需要分别移除三段式结构、长度限制和类别采样策略,观察究竟是哪一部分产生收益;如果去掉区段标题后表现几乎不变,那么真正有效的因素可能是数据质量,而不是Scaffold本身。
第四组实验应该测推理忠实性与答案校验率。数学任务可以逐步执行计算,代码任务可以运行测试,逻辑题可以使用规则验证器;仅由另一个语言模型判断“这段推理看起来是否合理”,容易让两个模型共享同一类幻觉。
我们的判断:方向靠谱,但现在还不能把它当作小模型推理答案
Scaffold CoT抓住了一个真实痛点:小模型缺少的往往不是输出更多步骤的许可,而是控制步骤数量、顺序和目标的能力。对本地Agent、端侧助手、垂直领域问答和低成本批处理系统来说,训练模型少说废话、减少自我矛盾,通常比追求更长的“深度思考”更有商业价值。
这套数据的最大潜力在于成为可拆分的训练原料。开发者未必需要使用完整30亿Token,而可以按数学、代码、规划或特定行业抽取子集,在1B至4B级模型上做参数高效微调,再用可执行验证器检查结果;这种组合比直接让小模型模仿大型模型的长篇推理更实际。
这套数据的最大不确定性则是尚无公开实验闭环。没有基座模型、训练配方、对照组、数据污染检查和基准成绩,400万条样本只能证明项目规模,不能证明训练效果;而CoT数据尤其容易出现“文字更像推理,答案却没有更准”的假进步。
近期更值得关注的不是作者能否做出一张漂亮的总榜,而是Scaffold CoT能否在相同模型、相同训练Token和相同推理预算下稳定胜过自由CoT。如果它能让3B级模型以更短输出获得更高正确率,这套数据会对消费级硬件训练和端侧部署很有价值;如果提升主要来自输出格式更整齐,它就更接近一套大规模风格微调数据,而不是小模型推理能力的突破。
参考来源
- Scaffold CoT原始发布帖:作者披露约400万条样本、约30亿Token、2048 Token长度上限和目标模型范围,并说明实验仍在进行。
- 一文读懂:思维链CoT:介绍CoT的基本机制、模型规模效应及其在小模型上的局限。
- 大语言模型思维链学习笔记:汇总CoT提示的原理、局限,以及小模型、验证器和事实准确性等研究方向。



