小红书开源280B全模态模型

小红书开源 dots3-note preview,以 280B 总参数、16B 激活参数和 512K 上下文主攻长程 Agent。昇腾在发布当天完成文本、视觉、语音全链路适配。
小红书把 dots3 系列的第一张牌打向长程 Agent
小红书 dots 模型实验室近日正式开源 dots3-note preview,这是一款采用 MoE 架构、总参数量达到 280B 的多模态模型,也是 dots3 系列首个公开版本。模型支持文本、图像、视频与音频输入,提供 512K 上下文窗口,并针对复杂推理、Agent 和长程开放任务做了专项优化。
这次发布的重点不是再做一个擅长刷题的聊天模型,而是尝试让模型在信息不完整、目标会变化、执行链条很长的环境里持续工作。旅行规划、婚礼筹备、开店经营和游戏决策,都是 dots3-note preview 想要处理的典型任务:它们没有唯一正确答案,也很难靠一次推理直接完成。
更值得注意的是,华为在模型发布当天完成了昇腾平台的 0 Day 适配。根据华为官方披露的信息(IT之家转述),Atlas 800 A3 与 Atlas 900 A3 SuperPoD 已可通过 vLLM Ascend 部署 dots3-note preview,并保留文本、视觉、语音一体化的原生理解能力。

280B 参数不等于每个 Token 都计算 280B
MoE(Mixture of Experts,混合专家)是一种只为每个输入激活部分专家网络的稀疏模型架构。 dots3-note preview 拥有 280B 总参数,但单次前向计算仅激活约 16B 参数,目的就是在扩大模型知识容量的同时,把每个 Token 的实际计算量控制在更低水平。
公开资料显示,模型包含 256 个路由专家和 1 个共享专家,每层通过 Top-8 路由选择参与计算的专家。共享专家负责承接高频通用能力,路由专家则更像不同方向的专业小组;每个 Token 不需要把所有专家都叫进会议室,而是由路由器挑出最相关的 8 个参与处理。
这种设计降低的是计算量,而不是模型权重的存储与通信压力。280B 参数仍意味着权重加载、多卡切分、专家调度和设备间通信都相当重,因此“16B 激活参数”不能直接理解为“部署成本等同于普通 16B 稠密模型”。对于开发者来说,dots3-note preview 依然属于数据中心级模型,而不是一张消费级显卡就能完整运行的轻量模型。
模型目前披露的关键规格如下:
| 项目 | dots3-note preview 规格 | 实际意义 | |---|---:|---| | 总参数量 | 280B | 决定模型总体容量,也带来较高显存与存储要求 | | 激活参数量 | 16B | 单个 Token 只调用部分专家,减少实际计算量 | | MoE 路由 | 256 个路由专家、1 个共享专家、Top-8 | 用稀疏激活换取容量与计算效率的平衡 | | 上下文窗口 | 512K Token | 可容纳长文档、工具轨迹和多轮环境反馈 | | 多模态输入 | 文本、图像、视频、音频 | 面向跨模态理解,不局限于文字问答 | | 主要方向 | 推理、Agent、长程任务 | 强调持续规划、执行、观察和纠错 | | 发布状态 | Preview、开源权重与代码 | 可研究和部署,但体验与工程细节仍可能调整 |
512K 上下文只是长程任务的起点
长程 Agent 是能够围绕一个目标持续规划、调用工具、观察结果并修正策略的智能体。 这类系统的难点不只是上下文够不够长,而是模型能否在几十次甚至数百次操作后,仍记得目标、约束条件、失败原因和待办事项。
512K 上下文可以装下大量网页、文档、截图、音频转录和执行轨迹,但“能装下”不代表“能稳定利用”。长上下文模型常见的问题包括注意力稀释、早期约束被遗忘、重复尝试已经失败的方案,以及把一次偶然成功总结成错误规则。对于真正运行数小时的 Agent,这些问题通常比单轮回答是否漂亮更关键。
小红书为 dots3-note preview 强调了一套面向开放环境的观察、假设与验证流程。模型在执行中遇到错误时,可以进行 Self-Critiquing,也就是主动回看此前决策,识别错误假设,并把修正后的规则写入外部记忆文件。外部记忆的意义是把关键经验从不断膨胀的对话历史中抽出来,形成一个更短、更稳定的任务状态。
这种机制并不神秘,本质上类似一名工程师边排查故障边维护故障记录。上下文窗口像桌面上摊开的全部材料,外部记忆则像持续更新的工作笔记;前者提供完整信息,后者负责保留真正影响下一步行动的结论。
官方展示的案例包括让模型接管《杀戮尖塔 II》。模型此前没有针对该游戏进行专门训练,却能从环境反馈中学习卡牌和敌人机制,同时管理生命值、牌组、金币、药水与路线选择,最终推进到第 33 层。这个案例的价值不在于游戏层数本身,而在于它要求模型处理延迟回报:当前拿一张牌是否划算,可能要几十个回合后才知道。
不过,演示案例仍不能替代可复现评测。长程 Agent 对浏览器环境、工具权限、重试次数、采样参数和失败判定方式高度敏感,只展示成功轨迹很容易高估系统稳定性。开发者真正需要关注的指标应包括任务成功率、平均工具调用次数、失败恢复率、单位任务 Token 消耗,以及在多次重复实验中的方差。
多模态不是“给语言模型加一双眼睛”
全模态理解是把文本、视觉与语音信号映射到统一表示空间,再由语言模型进行联合推理的能力。 dots3-note preview 并非只接入一个图片编码器,而是同时处理图像、视频和音频特征,面向图文、音文以及视频等组合输入。
公开资料显示,视觉侧采用总参数约 7B、激活参数约 1.2B 的 MoE ViT 编码器,音频侧采用约 800M 参数的稠密网络。不同模态的特征经过投影后与语言模型主干对齐,使模型可以把画面、声音和文字放进同一条推理链中。
这种能力适合处理大量真实业务中的“非结构化混合输入”。例如,用户可以提供一家店铺的现场视频、顾客语音反馈、菜单截图和经营报表,让 Agent 同时识别动线问题、归纳投诉原因并提出调整建议。传统文本模型需要先依赖多个独立工具完成 OCR、语音转写和画面描述,dots3-note preview 则试图在模型内部完成联合理解。
但这里必须区分理解与生成。dots3-note preview 公布的是视觉和语音理解能力,这不等于它具备原生图像生成、视频生成或高质量语音合成能力。把“可输入音频”写成“全双工语音模型”,或者把“视频理解”写成“视频生成”,都是对产品边界的误读。
MTP 解决的是生成阶段一次只走一步的问题
MTP(Multi-Token Prediction,多 Token 预测)是让模型在生成当前 Token 时,同时预测后续多个 Token 的训练与推理机制。 dots3-note preview 内置约 1.13B 参数的共享 MTP 层,最多可并行预测后续 3 个 Token,并可配合投机解码降低逐 Token 生成的延迟。
自回归模型的传统生成方式像一个人每写一个字都要重新审阅全文,下一步必须等待上一步完成。MTP 则让模型提前给出几步候选,如果主模型验证通过,就可以一次接受多个 Token;如果候选错误,再回退到常规解码。
MTP 的收益高度依赖接受率、请求批量、序列长度和硬件通信开销。官方当前没有公开统一测试条件下的首 Token 延迟、每秒输出 Token 数和 MTP 接受率,因此还不能仅凭“最多预测 3 个 Token”推导真实加速倍数。对于生产部署,完整的吞吐曲线会比单一峰值更有参考价值。
昇腾 0 Day 适配的难点主要在通信
0 Day 适配是指硬件与推理框架在模型公开当天即提供可运行的部署支持。 dots3-note preview 发布后,昇腾 Atlas 800 A3 和 Atlas 900 A3 SuperPoD 已完成全模态推理适配,相关能力建立在开源的 vLLM Ascend 推理框架之上。
这次适配并不只是把模型权重放到昇腾设备上运行。华为打通了视觉编码器、音频特征提取模块与语言模型主干的全链路,同时针对 MoE 多卡推理的通信和增量解码瓶颈进行了优化。
FlashComm 优化瞄准的是多卡重复计算。传统方案在 AllReduce 通信完成后,各张卡可能重复执行 RMSNorm、动态量化和 MLA QKV 降维等列向独立操作;新的实现通过数学等价变换,把 AllReduce 拆成 ReduceScatter 与 AllGather,并将部分独立计算移动到两段通信之间,从而减少设备间的重复工作。
FUSED_MC2 优化瞄准的是 MoE 层中过于零碎的算子链。原本的 dispatch、GMM、SwiGLU 和 combine 等步骤需要启动多个 Kernel,并在通信和计算之间频繁切换;融合后,这些环节被组合为更大的算子,中间张量无需反复写回显存,同时减少 Kernel Launch 次数。
这些优化对 280B MoE 模型尤其重要,因为稀疏模型经常不是算力不够,而是专家分布不均、跨卡数据搬运和小算子调度拖慢了速度。换句话说,16B 激活参数只是纸面计算规模,能否让这 16B 参数高效跑起来,取决于推理框架是否真正理解模型结构。
华为暂未在公开信息中给出适配前后的延迟、吞吐和集群规模数据,因此“生成效率提升”目前仍缺少可横向比较的数字。0 Day 可运行值得肯定,但要判断它是否达到生产可用水平,还需要每卡吞吐、长上下文显存占用、并发曲线和多模态预处理耗时。
dots3-note 补上了小红书模型版图的 Agent 一环
小红书此前已经发布文本模型 dots.llm1、文档解析模型 dots.ocr 和视觉理解模型 dots.vlm1,而 dots3-note preview 首次把这些能力方向收束到统一的长程 Agent 模型中。
| 模型 | 核心定位 | 主要输入 | dots3-note preview 带来的变化 | |---|---|---|---| | dots.llm1 | 通用文本理解与生成 | 文本 | 从文本任务扩展至多模态长程任务 | | dots.ocr | 多语言文档布局解析 | 文档图像 | 文档信息可成为 Agent 执行过程的一部分 | | dots.vlm1 | 视觉理解与图文推理 | 文本、图像 | 进一步加入音频、视频和长程决策能力 | | dots3-note preview | 多模态推理与 Agent | 文本、图像、视频、音频 | 统一感知、规划、工具执行和自我纠错 |
小红书把 note 定义为 dots3 系列中相对轻量的层级,后续还计划推出 jazz 与 aria。这里的“轻量”是相对于同系列更大版本而言,不代表本地部署轻量;280B 总参数已经决定了它更适合服务器集群和研究机构,而不是普通个人设备。
上个月获得国际数学奥林匹克竞赛 42 分满分认证的是同系列 dots-note-3.0 模型,这次开源的是 dots3-note preview,两者不能简单画等号。IMO 成绩可以证明该系列在数学推理和证明上的上限,但不能直接视为当前开源权重在相同设置下也能复现 42 分。
这是一款方向明确、但仍需验证稳定性的 Preview
现阶段看,dots3-note preview 最有价值的地方不是 280B 这个数字,而是把多模态感知、512K 上下文、外部记忆、MTP 与 MoE 推理放进了同一套面向 Agent 的开源模型中。对于研究长任务规划、浏览器 Agent、游戏 Agent 和复杂个人助理的团队,它提供了一个少见的开放底座。
它的短板也很明确:280B 权重带来的部署门槛不低,长上下文的实际利用率仍待测试,多模态端到端推理会进一步放大显存和预处理成本,而 Preview 状态意味着行为一致性与工具调用稳定性可能继续变化。
与其把 dots3-note preview 看成一款“更大的聊天模型”,不如把它看成小红书对下一代 Agent 基础设施的一次公开验证。它试图回答的问题不是模型会不会做一道题,而是模型能否在现实环境里持续做事、记住错误,并在几小时之后仍然知道自己为什么出发。
如果正式版能进一步公开可复现的长程任务评测、完整部署配置和昇腾性能数据,dots3-note 才有机会从一款参数醒目的开源模型,变成真正可用的 Agent 工程底座。
参考来源
- IT之家:华为官宣昇腾 0 Day 适配小红书 dots3-note preview —— 包含模型规格、支持硬件以及 FlashComm、FUSED_MC2 等适配信息。
- rednote-hilab GitHub 组织页 —— 小红书 dots 系列开源项目的官方代码组织入口。
- rednote-hilab Hugging Face 组织页 —— dots 系列模型权重、模型卡与相关资源入口。
- vLLM Ascend GitHub —— 面向昇腾设备的 vLLM 推理后端与部署框架。



