AI 快讯SmoothRL让机器人不等模型
行业快讯

SmoothRL让机器人不等模型

2026-09-04T12:05:26.337Z
SmoothRL让机器人不等模型

星尘智能发布异步在线强化学习框架 SmoothRL,并首次在真实高动态投掷任务中验证:机器人可以持续运动,同时等待大模型完成推理与更新,不再被串行决策链拖慢。

机器人终于不用等大模型了

星尘智能(Astribot)基座模型团队今天(2026 年 9 月 4 日)发布异步在线强化学习框架 SmoothRL,核心目标只有一个:让机器人在大模型推理尚未完成时继续执行,而不是停在原地等下一条指令。

**SmoothRL 是一套面向真实机器人在线强化学习的异步执行框架,它将环境交互、动作执行、模型推理和策略更新拆成可以并行运行的流程。**这意味着,机器人不必每完成一个动作就暂停,等视觉语言动作模型(VLA)重新观察、推理、生成动作,再继续下一步。

这看似是系统调度层面的改动,实际上击中了具身智能落地中的一个硬问题:机器人身体的控制频率,通常比大模型的决策速度快得多。机械臂可能需要以几十赫兹甚至更高频率接收控制信号,大模型却可能需要数百毫秒到数秒才能完成一次多模态推理。如果两者严格串行,机器人就会出现明显的“走一步、停一下”现象。

SmoothRL 此次最值得关注的地方,是它不只在仿真环境或低速精细操作中展示异步在线学习,而是把这类方法放进了真实高动态投掷任务中验证。投掷任务需要机器人连续加速、精确控制末端轨迹,并在特定时间窗口释放物体,中间几乎没有容许停顿的空间。

星尘智能 SmoothRL 异步在线强化学习流程示意图,展示机器人执行、模型推理与策略更新并行运行

大模型慢,不等于机器人必须慢

**在线强化学习(Online RL)是让策略模型在与真实环境持续交互的过程中,根据任务结果不断修正动作策略的训练方式。**它与只依赖人工示范的模仿学习不同:机器人不仅复现“人怎么做”,还会根据成功或失败结果主动探索更有效的动作。

在线强化学习对机器人尤其重要,因为很多任务很难靠示范数据覆盖所有情况。比如投掷时,物体重量、摩擦力、抓取位置、目标距离和机械臂当前姿态稍有变化,最佳释放时机就会改变。提前录制的大量轨迹可以提供起点,却很难穷举现实中的全部扰动。

问题在于,在线 RL 的数据采集和模型更新通常也采用相对僵化的同步流程:机器人执行一段轨迹,系统收集结果,模型完成推理或训练,环境再继续下一轮。对于真实机器人来说,这相当于让一台需要连续运动的机器,频繁暂停等待计算节点。

传统同步流程的瓶颈可以简化为:

  1. 机器人观察环境;
  2. 大模型生成动作;
  3. 机器人执行动作;
  4. 系统等待轨迹或一批轨迹结束;
  5. 训练策略模型;
  6. 使用更新后的模型重新开始。

只要其中最慢的一环出现延迟,整个链路的节拍就会被拉低。大模型推理越复杂、上下文越长、视觉输入越多,机器人等待的时间越长。

SmoothRL 的思路是把这条串行流水线改成异步流水线:机器人控制线程负责保持动作连续,推理线程持续生成新的决策,数据线程记录状态、动作和反馈,训练线程在后台更新策略。不同模块不再要求“上一环完全结束后,下一环才能开始”。

这可以类比为自动驾驶系统中的多速率控制:底层控制器以较高频率维持车辆稳定,中层规划器以较低频率更新路线,高层模型则根据更长时间尺度的信息调整策略。大模型不再承担每一个毫秒级控制动作,而是负责持续修正更高层的行为方向。

SmoothRL 验证了什么

据星尘智能团队披露,SmoothRL 首次将这类异步在线强化学习方法放入真实高动态投掷任务中验证,重点覆盖连续加速、精确释放和不能停顿等环节。

这里的“首次”需要限定在公开材料所描述的范围内:它并不意味着此前没有任何机器人系统使用异步控制或在线强化学习,而是指在公开报道中,SmoothRL 将异步在线 RL 放到真实高动态投掷任务中进行系统验证。

投掷任务的技术难点在于,动作结果存在明显的时序延迟。机器人从抓取物体、摆臂加速到释放,最终效果可能要等物体落地后才能判断。策略模型如果只根据即时反馈更新,很难准确判断究竟是加速阶段、姿态控制阶段,还是释放时机导致了失败。

同时,投掷动作不是一组互不相关的离散指令,而是一条连续轨迹。任何中途停顿都可能改变末端速度和释放姿态。因此,SmoothRL 的价值并不只是“让训练更快”,更在于它尝试让训练机制适应真实世界的连续动力学。

从应用角度看,这类能力可以迁移到以下场景:

  • 动态抓取与投放: 机器人需要在目标移动时持续调整动作,而不是等待完整推理结果后再行动;
  • 倒液体、递物和抛接: 任务结果依赖连续速度与时机,停顿会直接破坏动作轨迹;
  • 双臂协同: 一只手执行当前动作,另一只手或上层策略可以并行规划下一步;
  • 人机协作: 机器人需要根据人的实时动作不断修正策略,不能依赖长时间的批量决策;
  • 真实环境自适应: 机器人可以边执行边利用反馈调整策略,而不是离线训练完成后固定部署。

它和普通异步推理有什么区别

**异步推理是把模型生成动作与机器人执行动作解耦,而异步在线强化学习还需要进一步处理数据时效性、策略漂移和训练稳定性。**前者主要解决延迟问题,后者同时面对“模型正在变、数据却来自旧模型”的分布偏移问题。

假设机器人在时刻 t 使用策略模型 A 生成动作,但训练线程在后台已经把策略更新成模型 B。随后,执行结果可能由 A 产生,价值评估却使用 B 完成。如果系统直接把这些数据混在一起训练,就会产生离策略(off-policy)问题:训练样本不再完全对应当前策略。

因此,SmoothRL 的关键挑战不只是让多个线程同时工作,而是要在异步情况下保持强化学习信号有效。公开信息目前重点强调其真实高动态任务验证,尚未披露完整算法细节、训练规模、硬件配置和相对基线的全部量化结果。对开发者而言,这一点很重要:SmoothRL 的工程价值已经得到场景验证,但不能仅凭“异步”二字推断它在所有机器人任务上都能获得相同收益。

与近期几条路线怎么比

近期围绕异步强化学习的研究,实际上出现了几条不同路线。它们都在减少等待,但解决的问题并不完全相同。

| 方法或框架 | 主要面向对象 | 核心思路 | 已公开的代表性验证 | 主要价值 | |---|---|---|---|---| | SmoothRL | 真实机器人在线 RL | 执行、推理、数据采集与策略更新异步并行 | 真实高动态投掷任务 | 让连续动作不再被大模型推理节拍拖住 | | SAO | 长程 Agent、编码与数学任务 | 单 rollout 完成后立即训练,降低批量等待 | 可稳定训练 1000 步,并用于 Agent RL 流水线 | 提高异步语言模型训练的稳定性与样本利用率 | | Slime | 大模型后训练 | 解耦 rollout 生成和模型训练 | 面向长上下文 Agent 与工程任务 | 提高大模型异步 RL 的系统吞吐 | | RLinf v0.3 | 具身智能开发全流程 | 打通数据、SFT、RL、评测与真机部署 | 支持仿真、真机和多种具身模型 | 降低具身模型训练与部署的工程门槛 | | GR-RL | VLA 精细操作 | 离线筛选、监督训练与真机 RL 多阶段结合 | 真机连续穿鞋带,成功率由 45.7% 提升至 83.3% | 解决柔性物体与长程精细操作问题 |

清华团队在 2026 年 7 月提出的单 rollout 异步优化(SAO),重点是语言模型 Agent 训练中的样本更新效率和稳定性。SAO 用单条 rollout 替代 GRPO 所依赖的组式采样,并通过直接双边重要性采样、价值模型强化、固定部分注意力模块参数等方式,降低异步训练带来的离策略偏差与方差。

SmoothRL 的问题更贴近机器人本体:当策略模型还在算下一步时,机械臂应该做什么?它不是简单追求每秒生成多少条训练样本,而是要保证机器人在物理世界中保持连续、稳定、可控的动作节奏。

RLinf v0.3 则更像一套具身智能基础设施。它覆盖模型接入、数据管理、监督微调、强化学习、评测和真机部署,解决的是“如何把一套具身模型开发流程搭起来”。SmoothRL 解决的则是其中一个更具体但很关键的环节:在线 RL 如何适配实时机器人执行。

字节跳动 Seed 的 GR-RL 展示了另一种路径。其穿鞋带任务把成功率从 GR-3 的 45.7% 提升到 83.3%,说明真机强化学习可以帮助 VLA 模型突破柔性物体操作和长时程任务的限制。但穿鞋带更偏向高精度、低速、长步骤操作;SmoothRL 选择投掷,则把重点放在连续加速、动作时序和实时反馈上。

真正的难点:异步之后如何保证安全

异步架构并非只有优点。机器人异步在线学习的最大风险,是策略更新速度、推理延迟和物理执行节奏不一致时,系统可能出现不可预测行为。

在实验室里,模型可以失败后重置环境;在真实场景中,失败可能意味着物体损坏、机械臂碰撞,甚至人员受伤。因此,SmoothRL 如果要从投掷任务扩展到家庭和工业场景,至少还需要回答几个问题:

第一,旧策略生成的动作在多大程度上可以被新策略接受?如果训练线程频繁更新模型,执行线程如何判断某条动作轨迹是否已经过时?

第二,推理线程发生长尾延迟时,控制系统采用什么机制兜底?是继续执行上一段动作、切换到低层控制器,还是进入安全姿态?对于机器人来说,平均延迟并不够,99.9% 分位延迟和最坏情况响应时间更重要。

第三,在线 RL 如何避免探索行为突破安全边界?投掷任务可以通过固定场地、限定物体和保护区域控制风险,但开放环境下的探索需要加入动作约束、碰撞检测、速度限制和人工接管机制。

第四,策略更新是否会破坏已经学会的能力?机器人在一个任务上持续优化时,可能因为新数据分布变化而遗忘原有动作。真正可用的系统必须同时维护任务成功率、动作平滑度、能耗和安全约束,而不能只优化单一奖励。

这些问题也决定了 SmoothRL 的定位:它更像是把“在线学习可以发生”推进到“在线学习可以跟上真实动作”,但距离通用机器人自主进化仍有一段距离。

星尘智能押注的是系统节奏,而不是更大的模型

过去几年,具身智能竞争的叙事主要围绕更大的视觉语言动作模型、更大的数据集和更长的上下文展开。但机器人落地后,瓶颈往往不只在模型能力,而在模型能力能否以正确的时间尺度传递给身体。

一个离线评测很强的 VLA 模型,如果每次决策都需要等待很久,或者只能在静态场景中逐步执行,它仍然可能无法完成动态任务。反过来,一个参数规模并不夸张的模型,如果能够与底层控制器、传感器和训练系统形成稳定的异步闭环,也可能在特定任务上表现得更可靠。

SmoothRL 的判断很明确:机器人不应该被迫按照大模型的推理速度行动。更合理的架构是让不同层级以不同频率运行——底层控制保证实时性,中层策略保持连续性,高层模型负责理解任务与调整方向,在线强化学习则不断利用真实反馈修正整个系统。

这也是它与单纯部署一个更快模型的区别。加速推理当然有效,但模型越强、输入越复杂,推理成本仍可能上升。异步架构则试图从系统层面消除“所有动作都必须等待大模型”的依赖。两者结合,才可能真正解决机器人在动态环境中的节奏问题。

结语:从“能学会”走向“边动边学”

SmoothRL 发布的意义,不在于宣布机器人已经实现了通用自主学习,而在于它把异步在线 RL 推到了一个更贴近真实身体的验证场景:机器人需要持续运动,动作结果存在延迟,大模型推理速度又不够快,系统仍然要完成有效控制。

对于具身智能开发者来说,下一阶段的竞争重点可能不再只是模型参数量和离线成功率,而是以下几个系统指标:端到端延迟、控制频率、策略更新滞后、在线样本利用率、长尾稳定性和安全回退能力。

SmoothRL 目前公开的量化信息仍然有限,尚不足以判断它是否已经成为通用机器人 RL 的标准方案。但至少,它指出了一个越来越难回避的事实:机器人要在真实世界里工作,就不能让身体停下来等待大脑算完。

相关推荐

查看全部