AI 快讯Skild S1:机器人看一段视频就能学新活
模型上新

Skild S1:机器人看一段视频就能学新活

2026-09-10T19:05:28.740Z
Skild S1:机器人看一段视频就能学新活

Skild AI 近日发布机器人基础模型 S1,宣称机器人只需观看一段人类示范视频,就能在无需重新微调的情况下执行最长超过 10 分钟的新任务。内部测试中,S1 在未见过任务上的平均单步成功率达到 66%,显著高于传统语言指令 VLA 的 9%。

Skild S1:机器人看一段视频就能学新活

Skild AI 近日发布机器人基础模型 S1,核心变化是:机器人学习新任务不再首先依赖工程师重新采集数据、编写策略和微调模型,而是先看一段人类示范视频。

**机器人基础模型是能够跨任务、跨环境复用感知、推理和控制能力的通用模型。**过去这类模型通常能让机器人理解“拿起杯子”“移动到货架”等指令,但一旦任务变长、步骤变多,或者现场布局发生变化,模型就容易失效。Skild AI 对 S1 的定位,是让机器人从“执行预先写好的动作脚本”进一步走向“看懂示范后现场组织动作”。

这不是把视频简单转换成一串机械动作。按照 Skild AI 公布的信息,S1 会把示范视频当作上下文提示,在执行时结合当前摄像头观察到的环境,调用预训练中已经掌握的基础技能,或者组合出新的动作序列。机器人被打断、物体位置发生变化或中途出现偏差时,理论上可以重新判断下一步,而不是从头到尾机械回放视频。

Skild AI S1 机器人观看人类示范视频后执行煎饼翻面、手冲咖啡和植物换盆等长时任务的示意图

从“重新训练”到“现场示范”

机器人行业长期存在一个部署瓶颈:工厂、仓库和生产线很少真正静止不变。新产品上线后,抓取位置会变;订单变化后,分拣流程会变;同一条产线换班或换料后,机器人的动作边界也会变。对于传统自动化系统而言,这些变化往往意味着重新标定、采集数据、调整程序,甚至重新训练模型。

**上下文学习是指模型不修改参数,只通过当前输入中的示例临时获得新任务能力。**S1 把这种思路从文本和图像领域带到了机器人控制中:人类示范视频相当于一份临时任务说明,机器人不必把这份示范永久写入模型参数,就可以根据视频理解任务目标、步骤关系和动作节奏。

这与传统机器人示教也有区别。传统示教更像是给机械臂录制一条精确轨迹,机器人需要尽可能沿着相同路径复现;S1 试图学习的是任务本身。例如,人类把植物从旧花盆取出、放入新盆、填土并浇水,机器人需要理解这些动作之间的因果关系,而不是记住手腕在每一秒钟应该移动到哪个坐标。

从工程角度看,这种差异很关键。轨迹回放适合环境固定、精度要求高的重复工序,但面对柔性物体、遮挡、物品摆放变化和临时干扰时,鲁棒性有限。任务级学习则更适合仓储拣选、零售补货、实验室操作和小批量制造等场景,因为这些场景的核心问题不是“能不能重复同一条路径”,而是“能不能在变化的现场完成同一个目的”。

10 分钟任务,11 分钟开始执行

Skild AI 展示的任务包括煎饼翻面、手冲咖啡、植物换盆等。其中部分任务持续时间超过 10 分钟,且不属于模型预训练中直接出现过的任务。

植物换盆案例尤其能说明 S1 的目标。公开信息显示,从开始录制人类示范,到机器人开始自主执行,整个准备过程只用了 11 分钟。这个数字并不等于机器人 11 分钟内完成了模型训练,而是说明示范视频可以在很短时间内被纳入当前任务上下文,并转化为执行策略。

这类任务的难点在于,它们不是由一个动作构成的。机器人需要先识别植物和花盆,判断抓取位置,取出植物,处理根部与土壤,再把植物放入新容器,最后完成填土或浇水。任何一步发生偏差,后续状态都会改变。

如果系统只是逐帧模仿视频,植物换盆过程中一旦花盆位置偏移,后续动作就可能全部错位。S1 强调的能力则是根据当前环境继续调整。例如,机器人没有在预期位置抓到物体,或执行过程中被人为打断,它需要重新定位目标、评估当前进度,并决定是继续、纠正还是重复某个子步骤。

这也是长时程机器人任务与普通视觉动作测试的分水岭。**长时程任务是由多个相互依赖的子任务组成、执行时间通常达到数分钟甚至更久的机器人任务。**在这类任务中,单个动作的成功并不代表整个任务成功,模型还必须维持任务状态,理解哪些步骤已经完成,哪些步骤必须重新执行。

66% 对 9%,差距来自哪里

Skild AI 公布的内部评估显示,在使用相同的 10 万小时数据完成预训练后,S1 面对未见过的新任务时,平均单步成功率达到 66%;作为对照的传统语言指令 VLA,平均单步成功率为 9%。

**VLA,即视觉-语言-动作模型,是将图像和语言输入直接映射为机器人动作的模型。**VLA 的优势是接口直观:用户可以通过“把杯子放到托盘上”这样的语言命令驱动机器人。但语言指令通常只描述目标,不包含完整的动作细节,也不一定能传达物体的柔软程度、力度变化、操作节奏和环境约束。

| 对比维度 | Skild AI S1 | 传统语言指令 VLA | 说明 | |---|---:|---:|---| | 预训练数据 | 10 万小时 | 10 万小时 | Skild AI 公布的对比条件 | | 新任务平均单步成功率 | 66% | 9% | 内部评估结果,非第三方测试 | | 新任务输入方式 | 单段视频示范 | 语言指令为主 | 视频携带更完整的动作上下文 | | 是否需要针对任务微调 | 官方称无需额外微调 | 通常需要补充示范和微调 | 具体取决于模型和部署环境 | | 公开展示的任务时长 | 超过 10 分钟 | 未披露 | 包括咖啡、煎饼和植物换盆 | | 训练后适应方式 | 上下文学习、技能组合 | 指令解析与既有动作调用 | 两者并非完全同类系统 |

这个结果看起来差距很大,但需要准确理解它的含义。66% 是“平均单步成功率”,不是“完整任务成功率”。如果一个长任务包含 20 个相互依赖的步骤,即使每一步独立成功率达到 66%,简单相乘后也不能直接得到 66% 的整任务完成率。因此,这组数字更适合用来说明模型对新动作的适应能力,而不能直接当作工业部署成功率。

同样,9% 与 66% 的对比也不意味着所有 VLA 都只有 9% 的能力。测试任务、机器人硬件、摄像头布局、动作定义和成功判定标准都会影响结果。Skild AI 的数据证明了 S1 在其内部测试设定下的优势,但还不足以单独证明它已经解决了通用机器人控制问题。

Skild AI 还表示,传统语言指令 VLA 大约需要额外收集 380 次任务示范并进行微调,才能追上 S1 单次视频示范后的水平。这个数字如果在真实生产环境中成立,意义比单次跑分更直接:机器人部署的瓶颈从“重新训练一个模型”变成“拍摄一段高质量示范并检查执行结果”。

S1 真正改变的是数据闭环

机器人模型的竞争,表面上是模型结构和跑分,底层往往是数据闭环的效率。**机器人数据闭环是指示范采集、模型执行、失败分析和数据回流持续迭代的过程。**闭环越短,机器人就越容易适应现场变化。

过去,企业要为一个新任务准备专门数据,往往需要工程师让机器人重复执行数百次,再从失败案例中修正策略。这个流程的成本不仅包括采集时间,还包括设备占用、现场安全、数据清洗、标注和模型部署。对于每天都在变化的仓库和小批量制造场景,重新训练的成本可能高到让自动化失去经济性。

S1 的思路是把人类示范作为更高密度的数据。一个视频不只是“机器人应该怎么移动”的轨迹,也包含了目标识别、动作顺序、接触关系和任务节奏。比如手冲咖啡的示范能够同时传达拿取器具、倒水、控制角度和等待时间等信息,这些内容很难通过一句语言指令完整表达。

但视频也不是万能答案。人类和机器人拥有不同的身体结构、视角、力量范围和末端执行器。人手可以轻松捏住柔软的植物根部,机械夹爪却可能需要采用完全不同的抓取方式;人类能凭触觉判断锅铲是否卡住,机器人则必须依赖视觉、力觉或其他传感器。因此,S1 需要学习的不是“复制人类动作”,而是从人类动作中抽取任务意图,再映射到自身硬件能够执行的动作。

这也解释了为什么 Skild AI 把 S1 称为机器人基础模型,而不是单纯的视频模仿系统。基础模型的价值不在于某一个演示任务,而在于能否把“拿取、插入、倾倒、旋转、对齐、放置”等通用技能重新组合,迁移到此前没有直接训练过的新任务中。

NVIDIA Physical AI 的意义

Skild AI 的发布与 NVIDIA Physical AI 生态有关。**Physical AI 是面向物理世界的人工智能,目标是让模型理解三维环境、物体状态、动作后果和机器人控制。**与只输出文字、图像或代码的生成式 AI 不同,Physical AI 的错误可能直接表现为撞击、掉落、夹伤或设备损坏,因此对感知延迟、控制稳定性和安全边界要求更高。

NVIDIA 近年持续把机器人训练、仿真和部署整合到 Physical AI 路线上,试图为机器人公司提供从数据生成到模型运行的基础设施。对于 Skild AI 来说,接入这一生态的价值可能不只是获得算力,也包括仿真环境、物理世界数据和部署工具链。

不过,基础设施并不能自动解决机器人落地的全部问题。真实工厂里的光照、反光材质、遮挡、灰尘、网络抖动和机械臂磨损,都可能让实验室里的成功率快速下降。模型能否在不同品牌机械臂、不同摄像头和不同末端执行器之间迁移,也将决定 S1 是一个展示能力的研究成果,还是可以反复复制的商业产品。

它距离“通用机器人”还有多远

S1 最值得关注的地方,是它把机器人学习的交互单位从“数据集”缩短成了“示范视频”。但“看一次视频就会做”仍然有几个重要前提。

第一,示范视频必须足够清楚。拍摄角度、遮挡程度、动作完整性和环境差异都会影响模型理解。如果人类示范中存在犹豫、回退或未解释的隐含动作,模型可能无法判断哪些动作是必要步骤,哪些只是个人习惯。

第二,机器人需要具备与任务匹配的硬件能力。模型可以理解“倒水”,但如果夹爪无法稳定抓住杯子、机械臂自由度不足,或者没有足够的力控能力,软件策略仍然无法落地。

第三,工业部署必须有安全机制。机器人在执行长任务时,不能只依赖模型自行判断。速度限制、碰撞检测、急停、区域隔离和人工接管仍然是必需的。尤其在工厂和仓库中,“任务成功”不能以牺牲设备、货物或人员安全为代价。

第四,评测指标需要从单步成功率扩展到完整任务成功率、平均干预次数、每次任务成本和失败恢复时间。对于企业来说,一个机器人即使 66% 的单步动作成功,也可能因为频繁需要人工接管而不具备商业价值。

目前,S1 已开始向少量工业客户部署,Skild AI 计划在未来几个月扩大范围。接下来真正值得观察的不是又一个家庭场景演示,而是它在仓储、制造和生产线中能否连续运行数周,能否跨设备迁移,以及面对未预料到的失败时是否真的能够恢复。

OpenAI、Google 和特斯拉之外的另一条路线

当前机器人基础模型大致存在几条路线:一类以语言指令为入口,让机器人理解人类意图;一类依赖大量机器人轨迹数据,直接学习视觉到动作的映射;另一类则强调视频示范和上下文学习,让机器人在部署现场快速适应。

S1 选择的是第三条路线。它没有把“机器人是否通用”完全押在更大的语言模型上,而是把人类示范看作比自然语言更完整的任务提示。这种方式对非技术用户更友好,也更贴近工厂现场:培训人员不需要编写复杂指令,只需按照目标流程演示一遍。

但这条路线的成本是,模型必须拥有更强的时序理解、视觉预测和动作规划能力。视频中没有明确说出的内容,都需要模型从上下文中推断。也就是说,S1 的难点不在于“看过视频”,而在于“知道哪些信息能迁移,哪些信息不能照搬”。

我的判断是,S1 的价值目前更多体现在降低机器人部署门槛,而不是宣布机器人已经实现通用智能。如果它能够把新任务适配从数小时乃至数百次示范,压缩到一次视频和少量人工检查,那么它对柔性制造和仓储自动化的意义会非常现实。反过来,如果单次示范只在精心准备的实验环境中有效,到了光照变化、物体混杂和人员干预频繁的生产现场仍需要大量人工修正,那么它仍然只是一个能力演示。

机器人行业下一阶段的竞争,可能不再只是比较谁的模型参数更多,而是比较谁能用更少的人类示范,把机器人稳定地部署到更多不同现场。Skild S1 这次发布,至少把这个问题从“机器人能不能做”推进到了“机器人能不能在现场快速学会”。截至 2026 年 9 月 10 日,后一个问题仍没有最终答案,但已经成为比单次演示更值得关注的产品指标。

参考来源

  • NVIDIA Physical AI 相关站点: NVIDIA 的 Physical AI、机器人仿真与基础设施资料入口;本文关于 NVIDIA 生态的内容结合 Skild AI 官方公开信息整理。
  • IT之家: 国内科技媒体站点,可用于检索 Skild AI S1 发布及机器人基础模型相关报道。
  • Hugging Face: 开源模型与机器人模型社区入口,可用于跟踪视觉-语言-动作模型和机器人基础模型的公开进展。

注:Skild AI S1 的 66%、9%、380 次示范和 11 分钟等数据来自 Skild AI 对外披露的内部评估与案例描述,暂未见独立第三方复现实验。文章未将内部结果等同于完整工业部署成功率。

相关推荐

查看全部