Skild AI:推出S1,我们的新基础模型,能从单一示例中学习。

X · SKILD AI5分14秒 · AI 语音转写 · 词级双语字幕
原视频
口播稿 · 逐行
字幕

嘿,机器人,我给你看个东西。你能做到这个吗?人类学习新事物并不需要成千上万个例子,通常一个就够了。今天,我们发布S1,一个通用型机器人基础模型,它仅凭一个视频就能学会各种新任务。

它可以被教授超长时长的任务,这些任务超过10分钟,且不在其训练数据中,只需将一个视频提示传入其上下文窗口即可。这个概念被称为上下文学习,正是它定义了从GPT-1和GPT-2等研究项目到ChatGPT等革命性产品的飞跃。你将演示放入上下文窗口,就像带示例的提示,它就会输出机器人动作来完成任务。

长任务学习

让我们逐一来看。S1可以展示长达10分钟的任务,并记住每一步细节。例如,你可以教机器人做煎饼,它就会做煎饼。谢谢。你可以教它煮咖啡,它也会照做,方式与你相同。教它移植植物,它也会同样操作。学习如此长的任务,让S1能自动化比以往任何方法都更有价值的工作。

它第一次翻煎饼时,我们简直不敢相信。因为我们以为数据集中没有翻煎饼的数据。哇。为了验证这一点,我们花了两天时间检查所有预训练数据,约一百万小时,以确定是否有任何翻煎饼数据混入。结果没有。原来,机器人只是通过观察视频中锅铲的运动就学会了这个动作。

已知任务与新颖任务

这引出一个重要概念,即预训练分布中的已知任务与完全新颖任务之间的区别。对于已知任务,上下文学习表现与语言提示的VLA相当。但上下文学习在预训练中完全未见过的任务上真正大放异彩,随着预训练规模扩大,差距呈指数级增长。例如,这个任务不可能在分布内。这是一个卫生套件,以特定方式包装特定成分。S1能记住套件的每个组件和组装过程的每一步,尽管它在部署前几分钟才第一次看到它。

由于S1的有效上下文窗口非常大,因此涌现出了多种稳健的行为模式。

首先,如果场景或其中的物体发生位移,它能够泛化到新的配置中。

其次,即使机器人犯了错误,它也能即兴调整,即使视频提示中并未包含人类的相应操作。

第三,即使视频中的人类表现并非最优或犯了错误,S1也能推测用户的意图,并运用常识来达成目标。当我们改变提示设置、重新排列物品、翻转物体或更换对象时,机器人的准确度会非常平缓地下降。

这意味着,你只需录制一次演示,就能在多个不同地点部署应用。在上下文学习出现之前,任何新任务都可能需要数月的数据收集和后续训练。

我们发现,要达到S1仅凭一个提示示例所展现的准确度,VLA模型需要经过50到100小时的数据收集训练。

迄今为止,机器人仅对拥有庞大资源、并愿意彻底改造自身设施的组织有用。

我们设想,有了S1,每个小企业、每个杂货店、每家医院、每个组织,都能获得同等强大的机器人能力。

这些成果只是通往一条新路径的初步迹象,这条路径通向扎根于物理世界的通用智能。

知识卡片
一句话总结1 张
一句话总结

S1 是一个通用型机器人基础模型,仅凭一个视频示例就能学会各种新任务,包括超10分钟的复杂任务,并具备强大的泛化能力。

核心观点4 张
核心观点
01

上下文学习是关键

上下文学习 是S1的核心能力,将演示视频放入上下文窗口,模型即可输出动作,无需额外训练

核心观点
02

长任务自动化

S1能学习超过10分钟的任务,如做煎饼、煮咖啡、移植植物,记住每一步细节,自动化更有价值的工作。

核心观点
03

新颖任务优势

预训练中未见过的任务上,上下文学习表现远超传统VLA,且差距随预训练规模指数级增长

核心观点
04

稳健行为涌现

S1具备泛化到新配置即兴调整错误推测用户意图等稳健行为,即使视频提示不完美。

对比1 张
上下文学习 vs 传统VLA
S1(上下文学习)
· 仅需一个视频示例· 无需额外训练· 可处理超长任务
传统VLA
· 需要50-100小时数据· 需要后续训练· 难以处理新颖任务
数据需求
任务泛化
部署速度
S1(上下文学习)传统VLA
金句摘录2 张
金句
人类学习新事物并不需要成千上万个例子,通常一个就够了。
金句
这些成果只是通往一条新路径的初步迹象,这条路径通向扎根于物理世界的通用智能。
关键数据2 张
任务时长
10分钟+

S1能学习超过10分钟的复杂任务。

来源:口播稿:可教授超长时长任务

训练数据对比
50-100小时

达到S1的准确度,传统VLA需要50-100小时数据训练。

来源:口播稿:对比S1仅需一个示例

行动1 张
应用S1的步骤
全文脉络1 张
全文脉络
S1:一个示例学会新任务
已生成 12 张 · 每篇精选,少而精