Skild AI:推出S1,我们的新基础模型,能从单一示例中学习。
嘿,机器人,我给你看个东西。你能做到这个吗?人类学习新事物并不需要成千上万个例子,通常一个就够了。今天,我们发布S1,一个通用型机器人基础模型,它仅凭一个视频就能学会各种新任务。
它可以被教授超长时长的任务,这些任务超过10分钟,且不在其训练数据中,只需将一个视频提示传入其上下文窗口即可。这个概念被称为上下文学习,正是它定义了从GPT-1和GPT-2等研究项目到ChatGPT等革命性产品的飞跃。你将演示放入上下文窗口,就像带示例的提示,它就会输出机器人动作来完成任务。
长任务学习
让我们逐一来看。S1可以展示长达10分钟的任务,并记住每一步细节。例如,你可以教机器人做煎饼,它就会做煎饼。谢谢。你可以教它煮咖啡,它也会照做,方式与你相同。教它移植植物,它也会同样操作。学习如此长的任务,让S1能自动化比以往任何方法都更有价值的工作。
它第一次翻煎饼时,我们简直不敢相信。因为我们以为数据集中没有翻煎饼的数据。哇。为了验证这一点,我们花了两天时间检查所有预训练数据,约一百万小时,以确定是否有任何翻煎饼数据混入。结果没有。原来,机器人只是通过观察视频中锅铲的运动就学会了这个动作。
已知任务与新颖任务
这引出一个重要概念,即预训练分布中的已知任务与完全新颖任务之间的区别。对于已知任务,上下文学习表现与语言提示的VLA相当。但上下文学习在预训练中完全未见过的任务上真正大放异彩,随着预训练规模扩大,差距呈指数级增长。例如,这个任务不可能在分布内。这是一个卫生套件,以特定方式包装特定成分。S1能记住套件的每个组件和组装过程的每一步,尽管它在部署前几分钟才第一次看到它。
由于S1的有效上下文窗口非常大,因此涌现出了多种稳健的行为模式。
首先,如果场景或其中的物体发生位移,它能够泛化到新的配置中。
其次,即使机器人犯了错误,它也能即兴调整,即使视频提示中并未包含人类的相应操作。
第三,即使视频中的人类表现并非最优或犯了错误,S1也能推测用户的意图,并运用常识来达成目标。当我们改变提示设置、重新排列物品、翻转物体或更换对象时,机器人的准确度会非常平缓地下降。
这意味着,你只需录制一次演示,就能在多个不同地点部署应用。在上下文学习出现之前,任何新任务都可能需要数月的数据收集和后续训练。
我们发现,要达到S1仅凭一个提示示例所展现的准确度,VLA模型需要经过50到100小时的数据收集训练。
迄今为止,机器人仅对拥有庞大资源、并愿意彻底改造自身设施的组织有用。
我们设想,有了S1,每个小企业、每个杂货店、每家医院、每个组织,都能获得同等强大的机器人能力。
这些成果只是通往一条新路径的初步迹象,这条路径通向扎根于物理世界的通用智能。