AI能力沿平滑指数曲线攀升,机器人将复制这一路径,回报属于做大生态者而非押注单一赢家。

ERIC JANG(@ERICJANG11)观点长文 · 已翻译 · 约 10 分钟
阅览室 · 前沿观察#机器人#平滑#指数原文

我最近重读了达里奥·阿莫代伊的《慈爱机器》与《技术的青春期》两篇文章。在这些文章以及他的访谈中,达里奥常常谈到AI能力的“平滑指数增长”,仿佛机器智能“从数据与原始算力的恰当组合中自发涌现”。

认真思考“AI认知能力平滑而不可阻挡地增长”究竟意味着什么,令人清醒。若照字面理解,没有任何单一主体能真正改变这条曲线的平滑度,正如没有任何单个原子能改变一个放能反应的进程。我们可以通宵达旦地赶那篇论文,也可以关掉实验室、到OpenAI和Anthropic门口抗议,而进展依旧照常推进[1]。它发生的途径实在太多,因此几乎必然会发生。

在科学研究中,人们通常期待进展是断断续续的。研究往往像一场“英雄之旅”:一位孤独的科学家或一支小团队,卡在一个无人攻克过的难题上,煎熬一段时间,然后凭借毅力取得突破。从单个项目的视角看,进展随时可能熄火,必须靠好奇心与坚持去推动。在局部,研究是一种间断平衡。

然而在过去一年里,智能体编程模型的能力提升完全不像间断平衡。编程助手的用户经历着一波又一波更强大的前沿模型的冲击,以及每周发布、从不落后太远的开源模型。这条平滑的指数曲线不休假,不遭遇办公室闹剧,甚至不碰上意外之喜;它只是稳步攀升。

为什么进步感觉如此平滑而迅速,尽管个体的研究努力十分艰难?用统计力学的语言来说,当参与的粒子足够多时,任何单个粒子的特异行为都会被系综的总体行为所淹没。

机器人指数增长的起点

对于机器人技术而言,“平滑的指数曲线”是什么样子?我们很快就会开始看到机器人智能的规模化扩展,与大型语言模型极为相似,或许会被压缩在12到24个月的时间跨度内。最近发生了若干关键性的突破,让我现在相信机器人技术正处于“平滑能力指数增长”的早期阶段。

更多生态参与者: 在大学实验室、资金充裕的初创公司和产业研究实验室中,有足够多的人正在攻克正确的问题,从而形成持续进步的势头。如果你去参观中国的机器人公司,这一点尤为明显。每一种硬件形态的组合(双足、轮式底盘、灵巧手、夹爪)、数据采集策略、AI模型架构(WAM、VLA等)以及市场进入策略(消费级、企业级、娱乐、研究),都有众多实力强劲的公司在朝着各自方向推进。

中国的电子与硬件生态系统大幅降低了创业者制造机器人的准入门槛,而强大的开源VLA模型使得只需少量后训练数据就能获得稳健能力,这变得越来越容易。新入局者可以从更靠前的起点出发,因此将会有更多的人推动机器人技术的进步。

现代大语言模型可用于机器人能力评估:像 GPT 6 Astra 和 Fable 5.1 这样的前沿模型,已开始相当胜任地完成机器人任务。值得注意的是,它们与全球数百万用户使用的是同一批模型,而非专门训练用于控制机器人的专用模型,因此其能力可在广泛领域中被公开验证。像 Robocurve 这样的公司已开始直接在 LLM 上运行机器人操作能力。开源模型在能力上迎头赶上也只是时间问题。

由于 LLM 如今已能零样本执行机器人任务,我相信机器人评估将被拖入现代 LLM 排行榜的世界,并继承诸如测试时扩展曲线(test-time scaling curves)和困惑度扩展的外推预测等良好实践。

一个可复用的大规模训练语料库: 过去几年机器人学习中最深刻的突破之一,是发现为机器人广泛泛化而扩展的数据,可以与控制特定机器人所需的数据大不相同。

机器学习中的经典观点是,要泛化到领域 Y,你需要扩展 Y 上的数据,或至少是一个“覆盖”Y 的广泛数据集。我曾相信,要解决家用机器人问题,我们需要来自客户家中的数百万小时遥操作机器人数据,与特斯拉 Autopilot 针对城市驾驶的策略类似。

事实证明,在当今时代,你可以在广泛的领域 X 上扩展泛化能力以“学习智能”,而在后训练阶段只需使用来自 Y 的少量真实机器人数据即可获得控制能力。尽管 X 与 Y 之间存在相当大的领域差距,X 仍能将足够的知识迁移到 Y。最初,X 只是“其他机器人的遥操作数据”(Open-X Embodiment 2023),但很快扩展到 UMI 风格的夹爪(Sunday Robotics, 2025),随后是以自我为中心的视频(Nvidia EgoScale, 2026Dyna 2026)。如果这一趋势持续下去,我们甚至可能开始看到机器人领域的通用预训练在非自我中心视频上进行(Rhoda 2026)。

由于机器人领域的广泛预训练数据在一定程度上与硬件无关,我们开始看到机器人领域正在形成标准化的预训练语料库。各公司的具体构成有所不同,但 2026 年的大致数量级为(X 表示个位数):

  • 约 X 百万小时的自我中心数据
  • 约 X 十万小时的 UMI 夹爪数据
  • 约 X 万小时的遥操作机器人数据,可能涵盖多种形态
  • 约 X 小时的高质量、硬件特定的演示数据,用于高性能展示

由于预训练相对独立于硬件细节,相同的预训练语料库很可能惠及所有机器人实验室,因此机器人模仿学习的缩放定律可以以相当可复现的方式进行研究。反过来,一个由硬件无关数据构成的通用“数据金字塔”使得我们无需真实世界机器人,就能在大型留出数据集上解锁动作困惑度和动作均方误差缩放定律。

在四月份的一场演讲中,面对约100名听众,我预测首批2-3款通用家用机器人将于2027年10月上市,随后中国和美国将有十几家甚至更多公司迅速跟进,实现同样的目标。

第一代此类产品还不足以完全替代人类在家中或其他场所的工作,但其通用性足以吸引数千名爱好者用户。它们或许能完成家中基本的取放任务,或把你的衣物叠成整齐的一摞,外加一套小型的花式表演。就像ChatGPT和编程智能体一样,它们将经历从“不太有用”到“非常有用”再到“经济颠覆性”的演进过程。消费级家庭将是第一个容忍“有趣但不太有用的机器人”的场所,但随着能力过渡到“非常有用”的类别,我们应当预期企业和制造业将出现更大规模的爆发式采用。

押注什么

如今从事通用学习机器人研发和投资的人数远超四年前。在强大的编程智能体时代,以全新的视角审视机器人技术并投身其中,正逢其时。

对于寻找机器人领域机会的投资者而言,一个启示是:在平滑的指数增长中,我们可能不再处于传统的风险投资颠覆范式中——即某个玩家凭借一项绝妙的发明或创新角度颠覆整个市场。

在局部层面,我们仍会在企业之间看到幂律回报,但在全局层面,价值创造的主体是机器人技术进展所带来的平滑指数增长,而这种进展源于大量研究人员和开发者涌入这一领域。我更愿意押注于他们的集体成功,而不是押注于他们失败!回报将归于那些着眼于机器人生态系统长期增长的人,而不是那些讲述混合物中某一个原子将如何赢得整个市场的故事的人。我相信,像 Nvidia 为计算所做的那样、或 Unitree 为人形机器人研究所做的那样,把整个机器人蛋糕做大,会带来巨大的回报。

脚注

[1] 说我们失去了改变这条平滑曲线的自由意志,乍听起来有些夸张,但这些趋势确实出现了:

  1. 智能手机和 AI 尽管具有变革性、改变了世界,却甚至没有在全球 GDP 中留下“尖峰”的痕迹。大约从工业革命开始,前沿经济体(如英国,后来的美国)的总增长率按实际人均口径加速到每年约 1.5%–2%——这一复合增长率近 250 年来惊人地保持稳定
  2. 过去 60 年里发表了许多 AI 论文,但按照 Rich Sutton 的《苦涩的教训》,智能的提升主要受计算投入的增加所主导(通过算法搜索和学习)。神经缩放定律把这一点形式化得更好一些:总体而言,能力与计算量同步。
  3. 生产率本身也存在一条“苦涩的教训”:生产率的提升(GDP)主要与人均能源投入相关。GDP 与能源消耗的关系图将科学创新以及“能效提升乘数”的影响,统统平滑为一条随时间演进的趋势线。发明、新方法和关键人物在过程中都至关重要,但只要把视角拉得足够远,生产率与其说取决于发明,不如说取决于能源消耗。

这篇文章可以在我的网站 https://evjang.com/2026/09/10/smooth-exponential.html 上找到

已读完 · 本文由熊猫易读翻译重排