Standard Machines 用领域专家构建的 RL 环境,让模型在真实芯片设计循环中迭代,目标是让小型团队数月内完成流片,迈出模型-芯片递归自我改进的第

ANKIT GUPTA(@AGUPTA)深度报道 · 已翻译 · 约 3 分钟
阅览室 · AI 产业分析#芯片#设计#Standard#Machines#递归自我改进原文

今日,Standard Machines 正式启动,由 @jacobpeake 领衔。他们正在构建强化学习环境,以教授和评估模型在先进芯片设计领域的应用。他们与各实验室合作,推动模型能力向前发展,并实现模型与芯片之间的递归自我改进。

启动与愿景

关于其环境的完整介绍,请访问standardmachines.com/launch。

特定领域的强化学习环境通常由领域专家编写,这些专家对现实世界任务的形态、运行循环以及奖励可能被作弊的方式有着清晰的理解。

@jacobpeake 是苹果公司 GPU 架构部门的首位实习生及最年轻的员工。他曾与业界顶尖架构师并肩工作,亲眼见证了前沿芯片的设计过程:循环的运作方式,以及功耗、性能和面积之间的权衡如何被实际评估。Standard Machines 构建的环境正是运行这一相同的循环,并将这种评估方式正式化。

模型的改进以月为周期,而它们所运行的芯片的改进则以年为周期。如今,每个前沿实验室都在共同设计自己的推理芯片,而将一款芯片从架构设计到流片仍需数年时间和数百名专家的努力。Standard Machines 的目标是让小型团队能够在数月内完成先进芯片的流片。

芯片设计本应是强化学习(RL)的理想领域。正确性有可执行的参照标准,工具是程序化的,每项任务的价值巨大。然而,现有工具在三个方面存在缺陷,他对此均有记录。学术界的Verilog基准测试是约百行代码的一次性谜题,且已包含在各类训练集中。该领域的实际标准——NVIDIA的CVDP,在智能体能够与评分器迭代互动后,其通过率从34%跃升至97%,而97%的分数已无法区分优劣。此外,几乎所有评估都依赖运行测试平台:一项研究表明,通过捆绑测试平台95%至97%时间的设计,在正式等价性检查下仅有约20%的正确率。

环境构建与验证

Standard Machines构建的首个环境模拟了真实的工程循环。智能体在一个沙盒工作区内操作,该工作区包含规格说明及其自身文件,并安装了真实的EDA工具,除此之外别无他物:无参考解决方案、无可窥探的评分器、无网络连接。它编写SystemVerilog代码,运行模拟器,读取错误信息,进行修复,综合,并不断迭代。它可以在有限的预算内对当前设计进行布局布线预览,在回合中看到真实的面积、时序和功耗数据,从而发现时序不满足要求,并在提交前调整架构。

商业逻辑清晰明了。实验室在领域专家编写的环境上投入了数亿美元,而芯片设计因其正确性可验证、质量可物理测量而尤为适合。Standard Machines带来了先进芯片设计领域的专业知识,围绕其构建了稳健的真实世界环境,并让模型能够在芯片设计任务上逐步攀登。

这是构建真正RSI(递归自我改进)的第一步,将模型、系统和芯片纳入循环。提升模型在芯片设计上的能力是必要的首要检查点。

如果你在实验室或新实验室的强化学习、后训练或数据团队工作,或者你想要在芯片设计方面表现出色的模型,请通过jacob@standardmachines.com联系他。

已读完 · 本文由熊猫易读翻译重排