掌控你的智能:一份实用指南
AI应用层竞争已深入智能层,领先公司正通过开放权重模型、成熟后训练栈与自有评估体系,从租用智能转向拥有并塑造自身模型权重,以掌控成本、速度与命运。

作者:@sonyatweetybird、@gradypb 与 @w1tness1ngh
AI 应用层的竞赛,不仅关乎界面、工作流或市场策略……它更是一场对智能层本身的争夺。
关于拥有自己的智能的呼声日益高涨……
最近,Alex Karp 鼓励企业拥有生产资料。不久后,@satyanadella 宣称,从前沿实验室购买智能,无异于双重付费:一次是金钱,另一次则是你为让该智能发挥作用而透露的专有知识。
每个人都在问:谁应拥有你业务核心的智能?
需要明确的是,拥有自己的智能并非强制要求,也不是建议你脱离各大实验室。对许多工作负载而言,前沿 API 和智能体仍是正确的选择。但在我们的投资组合中,我们看到越来越多的公司正为其产品的一部分构建自有 AI 能力,通过垂直整合,逐步走向拥有并塑造自身模型权重之路。
几周前,我们 @sequoia 召集了一群 AI 创始人与构建者,举办了一场关于“拥有你的 AI 技术栈”的活动。我们请 @harvey 从客户视角出发,随后 @mercor_ai、@LangChain、@trajectorylabs 和 @FireworksAI_HQ 带我们深入了解了后训练技术栈中的各个技术模块。
在众多演讲中,一套清晰的行动指南逐渐浮现。
为何是现在?
首先,开放权重模型的前沿进展速度远超预期。Kimi K3 和 GLM 5.2 的表现极为出色!过去,在开放模型上进行训练就像在跑步机上奔跑……你可能花费数月进行微调,而下一代前沿模型的发布便会抹去你的成果。如今,你可以从一个接近前沿水平的基座模型开始。
其次,独立的后期训练技术栈已经成熟。得益于@FireworksAI_HQ和@Mercor_ai等公司,每家企业都能接触到前沿研究实验室的技术栈,从训练到推理,再到人工或合成数据。凭借强大的评估体系、工程化调优、后期训练和在线学习,开源模型现在能在特定领域超越前沿模型。
一年前,你选择开放权重时,性能是可以牺牲的。如今,这正变成一个关乎生存和战略的问题。最新的战场在于智能层,而非你的权重或产品。

何时应该做出转变?
没有一刀切的方案。除了性能之外,你的产品中可能有些部分,租用智能会变成一种约束,原因包括……
1. 成本。 你的AI产品越成功,AI的销售成本就越高。如果推理成本直接随使用量增长,那么拥有模型是保护利润率的最佳方式。
2. 速度。 如果你在编码(标签自动补全)或网络安全等领域运作,一个小型精炼的定制模型可能胜过大型通用模型,因为速度至关重要。
3. 专有数据。 如果让你的系统变得更好的是反馈、评估、客户互动或领域数据,你可能更希望这些数据留在自己的围墙之内。
4. 掌控自己的命运。 应用层和智能层开始融合。实验室正向上进入产品领域,而应用公司则向下深入定义产品思维方式的训练循环。拥有产品越来越可能意味着掌控更多的学习循环和智能本身(感谢@harvey Research、@RampLabs、@glean、@factoryAI等)。

路线图是什么?
假设你已经决定了拥有与租赁的策略,接下来的问题是:如何从零到一?
组建你的团队。 不要把这硬塞进一个平台团队里。拥有你的智能需要有人打进攻:构建评估、塑造数据、实验开放模型、调优框架,并在某个领域推动性能提升。小而精的新团队在这里能走得很远,与六七个生态系统伙伴合作。例如,@harvey 仅凭七人团队就完成了令人惊讶的大量研究!
让工作变得清晰可见。 现在每个买家都在挑选他们的AI冠军。越来越常见的是,决定胜负的关键在于已发表的研究、基准测试或技术文章。如果你选择在内部做精彩的研究,就与生态系统分享吧。
执行技术步骤。 我们在下面列出了一个高层框架。

1/ 评估
@gabepereyra 说得很好:“如果没有好的基准,你就无法训练模型。”
评估是一组任务,用来衡量你的系统是否能出色地完成工作。每个任务包含一个提示、模型可用的上下文,以及一个评分器。大多数评估始于创始人盯着输出,凭感觉判断是否合理。目标是将这种判断转化为可重复的过程。
@harvey 通过将真实的法律工作转化为可测试的离散任务,构建了其法律代理基准。第一版包含24个法律实践领域的1200多个代理任务,并由超过75,000条专家撰写的评分标准进行评估。
在决定拥有你的智能之前,先有评估至关重要。一旦每次前向传播都有评估,选择使用哪个模型就可以是一个有依据的决定,而不是猜测。
2/ 框架与上下文工程
一个智能体由三部分组成:模型、上下文和框架。框架负责管理围绕模型的业务逻辑:路由、检索、工具、记忆、回退和追踪。@hwchase17 的简洁表述是:“框架的主要任务是在恰当的时间点将上下文提供给模型。” 对于模型而言,任务越偏离其常规分布,现成框架的效果就越差。
一个好的框架能让你将任务路由到最适合特定工作的模型,跨模型复用相同的评估标准,并决定智能体获得哪些上下文和工具。它还使智能体变得可检查。你可以追踪输入了哪些上下文、调用了哪些工具,以及它在何处卡住。
3/ 后训练
后训练涵盖多种技术。选择哪种取决于你想要改进什么。
@lqiao 对此进行了阐述:如果模型缺少事实知识,你无需进行后训练——只需使用上下文或RAG。如果输出格式或行为有误,则使用监督微调。如果问题在于产品品味,则使用偏好调整。如果模型需要在特定任务上提升,则使用强化学习。如果模型运行过慢或成本过高,则进行蒸馏。
目标是选择能推动评估指标提升的最轻量级方法。然后通过相同的框架部署模型,并在运行过程中衡量质量、延迟和成本。
4/ 在线学习
一旦系统具备了各个组成部分——评估、框架和模型——最后一步就是在生产环境中改进该系统。
@QuantumArjun 提出了一个很好的观点:模型变得越来越聪明,但每次会话都感觉像是它们第一天上班。你可以把陶哲轩放进一家会计事务所,但很可能(至少第一天)他不会成为那里最优秀的会计师。所欠缺的是经验,而非智力。智能体在运行过程中会积累这种经验。
轨迹是贯穿任务全程的路径:模型所见的上下文、它调用的工具与子代理、它生成的答案,以及用户编辑、撤销或重试的内容。在像@LangChain的LangSmith这样的工具中捕获这些轨迹,对于构建持续的生产循环至关重要。一次失败的任务转化为评估。缺失的信息被纳入上下文或记忆。糟糕的工具响应则成为框架修复的契机。
结语
买家需谨慎:拥有自己的智能,无异于打开潘多拉之盒。
封闭模型栈简单直接。你调用前沿模型,使用现成的框架(如Claude Code或Codex),添加提示词和上下文,然后上线。这提供了较高的下限,但也限制了上限。
拥有自己的技术栈意味着你要更多地亲自掌控系统。生产栈变成你的开源模型、定制框架、工具和上下文。开发栈则成为你的专有评估、领域数据和在线学习循环。
这无疑是更多的工作!它可能降低你的下限——但也抬高了上限。

实验室将继续构建巨型大脑。我们都应善加利用。
但与此同时,最优秀的产品公司正在培育自己的小天才:快速、有主见、专注于特定领域,并针对它们所见的工作进行调优。在一个更多公司掌握自身智能的世界里,生态系统繁荣发展,个性得以彰显。
这就是公司拥有自身智能的世界的承诺。我们很高兴看到小角色们的进展,那些渴望将这一世界变为现实的初创公司。