掌控你的智能:一份实用指南

AI应用层竞争已深入智能层,领先公司正通过开放权重模型、成熟后训练栈与自有评估体系,从租用智能转向拥有并塑造自身模型权重,以掌控成本、速度与命运。

SONYA HUANG 🐥(@SONYATWEETYBIRD)随笔 · 已翻译 · 约 8 分钟
阅览室 · AI#智能#技术#训练#掌控原文

作者:@sonyatweetybird、@gradypb 与 @w1tness1ngh

AI 应用层的竞赛,不仅关乎界面、工作流或市场策略……它更是一场对智能层本身的争夺。

关于拥有自己的智能的呼声日益高涨……

最近,Alex Karp 鼓励企业拥有生产资料。不久后,@satyanadella 宣称,从前沿实验室购买智能,无异于双重付费:一次是金钱,另一次则是你为让该智能发挥作用而透露的专有知识。

每个人都在问:谁应拥有你业务核心的智能?

需要明确的是,拥有自己的智能并非强制要求,也不是建议你脱离各大实验室。对许多工作负载而言,前沿 API 和智能体仍是正确的选择。但在我们的投资组合中,我们看到越来越多的公司正为其产品的一部分构建自有 AI 能力,通过垂直整合,逐步走向拥有并塑造自身模型权重之路。

几周前,我们 @sequoia 召集了一群 AI 创始人与构建者,举办了一场关于“拥有你的 AI 技术栈”的活动。我们请 @harvey 从客户视角出发,随后 @mercor_ai、@LangChain、@trajectorylabs 和 @FireworksAI_HQ 带我们深入了解了后训练技术栈中的各个技术模块。

在众多演讲中,一套清晰的行动指南逐渐浮现。

为何是现在?

首先,开放权重模型的前沿进展速度远超预期。Kimi K3 和 GLM 5.2 的表现极为出色!过去,在开放模型上进行训练就像在跑步机上奔跑……你可能花费数月进行微调,而下一代前沿模型的发布便会抹去你的成果。如今,你可以从一个接近前沿水平的基座模型开始。

其次,独立的后期训练技术栈已经成熟。得益于@FireworksAI_HQ和@Mercor_ai等公司,每家企业都能接触到前沿研究实验室的技术栈,从训练到推理,再到人工或合成数据。凭借强大的评估体系、工程化调优、后期训练和在线学习,开源模型现在能在特定领域超越前沿模型。

一年前,你选择开放权重时,性能是可以牺牲的。如今,这正变成一个关乎生存和战略的问题。最新的战场在于智能层,而非你的权重或产品。

何时应该做出转变?

没有一刀切的方案。除了性能之外,你的产品中可能有些部分,租用智能会变成一种约束,原因包括……

1. 成本。 你的AI产品越成功,AI的销售成本就越高。如果推理成本直接随使用量增长,那么拥有模型是保护利润率的最佳方式。

2. 速度。 如果你在编码(标签自动补全)或网络安全等领域运作,一个小型精炼的定制模型可能胜过大型通用模型,因为速度至关重要。

3. 专有数据。 如果让你的系统变得更好的是反馈、评估、客户互动或领域数据,你可能更希望这些数据留在自己的围墙之内。

4. 掌控自己的命运。 应用层和智能层开始融合。实验室正向上进入产品领域,而应用公司则向下深入定义产品思维方式的训练循环。拥有产品越来越可能意味着掌控更多的学习循环和智能本身(感谢@harvey Research、@RampLabs、@glean、@factoryAI等)。

路线图是什么?

假设你已经决定了拥有与租赁的策略,接下来的问题是:如何从零到一?

组建你的团队。 不要把这硬塞进一个平台团队里。拥有你的智能需要有人打进攻:构建评估、塑造数据、实验开放模型、调优框架,并在某个领域推动性能提升。小而精的新团队在这里能走得很远,与六七个生态系统伙伴合作。例如,@harvey 仅凭七人团队就完成了令人惊讶的大量研究!

让工作变得清晰可见。 现在每个买家都在挑选他们的AI冠军。越来越常见的是,决定胜负的关键在于已发表的研究、基准测试或技术文章。如果你选择在内部做精彩的研究,就与生态系统分享吧。

执行技术步骤。 我们在下面列出了一个高层框架。

1/ 评估

@gabepereyra 说得很好:“如果没有好的基准,你就无法训练模型。”

评估是一组任务,用来衡量你的系统是否能出色地完成工作。每个任务包含一个提示、模型可用的上下文,以及一个评分器。大多数评估始于创始人盯着输出,凭感觉判断是否合理。目标是将这种判断转化为可重复的过程。

@harvey 通过将真实的法律工作转化为可测试的离散任务,构建了其法律代理基准。第一版包含24个法律实践领域的1200多个代理任务,并由超过75,000条专家撰写的评分标准进行评估。

在决定拥有你的智能之前,先有评估至关重要。一旦每次前向传播都有评估,选择使用哪个模型就可以是一个有依据的决定,而不是猜测。

2/ 框架与上下文工程

一个智能体由三部分组成:模型、上下文和框架。框架负责管理围绕模型的业务逻辑:路由、检索、工具、记忆、回退和追踪。@hwchase17 的简洁表述是:“框架的主要任务是在恰当的时间点将上下文提供给模型。” 对于模型而言,任务越偏离其常规分布,现成框架的效果就越差。

一个好的框架能让你将任务路由到最适合特定工作的模型,跨模型复用相同的评估标准,并决定智能体获得哪些上下文和工具。它还使智能体变得可检查。你可以追踪输入了哪些上下文、调用了哪些工具,以及它在何处卡住。

3/ 后训练

后训练涵盖多种技术。选择哪种取决于你想要改进什么。

@lqiao 对此进行了阐述:如果模型缺少事实知识,你无需进行后训练——只需使用上下文或RAG。如果输出格式或行为有误,则使用监督微调。如果问题在于产品品味,则使用偏好调整。如果模型需要在特定任务上提升,则使用强化学习。如果模型运行过慢或成本过高,则进行蒸馏。

目标是选择能推动评估指标提升的最轻量级方法。然后通过相同的框架部署模型,并在运行过程中衡量质量、延迟和成本。

4/ 在线学习

一旦系统具备了各个组成部分——评估、框架和模型——最后一步就是在生产环境中改进该系统。

@QuantumArjun 提出了一个很好的观点:模型变得越来越聪明,但每次会话都感觉像是它们第一天上班。你可以把陶哲轩放进一家会计事务所,但很可能(至少第一天)他不会成为那里最优秀的会计师。所欠缺的是经验,而非智力。智能体在运行过程中会积累这种经验。

轨迹是贯穿任务全程的路径:模型所见的上下文、它调用的工具与子代理、它生成的答案,以及用户编辑、撤销或重试的内容。在像@LangChain的LangSmith这样的工具中捕获这些轨迹,对于构建持续的生产循环至关重要。一次失败的任务转化为评估。缺失的信息被纳入上下文或记忆。糟糕的工具响应则成为框架修复的契机。

结语

买家需谨慎:拥有自己的智能,无异于打开潘多拉之盒。

封闭模型栈简单直接。你调用前沿模型,使用现成的框架(如Claude Code或Codex),添加提示词和上下文,然后上线。这提供了较高的下限,但也限制了上限。

拥有自己的技术栈意味着你要更多地亲自掌控系统。生产栈变成你的开源模型、定制框架、工具和上下文。开发栈则成为你的专有评估、领域数据和在线学习循环。

这无疑是更多的工作!它可能降低你的下限——但也抬高了上限。

实验室将继续构建巨型大脑。我们都应善加利用。

但与此同时,最优秀的产品公司正在培育自己的小天才:快速、有主见、专注于特定领域,并针对它们所见的工作进行调优。在一个更多公司掌握自身智能的世界里,生态系统繁荣发展,个性得以彰显。

这就是公司拥有自身智能的世界的承诺。我们很高兴看到小角色们的进展,那些渴望将这一世界变为现实的初创公司。

已读完 · 本文由熊猫易读翻译重排
知识卡片
一句话总结1 张
一句话总结

AI应用层竞争已深入智能层,领先公司正通过开放权重模型、成熟后训练栈与自有评估体系,从租用智能转向拥有并塑造自身模型权重,以掌控成本、速度与命运。

核心观点3 张
核心观点
01

智能层成为最新战场

  • 战场转移:从权重或产品转向智能层本身
  • 开放权重:性能已可媲美前沿,关乎生存战略
  • 垂直整合:应用公司向下深入训练循环
核心观点
02

拥有智能的四大驱动力

  • 成本:推理成本随使用增长,拥有模型保护利润率
  • 速度:小型定制模型在编码等领域胜过大型模型
  • 专有数据:反馈与评估数据留在围墙内
  • 掌控命运:应用层与智能层融合,拥有产品即拥有学习循环
核心观点
03

拥有技术栈:降低下限,抬高上限

  • 封闭栈:简单直接,下限高但上限受限
  • 自有栈:更多掌控,生产栈与开发栈分离
  • 权衡:更多工作,但上限被显著抬高
决策分支1 张
后训练技术选型决策树
模型需要改进什么?
缺少事实知识用上下文/RAG,无需后训练
输出格式或行为有误监督微调(SFT)
产品品味问题偏好调整
特定任务需提升强化学习(RL)
运行慢或成本高蒸馏
循环回路1 张
生产环境持续改进循环飞轮 · 自我增强
  1. 1捕获轨迹:记录任务全程路径
  2. 2失败任务转化为新评估
  3. 3缺失信息纳入上下文或记忆
  4. 4糟糕工具响应成为框架修复契机
  5. 5改进后重新部署模型衡量效果
回到 ①,循环往复

每次失败都成为系统改进的养料,形成自我强化的学习飞轮

关键概念3 张
关键概念
评估(Evaluation)Evaluation
详情
一组任务集,含提示、上下文与评分器,衡量系统能否出色完成工作就像像考试试卷:题目(任务)、考场材料(上下文)、标准答案(评分器)
收起
关键概念
轨迹(Trajectory)Trajectory
详情
任务全程路径:模型所见上下文、调用工具、生成答案及用户编辑就像像行车记录仪,完整回放智能体每一步决策与修正
收起
关键概念
后训练(Post-training)Post-training
详情
在基座模型之上用SFT、偏好调整、RL、蒸馏等技术针对性改进就像像大学毕业后进修:缺知识补课(RAG)、改习惯用SFT、提品味靠偏好
收起
对比1 张
封闭模型栈 vs 自有技术栈
封闭模型栈
· 调用前沿模型· 现成框架(Claude Code)· 提示词+上下文即上线
自有技术栈
· 开源模型+定制框架· 专有评估+领域数据· 在线学习循环
下限
上限
工作量
封闭模型栈自有技术栈
关键数据1 张
Harvey法律代理基准规模
1200+任务 / 75,000+评分标准

覆盖24个法律实践领域,含1200多个代理任务,由超过75,000条专家评分标准评估。

≈ 每个法律领域50个任务、每个任务62条评分标准

来源:Harvey Research

知识图解1 张
智能体三要素架构
智能体三要素架构
\text{模型}
核心推理能力,决定任务质量上限
\text{上下文}
任务相关数据,弥补模型知识盲区
\text{框架}
业务逻辑:路由、检索、工具、记忆
通俗解读框架在恰当时间将上下文提供给模型,三者协同完成智能体任务
步骤1 张
从零到一拥有智能四步法
  1. 1
    组建小而精团队,与生态伙伴合作
  2. 2
    让工作可见:分享研究、基准或技术文章
  3. 3
    建立评估体系:将直觉转为可重复过程
  4. 4
    执行技术栈:框架→后训练→在线学习
金句摘录1 张
金句

—— @QuantumArjun

点明智能体与人类专家的核心差距在于经验积累

全文脉络1 张
全文脉络
为何是现在、何时转变、如何从零到一
已生成 15 张 · 每篇精选,少而精