垂直AI初创公司的胜机不在与巨头争夺记录系统或通用入口,而在于专注把某项跨系统的完整工作做到最好,借学习闭环积累判断力。

SEEMA AMBLE(@SEEMA_AMBLE)观点长文 · 已翻译 · 约 10 分钟
阅览室 · AI 最佳实践#智能体#学习#系统#任务原文

支持现有记录系统的乐观论点在于,AI 让记录系统变得更加重要,而非相反。原因何在?因为理论上,客户现在可以将系统的数据导入 Claude 或 Codex,从而跳过 AI 原生应用。

随着智能体通过这些系统完成更多工作,它们所掌控的数据和操作变得愈发宝贵。因此,一个现有记录系统加上一个通用智能体(或由现有厂商构建的智能体)或许就足以完成任务。这正是 Salesforce 刚与 Anthropic 合作宣布的内容:Claudeforce 让你无需打开 Salesforce 就能在 Claude 内部 操作 Salesforce CRM(至少他们是这么宣称的!)。

这一论点部分正确。现有厂商并未坐以待毙。

现有厂商有动力控制和对其数据访问收费,如今也推动自身智能体的发展。我们已经看到现有厂商推出的产品正从单纯存储信息转向承担更多实际工作。Docusign 的 Iris 审查合同,Atlassian 的 Rovo 旨在解决和路由请求,Klaviyo 的 Composer 则构建营销活动并评估营销绩效。这些产品推动现有厂商超越套个聊天机器人策略,进入实际执行阶段。

与此同时,Claude 开始协调跨应用的工作,使通用智能体能够充当现有系统之上的一个层级。Claudeforce 展示了这种可能性:Claude 可以成为工作的入口,而 Salesforce 仍掌控底层 CRM 数据和操作。 界面与记录系统看似正在解耦,为 AI 原生初创公司围绕工作重新整合创造了机会。

那么,初创公司还能在哪些领域竞争?

垂直型AI原生公司必须依靠专注取胜。它必须将某项跨系统的具体工作做得更好,胜过现有企业专门构建的智能体,也胜过像Claude这样的通用智能体——后者能够从底层工具中重构出这项能力。专注能让垂直初创公司获得更深层的接入权限、精心构建的数据资产、更具体的上下文,以及一个学习闭环,从而随着时间推移,对某项特定工作“何为优质表现”形成更深刻的理解。

智能体层级

要看清现有企业的优势所在,以及垂直型AI公司可能在何处占据上风,不妨从四种应用层智能体入手,它们各自所需的自主性和判断力程度不同。

检索助手负责查找信息、总结文档、回答问题并起草回复。
流程智能体执行基于规则的工作,如更新记录或路由审批,运用有限的判断力来解读任务并采取行动。
策略智能体将组织手册、先例和阈值中的规则应用于模糊案例。
主理智能体则需对组织应如何行动做出判断决策,往往涉及战略、风险和资源方面的开放式权衡。

一年前,大多数现有企业的AI产品即便有进展,也仍停留在检索阶段。它们主要作为聊天机器人和分析工具,从现有记录中提取信息。如今,更多产品能够基于其已内置的工作流、权限和规则采取行动。少数企业开始应用狭窄的、由人工定义的策略。当决策依赖于现有企业所管理记录之外的信息时,判断就变得更加困难。

我们看到的广泛转变是,现有企业正沿着层级向上移动,从检索和流程处理,转向通过政策进行更多判断,比如Docusign的Iris应用法律团队的策略手册。但这种判断在很大程度上仍受限于现有企业所拥有的记录。

任务比记录更宏大

现有企业可以围绕其核心记录自动化更多工作,但客户要完成的任务远不止记录本身。这并非硬性的技术界限,因为现有企业可以引入外部数据并添加工作流程,但他们的工作仍然从他们已拥有的记录向外扩展

客户的工作是通过其人员、流程和软件的组合来完成的。合同不等于法律事务,工单不等于客户的解决方案,商机不等于销售。完整的工作跨越了应用、团队,甚至公司。不同方可能持有不同信息,并期望不同结果。现有企业局限于构建本地工作系统,但更大的机会在于跨边界管理任务,包括所有相关方、人员、文档、决策、修订以及最终结果。

像Claude或Codex这样的通用代理或许能够跨越所有这些系统,但仅凭访问权限并不意味着它能出色完成任务。即使使用MCP,跨应用拉取信息也存在延迟,且每个应用可能对同一客户、合同或交易有不同的描述方式。即使通用代理能访问一家公司的所有应用,它也不一定能自动获取外部方持有的信息(例如买卖双方之间的信息)。

尽管存在这些限制,Claude仍能凌驾于记录系统之上。Claudeforce使Claude成为任务的前台,而Salesforce仍掌握CRM数据和操作。并且,Claude可以通过现有企业认可的更深层次集成,持续获取更多上下文。

垂直AI如何学习

掌握更多工作环节之所以重要,是因为这让初创公司能够看到产生最终结果的决策与修正过程。通过具备恰当上下文、工具、工作流程及正确评估方式的垂直框架,模型在特定任务上表现更佳。这一框架使学习循环成为可能。正是这个学习循环——模型加框架——在每次任务后,利用智能体的工作成果、专家反馈及实际结果来改进下一次尝试,从而提升整个系统。

仅凭完成的记录,并不自动构成足够的工作训练课程。一份签署的合同展示了双方达成的协议,却未揭示所有考虑过的备选方案或每个例外条款背后的原因。一张已关闭的工单显示了解决方案,却未包含支持团队测试过的每一种假设。

记忆与学习之别

各大实验室也在构建通用记忆功能,因此仅保留上下文并非持久的优势。记忆与学习是两回事。记忆能帮助通用智能体回忆起客户的偏好或上周做出的决定,但它无法告知智能体工作质量如何、专家为何修改,或下次应做何调整。专注则让公司能见识更多同类任务的实例,加速学习,并更擅长衡量进步。

专业与机构

学习有两种。一种是学习优秀专业人士如何完成工作。 公司可通过专家设计的任务、贴近实际的案例及优秀成果的标准,开始传授这种知识。

另一种是学习特定公司或客户如何运作, 包括其模板与先例、风险阈值与升级规则。这可以从客户现有的材料入手,并通过培训过程中的修正与例外情况不断改进。关于专业的一些经验能惠及所有客户的产品,但关于某家公司的经验可能仅对该公司的产品有所提升。

要同时掌握专业知识和机构运作,初创企业不必一开始就拥有最庞大的历史数据储备。它可以为专业知识打造一套课程体系,然后通过实际生产来学习机构运作。随着开放权重模型和后训练技术的进步,整合恰当的数据与评估变得愈发关键。

长时间运行的智能体尤其能从学习循环中获益。当智能体在数小时或数天内,通过包含众多中间决策与交接的复杂逻辑链完成工作时,学习循环的质量就显得更为重要。这种长周期任务可以被拆解,并通过一系列检查点进行评估。

需要明确的是,现有企业也会从自家产品内部执行的工作中学习。但那种学习仅覆盖其职责的一部分:比如Docusign内部的合同审查、Jira内部的问题单解决,或是Salesforce内部的管道更新。

Harvey如何打造课程体系

Harvey在Tenet上的工作展示了垂直AI可能的发展路径。Harvey利用合成数据、公开法律数据以及人类专家创建的数据,对开放权重模型进行了后训练,初期并未使用客户数据。它创建了大约1750个法律任务环境,每个都模拟一个由合伙人分配的案件,配有文档、工具以及针对高质量结果的专家评分标准。平均每项任务约有50条具体标准。Harvey没有等待数年积累足够的客户历史,而是制造了一套可用于训练和评估其模型的课程体系。

Harvey更广泛的工作也展示了垂直型企业如何针对工作的不同部分训练模型,包括诸如并购尽职调查和理解律所整体知识等特定行业能力。

初创企业的机遇在于将所有要素整合起来。垂直领域的专精使初创企业能够将工作分解为具体能力,应对数据权利、系统和权限方面的实际摩擦,并将产品融入客户的日常工作。最终,它可以坦然承担结果的责任。部署与责任在此至关重要!

什么构成了优质的垂直AI市场?

以Harvey为例,以下是评估潜在垂直AI市场的几个维度。

  • 专家能否迅速判断AI的对错,并解释如何改进?
  • 工作是否足够复杂,使得判断力至关重要(而非简单规则)?
  • 工作是否频繁发生,以便产品能够学习?
  • 初创企业能否从单一任务起步,逐步扩展至完成整个工作流程?

最强大的垂直AI市场往往满足以上四点,从而形成强大的学习循环。

法律、税务和会计领域的许多工作流程符合这一标准,因为工作重复性强、需要判断力,且专家已对结果进行审查。这一模式也出现在不那么明显的市场,如工业领域。当出现制造缺陷时,质量工程师必须收集测试结果、供应商文件、设备日志和工厂规则,然后决定哪些可接受、哪些需要改变。这些信息可能分散在多个系统中。一家现有企业可能存储缺陷报告,但没有单一产品能掌控整个调查过程。初创企业可以从这一工作的一部分入手(例如起草调查报告),并随时间推移掌握端到端的解决方案。为此,它需要学习优秀质量工程师如何调查问题,以及特定工厂、客户或审计师如何高效完成此过程。

这份工作仍待争夺

有些工作场景中,记录系统加上通用型代理就足以应对,但垂直领域的AI原生初创公司依然拥有可观的机会!最强劲的垂直机会出现在那些工作频繁发生、专家判断至关重要、且学习循环紧密的领域。现有企业或许掌握着记录,实验室可能控制着入口,但垂直AI公司仍能通过成为完成这项工作本身的最佳者而胜出。

已读完 · 本文由熊猫易读翻译重排