机器中的幽灵:模拟与AI驱动的决策未来
AI行为模拟正将企业决策从「昂贵、缓慢、依赖不可靠受访者」的传统研究,转向「数小时、低成本、可反复查询合成人群」的新范式,其真正护城河在于数据飞轮、工作流嵌入与

企业决策正借助AI实现更精准、更高效的规模化升级。
试想一下:某家财富500强品牌的首席营销官在一夜之间,将三款包装设计方案与10,000名消费者进行测试,而后才敲定最终方案。一位政治顾问在投入一分钱媒体预算之前,就已针对三个摇摆选区的选民,对某参议院竞选团队的宣传信息进行了压力测试。一位北约分析师模拟了某欧洲国家全境510万民众对外国虚假信息宣传活动的反应,并针对同一群体测试了应对策略。
令人难以置信的是,这些研究均未开展访谈、问卷调查或焦点小组讨论。它们全部针对一个通过合成方式生成的人群进行查询,整个过程仅耗时数小时而非数周,成本仅为传统人工样本的一小部分,且其代表性不逊于(甚至优于)传统方法论。
行为模拟或许是我们所见过的、最具深远意义的应用型AI用例之一。 如今,它已是一个成熟的商业类别,在消费者市场研究等领域拥有付费企业客户。如果这项技术能达到其顶尖构建者所设想的高度,它就有潜力成为企业进行所有重大决策所依赖的基础层。以下是对其当前实际应用、主要参与者,以及决定成败关键因素的探讨。
对合成研究的需求日益增长
几乎每个重大决策背后的瓶颈都一样:在投入之前,无法预知人们实际会如何行动。市场研究是一个价值1400亿美元的行业,但其弊端已显而易见地令人痛苦。大型研究公司的一个简单概念测试可能从五位数高价起步,耗时数周,而更深入的项目则可能花费数百万美元、耗时数月,迫使组织不得不有选择地将研究范围限制在少数几个关键决策上。
更深层的问题不仅在于成本和速度:源数据往往不准确。受访者仅获得象征性报酬来填写问卷或参加焦点小组,一些研究发现,他们的回答与后续行为的关联度仅约40%。部分问题源于缺乏代表性的样本和紧张的预算,但更大的问题在于,访谈者可能引入偏见,而受访者可能是不可靠的叙述者。传统研究几乎完全依赖于人们所说,而非他们实际所做。最难触达的人群,包括政策内部人士、首席信息安全官或罕见病患者群体,几乎无法找到,更遑论进行研究。
一类相关的AI原生平台,如Strella和Listen Labs,应运而生,旨在自动化定性访谈本身,以以往不可能的速度和成本,与真实受访者进行对话并综合结果。尽管这些平台具有开创性,但群体模拟走的是另一条路径:以数据或人类访谈为输入来建模行为,然后构建合成群体以模拟结果、发现涌现的因果联系,并驱动决策。
一旦LLM在2023年底使模拟连贯的人类推理变得足够经济并实现商业化,随之而来的便是一波探索其可能性的学术论文浪潮。到2024年,这些技术已进入商业研究领域,而到2025年,真正的企业收入开始流动。在我们与买方的对话中,许多人已经确认了巨大的成本和时间效益。因此,一些领先企业现在每年在这些新兴公司上花费七位数。当那些过去绝不会值得战略咨询项目的决策,如今可以在一个下午内针对合成人群进行查询时,值得研究的领域范围呈指数级扩大,并发生了根本性改变。
模拟的两大阵营

构建合成人群的新兴方法论
在构建合成人群的方式上,市场参与者正汇聚成两大主要阵营。第一个阵营基于真实人类访谈构建,随后通过多层行为数据加以丰富,以便在未来的项目中反复查询。Simile 是斯坦福大学的一家衍生公司,源自开创性的“Smallville”生成式代理研究,在该研究中,AI代理在模拟小镇中生活,无需人工脚本便形成了日常习惯和互动。他们深入的研究方向使其偏离了直接提示现成模型的路径,转而训练专有的模拟和置信度模型,将收集到的行为和访谈数据融入模型权重本身,而非仅仅依赖上下文窗口。Simile 拥有一个个体模型,用于维护管理个人偏好、偏见和世界观的内在逻辑,同时还有一个群体模型,将这些学习成果大规模应用。Rehearsals 是该阵营中的另一参与者,同样进行人类访谈,但他们以心理学为基础的核心方法和多模态克隆作为切入点。
第二个阵营则侧重于从摄入的数据源而非个体访谈来重建人群。这些数据源可包括人口普查与人口统计研究、行为痕迹、历史研究小组以及社交聆听。Aaru 正是这一理念的体现。他们认为,仅依赖非访谈数据能让客户更快实现价值,同时避免访谈本身成为引入人为偏见的污染源。该阵营主张,自我报告继承了可能使传统研究不可靠的偏见,因此将人物角色建立在访谈基础上,可能会导入模拟本应避免的相同错误。Artificial Societies 是另一个商业实例,它通过合成建模的人物角色而非一对一访谈来构建人群。
基于访谈的方法论则反驳说,这些偏见在模拟真实人群行为时可能具有价值;仅以数据和行为痕迹为输入,几乎不可能进行验证和回溯测试;而与真实、具名个体进行校准,正是区分可信数字孪生与泛化人物角色的关键。话虽如此,各阵营之间的界限可能变得模糊。访谈优先的方法往往仍会整合公开数据,而纯数据方法也可能吸收客户的第一方记录(包括先前的调查、焦点小组和访谈)以改进其输出。像 Electric Twin 这样的参与者已经出现,占据了更为混合的视角。
无论一家公司从哪种方法起步,都揭示了其创始人对价值所在之处的信念,而这种信念将塑造他们最初的理想客户画像和未来的发展路线图。
企业买家视角
尽管初创企业在两大阵营中各有侧重,但买家大多采取了更为务实的态度。企业用户经常同时评估两大阵营的产品,他们的采购决策更多取决于具体的应用场景和技术要求,而非供应商围绕构建人群的理念。准确性是第一道检查关卡。如果输出结果无法验证或追溯,买家便不会对结果产生信心,该类别也可能难以通过严肃的采购或续约流程。
然而,即便是方向性的准确性,在缩小选择范围、在更昂贵的人工研究之前预先筛选想法方面也具有价值,并且往往比决策者如今被迫依赖的粗略猜测更胜一筹。
在这一领域为企业构建产品的人,需要成功驾驭三个层次的准确性:
| 态度复现 | 模拟回答是否与人们的表述一致? | 这是大多数已发表图表所衡量的内容。其上限由所用调查和基准设定,而这些可能与实际行为关联较弱。 |
| 行为复现 | 模拟是否与真实个体的行为及其在不同条件下的变化相符? | 这是更难也更有意义的衡量标准。该类别在此方面证据零散,但严格的样本外评估较为罕见。买家基准表明,最佳产品在实际活动结果上的误差在10–15%以内,足以支撑真实的商业决策。 |
| 涌现模拟 | 模拟人群在面对训练集或访谈数据之外的变量输入时,是否仍能保持准确性? | 这要求模拟能够再现任何单个个体无法产生的宏观现象,如情绪指数、零售趋势或选举结果。准确性的检验在于,个体间的互动是否产生真正的涌现行为。 |
另外,尽管我们在此聚焦于人类行为的模拟,还存在一个相关且新兴的公司类别,如Mantic或Preseen,它们旨在预测事件结果,如选举结果、供应链中断概率或监管决策。许多公司通过在Metaculus排行榜上竞争或在预测市场中下注起步。如果预测性预报和企业模拟能够证明其准确性或提供足够的信息量,它们在实际应用中具有无限潜力。
赢家需要做对什么
鉴于变化的速度,我们不认为合成人格、数据管道或查询引擎是护城河所在,因为基础模型和公共数据很可能在未来几年内将这三者商品化。我们相信真正的护城河将是:用于校准各人群的专有第一方数据、产品所嵌入的工作流程,以及通过严格验证建立起来的机构信任。
数据飞轮
企业级应用应整合客户自身的记录、交易日志及以往的调查波次,以校准人群。每次部署都会反馈回响应数据,优化下一次预测,并构建专有信号。构建这一人群正是技艺所在。对构建不当的人群进行查询,结果虽快却错,因此构成与校准才是决定准确性的关键。
产品工作流
当产品不再只是客户偶尔咨询一次性问题的工具,而是成为决策过程中固定的一环,应用于每次发布、定价决策和营销活动时,其粘性最强。届时,移除这一引擎就意味着要重建组织决策流程的一部分。
机构信任
随着预测在多次应用中保持准确,客户能通过指出系统得出结论的过程来捍卫自己的选择,以及该工具成为他们在下一次高风险决策中本能求助的对象,信任便会不断累积。机构信任建立缓慢,但一旦确立,便使供应商难以被取代。
模拟技术的下一步
机器中的幽灵已不再是比喻。有了足够的令牌和数据,一个可辨识的真实人物模型便应运而生,涵盖其品味、直觉及决策权衡方式。几年前还只是思想实验的概念,如今已成为实际产品,其精准度足以让企业将真实决策流程交由它处理。
随着技术能力的演进,商业与伦理界限的需求日益凸显。没有任何力量能阻止国家利用这些模拟进行政治定向或宣传优化,而当一个人的数字孪生足够精确,能在其缺席时被查询,谁拥有其回应权的问题尚无答案。
这一领域仍处于早期阶段,企业需要时间来赢得企业信任,并对照现实世界的结果检验其模拟。胜出者将需攻克最艰难的部分:真正的准确性、数据飞轮与工作流的持续累积、对所售产品验证的严谨态度,以及清晰界定这项技术应用边界的视野。在前沿地带,快速构建与深思熟虑必须并行不悖。
如果你是这一领域的创业者,欢迎联系Elliott Robinson、Andrew Ren或Caty Rea,深入探讨更多细节。