Cerebras如何以每秒高达750个token的速度服务GPT-5.6 Sol
**Cerebras WSE-3** 通过**消除内存墙**,将 GPT-5.6 Sol 推理速度提升至 **750 tok/s**,**不改变模型**,却**

过去两年,AI 模型的能力突飞猛进。它们能进行更长时间的推理、编写可直接上线的代码、操作计算机、使用浏览器,并在科学、金融、数学、物理和工程等领域产出专业级成果。
但体验中有一个环节始终未变:等待。

OpenAI 正在预览 GPT‑5.6 Sol 的全新超快模式,该模式运行于 Cerebras 平台,输出速度最高可达每秒 750 个 token。这种速度正在改变我们使用 AI 的方式:现在我们可以保持心流状态,并与智能体进行实时协作。

最关键的细节在于我们未做任何改动之处。
运行于 Cerebras 平台的 GPT‑5.6 Sol 并非经过精简、蒸馏或降低精度量化的更小模型。它与标准 OpenAI 端点上的 GPT-5.6 Sol 采用完全相同的模型架构、权重、精度、上下文配置和推理设置。它保留了人们喜爱 GPT-5.6-Sol 的浏览器操作、计算机操作和编码能力。
唯一的区别在于模型运行的硬件;我们不再使用 GPU,而是将 Sol-Ultrafast 部署在 Cerebras WSE-3 上——这是全球最大的 AI 芯片,为最快的 AI 芯片 Cerebras 提供动力。
借助 Cerebras,GPT-5.6-Sol 重新定义了速度与智能的帕累托前沿。

为何前沿模型的推理通常很慢
在传统GPU上,计算核心与存储模型权重的高带宽内存位于不同的芯片上。在推理的每次计算中,权重必须反复跨越这一界限才能到达计算核心。随着模型规模增大,推理的瓶颈不再主要受限于算术运算,而是取决于系统移动这些权重的速度。
这就是GPU内存墙。

增加GPU数量可以提升吞吐量,但这并不会自动让单个响应变得更快。将模型拆分到多个芯片上意味着每一层结束时都需要一次同步步骤,而每增加一个芯片,这一步骤的成本就会上升,同时还会缩减其本应加速的计算能力。存在一个临界点,此时互联开销占据主导,增加硬件反而会使模型变慢。简而言之:计算机花费了太多时间在数据传输上。
Cerebras旨在解决这一内存移动瓶颈:打造一个足够大的处理器,使模型的活跃权重紧邻使用它们的计算核心。

Cerebras如何加速模型,从一整块硅晶圆说起
传统芯片是从硅晶圆上切割下来的。而Cerebras则直接将整块晶圆用作芯片。
在传统GPU上,模型权重存储于片外HBM中,每个令牌都必须跨越这一距离进行计算。相比之下,WSE‑3将44GB的SRAM分布在整个晶圆上,紧邻其90万个核心。这些内存合计提供每秒21PB的聚合带宽,使每个核心都能快速访问所需的权重。

GPT‑5.6 Sol对于单个加速器而言过于庞大,因此Cerebras在层边界将其分割,分布在多个CS‑3系统上。每个晶圆将其负责的层保存在本地SRAM中。对于每个令牌,激活值从一个晶圆传递到下一个,直到最后阶段输出结果。
这取代了传统GPU集群所需的许多细粒度分片和同步操作,采用更简单的路径:权重紧邻计算单元,只有激活值在阶段间移动。随后,这一流水线重复运行,每秒最多可达750次。
每秒高达750个令牌对您意味着什么
大多数人认为与智能体合作就是输入一些内容,然后得到一些输出。但在幕后,智能体会执行许多步骤。它读取任务,对结果进行推理,编写代码,测试其工作,决定下一步行动,并循环工作,直到准备好交出控制权。
一个复杂的任务可能涉及多个模型请求和工具调用,因此延迟会在整个工作流程中累积。
这意味着每个令牌的延迟并非一次性成本。它是您在每一步都要支付的费用,乘以完成任务所需的步骤数。而这些步骤会迅速累积。
这个乘数是可以量化的,而且比您想象的要大。在一个质量匹配的GDP‑Val任务样本中,包括法律、金融和工程交付物,GPT‑5.6 Sol Ultrafast完成相同任务的速度比标准端点上的同一模型快5.6倍。
在人类最后考试中的匹配问题上,推理主导工作流程时,Sol Ultrafast成功完成了工作速度快6.9倍。凭借这种速度,一个需要一小时的任务可以在不到九分钟内完成。
面向开发者
Cerebras 的速度在编程领域体现得最为淋漓尽致。开发者让智能体连续工作数小时甚至数天,已是家常便饭。无论你是运行循环任务,还是执行长期运行的智能体,在 Cerebras 上使用 Sol 都是一种无与伦比的体验。前沿级别的智能,以惊人的速度交付,让你比以往任何时候都更快地构建、测试和迭代想法。
面向知识工作者
知识工作有更多人类参与其中,但它依然是一个循环。工作流程中很大一部分是阅读与决策、评估输出以及创建交付成果。而在这整个过程中,人类往往只是在等待。高达每秒 750 个 token 的处理速度,让你能显著加快迭代,在更短的时间内完成更多工作——无论是起草邮件、处理税务,还是剪辑视频。
计算机使用与自动化
智能体最受欢迎的新用例之一,是让模型在你授权的情况下,在你工作的同时,于后台使用你的电脑或浏览器。这让你能够创建强大的自动化流程,将你能直接描述的任务委派给智能体,而无需在你专注于更重要事务时接管你的机器。
更快的推理速度能减少观察界面、决定下一步行动以及执行操作之间的延迟,从而显著提升计算机使用类工作负载的效率。
此外,Cerebras 在其公共端点上以每秒数千个 token 的速度提供领先的开源模型:
对于专用企业端点,Cerebras 还支持 Kimi K2.6、GLM 5.1、MiniMax M2.5、Qwen3 Coder 480B、Llama 4 Maverick、Mistral Large 3、DeepSeek V3.2,以及众多其他模型系列。
补充来源
图表由 Halley Chang 制作。