我把AI账单从每月120万美元降到10万美元……关于GPU我所知道的一切
**AI创业公司**在规模扩张时,**推理GPU成本**会吞噬利润;**转向开源模型+租用GPU**,可将账单从120万降至10万美元,但需**精细运维**与*

三月,我在30天内从500名付费客户增长到了5000名。
然后账单来了。50万美元,100万美元,120万美元……
随着公司规模的扩大,这反而让我在这个过程中变得贫穷。
我告诉自己这没关系,因为我刚筹集了3000万美元,负担得起。
但我算了一笔账……
如果我从5000名客户扩展到50000名,我撑不过3个月。
于是我转向了开源模型,并租用了GPU。
到了六月,那张120万美元的账单变成了10万美元。
以下是我一路走来学到的关于GPU的一切。
↓↓↓
GPU入门
GPU本质上是一台进行大量计算的计算机。
AI模型的工作方式是,你给它文本输入。
然后基于该输入,它查看模型的所有权重并计算出一个响应。
这就是你用于代码的文本输出。
但使用所有这些权重来决定输入变成什么,需要大量的计算。
非常复杂。
训练、微调和推理
训练……
AI模型公司在海量数据上进行训练。
这就是他们如何找出正确的权重,以产生他们想要的输出。
为此,你需要大量的GPU。
快速的GPU,以便你能建立反馈循环并构建大量的模型迭代。
微调……
这是你改变模型响应方式的方法。
如果你希望它使用项目符号、添加表情符号,或以特定格式回答。
这也是你赋予它使用工具能力的地方。
推理……
一旦模型权重固定。
你使用另一个GPU来处理从文本输入到文本输出的过程,这就是我们日常使用的。
每次你提问时。
GPU会将你的词语通过这些权重运行,并给你一个答案。
我们在Polsia不做训练,因为那需要数十亿美元。
但随着Polsia的增长,我们推理所需的GPU也越来越多。
获取计算资源的多种途径
获取计算资源主要有三种方式。
1. 前沿科技公司。
如Anthropic、OpenAI及其他大型企业。
2. 亚马逊、微软。
它们拥有可用于任何模型推理的GPU。
3. 租赁公司。
Fireworks和Base10出租GPU,供您进行训练、微调或推理使用。
区别在于控制权。
若租赁GPU,您能掌控负载、令牌速度等一切细节。
问题在于,在GPU上运行开源模型并不像在手机上安装应用那样简单。
您需要专业工程师来配置这一切,这相当复杂。
这正是我们在将Polsia迁移至开源模型时所经历的痛点。
虽然工作量更大,但成本显著降低。
自营GPU
每块GPU有其能处理的计算量上限。
若一次性投入过多令牌,可能导致系统崩溃,影响工作负载。
这需要平衡,因为您必须预测令牌使用量。
若您租用了整块GPU,但夜间无流量,仍需支付费用。
因此,存在诸多权衡。
起初可能会感觉不稳定,但长远来看能节省大量资金。
为什么开源对 Polsia 有效
我们用户的大部分操作,都是围绕创办新业务的简单任务。
Polsia 帮助你从零开始创建一家企业。
而人们对于如何构建,往往有着非常相似的想法。
这使得过程更具可预测性。
Minimax 和 GLM 是我目前使用的主要模型。
但如果你在一个庞大公司内运行代码库,情况复杂多变。
那么坚持使用前沿模型可能更适合你。
降低成本的其它途径
批处理…
任何对用户不敏感的后台任务,都可以在 GPU 有空闲时稍后运行,这样能保持 GPU 充分利用,从而降低成本。
提示词管理…
精简提示词,避免模型执行用户不关心的多余操作。
缓存…
需要对提示词进行全面缓存,因为缓存的令牌成本更低。
路由…
将合适的任务复杂度分配给合适的模型,而不是总是发送给大型模型。
何时放弃前沿模型
除非有提供商能提供生产就绪的开源模型。
就像 Sapiom 现在所做的那样,否则这很难实现。
关键在于规模。
一旦你找到了产品市场契合点并开始扩展,那时再考虑这个问题。
但对于尚未达到产品市场契合点的初创公司,我建议坚持使用前沿模型,专注于将产品做到最好。
故事的寓意
在账单高得吓人之前,没人会在意AI的成本。
而这其实无妨,因为起步阶段唯一要紧的是打造出优秀的产品。
我对Polsia的目标是服务十亿用户……
如果我现在不开始着手削减成本,将来它定会反噬于我。
这个生态系统日新月异。
OpenAI刚刚将Luna的成本降低了80%,我相信Anthropic很快也会效仿。
这是一场价格竞赛,对Polsia和消费者而言都是好事。
点击此处试用Polsia:polsia.com