想法时间线
JJ@JosephJacks_ · X
09-05

全球现有算力约相当于2000万块H100 GPU。

其中约5%用于训练六个月,大致能产出一个10万亿参数的顶尖模型……达到Astra或Fable的水平。

绝大多数算力都消耗在推理上……预训练的效率比生物机制低数十亿倍。

去原帖