JJ@JosephJacks_ · X09-05全球现有算力约相当于2000万块H100 GPU。其中约5%用于训练六个月,大致能产出一个10万亿参数的顶尖模型……达到Astra或Fable的水平。绝大多数算力都消耗在推理上……预训练的效率比生物机制低数十亿倍。看原文去原帖