我拆解了英伟达AI工厂的TCO模型,发现万卡集群的盈亏平衡点在18个月
过去五年,我在投资机构审阅了三百多份AI基础设施相关的BP。我可以负责任地说,90%的创业者都在用同一套PPT模板:先贴一张NVIDIA官方的DGX超算渲染图,然后写“我们要建亚洲最大的AI算力平台”。我问他们单机柜功耗多少,回我“大概20kW”。我说现在一个GB200 NVL72的机架设计功耗是1…
过去五年,我在投资机构审阅了三百多份AI基础设施相关的BP。我可以负责任地说,90%的创业者都在用同一套PPT模板:先贴一张NVIDIA官方的DGX超算渲染图,然后写“我们要建亚洲最大的AI算力平台”。我问他们单机柜功耗多少,回我“大概20kW”。我说现在一个GB200 NVL72的机架设计功耗是1…
一张翻了倍的云账单让我痛下决心重构推理基础设施。我拆解出每token的真实成本,用Spot实例混合按需、连续批处理、时间切片替代MIG,甚至给Envoy加了压缩,最终把月GPU费用从8400美元砍到3100美元。这篇文章记录了我踩过的每一个坑和每一步优化代码,适合被GPU推理成本压得喘不过气的工程师阅读。