当单卡算力撞上800 TFLOPS,我翻了37份AI融资BP,发现90%的“大算力需求”都是PPT泡沫
那个被吹爆的“800 TFLOPS”是怎么骗过投委会的 上周又有两家公司更新了融资材料,把“需要2000张H100”改成了“首批部署300张B200即可启动”。数字砍掉85%,估值反而往上抬了40%,这种魔术我五年里看过太多遍。投资经理们把英伟达官网的FP8算力数字拿来当圣旨,却从不去看数据中心机房…

那个被吹爆的“800 TFLOPS”是怎么骗过投委会的 上周又有两家公司更新了融资材料,把“需要2000张H100”改成了“首批部署300张B200即可启动”。数字砍掉85%,估值反而往上抬了40%,这种魔术我五年里看过太多遍。投资经理们把英伟达官网的FP8算力数字拿来当圣旨,却从不去看数据中心机房…

去年Q4,CTO在季度复盘会上把GPU成本报表摔在桌上:“200张A100-80GB,平均利用率41%,你告诉我这不是在烧钱?”我盯着Grafana上那条软绵绵的绿线,GPU显存占用率确实很少冲过60%,可作业队列里天天堵着一堆等着要8卡整机的训练任务。问题不在算力不够,而在「碎片化」——每个跑在单…

去年秋天,我蹲在浙江一家汽车底盘件工厂的质检车间里,看着我们的AI模型把一片制动盘上的气孔误判成划痕,产线停了三分钟。车间主任老陈抱着胳膊,盯着屏幕上的误检图,只丢给我一句话:“你们这模型能一周更新一次不?现在的活,废品率又涨了。” 我是沈青锋,干了三个创业项目,现在这个公司搞制造业的AI视觉检测。…
过去五年,我在投资机构审阅了三百多份AI基础设施相关的BP。我可以负责任地说,90%的创业者都在用同一套PPT模板:先贴一张NVIDIA官方的DGX超算渲染图,然后写“我们要建亚洲最大的AI算力平台”。我问他们单机柜功耗多少,回我“大概20kW”。我说现在一个GB200 NVL72的机架设计功耗是1…

我花三周深度对比了AMD MI350和NVIDIA H100、L40S在Llama 3-70B推理上的表现,从延迟、吞吐、功耗到TCO逐一拆解。MI350的能效惊艳,但软件栈的坑差点让我通宵重装系统。这篇文章适合正在做推理芯片选型的高级工程师,看完你会清楚MI350到底该不该上。

把GB200的架构白皮书啃了三晚,我终于搞懂了NVIDIA这次玩的不只是迭代——Grace CPU与两颗Blackwell GPU通过NVLink-C2C缓存一致性融合成一颗超算模块,统一内存池高达860GB,推理能效有望甩开H100两倍以上。但这背后是1200W功耗、全液冷和80kW机柜的现实约束,本文拆解了从晶体管线布到TCO计算器的全链路,供AI基础设施工程师做技术选型参考。

搞AI推理这么多年,GPU内存墙是我最想砸电脑的问题。A100标称2039 GB/s的带宽实际只有1600多,计算单元90%的时间在等数据。去年试了Groq LPU,220MB纯SRAM架构把延迟干到0.54ms,但只能跑小模型。昇腾910B的达芬奇架构异构计算确实有两把刷子,但CANN软件栈差点让我加班到凌晨三点成了常态。这篇文章是我用2000条真实数据实测出来的结论,附上能跑的代码和选型决策树。