我在Trn2上训了个130亿模型,然后重新算了一笔账——Trainium2的ROI被高估了
我叫方瑾,在一家硬科技基金做了五年技术顾问。我的日常工作就是看BP、拆团队、审架构、算账。五年里我见过上百个AI项目,多数是“PPT AI”——演示的时候跑得欢,一上生产环境ROI就碎成渣。所以我养成了一个习惯:只看真实跑过、能交出完整成本账单的案例。三个月前,一个做垂直行业大模型的被投企业找到我,…
我叫方瑾,在一家硬科技基金做了五年技术顾问。我的日常工作就是看BP、拆团队、审架构、算账。五年里我见过上百个AI项目,多数是“PPT AI”——演示的时候跑得欢,一上生产环境ROI就碎成渣。所以我养成了一个习惯:只看真实跑过、能交出完整成本账单的案例。三个月前,一个做垂直行业大模型的被投企业找到我,…
如果你在 2024 年底问我,十万卡训练集群的账本还能怎么砍,我会说“下一代 GPU 的显存带宽再翻一倍,网络换成 800G,也就这样了”。但今年年初在 UltraCluster 上跑完千亿模型全量预训练后,我重新理解了这个问题。这场棋局的关键变量不是算力密度,不是显存容量,而是芯片间的互联拓扑能否…
讲真,当我第一次看到AWS Trn2实例的报价时,我的第一反应是:这玩意儿该不会是来搞笑的吧?毕竟我们这群独立开发者已经被各种云厂商的“下一代AI芯片”忽悠了太多次。但你猜怎么着?这次我真的把宝押上去了。我用Trn2集群完整跑了一次千亿参数模型的预训练,从采购、迁移、调优到最终的账单核算,整个过程简…
去年秋天英伟达把第一台DGX B200送进我们机房的时候,整个组都在围观那个像迷你冰箱一样的8U液冷节点。规格表上写着单卡20 petaFLOPS FP4算力、192GB HBM3e、1.8TB/s的NVLink 5带宽,所有人脑子里都是一个念头:“万亿参数模型可以随便训了。”我当天晚上就把Shoe…