🏷️ FP8 训练

Google那篇关于FP8的论文里说能省50%显存,但当我把Llama 3.1跑在Blackwell上时,我的Loss却炸了

上周在实验室组会上,老板扔给我一张 Blackwell 架构的架构图,问我:“韩知行,这玩意儿真的能解决我们现在的显存墙问题吗?”我盯着那张图看了五分钟,脑子里想的不是晶体管数量,而是我们那帮搞分布式训练的兄弟又要掉多少头发。说实话,从 Hopper 到 Blackwell,NVIDIA 这次玩了一…