我用Blackwell B200重构了公司大模型推理链路,显存降了一半但踩了几个致命坑

我盯着监控屏幕上的红色警告已经三小时了。公司自研的Sage大模型推理服务集群,正在经历一场前所未有的显存风暴。每个Blackwell B200 GPU的显存占用率都在95%以上,队列堆积如山,P99延迟从正常的200ms飙到了1200ms。运维那边已经把所有能调的参数调到极限,但显存瓶颈就像一堵墙,…