放弃MIG,拥抱Time-slicing:我们如何在Kubernetes上把GPU显存榨出30%额外利用率

去年Q4,CTO在季度复盘会上把GPU成本报表摔在桌上:“200张A100-80GB,平均利用率41%,你告诉我这不是在烧钱?”我盯着Grafana上那条软绵绵的绿线,GPU显存占用率确实很少冲过60%,可作业队列里天天堵着一堆等着要8卡整机的训练任务。问题不在算力不够,而在「碎片化」——每个跑在单…