我用 AWS Trainium 2 重构了公司大模型推理链路,显存降了一半但踩了几个致命坑
凌晨两点,我又被 AWS 的账单提醒邮件吵醒了。这次不是普通的警告,而是赤裸裸的“警告:您的 Trainium 实例显存使用率连续三个月超过 80%,建议优化或升级实例类型”。我盯着屏幕上的数字,手里的咖啡已经凉透。公司部署的几个大模型推理服务,自从上个月切换到 Trainium(Trn2)实例后,…
凌晨两点,我又被 AWS 的账单提醒邮件吵醒了。这次不是普通的警告,而是赤裸裸的“警告:您的 Trainium 实例显存使用率连续三个月超过 80%,建议优化或升级实例类型”。我盯着屏幕上的数字,手里的咖啡已经凉透。公司部署的几个大模型推理服务,自从上个月切换到 Trainium(Trn2)实例后,…
看着Prometheus上那条几乎贴着地面的CPU使用率曲线,我经常有一种“被割韭菜”的错觉。这就是Kubernetes在云原生时代最大的痛点:为了那1%的突发流量,我们往往要为99%的时间支付100%的资源成本。以前我总觉得Serverless是AWS Lambda这种公有云的专利,直到我深入研究…
我叫沈青锋,正在做第三个创业项目——用AI做汽车零部件的表面缺陷检测。我们给长三角十几家中小型汽配厂部署质检工位,摄像头拍下零件,模型实时判断有没有划痕、气泡。这些模型跑在Azure的GPU虚拟机(NCas_T4_v3系列),数据存储在Blob Storage,推理服务托管在AKS集群上。客户产线2…