🏷️ 大模型推理

Blackwell架构与GPT-4o的启示录:云架构师如何从硬件崇拜者进化为服务编排师

大家好,我是韩知行。今天想跟大家聊聊一个有点意思的话题——AI算力这波爆发,到底对我们云架构师意味着什么。我最近在复现一篇DeepMind上个月发的那篇论文,里面提到了Blackwell架构的能效比提升,结果实际用起来发现…咳咳,别提了,后面细说。但确实,从GPT-5.5o到现在的各种AI大模型,再…

仿真跑了100%通过,实测76%——我的AWS Trainium大模型推理部署踩坑实录

大家好,我是许彦,一个在机器人领域摸爬滚打了五年的工程师。我的工作从机械臂到人形机器人,一路走来,深刻体会到“仿真很美好,真实世界很残酷”这句话的重量。尤其是在AI部署这块,你以为在电脑上跑得飞起的模型,到了真实硬件上,往往要经历一场血雨腥风的适配和优化。今天,我想跟大家聊聊AWS Trainium…

我用 AWS Trainium 2 重构了公司大模型推理链路,显存降了一半但踩了几个致命坑

凌晨两点,我又被 AWS 的账单提醒邮件吵醒了。这次不是普通的警告,而是赤裸裸的“警告:您的 Trainium 实例显存使用率连续三个月超过 80%,建议优化或升级实例类型”。我盯着屏幕上的数字,手里的咖啡已经凉透。公司部署的几个大模型推理服务,自从上个月切换到 Trainium(Trn2)实例后,…