🏷️ AI 推理

我们把推理成本砍了一半,工厂老板终于同意继续用 AI 了:Blackwell FP8 稀疏化实战复盘

上个月,我去一家做汽车零部件的工厂调研。客户李总坐在满是油污的办公室里,手里拿着一张比A4纸还长的账单,眉头紧锁。他说:“沈工,我也想用 Llama 4 做实时质检,但云端的 API 费用每个月要烧掉五万美金,这 ROI 我算不过来账。” 这就是我们做 AI+制造业遇到的典型困境:技术够先进了,但成…

把推理塞进 Serverless:我的低资源 AI 部署实战

大家好,我是周明远。从嵌入式系统转行做 AI 推理部署这些年,我最大的感受就是:每一KB内存、每一毫秒延迟,都是真金白银。以前在单片机上跑模型,我得为几十 KB 的闪存、几百 KB 的内存精打细算;现在到了云端,虽然资源看似无限,但成本和性能的权衡依然无处不在。尤其是最近几年,Serverless …