🏷️ ?推理

骁龙8 Gen3实测Qwen2.5-3B:手机NPU跑LLM的真实延迟与发热边界

大家好,我是许彦,一个在具身智能领域摸爬滚打5年的机器人工程师。过去一年,我们团队在尝试将大模型植入机器人大脑时,遭遇了一个尴尬的现实:服务器算力虽然强,但带不动;边缘端(如Jetson Orin)虽然合适,但功耗和散热是个大问题。于是,我的目光转向了手机——特别是搭载最新NPU的旗舰机。我手里正好…

DeepSeek-V3 MoE路由的诡异行为:我调了6个参数后,推理吞吐涨了3倍,但负载均衡差点把GPU集群干崩

这件事要从上个月的一次凌晨3点的PagerDuty告警说起。我们的核心代码补全服务突然开始大量5xx,延迟从平时的300ms直接飙到12秒。应改为通过`kubectl exec`进入Pod执行`nvidia-smi`或使用GPU监控工具(如DCGM)查看显存状态。。这不对劲——我们跑的是DeepSe…

我花三个月在Jetson集群上实现自动并行,最后发现PyTorch RPC才是那个被低估的暗棋

年初,我接了一个近乎异想天开的需求:用四块Jetson Orin(单价不到400美元)拼出一套能推理ViT-22B的服务。CTO的原话是,“如果四张便宜板卡的协同成本低于一张A100,我们就能把大模型塞进智慧灯杆、工厂质检站,甚至农田里的无人巡检车。”我当时的第一反应是——你们是不是对22 bill…

我让Cursor写了一套KEDA规则和Spot切换器,推理成本从8万暴跌到1.7万——但挂了两次生产

今年三月份,我坐在工位上打开AWS Cost Explorer,差点把手里的咖啡洒在键盘上。我们那条大模型推理API管线的月账单,悄无声息地窜到了8.2万美元,而我们整个公司的月度营收才刚过25万。换句话说,光是跑模型推理就吃掉了三分之一的现金。更扎心的是,CFO发来的那封邮件里,只有一句话:“我们…

凌晨三点被CFO的成本警报叫醒:大模型推理正在吞噬利润,我用FinOps工具链砍掉了40%账单

那封邮件出现在凌晨3点14分,CFO抄送了整个AI平台组。标题是“大模型推理成本月度分析与降本要求”,附件里一个数字让我彻底清醒:过去30天,我们调用GPT-4o和Claude 4的API费用是13.7万美元,而整个Kubernetes集群加GPU节点的成本才5.8万。更打脸的是,这些钱花得稀里糊涂…

我给GPU集群接上了优先级队列和KEDA,高优推理请求的P99延迟终于从3.2秒砸到120ms

去年年底,我们那条模型推理管线的告警,几乎每天都把我从工位上薅起来。不是推理服务挂了,而是“慢”——客服机器人突然卡了超过两秒,业务方在群里@我说用户开始骂人了。我打开Grafana一看,同一时刻有几百个离线批处理请求涌进来,把在线请求的GPU显存和算力全部挤占。那些批处理是给后台运营同事生成报表用…

机器人在马拉松摔了7跤,每一跤都在打脸VLA的“物理理解”——因果推理缺位的60亿美金教训

我是方瑾。过去5年我在一家投技术赛道的风投做技术顾问,看过的AI项目BP没有一千也有八百。我有个职业病:只要PPT里出现“世界模型”四个字,我直接翻到财务预测那页,看看营收和研发投入之间的缺口有多大。因为大部分团队压根没想清楚,让机器人理解物理世界到底需要什么——他们以为堆足够多的视频数据、把VLA…

用竞价实例跑GPU推理:我把成本砍了67%,同时稳住了99.95%的可用性——一份被Spot中断逼出来的架构手记

把GPU推理成本砍掉67%的同时保持99.9%可用性,这听起来像天上掉馅饼。但我在帮一个日活30万的短视频平台做架构优化时发现,Spot实例的中断不是意外而是确定性事件——关键是在2分钟窗口内完成检测、摘除、迁移。这篇文章记录了从预热池设计到多区域切换的完整踩坑过程,以及三个让可用性从99.87%提升到99.96%的关键修复。

Jetson Orin推理优化:我把YOLOv8延迟从45ms压到8ms,但功耗翻车了

在Jetson AGX Orin上部署YOLOv8,从45ms延迟艰难优化到8ms。详细记录了TensorRT层融合、INT8量化的校准集精度陷阱、DLA加速器的隐藏坑,以及用共享内存多模型流水线把吞吐拉到45fps的全过程。还有差点烧坏板子的散热教训和生产环境的自动恢复设计。