我用三个框架跑了同一批模型,结果只有一个活得过生产环境

做边缘推理这六年,我学会的第一条铁律就是:别信官方benchmark。上个月我把同一个Phi-3模型原封不动搬到骁龙X Elite上,用ONNX Runtime跑,首token延迟350ms,看着还行。可一上压力,十路并发直接让NPU降频到比CPU还慢——而官方文档里那个1.8ms的ViT推理数据,…