🏷️ ONNX Runtime

骁龙 X Elite 的本地大模型部署:我用 7B 中文模型踩了一周的坑,才明白 ARM64 真的不是 x86 的补丁

上个月,我收到一台搭载 Snapdragon X Elite (Oryon) 的笔记本。这不是一台普通的笔记本,它是微软 Copilot+ PC 的基石。作为一个从科技媒体转行的技术博主,我手里已经测试过十几款消费级显卡,但在打开终端准备跑大模型的那一刻,我感到了久违的陌生感——因为这台机器的 CP…

把GPT-4o mini塞进树莓派5(2024):量化、NPU并行和三次半夜告警的全记录

我叫赵一帆,做了8年DevOps,K8s和CI/CD是我的饭碗。我的人生哲学很简单:生产环境要么稳得像死水,要么监控得响得像火警——因为被半夜叫醒的次数多了,自然就对“稳定”二字有了条件反射式的偏执。所以当团队说“我们准备在树莓派5上跑GPT-4o mini多模态交互,延迟得压在500ms以下”时,…

我半夜把Copilot Runtime塞进Surface Pro,NPU推理快得离谱,但矢量搜索差点让我把机器砸了

说出来你可能不信,我一个做了6年Python独立开发的老鸟,被微软的Copilot Runtime整整折腾了两宿。不是因为它难用,而是因为它太好用了——好用到我怀疑自己是不是漏了什么致命坑。结果第二天就翻车了:NPU加速没开,矢量搜索API是个半成品,文档写得像迷宫。今天我就把这48小时的折磨和惊喜…

Rust重写推理服务后速度提升了5倍,但我差点被编译器逼疯

为了搞掉在线教育平台批改服务的延迟和内存问题,我用Rust重写了推理网关。结果吞吐暴增5倍,p99延迟从510ms压到42ms,但开发过程几乎让我放弃——Session不支持Send、编译时间漫长、错误信息无法理解。这篇文章记录了我如何手写线程池、用Axum+ONNX Runtime趟过生产坑,以及最终为什么还说“Rust值得,但要用在刀刃上”。