🏷️ 端侧推理

M4 芯片:为什么我卖掉了 B200 卡,换了一台 iPad Pro

作为一个在投资机构盯着AI赛道看了五年的技术顾问,我看过几百份BP,也听过无数个关于“颠覆性AI应用”的PPT。大部分时候,这些项目的核心逻辑都在押注云端算力的边际成本下降。但在2026年10月,当我第一次真正把目光聚焦到苹果M4芯片上时,我发现这盘棋的棋子变了。 过去两年,我手头握着几张B200卡…

Apple Intelligence 没骗我,但也没完全骗我:我扒开了端侧模型和私有云池的底层逻辑

坐在工位上,我盯着屏幕上刚写完的一行私有算法代码,心里犯嘀咕。作为一名写了8年全栈的开发者,我见过太多号称“隐私保护”的AI工具,最后都变成了数据泄露的温床。但这次不一样,Apple Intelligence 把隐私保护做进了系统内核里。这不是简单的“加密传输”,而是一场从架构到硬件的底层重构。我花…

麒麟9100自研泰山核心深度解读:5nm归来,GPU能否叫板骁龙8 Gen3?

拿到麒麟9100工程样机的那天,我做的第一件事不是跑Geekbench,而是把之前部署在麒麟9000上的一套微型语言模型——TinyLlama系列无1.1版本,可能是Llama 2或Llama 3的误称。B——迁移过来,看看推理延迟能不能从42ms压到30ms以内。我在Jetson Orin Nan…

把GPT-4o mini塞进树莓派5(2024):量化、NPU并行和三次半夜告警的全记录

我叫赵一帆,做了8年DevOps,K8s和CI/CD是我的饭碗。我的人生哲学很简单:生产环境要么稳得像死水,要么监控得响得像火警——因为被半夜叫醒的次数多了,自然就对“稳定”二字有了条件反射式的偏执。所以当团队说“我们准备在树莓派5上跑GPT-4o mini多模态交互,延迟得压在500ms以下”时,…