🏷️ 端侧推理

Apple Intelligence 没骗我,但也没完全骗我:我扒开了端侧模型和私有云池的底层逻辑

坐在工位上,我盯着屏幕上刚写完的一行私有算法代码,心里犯嘀咕。作为一名写了8年全栈的开发者,我见过太多号称“隐私保护”的AI工具,最后都变成了数据泄露的温床。但这次不一样,Apple Intelligence 把隐私保护做进了系统内核里。这不是简单的“加密传输”,而是一场从架构到硬件的底层重构。我花…

麒麟9100自研泰山核心深度解读:5nm归来,GPU能否叫板骁龙8 Gen3?

拿到麒麟9100工程样机的那天,我做的第一件事不是跑Geekbench,而是把之前部署在麒麟9000上的一套微型语言模型——TinyLlama系列无1.1版本,可能是Llama 2或Llama 3的误称。B——迁移过来,看看推理延迟能不能从42ms压到30ms以内。我在Jetson Orin Nan…

把GPT-4o mini塞进树莓派5(2024):量化、NPU并行和三次半夜告警的全记录

我叫赵一帆,做了8年DevOps,K8s和CI/CD是我的饭碗。我的人生哲学很简单:生产环境要么稳得像死水,要么监控得响得像火警——因为被半夜叫醒的次数多了,自然就对“稳定”二字有了条件反射式的偏执。所以当团队说“我们准备在树莓派5上跑GPT-4o mini多模态交互,延迟得压在500ms以下”时,…