🏷️ 本地部署

把Llama 3塞进消费级显卡:我的资源受限AI部署实战

作为一名从嵌入式系统转岗到AI部署领域的工程师,我每天都在和资源限制作斗争。在那些只有几GB内存、几十MHz主频的设备上,让AI模型运行流畅几乎是一项不可能完成的任务。现在,我转向了消费级显卡,试图在预算有限的情况下部署开源大模型。这篇文章不是什么理论文章,而是我踩坑、调优、最终跑通Llama 3模…

别再手动装Python了:我用Docker重构了我的AI开发地狱,GPT-5.5跑在RTX 5090上

以前我搞本地部署,那是真的受罪。为了跑通一个 Llama 4 的微调,我把自己电脑的系统搞崩了三次,重装 Windows 的次数比换女朋友还勤。那时候的我坚信“环境隔离”是个伪命题,觉得只要把依赖装齐了,世界就是和平的。直到2026年,当 DeepSeek V4 Pro Pro 的推理速度在本地跑起…

Google那篇关于RAG延迟的论文里假设了“无限带宽”,但我的Jetson Orin NX的内存带宽只够喝汤

上周在实验室组会上,我抛出了个观点:现在大家都在卷RAG的检索精度,但很少有人聊“把RAG搬下云端”这件事有多难。就在上周,Google DeepMind上个月发的那篇关于“System 2 Reasoning”的论文里提到,大模型推理的延迟主要瓶颈在于KV Cache的读写。当时我就在想,这理论在…