🏷️ 知识库问答

Google那篇关于RAG延迟的论文里假设了“无限带宽”,但我的Jetson Orin NX的内存带宽只够喝汤

上周在实验室组会上,我抛出了个观点:现在大家都在卷RAG的检索精度,但很少有人聊“把RAG搬下云端”这件事有多难。就在上周,Google DeepMind上个月发的那篇关于“System 2 Reasoning”的论文里提到,大模型推理的延迟主要瓶颈在于KV Cache的读写。当时我就在想,这理论在…

免费午餐的代价:我在阿里云PAI上跑通DeepSeek R1后,看到的是算力生态的暗流

我花了整整一个周末,把阿里云PAI新推的「免费体验DeepSeek R1」活动从头啃到尾。不是蜻蜓点水地点一下“一键部署”,而是拿着200万tokens免费额度,从模型推理、API封装,一路做到私域知识库问答的原型。结论先摆在这里:这绝不是什么慈善行为,而是阿里云在国产大模型算力入口处布下的一颗精巧…