Google那篇关于RAG的原始论文里假设了一个“无限吞吐”的向量数据库,但我的Jetson Orin NX只给了8GB内存
大家好,我是韩知行。今天不想聊什么大模型微调的Loss曲线,也不聊Transformer架构的数学推导,我想和大家聊聊一个特别“土”但特别刚需的话题——在边缘端(Edge)跑RAG。 大家可能都看过那篇2019年的经典论文《Retrieval-Augmented Generation for Lar…
大家好,我是韩知行。今天不想聊什么大模型微调的Loss曲线,也不聊Transformer架构的数学推导,我想和大家聊聊一个特别“土”但特别刚需的话题——在边缘端(Edge)跑RAG。 大家可能都看过那篇2019年的经典论文《Retrieval-Augmented Generation for Lar…
这项目我从头到尾肝了快两个月,起因特别简单:有个客户想做一款能看懂眼前画面、又能用自然语音交流的助盲 App,数据不能离开手机,推理延迟必须低于 300 毫秒。云端 API 的 GPT-4o minio mini 他们嫌贵,还担心网络不稳定。客户原话是:“苏晚,你不是独立开发者嘛,能不能把一个多模态…
我不是在高通骁龙峰会现场。我是在一个普通的周三下午,从顺丰纸箱里拆出那台联想Yoga Slim 7x,系统信息显示“Snapdragon X Elite – X1E-84-100”,旁边贴着一张A4纸,用马克笔写着“NPU性能对标M3,能跑大模型”。我第一个念头不是“哦,终于有能跟苹果打一打的ARM…