Google那篇关于RAG的原始论文里假设了一个“无限吞吐”的向量数据库,但我的Jetson Orin NX只给了8GB内存
大家好,我是韩知行。今天不想聊什么大模型微调的Loss曲线,也不聊Transformer架构的数学推导,我想和大家聊聊一个特别“土”但特别刚需的话题——在边缘端(Edge)跑RAG。 大家可能都看过那篇2019年的经典论文《Retrieval-Augmented Generation for Lar…
AI 产业深度观察:从投资视角拆解 AI 芯片、大模型、具身智能等赛道的技术真相与商业逻辑。基于 37+ 份融资 BP 和 300+ 项目审查经验,拒绝 PPT 泡沫,只讲技术本质。
大家好,我是韩知行。今天不想聊什么大模型微调的Loss曲线,也不聊Transformer架构的数学推导,我想和大家聊聊一个特别“土”但特别刚需的话题——在边缘端(Edge)跑RAG。 大家可能都看过那篇2019年的经典论文《Retrieval-Augmented Generation for Lar…
大家好,我是许彦。在机器人领域摸爬滚打了五年,从机械臂到人形机器人,我深刻理解一个道理:仿真很美好,真实世界很残酷。今天,我想和大家聊聊NVIDIA最新的Blackwell B200芯片,以及它背后的技术革新如何影响我们这些搞具身智能的。我会把我的实验数据、硬件配置、踩坑经历都摆出来,不搞虚的。 B…
在投资机构的会议室里,我们看过太多关于「GPU算力短缺」的BP,也听过无数关于「云端推理成本」的抱怨。但作为看了五年AI项目的技术顾问,我必须指出一个被严重忽视的商业事实:对于绝大多数非大模型训练场景的开发者来说,把数据传到云端跑,本身就是一种低效且昂贵的行为。 最近,我手里拿到了两款极具代表性的移…
上个月,我收到一台搭载 Snapdragon X Elite (Oryon) 的笔记本。这不是一台普通的笔记本,它是微软 Copilot+ PC 的基石。作为一个从科技媒体转行的技术博主,我手里已经测试过十几款消费级显卡,但在打开终端准备跑大模型的那一刻,我感到了久违的陌生感——因为这台机器的 CP…
我是韩知行,在厂里搞 AI 研究,日常就是读论文、复现、再想办法把那些漂亮的数字变成能扛住真实流量的代码。上个月,我想给内部工具搭一个带实时流式输出的聊天助手,正好看到 Vercel AI SDK 3.0 发布了,文档里写着“useChat 一行搞定流式”,再翻到 Meta 之前那篇 Toolfor…
我叫沈青锋,这是我的第三个创业项目,做AI+制造业。现在公司给汽车零部件供应商上预测性维护系统,传感器数量大的能到5万点,边缘加云端混跑。团队一劈两半:算法和数据在上海,工厂对接和嵌入式在慕尼黑。两边时差6小时,实际同步窗口只有下午4点到晚上8点。这种分布式开发,代码评审和知识沉淀一直是个流血点。今…
事情要从两周前讲起。一家医疗影像软件团队的架构师给我打了一通电话,语气像刚被合规部门扣了一顶“数据泄露风险”的帽子——他们用 GitHub Copilot 做代码重构,结果 AI 生成的变量名建议被传到云端,安全审计直接亮红灯。他问我:“有没有一种办法,能在完全断网的环境下,让 AI 帮我做项目级的…
我是许彦,做了5年机器人工程师,主攻ROS和具身智能。我习惯把每一次软件升级当成硬件换装:先跑仿真,再上实机,最后用千分表和示波器盯住每一个参数。今年团队把设备监控面板从Next.js 14迁到15,我拿着同样的方法论,在三个不同硬件平台上跑了300多次构建、记录了40组延迟数据,发现开发环境里Tu…
这两周我在为组里的订单微服务系统做一次彻底的重构。系统不算大,但标准的微服务全家桶——Order、Payment、Inventory、Notification——一应俱全,跑在AWS上已经两年了,偶尔会出一些说不上致命的毛病,比如半夜库存扣减延迟导致订单超时,或者某个Region的Lambda冷启动…
去年秋天,我受邀去一家估值12亿美元的AI训练芯片创业公司做技术尽职调查。他们的BP首页写着“采用台积电3nm先进制程”,翻到第二页,PPT上列出的功耗数据比英伟达H100低了40%。创始团队背景很亮眼,但聊到流片进度时,CTO的眼神总是飘向窗外。三个月后,我听说他们的第一次MPW芯片回来,在700…