🏷️ 边?

我们用AI Agent重构了汽车零件厂的质检线,ROI是预期外的

大家好,我是沈青锋。第三个创业项目做AI+制造业,踩过的坑比家珍。今天不聊虚的,只说实在的——我们怎么把一个Chatbot改造成能自主跑完整个质检流程的AI Agent,以及在这个过程中踩的几个大坑。 从「会说话」到「能干活」:为什么制造业需要AI Agent 去年我们接了江浙一家汽车零件厂的活。那…

GPT-5.5 推理模型吃掉我的显存:从写代码到画架构的代价

凌晨三点,NVIDIA Jetson Orin NX 的散热风扇像直升机一样在头顶嗡嗡作响。屏幕上,vLLM 的日志在不断滚动,显示着 `Out of Memory` 的红色警告。我盯着那行报错,手里握着的不是咖啡,而是即将断电的边缘设备。 这不仅仅是一次部署失败,这是我对“从代码生成到架构规划”这…

Google那篇关于RAG延迟的论文里假设了“无限带宽”,但我的Jetson Orin NX的内存带宽只够喝汤

上周在实验室组会上,我抛出了个观点:现在大家都在卷RAG的检索精度,但很少有人聊“把RAG搬下云端”这件事有多难。就在上周,Google DeepMind上个月发的那篇关于“System 2 Reasoning”的论文里提到,大模型推理的延迟主要瓶颈在于KV Cache的读写。当时我就在想,这理论在…

Google那篇关于RAG的论文里假设了一个“无限吞吐”的向量数据库,但我的Jetson Orin NX只给了8GB内存

大家好,我是韩知行。今天咱们不聊那些花里胡哨的新架构,聊聊一个很实在的问题:**为什么我们在云端跑得飞起的RAG(检索增强生成),一到边缘端就变得像拖拉机一样慢?** 最近大厂都在推边缘大模型,我也在研究怎么把RAG从云端搬到Jetson上。这事儿看着简单,真上手了才发现,中间隔着好几道硬件和软件的…

别只盯着ChatGPT:ESP32-S3跑TinyLlama 2bit,我找到了LLM的最低硬件底线

当你还在为GPT-5.5的上下文长度焦虑,或者纠结H100的租用价格时,我刚刚把一个1.1B参数的小模型,塞进了一块几十块钱的MCU里。这不是为了炫技,而是为了回答一个残酷的问题:AI的尽头,真的是云端算力堆叠吗?还是说,真正的爆发,在于那些连Wi-Fi都断开、永远不需要联网的“超边缘”设备? 我手…

别只盯着H100:ESP32-S3跑TinyLlama 2bit,我找到了LLM的最低硬件底线

从科技媒体转行做技术博主这三年,我发现一个很有趣的现象:大家都在谈论H100算力、多模态大模型,仿佛AI的尽头就是堆砌GPU。但我更着迷于“减法”的艺术——把几百GB的模型塞进几MB的内存里,看看硅基智能的底线到底在哪里。 最近我搞了个疯狂的实验:让ESP32-S3这个只有400MHz主频的MCU,…

骁龙8 Gen3实测Qwen2.5-3B:手机NPU跑LLM的真实延迟与发热边界

大家好,我是许彦,一个在具身智能领域摸爬滚打5年的机器人工程师。过去一年,我们团队在尝试将大模型植入机器人大脑时,遭遇了一个尴尬的现实:服务器算力虽然强,但带不动;边缘端(如Jetson Orin)虽然合适,但功耗和散热是个大问题。于是,我的目光转向了手机——特别是搭载最新NPU的旗舰机。我手里正好…

给工厂装上本地SD:我们如何让Jetson Orin跑通图像生成并省下每月的API账单

我是沈青锋,一个在制造业AI化这条路上踩过两次坑的连续创业者。我们的第三个项目是做AI+制造业,主要解决工厂里的视觉质检和设计辅助问题。在做了前两个项目后,我有一个深刻的体会:**技术再牛,如果不能在离线环境跑通,在工厂里就是废铁。** 最近,我们接到了一个很典型的B端需求:一家拥有五条精密模具生产…

树莓派5硬刚Phi-3-mini:边缘推理的ROI真相,不是跑得快,是省下的API钱比电费贵

作为看了一百多个AI项目BP的投资人,我最烦听到的词就是“赋能”和“生态”。上周有个团队跟我吹他们的“端侧大模型解决方案”,核心逻辑是“把GPT-4搬到手机里”。我问他成本,他说“硬件成本很低”。我让他拿出数据,他拿不出。这就是目前90%边缘AI项目的死法:技术炫技有余,商业算账不足。 最近我把目光…