🏷️ 边?

技术热点驱动下的开发者转型:架构视角下的AI技能图谱重构

2026年8月,AI技术已从实验室走向产业化的深水区。作为一名有十年经验的Java/Go后端架构师,我目睹了从早期深度学习框架(TensorFlow 2.16.x, PyTorch 2.12.x)到当前分布式大模型训练与推理系统的技术迭代。开发者若仍固守传统后端技能栈,将面临系统设计能力被颠覆的风险…

我们给汽车零件厂上了AI视觉质检,半年后怎样了

大家好,我是沈青锋。搞过两次创业,现在在琢磨怎么用AI把制造业的效率盘活。这行当太旧了,流水线上的问题发现靠人盯,效率低得可怜。我第三个项目,就是用AI+制造业做点事。最近Rust 1.81发布了,我琢磨着这东西能不能用在AI基础设施上。不是画饼,是实在的工程问题。 编译器优化与安全修复:Rust …

Token 成本减半,Bug 修复率提升 40%(2024):Claude 3.5 Sonnet 在边缘推理上的极限压测

上周三晚上十一点,我的 Jetson Orin NX 开发板还在疯狂散热,屏幕上显示着 98% 的显存占用。这是我在重构公司那套老旧的嵌入式 C++ 驱动程序时遇到的场景。在资源受限的边缘设备上,每一行代码都关乎内存溢出的风险,每一次 API 调用都关乎云端推理的成本。当时我手里只有两把“枪”:An…

Cursor 1.0 暴力重构我的上下文窗口:从边缘推理到 IDE 架构师,我的技能树重构手记

昨晚,当 Cursor 1.0 正式发布时,我正盯着 Jetson Nano 的终端,试图把一个 7B 的模型参数量化到 4-bit 以节省那仅剩的 4GB 显存。屏幕上闪烁的红色报错信息让我烦躁不已——内存溢出。就在我准备重启设备,重新调整量化参数时,Cursor 1.0 的更新推送弹了出来。它声…

我们用AI Agent重构了汽车零件厂的质检线,ROI是预期外的

大家好,我是沈青锋。第三个创业项目做AI+制造业,踩过的坑比家珍。今天不聊虚的,只说实在的——我们怎么把一个Chatbot改造成能自主跑完整个质检流程的AI Agent,以及在这个过程中踩的几个大坑。 从「会说话」到「能干活」:为什么制造业需要AI Agent 去年我们接了江浙一家汽车零件厂的活。那…

GPT-5.5 推理模型吃掉我的显存:从写代码到画架构的代价

凌晨三点,NVIDIA Jetson Orin NX 的散热风扇像直升机一样在头顶嗡嗡作响。屏幕上,vLLM 的日志在不断滚动,显示着 `Out of Memory` 的红色警告。我盯着那行报错,手里握着的不是咖啡,而是即将断电的边缘设备。 这不仅仅是一次部署失败,这是我对“从代码生成到架构规划”这…

Google那篇关于RAG延迟的论文里假设了“无限带宽”,但我的Jetson Orin NX的内存带宽只够喝汤

上周在实验室组会上,我抛出了个观点:现在大家都在卷RAG的检索精度,但很少有人聊“把RAG搬下云端”这件事有多难。就在上周,Google DeepMind上个月发的那篇关于“System 2 Reasoning”的论文里提到,大模型推理的延迟主要瓶颈在于KV Cache的读写。当时我就在想,这理论在…

Google那篇关于RAG的论文里假设了一个“无限吞吐”的向量数据库,但我的Jetson Orin NX只给了8GB内存

大家好,我是韩知行。今天咱们不聊那些花里胡哨的新架构,聊聊一个很实在的问题:**为什么我们在云端跑得飞起的RAG(检索增强生成),一到边缘端就变得像拖拉机一样慢?** 最近大厂都在推边缘大模型,我也在研究怎么把RAG从云端搬到Jetson上。这事儿看着简单,真上手了才发现,中间隔着好几道硬件和软件的…

别只盯着ChatGPT:ESP32-S3跑TinyLlama 2bit,我找到了LLM的最低硬件底线

当你还在为GPT-5.5的上下文长度焦虑,或者纠结H100的租用价格时,我刚刚把一个1.1B参数的小模型,塞进了一块几十块钱的MCU里。这不是为了炫技,而是为了回答一个残酷的问题:AI的尽头,真的是云端算力堆叠吗?还是说,真正的爆发,在于那些连Wi-Fi都断开、永远不需要联网的“超边缘”设备? 我手…

别只盯着H100:ESP32-S3跑TinyLlama 2bit,我找到了LLM的最低硬件底线

从科技媒体转行做技术博主这三年,我发现一个很有趣的现象:大家都在谈论H100算力、多模态大模型,仿佛AI的尽头就是堆砌GPU。但我更着迷于“减法”的艺术——把几百GB的模型塞进几MB的内存里,看看硅基智能的底线到底在哪里。 最近我搞了个疯狂的实验:让ESP32-S3这个只有400MHz主频的MCU,…