Token 成本减半,Bug 修复率提升 40%(2024):Claude 3.5 Sonnet 在边缘推理上的极限压测
上周三晚上十一点,我的 Jetson Orin NX 开发板还在疯狂散热,屏幕上显示着 98% 的显存占用。这是我在重构公司那套老旧的嵌入式 C++ 驱动程序时遇到的场景。在资源受限的边缘设备上,每一行代码都关乎内存溢出的风险,每一次 API 调用都关乎云端推理的成本。当时我手里只有两把“枪”:An…
上周三晚上十一点,我的 Jetson Orin NX 开发板还在疯狂散热,屏幕上显示着 98% 的显存占用。这是我在重构公司那套老旧的嵌入式 C++ 驱动程序时遇到的场景。在资源受限的边缘设备上,每一行代码都关乎内存溢出的风险,每一次 API 调用都关乎云端推理的成本。当时我手里只有两把“枪”:An…
凌晨三点,办公室的咖啡已经凉透。屏幕上跳动的不是 ROS 2 的节点日志,而是 Gazebo 仿真器里那个因为逻辑错误而反复抽搐的机械臂。这已经是我们第五次尝试修复这个遗留代码库中的状态机漏洞了。作为搞机器人的,我们最怕的不是硬件故障,而是代码里那些深埋在注释和宏定义里的“祖传逻辑”。ChatGPT…
我是沈青锋,一个在制造业AI化这条路上踩过两次坑的连续创业者。我们的第三个项目是做AI+制造业,主要解决工厂里的视觉质检和设计辅助问题。在做了前两个项目后,我有一个深刻的体会:**技术再牛,如果不能在离线环境跑通,在工厂里就是废铁。** 最近,我们接到了一个很典型的B端需求:一家拥有五条精密模具生产…
大家好,我是韩知行。今天不想聊什么大模型微调的Loss曲线,也不聊Transformer架构的数学推导,我想和大家聊聊一个特别“土”但特别刚需的话题——在边缘端(Edge)跑RAG。 大家可能都看过那篇2019年的经典论文《Retrieval-Augmented Generation for Lar…
我叫周明远,前几年一直在搞嵌入式视觉——给产线质检相机写C++驱动,在STM32上抠内存。后来公司觉得AI落地是个好生意,我就被一脚踹进了模型部署的坑。这一年多我干的最磨人的活儿,就是在资源卡脖子的边缘设备上,让大模型挤出一点实用价值。这个项目的起因很简单:一家区域连锁便利店品牌找到我们,想要一套轻…
我叫周明远,做了六年嵌入式开发,最近两年在边缘设备上折腾AI部署。去年Q4接手一个零售门店的项目:客户在北京有12家连锁便利店,想用现有摄像头做客流分析和行为识别。传统方案报价单我看了——每家店要部署一台$2000的边缘服务器跑YOLO+DeepSORT,还得雇标注团队针对每个门店的货架布局重新标注…
我是许彦,一个在机器人公司摸爬滚打了五年的工程师,从ROS 1一直折腾到ROS 2 Humble,从简单的差分底盘做到现在的人形双臂操作。我们团队最近在做一个看似很“互联网”但实际上跟机器人硬件耦合极深的项目:为大模型驱动的抓取感知服务建立金丝雀发布体系。这个想法来自微服务的渐进式交付,但把它搬到J…
我叫赵一帆,干了8年DevOps,被报警短信吵醒的次数比我女儿半夜哭闹还多。这次的项目是在一台巴掌大的Jetson Orin上跑Gemma 2对话模型,要求延迟低于500毫秒、每秒至少输出20个token,而且必须是本地推理,数据不能出设备。领导的原话是:“边缘设备嘛,就是要又快又准,别跟上次K8s…
本想用树莓派加 Coral TPU 低成本搞定边缘 AI,却被端到端延迟、功耗和多路视频流折磨到怀疑人生。我通过实测 Jetson Orin、RK3588 和 Intel 平台,结合客流摄像和 AGV 两个真实场景,整理出一套基于软件链、压力测试和长期供货的选型铁律,帮你避开那些销售绝不会说的坑。
在Jetson AGX Orin上部署YOLOv8,从45ms延迟艰难优化到8ms。详细记录了TensorRT层融合、INT8量化的校准集精度陷阱、DLA加速器的隐藏坑,以及用共享内存多模型流水线把吞吐拉到45fps的全过程。还有差点烧坏板子的散热教训和生产环境的自动恢复设计。