📁 技术教程

面向一线开发者的技术教程:涵盖 AI 模型部署、Kubernetes GPU 调度、LLM 微调、边缘计算、机器人视觉等前沿领域的完整实施指南。每篇教程包含可运行代码和真实数据。

在Jetson Orin上跑金丝雀发布:100次抓取任务A/B测试,仿真99%置信自动止损,但真实传感器延迟让贝叶斯提前关停

我是许彦,一个在机器人公司摸爬滚打了五年的工程师,从ROS 1一直折腾到ROS 2 Humble,从简单的差分底盘做到现在的人形双臂操作。我们团队最近在做一个看似很“互联网”但实际上跟机器人硬件耦合极深的项目:为大模型驱动的抓取感知服务建立金丝雀发布体系。这个想法来自微服务的渐进式交付,但把它搬到J…

从850ms到110ms:我把CodeBERT塞进GitHub Actions的SQL注入猎杀实录

去年我在嵌入式团队裁撤后转头搞AI部署,接的第一个活就是把大模型塞进CI流水线检测SQL注入。当时团队用的是正则规则集,漏报率高达42%,每周至少被甲方安全审计揪出三个绕过案例。我花了三周,把一个微调过的CodeBERT模型塞进了GitHub Actions的标准Runner——2核CPU、7GB内…

凌晨两点,线上模型开始胡言乱语,因为有人改了我的Prompt注释——于是我把MLflow塞进了LLM实验流水线

凌晨2点17分,手机开始疯狂震动。我眯着眼看到PagerDuty上跳出来的告警:“rag-qa-service的答案偏离度超过阈值,当前偏离度0.72”。冲到电脑前翻日志,用户问“如何修改密码”,模型给出的回答里却夹杂着大段系统提示词,甚至打印出了内部文档的markdown语法。这已经是我们组三个月…

我照着普林斯顿SWE‑Agent论文搭了一条需求即交付管线,但在生成验收标准上卡了两个月——LLM在第287次构建时给我上了一课

今年初我翻到普林斯顿那篇SWE‑Agent论文的时候,脑子里冒出一个很自然的念头:既然LLM agent能自动解决GitHub issue,那能不能反过来,从issue出发自动生成验收标准,再用验收标准驱动代码生成和CI流水线,把“需求即交付”真正跑通?实验室有个内部项目刚好要重构一个微服务,需求方…

MTTR从47分钟砍到3分钟,但大模型给出的第一版修复建议差点rm -rf了生产库

我干机器人这5年,最怕的不是电机烧了或者编码器飘了,最怕的是凌晨三点手机震起来,告警列表长到需要滑三屏才能看完。ROS的rostopic echo一开,日志像洪水一样刷屏,你在里面找根本原因就像在台风天找一片特定的树叶。去年我开始把LLM接入运维管道的时候,脑子里只有一个想法:能不能让大模型替我扛下…

12GB显存里的ROI死磕:我把Gemma 2、Phi-3、Qwen-1.8B在法律/医疗微调上烧透了的成本账

我叫周明远,干了六年嵌入式开发,两年前因为项目需要开始往AI部署方向转。手头最常见的就是各种边缘盒子、工控机,显存从4GB到12GB不等,没有A100,更别提H100。去年年底,公司打算把法律咨询和医疗问诊的两个内部原型推到准生产环境,要求模型必须本地化部署,不能触网——这是合规底线。留给我的硬件是…

凌晨三点被CFO的成本警报叫醒:大模型推理正在吞噬利润,我用FinOps工具链砍掉了40%账单

那封邮件出现在凌晨3点14分,CFO抄送了整个AI平台组。标题是“大模型推理成本月度分析与降本要求”,附件里一个数字让我彻底清醒:过去30天,我们调用GPT-4o和Claude 4的API费用是13.7万美元,而整个Kubernetes集群加GPU节点的成本才5.8万。更打脸的是,这些钱花得稀里糊涂…

用Ollama + LangChain构建本地隐私聊天机器人,30行代码搞定!

那篇 DeepMind 论文提的本地推理,我复现时踩了三个星期的坑 上周我在组里分享用 Ollama 搭本地聊天机器人的经历,说实话,那篇文章写得有点潦草。有读者私信反馈代码根本跑不通,我回去一看,确实是我把 API 记串了——在草稿里随手写的 Ollama Python 库无需调用 init(),…

我们在Optimus Gen-3上刷出了99.2%搬运精度,但仿真到实机的坑烧掉了三台关节电机

我做机器人工程师这5年,从六轴机械臂一直干到人形整机。仿真工具用得越熟,就对“仿真到现实”这四个字越怕。去年底我们团队拿到了Tesla Optimus Gen-3的早期样机,任务是把这套人形平台塞进华东某汽车零配件厂的物料搬运和装配产线。8小时连续运转,最终做到了放置误差±1mm以内的成功率99.2…

在Jetson Orin上跑LangChain安全护栏:512MB内存预算下,我把注入拦截延迟压到1.8ms

去年我把一个7B的对话模型塞进Jetson Orin Nano 8GB模块的时候,满脑子想的都是怎么把KV cache从3.2GB压到1.1GB,怎么让首token延迟从4.7秒降到2.1秒。那时候安全护栏这件事,在我脑海里约等于「让前端做个输入长度限制」。直到有一天,一个实习生无意中在测试里敲了一…