Figure 01 进工厂:具身智能爆发前夜,软硬件结合的工程挑战在哪里?
昨天晚上实验室组会,大家都在刷 Figure 01 进工厂的视频。说实话,我盯着屏幕看了三遍,不是因为它有多好看,而是因为它太“反直觉”了。以前我们做机器人,那是把控制算法写在 C++ 里,像修钟表一样精细地调 PID 参数,每一步都要算好力矩、加速度、动力学模型。现在倒好,直接喂给一个大模型一句话…
昨天晚上实验室组会,大家都在刷 Figure 01 进工厂的视频。说实话,我盯着屏幕看了三遍,不是因为它有多好看,而是因为它太“反直觉”了。以前我们做机器人,那是把控制算法写在 C++ 里,像修钟表一样精细地调 PID 参数,每一步都要算好力矩、加速度、动力学模型。现在倒好,直接喂给一个大模型一句话…
最近在重构团队内部的代码生成流水线时,我面临一个经典的架构决策难题:是继续沿用 GPT-4o 这种高吞吐、低延迟的“即插即用”方案,还是引入 OpenAI o1 系列(o1-preview 和 o1-mini)这种引入了“推理”机制的模型? 作为干了十年的后端架构师,我习惯先看底层原理,再看上层表现…
中午十一点五十八分,我盯着终端里那个一闪而过的Query OK, 12834 rows affected,后背的汗一下子冒出来。两分钟前,我还得意洋洋地让Copilot切到Gemini模型生成一条“优化过的历史订单归档”SQL,觉得自己终于可以偷个懒——结果这玩意儿直接把整个orders表的过期记录…
做运维第八年,凌晨两点十七分,手机屏幕再次亮起:生产集群磁盘使用率92%。我条件反射般滚下床打开终端,手指刚碰到键盘就僵住了——又是那一套组合:df -h 找到分区,du -sh /var/log/* 逐层排查,然后手工拼一条 find 命令清理三天前的日志。这些命令我闭着眼睛都能敲,但那天晚上因为…
我叫周明远,前几年一直在搞嵌入式视觉——给产线质检相机写C++驱动,在STM32上抠内存。后来公司觉得AI落地是个好生意,我就被一脚踹进了模型部署的坑。这一年多我干的最磨人的活儿,就是在资源卡脖子的边缘设备上,让大模型挤出一点实用价值。这个项目的起因很简单:一家区域连锁便利店品牌找到我们,想要一套轻…
说来离谱,上周我妈突然问我能不能教她写个网页。她开了个小烘焙工作室,想在朋友圈发个像样的展示页。我正准备说”你先学HTML基础”,结果看到了GitHub Copilot Chat免费开放的消息。我直接把电脑推给她:”来,用普通话说你想做什么。” 十分钟…
事情是这样的。上周三下午,后端的张工在群里发了一段Java堆栈信息,说有个订单状态机的Bug已经啃了两天,每次到并发退款+改单的场景就StackOverflow,人肉眼已经看麻了。我刚好那天在测最新版GPT‑4o的推理增强,顺手把那段150行的堆栈trace贴了进去。以前的模型会给你列几条可能的原因…
那天凌晨3点14分,PagerDuty把我从梦里拽出来。告警消息写着:「proof-verification-pipeline失败率飙升,过去5分钟连续7次数学归纳法证明包含无效推导。」我眯着眼打开Grafana,看见那条代表“证明完备性得分”的曲线直接跌到0.3,正常阈值是0.85。我第一反应是A…
去年年底,OpenAI 开放 GPT-4o 实时 API 的第一周,我就把团队拖进了一个“48 小时极限改造”项目:把公司已有的文本解题机器人升级成能看、能听、能实时对话的交互式学习助手。产品经理想象的场景很美好:一个学生举着手机对准几何题,AI 立刻看懂图形,用语音引导他一步步推导,随时可以打断追…
上个月 OpenAI 把 GPT-4o 的 system card 公开出来的时候,我正在实验室里对着一个实时翻译 demo 抓狂。那篇系统卡里有一个让我过目难忘的数字:音频到音频的平均响应延迟 232 毫秒,而且是在真实网络环境下测的。我第一时间想的是:这不就意味着,我终于可以把“视频理解+语音合…