🏷️ Python

关于Python的文章标签

Blackwell Ultra推理调优手记:我为何押注FP8量化与MIG分区,却差点输给显存带宽

去年年底,我们拿到第一批Blackwell Ultra工程样卡时,整个团队都在算账:官方宣称FP8推理性能相比BF16翻倍,如果真能兑现,我们的在线推理集群规模可以砍掉60%的节点。但作为架构师,我见过太多“实验室性能”跟“线上跑起来的性能”之间的鸿沟。于是,我带着两个工程师,花了一整个迭代周期,从…

我们用Bedrock多智能体搞定了差旅报销,但第一个版本差点把财务部搞崩

我叫沈青锋,创业八年,前两个项目做SaaS和物联网数据平台,第三个项目一脚踩进制造业,做AI落地。去年年底,我们给一家汽车零部件供应商做了个差旅报销自动化系统,用的是AWS Bedrock的多智能体协作。这套方案上线第一个月,审批周期从平均7.2天压到了1.6天,财务手工复核量降了40%。但上线第二…

Optimus分拣仿真99.2%,实测71.3%——我复现端到端模仿学习后,发现Sim2Real的三个死穴

我是许彦,在机器人行业干了整整五年,从ROS 1跟到ROS 2 Humble,从六轴工业臂一直做到人形整机。半个月前,特斯拉Optimus那段分拣与行走的视频在内部群里刷屏时,我第一时间不是惊叹,而是把进度条反复拖了十几遍——我要看手指关节的抖动、料箱落位的重复精度、走路时躯干的晃动频率。因为我知道…

为什么我放弃了七套专用审核模型,用GPT-5.5一个多模态接口端到端重建内容安全流水线

半年前,我们的内容平台还在被七套专用模型拖着走。图像审核用ResNet+ViT组合,视频动作识别靠SlowFast,文字敏感词匹配是AC自动机,语音转文字再调一个ASR引擎,最后还有一套OpenCV规则专门检测logo和二维码。七套模型,七种输入规范,七份部署配置,光是GPU集群的显存分配图,我画了…

我用GPT‑4o升级版帮同事查了一个堆栈溢出的Bug,它画了张调用图,我直接沉默了

事情是这样的。上周三下午,后端的张工在群里发了一段Java堆栈信息,说有个订单状态机的Bug已经啃了两天,每次到并发退款+改单的场景就StackOverflow,人肉眼已经看麻了。我刚好那天在测最新版GPT‑4o的推理增强,顺手把那段150行的堆栈trace贴了进去。以前的模型会给你列几条可能的原因…

在90分贝噪音和2Mbps带宽下,我把GPT-5.5的多模态延迟压到了487ms

我叫周明远,三年前还在写STM32的固件,整天对着寄存器手册抠那几百字节的RAM。后来AI浪潮一来,我半路出家搞模型部署,在Jetson上跑过YOLO,在RK3588上量化过BERT。去年底接了一个工业远程辅助的项目,要把多模态大模型塞进一个90分贝噪音、2Mbps共享带宽的冲压车间里,给现场维修工…