Llama 3 零运维成本部署:Serverless AI 推理实战与成本博弈
说实话,每次看到 Llama 3 的参数量、上下文长度,我都得先摸摸我的 AWS 账单。这模型太香了,但香到直接把我逼成了 Serverless AI 的狂热信徒。最近帮团队把一个高并发问答服务从 EC2 集群搬到 Lambda 上,省下来的成本够买两台 H100 了。今天就来跟你们唠唠,怎么用 S…
说实话,每次看到 Llama 3 的参数量、上下文长度,我都得先摸摸我的 AWS 账单。这模型太香了,但香到直接把我逼成了 Serverless AI 的狂热信徒。最近帮团队把一个高并发问答服务从 EC2 集群搬到 Lambda 上,省下来的成本够买两台 H100 了。今天就来跟你们唠唠,怎么用 S…
大家好,我是许彦,一个在机器人领域摸爬滚打了五年的工程师。从早期的机械臂到如今的人形机器人,我见证了无数仿真模型在实验室里完美运行,却在真实世界的传感器噪声、延迟和标定误差面前折戟沉沙。这种“仿真很美好,真实世界很残酷”的体验,几乎每个搞硬件和具身智能的人都深有体会。今天,我想和大家聊聊一个我在重构…
为了搞掉在线教育平台批改服务的延迟和内存问题,我用Rust重写了推理网关。结果吞吐暴增5倍,p99延迟从510ms压到42ms,但开发过程几乎让我放弃——Session不支持Send、编译时间漫长、错误信息无法理解。这篇文章记录了我如何手写线程池、用Axum+ONNX Runtime趟过生产坑,以及最终为什么还说“Rust值得,但要用在刀刃上”。