在银行内网部署Llama 3,我踩了六个坑后终于把推理延迟压到了1.8秒
银行内网部署Llama 3,既要过合规关,又要管住模型不乱说话、日志不泄密、磁盘不爆炸。我用A40 4卡跑通AWQ量化+TensorRT-LLM,把推理延迟压到1.8秒,中间填了六个实打实的坑,这篇是血泪记录。
银行内网部署Llama 3,既要过合规关,又要管住模型不乱说话、日志不泄密、磁盘不爆炸。我用A40 4卡跑通AWQ量化+TensorRT-LLM,把推理延迟压到1.8秒,中间填了六个实打实的坑,这篇是血泪记录。
在Jetson AGX Orin上部署YOLOv8,从45ms延迟艰难优化到8ms。详细记录了TensorRT层融合、INT8量化的校准集精度陷阱、DLA加速器的隐藏坑,以及用共享内存多模型流水线把吞吐拉到45fps的全过程。还有差点烧坏板子的散热教训和生产环境的自动恢复设计。