在银行内网部署Llama 3,我踩了六个坑后终于把推理延迟压到了1.8秒

银行内网部署Llama 3,既要过合规关,又要管住模型不乱说话、日志不泄密、磁盘不爆炸。我用A40 4卡跑通AWQ量化+TensorRT-LLM,把推理延迟压到1.8秒,中间填了六个实打实的坑,这篇是血泪记录。