🏷️ Jetson

Google那篇关于RAG延迟的论文里假设了“无限带宽”,但我的Jetson Orin NX的内存带宽只够喝汤

上周在实验室组会上,我抛出了个观点:现在大家都在卷RAG的检索精度,但很少有人聊“把RAG搬下云端”这件事有多难。就在上周,Google DeepMind上个月发的那篇关于“System 2 Reasoning”的论文里提到,大模型推理的延迟主要瓶颈在于KV Cache的读写。当时我就在想,这理论在…

Jetson Orin推理优化:我把YOLOv8延迟从45ms压到8ms,但功耗翻车了

在Jetson AGX Orin上部署YOLOv8,从45ms延迟艰难优化到8ms。详细记录了TensorRT层融合、INT8量化的校准集精度陷阱、DLA加速器的隐藏坑,以及用共享内存多模型流水线把吞吐拉到45fps的全过程。还有差点烧坏板子的散热教训和生产环境的自动恢复设计。