NVIDIA Dynamo
nvidiaDisaggregated-serving framework for multi-node LLM inference — splits prefill and decode across GPU pools and manages distributed KV-cache placement, tiering, and cache-aware routing on top of vLLM, TensorRT-LLM, or SGLang backends