From d981b7b9c43a1816e4ef17f8b8b39eb16e0d2546 Mon Sep 17 00:00:00 2001 From: Zaili Wang <109502517+ZailiWang@users.noreply.github.com> Date: Tue, 9 Jun 2026 15:24:55 +0800 Subject: [PATCH] [Fix] Avoid applying cuda graph input-buffer registry on non-cuda devices (#27549) --- python/sglang/srt/model_executor/model_runner.py | 6 +++--- 1 file changed, 3 insertions(+), 3 deletions(-) diff --git a/python/sglang/srt/model_executor/model_runner.py b/python/sglang/srt/model_executor/model_runner.py index e91075fa7..3b30eb0e1 100644 --- a/python/sglang/srt/model_executor/model_runner.py +++ b/python/sglang/srt/model_executor/model_runner.py @@ -3204,7 +3204,7 @@ class ModelRunner(ModelRunnerKVCacheMixin): forward_batch: ForwardBatch, pp_proxy_tensors=None, ) -> Union[LogitsProcessorOutput, PPProxyTensors]: - if not self.server_args.enable_pdmux: + if not self.server_args.enable_pdmux and self.device == "cuda": forward_batch = self._eager_fb_view(forward_batch, pp_proxy_tensors) # Set extra arguments pdmux_override = False @@ -3294,7 +3294,7 @@ class ModelRunner(ModelRunnerKVCacheMixin): ret = self.piecewise_cuda_graph_runner.replay(forward_batch, **kwargs) return (ret, can_run_graph) - if not self.server_args.enable_pdmux: + if not self.server_args.enable_pdmux and self.device == "cuda": forward_batch = self._eager_fb_view(forward_batch, pp_proxy_tensors) # Launch model forward @@ -3355,7 +3355,7 @@ class ModelRunner(ModelRunnerKVCacheMixin): # called from the idle path can re-read a prior batch's req_pool # indices and trigger SWA mapping use-after-free. if forward_batch.batch_size > 0: - if not self.server_args.enable_pdmux: + if not self.server_args.enable_pdmux and self.device == "cuda": forward_batch = self._eager_fb_view(forward_batch, pp_proxy_tensors) self.attn_backend.init_forward_metadata(forward_batch) else: