From 688a6d23f144369a7d4d466addcba358022f5d33 Mon Sep 17 00:00:00 2001 From: Alison Shao <54658187+alisonshao@users.noreply.github.com> Date: Sun, 19 Jul 2026 14:42:04 -0700 Subject: [PATCH] [DeepSeek-V4] Fix idle-rank dummy-extend sparse-prefill crash under DP breakable CUDA graph (#31705) --- python/sglang/srt/layers/attention/deepseek_v4_backend.py | 2 ++ 1 file changed, 2 insertions(+) diff --git a/python/sglang/srt/layers/attention/deepseek_v4_backend.py b/python/sglang/srt/layers/attention/deepseek_v4_backend.py index cf5fa0183..5d53b46ad 100644 --- a/python/sglang/srt/layers/attention/deepseek_v4_backend.py +++ b/python/sglang/srt/layers/attention/deepseek_v4_backend.py @@ -94,6 +94,8 @@ def _get_logical_forward_mode(forward_batch: ForwardBatch) -> ForwardMode: # from a reused/padded ForwardBatch turn an empty rank into TARGET_VERIFY. if forward_batch.forward_mode.is_idle(): return forward_batch.forward_mode + if forward_batch.forward_mode == ForwardMode.EXTEND: + return forward_batch.forward_mode return ( getattr(forward_batch, "_original_forward_mode", None) or forward_batch.forward_mode