From ff51acd67b228bae35d73ce8d36a8f44c8cf9697 Mon Sep 17 00:00:00 2001 From: silencejade <222910030+silencejade@users.noreply.github.com> Date: Tue, 30 Jun 2026 15:55:50 +0800 Subject: [PATCH] [NPU] Qwen3-VL-8B use split_qkv_rmsnorm_rope for extend (#29627) --- python/sglang/srt/models/qwen3.py | 5 +---- 1 file changed, 1 insertion(+), 4 deletions(-) diff --git a/python/sglang/srt/models/qwen3.py b/python/sglang/srt/models/qwen3.py index ba6652915..dfa440621 100644 --- a/python/sglang/srt/models/qwen3.py +++ b/python/sglang/srt/models/qwen3.py @@ -287,10 +287,7 @@ class Qwen3Attention(nn.Module): positions, hidden_states, forward_batch ) save_kv_cache = False - elif ( - not _is_npu - or forward_batch.forward_mode.is_extend_or_draft_extend_or_mixed() - ): + elif not _is_npu: q, k, v = self.forward_prepare_native( positions=positions, hidden_states=hidden_states,