From 32a1d55431c6a68ab2b599f857c310ba757497f5 Mon Sep 17 00:00:00 2001 From: Xinyuan Tong <115166877+JustinTong0323@users.noreply.github.com> Date: Sat, 5 Sep 2026 13:42:29 +0800 Subject: [PATCH] fix(modelopt_fp4): skip NVFP4 swiglu-fusion interleave for shared experts with swiglu_limit (#37378) --- python/sglang/srt/models/deepseek_v2.py | 1 + 1 file changed, 1 insertion(+) diff --git a/python/sglang/srt/models/deepseek_v2.py b/python/sglang/srt/models/deepseek_v2.py index 9aafb6edd..45a84a6fb 100644 --- a/python/sglang/srt/models/deepseek_v2.py +++ b/python/sglang/srt/models/deepseek_v2.py @@ -787,6 +787,7 @@ class DeepseekV2MoE(nn.Module): ModelOptFp4LinearMethod, ) and fc1_n % 128 == 0 + and self.shared_experts.swiglu_limit is None and not check_cuda_graph_backend(Phase.PREFILL, Backend.TC_PIECEWISE) ): self.shared_experts.gate_up_proj._interleave_for_swiglu_fusion = True