From 1beb805356df1311f6c0490b2da8a016ed09b297 Mon Sep 17 00:00:00 2001 From: Mohammad Miadh Angkad <176301910+mmangkad@users.noreply.github.com> Date: Wed, 19 Aug 2026 10:53:52 +0800 Subject: [PATCH] [Perf] Restore the 16-token router GEMM threshold on SM10X (#34953) Co-authored-by: Mohammad Angkad --- python/sglang/srt/models/deepseek_v2.py | 4 +--- 1 file changed, 1 insertion(+), 3 deletions(-) diff --git a/python/sglang/srt/models/deepseek_v2.py b/python/sglang/srt/models/deepseek_v2.py index ca8014a7c..31047701e 100644 --- a/python/sglang/srt/models/deepseek_v2.py +++ b/python/sglang/srt/models/deepseek_v2.py @@ -525,11 +525,9 @@ class MoEGate(nn.Module): return linear_bf16_fp32(hidden_states, self.weight) return F.linear(hidden_states, self.weight, None) else: - # NOTE(b8zhong): this threshold has been empirically verified - max_router_gemm_tokens = 4 if _device_sm in (100, 103) else 16 if ( _is_cuda - and hidden_states.shape[0] <= max_router_gemm_tokens + and hidden_states.shape[0] <= 16 and hidden_states.shape[1] % 1024 == 0 and (self.weight.shape[0] == 256 or self.weight.shape[0] == 384) and _device_sm >= 90