From f532ad1f9aef2397cc86a00756f0758f8de31956 Mon Sep 17 00:00:00 2001 From: William Hu <67835823+willhu-jpg@users.noreply.github.com> Date: Mon, 21 Sep 2026 16:52:26 -0400 Subject: [PATCH] Fix GLM-5.3 forget-gate shape for nvCUTEDSL verify (#40607) --- python/sglang/srt/layers/attention/linear/kda_backend.py | 1 + 1 file changed, 1 insertion(+) diff --git a/python/sglang/srt/layers/attention/linear/kda_backend.py b/python/sglang/srt/layers/attention/linear/kda_backend.py index 54ffc91d5..c526d3432 100644 --- a/python/sglang/srt/layers/attention/linear/kda_backend.py +++ b/python/sglang/srt/layers/attention/linear/kda_backend.py @@ -1583,6 +1583,7 @@ class KDAAttnBackend(MambaAttnBackendBase): onorm_eps = None onorm_gate = None + a = a.reshape(1, seq_len, h, layer.head_k_dim) out = fused_kda_decode_mtp_dspark( x_q=x_q, x_k=x_k,