From 53a4b51f8ce0260c758120a6823502ee1b5513c2 Mon Sep 17 00:00:00 2001 From: Yueming Yuan Date: Tue, 9 Jun 2026 16:13:37 -0700 Subject: [PATCH] Fix GLM NextN draft value head dim (#26049) --- python/sglang/srt/configs/model_config.py | 11 +++++++++++ 1 file changed, 11 insertions(+) diff --git a/python/sglang/srt/configs/model_config.py b/python/sglang/srt/configs/model_config.py index 34798c3d3..75b631023 100644 --- a/python/sglang/srt/configs/model_config.py +++ b/python/sglang/srt/configs/model_config.py @@ -674,6 +674,17 @@ class ModelConfig: self.scaling = compute_mla_mscale_scaling( self.hf_config.rope_scaling, self.scaling ) + elif "Glm4MoeForCausalLMNextN" in self.hf_config.architectures: + if self.head_dim is None: + self.head_dim = ( + self.hf_text_config.hidden_size + // self.hf_text_config.num_attention_heads + ) + if self.swa_head_dim is None: + self.swa_head_dim = self.head_dim + self.v_head_dim = self.head_dim + self.swa_v_head_dim = self.swa_head_dim + self.attention_arch = AttentionArch.MHA elif "MiniCPM3ForCausalLM" in self.hf_config.architectures: self.head_dim = 128 self.attention_arch = AttentionArch.MLA