diff --git a/python/sglang/srt/hardware_backend/npu/moe/topk.py b/python/sglang/srt/hardware_backend/npu/moe/topk.py index 5c255af57..9aef68476 100644 --- a/python/sglang/srt/hardware_backend/npu/moe/topk.py +++ b/python/sglang/srt/hardware_backend/npu/moe/topk.py @@ -97,7 +97,7 @@ def fused_topk_npu( group_select_mode=(1 if use_grouped_topk else 0), renorm=0, # 1 for sigmoid, 0 for softmax - norm_type=(0 if topk_config.scoring_func == "softmax" else 1), + norm_type=1, routed_scaling_factor=( topk_config.routed_scaling_factor if topk_config.apply_routed_scaling_factor_on_output diff --git a/python/sglang/srt/models/glm4_moe_lite.py b/python/sglang/srt/models/glm4_moe_lite.py index 750117f9d..c650585a5 100644 --- a/python/sglang/srt/models/glm4_moe_lite.py +++ b/python/sglang/srt/models/glm4_moe_lite.py @@ -225,7 +225,6 @@ class Glm4MoeLiteSparseMoeBlock(nn.Module): quant_config=quant_config, routed_scaling_factor=self.routed_scaling_factor, prefix=add_prefix("experts", prefix), - **({"scoring_func": "sigmoid"}), ) self.topk = TopK(