From 0ae4740bd111ce3197baf7aa836b4224a0b4c4d0 Mon Sep 17 00:00:00 2001 From: Qeeweew <68716978+Qeeweew@users.noreply.github.com> Date: Wed, 17 Jun 2026 10:29:57 +0800 Subject: [PATCH] fix: add missing clamp_limit for CompressedTensorsWNA16MoE (#27328) --- .../compressed_tensors/schemes/compressed_tensors_wNa16_moe.py | 1 + 1 file changed, 1 insertion(+) diff --git a/python/sglang/srt/layers/quantization/compressed_tensors/schemes/compressed_tensors_wNa16_moe.py b/python/sglang/srt/layers/quantization/compressed_tensors/schemes/compressed_tensors_wNa16_moe.py index 581972032..0d6a9b896 100644 --- a/python/sglang/srt/layers/quantization/compressed_tensors/schemes/compressed_tensors_wNa16_moe.py +++ b/python/sglang/srt/layers/quantization/compressed_tensors/schemes/compressed_tensors_wNa16_moe.py @@ -425,6 +425,7 @@ class CompressedTensorsWNA16MoE(CompressedTensorsMoEScheme): num_bits=self.num_bits, is_k_full=self.is_k_full, routed_scaling_factor=self.moe_runner_config.routed_scaling_factor, + clamp_limit=self.moe_runner_config.swiglu_limit, workspace=layer.workspace, ) return StandardCombineInput(hidden_states=output)