From 1100b9865c48219e74887a60274f6d7a134bbb60 Mon Sep 17 00:00:00 2001 From: Sam Shleifer Date: Wed, 25 Mar 2026 22:57:09 -0400 Subject: [PATCH] Fix MxInt4 MoE returning wrong output variable (#21348) --- .../schemes/compressed_tensors_w4a4_mxint4_moe.py | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/python/sglang/srt/layers/quantization/compressed_tensors/schemes/compressed_tensors_w4a4_mxint4_moe.py b/python/sglang/srt/layers/quantization/compressed_tensors/schemes/compressed_tensors_w4a4_mxint4_moe.py index 865f3de43..569e20454 100644 --- a/python/sglang/srt/layers/quantization/compressed_tensors/schemes/compressed_tensors_w4a4_mxint4_moe.py +++ b/python/sglang/srt/layers/quantization/compressed_tensors/schemes/compressed_tensors_w4a4_mxint4_moe.py @@ -330,7 +330,7 @@ class CompressedTensorsMxInt4MoE(CompressedTensorsMoEScheme): num_tokens, hidden_size, dtype=torch.bfloat16, device=x.device ) - output = trtllm_mxint4_block_scale_moe( + trtllm_mxint4_block_scale_moe( routing_logits=router_logits, # float routing_bias=correction_bias, hidden_states=x, @@ -354,4 +354,4 @@ class CompressedTensorsMxInt4MoE(CompressedTensorsMoEScheme): output=symm_output, ) - return StandardCombineInput(hidden_states=output) + return StandardCombineInput(hidden_states=symm_output)