diff --git a/python/sglang/srt/layers/quantization/awq/awq.py b/python/sglang/srt/layers/quantization/awq/awq.py index 0b63dcb58..3fdcc7399 100644 --- a/python/sglang/srt/layers/quantization/awq/awq.py +++ b/python/sglang/srt/layers/quantization/awq/awq.py @@ -194,6 +194,8 @@ class AWQCPUConfig(AWQConfig): layer.scheme = self.get_linear_scheme(layer) return AWQLinearMethod(self) elif isinstance(layer, FusedMoE): + if is_layer_skipped_awq(prefix, self.modules_to_not_convert): + return None layer.scheme = self.get_moe_scheme(layer) return AWQMoEMethod(self) return None diff --git a/python/sglang/srt/models/qwen3_5.py b/python/sglang/srt/models/qwen3_5.py index 682b7ca1e..fe26e906e 100644 --- a/python/sglang/srt/models/qwen3_5.py +++ b/python/sglang/srt/models/qwen3_5.py @@ -301,7 +301,7 @@ class Qwen3_5GatedDeltaNet(nn.Module): group_size=None, norm_before_gate=True, device=torch.get_device_module().current_device(), - dtype=config.torch_dtype, + dtype=torch.get_default_dtype(), **( {"activation": self.output_gate_type} if self.output_gate_type is not None