diff --git a/python/sglang/srt/layers/quantization/modelslim/modelslim.py b/python/sglang/srt/layers/quantization/modelslim/modelslim.py index dc44dbaa7..a4074e5b8 100644 --- a/python/sglang/srt/layers/quantization/modelslim/modelslim.py +++ b/python/sglang/srt/layers/quantization/modelslim/modelslim.py @@ -177,6 +177,8 @@ class ModelSlimConfig(QuantizationConfig): ) or self.is_layer_skipped(prefix, self.packed_modules_mapping): return UnquantizedLinearMethod() layer.scheme = self.get_linear_scheme(layer, prefix_in_quant_config) + if layer.scheme is None: + return UnquantizedLinearMethod() return ModelSlimLinearMethod(self) elif isinstance(layer, FusedMoE): layer.scheme = self.get_moe_scheme(layer, prefix)