fix_get_quant_method_in_fused_moe_condition (#18459)
Signed-off-by: tom-zju <tanjianpingzju1990@gmail.com> Co-authored-by: Peng Zhang <aniz1905@gmail.com>
This commit is contained in:
@@ -18,7 +18,10 @@ from sglang.srt.layers.quantization.base_config import (
|
|||||||
QuantizeMethodBase,
|
QuantizeMethodBase,
|
||||||
)
|
)
|
||||||
from sglang.srt.layers.quantization.gptq import GPTQConfig, GPTQMarlinConfig
|
from sglang.srt.layers.quantization.gptq import GPTQConfig, GPTQMarlinConfig
|
||||||
from sglang.srt.layers.quantization.unquant import UnquantizedLinearMethod
|
from sglang.srt.layers.quantization.unquant import (
|
||||||
|
UnquantizedFusedMoEMethod,
|
||||||
|
UnquantizedLinearMethod,
|
||||||
|
)
|
||||||
from sglang.srt.utils import get_device_capability, set_weight_attrs
|
from sglang.srt.utils import get_device_capability, set_weight_attrs
|
||||||
|
|
||||||
logger = logging.getLogger(__name__)
|
logger = logging.getLogger(__name__)
|
||||||
@@ -194,6 +197,8 @@ class MoeWNA16Config(QuantizationConfig):
|
|||||||
from sglang.srt.layers.moe.fused_moe_triton.layer import FusedMoE
|
from sglang.srt.layers.moe.fused_moe_triton.layer import FusedMoE
|
||||||
|
|
||||||
if is_layer_skipped_quant(prefix, self.modules_to_not_convert):
|
if is_layer_skipped_quant(prefix, self.modules_to_not_convert):
|
||||||
|
if isinstance(layer, FusedMoE):
|
||||||
|
return UnquantizedFusedMoEMethod()
|
||||||
return UnquantizedLinearMethod()
|
return UnquantizedLinearMethod()
|
||||||
elif isinstance(layer, LinearBase):
|
elif isinstance(layer, LinearBase):
|
||||||
|
|
||||||
|
|||||||
Reference in New Issue
Block a user