fix: add missing clamp_limit for CompressedTensorsWNA16MoE (#27328)
This commit is contained in:
+1
@@ -425,6 +425,7 @@ class CompressedTensorsWNA16MoE(CompressedTensorsMoEScheme):
|
|||||||
num_bits=self.num_bits,
|
num_bits=self.num_bits,
|
||||||
is_k_full=self.is_k_full,
|
is_k_full=self.is_k_full,
|
||||||
routed_scaling_factor=self.moe_runner_config.routed_scaling_factor,
|
routed_scaling_factor=self.moe_runner_config.routed_scaling_factor,
|
||||||
|
clamp_limit=self.moe_runner_config.swiglu_limit,
|
||||||
workspace=layer.workspace,
|
workspace=layer.workspace,
|
||||||
)
|
)
|
||||||
return StandardCombineInput(hidden_states=output)
|
return StandardCombineInput(hidden_states=output)
|
||||||
|
|||||||
Reference in New Issue
Block a user