[Moe] Fix flashinfer_trtllm silently dropping swiglu_limit clamped SwiGLU activation (#39920)
This commit is contained in:
@@ -2358,10 +2358,15 @@ class Fp8MoEMethod(FusedMoEMethodBase):
|
|||||||
"""Materialize optional TRT-LLM SwiGLU parameters once per expert."""
|
"""Materialize optional TRT-LLM SwiGLU parameters once per expert."""
|
||||||
num_experts = int(layer.num_local_experts)
|
num_experts = int(layer.num_local_experts)
|
||||||
device = layer.w13_weight.device
|
device = layer.w13_weight.device
|
||||||
|
clamp_limit = (
|
||||||
|
self.moe_runner_config.gemm1_clamp_limit
|
||||||
|
if self.moe_runner_config.gemm1_clamp_limit is not None
|
||||||
|
else self.moe_runner_config.swiglu_limit
|
||||||
|
)
|
||||||
for name, value in (
|
for name, value in (
|
||||||
("gemm1_alpha", self.moe_runner_config.gemm1_alpha),
|
("gemm1_alpha", self.moe_runner_config.gemm1_alpha),
|
||||||
("gemm1_beta", self.moe_runner_config.gemm1_beta),
|
("gemm1_beta", self.moe_runner_config.gemm1_beta),
|
||||||
("gemm1_clamp_limit", self.moe_runner_config.gemm1_clamp_limit),
|
("gemm1_clamp_limit", clamp_limit),
|
||||||
):
|
):
|
||||||
tensor = (
|
tensor = (
|
||||||
None
|
None
|
||||||
|
|||||||
Reference in New Issue
Block a user