Fix MXFP8 FlashInfer CUTLASS scale selection (#28553)

This commit is contained in:
Mohammad Miadh Angkad
2026-06-17 16:44:23 -07:00
committed by GitHub
parent a663500ea9
commit d773b49e5b
+3 -4
View File
@@ -790,10 +790,9 @@ class Fp8LinearMethod(LinearMethodBase):
)
if self.use_mxfp8:
if (
get_fp8_gemm_runner_backend().is_flashinfer_cutlass()
or get_fp8_gemm_runner_backend().is_flashinfer_trtllm()
):
if get_fp8_gemm_runner_backend().is_flashinfer_cutlass():
weight_scale = layer.weight_scale_inv_swizzled
elif get_fp8_gemm_runner_backend().is_flashinfer_trtllm():
weight_scale = layer.weight_scale_inv_shuffled
else:
weight_scale = layer.weight_scale_inv