Fix MXFP8 FlashInfer CUTLASS scale selection (#28553)
This commit is contained in:
@@ -790,10 +790,9 @@ class Fp8LinearMethod(LinearMethodBase):
|
|||||||
)
|
)
|
||||||
|
|
||||||
if self.use_mxfp8:
|
if self.use_mxfp8:
|
||||||
if (
|
if get_fp8_gemm_runner_backend().is_flashinfer_cutlass():
|
||||||
get_fp8_gemm_runner_backend().is_flashinfer_cutlass()
|
weight_scale = layer.weight_scale_inv_swizzled
|
||||||
or get_fp8_gemm_runner_backend().is_flashinfer_trtllm()
|
elif get_fp8_gemm_runner_backend().is_flashinfer_trtllm():
|
||||||
):
|
|
||||||
weight_scale = layer.weight_scale_inv_shuffled
|
weight_scale = layer.weight_scale_inv_shuffled
|
||||||
else:
|
else:
|
||||||
weight_scale = layer.weight_scale_inv
|
weight_scale = layer.weight_scale_inv
|
||||||
|
|||||||
Reference in New Issue
Block a user