[Cherry pick to release/v0.5.15] Fix NVFP4 online quantization (#30397)
Co-authored-by: Brayden Zhong <brayden@radixark.ai>
This commit is contained in:
co-authored by
Brayden Zhong
parent
d88644b430
commit
e2ea7aafad
@@ -85,6 +85,7 @@ class NvFp4OnlineConfig(ModelOptQuantConfig):
|
|||||||
self.use_per_token_activation = True
|
self.use_per_token_activation = True
|
||||||
self.is_checkpoint_fp8_serialized = is_checkpoint_fp8_serialized
|
self.is_checkpoint_fp8_serialized = is_checkpoint_fp8_serialized
|
||||||
self.is_fp4_experts = False
|
self.is_fp4_experts = False
|
||||||
|
self.dequant_fp4_to_fp8 = False
|
||||||
self.activation_scheme = activation_scheme
|
self.activation_scheme = activation_scheme
|
||||||
self.weight_block_size = weight_block_size
|
self.weight_block_size = weight_block_size
|
||||||
self.use_mxfp8 = use_mxfp8
|
self.use_mxfp8 = use_mxfp8
|
||||||
|
|||||||
Reference in New Issue
Block a user