Revert "[AMD][Quantization] Online MXFP4 quantization 2/N - FP8 to MXFP4 requantization on AMD GPUs" (#28213)

This commit is contained in:
Lianmin Zheng
2026-06-14 13:34:06 -07:00
committed by GitHub
parent 3cb29f6747
commit f18d38d040
15 changed files with 185 additions and 1097 deletions
@@ -1508,16 +1508,13 @@ class ModelRunner(ModelRunnerKVCacheMixin):
getattr(self.model, "quant_config", None), "quantized_layers", None
)
if (
hasattr(self.model, "quant_config")
and hasattr(self.model.quant_config, "quantized_layers")
and self.server_args.quantization is not None
self.server_args.quantization is not None
and isinstance(quantized_layers, tuple)
and len(quantized_layers) == 2
):
type_counts, quantized_layers_count = (
self.model.quant_config.quantized_layers
)
type_summary = ", ".join(f"{t}: {c}" for t, c in type_counts.items())
layer_types, quantized_layers_count = quantized_layers
logger.info(
f"Online {self.server_args.quantization} quantization: quantized {quantized_layers_count} layers in total ({type_summary})."
f"Online {self.server_args.quantization} quantization: quantized {quantized_layers_count} layers of types: {layer_types}"
)
if self.server_args.debug_tensor_dump_output_folder is not None: