[diffusion] [AMD] feat: support online MXFP4 and fp8 quantization (#21431)

Co-authored-by: Bowen Bao <bowenbao@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
This commit is contained in:
Colin Z
2026-05-14 08:52:01 +08:00
committed by GitHub
co-authored by Bowen Bao HAI
parent af7511e0e8
commit 34c0029f0a
10 changed files with 417 additions and 17 deletions
+2
View File
@@ -101,6 +101,8 @@ For quantized transformer checkpoints, prefer:
- `--model-path` for the base pipeline
- `--transformer-path` for a quantized `transformers` transformer component folder
- `--transformer-weights-path` for a quantized safetensors file, directory, or repo
- `--quantization` for online quantization (apply quantization to unquantized models at load time, activations are quantized dynamically)
- `--quantization-ignored-layers` layer name patterns to keep unquantized (e.g. `attention.to_`)
See [Quantization](../quantization.md) for supported quantization families and examples.