[AMD][Quantization] Online MXFP4 quantization 4/N - NVFP4 to MXFP4 Online Requantization on AMD GPUs (#29328)
This commit is contained in:
@@ -167,7 +167,7 @@ QUANTIZATION_CHOICES = [
|
||||
"mxfp_w4a8", # for NPU W4A8 (MXFP4 weights + MXFP8 activations)
|
||||
"quark", # AMD Quark quantizer (FP8 / MXFP4 / Int4FP8 etc.)
|
||||
"quark_int4fp8_moe",
|
||||
"quark_mxfp4", # Online MOE + linear quantization.
|
||||
"quark_mxfp4", # Online MOE + linear quantization (incl. NVFP4 -> MXFP4 requantization).
|
||||
# Apple Silicon MLX backend — on-the-fly quantization of fp16 weights at load
|
||||
# time via mlx.nn.quantize. Only takes effect when SGLANG_USE_MLX=1.
|
||||
"mlx_q4", # 4 bits, group_size=64 (mlx-community default)
|
||||
|
||||
Reference in New Issue
Block a user