diff --git a/docs/cookbook/autoregressive/Qwen/Qwen3.5.mdx b/docs/cookbook/autoregressive/Qwen/Qwen3.5.mdx index 023360f42..30c92a678 100644 --- a/docs/cookbook/autoregressive/Qwen/Qwen3.5.mdx +++ b/docs/cookbook/autoregressive/Qwen/Qwen3.5.mdx @@ -42,7 +42,7 @@ Qwen3.5 features a Gated Delta Networks combined with sparse Mixture-of-Experts Qwen3.5-397B-A17B [Qwen/Qwen3.5-397B-A17B](https://huggingface.co/Qwen/Qwen3.5-397B-A17B) [Qwen/Qwen3.5-397B-A17B-FP8](https://huggingface.co/Qwen/Qwen3.5-397B-A17B-FP8) - NVIDIA NVFP4: [nvidia/Qwen3.5-397B-A17B-NVFP4](https://huggingface.co/nvidia/Qwen3.5-397B-A17B-NVFP4)
AMD MXFP4: [amd/Qwen3.5-397B-A17B-MXFP4](https://huggingface.co/amd/Qwen3.5-397B-A17B-MXFP4) + NVIDIA NVFP4: [nvidia/Qwen3.5-397B-A17B-NVFP4-V2](https://huggingface.co/nvidia/Qwen3.5-397B-A17B-NVFP4-V2)
AMD MXFP4: [amd/Qwen3.5-397B-A17B-MXFP4](https://huggingface.co/amd/Qwen3.5-397B-A17B-MXFP4) Qwen3.5-122B-A10B @@ -156,7 +156,7 @@ This section provides deployment configurations optimized for different hardware - **MI300X (192GB)** runs with tp=4. - **MI325X (256GB)** runs with tp=2. - **MI355X (288GB)** runs with tp=2. - - **FP4**: The FP4 quantized model requires ~250GB for weights, cutting memory by almost 4x. NVFP4 ([nvidia/Qwen3.5-397B-A17B-NVFP4](https://huggingface.co/nvidia/Qwen3.5-397B-A17B-NVFP4)) requires B200/B300 (Blackwell architecture); AMD provides an MXFP4 checkpoint ([amd/Qwen3.5-397B-A17B-MXFP4](https://huggingface.co/amd/Qwen3.5-397B-A17B-MXFP4)) for MI355X. + - **FP4**: The FP4 quantized model requires ~250GB for weights, cutting memory by almost 4x. NVFP4 ([nvidia/Qwen3.5-397B-A17B-NVFP4-V2](https://huggingface.co/nvidia/Qwen3.5-397B-A17B-NVFP4-V2)) requires B200/B300 (Blackwell architecture); AMD provides an MXFP4 checkpoint ([amd/Qwen3.5-397B-A17B-MXFP4](https://huggingface.co/amd/Qwen3.5-397B-A17B-MXFP4)) for MI355X. - **B200 (183GB)** runs with tp=4. (NVFP4) - **B300 (275GB)** runs with tp=2. (NVFP4) - **MI355X (288GB)** runs with tp=2 (use tp=4 for low concurrency). (MXFP4) diff --git a/docs/src/snippets/autoregressive/qwen35-deployment.jsx b/docs/src/snippets/autoregressive/qwen35-deployment.jsx index eebdc8881..0ce212be0 100644 --- a/docs/src/snippets/autoregressive/qwen35-deployment.jsx +++ b/docs/src/snippets/autoregressive/qwen35-deployment.jsx @@ -318,10 +318,10 @@ export const Qwen35Deployment = () => { let modelName; if (quantization === 'fp4') { - // AMD MI355X uses the MXFP4 checkpoint; Blackwell uses NVFP4. + // AMD MI355X uses the MXFP4 checkpoint; Blackwell uses NVFP4-V2. modelName = hardware === 'mi355x' ? 'amd/Qwen3.5-397B-A17B-MXFP4' - : 'nvidia/Qwen3.5-397B-A17B-NVFP4'; + : 'nvidia/Qwen3.5-397B-A17B-NVFP4-V2'; } else { const suffix = MODEL_SUFFIX[model]; const quantSuffix = quantization === 'fp8' ? '-FP8' : '';