From ec741e4161b8c25b575a36f87b781c3d35ededc9 Mon Sep 17 00:00:00 2001 From: Mohammad Miadh Angkad <176301910+mmangkad@users.noreply.github.com> Date: Mon, 3 Aug 2026 02:05:09 +0800 Subject: [PATCH] Fix DSpark loading for hybrid DSV4 NVFP4 (#33276) --- python/sglang/srt/model_loader/loader.py | 5 +++-- 1 file changed, 3 insertions(+), 2 deletions(-) diff --git a/python/sglang/srt/model_loader/loader.py b/python/sglang/srt/model_loader/loader.py index c2f4e83dd..d233612bd 100644 --- a/python/sglang/srt/model_loader/loader.py +++ b/python/sglang/srt/model_loader/loader.py @@ -263,10 +263,11 @@ def _get_quantization_config( ModelOptFp4Config, ) - # MTP MoE layers (model.decoder.*) are not NVFP4 quantized. + # Draft experts serialized under mtp.* remain source MXFP4. + # NextN exposes them as model.decoder.*; DSpark as stages.*. nvfp4_exclude_modules = list( nvfp4_meta.get("exclude_modules") or [] - ) + ["model.decoder.*"] + ) + ["model.decoder.*", "stages.*"] nvfp4_config = ModelOptFp4Config( is_checkpoint_nvfp4_serialized=True, group_size=int(nvfp4_meta["group_size"]),