From 8bfcc0c39c6d2fd6da2549f5627599d459118157 Mon Sep 17 00:00:00 2001 From: Brayden Zhong Date: Thu, 11 Jun 2026 20:23:09 -0700 Subject: [PATCH] Use the correct wrapper for `fp4_quantize` (#27956) Co-authored-by: Brayden Zhong --- python/sglang/srt/models/deepseek_v2.py | 3 +-- 1 file changed, 1 insertion(+), 2 deletions(-) diff --git a/python/sglang/srt/models/deepseek_v2.py b/python/sglang/srt/models/deepseek_v2.py index c9e24145c..b6c34b81a 100644 --- a/python/sglang/srt/models/deepseek_v2.py +++ b/python/sglang/srt/models/deepseek_v2.py @@ -286,8 +286,7 @@ class DeepseekV2MLP(nn.Module): and self.swiglu_limit is None and not isinstance(x, tuple) ): - from flashinfer import fp4_quantize - + from sglang.srt.layers.quantization.fp4_utils import fp4_quantize from sglang.srt.layers.quantization.nvfp4_gemm_swiglu_nvfp4_quant import ( nvfp4_gemm_swiglu_nvfp4_quant, )