From dde03d7c4aad4f4a722fc23d9d986324468ebd65 Mon Sep 17 00:00:00 2001 From: hjzhang <499213894@qq.com> Date: Tue, 28 Jul 2026 17:56:36 +0800 Subject: [PATCH] [JIT] Restore the previous division behavior in per-token group quantization (#32616) Co-authored-by: hjzhang --- python/sglang/kernels/jit/csrc/gemm/per_token_group_quant.cuh | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/python/sglang/kernels/jit/csrc/gemm/per_token_group_quant.cuh b/python/sglang/kernels/jit/csrc/gemm/per_token_group_quant.cuh index f44489c29..f8ecbe3f2 100644 --- a/python/sglang/kernels/jit/csrc/gemm/per_token_group_quant.cuh +++ b/python/sglang/kernels/jit/csrc/gemm/per_token_group_quant.cuh @@ -305,7 +305,7 @@ struct QuantTrait { } else { // fp32 scale: multiply in fp32 (hmul2 brings too much precision loss) scale_inv = raw_scale; - const float quant_scale = kMaxValue * __frcp_rn(amax); + const float quant_scale = kMaxValue / amax; const float2 quant_scale2 = {quant_scale, quant_scale}; #pragma unroll for (uint32_t i = 0; i < kVecSize / 2; ++i) {