From 619ab2bccecf6d075c0cf198a62aec407ff8f187 Mon Sep 17 00:00:00 2001 From: Lianmin Zheng Date: Thu, 3 Sep 2026 10:47:04 -0700 Subject: [PATCH] Fix block-scale swizzling device placement (#37849) --- python/sglang/srt/layers/quantization/utils.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/python/sglang/srt/layers/quantization/utils.py b/python/sglang/srt/layers/quantization/utils.py index 5a130d6e6..7aa3d018d 100644 --- a/python/sglang/srt/layers/quantization/utils.py +++ b/python/sglang/srt/layers/quantization/utils.py @@ -615,7 +615,7 @@ def swizzle_blockscale(scale: torch.Tensor): assert cols % 4 == 0 padded_scale = padded_scale.reshape(batches, rows // 128, 4, 32, cols // 4, 4) swizzled_scale = padded_scale.permute((0, 1, 4, 3, 2, 5)) - swizzled_scale = swizzled_scale.contiguous().cuda() + swizzled_scale = swizzled_scale.contiguous().to(scale.device) return ( swizzled_scale.reshape(M_padded, K_padded) if scale_ndim == 2