diff --git a/python/sglang/srt/models/deepseek_v4.py b/python/sglang/srt/models/deepseek_v4.py index 4ab6d00e8..f9508ed95 100644 --- a/python/sglang/srt/models/deepseek_v4.py +++ b/python/sglang/srt/models/deepseek_v4.py @@ -623,6 +623,7 @@ class MQALayer(nn.Module): o.reshape(T * G, D).contiguous(), group_size=128, ) + o_s = deep_gemm.ceil_to_ue8m0(o_s) output = torch.empty(T, G, R, device=o.device, dtype=torch.bfloat16) deep_gemm.fp8_einsum( "bhr,hdr->bhd",