[Bug] Fix V4-Pro NaN on Blackwell by converting fp8_einsum input scale to ue8m0 (#25733)
This commit is contained in:
@@ -623,6 +623,7 @@ class MQALayer(nn.Module):
|
|||||||
o.reshape(T * G, D).contiguous(),
|
o.reshape(T * G, D).contiguous(),
|
||||||
group_size=128,
|
group_size=128,
|
||||||
)
|
)
|
||||||
|
o_s = deep_gemm.ceil_to_ue8m0(o_s)
|
||||||
output = torch.empty(T, G, R, device=o.device, dtype=torch.bfloat16)
|
output = torch.empty(T, G, R, device=o.device, dtype=torch.bfloat16)
|
||||||
deep_gemm.fp8_einsum(
|
deep_gemm.fp8_einsum(
|
||||||
"bhr,hdr->bhd",
|
"bhr,hdr->bhd",
|
||||||
|
|||||||
Reference in New Issue
Block a user