[Kernel] Set sgl_per_token_group_quant_8bit_v2 as default choice (#22467)

This commit is contained in:
Baizhou Zhang
2026-04-11 01:59:57 -07:00
committed by GitHub
parent 4f45472f34
commit d14d368191
5 changed files with 29 additions and 19 deletions
+3 -1
View File
@@ -96,7 +96,9 @@ class TestPerTokenGroupQuantFP8(TestFP8Base):
A, A_quant_gt, scale_gt = self._make_A(
M=self.M, K=self.K, group_size=self.group_size, out_dtype=self.quant_type
)
A_quant, scale = per_token_group_quant_fp8(x=A, group_size=self.group_size)
A_quant, scale = per_token_group_quant_fp8(
x=A.to(torch.bfloat16), group_size=self.group_size
)
torch.testing.assert_close(scale, scale_gt)
diff = (A_quant.to(torch.float16) - A_quant_gt.to(torch.float16)).abs()
diff_count = (diff > 1e-5).count_nonzero()