[AMD] Fused qk rmsnorm bf16 for amd/Kimi-K2.5-MXFP4 (#23186)

Co-authored-by: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
Alan Kao
2026-04-21 02:35:09 -07:00
committed by GitHub
co-authored by Claude Sonnet 4.6
parent fa8993111d
commit 8589b92a89
@@ -60,6 +60,9 @@ if _is_cuda:
if _use_aiter:
from aiter.ops.fused_qk_norm_rope_cache_quant import (
fused_qk_rmsnorm as fused_qk_rmsnorm_bf16,
)
from aiter.ops.triton.batched_gemm_a8w8_a_per_token_group_prequant_w_per_batched_tensor_quant import (
batched_gemm_a8w8_a_per_token_group_prequant_w_per_batched_tensor_quant,
)
@@ -160,6 +163,15 @@ class DeepseekMLAForwardMixin:
output_unquantized_inp1=False,
)
elif _use_aiter:
q, k_nope = fused_qk_rmsnorm_bf16(
q,
self.q_a_layernorm.weight,
self.q_a_layernorm.variance_epsilon,
k_nope,
self.kv_a_layernorm.weight,
self.kv_a_layernorm.variance_epsilon,
)
else:
q = self.q_a_layernorm(q)
k_nope = self.kv_a_layernorm(k_nope)