[attn backend] clean legacy init_mha_chunk_metadata in trtllm_mla backend (#27403)

This commit is contained in:
Qiaolin Yu
2026-06-05 23:30:21 -07:00
committed by GitHub
parent 163fafba51
commit 8c47b7678a
@@ -568,7 +568,9 @@ class TRTLLMMLABackend(FlashInferMLAAttnBackend):
self.disable_chunked_prefix_cache and has_prefix self.disable_chunked_prefix_cache and has_prefix
) or is_in_piecewise_cuda_graph() ) or is_in_piecewise_cuda_graph()
if fallback_to_flashinfer_impl: if fallback_to_flashinfer_impl:
super().init_mha_chunk_metadata(forward_batch) super().init_mha_chunk_metadata(
forward_batch, disable_flashinfer_ragged=True
)
def init_forward_metadata_out_graph( def init_forward_metadata_out_graph(
self, self,
@@ -706,9 +708,6 @@ class TRTLLMMLABackend(FlashInferMLAAttnBackend):
else: else:
return super().init_forward_metadata(forward_batch) return super().init_forward_metadata(forward_batch)
def init_mha_chunk_metadata(self, forward_batch: ForwardBatch):
super().init_mha_chunk_metadata(forward_batch, disable_flashinfer_ragged=True)
def pad_draft_extend_query( def pad_draft_extend_query(
self, self,
q: torch.Tensor, q: torch.Tensor,