[attn backend] clean legacy init_mha_chunk_metadata in trtllm_mla backend (#27403)
This commit is contained in:
@@ -568,7 +568,9 @@ class TRTLLMMLABackend(FlashInferMLAAttnBackend):
|
||||
self.disable_chunked_prefix_cache and has_prefix
|
||||
) or is_in_piecewise_cuda_graph()
|
||||
if fallback_to_flashinfer_impl:
|
||||
super().init_mha_chunk_metadata(forward_batch)
|
||||
super().init_mha_chunk_metadata(
|
||||
forward_batch, disable_flashinfer_ragged=True
|
||||
)
|
||||
|
||||
def init_forward_metadata_out_graph(
|
||||
self,
|
||||
@@ -706,9 +708,6 @@ class TRTLLMMLABackend(FlashInferMLAAttnBackend):
|
||||
else:
|
||||
return super().init_forward_metadata(forward_batch)
|
||||
|
||||
def init_mha_chunk_metadata(self, forward_batch: ForwardBatch):
|
||||
super().init_mha_chunk_metadata(forward_batch, disable_flashinfer_ragged=True)
|
||||
|
||||
def pad_draft_extend_query(
|
||||
self,
|
||||
q: torch.Tensor,
|
||||
|
||||
Reference in New Issue
Block a user