[attn backend] clean legacy init_mha_chunk_metadata in trtllm_mla backend (#27403)
This commit is contained in:
@@ -568,7 +568,9 @@ class TRTLLMMLABackend(FlashInferMLAAttnBackend):
|
|||||||
self.disable_chunked_prefix_cache and has_prefix
|
self.disable_chunked_prefix_cache and has_prefix
|
||||||
) or is_in_piecewise_cuda_graph()
|
) or is_in_piecewise_cuda_graph()
|
||||||
if fallback_to_flashinfer_impl:
|
if fallback_to_flashinfer_impl:
|
||||||
super().init_mha_chunk_metadata(forward_batch)
|
super().init_mha_chunk_metadata(
|
||||||
|
forward_batch, disable_flashinfer_ragged=True
|
||||||
|
)
|
||||||
|
|
||||||
def init_forward_metadata_out_graph(
|
def init_forward_metadata_out_graph(
|
||||||
self,
|
self,
|
||||||
@@ -706,9 +708,6 @@ class TRTLLMMLABackend(FlashInferMLAAttnBackend):
|
|||||||
else:
|
else:
|
||||||
return super().init_forward_metadata(forward_batch)
|
return super().init_forward_metadata(forward_batch)
|
||||||
|
|
||||||
def init_mha_chunk_metadata(self, forward_batch: ForwardBatch):
|
|
||||||
super().init_mha_chunk_metadata(forward_batch, disable_flashinfer_ragged=True)
|
|
||||||
|
|
||||||
def pad_draft_extend_query(
|
def pad_draft_extend_query(
|
||||||
self,
|
self,
|
||||||
q: torch.Tensor,
|
q: torch.Tensor,
|
||||||
|
|||||||
Reference in New Issue
Block a user