From 8c47b7678a8b9100a0f36672e30bd2ed0eaf15d8 Mon Sep 17 00:00:00 2001 From: Qiaolin Yu Date: Fri, 5 Jun 2026 23:30:21 -0700 Subject: [PATCH] [attn backend] clean legacy init_mha_chunk_metadata in trtllm_mla backend (#27403) --- python/sglang/srt/layers/attention/trtllm_mla_backend.py | 7 +++---- 1 file changed, 3 insertions(+), 4 deletions(-) diff --git a/python/sglang/srt/layers/attention/trtllm_mla_backend.py b/python/sglang/srt/layers/attention/trtllm_mla_backend.py index 2f4af37ac..8b4817207 100755 --- a/python/sglang/srt/layers/attention/trtllm_mla_backend.py +++ b/python/sglang/srt/layers/attention/trtllm_mla_backend.py @@ -568,7 +568,9 @@ class TRTLLMMLABackend(FlashInferMLAAttnBackend): self.disable_chunked_prefix_cache and has_prefix ) or is_in_piecewise_cuda_graph() if fallback_to_flashinfer_impl: - super().init_mha_chunk_metadata(forward_batch) + super().init_mha_chunk_metadata( + forward_batch, disable_flashinfer_ragged=True + ) def init_forward_metadata_out_graph( self, @@ -706,9 +708,6 @@ class TRTLLMMLABackend(FlashInferMLAAttnBackend): else: return super().init_forward_metadata(forward_batch) - def init_mha_chunk_metadata(self, forward_batch: ForwardBatch): - super().init_mha_chunk_metadata(forward_batch, disable_flashinfer_ragged=True) - def pad_draft_extend_query( self, q: torch.Tensor,