From a5a64a311a39b153d1e4d3d6bcb67e77cdc9aeae Mon Sep 17 00:00:00 2001 From: Hanming Lu <69857889+hanming-lu@users.noreply.github.com> Date: Sat, 23 May 2026 03:25:57 -0700 Subject: [PATCH] [Spec] trtllm mha supports overlap plan stream (#25925) --- python/sglang/srt/layers/attention/trtllm_mha_backend.py | 5 +++++ 1 file changed, 5 insertions(+) diff --git a/python/sglang/srt/layers/attention/trtllm_mha_backend.py b/python/sglang/srt/layers/attention/trtllm_mha_backend.py index e68bcb95e..b74a11846 100644 --- a/python/sglang/srt/layers/attention/trtllm_mha_backend.py +++ b/python/sglang/srt/layers/attention/trtllm_mha_backend.py @@ -537,6 +537,11 @@ class TRTLLMHAAttnBackend(FlashInferAttnBackend): self._copy_swa_page_table(metadata, page_indices, max_seq_pages) self.forward_metadata = metadata + def update_verify_buffers_to_fill_after_draft( + self, spec_info: SpecInput, cuda_graph_bs: Optional[int] + ): + pass + def get_cuda_graph_seq_len_fill_value(self) -> int: """Get the fill value for sequence lengths in CUDA graph.""" return 1