diff --git a/python/sglang/srt/layers/attention/trtllm_mha_backend.py b/python/sglang/srt/layers/attention/trtllm_mha_backend.py index 17f565ef1..93a028d20 100644 --- a/python/sglang/srt/layers/attention/trtllm_mha_backend.py +++ b/python/sglang/srt/layers/attention/trtllm_mha_backend.py @@ -484,6 +484,7 @@ class TRTLLMHAAttnBackend(FlashInferAttnBackend): ] metadata.page_table[:, :max_seq_pages].copy_(page_indices // self.page_size) self._copy_swa_page_table(metadata, page_indices, max_seq_pages) + metadata.max_seq_len_q = self.speculative_num_draft_tokens elif forward_mode.is_draft_extend(include_v2=True): metadata = self.draft_extend_metadata[bs] metadata.cache_seqlens_int32.copy_(seq_lens)