From 5dd2c243eb52dfd04f27b998e2595fe0c66437b1 Mon Sep 17 00:00:00 2001 From: Kangyan-Zhou Date: Sun, 5 Apr 2026 09:41:14 -0700 Subject: [PATCH] fix: TRT-LLM MHA CUDA illegal address with EAGLE v2 + DP attention (#21649) Co-authored-by: Claude Opus 4.6 (1M context) Co-authored-by: Baizhou Zhang --- python/sglang/srt/layers/attention/trtllm_mha_backend.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/python/sglang/srt/layers/attention/trtllm_mha_backend.py b/python/sglang/srt/layers/attention/trtllm_mha_backend.py index 205b5fadf..722c598b6 100644 --- a/python/sglang/srt/layers/attention/trtllm_mha_backend.py +++ b/python/sglang/srt/layers/attention/trtllm_mha_backend.py @@ -871,7 +871,7 @@ class TRTLLMHAAttnBackend(FlashInferAttnBackend): max_kv_len=self.max_context_len, bmm1_scale=bmm1_scale, bmm2_scale=bmm2_scale, - batch_size=forward_batch.batch_size, + batch_size=self.forward_metadata.cu_seqlens_q.shape[0] - 1, cum_seq_lens_q=self.forward_metadata.cu_seqlens_q, cum_seq_lens_kv=self.forward_metadata.cu_seqlens_k, window_left=layer.sliding_window_size,