From 67c295b5f5a97cd5742aaf453a7cba262c8ba127 Mon Sep 17 00:00:00 2001 From: kk <43161300+kkHuang-amd@users.noreply.github.com> Date: Tue, 31 Mar 2026 07:30:16 +0800 Subject: [PATCH] [AMD] fix performance regression issue when run gpt-oss with "--context-length 13824" (#21691) --- python/sglang/srt/layers/attention/aiter_backend.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/python/sglang/srt/layers/attention/aiter_backend.py b/python/sglang/srt/layers/attention/aiter_backend.py index 44427ec81..7833c2494 100755 --- a/python/sglang/srt/layers/attention/aiter_backend.py +++ b/python/sglang/srt/layers/attention/aiter_backend.py @@ -2503,7 +2503,7 @@ class AiterAttnBackend(AttentionBackend): o = torch.empty_like(q, dtype=self.input_dtype) - max_kv_len = page_table.shape[1] + max_kv_len = page_table.shape[1] * self.page_size unified_attention( q=q.view(-1, layer.tp_q_head_num, layer.qk_head_dim),