From ccfa120daecabab4b9b4d7e89ec82f41e071a7e9 Mon Sep 17 00:00:00 2001 From: Hank Han Date: Tue, 8 Sep 2026 16:50:07 +0800 Subject: [PATCH] Fix DSA compression tail capacity for PD decode request slots (#38417) --- python/sglang/srt/mem_cache/kv_cache_configurator.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/python/sglang/srt/mem_cache/kv_cache_configurator.py b/python/sglang/srt/mem_cache/kv_cache_configurator.py index 33b58fe59..fffed010b 100644 --- a/python/sglang/srt/mem_cache/kv_cache_configurator.py +++ b/python/sglang/srt/mem_cache/kv_cache_configurator.py @@ -1246,7 +1246,7 @@ class KVCacheConfigurator: elif self.use_mla_backend and is_dsa_model and not self.mambaish_config: token_to_kv_pool = self._build_dsa_kv_pool( max_total_num_tokens=sizes.max_total_num_tokens, - max_running_requests=sizes.max_running_requests, + max_running_requests=req_to_token_pool.req_to_token.shape[0], ) elif self.use_mla_backend and not self.mambaish_config: assert not is_dsa_model