Fix DSA compression tail capacity for PD decode request slots (#38417)

This commit is contained in:
Hank Han
2026-09-08 01:50:07 -07:00
committed by GitHub
parent 5ae4ccb0fd
commit ccfa120dae
@@ -1246,7 +1246,7 @@ class KVCacheConfigurator:
elif self.use_mla_backend and is_dsa_model and not self.mambaish_config:
token_to_kv_pool = self._build_dsa_kv_pool(
max_total_num_tokens=sizes.max_total_num_tokens,
max_running_requests=sizes.max_running_requests,
max_running_requests=req_to_token_pool.req_to_token.shape[0],
)
elif self.use_mla_backend and not self.mambaish_config:
assert not is_dsa_model