Fix DSA compression tail capacity for PD decode request slots (#38417)
This commit is contained in:
@@ -1246,7 +1246,7 @@ class KVCacheConfigurator:
|
|||||||
elif self.use_mla_backend and is_dsa_model and not self.mambaish_config:
|
elif self.use_mla_backend and is_dsa_model and not self.mambaish_config:
|
||||||
token_to_kv_pool = self._build_dsa_kv_pool(
|
token_to_kv_pool = self._build_dsa_kv_pool(
|
||||||
max_total_num_tokens=sizes.max_total_num_tokens,
|
max_total_num_tokens=sizes.max_total_num_tokens,
|
||||||
max_running_requests=sizes.max_running_requests,
|
max_running_requests=req_to_token_pool.req_to_token.shape[0],
|
||||||
)
|
)
|
||||||
elif self.use_mla_backend and not self.mambaish_config:
|
elif self.use_mla_backend and not self.mambaish_config:
|
||||||
assert not is_dsa_model
|
assert not is_dsa_model
|
||||||
|
|||||||
Reference in New Issue
Block a user