Revert "[server_args] compute mem_fraction_static after dp chunked-prefill division" (#28991)
This commit is contained in:
@@ -3266,12 +3266,9 @@ class ServerArgs:
|
|||||||
if self.mem_fraction_static is None:
|
if self.mem_fraction_static is None:
|
||||||
# Constant meta data (e.g., from attention backend)
|
# Constant meta data (e.g., from attention backend)
|
||||||
reserved_mem = 512
|
reserved_mem = 512
|
||||||
effective_chunked_prefill_size = self.chunked_prefill_size // (
|
|
||||||
self.dp_size if self.enable_dp_attention and self.dp_size > 1 else 1
|
|
||||||
)
|
|
||||||
# For activation during large prefill
|
# For activation during large prefill
|
||||||
if self.chunked_prefill_size > 0:
|
if self.chunked_prefill_size > 0:
|
||||||
reserved_mem += max(effective_chunked_prefill_size, 2048) * 1.5
|
reserved_mem += max(self.chunked_prefill_size, 2048) * 1.5
|
||||||
else:
|
else:
|
||||||
reserved_mem += max(self.max_prefill_tokens, 2048) * 1.5
|
reserved_mem += max(self.max_prefill_tokens, 2048) * 1.5
|
||||||
# For cuda graphs
|
# For cuda graphs
|
||||||
|
|||||||
Reference in New Issue
Block a user