From 4740f23e1f6a9dbb160151ad5e6b7e8b2d887b7b Mon Sep 17 00:00:00 2001 From: Liangsheng Yin Date: Mon, 22 Jun 2026 20:48:16 -0700 Subject: [PATCH] Revert "[server_args] compute mem_fraction_static after dp chunked-prefill division" (#28991) --- python/sglang/srt/server_args.py | 5 +---- 1 file changed, 1 insertion(+), 4 deletions(-) diff --git a/python/sglang/srt/server_args.py b/python/sglang/srt/server_args.py index 7ca69f470..92fbcb575 100644 --- a/python/sglang/srt/server_args.py +++ b/python/sglang/srt/server_args.py @@ -3266,12 +3266,9 @@ class ServerArgs: if self.mem_fraction_static is None: # Constant meta data (e.g., from attention backend) reserved_mem = 512 - effective_chunked_prefill_size = self.chunked_prefill_size // ( - self.dp_size if self.enable_dp_attention and self.dp_size > 1 else 1 - ) # For activation during large prefill if self.chunked_prefill_size > 0: - reserved_mem += max(effective_chunked_prefill_size, 2048) * 1.5 + reserved_mem += max(self.chunked_prefill_size, 2048) * 1.5 else: reserved_mem += max(self.max_prefill_tokens, 2048) * 1.5 # For cuda graphs