From de3ec2c437696767dfb4924e17da6c910e0c497a Mon Sep 17 00:00:00 2001 From: Xinyuan Tong <115166877+JustinTong0323@users.noreply.github.com> Date: Tue, 23 Jun 2026 01:59:05 +0100 Subject: [PATCH] [server_args] compute mem_fraction_static after dp chunked-prefill division (#28884) --- python/sglang/srt/server_args.py | 5 ++++- 1 file changed, 4 insertions(+), 1 deletion(-) diff --git a/python/sglang/srt/server_args.py b/python/sglang/srt/server_args.py index 92fbcb575..7ca69f470 100644 --- a/python/sglang/srt/server_args.py +++ b/python/sglang/srt/server_args.py @@ -3266,9 +3266,12 @@ class ServerArgs: if self.mem_fraction_static is None: # Constant meta data (e.g., from attention backend) reserved_mem = 512 + effective_chunked_prefill_size = self.chunked_prefill_size // ( + self.dp_size if self.enable_dp_attention and self.dp_size > 1 else 1 + ) # For activation during large prefill if self.chunked_prefill_size > 0: - reserved_mem += max(self.chunked_prefill_size, 2048) * 1.5 + reserved_mem += max(effective_chunked_prefill_size, 2048) * 1.5 else: reserved_mem += max(self.max_prefill_tokens, 2048) * 1.5 # For cuda graphs