From 96dd96c02baa65119658f611cb52d4c16a59edd2 Mon Sep 17 00:00:00 2001 From: Khoa Pham Date: Thu, 16 Jul 2026 22:17:50 -0700 Subject: [PATCH] [DCP] Auto-disable tc_piecewise and breakable prefill CUDA graphs under DCP (#31532) Co-authored-by: Cursor --- python/sglang/srt/server_args.py | 10 ++++++++++ 1 file changed, 10 insertions(+) diff --git a/python/sglang/srt/server_args.py b/python/sglang/srt/server_args.py index 15272cc28..5a0d03464 100644 --- a/python/sglang/srt/server_args.py +++ b/python/sglang/srt/server_args.py @@ -3651,6 +3651,11 @@ class ServerArgs: "DSA prefill context parallelism", lambda: self.enable_dsa_prefill_context_parallel, ), + # Capture builds a dummy extend forward with attn_dcp_metadata=None. + ( + "decode context parallel (dcp_size > 1)", + lambda: self.dcp_size > 1, + ), ] for _name, predicate in rules: if predicate(): @@ -3679,6 +3684,11 @@ class ServerArgs: "context parallel (attn_cp_size > 1)", lambda: self._resolved().attn_cp_size > 1, ), + # Capture builds a dummy extend forward with attn_dcp_metadata=None. + ( + "decode context parallel (dcp_size > 1)", + lambda: self.dcp_size > 1, + ), # BCG capture + LoRA adapter weights exceed host RAM headroom. ("LoRA", lambda: bool(self.lora_paths) or bool(self.enable_lora)), # BCG bucket sizes exceed FlashInfer MoE A2A's dispatch cap.