[DCP] Auto-disable tc_piecewise and breakable prefill CUDA graphs under DCP (#31532)

Co-authored-by: Cursor <cursoragent@cursor.com>
This commit is contained in:
Khoa Pham
2026-07-16 22:17:50 -07:00
committed by GitHub
co-authored by Cursor
parent d310fce85f
commit 96dd96c02b
+10
View File
@@ -3651,6 +3651,11 @@ class ServerArgs:
"DSA prefill context parallelism",
lambda: self.enable_dsa_prefill_context_parallel,
),
# Capture builds a dummy extend forward with attn_dcp_metadata=None.
(
"decode context parallel (dcp_size > 1)",
lambda: self.dcp_size > 1,
),
]
for _name, predicate in rules:
if predicate():
@@ -3679,6 +3684,11 @@ class ServerArgs:
"context parallel (attn_cp_size > 1)",
lambda: self._resolved().attn_cp_size > 1,
),
# Capture builds a dummy extend forward with attn_dcp_metadata=None.
(
"decode context parallel (dcp_size > 1)",
lambda: self.dcp_size > 1,
),
# BCG capture + LoRA adapter weights exceed host RAM headroom.
("LoRA", lambda: bool(self.lora_paths) or bool(self.enable_lora)),
# BCG bucket sizes exceed FlashInfer MoE A2A's dispatch cap.