[DCP] Auto-disable tc_piecewise and breakable prefill CUDA graphs under DCP (#31532)
Co-authored-by: Cursor <cursoragent@cursor.com>
This commit is contained in:
@@ -3651,6 +3651,11 @@ class ServerArgs:
|
||||
"DSA prefill context parallelism",
|
||||
lambda: self.enable_dsa_prefill_context_parallel,
|
||||
),
|
||||
# Capture builds a dummy extend forward with attn_dcp_metadata=None.
|
||||
(
|
||||
"decode context parallel (dcp_size > 1)",
|
||||
lambda: self.dcp_size > 1,
|
||||
),
|
||||
]
|
||||
for _name, predicate in rules:
|
||||
if predicate():
|
||||
@@ -3679,6 +3684,11 @@ class ServerArgs:
|
||||
"context parallel (attn_cp_size > 1)",
|
||||
lambda: self._resolved().attn_cp_size > 1,
|
||||
),
|
||||
# Capture builds a dummy extend forward with attn_dcp_metadata=None.
|
||||
(
|
||||
"decode context parallel (dcp_size > 1)",
|
||||
lambda: self.dcp_size > 1,
|
||||
),
|
||||
# BCG capture + LoRA adapter weights exceed host RAM headroom.
|
||||
("LoRA", lambda: bool(self.lora_paths) or bool(self.enable_lora)),
|
||||
# BCG bucket sizes exceed FlashInfer MoE A2A's dispatch cap.
|
||||
|
||||
Reference in New Issue
Block a user