[DCP] Auto-disable tc_piecewise and breakable prefill CUDA graphs under DCP (#31532)
Co-authored-by: Cursor <cursoragent@cursor.com>
This commit is contained in:
@@ -3651,6 +3651,11 @@ class ServerArgs:
|
|||||||
"DSA prefill context parallelism",
|
"DSA prefill context parallelism",
|
||||||
lambda: self.enable_dsa_prefill_context_parallel,
|
lambda: self.enable_dsa_prefill_context_parallel,
|
||||||
),
|
),
|
||||||
|
# Capture builds a dummy extend forward with attn_dcp_metadata=None.
|
||||||
|
(
|
||||||
|
"decode context parallel (dcp_size > 1)",
|
||||||
|
lambda: self.dcp_size > 1,
|
||||||
|
),
|
||||||
]
|
]
|
||||||
for _name, predicate in rules:
|
for _name, predicate in rules:
|
||||||
if predicate():
|
if predicate():
|
||||||
@@ -3679,6 +3684,11 @@ class ServerArgs:
|
|||||||
"context parallel (attn_cp_size > 1)",
|
"context parallel (attn_cp_size > 1)",
|
||||||
lambda: self._resolved().attn_cp_size > 1,
|
lambda: self._resolved().attn_cp_size > 1,
|
||||||
),
|
),
|
||||||
|
# Capture builds a dummy extend forward with attn_dcp_metadata=None.
|
||||||
|
(
|
||||||
|
"decode context parallel (dcp_size > 1)",
|
||||||
|
lambda: self.dcp_size > 1,
|
||||||
|
),
|
||||||
# BCG capture + LoRA adapter weights exceed host RAM headroom.
|
# BCG capture + LoRA adapter weights exceed host RAM headroom.
|
||||||
("LoRA", lambda: bool(self.lora_paths) or bool(self.enable_lora)),
|
("LoRA", lambda: bool(self.lora_paths) or bool(self.enable_lora)),
|
||||||
# BCG bucket sizes exceed FlashInfer MoE A2A's dispatch cap.
|
# BCG bucket sizes exceed FlashInfer MoE A2A's dispatch cap.
|
||||||
|
|||||||
Reference in New Issue
Block a user