[gRPC] Fix scheduler startup broken by context parallel refactor (#18933)
Co-authored-by: Chang Su <chang.s.su@oracle.com>
This commit is contained in:
@@ -112,8 +112,26 @@ def launch_scheduler_process_only(
|
|||||||
+ (tp_rank % tp_size_per_node) * server_args.gpu_id_step
|
+ (tp_rank % tp_size_per_node) * server_args.gpu_id_step
|
||||||
)
|
)
|
||||||
|
|
||||||
# Calculate MoE expert parallel rank
|
# Calculate parallelism ranks (matching engine.py logic)
|
||||||
moe_ep_rank = tp_rank // (server_args.tp_size // server_args.ep_size)
|
attn_dp_size = (
|
||||||
|
server_args.dp_size if server_args.enable_dp_attention else 1
|
||||||
|
)
|
||||||
|
attn_tp_size = (
|
||||||
|
server_args.tp_size // attn_dp_size // server_args.attn_cp_size
|
||||||
|
)
|
||||||
|
attn_cp_rank = (tp_rank // attn_tp_size) % server_args.attn_cp_size
|
||||||
|
moe_dp_rank = tp_rank // (
|
||||||
|
server_args.tp_size // server_args.moe_dp_size
|
||||||
|
)
|
||||||
|
moe_ep_rank = (
|
||||||
|
tp_rank
|
||||||
|
% (server_args.tp_size // server_args.moe_dp_size)
|
||||||
|
// (
|
||||||
|
server_args.tp_size
|
||||||
|
// server_args.moe_dp_size
|
||||||
|
// server_args.ep_size
|
||||||
|
)
|
||||||
|
)
|
||||||
|
|
||||||
# Create scheduler process
|
# Create scheduler process
|
||||||
proc = mp.Process(
|
proc = mp.Process(
|
||||||
@@ -123,6 +141,8 @@ def launch_scheduler_process_only(
|
|||||||
port_args,
|
port_args,
|
||||||
gpu_id,
|
gpu_id,
|
||||||
tp_rank,
|
tp_rank,
|
||||||
|
attn_cp_rank,
|
||||||
|
moe_dp_rank,
|
||||||
moe_ep_rank,
|
moe_ep_rank,
|
||||||
pp_rank,
|
pp_rank,
|
||||||
None, # dp_rank
|
None, # dp_rank
|
||||||
|
|||||||
Reference in New Issue
Block a user