diff --git a/python/sglang/srt/distributed/parallel_state.py b/python/sglang/srt/distributed/parallel_state.py index b131a48e6..75dfdd0ce 100644 --- a/python/sglang/srt/distributed/parallel_state.py +++ b/python/sglang/srt/distributed/parallel_state.py @@ -2372,12 +2372,16 @@ def initialize_model_parallel( Let's say we use 2 GPUs for attention context parallelism (attn_cp_size=2) and 4 GPUs for attention tensor parallelism (attn_tp_size=4). As for MoE part, we use 2 GPUs for moe data - parallelism (moe_dp_size=2) and 4 GPUs for moe expert parallelism (moe_ep_size=4). The present + parallelism (moe_dp_size=2) and 4 GPUs for moe expert parallelism (moe_ep_size=4). Note that + this implies tensor_model_parallel_size=8 (attn_tp_size = tp_size // attn_cp_size // + attn_dp_size), so all 8 GPUs form a single tensor model-parallel group. The present function will create the following groups: - 2 tensor model-parallel groups: - [g0, g1, g2, g3], [g4, g5, g6, g7] + 1 tensor model-parallel group: + [g0, g1, g2, g3, g4, g5, g6, g7] 4 attention context-parallel groups: [g0, g4], [g1, g5], [g2, g6], [g3, g7] + 2 attention tensor-parallel groups: + [g0, g1, g2, g3], [g4, g5, g6, g7] 2 moe expert-parallel groups: [g0, g1, g2, g3], [g4, g5, g6, g7] 4 moe data-parallel groups: