From 2b1c4e4c854ae41916f7df22b49931c83b97d984 Mon Sep 17 00:00:00 2001 From: pllimax Date: Thu, 10 Sep 2026 00:08:07 +0800 Subject: [PATCH] [NPU] Set DEEPEP_HYBRID_DEPLOYMENT=1 for collocated DeepEP test cases (#38667) --- .../test_npu_deepseek_v4_flash_w8a8_8p_gpqa.py | 1 + .../npu/accuracy/glm5_2/test_npu_glm_5_2_w4a8_16p_gpqa.py | 1 + .../test_npu_deepep_auto_deepseek_v3_2_w8a8.py | 1 + .../expert_parallelism/test_npu_deepep_auto_qwen3_480b.py | 1 + .../expert_parallelism/test_npu_deepep_auto_qwen3_next.py | 1 + .../test_npu_deepep_low_latency_deepseek_v3_2_w8a8.py | 1 + .../test_npu_deepep_low_latency_qwen3_480b.py | 1 + .../test_npu_deepep_low_latency_qwen3_next.py | 1 + .../test_npu_eplb_min_rebalancing_utilization_threshold.py | 2 ++ .../test_npu_expert_distribution_recorder_mode.py | 1 + .../expert_parallelism/test_npu_moe_dense_tp_size.py | 1 + .../test_npu_deepseek_v4_flash_w8a8_8p_in32k_out1k_50ms.py | 1 + .../test_npu_deepseek_v4_flash_w8a8_8p_in8k_out1k_50ms.py | 1 + .../test_npu_qwen3_5_397b_w4a8_8p_in3k5_out1k5_50ms.py | 1 + 14 files changed, 15 insertions(+) diff --git a/test/registered/npu/accuracy/deepseek_v4_flash/test_npu_deepseek_v4_flash_w8a8_8p_gpqa.py b/test/registered/npu/accuracy/deepseek_v4_flash/test_npu_deepseek_v4_flash_w8a8_8p_gpqa.py index 1389d7db4..d1c8e5317 100644 --- a/test/registered/npu/accuracy/deepseek_v4_flash/test_npu_deepseek_v4_flash_w8a8_8p_gpqa.py +++ b/test/registered/npu/accuracy/deepseek_v4_flash/test_npu_deepseek_v4_flash_w8a8_8p_gpqa.py @@ -41,6 +41,7 @@ DEEPSEEK_V4_FLASH_W8A8_DSPARK_8P_ENVS = { "DEEP_NORMAL_MODE_USE_INT8_QUANT": "1", "DEEPEP_HCCL_BUFFSIZE": "2048", "SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK": "64", + "DEEPEP_HYBRID_DEPLOYMENT": "1", # war barrier "SGLANG_ENABLE_WAR_BARRIER": "1", "SGLANG_FORCE_COARSE_WAR_BARRIER": "1", diff --git a/test/registered/npu/accuracy/glm5_2/test_npu_glm_5_2_w4a8_16p_gpqa.py b/test/registered/npu/accuracy/glm5_2/test_npu_glm_5_2_w4a8_16p_gpqa.py index 2cc5a452a..3bcf57e19 100644 --- a/test/registered/npu/accuracy/glm5_2/test_npu_glm_5_2_w4a8_16p_gpqa.py +++ b/test/registered/npu/accuracy/glm5_2/test_npu_glm_5_2_w4a8_16p_gpqa.py @@ -28,6 +28,7 @@ GLM_5_2_W4A8_16P_TWO_NODE_ENVS = { "DEEPEP_NORMAL_LONG_SEQ_PER_ROUND_TOKENS": "1024", "DEEPEP_NORMAL_LONG_SEQ_ROUND": "72", "SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK": "32", + "DEEPEP_HYBRID_DEPLOYMENT": "1", "DEEP_NORMAL_MODE_USE_INT8_QUANT": "1", "HCCL_SOCKET_IFNAME": NIC_NAME, "GLOO_SOCKET_IFNAME": NIC_NAME, diff --git a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_auto_deepseek_v3_2_w8a8.py b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_auto_deepseek_v3_2_w8a8.py index 2952a766c..0e217e062 100644 --- a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_auto_deepseek_v3_2_w8a8.py +++ b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_auto_deepseek_v3_2_w8a8.py @@ -50,6 +50,7 @@ class TestDeepEpDeepseekV32(GSM8KAscendMixin, TestMMLU, CustomTestCase): "PYTORCH_NPU_ALLOC_CONF": "expandable_segments:True", "STREAMS_PER_DEVICE": "32", "SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK": "16", + "DEEPEP_HYBRID_DEPLOYMENT": "1", "HCCL_BUFFSIZE": "1600", "HCCL_OP_EXPANSION_MODE": "AIV", "SGLANG_NPU_USE_MLAPO": "0", diff --git a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_auto_qwen3_480b.py b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_auto_qwen3_480b.py index 840271f16..3f45e0a9c 100644 --- a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_auto_qwen3_480b.py +++ b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_auto_qwen3_480b.py @@ -65,6 +65,7 @@ class TestDeepEpQwen(GSM8KAscendMixin, TestMMLU, CustomTestCase): env = { "PYTORCH_NPU_ALLOC_CONF": "expandable_segments:True", "SGLANG_DISAGGREGATION_BOOTSTRAP_TIMEOUT": "600", + "DEEPEP_HYBRID_DEPLOYMENT": "1", "HCCL_BUFFSIZE": "2100", "HCCL_OP_EXPANSION_MODE": "AIV", "TRANSFORMERS_VERBOSITY": "error", diff --git a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_auto_qwen3_next.py b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_auto_qwen3_next.py index f7470caa1..a2a50e1e0 100644 --- a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_auto_qwen3_next.py +++ b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_auto_qwen3_next.py @@ -66,6 +66,7 @@ class TestQwen3Next(GSM8KAscendMixin, TestMMLU, CustomTestCase): "HCCL_OP_EXPANSION_MODE": "AIV", "HCCL_ALGO": "level0:NA;level1:ring", "SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK": "20", + "DEEPEP_HYBRID_DEPLOYMENT": "1", "HCCL_BUFFSIZE": "2000", "GDN_ATTN_BACKEND_TRITON": "1", **os.environ, diff --git a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_low_latency_deepseek_v3_2_w8a8.py b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_low_latency_deepseek_v3_2_w8a8.py index 6d5607ab2..12197a33a 100644 --- a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_low_latency_deepseek_v3_2_w8a8.py +++ b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_low_latency_deepseek_v3_2_w8a8.py @@ -48,6 +48,7 @@ class TestDeepEpDeepseekV32(GSM8KAscendMixin, TestMMLU, CustomTestCase): "PYTORCH_NPU_ALLOC_CONF": "expandable_segments:True", "STREAMS_PER_DEVICE": "32", "SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK": "128", + "DEEPEP_HYBRID_DEPLOYMENT": "1", "HCCL_BUFFSIZE": "2048", "HCCL_OP_EXPANSION_MODE": "AIV", "TASK_QUEUE_ENABLE": "0", diff --git a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_low_latency_qwen3_480b.py b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_low_latency_qwen3_480b.py index ed82f9d00..8663a582d 100644 --- a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_low_latency_qwen3_480b.py +++ b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_low_latency_qwen3_480b.py @@ -66,6 +66,7 @@ class TestDeepEpQwen(GSM8KAscendMixin, TestMMLU, CustomTestCase): env = { "PYTORCH_NPU_ALLOC_CONF": "expandable_segments:True", "SGLANG_DISAGGREGATION_BOOTSTRAP_TIMEOUT": "600", + "DEEPEP_HYBRID_DEPLOYMENT": "1", "HCCL_BUFFSIZE": "2100", "HCCL_OP_EXPANSION_MODE": "AIV", "TRANSFORMERS_VERBOSITY": "error", diff --git a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_low_latency_qwen3_next.py b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_low_latency_qwen3_next.py index cc4204e97..5bf697b80 100644 --- a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_low_latency_qwen3_next.py +++ b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_deepep_low_latency_qwen3_next.py @@ -70,6 +70,7 @@ class TestQwen3Next(GSM8KAscendMixin, TestMMLU, CustomTestCase): "HCCL_OP_EXPANSION_MODE": "AIV", "HCCL_ALGO": "level0:NA;level1:ring", "SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK": "160", + "DEEPEP_HYBRID_DEPLOYMENT": "1", "HCCL_BUFFSIZE": "2048", "GDN_ATTN_BACKEND_TRITON": "1", **os.environ, diff --git a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_eplb_min_rebalancing_utilization_threshold.py b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_eplb_min_rebalancing_utilization_threshold.py index efad306bc..2be69ee45 100644 --- a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_eplb_min_rebalancing_utilization_threshold.py +++ b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_eplb_min_rebalancing_utilization_threshold.py @@ -80,6 +80,7 @@ class TestEplbMinRebalancingUtilizationThresholdBase(CustomTestCase): "SGLANG_EXPERT_LOCATION_UPDATER_CANARY": "1", "HCCL_BUFFSIZE": "1024", "SGLANG_DEEPEP_BF16_DISPATCH": "1", + "DEEPEP_HYBRID_DEPLOYMENT": "1", "TRANSFORMERS_VERBOSITY": "error", "DEEP_NORMAL_MODE_USE_INT8_QUANT": "1", **os.environ, @@ -155,6 +156,7 @@ class TestEplbMinRebalancingUtilizationThreshold095( "SGLANG_EXPERT_LOCATION_UPDATER_CANARY": "1", "HCCL_BUFFSIZE": "1024", "SGLANG_NPU_DISABLE_ACL_FORMAT_WEIGHT": "1", + "DEEPEP_HYBRID_DEPLOYMENT": "1", "TRANSFORMERS_VERBOSITY": "error", "DEEP_NORMAL_MODE_USE_INT8_QUANT": "1", **os.environ, diff --git a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_expert_distribution_recorder_mode.py b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_expert_distribution_recorder_mode.py index 8d96cc9b4..3a9f3776d 100644 --- a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_expert_distribution_recorder_mode.py +++ b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_expert_distribution_recorder_mode.py @@ -61,6 +61,7 @@ class TestExpertDistributionRecorderModeStatic(CustomTestCase): env={ "SGLANG_NPU_DISABLE_ACL_FORMAT_WEIGHT": "1", "HCCL_BUFFSIZE": "1024", + "DEEPEP_HYBRID_DEPLOYMENT": "1", "SGLANG_EXPERT_DISTRIBUTION_RECORDER_DIR": f"{cls.path}", "TRANSFORMERS_VERBOSITY": "error", }, diff --git a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_moe_dense_tp_size.py b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_moe_dense_tp_size.py index cdc39ff86..0f16aff9f 100644 --- a/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_moe_dense_tp_size.py +++ b/test/registered/npu/basic_function/parallel_strategy/expert_parallelism/test_npu_moe_dense_tp_size.py @@ -54,6 +54,7 @@ class TestAscendMoeDenseTPSize(CustomTestCase): ], env={ "HCCL_BUFFSIZE": "1024", + "DEEPEP_HYBRID_DEPLOYMENT": "1", }, ) diff --git a/test/registered/npu/performance/deepseek_v4_flash/test_npu_deepseek_v4_flash_w8a8_8p_in32k_out1k_50ms.py b/test/registered/npu/performance/deepseek_v4_flash/test_npu_deepseek_v4_flash_w8a8_8p_in32k_out1k_50ms.py index 1e5f71d91..ddcc68d59 100644 --- a/test/registered/npu/performance/deepseek_v4_flash/test_npu_deepseek_v4_flash_w8a8_8p_in32k_out1k_50ms.py +++ b/test/registered/npu/performance/deepseek_v4_flash/test_npu_deepseek_v4_flash_w8a8_8p_in32k_out1k_50ms.py @@ -25,6 +25,7 @@ DEEPSEEK_V4_FLASH_W8A8_8P_ENVS = { "DEEP_NORMAL_MODE_USE_INT8_QUANT": "1", "DEEPEP_HCCL_BUFFSIZE": "2048", "SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK": "35", + "DEEPEP_HYBRID_DEPLOYMENT": "1", # war barrier "SGLANG_ENABLE_WAR_BARRIER": "1", "SGLANG_FORCE_COARSE_WAR_BARRIER": "1", diff --git a/test/registered/npu/performance/deepseek_v4_flash/test_npu_deepseek_v4_flash_w8a8_8p_in8k_out1k_50ms.py b/test/registered/npu/performance/deepseek_v4_flash/test_npu_deepseek_v4_flash_w8a8_8p_in8k_out1k_50ms.py index 5fc3efb96..93486464b 100644 --- a/test/registered/npu/performance/deepseek_v4_flash/test_npu_deepseek_v4_flash_w8a8_8p_in8k_out1k_50ms.py +++ b/test/registered/npu/performance/deepseek_v4_flash/test_npu_deepseek_v4_flash_w8a8_8p_in8k_out1k_50ms.py @@ -24,6 +24,7 @@ DEEPSEEK_V4_FLASH_W8A8_8P_ENVS = { "DEEP_NORMAL_MODE_USE_INT8_QUANT": "1", "DEEPEP_HCCL_BUFFSIZE": "2048", "SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK": "35", + "DEEPEP_HYBRID_DEPLOYMENT": "1", # war barrier "SGLANG_ENABLE_WAR_BARRIER": "1", "SGLANG_FORCE_COARSE_WAR_BARRIER": "1", diff --git a/test/registered/npu/performance/qwen3_5_397b/test_npu_qwen3_5_397b_w4a8_8p_in3k5_out1k5_50ms.py b/test/registered/npu/performance/qwen3_5_397b/test_npu_qwen3_5_397b_w4a8_8p_in3k5_out1k5_50ms.py index e4f1d74e6..3ee4945e4 100644 --- a/test/registered/npu/performance/qwen3_5_397b/test_npu_qwen3_5_397b_w4a8_8p_in3k5_out1k5_50ms.py +++ b/test/registered/npu/performance/qwen3_5_397b/test_npu_qwen3_5_397b_w4a8_8p_in3k5_out1k5_50ms.py @@ -17,6 +17,7 @@ QWEN3_5_397B_A17B_ENVS = { "STREAMS_PER_DEVICE": "32", "ASCEND_USE_FIA": "1", "SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK": "128", + "DEEPEP_HYBRID_DEPLOYMENT": "1", "HCCL_BUFFSIZE": "0", "DEEPEP_NORMAL_LONG_SEQ_ROUND": "6", "DEEP_NORMAL_MODE_USE_INT8_QUANT": "1",