[NPU] Set DEEPEP_HYBRID_DEPLOYMENT for new DeepEP tests; switch glm5_2 to w8a8; tune nightly timeouts (#38775)

This commit is contained in:
pllimax
2026-09-10 23:32:54 +08:00
committed by GitHub
parent 12771786f2
commit 92dffebe16
7 changed files with 37 additions and 31 deletions
@@ -6,7 +6,7 @@ from sglang.test.ascend.e2e.test_npu_accuracy_utils import (
)
from sglang.test.ascend.e2e.test_npu_multi_node_utils import NIC_NAME
from sglang.test.ascend.e2e.test_npu_performance_utils import (
GLM_5_2_W4A8_MODEL_PATH,
GLM_5_2_W8A8_MODEL_PATH,
)
from sglang.test.ci.ci_register import register_npu_ci
@@ -17,7 +17,7 @@ register_npu_ci(
disabled="accuracy testcase",
)
GLM_5_2_W4A8_16P_TWO_NODE_ENVS = {
GLM_5_2_W8A8_16P_TWO_NODE_ENVS = {
"PYTORCH_NPU_ALLOC_CONF": "expandable_segments:True",
"STREAMS_PER_DEVICE": "32",
"SGLANG_SET_CPU_AFFINITY": "1",
@@ -34,7 +34,7 @@ GLM_5_2_W4A8_16P_TWO_NODE_ENVS = {
"GLOO_SOCKET_IFNAME": NIC_NAME,
}
GLM_5_2_W4A8_16P_TWO_NODE_OTHER_ARGS = [
GLM_5_2_W8A8_16P_TWO_NODE_OTHER_ARGS = [
"--attention-backend",
"ascend",
"--device",
@@ -56,7 +56,7 @@ GLM_5_2_W4A8_16P_TWO_NODE_OTHER_ARGS = [
"--context-length",
135000,
"--served-model-name",
"glm-5.2-w4a8",
"glm-5.2-w8a8",
"--cuda-graph-max-bs-decode",
4,
"--max-running-requests",
@@ -85,18 +85,18 @@ GLM_5_2_W4A8_16P_TWO_NODE_OTHER_ARGS = [
4,
]
GLM_5_2_W4A8_16P_TWO_NODE_MODEL_CONFIG = {
"model_path": GLM_5_2_W4A8_MODEL_PATH,
"other_args": GLM_5_2_W4A8_16P_TWO_NODE_OTHER_ARGS,
"node_envs": GLM_5_2_W4A8_16P_TWO_NODE_ENVS,
GLM_5_2_W8A8_16P_TWO_NODE_MODEL_CONFIG = {
"model_path": GLM_5_2_W8A8_MODEL_PATH,
"other_args": GLM_5_2_W8A8_16P_TWO_NODE_OTHER_ARGS,
"node_envs": GLM_5_2_W8A8_16P_TWO_NODE_ENVS,
}
class TestNPUGLM_5_2_W4A8_16P_GPQA(TestNpuAccuracyMultiNodePdMixTestCaseBase):
"""Test NPU accuracy for GLM-5.2-w4a8 16p two nodes on gpqa_diamond"""
class TestNPUGLM_5_2_W8A8_16P_GPQA(TestNpuAccuracyMultiNodePdMixTestCaseBase):
"""Test NPU accuracy for GLM-5.2-w8a8 16p two nodes on gpqa_diamond"""
benchmark_tool = BENCHMARK_TOOL_DEFAULT
model_config = GLM_5_2_W4A8_16P_TWO_NODE_MODEL_CONFIG
model_config = GLM_5_2_W8A8_16P_TWO_NODE_MODEL_CONFIG
accuracy = 0.912
datasets = ["gpqa_diamond"]
# eval_batch_size = 16
@@ -109,8 +109,8 @@ class TestNPUGLM_5_2_W4A8_16P_GPQA(TestNpuAccuracyMultiNodePdMixTestCaseBase):
"stream": True,
}
def test_npu_glm_5_2_w4a8_16p_gpqa(self):
"""Run NPU accuracy test for GLM-5.2-w4a8 16p two nodes on gpqa_diamond"""
def test_npu_glm_5_2_w8a8_16p_gpqa(self):
"""Run NPU accuracy test for GLM-5.2-w8a8 16p two nodes on gpqa_diamond"""
self.run_accuracy()
@@ -19,6 +19,7 @@ ENVS = {
"SGLANG_ENABLE_OVERLAP_PLAN_STREAM": "1",
"SGLANG_NPU_USE_MULTI_STREAM": "1",
"HCCL_BUFFSIZE": "1000",
"DEEPEP_HYBRID_DEPLOYMENT": "1",
"HCCL_OP_EXPANSION_MODE": "AIV",
"HCCL_SOCKET_IFNAME": "lo",
"GLOO_SOCKET_IFNAME": "lo",
@@ -23,6 +23,7 @@ ENVS = {
"STREAMS_PER_DEVICE": "32",
"DEEP_NORMAL_MODE_USE_INT8_QUANT": "1",
"SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK": "64",
"DEEPEP_HYBRID_DEPLOYMENT": "1",
"DEEPEP_HCCL_BUFFSIZE": "4400",
"SGLANG_ENABLE_OVERLAP_PLAN_STREAM": "1",
"HCCL_SOCKET_IFNAME": NIC_NAME,
@@ -36,6 +36,7 @@ KIMI_K3_W4A8_32P_ENVS = {
"STREAMS_PER_DEVICE": "32",
"DEEP_NORMAL_MODE_USE_INT8_QUANT": "1",
"SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK": "128",
"DEEPEP_HYBRID_DEPLOYMENT": "1",
"HCCL_BUFFSIZE": "2000",
"DEEPEP_NORMAL_LONG_SEQ_ROUND": "64",
"DEEPEP_NORMAL_LONG_SEQ_PER_ROUND_TOKENS": "512",
@@ -58,6 +58,7 @@ class TestMoreRunnerBackendTriton(CustomTestCase):
],
env={
"HCCL_BUFFSIZE": "1024",
"DEEPEP_HYBRID_DEPLOYMENT": "1",
},
)