[Fix][CPU] fix xeon ci failure by test_qwen35_flashinfer_fusion (#37338)

This commit is contained in:
Ma Mingfei
2026-09-01 14:17:35 +08:00
committed by GitHub
parent 60548501bb
commit 5e79110122
@@ -1,5 +1,6 @@
from dataclasses import dataclass from dataclasses import dataclass
from types import SimpleNamespace from types import SimpleNamespace
from unittest.mock import patch
import pytest import pytest
import torch import torch
@@ -17,7 +18,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode
from sglang.srt.models.qwen3_5_text import Qwen3_5ForCausalLM from sglang.srt.models.qwen3_5_text import Qwen3_5ForCausalLM
from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=20, suite="base-c-test-cpu") register_cpu_ci(est_time=20, suite="base-a-test-cpu")
@dataclass(frozen=True) @dataclass(frozen=True)
@@ -59,15 +60,16 @@ def test_supported_forward_modes(forward_mode, expected):
assert is_supported_forward_mode(forward_mode) is expected assert is_supported_forward_mode(forward_mode) is expected
def test_framework_capacity_is_maximum_of_all_sources(): @patch(
"sglang.srt.layers.moe.qwen35_flashinfer_fusion.cutedsl_moe_max_num_tokens",
return_value=8192,
)
def test_framework_capacity_is_maximum_of_all_sources(_cutedsl_moe_max_num_tokens):
graph = SimpleNamespace( graph = SimpleNamespace(
decode=SimpleNamespace(max_bs=512, bs=[1, 64, 256]), decode=SimpleNamespace(max_bs=512, bs=[1, 64, 256]),
prefill=SimpleNamespace(max_bs=4096, bs=[1024, 2048, 4096]), prefill=SimpleNamespace(max_bs=4096, bs=[1024, 2048, 4096]),
) )
server_args = SimpleNamespace( server_args = SimpleNamespace(cuda_graph_config=graph)
cuda_graph_config=graph,
cutedsl_moe_max_num_tokens=lambda: 8192,
)
runner = SimpleNamespace(server_args=server_args, max_running_requests=2048) runner = SimpleNamespace(server_args=server_args, max_running_requests=2048)
assert resolve_max_m(runner) == 8192 assert resolve_max_m(runner) == 8192