From 5e791101225ffef29e6a6897471eba281eafc801 Mon Sep 17 00:00:00 2001 From: Ma Mingfei Date: Tue, 1 Sep 2026 14:17:35 +0800 Subject: [PATCH] [Fix][CPU] fix xeon ci failure by test_qwen35_flashinfer_fusion (#37338) --- .../layers/moe/test_qwen35_flashinfer_fusion.py | 14 ++++++++------ 1 file changed, 8 insertions(+), 6 deletions(-) diff --git a/test/registered/unit/layers/moe/test_qwen35_flashinfer_fusion.py b/test/registered/unit/layers/moe/test_qwen35_flashinfer_fusion.py index d0da7ddc1..cdc2baf0c 100644 --- a/test/registered/unit/layers/moe/test_qwen35_flashinfer_fusion.py +++ b/test/registered/unit/layers/moe/test_qwen35_flashinfer_fusion.py @@ -1,5 +1,6 @@ from dataclasses import dataclass from types import SimpleNamespace +from unittest.mock import patch import pytest import torch @@ -17,7 +18,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.srt.models.qwen3_5_text import Qwen3_5ForCausalLM from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=20, suite="base-c-test-cpu") +register_cpu_ci(est_time=20, suite="base-a-test-cpu") @dataclass(frozen=True) @@ -59,15 +60,16 @@ def test_supported_forward_modes(forward_mode, expected): assert is_supported_forward_mode(forward_mode) is expected -def test_framework_capacity_is_maximum_of_all_sources(): +@patch( + "sglang.srt.layers.moe.qwen35_flashinfer_fusion.cutedsl_moe_max_num_tokens", + return_value=8192, +) +def test_framework_capacity_is_maximum_of_all_sources(_cutedsl_moe_max_num_tokens): graph = SimpleNamespace( decode=SimpleNamespace(max_bs=512, bs=[1, 64, 256]), prefill=SimpleNamespace(max_bs=4096, bs=[1024, 2048, 4096]), ) - server_args = SimpleNamespace( - cuda_graph_config=graph, - cutedsl_moe_max_num_tokens=lambda: 8192, - ) + server_args = SimpleNamespace(cuda_graph_config=graph) runner = SimpleNamespace(server_args=server_args, max_running_requests=2048) assert resolve_max_m(runner) == 8192