[CPU][CI]: rename Xeon CPU CI suites to stage-*-intel (#37395)

Co-authored-by: Ma Mingfei <mingfei.ma@intel.com>
This commit is contained in:
jundu
2026-09-04 10:08:41 +08:00
committed by GitHub
co-authored by Ma Mingfei
parent c1b4d535d7
commit 8770c1db1f
109 changed files with 115 additions and 115 deletions
+4 -4
View File
@@ -90,7 +90,7 @@ jobs:
# full machine, no partitioning. 4 files: 3 TP + autoround.
- runner: xeon-gnr
role: gnr
suite: "base-b-tp-test-cpu"
suite: "stage-a-tp-test-cpu-intel"
name: gnr
# Three SPR boxes each run ONE full-machine container taking one
@@ -102,19 +102,19 @@ jobs:
# per box keeps each server within the box's memory budget.
- runner: xeon-spr
role: spr
suite: "base-b-test-cpu,base-c-test-cpu"
suite: "stage-a-test-cpu-intel,stage-b-test-cpu-intel"
name: spr1
part_id: 0
part_size: 3
- runner: xeon-spr
role: spr
suite: "base-b-test-cpu,base-c-test-cpu"
suite: "stage-a-test-cpu-intel,stage-b-test-cpu-intel"
name: spr2
part_id: 1
part_size: 3
- runner: xeon-spr
role: spr
suite: "base-b-test-cpu,base-c-test-cpu"
suite: "stage-a-test-cpu-intel,stage-b-test-cpu-intel"
name: spr3
part_id: 2
part_size: 3
@@ -61,7 +61,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=30, suite="base-a-test-cpu")
register_cpu_ci(est_time=46, suite="base-c-test-cpu")
register_cpu_ci(est_time=46, suite="stage-b-test-cpu-intel")
_BENCH_SERVING_CLI_CASES = {
+1 -1
View File
@@ -24,7 +24,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cpu_ci(est_time=183, suite="base-b-tp-test-cpu")
register_cpu_ci(est_time=183, suite="stage-a-tp-test-cpu-intel")
class TestAutoRoundCPUConfig(CustomTestCase):
+1 -1
View File
@@ -8,7 +8,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.cpu_test_utils import GeluAndMul, SiluAndMul, precision
register_cpu_ci(est_time=9, suite="base-b-test-cpu")
register_cpu_ci(est_time=9, suite="stage-a-test-cpu-intel")
register_cpu_ci(est_time=10, suite="base-b-test-cpu-arm64")
torch.manual_seed(1234)
+1 -1
View File
@@ -11,7 +11,7 @@ from sglang.srt.utils.numa_utils import init_threads_binding
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=6, suite="base-b-tp-test-cpu")
register_cpu_ci(est_time=6, suite="stage-a-tp-test-cpu-intel")
class TestBinding(CustomTestCase):
+1 -1
View File
@@ -11,7 +11,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.cpu_test_utils import precision
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=13, suite="base-b-test-cpu")
register_cpu_ci(est_time=13, suite="stage-a-test-cpu-intel")
torch.manual_seed(1234)
+1 -1
View File
@@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.cpu_test_utils import parametrize, precision
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=7, suite="base-b-test-cpu")
register_cpu_ci(est_time=7, suite="stage-a-test-cpu-intel")
causal_conv1d_weight_pack = torch.ops.sgl_kernel.causal_conv1d_weight_pack
causal_conv1d_fwd = torch.ops.sgl_kernel.causal_conv1d_fwd_cpu
+1 -1
View File
@@ -13,7 +13,7 @@ import torch.multiprocessing as mp
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase, find_available_port
register_cpu_ci(est_time=43, suite="base-b-test-cpu")
register_cpu_ci(est_time=43, suite="stage-a-test-cpu-intel")
def run_distributed_test(rank, world_size, master_port, output_writer, fn):
+1 -1
View File
@@ -21,7 +21,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cpu_ci(est_time=315, suite="base-b-tp-test-cpu")
register_cpu_ci(est_time=315, suite="stage-a-tp-test-cpu-intel")
class TestCPUGraph(CustomTestCase):
+1 -1
View File
@@ -7,7 +7,7 @@ from torch.nn.functional import scaled_dot_product_attention
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=10, suite="base-b-test-cpu")
register_cpu_ci(est_time=10, suite="stage-a-test-cpu-intel")
register_cpu_ci(est_time=10, suite="base-b-test-cpu-arm64")
torch.manual_seed(1234)
+1 -1
View File
@@ -7,7 +7,7 @@ from torch.nn.functional import scaled_dot_product_attention
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=7, suite="base-b-test-cpu")
register_cpu_ci(est_time=7, suite="stage-a-test-cpu-intel")
torch.manual_seed(1234)
+1 -1
View File
@@ -8,7 +8,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.cpu_test_utils import parametrize, precision
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=54, suite="base-b-test-cpu")
register_cpu_ci(est_time=54, suite="stage-a-test-cpu-intel")
flash_attn_varlen_func = torch.ops.sgl_kernel.flash_attn_varlen_func
+1 -1
View File
@@ -18,7 +18,7 @@ from sglang.test.cpu_test_utils import (
)
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=9, suite="base-b-test-cpu")
register_cpu_ci(est_time=9, suite="stage-a-test-cpu-intel")
torch.manual_seed(1234)
@@ -21,7 +21,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cpu_ci(est_time=685, suite="base-b-tp-test-cpu")
register_cpu_ci(est_time=685, suite="stage-a-tp-test-cpu-intel")
class TestIntelAMXAttnBackend(CustomTestCase):
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
intel_amx_benchmark,
)
register_cpu_ci(est_time=47, suite="base-b-test-cpu")
register_cpu_ci(est_time=47, suite="stage-a-test-cpu-intel")
class TestIntelAMXAttnBackendQuant(CustomTestCase):
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
intel_amx_benchmark,
)
register_cpu_ci(est_time=477, suite="base-b-tp-test-cpu")
register_cpu_ci(est_time=477, suite="stage-a-tp-test-cpu-intel")
class TestIntelAMXAttnBackendQuant(CustomTestCase):
+1 -1
View File
@@ -9,7 +9,7 @@ from torch.nn.functional import softplus
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.cpu_test_utils import precision
register_cpu_ci(est_time=7, suite="base-b-test-cpu")
register_cpu_ci(est_time=7, suite="stage-a-test-cpu-intel")
torch.manual_seed(1234)
+1 -1
View File
@@ -8,7 +8,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.cpu_test_utils import precision
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=8, suite="base-b-test-cpu")
register_cpu_ci(est_time=8, suite="stage-a-test-cpu-intel")
torch.manual_seed(1234)
+1 -1
View File
@@ -34,7 +34,7 @@ from sglang.test.cpu_test_utils import (
unpack_and_dequant_awq,
)
register_cpu_ci(est_time=7, suite="base-b-test-cpu")
register_cpu_ci(est_time=7, suite="stage-a-test-cpu-intel")
def run_fused_experts(
+1 -1
View File
@@ -8,7 +8,7 @@ import torch
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.cpu_test_utils import make_non_contiguous, precision
register_cpu_ci(est_time=5, suite="base-b-test-cpu")
register_cpu_ci(est_time=5, suite="stage-a-test-cpu-intel")
register_cpu_ci(est_time=10, suite="base-b-test-cpu-arm64")
torch.manual_seed(1234)
@@ -14,7 +14,7 @@ from sglang.test.cpu_test_utils import (
)
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=7, suite="base-b-test-cpu")
register_cpu_ci(est_time=7, suite="stage-a-test-cpu-intel")
convert_weight_packed = torch.ops.sgl_kernel.convert_weight_packed
qkv_proj_with_rope = torch.ops.sgl_kernel.qkv_proj_with_rope
+1 -1
View File
@@ -8,7 +8,7 @@ from sglang.srt.utils import is_host_cpu_arm64
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.cpu_test_utils import precision
register_cpu_ci(est_time=5, suite="base-b-test-cpu")
register_cpu_ci(est_time=5, suite="stage-a-test-cpu-intel")
register_cpu_ci(est_time=10, suite="base-b-test-cpu-arm64")
torch.manual_seed(1234)
@@ -25,7 +25,7 @@ from sglang.srt.utils.rank_consensus_checker import (
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase, find_available_port
register_cpu_ci(est_time=193, suite="base-b-test-cpu")
register_cpu_ci(est_time=193, suite="stage-a-test-cpu-intel")
def run_distributed_test(
@@ -8,7 +8,7 @@ from sglang.srt.entrypoints.http_request_decompression import (
)
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=5, suite="base-b-test-cpu")
register_cpu_ci(est_time=5, suite="stage-a-test-cpu-intel")
PAYLOAD = b'{"text":"hello world","n":7}'
COMPRESSED = zstandard.ZstdCompressor().compress(PAYLOAD)
+1 -1
View File
@@ -7,7 +7,7 @@ from starlette.datastructures import Headers
from sglang.srt.entrypoints.request_headers import apply_header_overrides
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=4, suite="base-b-test-cpu")
register_cpu_ci(est_time=4, suite="stage-a-test-cpu-intel")
def _obj():
+1 -1
View File
@@ -17,7 +17,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.cpu_test_utils import precision
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=33, suite="base-b-test-cpu")
register_cpu_ci(est_time=33, suite="stage-a-test-cpu-intel")
register_cpu_ci(est_time=10, suite="base-b-test-cpu-arm64")
torch.manual_seed(1234)
@@ -10,7 +10,7 @@ from sglang.srt.arg_groups.validation_hook import validate_ib_devices
from sglang.srt.server_args import ServerArgs
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=6, suite="base-b-test-cpu")
register_cpu_ci(est_time=6, suite="stage-a-test-cpu-intel")
register_cpu_ci(est_time=10, suite="base-b-test-cpu-arm64")
+1 -1
View File
@@ -20,7 +20,7 @@ from sglang.test.cpu_test_utils import (
)
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=8, suite="base-b-test-cpu")
register_cpu_ci(est_time=8, suite="stage-a-test-cpu-intel")
torch.manual_seed(1234)
+1 -1
View File
@@ -20,7 +20,7 @@ from sglang.test.server_fixtures.spec_eagle_fixture import EagleLlama2Base
# Measured 780s all-green on a 40-core GNR socket (1 launch + 18 methods).
register_cpu_ci(
est_time=800,
suite="base-b-test-cpu",
suite="stage-a-test-cpu-intel",
disabled="EagleLlama2Base needs gated meta-llama/Llama-2-7b-chat-hf",
)
@@ -9,7 +9,7 @@ from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base
# (CUDA sibling: 360); tune from CI TIMINGS once it has run there.
register_cpu_ci(
est_time=480,
suite="base-b-test-cpu",
suite="stage-a-test-cpu-intel",
disabled="EAGLE3 numerical parity mismatches on CPU intel_amx",
)
@@ -21,7 +21,7 @@ from sglang.test.server_fixtures.spec_eagle_fixture import EagleLlama2Base
# Measured 830s all-green on a 40-core GNR socket (1 launch + 14 methods).
register_cpu_ci(
est_time=850,
suite="base-b-test-cpu",
suite="stage-a-test-cpu-intel",
disabled="EagleLlama2Base needs gated meta-llama/Llama-2-7b-chat-hf",
)
+1 -1
View File
@@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.cpu_test_utils import precision
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=6, suite="base-b-test-cpu")
register_cpu_ci(est_time=6, suite="stage-a-test-cpu-intel")
def _topk1_chain_inputs(bs, num_steps):
+1 -1
View File
@@ -11,7 +11,7 @@ from sglang.srt.layers.quantization.fp4_kv_cache_quant_method import (
from sglang.srt.mem_cache.memory_pool import MHATokenToKVPool
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=14, suite="base-b-test-cpu")
register_cpu_ci(est_time=14, suite="stage-a-test-cpu-intel")
torch.manual_seed(42)
@@ -43,7 +43,7 @@ from sglang.multimodal_gen.runtime.platforms.cuda import (
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=9, suite="base-b-test-cpu")
register_cpu_ci(est_time=9, suite="stage-a-test-cpu-intel")
class TestSubBlockSparseAttentionDispatch(CustomTestCase):
+1 -1
View File
@@ -15,7 +15,7 @@ from sglang.srt.models.llama4 import Llama4MoE
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=30, suite="base-b-test-cpu")
register_cpu_ci(est_time=30, suite="stage-a-test-cpu-intel")
register_cpu_ci(est_time=10, suite="base-b-test-cpu-arm64")
@@ -23,7 +23,7 @@ from sglang.test.test_utils import (
register_cuda_ci(est_time=70, stage="nightly", runner_config="1-gpu-large")
register_amd_ci(est_time=40, suite="nightly-amd-1-gpu", nightly=True)
register_cpu_ci(est_time=48, suite="base-c-test-cpu")
register_cpu_ci(est_time=48, suite="stage-b-test-cpu-intel")
class TestCrashDump(CustomTestCase):
@@ -19,7 +19,7 @@ from sglang.test.test_utils import (
register_cuda_ci(est_time=240, stage="nightly", runner_config="1-gpu-large")
register_amd_ci(est_time=120, suite="nightly-amd-1-gpu", nightly=True)
register_cpu_ci(est_time=237, suite="base-c-test-cpu")
register_cpu_ci(est_time=237, suite="stage-b-test-cpu-intel")
class BaseTestSoftWatchdog:
@@ -12,7 +12,7 @@ from sglang.srt.parser.reasoning_parser import KimiK2Detector as KimiK2Reasoning
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(5, "base-a-test-cpu")
register_cpu_ci(est_time=4, suite="base-c-test-cpu")
register_cpu_ci(est_time=4, suite="stage-b-test-cpu-intel")
def _make_tool(name, parameters=None):
@@ -22,7 +22,7 @@ from sglang.test.test_utils import (
register_cuda_ci(est_time=42, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=38, suite="stage-b-test-1-gpu-small-amd")
register_cpu_ci(est_time=58, suite="base-c-test-cpu")
register_cpu_ci(est_time=58, suite="stage-b-test-cpu-intel")
class TestInputEmbeds(CustomTestCase):
@@ -36,7 +36,7 @@ from sglang.test.test_utils import (
register_cuda_ci(est_time=43, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=43, suite="stage-b-test-1-gpu-small-amd")
register_cpu_ci(est_time=54, suite="base-c-test-cpu")
register_cpu_ci(est_time=54, suite="stage-b-test-cpu-intel")
CHUNKED_PREFILL_SIZE = 256
+1 -1
View File
@@ -8,7 +8,7 @@ from sglang.test.kv_canary.e2e_base import (
)
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=8, suite="base-c-test-cpu")
register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel")
class TestCanaryE2EBase(CustomTestCase):
@@ -8,7 +8,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.kv_canary.e2e_base import CanaryE2EBase
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=6, suite="base-c-test-cpu")
register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel")
_GOOD_LINE: str = SwaDivergenceLog(
+1 -1
View File
@@ -13,7 +13,7 @@ from sglang.srt.server_args import ServerArgs
from sglang.test.ci.ci_register import register_amd_ci, register_cpu_ci
register_amd_ci(est_time=30, suite="nightly-amd-1-gpu", nightly=True)
register_cpu_ci(est_time=7, suite="base-c-test-cpu")
register_cpu_ci(est_time=7, suite="stage-b-test-cpu-intel")
class MockTokenizerManager:
@@ -11,7 +11,7 @@ from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=29, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=45, suite="stage-b-test-1-gpu-small-amd")
register_cpu_ci(est_time=32, suite="base-c-test-cpu")
register_cpu_ci(est_time=32, suite="stage-b-test-cpu-intel")
class TestExternalModels(CustomTestCase):
@@ -13,7 +13,7 @@ from sglang.test.server_fixtures.default_fixture import DefaultServerBase
register_cuda_ci(est_time=48, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=48, suite="stage-b-test-1-gpu-small-amd")
register_cpu_ci(est_time=206, suite="base-c-test-cpu")
register_cpu_ci(est_time=206, suite="stage-b-test-cpu-intel")
class TestTransformersBackendEval(DefaultServerBase):
+1 -1
View File
@@ -15,7 +15,7 @@ from sglang.srt.runtime_context import get_parallel
from sglang.srt.server_args import ServerArgs, set_global_server_args_for_scheduler
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=6, suite="base-b-test-cpu")
register_cpu_ci(est_time=6, suite="stage-a-test-cpu-intel")
@pytest.fixture(autouse=True)
@@ -26,7 +26,7 @@ register_cuda_ci(
runner_config="1-gpu-small",
)
register_amd_ci(est_time=60, suite="stage-b-test-1-gpu-small-amd")
register_cpu_ci(est_time=49, suite="base-c-test-cpu")
register_cpu_ci(est_time=49, suite="stage-b-test-cpu-intel")
_MODEL_NAME = "Qwen/Qwen3-0.6B"
@@ -31,7 +31,7 @@ from sglang.test.test_utils import (
register_cuda_ci(est_time=50, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd")
register_cpu_ci(est_time=54, suite="base-c-test-cpu")
register_cpu_ci(est_time=54, suite="stage-b-test-cpu-intel")
# System message to guide Llama3.2 to produce proper tool call format
SYSTEM_MESSAGE = (
@@ -28,7 +28,7 @@ from sglang.test.test_utils import (
register_cuda_ci(est_time=58, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=41, suite="stage-b-test-1-gpu-small-amd")
register_cpu_ci(est_time=101, suite="base-c-test-cpu")
register_cpu_ci(est_time=101, suite="stage-b-test-cpu-intel")
class TestLargeMaxNewTokens(CustomTestCase):
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
register_cuda_ci(est_time=52, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=60, suite="stage-b-test-1-gpu-small-amd")
register_cpu_ci(est_time=83, suite="base-c-test-cpu")
register_cpu_ci(est_time=83, suite="stage-b-test-cpu-intel")
class TestMatchedStop(CustomTestCase, MatchedStopMixin):
@@ -19,7 +19,7 @@ from sglang.test.test_utils import (
register_cuda_ci(est_time=91, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=141, suite="stage-b-test-1-gpu-small-amd")
register_cpu_ci(est_time=91, suite="base-c-test-cpu")
register_cpu_ci(est_time=91, suite="stage-b-test-cpu-intel")
class TestOpenAIEmbedding(CustomTestCase):
@@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=15, suite="base-a-test-cpu")
register_cpu_ci(est_time=8, suite="base-c-test-cpu")
register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel")
class TestQuantLogString(CustomTestCase):
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
# RadixAttention server integration tests
register_cuda_ci(est_time=100, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=100, suite="stage-b-test-1-gpu-small-amd")
register_cpu_ci(est_time=405, suite="base-c-test-cpu")
register_cpu_ci(est_time=405, suite="stage-b-test-cpu-intel")
class TestRadixCacheFCFS(CustomTestCase):
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
register_cuda_ci(est_time=55, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=55, suite="stage-b-test-1-gpu-small-amd")
register_cpu_ci(est_time=113, suite="base-c-test-cpu")
register_cpu_ci(est_time=113, suite="stage-b-test-cpu-intel")
MODEL = DEFAULT_SMALL_MODEL_NAME_FOR_TEST
@@ -7,7 +7,7 @@ from sglang.test.server_fixtures.default_fixture import DefaultServerBase
MODEL = "openai/gpt-oss-20b"
register_cuda_ci(est_time=151, stage="base-b", runner_config="1-gpu-large")
register_cpu_ci(est_time=1602, suite="base-c-test-cpu")
register_cpu_ci(est_time=1602, suite="stage-b-test-cpu-intel")
class TestSWARadixCacheKL(KLDivergenceMixin, DefaultServerBase):
@@ -10,7 +10,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
register_cpu_ci(est_time=8, suite="base-c-test-cpu")
register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel")
# ---------------------------------------------------------------------------
@@ -19,7 +19,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
register_cpu_ci(est_time=8, suite="base-c-test-cpu")
register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel")
_HTTP_SCOPE = {
"type": "http",
@@ -22,7 +22,7 @@ from sglang.test.test_utils import (
register_cuda_ci(est_time=50, stage="weekly", runner_config="1-gpu-large")
register_amd_ci(est_time=120, suite="nightly-amd-1-gpu", nightly=True)
register_cpu_ci(est_time=55, suite="base-c-test-cpu")
register_cpu_ci(est_time=55, suite="stage-b-test-cpu-intel")
class TestRoutingKeyScheduling(CustomTestCase):
@@ -14,7 +14,7 @@ from sglang.test.server_fixtures.streaming_session_fixture import (
)
register_cuda_ci(est_time=130, stage="extra-a", runner_config="1-gpu-large")
register_cpu_ci(est_time=449, suite="base-c-test-cpu")
register_cpu_ci(est_time=449, suite="stage-b-test-cpu-intel")
class TestStreamingSessionSWARetractMixedChunk(
@@ -11,7 +11,7 @@ from sglang.test.simple_eval_mixed_prefix_gsm8k import (
)
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=8, suite="base-c-test-cpu")
register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel")
def _write_synthetic_dataset(path: str, n: int) -> None:
@@ -10,7 +10,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.run_eval import _run_sgl_eval, run_eval
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=6, suite="base-b-test-cpu")
register_cpu_ci(est_time=6, suite="stage-a-test-cpu-intel")
def _write_fake_metrics(out_parent: Path, eval_name: str, payload: dict) -> None:
@@ -34,7 +34,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(2.0, "base-a-test-cpu")
register_cpu_ci(est_time=5, suite="base-c-test-cpu")
register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel")
def _make_scheduler(grammar_backend_name="none", skip_tokenizer=False):
@@ -18,7 +18,7 @@ from sglang.srt.parser.reasoning_parser import KimiK3Detector as KimiK3Reasoning
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(2.0, "base-a-test-cpu")
register_cpu_ci(est_time=5, suite="base-c-test-cpu")
register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel")
class _DummyTokenizer:
@@ -15,7 +15,7 @@ from sglang.srt.constrained.utils import is_legacy_structural_tag
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(1.0, "base-a-test-cpu")
register_cpu_ci(est_time=5, suite="base-c-test-cpu")
register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel")
class TestIsLegacyStructuralTag(unittest.TestCase):
@@ -59,7 +59,7 @@ from sglang.srt.managers.io_struct import EmbeddingReqInput
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
register_cpu_ci(est_time=6, suite="base-c-test-cpu")
register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel")
# Mock TokenizerManager for embedding tests
@@ -37,7 +37,7 @@ from sglang.srt.function_call.utils import get_schema_properties
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=20, suite="base-a-test-cpu")
register_cpu_ci(est_time=70, suite="base-c-test-cpu")
register_cpu_ci(est_time=70, suite="stage-b-test-cpu-intel")
@functools.lru_cache(maxsize=None)
@@ -19,7 +19,7 @@ from sglang.srt.function_call.utils import (
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(5, "base-a-test-cpu")
register_cpu_ci(est_time=6, suite="base-c-test-cpu")
register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel")
class TestJsonSchemaConstraint(unittest.TestCase):
@@ -24,7 +24,7 @@ from sglang.srt.function_call.json_array_parser import JsonArrayParser
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(5, "base-a-test-cpu")
register_cpu_ci(est_time=4, suite="base-c-test-cpu")
register_cpu_ci(est_time=4, suite="stage-b-test-cpu-intel")
class TestParallelToolCalls(unittest.TestCase):
@@ -10,7 +10,7 @@ from sglang.srt.function_call.core_types import StreamingParseResult
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(5, "base-a-test-cpu")
register_cpu_ci(est_time=5, suite="base-c-test-cpu")
register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel")
class DummyDetector(BaseFormatDetector):
@@ -14,7 +14,7 @@ from sglang.srt.layers.moe.moe_runner.aiter import (
from sglang.srt.layers.moe.moe_runner.base import MoeRunnerConfig
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=7, suite="base-c-test-cpu")
register_cpu_ci(est_time=7, suite="stage-b-test-cpu-intel")
def _runner_input():
@@ -11,7 +11,7 @@ from sglang.srt.layers.moe.utils import MoeA2ABackend, MoeRunnerBackend
from sglang.srt.runtime_context import get_flags
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=6, suite="base-c-test-cpu")
register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel")
@pytest.fixture
@@ -32,7 +32,7 @@ from sglang.srt.lora.layers import FusedMoEWithLoRA
from sglang.srt.runtime_context import get_context, get_flags, get_parallel
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=15, suite="base-c-test-cpu")
register_cpu_ci(est_time=15, suite="stage-b-test-cpu-intel")
class _TestDispatchRunnerCore(DispatchMoeRunnerCore):
@@ -39,7 +39,7 @@ from sglang.test.test_utils import (
register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=8, suite="stage-b-test-1-gpu-small-amd")
register_cpu_ci(est_time=6, suite="base-c-test-cpu")
register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel")
class TestTokenizedReqInputMsgpack(unittest.TestCase):
@@ -4,7 +4,7 @@ import torch
from sglang.srt.managers.mm_utils import _scatter_mm_embedding
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=5, suite="base-b-test-cpu")
register_cpu_ci(est_time=5, suite="stage-a-test-cpu-intel")
NUM_TOKENS = 64
@@ -7,7 +7,7 @@ from sglang.srt.environ import envs
from sglang.srt.managers import mm_schedule as mm_utils
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=8, suite="base-b-test-cpu")
register_cpu_ci(est_time=8, suite="stage-a-test-cpu-intel")
@pytest.mark.parametrize(
@@ -42,7 +42,7 @@ from sglang.srt.utils.weight_versions import WeightVersionSpan
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=8, suite="base-c-test-cpu")
register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel")
def _round_trip(obj):
@@ -13,7 +13,7 @@ from sglang.srt.managers.scheduler_components.flush_wrapper import (
)
register_cpu_ci(est_time=14, suite="base-a-test-cpu")
register_cpu_ci(est_time=8, suite="base-c-test-cpu")
register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel")
class TestSchedulerFlushCache(unittest.TestCase):
@@ -24,7 +24,7 @@ from sglang.srt.runtime_context import publish, reset_context
from sglang.srt.sampling.sampling_params import SamplingParams
register_cpu_ci(est_time=15, suite="base-a-test-cpu")
register_cpu_ci(est_time=8, suite="base-c-test-cpu")
register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel")
class TestSchedulerPauseGeneration(unittest.TestCase):
@@ -3,7 +3,7 @@
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=6, suite="base-a-test-cpu")
register_cpu_ci(est_time=5, suite="base-c-test-cpu")
register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel")
import unittest
from unittest.mock import MagicMock
@@ -7,7 +7,7 @@ from unittest.mock import MagicMock, patch
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=60, suite="base-a-test-cpu", nightly=True)
register_cpu_ci(est_time=5, suite="base-c-test-cpu")
register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel")
class TestCpuMonitor(unittest.TestCase):
@@ -3,7 +3,7 @@
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=6, suite="base-a-test-cpu")
register_cpu_ci(est_time=4, suite="base-c-test-cpu")
register_cpu_ci(est_time=4, suite="stage-b-test-cpu-intel")
import asyncio
import unittest
@@ -3,7 +3,7 @@
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=6, suite="base-a-test-cpu")
register_cpu_ci(est_time=4, suite="base-c-test-cpu")
register_cpu_ci(est_time=4, suite="stage-b-test-cpu-intel")
import unittest
@@ -7,7 +7,7 @@ from sglang.srt.observability.utils import (
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=6, suite="base-a-test-cpu")
register_cpu_ci(est_time=5, suite="base-c-test-cpu")
register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel")
class TestMetricsUtils(unittest.TestCase):
@@ -6,7 +6,7 @@ from typing import Any, Dict, List, Optional
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=6, suite="base-a-test-cpu")
register_cpu_ci(est_time=5, suite="base-c-test-cpu")
register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel")
import asyncio
import json
@@ -3,7 +3,7 @@
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=6, suite="base-a-test-cpu")
register_cpu_ci(est_time=4, suite="base-c-test-cpu")
register_cpu_ci(est_time=4, suite="stage-b-test-cpu-intel")
import unittest
from unittest.mock import MagicMock, patch
@@ -19,7 +19,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
register_cpu_ci(est_time=6, suite="base-c-test-cpu")
register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel")
class TestRegisterCompletionTemplate(CustomTestCase):
@@ -33,7 +33,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
register_cpu_ci(est_time=8, suite="base-c-test-cpu")
register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel")
class TestConversationGetPrompt(CustomTestCase):
@@ -13,7 +13,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
register_cpu_ci(est_time=8, suite="base-c-test-cpu")
register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel")
class TestPrefixHold(CustomTestCase):
@@ -12,7 +12,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
register_cpu_ci(est_time=6, suite="base-c-test-cpu")
register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel")
class TestTemplateContentFormatDetection(CustomTestCase):
@@ -5,7 +5,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
register_cpu_ci(est_time=6, suite="base-c-test-cpu")
register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel")
# Simulated model output that contains think tags (e.g. from DeepSeek-R1)
THINK_OUTPUT = (
@@ -3,7 +3,7 @@
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
register_cpu_ci(est_time=8, suite="base-c-test-cpu")
register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel")
import json
import unittest
@@ -3,7 +3,7 @@
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=9, suite="base-a-test-cpu")
register_cpu_ci(est_time=8, suite="base-c-test-cpu")
register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel")
import unittest
from unittest.mock import MagicMock
@@ -3,7 +3,7 @@
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=9, suite="base-a-test-cpu")
register_cpu_ci(est_time=6, suite="base-c-test-cpu")
register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel")
import unittest
from types import SimpleNamespace
@@ -3,7 +3,7 @@
from sglang.test.ci.ci_register import register_cpu_ci, register_xpu_ci
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
register_cpu_ci(est_time=8, suite="base-c-test-cpu")
register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel")
register_xpu_ci(est_time=10, suite="stage-a-test-1-gpu-xpu")
import copy
@@ -94,7 +94,7 @@ from sglang.test.test_utils import (
)
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
register_cpu_ci(est_time=11, suite="base-c-test-cpu")
register_cpu_ci(est_time=11, suite="stage-b-test-cpu-intel")
# Mock get_device() so all tests run on CPU-only CI runners
_mock_device = patch(
+1 -1
View File
@@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
register_cpu_ci(est_time=6, suite="base-c-test-cpu")
register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel")
class TestRunaiUtils(CustomTestCase):
@@ -14,7 +14,7 @@ from sglang.kernels.ops.diffusion.common.fallback_torch import (
from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci
register_cpu_ci(est_time=1, suite="base-a-test-cpu")
register_cpu_ci(est_time=1, suite="base-b-test-cpu")
register_cpu_ci(est_time=1, suite="stage-a-test-cpu-intel")
register_cpu_ci(est_time=1, suite="base-b-test-cpu-arm64")
register_mlx_ci(est_time=1, suite="stage-a-unit-test-mlx")
@@ -1,7 +1,7 @@
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=6, suite="base-a-test-cpu")
register_cpu_ci(est_time=4, suite="base-c-test-cpu")
register_cpu_ci(est_time=4, suite="stage-b-test-cpu-intel")
import unittest
@@ -11,7 +11,7 @@ from sglang.srt.utils.auth import AuthLevel, decide_request_auth
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=6, suite="base-a-test-cpu")
register_cpu_ci(est_time=5, suite="base-c-test-cpu")
register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel")
class TestHttpServerAdminAuth(unittest.TestCase):
@@ -11,7 +11,7 @@ from sglang.srt.utils.json_response import (
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=6, suite="base-a-test-cpu")
register_cpu_ci(est_time=5, suite="base-c-test-cpu")
register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel")
class TestJSONResponseUtils(unittest.TestCase):

Some files were not shown because too many files have changed in this diff Show More