chore: update CI test est_time values (#38238)

Co-authored-by: sglang-bot <sglang-bot@users.noreply.github.com>
This commit is contained in:
sglang-bot
2026-09-06 17:49:41 -07:00
committed by GitHub
co-authored by sglang-bot
parent 15aa2fb843
commit 6252993afe
1016 changed files with 1051 additions and 1051 deletions
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
try_cached_model,
)
register_cuda_ci(est_time=1800, stage="base-c", runner_config="4-gpu-gb300")
register_cuda_ci(est_time=384, stage="base-c", runner_config="4-gpu-gb300")
# Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner.
NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 100
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=450, stage="extra-b", runner_config="8-gpu-h200")
register_cuda_ci(est_time=575, stage="extra-b", runner_config="8-gpu-h200")
DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
@@ -13,7 +13,7 @@ from sglang.test.ci.ci_register import (
register_xpu_ci,
)
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=11, stage="stage-b", runner_config="1-gpu-large-amd")
register_xpu_ci(est_time=900, suite="stage-b-test-1-gpu-xpu")
@@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import CustomTestCase
# Triton kernel unit test for KV indices creation
register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-small")
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd")
@@ -24,7 +24,7 @@ from sglang.test.test_utils import (
is_in_amd_ci,
)
register_cuda_ci(est_time=207, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=280, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd")
register_xpu_ci(est_time=207, suite="stage-b-test-1-gpu-xpu")
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
)
# FlashAttention4 integration test (requires SM 100+ / Blackwell B200)
register_cuda_ci(est_time=260, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=230, stage="base-b", runner_config="4-gpu-b200")
@unittest.skipIf(get_device_sm() < 100, "Test requires CUDA SM 100 or higher")
@@ -7,7 +7,7 @@ from sglang.kernels.ops.attention.triton_gdn_fused_proj import (
)
from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=3, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large")
def _reference_split(mixed_qkvz, mixed_ba, num_heads_qk, num_heads_v, head_qk, head_v):
@@ -14,7 +14,7 @@ from sglang.kernels.ops.attention.fla.fused_sigmoid_gating_recurrent import (
)
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=7, stage="stage-b", runner_config="1-gpu-large-amd")
@@ -13,7 +13,7 @@ from sglang.kernels.ops.attention.triton_gdn_fused_proj import (
)
from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "Test requires CUDA")
@@ -23,7 +23,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=107, stage="base-b", runner_config="2-gpu-large")
register_cuda_ci(est_time=90, stage="base-b", runner_config="2-gpu-large")
register_amd_ci(est_time=160, suite="stage-b-test-2-gpu-large-amd")
@@ -48,7 +48,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=65, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=72, stage="base-b", runner_config="1-gpu-large")
# Healthy 0.865-0.880 (static pool 0.870); a died-mid-run server scores
# 0.05-0.21. 1 sigma over 200 examples is ~0.024.
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
# Hybrid attention backend tests (FA3 prefill + FlashInfer decode, requires SM 90+ / H100)
# Multiple test classes: base, MLA, TorchCompile, SpecDecode variants
register_cuda_ci(est_time=407, stage="extra-a", runner_config="1-gpu-large")
register_cuda_ci(est_time=393, stage="extra-a", runner_config="1-gpu-large")
class TestHybridAttnBackendMLA(TestHybridAttnBackendBase):
@@ -19,7 +19,7 @@ from sglang.srt.utils.common import get_device
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=12, stage="stage-b", runner_config="1-gpu-large-amd")
@@ -12,7 +12,7 @@ from sglang.srt.environ import envs
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=15, suite="base-a-test-cpu")
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
class TestMlaGluonCapability(CustomTestCase):
@@ -12,7 +12,7 @@ from sglang.test.test_deterministic_utils import (
TestDeterministicBase,
)
register_cuda_ci(est_time=360, stage="extra-b", runner_config="4-gpu-h100")
register_cuda_ci(est_time=119, stage="extra-b", runner_config="4-gpu-h100")
QWEN35 = "Qwen/Qwen3.5-35B-A3B"
@@ -18,7 +18,7 @@ from sglang.test.test_utils import (
)
# Torch native attention backend integration test with MMLU eval
register_cuda_ci(est_time=140, stage="extra-a", runner_config="1-gpu-small")
register_cuda_ci(est_time=310, stage="extra-a", runner_config="1-gpu-small")
register_amd_ci(est_time=150, suite="stage-b-test-1-gpu-small-amd")
@@ -25,7 +25,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import CustomTestCase, is_in_amd_ci
# Triton attention kernel unit tests (decode, extend, prefill)
register_cuda_ci(est_time=19, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=30, suite="stage-b-test-1-gpu-small-amd")
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
)
# Sliding window attention with Triton backend (Gemma-3 model)
register_cuda_ci(est_time=93, stage="extra-a", runner_config="1-gpu-large")
register_cuda_ci(est_time=80, stage="extra-a", runner_config="1-gpu-large")
register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd")
@@ -17,7 +17,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.test_utils import CustomTestCase
# trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell.
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
DEVICE = "cuda"
PAGE_SIZE = 32
@@ -23,7 +23,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode
from sglang.test.ci.ci_register import register_cuda_ci
# trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell.
register_cuda_ci(est_time=30, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=16, stage="base-b", runner_config="4-gpu-b200")
DEVICE = "cuda"
PAGE_SIZE = 128
@@ -25,7 +25,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import CustomTestCase
# Triton kernel unit test for the trtllm_mha device-side page-table build.
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-small")
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=14, stage="stage-b", runner_config="1-gpu-small-amd")
@@ -27,7 +27,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=300, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=71, stage="base-b", runner_config="1-gpu-large")
KIMI_LINEAR_MODEL = "yujiepan/kimi-linear-tiny-random"
SERVER_ENV = {"SGLANG_BATCH_INVARIANT_OPS_ENABLE_MM_DEEPGEMM": "0"}
@@ -30,7 +30,7 @@ from sglang.kernels.ops.attention.verify_splitkv import (
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small")
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=30, suite="stage-b-test-1-gpu-small-amd-mi35x")
# Split-KV accumulates the prefix in parallel splits and merges via log-sum-exp;
@@ -36,7 +36,7 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=10, stage="base-a", runner_config="1-gpu-small")
register_cuda_ci(est_time=11, stage="base-a", runner_config="1-gpu-small")
_EXTEND_CASE = DenseAttentionCase(
name="extend_no_prefix_smoke",
@@ -30,7 +30,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -29,8 +29,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=45, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=45, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=27, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=22, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -26,8 +26,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(
@@ -14,8 +14,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -18,8 +18,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(
@@ -21,8 +21,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -11,8 +11,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -30,8 +30,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=19, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-large-amd")
@@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=17, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(
@@ -30,8 +30,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_draft_runner i
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -47,8 +47,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
run_dsv4_eagle_verify_cuda_graph_case,
)
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -60,8 +60,8 @@ _DUAL_CHUNK_FLASH_ATTN_AVAILABLE, _DUAL_CHUNK_SKIP_REASON = _dual_chunk_fa_suppo
from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -25,8 +25,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large")
_cuda_major = int(torch.version.cuda.split(".")[0]) if torch.version.cuda else 0
_sm_major = torch.cuda.get_device_capability()[0] if torch.cuda.is_available() else 0
@@ -28,7 +28,7 @@ from sglang.kernels.ops.attention.fla.gdn_replayssm_spec_fold import (
from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=23, stage="base-b", runner_config="1-gpu-large")
T, H, HV, K, V, SLOTS = 4, 4, 16, 128, 128, 16
DEVICE = "cuda"
@@ -20,7 +20,7 @@ from sglang.kernels.ops.attention.fla.gdn_replayssm_spec_fold import (
from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
B, T = 3, 4
H, HV = 4, 8
@@ -45,7 +45,7 @@ import torch
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -15,8 +15,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -32,7 +32,7 @@ from sglang.test.kits.attention_unittest.attention_methods.mla_attention import
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large")
_KV_LORA_RANK = DEFAULT_KV_LORA_RANK
@@ -24,7 +24,7 @@ from sglang.srt.layers.attention.linear.kernels.kda_flashinfer import (
from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=2, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large")
class TestBuildFusedAcceptIndices(CustomTestCase):
@@ -22,7 +22,7 @@ from sglang.srt.speculative.eagle_info import EagleVerifyInput
from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=2, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
_STALE = -555
_MAX_BS = 4
@@ -22,7 +22,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -19,8 +19,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -32,8 +32,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -7,7 +7,7 @@ from sglang.srt.layers.attention.mamba.replay_state_indices_validator import (
)
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=5, suite="base-a-test-cpu")
register_cpu_ci(est_time=6, suite="base-a-test-cpu")
class TestReplayStateIndicesValidator(unittest.TestCase):
@@ -42,8 +42,8 @@ _SUPPORTED, _SKIP_REASON = _supported()
from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not _SUPPORTED, _SKIP_REASON)
@@ -32,8 +32,8 @@ MLA_SHAPE_KWARGS = dict(
from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -58,8 +58,8 @@ _DECODE_SKIP_REASON = (
from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -55,8 +55,8 @@ MLA_SHAPE_KWARGS = dict(
from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not _SUPPORTED, _SKIP_REASON)
@@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -42,8 +42,8 @@ _SUPPORTED, _SKIP_REASON = _supported()
from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not _SUPPORTED, _SKIP_REASON)
@@ -24,8 +24,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(
@@ -24,7 +24,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=5, suite="base-a-test-cpu")
register_cpu_ci(est_time=11, suite="base-a-test-cpu")
class TestSWAKVPoolSetKVBuffer(CustomTestCase):
@@ -12,8 +12,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -23,8 +23,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
)
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=900, stage="extra-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=243, stage="extra-b", runner_config="4-gpu-b200")
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4"
SERVER_LAUNCH_TIMEOUT = 1000
@@ -11,7 +11,7 @@ from sglang.srt.utils import get_cuda_driver_bindings, is_flashinfer_available
from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=30, stage="base-b", runner_config="2-gpu-large")
register_cuda_ci(est_time=28, stage="base-b", runner_config="2-gpu-large")
WORLD_SIZE = 2
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=126, stage="extra-a", runner_config="1-gpu-large")
register_cuda_ci(est_time=139, stage="extra-a", runner_config="1-gpu-large")
register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-small-amd")
@@ -26,7 +26,7 @@ from sglang.benchmark.serving import (
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
register_cpu_ci(est_time=16, suite="base-a-test-cpu")
def _free_port() -> int:
@@ -60,7 +60,7 @@ from sglang.benchmark.serving import (
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=30, suite="base-a-test-cpu")
register_cpu_ci(est_time=38, suite="base-a-test-cpu")
register_cpu_ci(est_time=46, suite="stage-b-test-cpu-intel")
@@ -13,7 +13,7 @@ from sglang.benchmark.steady_state import (
)
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=5, suite="base-a-test-cpu")
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
class _StringTokenizer:
@@ -20,7 +20,7 @@ from sglang.srt.managers.schedule_batch import Modality, MultimodalDataItem
from sglang.srt.runtime_context import get_context, get_parallel
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
register_cpu_ci(est_time=12, suite="base-a-test-cpu")
@pytest.fixture(autouse=True)
@@ -10,7 +10,7 @@ from sglang.test.scripted_runtime_chunked_helpers import (
run_until_finished,
)
register_cuda_ci(est_time=300, stage="extra-a", runner_config="1-gpu-small")
register_cuda_ci(est_time=106, stage="extra-a", runner_config="1-gpu-small")
register_amd_ci(est_time=198, stage="extra-a", runner_config="1-gpu-small-amd")
@@ -11,7 +11,7 @@ from sglang.test.scripted_runtime_chunked_helpers import (
run_until_finished,
)
register_cuda_ci(est_time=900, stage="extra-b", runner_config="4-gpu-h100")
register_cuda_ci(est_time=55, stage="extra-b", runner_config="4-gpu-h100")
_CHUNK_SIZE = 64
@@ -5,7 +5,7 @@ from sglang.test.scripted_runtime.context import ScriptedContext
from sglang.test.scripted_runtime.test_case import ScriptedTestCase
from sglang.test.scripted_runtime_chunked_helpers import base_engine_kwargs
register_cuda_ci(est_time=400, stage="extra-a", runner_config="1-gpu-large")
register_cuda_ci(est_time=130, stage="extra-a", runner_config="1-gpu-large")
_SWA_MODEL = "openai/gpt-oss-20b"
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=135, stage="base-b", runner_config="1-gpu-small")
register_cuda_ci(est_time=161, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=220, suite="stage-b-test-1-gpu-small-amd")
+1 -1
View File
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=160, stage="base-a", runner_config="1-gpu-small")
register_cuda_ci(est_time=97, stage="base-a", runner_config="1-gpu-small")
register_amd_ci(est_time=160, suite="stage-a-test-1-gpu-small-amd")
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=200, stage="base-a", runner_config="1-gpu-small")
register_cuda_ci(est_time=135, stage="base-a", runner_config="1-gpu-small")
class TestBasicSanityDFlash(
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=180, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=97, stage="base-b", runner_config="1-gpu-large")
TARGET_MODEL = "Qwen/Qwen3-14B"
DRAFT_MODEL = "deepseek-ai/dspark_qwen3_14b_block7"
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=200, stage="base-a", runner_config="1-gpu-small")
register_cuda_ci(est_time=167, stage="base-a", runner_config="1-gpu-small")
register_amd_ci(est_time=200, suite="stage-a-test-1-gpu-small-amd")
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
CustomTestCase,
)
register_cuda_ci(est_time=77, stage="base-b", runner_config="1-gpu-small")
register_cuda_ci(est_time=38, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=77, suite="stage-b-test-1-gpu-small-amd")
+1 -1
View File
@@ -8,7 +8,7 @@ from sglang.srt.utils import get_device, is_hip
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase
register_cuda_ci(est_time=45, stage="base-b", runner_config="1-gpu-small")
register_cuda_ci(est_time=32, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=55, suite="stage-b-test-1-gpu-small-amd")
_is_hip = is_hip()
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=120, stage="base-b", runner_config="2-gpu-large")
register_cuda_ci(est_time=54, stage="base-b", runner_config="2-gpu-large")
class TestTPServerGPUProcesses(CustomTestCase):
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
send_generate_requests,
)
register_cuda_ci(est_time=53, stage="base-b", runner_config="1-gpu-small")
register_cuda_ci(est_time=65, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=70, suite="stage-b-test-1-gpu-small-amd")
+1 -1
View File
@@ -12,7 +12,7 @@ import pytest
from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
# Packages known to transitively depend on torch or triton.
# If a new package is added to runtime_base and it pulls torch,
+1 -1
View File
@@ -31,7 +31,7 @@ from sglang.test.test_utils import (
run_logprob_check,
)
register_cuda_ci(est_time=260, stage="base-b", runner_config="1-gpu-small")
register_cuda_ci(est_time=265, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=260, suite="stage-b-test-1-gpu-small-amd")
SERVER_ENV = {"SGLANG_USE_PICKLE_IPC": "0"}
+1 -1
View File
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
CustomTestCase,
)
register_cuda_ci(est_time=387, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=276, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=261, suite="stage-b-test-1-gpu-small-amd")
+1 -1
View File
@@ -42,7 +42,7 @@ from sglang.srt.runtime_context import get_parallel
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=5, suite="base-a-test-cpu")
register_cpu_ci(est_time=11, suite="base-a-test-cpu")
class _ExtendMode:
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=500, stage="extra-b", runner_config="8-gpu-h200")
register_cuda_ci(est_time=275, stage="extra-b", runner_config="8-gpu-h200")
DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324"
@@ -22,7 +22,7 @@ from sglang.test.test_utils import (
try_cached_model,
)
register_cuda_ci(est_time=235, stage="extra-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=689, stage="extra-b", runner_config="4-gpu-b200")
MODEL = "deepseek-ai/DeepSeek-V4-Flash"
SERVER_LAUNCH_TIMEOUT = 3600
+1 -1
View File
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=320, stage="extra-b", runner_config="8-gpu-h200")
register_cuda_ci(est_time=314, stage="extra-b", runner_config="8-gpu-h200")
GLM52_MODEL_PATH = "zai-org/GLM-5.2-FP8"
SERVER_LAUNCH_TIMEOUT = max(DEFAULT_TIMEOUT_FOR_SERVER_LAUNCH, 1800)
@@ -3,7 +3,7 @@ import unittest
from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.gpt_oss_common import BaseTestGptOss
register_cuda_ci(est_time=220, stage="extra-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=121, stage="extra-b", runner_config="4-gpu-b200")
class TestGptOss4GpuMxfp4CP(BaseTestGptOss):
+1 -1
View File
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=500, stage="extra-b", runner_config="4-gpu-h100")
register_cuda_ci(est_time=466, stage="extra-b", runner_config="4-gpu-h100")
GQA_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8"
@@ -26,7 +26,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=480, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=178, stage="base-b", runner_config="1-gpu-large")
BASE_MODEL = "Qwen/Qwen3-4B"
LORA_ADAPTER = "nissenj/Qwen3-4B-lora-v2"
@@ -12,7 +12,7 @@ import unittest
from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.server_fixtures.pcg_spec_fixture import PCGSpecBase
register_cuda_ci(est_time=531, stage="base-b", runner_config="2-gpu-large")
register_cuda_ci(est_time=106, stage="base-b", runner_config="2-gpu-large")
class TestBCGWithEAGLE3(PCGSpecBase, unittest.TestCase):
@@ -24,7 +24,7 @@ from sglang.test.test_utils import (
)
# CI Registration — large suite to fit the integration test's server startup.
register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-large")
register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=200, suite="stage-c-test-large-8-gpu-amd-mi35x")
@@ -33,7 +33,7 @@ from sglang.test.test_utils import (
# OSS FA4 coverage requires Blackwell. The PP test uses two GPUs; the other
# tests use one GPU.
register_cuda_ci(est_time=300, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=251, stage="base-b", runner_config="4-gpu-b200")
def _prefill_graph_count(base_url: str) -> float:
@@ -5,7 +5,7 @@ import torch
from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-small")
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small")
if not torch.cuda.is_available():
pytest.skip("CUDA piecewise backend requires CUDA", allow_module_level=True)
+1 -1
View File
@@ -33,7 +33,7 @@ from sglang.srt.mem_cache.memory_pool import HybridLinearKVPool
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
register_cpu_ci(est_time=11, suite="base-a-test-cpu")
DCP_SIZES = [1, 2, 3, 4, 8]
LENS = list(range(0, 41))
+1 -1
View File
@@ -55,7 +55,7 @@ from sglang.test.test_utils import (
# ---------------------------------------------------------------------------
# CI registration — only TestDSV31DCP8TP8GSM8K runs in CI
# ---------------------------------------------------------------------------
register_cuda_ci(est_time=600, stage="extra-b", runner_config="8-gpu-h200")
register_cuda_ci(est_time=213, stage="extra-b", runner_config="8-gpu-h200")
DEEPSEEK_V31_MODEL_PATH = "deepseek-ai/DeepSeek-V3.1"
+1 -1
View File
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=240, stage="extra-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=105, stage="extra-b", runner_config="4-gpu-b200")
KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct"
CUDA_GRAPH_MAX_BS_DECODE = 256
@@ -22,7 +22,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=350, stage="extra-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=201, stage="extra-b", runner_config="4-gpu-b200")
KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct"
GSM8K_SCORE_THRESHOLD = 0.88
@@ -23,7 +23,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode
from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=60, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
NUM_DRAFT_TOKENS = 8
DCP_SIZE = 4
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
QWEN3_8B_MODEL_PATH = "Qwen/Qwen3-8B"
register_cuda_ci(est_time=300, stage="base-c", runner_config="4-gpu-gb300")
register_cuda_ci(est_time=125, stage="base-c", runner_config="4-gpu-gb300")
# Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner.
NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 120
@@ -27,7 +27,7 @@ from sglang.test.test_utils import (
DEFAULT_TARGET_MODEL_EAGLE3,
)
register_cuda_ci(est_time=730, stage="base-b", runner_config="2-gpu-large")
register_cuda_ci(est_time=1007, stage="base-b", runner_config="2-gpu-large")
class TestDisaggregationAccuracy(PauseResumeInPlaceMixin, PDDisaggregationServerBase):
@@ -26,7 +26,7 @@ from sglang.test.test_utils import (
try_cached_model,
)
register_cuda_ci(est_time=300, stage="base-c", runner_config="8-gpu-h20")
register_cuda_ci(est_time=509, stage="base-c", runner_config="8-gpu-h20")
def _has_nixl():

Some files were not shown because too many files have changed in this diff Show More