chore: update CI test est_time values (#38238)
Co-authored-by: sglang-bot <sglang-bot@users.noreply.github.com>
This commit is contained in:
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
|
||||
try_cached_model,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=1800, stage="base-c", runner_config="4-gpu-gb300")
|
||||
register_cuda_ci(est_time=384, stage="base-c", runner_config="4-gpu-gb300")
|
||||
|
||||
# Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner.
|
||||
NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 100
|
||||
|
||||
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
|
||||
write_github_step_summary,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=450, stage="extra-b", runner_config="8-gpu-h200")
|
||||
register_cuda_ci(est_time=575, stage="extra-b", runner_config="8-gpu-h200")
|
||||
|
||||
DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
|
||||
|
||||
|
||||
@@ -13,7 +13,7 @@ from sglang.test.ci.ci_register import (
|
||||
register_xpu_ci,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=11, stage="stage-b", runner_config="1-gpu-large-amd")
|
||||
register_xpu_ci(est_time=900, suite="stage-b-test-1-gpu-xpu")
|
||||
|
||||
|
||||
@@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
# Triton kernel unit test for KV indices creation
|
||||
register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small")
|
||||
register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd")
|
||||
|
||||
|
||||
|
||||
@@ -24,7 +24,7 @@ from sglang.test.test_utils import (
|
||||
is_in_amd_ci,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=207, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=280, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd")
|
||||
register_xpu_ci(est_time=207, suite="stage-b-test-1-gpu-xpu")
|
||||
|
||||
|
||||
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
|
||||
)
|
||||
|
||||
# FlashAttention4 integration test (requires SM 100+ / Blackwell B200)
|
||||
register_cuda_ci(est_time=260, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=230, stage="base-b", runner_config="4-gpu-b200")
|
||||
|
||||
|
||||
@unittest.skipIf(get_device_sm() < 100, "Test requires CUDA SM 100 or higher")
|
||||
|
||||
@@ -7,7 +7,7 @@ from sglang.kernels.ops.attention.triton_gdn_fused_proj import (
|
||||
)
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
|
||||
register_cuda_ci(est_time=3, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
def _reference_split(mixed_qkvz, mixed_ba, num_heads_qk, num_heads_v, head_qk, head_v):
|
||||
|
||||
@@ -14,7 +14,7 @@ from sglang.kernels.ops.attention.fla.fused_sigmoid_gating_recurrent import (
|
||||
)
|
||||
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||
|
||||
register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=7, stage="stage-b", runner_config="1-gpu-large-amd")
|
||||
|
||||
|
||||
|
||||
@@ -13,7 +13,7 @@ from sglang.kernels.ops.attention.triton_gdn_fused_proj import (
|
||||
)
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
|
||||
register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not torch.cuda.is_available(), "Test requires CUDA")
|
||||
|
||||
@@ -23,7 +23,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=107, stage="base-b", runner_config="2-gpu-large")
|
||||
register_cuda_ci(est_time=90, stage="base-b", runner_config="2-gpu-large")
|
||||
register_amd_ci(est_time=160, suite="stage-b-test-2-gpu-large-amd")
|
||||
|
||||
|
||||
|
||||
@@ -48,7 +48,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=65, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=72, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
# Healthy 0.865-0.880 (static pool 0.870); a died-mid-run server scores
|
||||
# 0.05-0.21. 1 sigma over 200 examples is ~0.024.
|
||||
|
||||
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
|
||||
|
||||
# Hybrid attention backend tests (FA3 prefill + FlashInfer decode, requires SM 90+ / H100)
|
||||
# Multiple test classes: base, MLA, TorchCompile, SpecDecode variants
|
||||
register_cuda_ci(est_time=407, stage="extra-a", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=393, stage="extra-a", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
class TestHybridAttnBackendMLA(TestHybridAttnBackendBase):
|
||||
|
||||
@@ -19,7 +19,7 @@ from sglang.srt.utils.common import get_device
|
||||
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=12, stage="stage-b", runner_config="1-gpu-large-amd")
|
||||
|
||||
|
||||
|
||||
@@ -12,7 +12,7 @@ from sglang.srt.environ import envs
|
||||
from sglang.test.ci.ci_register import register_cpu_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cpu_ci(est_time=15, suite="base-a-test-cpu")
|
||||
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
|
||||
|
||||
|
||||
class TestMlaGluonCapability(CustomTestCase):
|
||||
|
||||
@@ -12,7 +12,7 @@ from sglang.test.test_deterministic_utils import (
|
||||
TestDeterministicBase,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=360, stage="extra-b", runner_config="4-gpu-h100")
|
||||
register_cuda_ci(est_time=119, stage="extra-b", runner_config="4-gpu-h100")
|
||||
|
||||
QWEN35 = "Qwen/Qwen3.5-35B-A3B"
|
||||
|
||||
|
||||
@@ -18,7 +18,7 @@ from sglang.test.test_utils import (
|
||||
)
|
||||
|
||||
# Torch native attention backend integration test with MMLU eval
|
||||
register_cuda_ci(est_time=140, stage="extra-a", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=310, stage="extra-a", runner_config="1-gpu-small")
|
||||
register_amd_ci(est_time=150, suite="stage-b-test-1-gpu-small-amd")
|
||||
|
||||
|
||||
|
||||
@@ -25,7 +25,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||
from sglang.test.test_utils import CustomTestCase, is_in_amd_ci
|
||||
|
||||
# Triton attention kernel unit tests (decode, extend, prefill)
|
||||
register_cuda_ci(est_time=19, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=30, suite="stage-b-test-1-gpu-small-amd")
|
||||
|
||||
|
||||
|
||||
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
|
||||
)
|
||||
|
||||
# Sliding window attention with Triton backend (Gemma-3 model)
|
||||
register_cuda_ci(est_time=93, stage="extra-a", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=80, stage="extra-a", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd")
|
||||
|
||||
|
||||
|
||||
@@ -17,7 +17,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
# trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell.
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
|
||||
|
||||
DEVICE = "cuda"
|
||||
PAGE_SIZE = 32
|
||||
|
||||
@@ -23,7 +23,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
|
||||
# trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell.
|
||||
register_cuda_ci(est_time=30, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=16, stage="base-b", runner_config="4-gpu-b200")
|
||||
|
||||
DEVICE = "cuda"
|
||||
PAGE_SIZE = 128
|
||||
|
||||
@@ -25,7 +25,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
# Triton kernel unit test for the trtllm_mha device-side page-table build.
|
||||
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small")
|
||||
register_amd_ci(est_time=14, stage="stage-b", runner_config="1-gpu-small-amd")
|
||||
|
||||
|
||||
|
||||
@@ -27,7 +27,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=300, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=71, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
KIMI_LINEAR_MODEL = "yujiepan/kimi-linear-tiny-random"
|
||||
SERVER_ENV = {"SGLANG_BATCH_INVARIANT_OPS_ENABLE_MM_DEEPGEMM": "0"}
|
||||
|
||||
@@ -30,7 +30,7 @@ from sglang.kernels.ops.attention.verify_splitkv import (
|
||||
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small")
|
||||
register_amd_ci(est_time=30, suite="stage-b-test-1-gpu-small-amd-mi35x")
|
||||
|
||||
# Split-KV accumulates the prefix in parallel splits and merges via log-sum-exp;
|
||||
|
||||
@@ -36,7 +36,7 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=10, stage="base-a", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=11, stage="base-a", runner_config="1-gpu-small")
|
||||
|
||||
_EXTEND_CASE = DenseAttentionCase(
|
||||
name="extend_no_prefix_smoke",
|
||||
|
||||
@@ -30,7 +30,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||
|
||||
@@ -29,8 +29,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=45, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=45, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=27, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=22, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||
|
||||
@@ -26,8 +26,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(
|
||||
|
||||
@@ -14,8 +14,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||
|
||||
@@ -18,8 +18,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(
|
||||
|
||||
@@ -21,8 +21,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||
|
||||
@@ -11,8 +11,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||
|
||||
|
||||
|
||||
@@ -30,8 +30,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=19, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-large-amd")
|
||||
|
||||
|
||||
|
||||
@@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=17, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(
|
||||
|
||||
@@ -30,8 +30,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_draft_runner i
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||
|
||||
@@ -47,8 +47,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
|
||||
run_dsv4_eagle_verify_cuda_graph_case,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||
|
||||
@@ -60,8 +60,8 @@ _DUAL_CHUNK_FLASH_ATTN_AVAILABLE, _DUAL_CHUNK_SKIP_REASON = _dual_chunk_fa_suppo
|
||||
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||
|
||||
@@ -25,8 +25,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
_cuda_major = int(torch.version.cuda.split(".")[0]) if torch.version.cuda else 0
|
||||
_sm_major = torch.cuda.get_device_capability()[0] if torch.cuda.is_available() else 0
|
||||
|
||||
@@ -28,7 +28,7 @@ from sglang.kernels.ops.attention.fla.gdn_replayssm_spec_fold import (
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=23, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
T, H, HV, K, V, SLOTS = 4, 4, 16, 128, 128, 16
|
||||
DEVICE = "cuda"
|
||||
|
||||
@@ -20,7 +20,7 @@ from sglang.kernels.ops.attention.fla.gdn_replayssm_spec_fold import (
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
B, T = 3, 4
|
||||
H, HV = 4, 8
|
||||
|
||||
@@ -45,7 +45,7 @@ import torch
|
||||
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||
|
||||
|
||||
|
||||
@@ -15,8 +15,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||
|
||||
|
||||
|
||||
@@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||
|
||||
|
||||
|
||||
+1
-1
@@ -32,7 +32,7 @@ from sglang.test.kits.attention_unittest.attention_methods.mla_attention import
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
_KV_LORA_RANK = DEFAULT_KV_LORA_RANK
|
||||
|
||||
@@ -24,7 +24,7 @@ from sglang.srt.layers.attention.linear.kernels.kda_flashinfer import (
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=2, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
class TestBuildFusedAcceptIndices(CustomTestCase):
|
||||
|
||||
@@ -22,7 +22,7 @@ from sglang.srt.speculative.eagle_info import EagleVerifyInput
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=2, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
_STALE = -555
|
||||
_MAX_BS = 4
|
||||
|
||||
@@ -22,7 +22,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||
|
||||
|
||||
@@ -19,8 +19,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||
|
||||
|
||||
|
||||
@@ -32,8 +32,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||
|
||||
@@ -7,7 +7,7 @@ from sglang.srt.layers.attention.mamba.replay_state_indices_validator import (
|
||||
)
|
||||
from sglang.test.ci.ci_register import register_cpu_ci
|
||||
|
||||
register_cpu_ci(est_time=5, suite="base-a-test-cpu")
|
||||
register_cpu_ci(est_time=6, suite="base-a-test-cpu")
|
||||
|
||||
|
||||
class TestReplayStateIndicesValidator(unittest.TestCase):
|
||||
|
||||
@@ -42,8 +42,8 @@ _SUPPORTED, _SKIP_REASON = _supported()
|
||||
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
|
||||
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not _SUPPORTED, _SKIP_REASON)
|
||||
|
||||
@@ -32,8 +32,8 @@ MLA_SHAPE_KWARGS = dict(
|
||||
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||
|
||||
@@ -58,8 +58,8 @@ _DECODE_SKIP_REASON = (
|
||||
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||
|
||||
@@ -55,8 +55,8 @@ MLA_SHAPE_KWARGS = dict(
|
||||
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
|
||||
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not _SUPPORTED, _SKIP_REASON)
|
||||
|
||||
@@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||
|
||||
@@ -42,8 +42,8 @@ _SUPPORTED, _SKIP_REASON = _supported()
|
||||
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
|
||||
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(not _SUPPORTED, _SKIP_REASON)
|
||||
|
||||
@@ -24,8 +24,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
@unittest.skipIf(
|
||||
|
||||
@@ -24,7 +24,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode
|
||||
from sglang.test.ci.ci_register import register_cpu_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cpu_ci(est_time=5, suite="base-a-test-cpu")
|
||||
register_cpu_ci(est_time=11, suite="base-a-test-cpu")
|
||||
|
||||
|
||||
class TestSWAKVPoolSetKVBuffer(CustomTestCase):
|
||||
|
||||
@@ -12,8 +12,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||
|
||||
|
||||
|
||||
@@ -23,8 +23,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
||||
)
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||
|
||||
|
||||
|
||||
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
|
||||
write_github_step_summary,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=900, stage="extra-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=243, stage="extra-b", runner_config="4-gpu-b200")
|
||||
|
||||
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4"
|
||||
SERVER_LAUNCH_TIMEOUT = 1000
|
||||
|
||||
@@ -11,7 +11,7 @@ from sglang.srt.utils import get_cuda_driver_bindings, is_flashinfer_available
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=30, stage="base-b", runner_config="2-gpu-large")
|
||||
register_cuda_ci(est_time=28, stage="base-b", runner_config="2-gpu-large")
|
||||
|
||||
WORLD_SIZE = 2
|
||||
|
||||
|
||||
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=126, stage="extra-a", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=139, stage="extra-a", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-small-amd")
|
||||
|
||||
|
||||
|
||||
@@ -26,7 +26,7 @@ from sglang.benchmark.serving import (
|
||||
from sglang.test.ci.ci_register import register_cpu_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
|
||||
register_cpu_ci(est_time=16, suite="base-a-test-cpu")
|
||||
|
||||
|
||||
def _free_port() -> int:
|
||||
|
||||
@@ -60,7 +60,7 @@ from sglang.benchmark.serving import (
|
||||
from sglang.test.ci.ci_register import register_cpu_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cpu_ci(est_time=30, suite="base-a-test-cpu")
|
||||
register_cpu_ci(est_time=38, suite="base-a-test-cpu")
|
||||
register_cpu_ci(est_time=46, suite="stage-b-test-cpu-intel")
|
||||
|
||||
|
||||
|
||||
@@ -13,7 +13,7 @@ from sglang.benchmark.steady_state import (
|
||||
)
|
||||
from sglang.test.ci.ci_register import register_cpu_ci
|
||||
|
||||
register_cpu_ci(est_time=5, suite="base-a-test-cpu")
|
||||
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
|
||||
|
||||
|
||||
class _StringTokenizer:
|
||||
|
||||
@@ -20,7 +20,7 @@ from sglang.srt.managers.schedule_batch import Modality, MultimodalDataItem
|
||||
from sglang.srt.runtime_context import get_context, get_parallel
|
||||
from sglang.test.ci.ci_register import register_cpu_ci
|
||||
|
||||
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
|
||||
register_cpu_ci(est_time=12, suite="base-a-test-cpu")
|
||||
|
||||
|
||||
@pytest.fixture(autouse=True)
|
||||
|
||||
@@ -10,7 +10,7 @@ from sglang.test.scripted_runtime_chunked_helpers import (
|
||||
run_until_finished,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=300, stage="extra-a", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=106, stage="extra-a", runner_config="1-gpu-small")
|
||||
register_amd_ci(est_time=198, stage="extra-a", runner_config="1-gpu-small-amd")
|
||||
|
||||
|
||||
|
||||
@@ -11,7 +11,7 @@ from sglang.test.scripted_runtime_chunked_helpers import (
|
||||
run_until_finished,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=900, stage="extra-b", runner_config="4-gpu-h100")
|
||||
register_cuda_ci(est_time=55, stage="extra-b", runner_config="4-gpu-h100")
|
||||
|
||||
|
||||
_CHUNK_SIZE = 64
|
||||
|
||||
@@ -5,7 +5,7 @@ from sglang.test.scripted_runtime.context import ScriptedContext
|
||||
from sglang.test.scripted_runtime.test_case import ScriptedTestCase
|
||||
from sglang.test.scripted_runtime_chunked_helpers import base_engine_kwargs
|
||||
|
||||
register_cuda_ci(est_time=400, stage="extra-a", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=130, stage="extra-a", runner_config="1-gpu-large")
|
||||
|
||||
|
||||
_SWA_MODEL = "openai/gpt-oss-20b"
|
||||
|
||||
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=135, stage="base-b", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=161, stage="base-b", runner_config="1-gpu-small")
|
||||
register_amd_ci(est_time=220, suite="stage-b-test-1-gpu-small-amd")
|
||||
|
||||
|
||||
|
||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=160, stage="base-a", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=97, stage="base-a", runner_config="1-gpu-small")
|
||||
register_amd_ci(est_time=160, suite="stage-a-test-1-gpu-small-amd")
|
||||
|
||||
|
||||
|
||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=200, stage="base-a", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=135, stage="base-a", runner_config="1-gpu-small")
|
||||
|
||||
|
||||
class TestBasicSanityDFlash(
|
||||
|
||||
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=180, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=97, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
TARGET_MODEL = "Qwen/Qwen3-14B"
|
||||
DRAFT_MODEL = "deepseek-ai/dspark_qwen3_14b_block7"
|
||||
|
||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=200, stage="base-a", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=167, stage="base-a", runner_config="1-gpu-small")
|
||||
register_amd_ci(est_time=200, suite="stage-a-test-1-gpu-small-amd")
|
||||
|
||||
|
||||
|
||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
||||
CustomTestCase,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=77, stage="base-b", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=38, stage="base-b", runner_config="1-gpu-small")
|
||||
register_amd_ci(est_time=77, suite="stage-b-test-1-gpu-small-amd")
|
||||
|
||||
|
||||
|
||||
@@ -8,7 +8,7 @@ from sglang.srt.utils import get_device, is_hip
|
||||
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||
from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=45, stage="base-b", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=32, stage="base-b", runner_config="1-gpu-small")
|
||||
register_amd_ci(est_time=55, suite="stage-b-test-1-gpu-small-amd")
|
||||
|
||||
_is_hip = is_hip()
|
||||
|
||||
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=120, stage="base-b", runner_config="2-gpu-large")
|
||||
register_cuda_ci(est_time=54, stage="base-b", runner_config="2-gpu-large")
|
||||
|
||||
|
||||
class TestTPServerGPUProcesses(CustomTestCase):
|
||||
|
||||
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
|
||||
send_generate_requests,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=53, stage="base-b", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=65, stage="base-b", runner_config="1-gpu-small")
|
||||
register_amd_ci(est_time=70, suite="stage-b-test-1-gpu-small-amd")
|
||||
|
||||
|
||||
|
||||
@@ -12,7 +12,7 @@ import pytest
|
||||
|
||||
from sglang.test.ci.ci_register import register_cpu_ci
|
||||
|
||||
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
|
||||
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
|
||||
|
||||
# Packages known to transitively depend on torch or triton.
|
||||
# If a new package is added to runtime_base and it pulls torch,
|
||||
|
||||
@@ -31,7 +31,7 @@ from sglang.test.test_utils import (
|
||||
run_logprob_check,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=260, stage="base-b", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=265, stage="base-b", runner_config="1-gpu-small")
|
||||
register_amd_ci(est_time=260, suite="stage-b-test-1-gpu-small-amd")
|
||||
|
||||
SERVER_ENV = {"SGLANG_USE_PICKLE_IPC": "0"}
|
||||
|
||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
||||
CustomTestCase,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=387, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=276, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=261, suite="stage-b-test-1-gpu-small-amd")
|
||||
|
||||
|
||||
|
||||
@@ -42,7 +42,7 @@ from sglang.srt.runtime_context import get_parallel
|
||||
from sglang.test.ci.ci_register import register_cpu_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cpu_ci(est_time=5, suite="base-a-test-cpu")
|
||||
register_cpu_ci(est_time=11, suite="base-a-test-cpu")
|
||||
|
||||
|
||||
class _ExtendMode:
|
||||
|
||||
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
|
||||
write_github_step_summary,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=500, stage="extra-b", runner_config="8-gpu-h200")
|
||||
register_cuda_ci(est_time=275, stage="extra-b", runner_config="8-gpu-h200")
|
||||
|
||||
DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324"
|
||||
|
||||
|
||||
@@ -22,7 +22,7 @@ from sglang.test.test_utils import (
|
||||
try_cached_model,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=235, stage="extra-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=689, stage="extra-b", runner_config="4-gpu-b200")
|
||||
|
||||
MODEL = "deepseek-ai/DeepSeek-V4-Flash"
|
||||
SERVER_LAUNCH_TIMEOUT = 3600
|
||||
|
||||
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
|
||||
write_github_step_summary,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=320, stage="extra-b", runner_config="8-gpu-h200")
|
||||
register_cuda_ci(est_time=314, stage="extra-b", runner_config="8-gpu-h200")
|
||||
GLM52_MODEL_PATH = "zai-org/GLM-5.2-FP8"
|
||||
SERVER_LAUNCH_TIMEOUT = max(DEFAULT_TIMEOUT_FOR_SERVER_LAUNCH, 1800)
|
||||
|
||||
|
||||
@@ -3,7 +3,7 @@ import unittest
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
from sglang.test.gpt_oss_common import BaseTestGptOss
|
||||
|
||||
register_cuda_ci(est_time=220, stage="extra-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=121, stage="extra-b", runner_config="4-gpu-b200")
|
||||
|
||||
|
||||
class TestGptOss4GpuMxfp4CP(BaseTestGptOss):
|
||||
|
||||
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=500, stage="extra-b", runner_config="4-gpu-h100")
|
||||
register_cuda_ci(est_time=466, stage="extra-b", runner_config="4-gpu-h100")
|
||||
|
||||
GQA_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8"
|
||||
|
||||
|
||||
@@ -26,7 +26,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=480, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=178, stage="base-b", runner_config="1-gpu-large")
|
||||
|
||||
BASE_MODEL = "Qwen/Qwen3-4B"
|
||||
LORA_ADAPTER = "nissenj/Qwen3-4B-lora-v2"
|
||||
|
||||
@@ -12,7 +12,7 @@ import unittest
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
from sglang.test.server_fixtures.pcg_spec_fixture import PCGSpecBase
|
||||
|
||||
register_cuda_ci(est_time=531, stage="base-b", runner_config="2-gpu-large")
|
||||
register_cuda_ci(est_time=106, stage="base-b", runner_config="2-gpu-large")
|
||||
|
||||
|
||||
class TestBCGWithEAGLE3(PCGSpecBase, unittest.TestCase):
|
||||
|
||||
@@ -24,7 +24,7 @@ from sglang.test.test_utils import (
|
||||
)
|
||||
|
||||
# CI Registration — large suite to fit the integration test's server startup.
|
||||
register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-large")
|
||||
register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-large")
|
||||
register_amd_ci(est_time=200, suite="stage-c-test-large-8-gpu-amd-mi35x")
|
||||
|
||||
|
||||
|
||||
@@ -33,7 +33,7 @@ from sglang.test.test_utils import (
|
||||
|
||||
# OSS FA4 coverage requires Blackwell. The PP test uses two GPUs; the other
|
||||
# tests use one GPU.
|
||||
register_cuda_ci(est_time=300, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=251, stage="base-b", runner_config="4-gpu-b200")
|
||||
|
||||
|
||||
def _prefill_graph_count(base_url: str) -> float:
|
||||
|
||||
@@ -5,7 +5,7 @@ import torch
|
||||
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
|
||||
register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-small")
|
||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small")
|
||||
|
||||
if not torch.cuda.is_available():
|
||||
pytest.skip("CUDA piecewise backend requires CUDA", allow_module_level=True)
|
||||
|
||||
@@ -33,7 +33,7 @@ from sglang.srt.mem_cache.memory_pool import HybridLinearKVPool
|
||||
from sglang.test.ci.ci_register import register_cpu_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
|
||||
register_cpu_ci(est_time=11, suite="base-a-test-cpu")
|
||||
|
||||
DCP_SIZES = [1, 2, 3, 4, 8]
|
||||
LENS = list(range(0, 41))
|
||||
|
||||
@@ -55,7 +55,7 @@ from sglang.test.test_utils import (
|
||||
# ---------------------------------------------------------------------------
|
||||
# CI registration — only TestDSV31DCP8TP8GSM8K runs in CI
|
||||
# ---------------------------------------------------------------------------
|
||||
register_cuda_ci(est_time=600, stage="extra-b", runner_config="8-gpu-h200")
|
||||
register_cuda_ci(est_time=213, stage="extra-b", runner_config="8-gpu-h200")
|
||||
|
||||
DEEPSEEK_V31_MODEL_PATH = "deepseek-ai/DeepSeek-V3.1"
|
||||
|
||||
|
||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=240, stage="extra-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=105, stage="extra-b", runner_config="4-gpu-b200")
|
||||
|
||||
KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct"
|
||||
CUDA_GRAPH_MAX_BS_DECODE = 256
|
||||
|
||||
@@ -22,7 +22,7 @@ from sglang.test.test_utils import (
|
||||
popen_launch_server,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=350, stage="extra-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=201, stage="extra-b", runner_config="4-gpu-b200")
|
||||
|
||||
KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct"
|
||||
GSM8K_SCORE_THRESHOLD = 0.88
|
||||
|
||||
@@ -23,7 +23,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode
|
||||
from sglang.test.ci.ci_register import register_cuda_ci
|
||||
from sglang.test.test_utils import CustomTestCase
|
||||
|
||||
register_cuda_ci(est_time=60, stage="base-b", runner_config="4-gpu-b200")
|
||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
|
||||
|
||||
NUM_DRAFT_TOKENS = 8
|
||||
DCP_SIZE = 4
|
||||
|
||||
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
|
||||
|
||||
QWEN3_8B_MODEL_PATH = "Qwen/Qwen3-8B"
|
||||
|
||||
register_cuda_ci(est_time=300, stage="base-c", runner_config="4-gpu-gb300")
|
||||
register_cuda_ci(est_time=125, stage="base-c", runner_config="4-gpu-gb300")
|
||||
|
||||
# Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner.
|
||||
NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 120
|
||||
|
||||
@@ -27,7 +27,7 @@ from sglang.test.test_utils import (
|
||||
DEFAULT_TARGET_MODEL_EAGLE3,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=730, stage="base-b", runner_config="2-gpu-large")
|
||||
register_cuda_ci(est_time=1007, stage="base-b", runner_config="2-gpu-large")
|
||||
|
||||
|
||||
class TestDisaggregationAccuracy(PauseResumeInPlaceMixin, PDDisaggregationServerBase):
|
||||
|
||||
@@ -26,7 +26,7 @@ from sglang.test.test_utils import (
|
||||
try_cached_model,
|
||||
)
|
||||
|
||||
register_cuda_ci(est_time=300, stage="base-c", runner_config="8-gpu-h20")
|
||||
register_cuda_ci(est_time=509, stage="base-c", runner_config="8-gpu-h20")
|
||||
|
||||
|
||||
def _has_nixl():
|
||||
|
||||
Some files were not shown because too many files have changed in this diff Show More
Reference in New Issue
Block a user