chore: update CI test est_time from recent run data

This commit is contained in:
sglang-bot
2026-09-28 00:00:30 +00:00
parent 8ac19cc19f
commit 3d8df4b127
1049 changed files with 1073 additions and 1073 deletions
@@ -15,7 +15,7 @@ from sglang.srt.layers.attention import aiter_mla_gluon as mod
from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=15, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="base-a-test-cpu")
_GLUON_FN = "sglang.srt.layers.attention.aiter_mla_gluon._gluon_fn" _GLUON_FN = "sglang.srt.layers.attention.aiter_mla_gluon._gluon_fn"
@@ -13,7 +13,7 @@ from sglang.test.ci.ci_register import (
register_xpu_ci, register_xpu_ci,
) )
register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=11, stage="stage-b", runner_config="1-gpu-large-amd") register_amd_ci(est_time=11, stage="stage-b", runner_config="1-gpu-large-amd")
register_xpu_ci(est_time=900, suite="stage-b-test-1-gpu-xpu") register_xpu_ci(est_time=900, suite="stage-b-test-1-gpu-xpu")
@@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
# Triton kernel unit test for KV indices creation # Triton kernel unit test for KV indices creation
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd")
@@ -24,7 +24,7 @@ from sglang.test.test_utils import (
is_in_amd_ci, is_in_amd_ci,
) )
register_cuda_ci(est_time=280, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=272, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd")
register_xpu_ci(est_time=207, suite="stage-b-test-1-gpu-xpu") register_xpu_ci(est_time=207, suite="stage-b-test-1-gpu-xpu")
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
) )
# FlashAttention4 integration test (requires SM 100+ / Blackwell B200) # FlashAttention4 integration test (requires SM 100+ / Blackwell B200)
register_cuda_ci(est_time=230, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=220, stage="base-b", runner_config="4-gpu-b200")
@unittest.skipIf(get_device_sm() < 100, "Test requires CUDA SM 100 or higher") @unittest.skipIf(get_device_sm() < 100, "Test requires CUDA SM 100 or higher")
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
# Hybrid attention backend tests (FA3 prefill + FlashInfer decode, requires SM 90+ / H100) # Hybrid attention backend tests (FA3 prefill + FlashInfer decode, requires SM 90+ / H100)
# Multiple test classes: base, MLA, TorchCompile, SpecDecode variants # Multiple test classes: base, MLA, TorchCompile, SpecDecode variants
register_cuda_ci(est_time=393, stage="extra-a", runner_config="1-gpu-large") register_cuda_ci(est_time=368, stage="extra-a", runner_config="1-gpu-large")
class TestHybridAttnBackendMLA(TestHybridAttnBackendBase): class TestHybridAttnBackendMLA(TestHybridAttnBackendBase):
@@ -19,7 +19,7 @@ from sglang.srt.utils.common import get_device
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=32, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=12, stage="stage-b", runner_config="1-gpu-large-amd") register_amd_ci(est_time=12, stage="stage-b", runner_config="1-gpu-large-amd")
@@ -21,7 +21,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
# Register this test for CUDA CI in base-b (fast attention/kernel tests) # Register this test for CUDA CI in base-b (fast attention/kernel tests)
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=17, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=17, suite="stage-b-test-1-gpu-large-amd")
@@ -12,7 +12,7 @@ from sglang.test.test_deterministic_utils import (
TestDeterministicBase, TestDeterministicBase,
) )
register_cuda_ci(est_time=119, stage="extra-b", runner_config="4-gpu-h100") register_cuda_ci(est_time=135, stage="extra-b", runner_config="4-gpu-h100")
QWEN35 = "Qwen/Qwen3.5-35B-A3B" QWEN35 = "Qwen/Qwen3.5-35B-A3B"
@@ -18,7 +18,7 @@ from sglang.test.test_utils import (
) )
# Torch native attention backend integration test with MMLU eval # Torch native attention backend integration test with MMLU eval
register_cuda_ci(est_time=310, stage="extra-a", runner_config="1-gpu-small") register_cuda_ci(est_time=312, stage="extra-a", runner_config="1-gpu-small")
register_amd_ci(est_time=150, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=150, suite="stage-b-test-1-gpu-small-amd")
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
) )
# Sliding window attention with Triton backend (Gemma-3 model) # Sliding window attention with Triton backend (Gemma-3 model)
register_cuda_ci(est_time=80, stage="extra-a", runner_config="1-gpu-large") register_cuda_ci(est_time=81, stage="extra-a", runner_config="1-gpu-large")
register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd")
@@ -17,7 +17,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
# trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell. # trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell.
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=8, stage="base-b", runner_config="4-gpu-b200")
DEVICE = "cuda" DEVICE = "cuda"
PAGE_SIZE = 32 PAGE_SIZE = 32
@@ -23,7 +23,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode
from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.ci.ci_register import register_cuda_ci
# trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell. # trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell.
register_cuda_ci(est_time=16, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
DEVICE = "cuda" DEVICE = "cuda"
PAGE_SIZE = 128 PAGE_SIZE = 128
@@ -25,7 +25,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
# Triton kernel unit test for the trtllm_mha device-side page-table build. # Triton kernel unit test for the trtllm_mha device-side page-table build.
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=14, stage="stage-b", runner_config="1-gpu-small-amd") register_amd_ci(est_time=14, stage="stage-b", runner_config="1-gpu-small-amd")
@@ -27,7 +27,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=71, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-large")
KIMI_LINEAR_MODEL = "yujiepan/kimi-linear-tiny-random" KIMI_LINEAR_MODEL = "yujiepan/kimi-linear-tiny-random"
SERVER_ENV = {"SGLANG_BATCH_INVARIANT_OPS_ENABLE_MM_DEEPGEMM": "0"} SERVER_ENV = {"SGLANG_BATCH_INVARIANT_OPS_ENABLE_MM_DEEPGEMM": "0"}
@@ -36,7 +36,7 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=11, stage="base-a", runner_config="1-gpu-small") register_cuda_ci(est_time=10, stage="base-a", runner_config="1-gpu-small")
_EXTEND_CASE = DenseAttentionCase( _EXTEND_CASE = DenseAttentionCase(
name="extend_no_prefix_smoke", name="extend_no_prefix_smoke",
@@ -30,7 +30,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=18, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -29,8 +29,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=27, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=23, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=22, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -26,8 +26,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=16, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=26, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf( @unittest.skipIf(
@@ -14,8 +14,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=16, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=36, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -18,8 +18,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf( @unittest.skipIf(
@@ -21,8 +21,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -11,8 +11,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -30,8 +30,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=38, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=19, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=36, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-large-amd")
@@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=17, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=18, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf( @unittest.skipIf(
@@ -30,8 +30,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_draft_runner i
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=22, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=26, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -48,7 +48,7 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
) )
register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -25,7 +25,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large")
_cuda_major = int(torch.version.cuda.split(".")[0]) if torch.version.cuda else 0 _cuda_major = int(torch.version.cuda.split(".")[0]) if torch.version.cuda else 0
@@ -45,7 +45,7 @@ import torch
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -15,7 +15,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -29,8 +29,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -32,7 +32,7 @@ from sglang.test.kits.attention_unittest.attention_methods.mla_attention import
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
_KV_LORA_RANK = DEFAULT_KV_LORA_RANK _KV_LORA_RANK = DEFAULT_KV_LORA_RANK
@@ -24,7 +24,7 @@ from sglang.srt.layers.attention.linear.kernels.kda_flashinfer import (
from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large")
class TestBuildFusedAcceptIndices(CustomTestCase): class TestBuildFusedAcceptIndices(CustomTestCase):
@@ -22,8 +22,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -19,7 +19,7 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -32,8 +32,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -7,7 +7,7 @@ from sglang.srt.layers.attention.mamba.replay_state_indices_validator import (
) )
from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=6, suite="base-a-test-cpu") register_cpu_ci(est_time=5, suite="base-a-test-cpu")
class TestReplayStateIndicesValidator(unittest.TestCase): class TestReplayStateIndicesValidator(unittest.TestCase):
@@ -32,7 +32,7 @@ MLA_SHAPE_KWARGS = dict(
from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
@@ -56,7 +56,7 @@ MLA_SHAPE_KWARGS = dict(
from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not _SUPPORTED, _SKIP_REASON) @unittest.skipIf(not _SUPPORTED, _SKIP_REASON)
@@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=17, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
@@ -24,8 +24,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
@unittest.skipIf( @unittest.skipIf(
@@ -24,7 +24,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode
from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="base-a-test-cpu")
class TestSWAKVPoolSetKVBuffer(CustomTestCase): class TestSWAKVPoolSetKVBuffer(CustomTestCase):
@@ -12,8 +12,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -23,8 +23,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
) )
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
write_github_step_summary, write_github_step_summary,
) )
register_cuda_ci(est_time=243, stage="extra-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=259, stage="extra-b", runner_config="4-gpu-b200")
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4"
SERVER_LAUNCH_TIMEOUT = 1000 SERVER_LAUNCH_TIMEOUT = 1000
@@ -11,7 +11,7 @@ from sglang.srt.utils import get_cuda_driver_bindings, is_flashinfer_available
from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=28, stage="base-b", runner_config="2-gpu-large") register_cuda_ci(est_time=26, stage="base-b", runner_config="2-gpu-large")
WORLD_SIZE = 2 WORLD_SIZE = 2
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=139, stage="extra-a", runner_config="1-gpu-large") register_cuda_ci(est_time=131, stage="extra-a", runner_config="1-gpu-large")
register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-small-amd")
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
run_bench_serving, run_bench_serving,
) )
register_cuda_ci(est_time=145, stage="extra-a", runner_config="1-gpu-large") register_cuda_ci(est_time=136, stage="extra-a", runner_config="1-gpu-large")
class TestEagle3Latency(CustomTestCase): class TestEagle3Latency(CustomTestCase):
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
run_embeddings_benchmark_multi, run_embeddings_benchmark_multi,
) )
register_cuda_ci(est_time=245, stage="extra-a", runner_config="1-gpu-large") register_cuda_ci(est_time=215, stage="extra-a", runner_config="1-gpu-large")
register_amd_ci(est_time=240, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=240, suite="stage-b-test-1-gpu-large-amd")
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
run_bench_serving, run_bench_serving,
) )
register_cuda_ci(est_time=490, stage="extra-a", runner_config="1-gpu-large") register_cuda_ci(est_time=247, stage="extra-a", runner_config="1-gpu-large")
register_amd_ci(est_time=430, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=430, suite="stage-b-test-1-gpu-large-amd")
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
run_bench_serving, run_bench_serving,
) )
register_cuda_ci(est_time=290, stage="extra-a", runner_config="2-gpu-large") register_cuda_ci(est_time=271, stage="extra-a", runner_config="2-gpu-large")
register_amd_ci(est_time=770, suite="stage-b-test-2-gpu-large-amd") register_amd_ci(est_time=770, suite="stage-b-test-2-gpu-large-amd")
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
run_bench_serving, run_bench_serving,
) )
register_cuda_ci(est_time=490, stage="extra-a", runner_config="2-gpu-large") register_cuda_ci(est_time=325, stage="extra-a", runner_config="2-gpu-large")
register_amd_ci(est_time=1030, suite="stage-b-test-2-gpu-large-amd") register_amd_ci(est_time=1030, suite="stage-b-test-2-gpu-large-amd")
+1 -1
View File
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
run_score_benchmark_multi, run_score_benchmark_multi,
) )
register_cuda_ci(est_time=215, stage="extra-a", runner_config="1-gpu-large") register_cuda_ci(est_time=185, stage="extra-a", runner_config="1-gpu-large")
register_amd_ci(est_time=210, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=210, suite="stage-b-test-1-gpu-large-amd")
@@ -10,7 +10,7 @@ from sglang.test.test_utils import (
run_bench_serving, run_bench_serving,
) )
register_cuda_ci(est_time=190, stage="extra-a", runner_config="1-gpu-large") register_cuda_ci(est_time=182, stage="extra-a", runner_config="1-gpu-large")
register_amd_ci(est_time=165, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=165, suite="stage-b-test-1-gpu-large-amd")
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
run_bench_serving, run_bench_serving,
) )
register_cuda_ci(est_time=710, stage="extra-a", runner_config="1-gpu-large") register_cuda_ci(est_time=660, stage="extra-a", runner_config="1-gpu-large")
register_amd_ci(est_time=810, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=810, suite="stage-b-test-1-gpu-large-amd")
@@ -10,7 +10,7 @@ from sglang.test.test_utils import (
run_bench_offline_throughput, run_bench_offline_throughput,
) )
register_cuda_ci(est_time=75, stage="extra-a", runner_config="2-gpu-large") register_cuda_ci(est_time=85, stage="extra-a", runner_config="2-gpu-large")
register_amd_ci(est_time=280, suite="stage-b-test-2-gpu-large-amd") register_amd_ci(est_time=280, suite="stage-b-test-2-gpu-large-amd")
@@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.kits.vlm_perf_kit import check_vlm_serving_perf from sglang.test.kits.vlm_perf_kit import check_vlm_serving_perf
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=150, stage="extra-a", runner_config="1-gpu-large") register_cuda_ci(est_time=152, stage="extra-a", runner_config="1-gpu-large")
class TestVLMServingFa3(CustomTestCase): class TestVLMServingFa3(CustomTestCase):
@@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.kits.vlm_perf_kit import check_vlm_serving_perf from sglang.test.kits.vlm_perf_kit import check_vlm_serving_perf
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=195, stage="extra-a", runner_config="1-gpu-small") register_cuda_ci(est_time=191, stage="extra-a", runner_config="1-gpu-small")
class TestVLMServingFlashinfer(CustomTestCase): class TestVLMServingFlashinfer(CustomTestCase):
@@ -26,7 +26,7 @@ from sglang.benchmark.serving import (
from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=16, suite="base-a-test-cpu") register_cpu_ci(est_time=13, suite="base-a-test-cpu")
def _free_port() -> int: def _free_port() -> int:
@@ -60,7 +60,7 @@ from sglang.benchmark.serving import (
from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=38, suite="base-a-test-cpu") register_cpu_ci(est_time=36, suite="base-a-test-cpu")
register_cpu_ci(est_time=46, suite="stage-b-test-cpu-intel") register_cpu_ci(est_time=46, suite="stage-b-test-cpu-intel")
@@ -13,7 +13,7 @@ from sglang.benchmark.steady_state import (
) )
from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_cpu_ci(est_time=7, suite="base-a-test-cpu")
class _StringTokenizer: class _StringTokenizer:
@@ -25,7 +25,7 @@ from sglang.srt.multimodal.transport.cuda_ipc import (
from sglang.srt.runtime_context import get_context, get_parallel from sglang.srt.runtime_context import get_context, get_parallel
from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=12, suite="base-a-test-cpu") register_cpu_ci(est_time=9, suite="base-a-test-cpu")
@pytest.fixture(autouse=True) @pytest.fixture(autouse=True)
@@ -10,7 +10,7 @@ from sglang.test.scripted_runtime_chunked_helpers import (
run_until_finished, run_until_finished,
) )
register_cuda_ci(est_time=106, stage="extra-a", runner_config="1-gpu-small") register_cuda_ci(est_time=103, stage="extra-a", runner_config="1-gpu-small")
register_amd_ci(est_time=198, stage="extra-a", runner_config="1-gpu-small-amd") register_amd_ci(est_time=198, stage="extra-a", runner_config="1-gpu-small-amd")
@@ -11,7 +11,7 @@ from sglang.test.scripted_runtime_chunked_helpers import (
run_until_finished, run_until_finished,
) )
register_cuda_ci(est_time=55, stage="extra-b", runner_config="4-gpu-h100") register_cuda_ci(est_time=96, stage="extra-b", runner_config="4-gpu-h100")
_CHUNK_SIZE = 64 _CHUNK_SIZE = 64
@@ -5,7 +5,7 @@ from sglang.test.scripted_runtime.context import ScriptedContext
from sglang.test.scripted_runtime.test_case import ScriptedTestCase from sglang.test.scripted_runtime.test_case import ScriptedTestCase
from sglang.test.scripted_runtime_chunked_helpers import base_engine_kwargs from sglang.test.scripted_runtime_chunked_helpers import base_engine_kwargs
register_cuda_ci(est_time=130, stage="extra-a", runner_config="1-gpu-large") register_cuda_ci(est_time=137, stage="extra-a", runner_config="1-gpu-large")
_SWA_MODEL = "openai/gpt-oss-20b" _SWA_MODEL = "openai/gpt-oss-20b"
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=161, stage="base-b", runner_config="1-gpu-small") register_cuda_ci(est_time=149, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=220, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=220, suite="stage-b-test-1-gpu-small-amd")
+1 -1
View File
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=97, stage="base-a", runner_config="1-gpu-small") register_cuda_ci(est_time=112, stage="base-a", runner_config="1-gpu-small")
register_amd_ci(est_time=160, suite="stage-a-test-1-gpu-small-amd") register_amd_ci(est_time=160, suite="stage-a-test-1-gpu-small-amd")
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=135, stage="base-a", runner_config="1-gpu-small") register_cuda_ci(est_time=94, stage="base-a", runner_config="1-gpu-small")
class TestBasicSanityDFlash( class TestBasicSanityDFlash(
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=97, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=92, stage="base-b", runner_config="1-gpu-large")
TARGET_MODEL = "Qwen/Qwen3-14B" TARGET_MODEL = "Qwen/Qwen3-14B"
DRAFT_MODEL = "deepseek-ai/dspark_qwen3_14b_block7" DRAFT_MODEL = "deepseek-ai/dspark_qwen3_14b_block7"
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=167, stage="base-a", runner_config="1-gpu-small") register_cuda_ci(est_time=112, stage="base-a", runner_config="1-gpu-small")
register_amd_ci(est_time=200, suite="stage-a-test-1-gpu-small-amd") register_amd_ci(est_time=200, suite="stage-a-test-1-gpu-small-amd")
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
CustomTestCase, CustomTestCase,
) )
register_cuda_ci(est_time=77, stage="base-b", runner_config="1-gpu-small") register_cuda_ci(est_time=34, stage="base-b", runner_config="1-gpu-small")
class TestEngineChildPids(CustomTestCase): class TestEngineChildPids(CustomTestCase):
+1 -1
View File
@@ -8,7 +8,7 @@ from sglang.srt.utils import get_device, is_hip
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase
register_cuda_ci(est_time=32, stage="base-b", runner_config="1-gpu-small") register_cuda_ci(est_time=31, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=55, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=55, suite="stage-b-test-1-gpu-small-amd")
_is_hip = is_hip() _is_hip = is_hip()
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=54, stage="base-b", runner_config="2-gpu-large") register_cuda_ci(est_time=53, stage="base-b", runner_config="2-gpu-large")
class TestTPServerGPUProcesses(CustomTestCase): class TestTPServerGPUProcesses(CustomTestCase):
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
send_generate_requests, send_generate_requests,
) )
register_cuda_ci(est_time=53, stage="base-b", runner_config="1-gpu-small") register_cuda_ci(est_time=63, stage="base-b", runner_config="1-gpu-small")
class TestMaxQueuedRequests(CustomTestCase): class TestMaxQueuedRequests(CustomTestCase):
+1 -1
View File
@@ -12,7 +12,7 @@ import pytest
from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.ci.ci_register import register_cpu_ci
register_cpu_ci(est_time=7, suite="base-a-test-cpu") register_cpu_ci(est_time=5, suite="base-a-test-cpu")
# Packages known to transitively depend on torch or triton. # Packages known to transitively depend on torch or triton.
# If a new package is added to runtime_base and it pulls torch, # If a new package is added to runtime_base and it pulls torch,
+1 -1
View File
@@ -31,7 +31,7 @@ from sglang.test.test_utils import (
run_logprob_check, run_logprob_check,
) )
register_cuda_ci(est_time=265, stage="base-b", runner_config="1-gpu-small") register_cuda_ci(est_time=250, stage="base-b", runner_config="1-gpu-small")
register_amd_ci(est_time=260, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=260, suite="stage-b-test-1-gpu-small-amd")
SERVER_ENV = {"SGLANG_USE_PICKLE_IPC": "0"} SERVER_ENV = {"SGLANG_USE_PICKLE_IPC": "0"}
+1 -1
View File
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
CustomTestCase, CustomTestCase,
) )
register_cuda_ci(est_time=276, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=286, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=261, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=261, suite="stage-b-test-1-gpu-small-amd")
+1 -1
View File
@@ -41,7 +41,7 @@ from sglang.srt.runtime_context import get_parallel
from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="base-a-test-cpu")
class _ExtendMode: class _ExtendMode:
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
write_github_step_summary, write_github_step_summary,
) )
register_cuda_ci(est_time=275, stage="extra-b", runner_config="8-gpu-h200") register_cuda_ci(est_time=334, stage="extra-b", runner_config="8-gpu-h200")
DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324" DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324"
@@ -22,7 +22,7 @@ from sglang.test.test_utils import (
try_cached_model, try_cached_model,
) )
register_cuda_ci(est_time=689, stage="extra-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=654, stage="extra-b", runner_config="4-gpu-b200")
MODEL = "deepseek-ai/DeepSeek-V4-Flash" MODEL = "deepseek-ai/DeepSeek-V4-Flash"
SERVER_LAUNCH_TIMEOUT = 3600 SERVER_LAUNCH_TIMEOUT = 3600
+1 -1
View File
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
write_github_step_summary, write_github_step_summary,
) )
register_cuda_ci(est_time=314, stage="extra-b", runner_config="8-gpu-h200") register_cuda_ci(est_time=433, stage="extra-b", runner_config="8-gpu-h200")
GLM52_MODEL_PATH = "zai-org/GLM-5.2-FP8" GLM52_MODEL_PATH = "zai-org/GLM-5.2-FP8"
SERVER_LAUNCH_TIMEOUT = max(DEFAULT_TIMEOUT_FOR_SERVER_LAUNCH, 1800) SERVER_LAUNCH_TIMEOUT = max(DEFAULT_TIMEOUT_FOR_SERVER_LAUNCH, 1800)
@@ -3,7 +3,7 @@ import unittest
from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.gpt_oss_common import BaseTestGptOss from sglang.test.gpt_oss_common import BaseTestGptOss
register_cuda_ci(est_time=121, stage="extra-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=127, stage="extra-b", runner_config="4-gpu-b200")
class TestGptOss4GpuMxfp4CP(BaseTestGptOss): class TestGptOss4GpuMxfp4CP(BaseTestGptOss):
+1 -1
View File
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=466, stage="extra-b", runner_config="4-gpu-h100") register_cuda_ci(est_time=553, stage="extra-b", runner_config="4-gpu-h100")
GQA_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8" GQA_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8"
@@ -12,7 +12,7 @@ import unittest
from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.server_fixtures.pcg_spec_fixture import PCGSpecBase from sglang.test.server_fixtures.pcg_spec_fixture import PCGSpecBase
register_cuda_ci(est_time=106, stage="base-b", runner_config="2-gpu-large") register_cuda_ci(est_time=103, stage="base-b", runner_config="2-gpu-large")
class TestBCGWithEAGLE3(PCGSpecBase, unittest.TestCase): class TestBCGWithEAGLE3(PCGSpecBase, unittest.TestCase):
@@ -24,7 +24,7 @@ from sglang.test.test_utils import (
) )
# CI Registration — large suite to fit the integration test's server startup. # CI Registration — large suite to fit the integration test's server startup.
register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-large") register_cuda_ci(est_time=88, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=200, suite="stage-c-test-large-8-gpu-amd-mi35x") register_amd_ci(est_time=200, suite="stage-c-test-large-8-gpu-amd-mi35x")
@@ -33,7 +33,7 @@ from sglang.test.test_utils import (
# OSS FA4 coverage requires Blackwell. The PP test uses two GPUs; the other # OSS FA4 coverage requires Blackwell. The PP test uses two GPUs; the other
# tests use one GPU. # tests use one GPU.
register_cuda_ci(est_time=251, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=278, stage="base-b", runner_config="4-gpu-b200")
def _prefill_graph_count(base_url: str) -> float: def _prefill_graph_count(base_url: str) -> float:
@@ -5,7 +5,7 @@ import torch
from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small")
if not torch.cuda.is_available(): if not torch.cuda.is_available():
pytest.skip("CUDA piecewise backend requires CUDA", allow_module_level=True) pytest.skip("CUDA piecewise backend requires CUDA", allow_module_level=True)
+1 -1
View File
@@ -33,7 +33,7 @@ from sglang.srt.mem_cache.memory_pool import HybridLinearKVPool
from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="base-a-test-cpu")
DCP_SIZES = [1, 2, 3, 4, 8] DCP_SIZES = [1, 2, 3, 4, 8]
LENS = list(range(0, 41)) LENS = list(range(0, 41))
+1 -1
View File
@@ -55,7 +55,7 @@ from sglang.test.test_utils import (
# --------------------------------------------------------------------------- # ---------------------------------------------------------------------------
# CI registration — only TestDSV31DCP8TP8GSM8K runs in CI # CI registration — only TestDSV31DCP8TP8GSM8K runs in CI
# --------------------------------------------------------------------------- # ---------------------------------------------------------------------------
register_cuda_ci(est_time=213, stage="extra-b", runner_config="8-gpu-h200") register_cuda_ci(est_time=248, stage="extra-b", runner_config="8-gpu-h200")
DEEPSEEK_V31_MODEL_PATH = "deepseek-ai/DeepSeek-V3.1" DEEPSEEK_V31_MODEL_PATH = "deepseek-ai/DeepSeek-V3.1"
+1 -1
View File
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=105, stage="extra-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=98, stage="extra-b", runner_config="4-gpu-b200")
KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct" KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct"
CUDA_GRAPH_MAX_BS_DECODE = 256 CUDA_GRAPH_MAX_BS_DECODE = 256
@@ -22,7 +22,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=201, stage="extra-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=206, stage="extra-b", runner_config="4-gpu-b200")
KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct" KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct"
GSM8K_SCORE_THRESHOLD = 0.88 GSM8K_SCORE_THRESHOLD = 0.88
@@ -18,7 +18,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.layer_ut_utils import init_single_process_dist from sglang.test.layer_ut_utils import init_single_process_dist
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small")
# Backend-specific: the hook resolves get_device() and the matching distributed # Backend-specific: the hook resolves get_device() and the matching distributed
# backend, so only an AMD run exercises the HIP device and dump path. # backend, so only an AMD run exercises the HIP device and dump path.
register_amd_ci(est_time=15, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=15, suite="stage-b-test-1-gpu-small-amd")
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
QWEN3_8B_MODEL_PATH = "Qwen/Qwen3-8B" QWEN3_8B_MODEL_PATH = "Qwen/Qwen3-8B"
register_cuda_ci(est_time=125, stage="base-c", runner_config="4-gpu-gb300") register_cuda_ci(est_time=137, stage="base-c", runner_config="4-gpu-gb300")
# Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner. # Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner.
NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 120 NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 120
@@ -27,7 +27,7 @@ from sglang.test.test_utils import (
DEFAULT_TARGET_MODEL_EAGLE3, DEFAULT_TARGET_MODEL_EAGLE3,
) )
register_cuda_ci(est_time=1007, stage="base-b", runner_config="2-gpu-large") register_cuda_ci(est_time=895, stage="base-b", runner_config="2-gpu-large")
class TestDisaggregationAccuracy(PauseResumeInPlaceMixin, PDDisaggregationServerBase): class TestDisaggregationAccuracy(PauseResumeInPlaceMixin, PDDisaggregationServerBase):
@@ -12,7 +12,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import (
) )
from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST
register_cuda_ci(est_time=120, stage="base-b", runner_config="2-gpu-large") register_cuda_ci(est_time=98, stage="base-b", runner_config="2-gpu-large")
PD_CHUNKED_ABORT_EXTRA_ARGS = [ PD_CHUNKED_ABORT_EXTRA_ARGS = [
"--max-running-requests", "--max-running-requests",
@@ -26,7 +26,7 @@ from sglang.test.test_utils import (
try_cached_model, try_cached_model,
) )
register_cuda_ci(est_time=170, stage="base-c", runner_config="8-gpu-h20") register_cuda_ci(est_time=164, stage="base-c", runner_config="8-gpu-h20")
def _has_mooncake(): def _has_mooncake():
@@ -17,7 +17,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import (
) )
from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST_MXFP4_WITH_MOE, is_in_ci from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST_MXFP4_WITH_MOE, is_in_ci
register_cuda_ci(est_time=365, stage="extra-b", runner_config="8-gpu-h200") register_cuda_ci(est_time=334, stage="extra-b", runner_config="8-gpu-h200")
SWA_SERVER_ARGS = ["--page-size", "64", "--attention-backend", "triton"] SWA_SERVER_ARGS = ["--page-size", "64", "--attention-backend", "triton"]
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
try_cached_model, try_cached_model,
) )
register_cuda_ci(est_time=1171, stage="base-c", runner_config="8-gpu-h20") register_cuda_ci(est_time=1180, stage="base-c", runner_config="8-gpu-h20")
class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase): class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase):
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
try_cached_model, try_cached_model,
) )
register_cuda_ci(est_time=140, stage="base-c", runner_config="8-gpu-h20") register_cuda_ci(est_time=141, stage="base-c", runner_config="8-gpu-h20")
class TestDisaggregationDPAttention(PDDisaggregationServerBase): class TestDisaggregationDPAttention(PDDisaggregationServerBase):
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
try_cached_model, try_cached_model,
) )
register_cuda_ci(est_time=184, stage="base-c", runner_config="8-gpu-h200") register_cuda_ci(est_time=206, stage="base-c", runner_config="8-gpu-h200")
DSV4_FLASH_MODEL = "sgl-project/DeepSeek-V4-Flash-FP8" DSV4_FLASH_MODEL = "sgl-project/DeepSeek-V4-Flash-FP8"

Some files were not shown because too many files have changed in this diff Show More