diff --git a/test/registered/4-gpu-models/test_gpt_oss_4gpu.py b/test/registered/4-gpu-models/test_gpt_oss_4gpu.py index c31deb720..58c71e72b 100644 --- a/test/registered/4-gpu-models/test_gpt_oss_4gpu.py +++ b/test/registered/4-gpu-models/test_gpt_oss_4gpu.py @@ -3,8 +3,8 @@ import unittest from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=328, suite="stage-c-test-4-gpu-h100") -register_cuda_ci(est_time=740, suite="stage-c-test-4-gpu-b200-small") +register_cuda_ci(est_time=392, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=584, suite="stage-c-test-4-gpu-b200-small") class TestGptOss4Gpu(BaseTestGptOss): diff --git a/test/registered/4-gpu-models/test_qwen35_fp4_mtp_v2.py b/test/registered/4-gpu-models/test_qwen35_fp4_mtp_v2.py index 53c8e7917..1f7034286 100644 --- a/test/registered/4-gpu-models/test_qwen35_fp4_mtp_v2.py +++ b/test/registered/4-gpu-models/test_qwen35_fp4_mtp_v2.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=540, suite="stage-c-test-4-gpu-b200-small") +register_cuda_ci(est_time=422, suite="stage-c-test-4-gpu-b200-small") QWEN35_FP4_MODEL = "nvidia/Qwen3.5-397B-A17B-NVFP4" ACC_THRESHOLDS = {QWEN35_FP4_MODEL: {"gsm8k": 0.95}} diff --git a/test/registered/4-gpu-models/test_qwen35_fp4_triton.py b/test/registered/4-gpu-models/test_qwen35_fp4_triton.py index 29b7e5ce0..96363bf69 100644 --- a/test/registered/4-gpu-models/test_qwen35_fp4_triton.py +++ b/test/registered/4-gpu-models/test_qwen35_fp4_triton.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( ModelLaunchSettings, ) -register_cuda_ci(est_time=720, suite="stage-c-test-4-gpu-b200-small") +register_cuda_ci(est_time=563, suite="stage-c-test-4-gpu-b200-small") QWEN35_FP4_MODEL = "nvidia/Qwen3.5-397B-A17B-NVFP4" ACC_THRESHOLDS = {QWEN35_FP4_MODEL: {"gsm8k": 0.95}} diff --git a/test/registered/4-gpu-models/test_qwen3_30b.py b/test/registered/4-gpu-models/test_qwen3_30b.py index 487445a24..d2461da92 100644 --- a/test/registered/4-gpu-models/test_qwen3_30b.py +++ b/test/registered/4-gpu-models/test_qwen3_30b.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=146, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=261, suite="stage-c-test-4-gpu-h100") QWEN3_30B_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8" diff --git a/test/registered/4-gpu-models/test_qwen3_next_models.py b/test/registered/4-gpu-models/test_qwen3_next_models.py index c9bc1839e..d6a801d52 100644 --- a/test/registered/4-gpu-models/test_qwen3_next_models.py +++ b/test/registered/4-gpu-models/test_qwen3_next_models.py @@ -6,7 +6,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=119, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=142, suite="stage-c-test-4-gpu-h100") QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct" diff --git a/test/registered/8-gpu-models/test_deepseek_v32_indexcache.py b/test/registered/8-gpu-models/test_deepseek_v32_indexcache.py index 320e23028..e9b3d8633 100644 --- a/test/registered/8-gpu-models/test_deepseek_v32_indexcache.py +++ b/test/registered/8-gpu-models/test_deepseek_v32_indexcache.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=354, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=492, suite="stage-c-test-8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" diff --git a/test/registered/8-gpu-models/test_deepseek_v3_basic.py b/test/registered/8-gpu-models/test_deepseek_v3_basic.py index c814ed127..cd0bc5c2c 100644 --- a/test/registered/8-gpu-models/test_deepseek_v3_basic.py +++ b/test/registered/8-gpu-models/test_deepseek_v3_basic.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=320, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=301, suite="stage-c-test-8-gpu-h200") FULL_DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324" diff --git a/test/registered/8-gpu-models/test_deepseek_v3_mtp.py b/test/registered/8-gpu-models/test_deepseek_v3_mtp.py index 805db513d..8089d1167 100644 --- a/test/registered/8-gpu-models/test_deepseek_v3_mtp.py +++ b/test/registered/8-gpu-models/test_deepseek_v3_mtp.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=198, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=309, suite="stage-c-test-8-gpu-h200") FULL_DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324" diff --git a/test/registered/8-gpu-models/test_dsa_models_basic.py b/test/registered/8-gpu-models/test_dsa_models_basic.py index cc6caffd2..ca1ebcd75 100644 --- a/test/registered/8-gpu-models/test_dsa_models_basic.py +++ b/test/registered/8-gpu-models/test_dsa_models_basic.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=966, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=1047, suite="stage-c-test-8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" GLM5_MODEL_PATH = "zai-org/GLM-5-FP8" diff --git a/test/registered/8-gpu-models/test_dsa_models_mtp.py b/test/registered/8-gpu-models/test_dsa_models_mtp.py index 9c0b2dcef..fe5ffe1c7 100644 --- a/test/registered/8-gpu-models/test_dsa_models_mtp.py +++ b/test/registered/8-gpu-models/test_dsa_models_mtp.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=910, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=1048, suite="stage-c-test-8-gpu-h200") FULL_DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" GLM5_MODEL_PATH = "zai-org/GLM-5-FP8" diff --git a/test/registered/8-gpu-models/test_mimo_models.py b/test/registered/8-gpu-models/test_mimo_models.py index fe79139bd..e2651ad30 100644 --- a/test/registered/8-gpu-models/test_mimo_models.py +++ b/test/registered/8-gpu-models/test_mimo_models.py @@ -5,7 +5,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.kits.spec_decoding_kit import SpecDecodingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=283, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=330, suite="stage-c-test-8-gpu-h200") class TestMiMoV2Flash(GSM8KMixin, SpecDecodingMixin, DefaultServerBase): diff --git a/test/registered/8-gpu-models/test_minimax_m25_basic.py b/test/registered/8-gpu-models/test_minimax_m25_basic.py index f99e4c3cd..894dfe89b 100644 --- a/test/registered/8-gpu-models/test_minimax_m25_basic.py +++ b/test/registered/8-gpu-models/test_minimax_m25_basic.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=330, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=307, suite="stage-c-test-8-gpu-h200") MINIMAX_M25_MODEL_PATH = "MiniMaxAI/MiniMax-M2.5" diff --git a/test/registered/8-gpu-models/test_nvidia_nemotron_3_super_bf16.py b/test/registered/8-gpu-models/test_nvidia_nemotron_3_super_bf16.py index 5d2200f3c..0e35999b3 100644 --- a/test/registered/8-gpu-models/test_nvidia_nemotron_3_super_bf16.py +++ b/test/registered/8-gpu-models/test_nvidia_nemotron_3_super_bf16.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=319, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=376, suite="stage-c-test-8-gpu-h200") NEMOTRON_3_SUPER_BF16_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16" diff --git a/test/registered/8-gpu-models/test_step3p5_flash_chain_mtp.py b/test/registered/8-gpu-models/test_step3p5_flash_chain_mtp.py index 40d188180..15abe79ce 100644 --- a/test/registered/8-gpu-models/test_step3p5_flash_chain_mtp.py +++ b/test/registered/8-gpu-models/test_step3p5_flash_chain_mtp.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=500, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=663, suite="stage-c-test-8-gpu-h200") STEP3P5_FLASH_MODEL_PATH = "stepfun-ai/Step-3.5-Flash" diff --git a/test/registered/attention/test_chunk_gated_delta_rule.py b/test/registered/attention/test_chunk_gated_delta_rule.py index f1ac1a40f..e9f9c7ad5 100644 --- a/test/registered/attention/test_chunk_gated_delta_rule.py +++ b/test/registered/attention/test_chunk_gated_delta_rule.py @@ -8,7 +8,7 @@ from sglang.srt.layers.attention.fla.fused_recurrent import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=5, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=11, suite="stage-b-test-1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "Test requires CUDA") diff --git a/test/registered/attention/test_fa3.py b/test/registered/attention/test_fa3.py index b941e134d..87fd59ac4 100644 --- a/test/registered/attention/test_fa3.py +++ b/test/registered/attention/test_fa3.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( # FlashAttention3 integration tests (requires SM 90+ / H100) # Multiple test classes: FA3, FA3+MLA, FA3+SpecDecode variants -register_cuda_ci(est_time=386, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=551, suite="stage-b-test-1-gpu-large") GSM_DATASET_PATH = None diff --git a/test/registered/attention/test_flash_attention_4.py b/test/registered/attention/test_flash_attention_4.py index 83a34c968..229096307 100644 --- a/test/registered/attention/test_flash_attention_4.py +++ b/test/registered/attention/test_flash_attention_4.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( ) # FlashAttention4 integration test (requires SM 100+ / Blackwell B200) -register_cuda_ci(est_time=332, suite="stage-b-test-4-gpu-b200") +register_cuda_ci(est_time=265, suite="stage-b-test-4-gpu-b200") @unittest.skipIf(get_device_sm() < 100, "Test requires CUDA SM 100 or higher") diff --git a/test/registered/attention/test_gdn_noncontiguous_stride.py b/test/registered/attention/test_gdn_noncontiguous_stride.py index 81b28f66d..af807978b 100644 --- a/test/registered/attention/test_gdn_noncontiguous_stride.py +++ b/test/registered/attention/test_gdn_noncontiguous_stride.py @@ -14,7 +14,7 @@ from sglang.srt.layers.attention.fla.fused_sigmoid_gating_recurrent import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=30, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=7, suite="stage-b-test-1-gpu-large") def _make_noncontiguous_ab(batch, num_heads, dtype=torch.bfloat16, device="cuda"): diff --git a/test/registered/attention/test_hybrid_attn_backend.py b/test/registered/attention/test_hybrid_attn_backend.py index dce9ca3c6..d99943842 100644 --- a/test/registered/attention/test_hybrid_attn_backend.py +++ b/test/registered/attention/test_hybrid_attn_backend.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( # Hybrid attention backend tests (FA3 prefill + FlashInfer decode, requires SM 90+ / H100) # Multiple test classes: base, MLA, TorchCompile, SpecDecode variants -register_cuda_ci(est_time=342, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=407, suite="stage-b-test-1-gpu-large") GSM_DATASET_PATH = None diff --git a/test/registered/attention/test_kda_kernels.py b/test/registered/attention/test_kda_kernels.py index 51f4e9db1..42bdea4f0 100644 --- a/test/registered/attention/test_kda_kernels.py +++ b/test/registered/attention/test_kda_kernels.py @@ -13,7 +13,7 @@ from sglang.srt.layers.attention.fla.kda import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=12, suite="stage-b-test-1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "Test requires CUDA") diff --git a/test/registered/attention/test_local_attn.py b/test/registered/attention/test_local_attn.py index f14be8cf7..f3c0a2c6e 100644 --- a/test/registered/attention/test_local_attn.py +++ b/test/registered/attention/test_local_attn.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( ) # Local attention with FA3 (requires SM 90+ / H100, tp=4) -register_cuda_ci(est_time=208, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=217, suite="stage-c-test-4-gpu-h100") @unittest.skipIf(get_device_sm() < 90, "Test requires CUDA SM 90 or higher") diff --git a/test/registered/attention/test_normal_decode_set_metadata.py b/test/registered/attention/test_normal_decode_set_metadata.py index 6906f6cfa..b4c6e5c12 100644 --- a/test/registered/attention/test_normal_decode_set_metadata.py +++ b/test/registered/attention/test_normal_decode_set_metadata.py @@ -21,7 +21,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase # Register this test for CUDA CI in stage-b (fast attention/kernel tests) -register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=11, suite="stage-b-test-1-gpu-large") def reference_normal_decode_set_metadata( diff --git a/test/registered/attention/test_torch_native_attention_backend.py b/test/registered/attention/test_torch_native_attention_backend.py index 102a7816b..eba008c64 100644 --- a/test/registered/attention/test_torch_native_attention_backend.py +++ b/test/registered/attention/test_torch_native_attention_backend.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( ) # Torch native attention backend integration test with MMLU eval -register_cuda_ci(est_time=128, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=140, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=150, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_triton_attention_backend.py b/test/registered/attention/test_triton_attention_backend.py index 2034a89a6..e8558d13c 100644 --- a/test/registered/attention/test_triton_attention_backend.py +++ b/test/registered/attention/test_triton_attention_backend.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( ) # Triton attention backend integration test with latency benchmark and MMLU eval -register_cuda_ci(est_time=164, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=177, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=1400, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_triton_attention_kernels.py b/test/registered/attention/test_triton_attention_kernels.py index 48b74cb72..9dde8c16d 100644 --- a/test/registered/attention/test_triton_attention_kernels.py +++ b/test/registered/attention/test_triton_attention_kernels.py @@ -23,7 +23,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase, is_in_amd_ci # Triton attention kernel unit tests (decode, extend, prefill) -register_cuda_ci(est_time=16, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=19, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=30, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_triton_sliding_window.py b/test/registered/attention/test_triton_sliding_window.py index faff86108..42aa770e3 100644 --- a/test/registered/attention/test_triton_sliding_window.py +++ b/test/registered/attention/test_triton_sliding_window.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( ) # Sliding window attention with Triton backend (Gemma-3 model) -register_cuda_ci(est_time=95, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=93, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/backends/test_torch_compile.py b/test/registered/backends/test_torch_compile.py index 3f5f1ca91..d884631f9 100644 --- a/test/registered/backends/test_torch_compile.py +++ b/test/registered/backends/test_torch_compile.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=115, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=126, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/breakable_cuda_graph/test_breakable_cuda_graph.py b/test/registered/breakable_cuda_graph/test_breakable_cuda_graph.py index 588f3e91f..e69674dd7 100644 --- a/test/registered/breakable_cuda_graph/test_breakable_cuda_graph.py +++ b/test/registered/breakable_cuda_graph/test_breakable_cuda_graph.py @@ -23,7 +23,7 @@ from sglang.test.test_utils import ( ) # CI Registration — large suite to fit the integration test's server startup. -register_cuda_ci(est_time=130, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=79, suite="stage-b-test-1-gpu-large") def _skip_if_no_cuda(test_func): diff --git a/test/registered/constrained_decoding/test_constrained_decoding.py b/test/registered/constrained_decoding/test_constrained_decoding.py index 9e3cf9213..9a71f75fd 100644 --- a/test/registered/constrained_decoding/test_constrained_decoding.py +++ b/test/registered/constrained_decoding/test_constrained_decoding.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=110, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=179, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_deterministic.py b/test/registered/core/test_deterministic.py index 7b269a93f..f28db8d0b 100644 --- a/test/registered/core/test_deterministic.py +++ b/test/registered/core/test_deterministic.py @@ -16,7 +16,7 @@ from sglang.test.test_deterministic_utils import ( ) from sglang.test.test_utils import is_in_amd_ci -register_cuda_ci(est_time=194, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=207, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_engine_child_pids.py b/test/registered/core/test_engine_child_pids.py index 7762ef79e..eaa103e40 100644 --- a/test/registered/core/test_engine_child_pids.py +++ b/test/registered/core/test_engine_child_pids.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=60, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=77, suite="stage-b-test-1-gpu-small") class TestEngineChildPids(CustomTestCase): diff --git a/test/registered/core/test_gpt_oss_1gpu.py b/test/registered/core/test_gpt_oss_1gpu.py index 692af9070..c6b6e5162 100644 --- a/test/registered/core/test_gpt_oss_1gpu.py +++ b/test/registered/core/test_gpt_oss_1gpu.py @@ -3,7 +3,7 @@ import unittest from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=372, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=408, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=750, suite="stage-b-test-1-gpu-small-amd-mi35x") diff --git a/test/registered/core/test_gpt_oss_sm120.py b/test/registered/core/test_gpt_oss_sm120.py index 18ad85478..d453d3dab 100644 --- a/test/registered/core/test_gpt_oss_sm120.py +++ b/test/registered/core/test_gpt_oss_sm120.py @@ -5,7 +5,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=329, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=345, suite="stage-b-test-1-gpu-small") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is not available") diff --git a/test/registered/core/test_hidden_states.py b/test/registered/core/test_hidden_states.py index 1e8d8a764..2f83fea90 100644 --- a/test/registered/core/test_hidden_states.py +++ b/test/registered/core/test_hidden_states.py @@ -8,7 +8,7 @@ from sglang.srt.utils import get_device, is_hip from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase -register_cuda_ci(est_time=47, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=45, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=55, suite="stage-b-test-1-gpu-small-amd") _is_hip = is_hip() diff --git a/test/registered/core/test_mm_process_config.py b/test/registered/core/test_mm_process_config.py index 35540d8d7..aef4fd3c5 100644 --- a/test/registered/core/test_mm_process_config.py +++ b/test/registered/core/test_mm_process_config.py @@ -4,7 +4,7 @@ from unittest.mock import MagicMock, patch from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=5, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=1, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_request_queue_validation.py b/test/registered/core/test_request_queue_validation.py index d6293ae2f..82147c41f 100644 --- a/test/registered/core/test_request_queue_validation.py +++ b/test/registered/core/test_request_queue_validation.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( send_generate_requests, ) -register_cuda_ci(est_time=50, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=53, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=70, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_srt_endpoint.py b/test/registered/core/test_srt_endpoint.py index a639d7861..081c93cb7 100644 --- a/test/registered/core/test_srt_endpoint.py +++ b/test/registered/core/test_srt_endpoint.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( run_logprob_check, ) -register_cuda_ci(est_time=132, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=134, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=130, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_srt_engine.py b/test/registered/core/test_srt_engine.py index f6610ddf8..2d769631a 100644 --- a/test/registered/core/test_srt_engine.py +++ b/test/registered/core/test_srt_engine.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=311, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=387, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=261, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/cp/test_deepseek_v32_cp_single_node.py b/test/registered/cp/test_deepseek_v32_cp_single_node.py index badcb2caa..5adefd3d1 100644 --- a/test/registered/cp/test_deepseek_v32_cp_single_node.py +++ b/test/registered/cp/test_deepseek_v32_cp_single_node.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=614, suite="stage-c-test-deepep-8-gpu-h200") +register_cuda_ci(est_time=616, suite="stage-c-test-deepep-8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" diff --git a/test/registered/disaggregation/test_disaggregation_basic.py b/test/registered/disaggregation/test_disaggregation_basic.py index e20d59ea8..fdd62ce90 100644 --- a/test/registered/disaggregation/test_disaggregation_basic.py +++ b/test/registered/disaggregation/test_disaggregation_basic.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( DEFAULT_TARGET_MODEL_EAGLE3, ) -register_cuda_ci(est_time=394, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=509, suite="stage-b-test-2-gpu-large") class TestDisaggregationAccuracy(PauseResumeInPlaceMixin, PDDisaggregationServerBase): diff --git a/test/registered/distributed/test_data_parallelism.py b/test/registered/distributed/test_data_parallelism.py index a7d49ac19..fa7ac2170 100644 --- a/test/registered/distributed/test_data_parallelism.py +++ b/test/registered/distributed/test_data_parallelism.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=78, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=91, suite="stage-b-test-2-gpu-large") register_amd_ci(est_time=73, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/distributed/test_disaggregation_different_tp.py b/test/registered/distributed/test_disaggregation_different_tp.py index 3fd1a9504..f3ed6ad35 100644 --- a/test/registered/distributed/test_disaggregation_different_tp.py +++ b/test/registered/distributed/test_disaggregation_different_tp.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=331, suite="stage-c-test-8-gpu-h20") +register_cuda_ci(est_time=375, suite="stage-c-test-8-gpu-h20") class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase): diff --git a/test/registered/distributed/test_disaggregation_dp_attention.py b/test/registered/distributed/test_disaggregation_dp_attention.py index 3eab31142..e6348f83b 100644 --- a/test/registered/distributed/test_disaggregation_dp_attention.py +++ b/test/registered/distributed/test_disaggregation_dp_attention.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=408, suite="stage-c-test-8-gpu-h20") +register_cuda_ci(est_time=443, suite="stage-c-test-8-gpu-h20") class TestDisaggregationDPAttention(PDDisaggregationServerBase): diff --git a/test/registered/distributed/test_disaggregation_hybrid_attention.py b/test/registered/distributed/test_disaggregation_hybrid_attention.py index 87ef16974..439201d0e 100644 --- a/test/registered/distributed/test_disaggregation_hybrid_attention.py +++ b/test/registered/distributed/test_disaggregation_hybrid_attention.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_pd_server, ) -register_cuda_ci(est_time=317, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=695, suite="stage-c-test-8-gpu-h200") @unittest.skipIf(is_in_ci(), "Temporarily disable the flaky test.") diff --git a/test/registered/distributed/test_disaggregation_pp.py b/test/registered/distributed/test_disaggregation_pp.py index 683da93a6..072b034ad 100644 --- a/test/registered/distributed/test_disaggregation_pp.py +++ b/test/registered/distributed/test_disaggregation_pp.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=180, suite="stage-c-test-8-gpu-h20") +register_cuda_ci(est_time=216, suite="stage-c-test-8-gpu-h20") class TestDisaggregationPrefillPPAccuracy(PDDisaggregationServerBase): diff --git a/test/registered/distributed/test_dp_attention.py b/test/registered/distributed/test_dp_attention.py index 4b9ab0ef5..c93ec10ce 100644 --- a/test/registered/distributed/test_dp_attention.py +++ b/test/registered/distributed/test_dp_attention.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=446, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=524, suite="stage-b-test-2-gpu-large") class TestDPAttentionDP2TP2( diff --git a/test/registered/distributed/test_dp_attention_large.py b/test/registered/distributed/test_dp_attention_large.py index 57e3f24ce..0a21c5ac7 100644 --- a/test/registered/distributed/test_dp_attention_large.py +++ b/test/registered/distributed/test_dp_attention_large.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=230, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=245, suite="stage-c-test-4-gpu-h100") register_amd_ci(est_time=350, suite="stage-c-test-4-gpu-amd") diff --git a/test/registered/distributed/test_load_weights_from_remote_instance.py b/test/registered/distributed/test_load_weights_from_remote_instance.py index 645ecd82c..e48377f97 100644 --- a/test/registered/distributed/test_load_weights_from_remote_instance.py +++ b/test/registered/distributed/test_load_weights_from_remote_instance.py @@ -38,7 +38,7 @@ from sglang.utils import terminate_process mp.set_start_method("spawn", force=True) -register_cuda_ci(est_time=110, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=145, suite="stage-b-test-2-gpu-large") register_amd_ci(est_time=72, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/distributed/test_pp_single_node.py b/test/registered/distributed/test_pp_single_node.py index 0549d00d2..13ed42509 100644 --- a/test/registered/distributed/test_pp_single_node.py +++ b/test/registered/distributed/test_pp_single_node.py @@ -32,7 +32,7 @@ from sglang.test.test_utils import ( run_bench_one_batch_server, ) -register_cuda_ci(est_time=462, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=554, suite="stage-c-test-4-gpu-h100") register_amd_ci(est_time=650, suite="stage-c-test-4-gpu-amd") diff --git a/test/registered/dllm/test_llada2_mini.py b/test/registered/dllm/test_llada2_mini.py index 139fc2b7a..e56d3dcbd 100644 --- a/test/registered/dllm/test_llada2_mini.py +++ b/test/registered/dllm/test_llada2_mini.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=116, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=139, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=330, suite="stage-b-test-1-gpu-small-amd") import unittest diff --git a/test/registered/ep/test_deepep_large.py b/test/registered/ep/test_deepep_large.py index aa9d37ec2..5967d489e 100644 --- a/test/registered/ep/test_deepep_large.py +++ b/test/registered/ep/test_deepep_large.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=462, suite="stage-c-test-deepep-8-gpu-h200") +register_cuda_ci(est_time=528, suite="stage-c-test-deepep-8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" diff --git a/test/registered/ep/test_deepep_small.py b/test/registered/ep/test_deepep_small.py index 1f4e8a619..0ed244774 100644 --- a/test/registered/ep/test_deepep_small.py +++ b/test/registered/ep/test_deepep_small.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=432, suite="stage-c-test-deepep-4-gpu-h100") +register_cuda_ci(est_time=478, suite="stage-c-test-deepep-4-gpu-h100") class TestPureDP(CustomTestCase): diff --git a/test/registered/ep/test_mooncake_ep_small.py b/test/registered/ep/test_mooncake_ep_small.py index 80f328c0d..61e0cd04e 100644 --- a/test/registered/ep/test_mooncake_ep_small.py +++ b/test/registered/ep/test_mooncake_ep_small.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=77, suite="stage-c-test-deepep-4-gpu-h100") +register_cuda_ci(est_time=82, suite="stage-c-test-deepep-4-gpu-h100") ib_devices = get_rdma_devices_args() diff --git a/test/registered/eval/test_eval_accuracy_large.py b/test/registered/eval/test_eval_accuracy_large.py index 7ac092d8a..c17127d48 100644 --- a/test/registered/eval/test_eval_accuracy_large.py +++ b/test/registered/eval/test_eval_accuracy_large.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=534, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=496, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=420, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/input_embedding/test_input_embeddings.py b/test/registered/input_embedding/test_input_embeddings.py index 373be99dd..1616fe942 100644 --- a/test/registered/input_embedding/test_input_embeddings.py +++ b/test/registered/input_embedding/test_input_embeddings.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=41, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=42, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=38, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/input_embedding/test_input_embeds_chunked.py b/test/registered/input_embedding/test_input_embeds_chunked.py index 963a205ce..61c3ca501 100644 --- a/test/registered/input_embedding/test_input_embeds_chunked.py +++ b/test/registered/input_embedding/test_input_embeds_chunked.py @@ -30,7 +30,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=42, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=43, suite="stage-b-test-1-gpu-small") CHUNKED_PREFILL_SIZE = 256 diff --git a/test/registered/kernels/test_nsa_indexer.py b/test/registered/kernels/test_nsa_indexer.py index 77c007dad..9aaba4568 100644 --- a/test/registered/kernels/test_nsa_indexer.py +++ b/test/registered/kernels/test_nsa_indexer.py @@ -24,7 +24,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardBatch, ForwardMo from sglang.srt.server_args import ServerArgs, set_global_server_args_for_scheduler from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=15, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=18, suite="stage-b-test-1-gpu-large") # Global configuration for all indexer tests DEFAULT_CONFIG = { diff --git a/test/registered/language/test_srt_backend.py b/test/registered/language/test_srt_backend.py index 551ec8103..23567f119 100644 --- a/test/registered/language/test_srt_backend.py +++ b/test/registered/language/test_srt_backend.py @@ -20,7 +20,7 @@ from sglang.test.test_programs import ( ) from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST, CustomTestCase -register_cuda_ci(est_time=72, suite="stage-a-test-1-gpu-small") +register_cuda_ci(est_time=79, suite="stage-a-test-1-gpu-small") register_amd_ci(est_time=120, suite="stage-a-test-1-gpu-small-amd") diff --git a/test/registered/layers/mamba/test_causal_conv1d.py b/test/registered/layers/mamba/test_causal_conv1d.py index bd10fe21a..24acdd774 100644 --- a/test/registered/layers/mamba/test_causal_conv1d.py +++ b/test/registered/layers/mamba/test_causal_conv1d.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=13, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=11, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-small-amd") # Adapted from https://github.com/vllm-project/vllm/blob/main/tests/kernels/mamba/test_causal_conv1d.py diff --git a/test/registered/layers/mamba/test_mamba2_mixer.py b/test/registered/layers/mamba/test_mamba2_mixer.py index 85aadbcd7..9ff5060ba 100644 --- a/test/registered/layers/mamba/test_mamba2_mixer.py +++ b/test/registered/layers/mamba/test_mamba2_mixer.py @@ -15,7 +15,7 @@ from sglang.srt.distributed.parallel_state import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=28, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=32, suite="stage-b-test-2-gpu-large") NUM_GPUS = 2 diff --git a/test/registered/layers/mamba/test_mamba_ssm.py b/test/registered/layers/mamba/test_mamba_ssm.py index 8c139fbdf..6bd7d5734 100644 --- a/test/registered/layers/mamba/test_mamba_ssm.py +++ b/test/registered/layers/mamba/test_mamba_ssm.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-small-amd") # Adapted from https://github.com/vllm-project/vllm/blob/633f943e30a4444d890d26b81850f7217736f840/tests/kernels/mamba/test_mamba_ssm_ssd.py diff --git a/test/registered/layers/mamba/test_mamba_ssm_ssd.py b/test/registered/layers/mamba/test_mamba_ssm_ssd.py index 2e42caa9b..3b9670d7e 100644 --- a/test/registered/layers/mamba/test_mamba_ssm_ssd.py +++ b/test/registered/layers/mamba/test_mamba_ssm_ssd.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=34, suite="stage-b-test-1-gpu-small-amd") # Adapted from https://github.com/vllm-project/vllm/blob/633f943e30a4444d890d26b81850f7217736f840/tests/kernels/mamba/test_mamba_ssm_ssd.py diff --git a/test/registered/lora/test_fused_moe_lora_kernel.py b/test/registered/lora/test_fused_moe_lora_kernel.py index 50587579d..91fd2f55e 100644 --- a/test/registered/lora/test_fused_moe_lora_kernel.py +++ b/test/registered/lora/test_fused_moe_lora_kernel.py @@ -15,7 +15,7 @@ from sglang.test.ci.ci_register import register_cuda_ci # ============================================================================== -register_cuda_ci(est_time=14, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=28, suite="stage-b-test-1-gpu-large") def round_up(x, base): diff --git a/test/registered/lora/test_lora_backend.py b/test/registered/lora/test_lora_backend.py index 9ac9f4167..4a622bbc5 100644 --- a/test/registered/lora/test_lora_backend.py +++ b/test/registered/lora/test_lora_backend.py @@ -29,7 +29,7 @@ from sglang.test.lora_utils import ( ) from sglang.test.test_utils import CustomTestCase, is_in_ci -register_cuda_ci(est_time=206, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=224, suite="stage-b-test-1-gpu-small") register_amd_ci( est_time=200, suite="stage-b-test-1-gpu-small-amd", diff --git a/test/registered/lora/test_lora_eviction.py b/test/registered/lora/test_lora_eviction.py index c7c2a20d3..940db7af0 100644 --- a/test/registered/lora/test_lora_eviction.py +++ b/test/registered/lora/test_lora_eviction.py @@ -23,7 +23,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.runners import SRTRunner from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=238, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=263, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=224, suite="stage-b-test-1-gpu-small-amd") PROMPTS = [ diff --git a/test/registered/lora/test_lora_moe_runner.py b/test/registered/lora/test_lora_moe_runner.py index 437f6b1c0..253fdf1e9 100644 --- a/test/registered/lora/test_lora_moe_runner.py +++ b/test/registered/lora/test_lora_moe_runner.py @@ -30,7 +30,7 @@ from sglang.srt.lora.lora_moe_runners import LoRAInfo from sglang.srt.utils import set_random_seed from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=80, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=17, suite="stage-b-test-1-gpu-large") def generate_request_data( diff --git a/test/registered/lora/test_lora_overlap_loading.py b/test/registered/lora/test_lora_overlap_loading.py index 3812b8c25..a733d4a7c 100644 --- a/test/registered/lora/test_lora_overlap_loading.py +++ b/test/registered/lora/test_lora_overlap_loading.py @@ -29,7 +29,7 @@ from sglang.test.lora_utils import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=45, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=48, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=75, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/lora/test_marlin_lora_correctness.py b/test/registered/lora/test_marlin_lora_correctness.py index 97a3d71e4..44fc970db 100644 --- a/test/registered/lora/test_marlin_lora_correctness.py +++ b/test/registered/lora/test_marlin_lora_correctness.py @@ -34,7 +34,7 @@ from sglang.srt.layers.moe.utils import MoeRunnerBackend from sglang.srt.lora.lora_moe_runners import LoRAInfo from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=600, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=129, suite="stage-b-test-1-gpu-large") # --------------------------------------------------------------------------- diff --git a/test/registered/lora/test_multi_lora_backend.py b/test/registered/lora/test_multi_lora_backend.py index ac0156bbd..c13acdc93 100644 --- a/test/registered/lora/test_multi_lora_backend.py +++ b/test/registered/lora/test_multi_lora_backend.py @@ -25,7 +25,7 @@ from sglang.test.lora_utils import ( ) from sglang.test.test_utils import CustomTestCase, is_in_ci -register_cuda_ci(est_time=88, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=99, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/lora/test_sgemm_sorted_by_adapter.py b/test/registered/lora/test_sgemm_sorted_by_adapter.py index a8c787267..d1f7a0baf 100644 --- a/test/registered/lora/test_sgemm_sorted_by_adapter.py +++ b/test/registered/lora/test_sgemm_sorted_by_adapter.py @@ -7,7 +7,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=15, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=11, suite="stage-b-test-1-gpu-large") def _make_batch_info( diff --git a/test/registered/mla/test_flashmla.py b/test/registered/mla/test_flashmla.py index 046bcc778..abcad2a39 100644 --- a/test/registered/mla/test_flashmla.py +++ b/test/registered/mla/test_flashmla.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( ) # FlashMLA attention backend tests with MTP speculative decoding -register_cuda_ci(est_time=700, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=314, suite="stage-b-test-1-gpu-large") class TestFlashMLAAttnBackend(unittest.TestCase): diff --git a/test/registered/mla/test_mla.py b/test/registered/mla/test_mla.py index 0d6761bdb..083d3f5e8 100644 --- a/test/registered/mla/test_mla.py +++ b/test/registered/mla/test_mla.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( ) # MLA attention test with MGSM evaluation -register_cuda_ci(est_time=174, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=181, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/mla/test_mla_flashinfer.py b/test/registered/mla/test_mla_flashinfer.py index 23a24aade..62d269b03 100644 --- a/test/registered/mla/test_mla_flashinfer.py +++ b/test/registered/mla/test_mla_flashinfer.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( ) # FlashInfer MLA backend tests with MTP speculative decoding -register_cuda_ci(est_time=256, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=260, suite="stage-b-test-1-gpu-large") class TestFlashinferMLA(CustomTestCase): diff --git a/test/registered/mla/test_mla_fp8.py b/test/registered/mla/test_mla_fp8.py index dd402c5c7..eb793a530 100644 --- a/test/registered/mla/test_mla_fp8.py +++ b/test/registered/mla/test_mla_fp8.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( ) # MLA FP8 KV cache test with MGSM evaluation -register_cuda_ci(est_time=106, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=104, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=800, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/mla/test_mla_int8_deepseek_v3.py b/test/registered/mla/test_mla_int8_deepseek_v3.py index 35cf4b229..8a94544c8 100644 --- a/test/registered/mla/test_mla_int8_deepseek_v3.py +++ b/test/registered/mla/test_mla_int8_deepseek_v3.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( ) # DeepSeek-V3 INT8 quantization tests (channel and block INT8) -register_cuda_ci(est_time=282, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=313, suite="stage-b-test-1-gpu-large") class TestMLADeepseekV3ChannelInt8(CustomTestCase): diff --git a/test/registered/model_loading/test_external_models.py b/test/registered/model_loading/test_external_models.py index d32adfcc9..cd546d998 100644 --- a/test/registered/model_loading/test_external_models.py +++ b/test/registered/model_loading/test_external_models.py @@ -5,7 +5,7 @@ from sglang.srt.environ import envs from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=28, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=29, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=45, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/models/test_compressed_tensors_models.py b/test/registered/models/test_compressed_tensors_models.py index 2d191f40e..74cbe0061 100644 --- a/test/registered/models/test_compressed_tensors_models.py +++ b/test/registered/models/test_compressed_tensors_models.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=63, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=65, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=42, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/models/test_generation_models.py b/test/registered/models/test_generation_models.py index 116fc62dc..64d5246f1 100644 --- a/test/registered/models/test_generation_models.py +++ b/test/registered/models/test_generation_models.py @@ -1,7 +1,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Generation model tests (CUDA only) -register_cuda_ci(est_time=124, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=150, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=106, suite="stage-b-test-1-gpu-small-amd") # Copyright 2023-2024 SGLang Team diff --git a/test/registered/models/test_kimi_linear_models.py b/test/registered/models/test_kimi_linear_models.py index 83f01d009..21acf3c57 100644 --- a/test/registered/models/test_kimi_linear_models.py +++ b/test/registered/models/test_kimi_linear_models.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=168, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=178, suite="stage-b-test-2-gpu-large") class TestKimiLinear(CustomTestCase): diff --git a/test/registered/models/test_nvidia_nemotron_nano_v2.py b/test/registered/models/test_nvidia_nemotron_nano_v2.py index d9e5883c5..1fb7b67a8 100644 --- a/test/registered/models/test_nvidia_nemotron_nano_v2.py +++ b/test/registered/models/test_nvidia_nemotron_nano_v2.py @@ -5,7 +5,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=214, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=249, suite="stage-b-test-2-gpu-large") class TestNvidiaNemotronNanoV2BF16(GSM8KMixin, DefaultServerBase): diff --git a/test/registered/models/test_nvidia_nemotron_nano_v2_vl.py b/test/registered/models/test_nvidia_nemotron_nano_v2_vl.py index 4c52c05d6..510883d8d 100644 --- a/test/registered/models/test_nvidia_nemotron_nano_v2_vl.py +++ b/test/registered/models/test_nvidia_nemotron_nano_v2_vl.py @@ -10,7 +10,7 @@ from sglang.test.server_fixtures.mmmu_fixture import MMMUServerBase # GSM8k + MMMU evaluation -register_cuda_ci(est_time=206, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=256, suite="stage-b-test-1-gpu-large") MODEL = "nvidia/NVIDIA-Nemotron-Nano-12B-v2-VL-BF16" diff --git a/test/registered/models/test_qwen_models.py b/test/registered/models/test_qwen_models.py index 602de7f25..4283b2809 100644 --- a/test/registered/models/test_qwen_models.py +++ b/test/registered/models/test_qwen_models.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=109, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=108, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=130, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/models/test_transformers_backend_eval.py b/test/registered/models/test_transformers_backend_eval.py index 9d68505fa..58698dc5d 100644 --- a/test/registered/models/test_transformers_backend_eval.py +++ b/test/registered/models/test_transformers_backend_eval.py @@ -7,7 +7,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.few_shot_gsm8k import run_eval from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=44, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=48, suite="stage-b-test-1-gpu-small") class TestTransformersBackendEval(DefaultServerBase): diff --git a/test/registered/models/test_transformers_models.py b/test/registered/models/test_transformers_models.py index 9313bc5ba..5fe40e122 100644 --- a/test/registered/models/test_transformers_models.py +++ b/test/registered/models/test_transformers_models.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=244, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=177, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=320, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/models/test_vlm_models.py b/test/registered/models/test_vlm_models.py index 2ed573417..17e9b146a 100644 --- a/test/registered/models/test_vlm_models.py +++ b/test/registered/models/test_vlm_models.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import is_in_ci # VLM (Vision Language Model) tests -register_cuda_ci(est_time=176, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=317, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=850, suite="stage-b-test-1-gpu-small-amd-nondeterministic") _is_hip = is_hip() diff --git a/test/registered/moe/test_cutedsl_moe.py b/test/registered/moe/test_cutedsl_moe.py index f64db08f0..b0c10db79 100644 --- a/test/registered/moe/test_cutedsl_moe.py +++ b/test/registered/moe/test_cutedsl_moe.py @@ -16,7 +16,7 @@ except ImportError: CuteDslMoEWrapper = None convert_sf_to_mma_layout = None -register_cuda_ci(est_time=590, suite="stage-c-test-4-gpu-b200-small") +register_cuda_ci(est_time=427, suite="stage-c-test-4-gpu-b200-small") SKIP_TEST = torch.cuda.get_device_capability() < (10, 0) SKIP_REASON = "Nvfp4 Requires compute capability of 10 or above." diff --git a/test/registered/moe/test_fused_moe.py b/test/registered/moe/test_fused_moe.py index b67d1b4ed..f93cbff99 100644 --- a/test/registered/moe/test_fused_moe.py +++ b/test/registered/moe/test_fused_moe.py @@ -13,7 +13,7 @@ from sglang.srt.utils import get_device, get_device_capability, is_hip from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase, empty_gpu_cache -register_cuda_ci(est_time=79, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=87, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=30, suite="stage-b-test-1-gpu-small-amd") _is_hip = is_hip() diff --git a/test/registered/moe/test_glm4_moe_models.py b/test/registered/moe/test_glm4_moe_models.py index 58a54f25b..e6e800ecd 100644 --- a/test/registered/moe/test_glm4_moe_models.py +++ b/test/registered/moe/test_glm4_moe_models.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=150, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=171, suite="stage-b-test-2-gpu-large") class TestGLM4MoE(CustomTestCase): diff --git a/test/registered/moe/test_moe_ep.py b/test/registered/moe/test_moe_ep.py index 5aa4d4836..b5e936ee6 100644 --- a/test/registered/moe/test_moe_ep.py +++ b/test/registered/moe/test_moe_ep.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=232, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=279, suite="stage-b-test-2-gpu-large") class TestEp(CustomTestCase): diff --git a/test/registered/moe/test_torch_compile_moe.py b/test/registered/moe/test_torch_compile_moe.py index 2175f0dc9..811ca69b4 100644 --- a/test/registered/moe/test_torch_compile_moe.py +++ b/test/registered/moe/test_torch_compile_moe.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=125, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=130, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=1400, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/moe/test_triton_fused_moe.py b/test/registered/moe/test_triton_fused_moe.py index b5c263a04..309ac1b3a 100644 --- a/test/registered/moe/test_triton_fused_moe.py +++ b/test/registered/moe/test_triton_fused_moe.py @@ -12,7 +12,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=12, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=13, suite="stage-b-test-1-gpu-large") class TestFusedMOE(CustomTestCase): diff --git a/test/registered/moe/test_triton_moe_channel_fp8_kernel.py b/test/registered/moe/test_triton_moe_channel_fp8_kernel.py index 49bdff402..ee6b45227 100644 --- a/test/registered/moe/test_triton_moe_channel_fp8_kernel.py +++ b/test/registered/moe/test_triton_moe_channel_fp8_kernel.py @@ -11,7 +11,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=16, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=17, suite="stage-b-test-1-gpu-large") def native_w8a8_per_token_matmul(A, B, As, Bs, output_dtype=torch.float16): diff --git a/test/registered/observability/test_metrics.py b/test/registered/observability/test_metrics.py index 066999d02..2b6c65987 100644 --- a/test/registered/observability/test_metrics.py +++ b/test/registered/observability/test_metrics.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=73, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=74, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=32, suite="stage-b-test-1-gpu-small-amd") _MODEL_NAME = "Qwen/Qwen3-0.6B" diff --git a/test/registered/observability/test_tracing.py b/test/registered/observability/test_tracing.py index f77dc2ea2..4217a1ac0 100644 --- a/test/registered/observability/test_tracing.py +++ b/test/registered/observability/test_tracing.py @@ -46,7 +46,7 @@ from sglang.test.test_utils import ( logger = logging.getLogger(__name__) # CI registration -register_cuda_ci(est_time=104, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=113, suite="stage-b-test-1-gpu-small") # ============================================================================ diff --git a/test/registered/observability/test_tracing_disaggregation.py b/test/registered/observability/test_tracing_disaggregation.py index 91d1e11ed..3c7990df7 100644 --- a/test/registered/observability/test_tracing_disaggregation.py +++ b/test/registered/observability/test_tracing_disaggregation.py @@ -33,7 +33,7 @@ from sglang.utils import wait_for_http_ready logger = logging.getLogger(__name__) # CI registration - PD disaggregation requires 2 GPUs -register_cuda_ci(est_time=48, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=65, suite="stage-b-test-2-gpu-large") class TestTraceDisaggregation(CustomTestCase): diff --git a/test/registered/openai_server/basic/test_anthropic_server.py b/test/registered/openai_server/basic/test_anthropic_server.py index 3e50e6758..bdfb8b91f 100644 --- a/test/registered/openai_server/basic/test_anthropic_server.py +++ b/test/registered/openai_server/basic/test_anthropic_server.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=39, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/basic/test_http2_server.py b/test/registered/openai_server/basic/test_http2_server.py index d35204c31..e2a05a335 100644 --- a/test/registered/openai_server/basic/test_http2_server.py +++ b/test/registered/openai_server/basic/test_http2_server.py @@ -27,7 +27,7 @@ try: except ImportError: _HAS_GRANIAN = False -register_cuda_ci(est_time=51, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=52, suite="stage-b-test-1-gpu-small") @unittest.skipUnless(_HAS_GRANIAN, "granian not installed (pip install sglang[http2])") diff --git a/test/registered/openai_server/basic/test_openai_server.py b/test/registered/openai_server/basic/test_openai_server.py index 967ef109b..4a96c100f 100644 --- a/test/registered/openai_server/basic/test_openai_server.py +++ b/test/registered/openai_server/basic/test_openai_server.py @@ -28,7 +28,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=189, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=182, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/basic/test_serving_transcription.py b/test/registered/openai_server/basic/test_serving_transcription.py index 6a51d36a7..31efdb5be 100644 --- a/test/registered/openai_server/basic/test_serving_transcription.py +++ b/test/registered/openai_server/basic/test_serving_transcription.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=51, suite="stage-b-test-1-gpu-small") WHISPER_MODEL = "openai/whisper-large-v3" AUDIO_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/audios/Trump_WEF_2018_10s.mp3" diff --git a/test/registered/openai_server/features/test_json_mode.py b/test/registered/openai_server/features/test_json_mode.py index fcdd6e792..d3aa8e68a 100644 --- a/test/registered/openai_server/features/test_json_mode.py +++ b/test/registered/openai_server/features/test_json_mode.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=108, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=118, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=180, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/features/test_openai_server_ebnf.py b/test/registered/openai_server/features/test_openai_server_ebnf.py index 78327bc50..42dfd58fd 100644 --- a/test/registered/openai_server/features/test_openai_server_ebnf.py +++ b/test/registered/openai_server/features/test_openai_server_ebnf.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=42, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=44, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/features/test_openai_server_hidden_states.py b/test/registered/openai_server/features/test_openai_server_hidden_states.py index 868e9aa7a..c1a46fd7a 100644 --- a/test/registered/openai_server/features/test_openai_server_hidden_states.py +++ b/test/registered/openai_server/features/test_openai_server_hidden_states.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=193, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=222, suite="stage-b-test-1-gpu-small") register_amd_ci( est_time=186, suite="stage-b-test-1-gpu-small-amd", diff --git a/test/registered/openai_server/function_call/test_openai_function_calling.py b/test/registered/openai_server/function_call/test_openai_function_calling.py index fc3847b6c..88544c197 100644 --- a/test/registered/openai_server/function_call/test_openai_function_calling.py +++ b/test/registered/openai_server/function_call/test_openai_function_calling.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=97, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=100, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=73, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/function_call/test_tool_choice.py b/test/registered/openai_server/function_call/test_tool_choice.py index 1c7e49617..c7fef05c7 100644 --- a/test/registered/openai_server/function_call/test_tool_choice.py +++ b/test/registered/openai_server/function_call/test_tool_choice.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=194, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=204, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=258, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/validation/test_large_max_new_tokens.py b/test/registered/openai_server/validation/test_large_max_new_tokens.py index c48ca4547..3ec576774 100644 --- a/test/registered/openai_server/validation/test_large_max_new_tokens.py +++ b/test/registered/openai_server/validation/test_large_max_new_tokens.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=56, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=58, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=41, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/validation/test_openai_server_ignore_eos.py b/test/registered/openai_server/validation/test_openai_server_ignore_eos.py index 2986c2f57..847dd0463 100644 --- a/test/registered/openai_server/validation/test_openai_server_ignore_eos.py +++ b/test/registered/openai_server/validation/test_openai_server_ignore_eos.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=42, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=44, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=47, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/validation/test_request_length_validation.py b/test/registered/openai_server/validation/test_request_length_validation.py index 1bc93e551..0c581bed0 100644 --- a/test/registered/openai_server/validation/test_request_length_validation.py +++ b/test/registered/openai_server/validation/test_request_length_validation.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=39, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=49, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=31, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/perf/test_bench_one_batch_1gpu.py b/test/registered/perf/test_bench_one_batch_1gpu.py index 26c251ccd..13f16dc92 100644 --- a/test/registered/perf/test_bench_one_batch_1gpu.py +++ b/test/registered/perf/test_bench_one_batch_1gpu.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=80, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=95, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=120, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/perf/test_bench_one_batch_2gpu.py b/test/registered/perf/test_bench_one_batch_2gpu.py index 41ba7a030..2daa9b6c4 100644 --- a/test/registered/perf/test_bench_one_batch_2gpu.py +++ b/test/registered/perf/test_bench_one_batch_2gpu.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=167, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=209, suite="stage-b-test-2-gpu-large") register_amd_ci(est_time=630, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/perf/test_bench_serving_1gpu_large.py b/test/registered/perf/test_bench_serving_1gpu_large.py index 43e0ad63e..cee6d4014 100644 --- a/test/registered/perf/test_bench_serving_1gpu_large.py +++ b/test/registered/perf/test_bench_serving_1gpu_large.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=251, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=286, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=300, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/perf/test_bench_serving_1gpu_part1.py b/test/registered/perf/test_bench_serving_1gpu_part1.py index 635593307..56040ffb6 100644 --- a/test/registered/perf/test_bench_serving_1gpu_part1.py +++ b/test/registered/perf/test_bench_serving_1gpu_part1.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=1184, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=1210, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/perf/test_bench_serving_1gpu_part2.py b/test/registered/perf/test_bench_serving_1gpu_part2.py index 23eb51a22..7743877b0 100644 --- a/test/registered/perf/test_bench_serving_1gpu_part2.py +++ b/test/registered/perf/test_bench_serving_1gpu_part2.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=910, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=968, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=900, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/perf/test_bench_serving_2gpu.py b/test/registered/perf/test_bench_serving_2gpu.py index d03cf2499..91783b07b 100644 --- a/test/registered/perf/test_bench_serving_2gpu.py +++ b/test/registered/perf/test_bench_serving_2gpu.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=660, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=721, suite="stage-b-test-2-gpu-large") register_amd_ci(est_time=1450, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/perf/test_vlm_perf_5090.py b/test/registered/perf/test_vlm_perf_5090.py index 8802c75b3..83f1ce25a 100644 --- a/test/registered/perf/test_vlm_perf_5090.py +++ b/test/registered/perf/test_vlm_perf_5090.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=410, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=406, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=500, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/piecewise_cuda_graph/test_pcg_with_speculative_decoding.py b/test/registered/piecewise_cuda_graph/test_pcg_with_speculative_decoding.py index e65f16b3f..db8eea094 100644 --- a/test/registered/piecewise_cuda_graph/test_pcg_with_speculative_decoding.py +++ b/test/registered/piecewise_cuda_graph/test_pcg_with_speculative_decoding.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=600, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=531, suite="stage-b-test-2-gpu-large") class TestPCGWithMTP(unittest.TestCase): diff --git a/test/registered/piecewise_cuda_graph/test_piecewise_cuda_graph_support_1_gpu.py b/test/registered/piecewise_cuda_graph/test_piecewise_cuda_graph_support_1_gpu.py index 9d4a785a9..56e12fbd0 100644 --- a/test/registered/piecewise_cuda_graph/test_piecewise_cuda_graph_support_1_gpu.py +++ b/test/registered/piecewise_cuda_graph/test_piecewise_cuda_graph_support_1_gpu.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( ) # CI Registration -register_cuda_ci(est_time=262, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=260, suite="stage-b-test-1-gpu-large") class TestPiecewiseCudaGraphQwen25VL(CustomTestCase): diff --git a/test/registered/prefill_only/test_cross_encoder_models.py b/test/registered/prefill_only/test_cross_encoder_models.py index d63323d54..c32c7eac5 100644 --- a/test/registered/prefill_only/test_cross_encoder_models.py +++ b/test/registered/prefill_only/test_cross_encoder_models.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import CustomTestCase, is_in_ci # Cross encoder model tests -register_cuda_ci(est_time=101, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=125, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=150, suite="stage-b-test-1-gpu-small-amd") MODELS = [ diff --git a/test/registered/prefill_only/test_embed_overrides.py b/test/registered/prefill_only/test_embed_overrides.py index 01349dbd1..f0c8ff830 100644 --- a/test/registered/prefill_only/test_embed_overrides.py +++ b/test/registered/prefill_only/test_embed_overrides.py @@ -24,7 +24,7 @@ from sglang.srt.server_args import MIS_DELIMITER_TOKEN_ID from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") HIDDEN_DIM = 4 diff --git a/test/registered/prefill_only/test_embedding_models.py b/test/registered/prefill_only/test_embedding_models.py index 6776c8602..7dc4aa6c8 100644 --- a/test/registered/prefill_only/test_embedding_models.py +++ b/test/registered/prefill_only/test_embedding_models.py @@ -35,7 +35,7 @@ register_amd_ci( suite="stage-b-test-1-gpu-small-amd", disabled="see https://github.com/sgl-project/sglang/issues/11127", ) -register_cuda_ci(est_time=102, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=136, suite="stage-b-test-1-gpu-small") MODEL_TO_CONFIG = { "Alibaba-NLP/gte-Qwen2-1.5B-instruct": (1, 1e-5), diff --git a/test/registered/prefill_only/test_encoder_embedding_models.py b/test/registered/prefill_only/test_encoder_embedding_models.py index 90cfca661..8f9a694a9 100644 --- a/test/registered/prefill_only/test_encoder_embedding_models.py +++ b/test/registered/prefill_only/test_encoder_embedding_models.py @@ -29,7 +29,7 @@ from sglang.test.test_utils import CustomTestCase, get_similarities, is_in_ci # python -m unittest test_encoder_embedding_models.TestEncoderEmbeddingModels.test_prefill_logits -register_cuda_ci(est_time=198, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=444, suite="stage-b-test-1-gpu-small") MODELS = [("BAAI/bge-small-en", 1, 1e-5), ("BAAI/bge-m3", 1, 1e-5)] diff --git a/test/registered/prefill_only/test_multi_item_scoring.py b/test/registered/prefill_only/test_multi_item_scoring.py index 7ec80e98c..fb9205cdd 100644 --- a/test/registered/prefill_only/test_multi_item_scoring.py +++ b/test/registered/prefill_only/test_multi_item_scoring.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=240, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=211, suite="stage-b-test-1-gpu-small") TEST_MODEL_NAME = os.environ.get("TEST_MODEL_NAME", DEFAULT_SMALL_MODEL_NAME_FOR_TEST) TEST_CLASSIFICATION_BASE_MODEL = os.environ.get( diff --git a/test/registered/prefill_only/test_openai_embedding.py b/test/registered/prefill_only/test_openai_embedding.py index cb3507027..cb088aa17 100644 --- a/test/registered/prefill_only/test_openai_embedding.py +++ b/test/registered/prefill_only/test_openai_embedding.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=80, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=91, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=141, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/prefill_only/test_pooled_hidden_states.py b/test/registered/prefill_only/test_pooled_hidden_states.py index dd1757302..0d3b7b969 100644 --- a/test/registered/prefill_only/test_pooled_hidden_states.py +++ b/test/registered/prefill_only/test_pooled_hidden_states.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=240, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=100, suite="stage-b-test-1-gpu-small") _SEQCLS_MODEL = "Qwen/Qwen3-0.6B" _CAUSAL_LM_MODEL = DEFAULT_SMALL_MODEL_NAME_FOR_TEST diff --git a/test/registered/prefill_only/test_reward_models.py b/test/registered/prefill_only/test_reward_models.py index fb3084675..53eda08bb 100644 --- a/test/registered/prefill_only/test_reward_models.py +++ b/test/registered/prefill_only/test_reward_models.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import CustomTestCase # ============================================================================== -register_cuda_ci(est_time=142, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=166, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=132, suite="stage-b-test-1-gpu-small-amd-nondeterministic") MODELS = [ diff --git a/test/registered/prefill_only/test_score_api.py b/test/registered/prefill_only/test_score_api.py index 4def12765..ae06a5835 100644 --- a/test/registered/prefill_only/test_score_api.py +++ b/test/registered/prefill_only/test_score_api.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=70, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=71, suite="stage-b-test-1-gpu-small") _MODEL = os.environ.get("TEST_MODEL_NAME", DEFAULT_SMALL_MODEL_NAME_FOR_TEST) diff --git a/test/registered/prefill_only/test_serving_rerank.py b/test/registered/prefill_only/test_serving_rerank.py index 411ea1c8e..f1b10f253 100644 --- a/test/registered/prefill_only/test_serving_rerank.py +++ b/test/registered/prefill_only/test_serving_rerank.py @@ -7,7 +7,7 @@ from sglang.srt.managers.tokenizer_manager_score_mixin import ScoreResult from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Keep consistent with other openai_server/basic unit tests. -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") try: diff --git a/test/registered/profiling/test_start_profile.py b/test/registered/profiling/test_start_profile.py index edfb48fa5..9049f9cba 100644 --- a/test/registered/profiling/test_start_profile.py +++ b/test/registered/profiling/test_start_profile.py @@ -29,7 +29,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=42, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=60, suite="stage-b-test-1-gpu-small-amd") OUTPUT_DIR = "./profiler_dir" diff --git a/test/registered/quant/test_autoround.py b/test/registered/quant/test_autoround.py index 9c1e3005f..f71967b18 100644 --- a/test/registered/quant/test_autoround.py +++ b/test/registered/quant/test_autoround.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=96, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=99, suite="stage-b-test-1-gpu-large") class TestAutoRound(CustomTestCase): diff --git a/test/registered/quant/test_awq.py b/test/registered/quant/test_awq.py index 0f72d8ded..ae13e8431 100644 --- a/test/registered/quant/test_awq.py +++ b/test/registered/quant/test_awq.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=950, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=226, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/quant/test_block_int8.py b/test/registered/quant/test_block_int8.py index aa0c8bae5..b7716c8dc 100644 --- a/test/registered/quant/test_block_int8.py +++ b/test/registered/quant/test_block_int8.py @@ -10,7 +10,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=39, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=44, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=22, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/quant/test_deepseek_v32_fp4_4gpu.py b/test/registered/quant/test_deepseek_v32_fp4_4gpu.py index dc5d2824b..9860c38c5 100644 --- a/test/registered/quant/test_deepseek_v32_fp4_4gpu.py +++ b/test/registered/quant/test_deepseek_v32_fp4_4gpu.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=852, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=874, suite="stage-c-test-4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/quant/test_deepseek_v32_fp4_mtp_4gpu.py b/test/registered/quant/test_deepseek_v32_fp4_mtp_4gpu.py index 8ea65b8ca..59dbe8741 100644 --- a/test/registered/quant/test_deepseek_v32_fp4_mtp_4gpu.py +++ b/test/registered/quant/test_deepseek_v32_fp4_mtp_4gpu.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=1030, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=1060, suite="stage-c-test-4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/quant/test_deepseek_v3_fp4_4gpu.py b/test/registered/quant/test_deepseek_v3_fp4_4gpu.py index e667bbc6f..5ce8a8fb3 100644 --- a/test/registered/quant/test_deepseek_v3_fp4_4gpu.py +++ b/test/registered/quant/test_deepseek_v3_fp4_4gpu.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=1380, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=1190, suite="stage-c-test-4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/quant/test_eval_fp8_accuracy.py b/test/registered/quant/test_eval_fp8_accuracy.py index 5fa425a24..e91e683c0 100644 --- a/test/registered/quant/test_eval_fp8_accuracy.py +++ b/test/registered/quant/test_eval_fp8_accuracy.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=326, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=351, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=600, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/quant/test_fp8_gemm_sm120.py b/test/registered/quant/test_fp8_gemm_sm120.py index bbdf97fa6..9ecbb98ec 100644 --- a/test/registered/quant/test_fp8_gemm_sm120.py +++ b/test/registered/quant/test_fp8_gemm_sm120.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=144, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=146, suite="stage-b-test-1-gpu-small") PERTENSOR_MODEL_PATH = "nvidia/Llama-3.1-8B-Instruct-FP8" BLOCKWISE_MODEL_PATH = "Qwen/Qwen3-4B-Instruct-2507-FP8" diff --git a/test/registered/quant/test_fp8_utils.py b/test/registered/quant/test_fp8_utils.py index b4118d6f6..563a9123b 100644 --- a/test/registered/quant/test_fp8_utils.py +++ b/test/registered/quant/test_fp8_utils.py @@ -10,7 +10,7 @@ from sglang.srt.layers.quantization.fp8_utils import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-large") class TestInverseTransformScaleUe8m0(CustomTestCase): diff --git a/test/registered/quant/test_fp8kv_triton.py b/test/registered/quant/test_fp8kv_triton.py index 8136f0109..c46302444 100644 --- a/test/registered/quant/test_fp8kv_triton.py +++ b/test/registered/quant/test_fp8kv_triton.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=63, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=73, suite="stage-b-test-1-gpu-large") class TestFP8KVCacheTritonBackend(CustomTestCase): diff --git a/test/registered/quant/test_gguf.py b/test/registered/quant/test_gguf.py index 4ae3bb8e0..3ec75dad0 100644 --- a/test/registered/quant/test_gguf.py +++ b/test/registered/quant/test_gguf.py @@ -6,7 +6,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=71, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=76, suite="stage-b-test-1-gpu-small") class TestGGUF(CustomTestCase): diff --git a/test/registered/quant/test_gptqmodel_dynamic.py b/test/registered/quant/test_gptqmodel_dynamic.py index 15927a7c9..e0f542aa2 100644 --- a/test/registered/quant/test_gptqmodel_dynamic.py +++ b/test/registered/quant/test_gptqmodel_dynamic.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=98, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=100, suite="stage-b-test-1-gpu-large") def check_quant_method(model_path: str, use_marlin_kernel: bool): diff --git a/test/registered/quant/test_int8_kernel.py b/test/registered/quant/test_int8_kernel.py index 4114887dd..8b48a913a 100644 --- a/test/registered/quant/test_int8_kernel.py +++ b/test/registered/quant/test_int8_kernel.py @@ -11,7 +11,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=13, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=15, suite="stage-b-test-1-gpu-small") def native_w8a8_per_token_matmul(A, B, As, Bs, output_dtype=torch.float16): diff --git a/test/registered/quant/test_marlin_moe.py b/test/registered/quant/test_marlin_moe.py index 9554c51f6..d88a3627e 100644 --- a/test/registered/quant/test_marlin_moe.py +++ b/test/registered/quant/test_marlin_moe.py @@ -12,7 +12,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_marlin_utils import awq_marlin_quantize, marlin_quantize from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=85, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=108, suite="stage-b-test-1-gpu-small") set_global_server_args_for_scheduler(object.__new__(ServerArgs)) diff --git a/test/registered/quant/test_nvfp4_gemm_sm120.py b/test/registered/quant/test_nvfp4_gemm_sm120.py index 4f87b965b..7b1f4390f 100644 --- a/test/registered/quant/test_nvfp4_gemm_sm120.py +++ b/test/registered/quant/test_nvfp4_gemm_sm120.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=115, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=109, suite="stage-b-test-1-gpu-small") MODEL_PATH = "nvidia/Llama-3.1-8B-Instruct-NVFP4" diff --git a/test/registered/quant/test_quant_config_parsing.py b/test/registered/quant/test_quant_config_parsing.py index 5db3be7b8..33ebda5b8 100644 --- a/test/registered/quant/test_quant_config_parsing.py +++ b/test/registered/quant/test_quant_config_parsing.py @@ -5,7 +5,7 @@ from sglang.srt.configs.model_config import ModelConfig from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="stage-a-test-cpu") +register_cpu_ci(est_time=15, suite="stage-a-test-cpu") class TestQuantLogString(CustomTestCase): diff --git a/test/registered/quant/test_quantization.py b/test/registered/quant/test_quantization.py index 30ccc18f8..8bf8401a4 100644 --- a/test/registered/quant/test_quantization.py +++ b/test/registered/quant/test_quantization.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_results_to_json, ) -register_cuda_ci(est_time=402, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=460, suite="stage-b-test-1-gpu-large") MODEL_SCORE_THRESHOLDS = { # Baselines observed with gsm8k 5-shot concatenated format via chat API, diff --git a/test/registered/quant/test_triton_scaled_mm.py b/test/registered/quant/test_triton_scaled_mm.py index f66c33c5d..8057fc593 100644 --- a/test/registered/quant/test_triton_scaled_mm.py +++ b/test/registered/quant/test_triton_scaled_mm.py @@ -8,7 +8,7 @@ from sglang.srt.layers.quantization.fp8_kernel import triton_scaled_mm from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=11, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=12, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/quant/test_w4a8_deepseek_v3.py b/test/registered/quant/test_w4a8_deepseek_v3.py index 72e717eb8..622c9e3c8 100644 --- a/test/registered/quant/test_w4a8_deepseek_v3.py +++ b/test/registered/quant/test_w4a8_deepseek_v3.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=700, suite="stage-c-test-8-gpu-h20") +register_cuda_ci(est_time=930, suite="stage-c-test-8-gpu-h20") class TestDeepseekV3W4afp8(CustomTestCase): diff --git a/test/registered/quant/test_w8a8_quantization.py b/test/registered/quant/test_w8a8_quantization.py index 33805704e..7841d098d 100644 --- a/test/registered/quant/test_w8a8_quantization.py +++ b/test/registered/quant/test_w8a8_quantization.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=204, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=232, suite="stage-b-test-1-gpu-large") class BaseW8A8Test(CustomTestCase): diff --git a/test/registered/radix_cache/test_radix_attention.py b/test/registered/radix_cache/test_radix_attention.py index 3ce4643da..871dac26e 100644 --- a/test/registered/radix_cache/test_radix_attention.py +++ b/test/registered/radix_cache/test_radix_attention.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( ) # RadixAttention server integration tests -register_cuda_ci(est_time=96, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=100, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/radix_cache/test_radix_cache_hit.py b/test/registered/radix_cache/test_radix_cache_hit.py index 974adb866..18bd3a997 100644 --- a/test/registered/radix_cache/test_radix_cache_hit.py +++ b/test/registered/radix_cache/test_radix_cache_hit.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=62, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=55, suite="stage-b-test-1-gpu-small") MODEL = DEFAULT_SMALL_MODEL_NAME_FOR_TEST diff --git a/test/registered/radix_cache/test_swa_radix_cache_kl.py b/test/registered/radix_cache/test_swa_radix_cache_kl.py index a58abd916..02a336384 100644 --- a/test/registered/radix_cache/test_swa_radix_cache_kl.py +++ b/test/registered/radix_cache/test_swa_radix_cache_kl.py @@ -6,7 +6,7 @@ from sglang.test.server_fixtures.default_fixture import DefaultServerBase MODEL = "openai/gpt-oss-20b" -register_cuda_ci(est_time=142, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=151, suite="stage-b-test-1-gpu-large") class TestSWARadixCacheKL(KLDivergenceMixin, DefaultServerBase): diff --git a/test/registered/radix_cache/test_unified_radix_cache_kl.py b/test/registered/radix_cache/test_unified_radix_cache_kl.py index abf1324c3..6ac338518 100644 --- a/test/registered/radix_cache/test_unified_radix_cache_kl.py +++ b/test/registered/radix_cache/test_unified_radix_cache_kl.py @@ -34,7 +34,7 @@ MAMBA_TRACK_INTERVAL = 128 SWA_MODEL = "openai/gpt-oss-20b" FULL_MODEL = "Qwen/Qwen3-32B" -register_cuda_ci(est_time=1200, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=632, suite="stage-c-test-4-gpu-h100") class UnifiedRadixTreeTestMixin: diff --git a/test/registered/reasoning/test_reasoning.py b/test/registered/reasoning/test_reasoning.py index b6295c3da..b271bea52 100644 --- a/test/registered/reasoning/test_reasoning.py +++ b/test/registered/reasoning/test_reasoning.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=111, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=129, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/rl/test_fp32_lm_head.py b/test/registered/rl/test_fp32_lm_head.py index f98769cdb..8b721cc4e 100644 --- a/test/registered/rl/test_fp32_lm_head.py +++ b/test/registered/rl/test_fp32_lm_head.py @@ -15,7 +15,7 @@ from sglang.srt.server_args import ( from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=15, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/rl/test_lora_load_from_tensor.py b/test/registered/rl/test_lora_load_from_tensor.py index 14bb64c7d..6dd6a89bd 100644 --- a/test/registered/rl/test_lora_load_from_tensor.py +++ b/test/registered/rl/test_lora_load_from_tensor.py @@ -10,7 +10,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=78, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=102, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=90, suite="stage-b-test-1-gpu-small-amd") MODEL_PATH = "Qwen/Qwen3-0.6B" diff --git a/test/registered/rl/test_patch_torch.py b/test/registered/rl/test_patch_torch.py index 445713165..260ae2f30 100644 --- a/test/registered/rl/test_patch_torch.py +++ b/test/registered/rl/test_patch_torch.py @@ -12,7 +12,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_amd_ci( est_time=19, suite="stage-b-test-2-gpu-large-amd", disabled="see #11127" ) -register_cuda_ci(est_time=22, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=38, suite="stage-b-test-2-gpu-large") class TestReleaseMemoryOccupation(unittest.TestCase): diff --git a/test/registered/rl/test_pause_generation_tensor_consistency.py b/test/registered/rl/test_pause_generation_tensor_consistency.py index 0223cca11..64c172221 100644 --- a/test/registered/rl/test_pause_generation_tensor_consistency.py +++ b/test/registered/rl/test_pause_generation_tensor_consistency.py @@ -9,7 +9,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") # --------------------------------------------------------------------------- diff --git a/test/registered/rl/test_return_routed_experts.py b/test/registered/rl/test_return_routed_experts.py index d75bbd4e2..a4b4f6407 100644 --- a/test/registered/rl/test_return_routed_experts.py +++ b/test/registered/rl/test_return_routed_experts.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=164, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=185, suite="stage-b-test-2-gpu-large") register_amd_ci( est_time=200, suite="stage-b-test-2-gpu-large-amd", diff --git a/test/registered/rl/test_update_weights_from_disk_blackwell.py b/test/registered/rl/test_update_weights_from_disk_blackwell.py index 935d8ba31..ba13c5bbd 100644 --- a/test/registered/rl/test_update_weights_from_disk_blackwell.py +++ b/test/registered/rl/test_update_weights_from_disk_blackwell.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=149, suite="stage-c-test-4-gpu-b200-small") +register_cuda_ci(est_time=400, suite="stage-c-test-4-gpu-b200-small") import unittest diff --git a/test/registered/rl/test_update_weights_from_distributed.py b/test/registered/rl/test_update_weights_from_distributed.py index d728fbc53..321826cca 100644 --- a/test/registered/rl/test_update_weights_from_distributed.py +++ b/test/registered/rl/test_update_weights_from_distributed.py @@ -43,7 +43,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import terminate_process -register_cuda_ci(est_time=91, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=137, suite="stage-b-test-2-gpu-large") register_amd_ci(est_time=400, suite="stage-b-test-2-gpu-large-amd") mp.set_start_method("spawn", force=True) diff --git a/test/registered/rl/test_update_weights_from_tensor.py b/test/registered/rl/test_update_weights_from_tensor.py index cdd1afdc4..298030975 100644 --- a/test/registered/rl/test_update_weights_from_tensor.py +++ b/test/registered/rl/test_update_weights_from_tensor.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=136, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=147, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=195, suite="stage-b-test-1-gpu-small-amd") import gc diff --git a/test/registered/sampling/test_original_logprobs.py b/test/registered/sampling/test_original_logprobs.py index b8125e407..c5a21f0e3 100644 --- a/test/registered/sampling/test_original_logprobs.py +++ b/test/registered/sampling/test_original_logprobs.py @@ -25,7 +25,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST -register_cuda_ci(est_time=46, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=45, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=60, suite="stage-b-test-1-gpu-small-amd") # ------------------------- Configurable via env ------------------------- # diff --git a/test/registered/sampling/test_penalty.py b/test/registered/sampling/test_penalty.py index 06311c083..d6b7425a1 100644 --- a/test/registered/sampling/test_penalty.py +++ b/test/registered/sampling/test_penalty.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=50, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=53, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=82, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/sampling/test_pytorch_sampling_backend.py b/test/registered/sampling/test_pytorch_sampling_backend.py index 23e10e05b..ad13ebda8 100644 --- a/test/registered/sampling/test_pytorch_sampling_backend.py +++ b/test/registered/sampling/test_pytorch_sampling_backend.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=77, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=80, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=66, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_abort_with_metrics.py b/test/registered/scheduler/test_abort_with_metrics.py index 3c1a8c0b0..4f894a31f 100644 --- a/test/registered/scheduler/test_abort_with_metrics.py +++ b/test/registered/scheduler/test_abort_with_metrics.py @@ -18,7 +18,7 @@ from sglang.srt.utils.http_middleware_patch import _PureASGIDispatch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") _HTTP_SCOPE = { "type": "http", diff --git a/test/registered/scheduler/test_mixed_chunked_prefill.py b/test/registered/scheduler/test_mixed_chunked_prefill.py index 895943394..cced856d3 100644 --- a/test/registered/scheduler/test_mixed_chunked_prefill.py +++ b/test/registered/scheduler/test_mixed_chunked_prefill.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=180, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=167, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=180, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_no_chunked_prefill.py b/test/registered/scheduler/test_no_chunked_prefill.py index 5aa67fc14..db574e37b 100644 --- a/test/registered/scheduler/test_no_chunked_prefill.py +++ b/test/registered/scheduler/test_no_chunked_prefill.py @@ -8,7 +8,7 @@ from sglang.test.test_utils import ( run_mmlu_test, ) -register_cuda_ci(est_time=121, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=131, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=108, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_no_overlap_scheduler.py b/test/registered/scheduler/test_no_overlap_scheduler.py index b3e0b28f6..c3e972892 100644 --- a/test/registered/scheduler/test_no_overlap_scheduler.py +++ b/test/registered/scheduler/test_no_overlap_scheduler.py @@ -9,7 +9,7 @@ import unittest from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase, run_mmlu_test -register_cuda_ci(est_time=231, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=267, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=275, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_priority_scheduling.py b/test/registered/scheduler/test_priority_scheduling.py index d9328c857..71e9cccb6 100644 --- a/test/registered/scheduler/test_priority_scheduling.py +++ b/test/registered/scheduler/test_priority_scheduling.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( send_concurrent_generate_requests_with_custom_params, ) -register_cuda_ci(est_time=133, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=149, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=195, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_retract_decode.py b/test/registered/scheduler/test_retract_decode.py index 45e120ca1..56ed5b0d4 100644 --- a/test/registered/scheduler/test_retract_decode.py +++ b/test/registered/scheduler/test_retract_decode.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import is_in_ci -register_cuda_ci(est_time=305, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=353, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=600, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_scheduler_control.py b/test/registered/scheduler/test_scheduler_control.py index 3e6d967d2..ea77c8023 100644 --- a/test/registered/scheduler/test_scheduler_control.py +++ b/test/registered/scheduler/test_scheduler_control.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( run_and_check_memory_leak, ) -register_cuda_ci(est_time=360, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=367, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=300, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/sessions/test_session_control.py b/test/registered/sessions/test_session_control.py index 386d57b9b..ed5855d89 100644 --- a/test/registered/sessions/test_session_control.py +++ b/test/registered/sessions/test_session_control.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=77, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=87, suite="stage-b-test-1-gpu-large") def remove_prefix(text: str, prefix: str) -> str: diff --git a/test/registered/sessions/test_streaming_session.py b/test/registered/sessions/test_streaming_session.py index fc095c055..f565f7742 100644 --- a/test/registered/sessions/test_streaming_session.py +++ b/test/registered/sessions/test_streaming_session.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=560, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=691, suite="stage-b-test-1-gpu-large") LOGPROB_PROMPTS = [ "The quick brown fox jumps over the lazy dog.", diff --git a/test/registered/sessions/test_streaming_session_swa.py b/test/registered/sessions/test_streaming_session_swa.py index 465b26a24..76e124783 100644 --- a/test/registered/sessions/test_streaming_session_swa.py +++ b/test/registered/sessions/test_streaming_session_swa.py @@ -24,7 +24,7 @@ from test_streaming_session import ( # noqa: E402 TestStreamingSessionAbortLeakRepro, ) -register_cuda_ci(est_time=450, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=519, suite="stage-b-test-1-gpu-large") SWA_MODEL = "openai/gpt-oss-20b" diff --git a/test/registered/spec/dflash/test_dflash.py b/test/registered/spec/dflash/test_dflash.py index 1583bd92b..d393e4019 100644 --- a/test/registered/spec/dflash/test_dflash.py +++ b/test/registered/spec/dflash/test_dflash.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=302, suite="stage-b-test-1-gpu-small") class TestDFlashServerBase(CustomTestCase, MatchedStopMixin, GSM8KMixin): diff --git a/test/registered/spec/eagle/test_adaptive_speculative.py b/test/registered/spec/eagle/test_adaptive_speculative.py index 642f941df..6863eacb4 100644 --- a/test/registered/spec/eagle/test_adaptive_speculative.py +++ b/test/registered/spec/eagle/test_adaptive_speculative.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=420, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=76, suite="stage-b-test-1-gpu-large") HIGH_ACCEPT_PROMPT = ( "Output exactly 128 new lines. " diff --git a/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py b/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py index bea968024..a8372c84e 100644 --- a/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py +++ b/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=510, suite="stage-b-test-4-gpu-b200") +register_cuda_ci(est_time=420, suite="stage-b-test-4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/spec/eagle/test_eagle3_basic.py b/test/registered/spec/eagle/test_eagle3_basic.py index 19486829e..90e672ef1 100644 --- a/test/registered/spec/eagle/test_eagle3_basic.py +++ b/test/registered/spec/eagle/test_eagle3_basic.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( DEFAULT_TARGET_MODEL_EAGLE3, ) -register_cuda_ci(est_time=70, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=88, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=50, suite="stage-b-test-1-gpu-small") _is_hip = is_hip() diff --git a/test/registered/spec/eagle/test_eagle_constrained_decoding.py b/test/registered/spec/eagle/test_eagle_constrained_decoding.py index 13712d152..05536be5e 100644 --- a/test/registered/spec/eagle/test_eagle_constrained_decoding.py +++ b/test/registered/spec/eagle/test_eagle_constrained_decoding.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=96, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=116, suite="stage-b-test-1-gpu-large") class TestEagleConstrainedDecoding( diff --git a/test/registered/spec/eagle/test_eagle_dp_attention.py b/test/registered/spec/eagle/test_eagle_dp_attention.py index 3f9dc9d1c..4fa87f1d5 100644 --- a/test/registered/spec/eagle/test_eagle_dp_attention.py +++ b/test/registered/spec/eagle/test_eagle_dp_attention.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( ) # EAGLE3 with DP attention (tp=2, dp=2, requires 4 GPUs) -register_cuda_ci(est_time=96, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=99, suite="stage-c-test-4-gpu-h100") register_amd_ci(est_time=200, suite="stage-c-test-4-gpu-amd") diff --git a/test/registered/spec/eagle/test_eagle_infer_a.py b/test/registered/spec/eagle/test_eagle_infer_a.py index e7bfd9936..eca84327c 100644 --- a/test/registered/spec/eagle/test_eagle_infer_a.py +++ b/test/registered/spec/eagle/test_eagle_infer_a.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=266, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=357, suite="stage-b-test-1-gpu-large") class TestEAGLEEngine(CustomTestCase): diff --git a/test/registered/spec/eagle/test_eagle_infer_b.py b/test/registered/spec/eagle/test_eagle_infer_b.py index c603a04d8..7e941b38e 100644 --- a/test/registered/spec/eagle/test_eagle_infer_b.py +++ b/test/registered/spec/eagle/test_eagle_infer_b.py @@ -22,7 +22,7 @@ from sglang.test.run_eval import run_eval from sglang.test.server_fixtures.eagle_fixture import EagleServerBase from sglang.test.test_utils import DEFAULT_TARGET_MODEL_EAGLE, run_logprob_check -register_cuda_ci(est_time=684, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=847, suite="stage-b-test-1-gpu-large") class TestEAGLEServerBasic(EagleServerBase): diff --git a/test/registered/spec/eagle/test_eagle_infer_beta.py b/test/registered/spec/eagle/test_eagle_infer_beta.py index 77a571c14..96a2096a7 100644 --- a/test/registered/spec/eagle/test_eagle_infer_beta.py +++ b/test/registered/spec/eagle/test_eagle_infer_beta.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=333, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=369, suite="stage-b-test-1-gpu-small") class TestEagle3ServerBase(CustomTestCase, MatchedStopMixin): diff --git a/test/registered/spec/eagle/test_eagle_infer_beta_dp_attention.py b/test/registered/spec/eagle/test_eagle_infer_beta_dp_attention.py index ba21aabc3..bb31b88ae 100644 --- a/test/registered/spec/eagle/test_eagle_infer_beta_dp_attention.py +++ b/test/registered/spec/eagle/test_eagle_infer_beta_dp_attention.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( ) # EAGLE with DP attention on B200 (tp=2, dp=2, requires 4 B200 GPUs) -register_cuda_ci(est_time=136, suite="stage-c-test-4-gpu-b200-small") +register_cuda_ci(est_time=123, suite="stage-c-test-4-gpu-b200-small") def test_gsm8k(base_url: str, model: str): diff --git a/test/registered/spec/test_constrained_decoding_spec_reasoning.py b/test/registered/spec/test_constrained_decoding_spec_reasoning.py index 81e53d01e..18225dc25 100644 --- a/test/registered/spec/test_constrained_decoding_spec_reasoning.py +++ b/test/registered/spec/test_constrained_decoding_spec_reasoning.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( ) # Constrained decoding with EAGLE3 speculative reasoning (tp=2) -register_cuda_ci(est_time=80, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=137, suite="stage-b-test-2-gpu-large") class ServerWithGrammar(CustomTestCase): diff --git a/test/registered/spec/test_ngram_speculative_decoding.py b/test/registered/spec/test_ngram_speculative_decoding.py index f1fdfb11c..ad3904b7d 100644 --- a/test/registered/spec/test_ngram_speculative_decoding.py +++ b/test/registered/spec/test_ngram_speculative_decoding.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=254, suite="stage-b-test-1-gpu-large") GSM_DATASET_PATH = None diff --git a/test/registered/spec/test_standalone_speculative_decoding.py b/test/registered/spec/test_standalone_speculative_decoding.py index cebe13467..6510210df 100644 --- a/test/registered/spec/test_standalone_speculative_decoding.py +++ b/test/registered/spec/test_standalone_speculative_decoding.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( ) # Standalone speculative decoding tests (FA3, Triton, FlashInfer backends) -register_cuda_ci(est_time=294, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=406, suite="stage-b-test-1-gpu-large") GSM_DATASET_PATH = None diff --git a/test/registered/spec/utils/test_build_eagle_tree.py b/test/registered/spec/utils/test_build_eagle_tree.py index d07afeb7c..103349fcc 100644 --- a/test/registered/spec/utils/test_build_eagle_tree.py +++ b/test/registered/spec/utils/test_build_eagle_tree.py @@ -9,7 +9,7 @@ from sglang.srt.speculative.eagle_utils import ( from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=4, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=6, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=3, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/tokenizer/test_multi_tokenizer.py b/test/registered/tokenizer/test_multi_tokenizer.py index caa0dd2cb..134bcf845 100644 --- a/test/registered/tokenizer/test_multi_tokenizer.py +++ b/test/registered/tokenizer/test_multi_tokenizer.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=204, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=211, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=345, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/tokenizer/test_skip_tokenizer_init.py b/test/registered/tokenizer/test_skip_tokenizer_init.py index 3cb491979..89a5ff977 100644 --- a/test/registered/tokenizer/test_skip_tokenizer_init.py +++ b/test/registered/tokenizer/test_skip_tokenizer_init.py @@ -23,7 +23,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=82, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=79, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=117, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/auto_benchmark/test_dataset_tools.py b/test/registered/unit/auto_benchmark/test_dataset_tools.py index 821921289..cab0aaee3 100644 --- a/test/registered/unit/auto_benchmark/test_dataset_tools.py +++ b/test/registered/unit/auto_benchmark/test_dataset_tools.py @@ -15,7 +15,7 @@ from sglang.auto_benchmark_lib import infer_backend, prepare_dataset from sglang.benchmark.datasets.autobench import sample_autobench_requests from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=5, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=6, suite="stage-b-test-1-gpu-small") class TestAutoBenchmarkDatasetTools(AutoBenchmarkTestCase): diff --git a/test/registered/unit/auto_benchmark/test_run_candidate.py b/test/registered/unit/auto_benchmark/test_run_candidate.py index 7c3b78f22..e172fac3e 100644 --- a/test/registered/unit/auto_benchmark/test_run_candidate.py +++ b/test/registered/unit/auto_benchmark/test_run_candidate.py @@ -14,7 +14,7 @@ from auto_benchmark import AutoBenchmarkTestCase from sglang.auto_benchmark_lib import SearchDeadlineExceeded, run_candidate from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=5, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=6, suite="stage-b-test-1-gpu-small") class TestAutoBenchmarkRunCandidate(AutoBenchmarkTestCase): diff --git a/test/registered/unit/auto_benchmark/test_search_tools.py b/test/registered/unit/auto_benchmark/test_search_tools.py index 409d7e2f7..24af47d0b 100644 --- a/test/registered/unit/auto_benchmark/test_search_tools.py +++ b/test/registered/unit/auto_benchmark/test_search_tools.py @@ -28,7 +28,7 @@ from sglang.auto_benchmark_lib import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=5, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=6, suite="stage-b-test-1-gpu-small") class TestAutoBenchmarkSearchTools(AutoBenchmarkTestCase): diff --git a/test/registered/unit/configs/test_linear_attn_model_registry.py b/test/registered/unit/configs/test_linear_attn_model_registry.py index 8933a25d5..9eb6970ca 100644 --- a/test/registered/unit/configs/test_linear_attn_model_registry.py +++ b/test/registered/unit/configs/test_linear_attn_model_registry.py @@ -13,7 +13,7 @@ from sglang.srt.configs.linear_attn_model_registry import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") # Dummy config classes for testing diff --git a/test/registered/unit/entrypoints/openai/test_matched_stop.py b/test/registered/unit/entrypoints/openai/test_matched_stop.py index d3d8c65d1..9c0f5d5ee 100644 --- a/test/registered/unit/entrypoints/openai/test_matched_stop.py +++ b/test/registered/unit/entrypoints/openai/test_matched_stop.py @@ -3,7 +3,7 @@ import unittest from sglang.srt.sampling.sampling_params import MAX_LEN, get_max_seq_length from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") class TestRegexPatternMaxLength(unittest.TestCase): diff --git a/test/registered/unit/entrypoints/openai/test_protocol.py b/test/registered/unit/entrypoints/openai/test_protocol.py index d29a1cf1b..ee978f6a7 100644 --- a/test/registered/unit/entrypoints/openai/test_protocol.py +++ b/test/registered/unit/entrypoints/openai/test_protocol.py @@ -32,7 +32,7 @@ from sglang.srt.entrypoints.openai.protocol import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") class TestModelCard(unittest.TestCase): diff --git a/test/registered/unit/entrypoints/openai/test_serving_chat.py b/test/registered/unit/entrypoints/openai/test_serving_chat.py index 1fbc8bad7..19f30cf08 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_chat.py +++ b/test/registered/unit/entrypoints/openai/test_serving_chat.py @@ -31,7 +31,7 @@ from sglang.srt.managers.io_struct import GenerateReqInput from sglang.srt.utils import get_or_create_event_loop from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="stage-a-test-cpu") +register_cpu_ci(est_time=11, suite="stage-a-test-cpu") class _MockTokenizerManager: diff --git a/test/registered/unit/entrypoints/openai/test_serving_completions.py b/test/registered/unit/entrypoints/openai/test_serving_completions.py index 7b19b59ca..f090cb4da 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_completions.py +++ b/test/registered/unit/entrypoints/openai/test_serving_completions.py @@ -22,7 +22,7 @@ from sglang.srt.managers.tokenizer_manager import TokenizerManager from sglang.srt.utils import get_or_create_event_loop from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="stage-a-test-cpu") +register_cpu_ci(est_time=11, suite="stage-a-test-cpu") class _MockTemplateManager: diff --git a/test/registered/unit/entrypoints/openai/test_serving_embedding.py b/test/registered/unit/entrypoints/openai/test_serving_embedding.py index ccbd03435..abbec63ec 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_embedding.py +++ b/test/registered/unit/entrypoints/openai/test_serving_embedding.py @@ -54,7 +54,7 @@ from sglang.srt.entrypoints.openai.serving_embedding import OpenAIServingEmbeddi from sglang.srt.managers.io_struct import EmbeddingReqInput from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=9, suite="stage-a-test-cpu") +register_cpu_ci(est_time=10, suite="stage-a-test-cpu") # Mock TokenizerManager for embedding tests diff --git a/test/registered/unit/entrypoints/test_ssl_cert_refresher.py b/test/registered/unit/entrypoints/test_ssl_cert_refresher.py index 85393fd86..119a08348 100644 --- a/test/registered/unit/entrypoints/test_ssl_cert_refresher.py +++ b/test/registered/unit/entrypoints/test_ssl_cert_refresher.py @@ -8,7 +8,7 @@ from sglang.srt.entrypoints.ssl_utils import SSLCertRefresher from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=13, suite="stage-a-test-cpu") +register_cpu_ci(est_time=14, suite="stage-a-test-cpu") def _make_temp_pem(content: bytes) -> str: diff --git a/test/registered/unit/entrypoints/test_v1_loads_aggregate.py b/test/registered/unit/entrypoints/test_v1_loads_aggregate.py index 75e1cf50c..4273f9687 100644 --- a/test/registered/unit/entrypoints/test_v1_loads_aggregate.py +++ b/test/registered/unit/entrypoints/test_v1_loads_aggregate.py @@ -11,7 +11,7 @@ from sglang.srt.entrypoints.v1_loads import _compute_aggregate from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="stage-a-test-cpu") +register_cpu_ci(est_time=10, suite="stage-a-test-cpu") def _load( diff --git a/test/registered/unit/eplb/test_balanced_packing.py b/test/registered/unit/eplb/test_balanced_packing.py index 447e7cdd2..efa94f94d 100644 --- a/test/registered/unit/eplb/test_balanced_packing.py +++ b/test/registered/unit/eplb/test_balanced_packing.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") import unittest diff --git a/test/registered/unit/eplb/test_compute_logical_to_rank_dispatch_physical_map.py b/test/registered/unit/eplb/test_compute_logical_to_rank_dispatch_physical_map.py index 68e75fab2..f4981060c 100644 --- a/test/registered/unit/eplb/test_compute_logical_to_rank_dispatch_physical_map.py +++ b/test/registered/unit/eplb/test_compute_logical_to_rank_dispatch_physical_map.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") import types import unittest diff --git a/test/registered/unit/function_call/test_hunyuan_detector.py b/test/registered/unit/function_call/test_hunyuan_detector.py index 61bef8f01..5b64aac8b 100644 --- a/test/registered/unit/function_call/test_hunyuan_detector.py +++ b/test/registered/unit/function_call/test_hunyuan_detector.py @@ -8,7 +8,7 @@ from sglang.srt.function_call.hunyuan_detector import HunyuanDetector from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") def _make_tools(): diff --git a/test/registered/unit/layers/test_conv_layer.py b/test/registered/unit/layers/test_conv_layer.py index 20ab6698a..2dedbc3b5 100644 --- a/test/registered/unit/layers/test_conv_layer.py +++ b/test/registered/unit/layers/test_conv_layer.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=4, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=7, suite="stage-b-test-1-gpu-small") import unittest diff --git a/test/registered/unit/layers/test_mamba_state_scatter_triton.py b/test/registered/unit/layers/test_mamba_state_scatter_triton.py index c1f106c4b..1f20373b3 100644 --- a/test/registered/unit/layers/test_mamba_state_scatter_triton.py +++ b/test/registered/unit/layers/test_mamba_state_scatter_triton.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=4, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=7, suite="stage-b-test-1-gpu-small") import os import unittest diff --git a/test/registered/unit/layers/test_pooler_score_and_pool.py b/test/registered/unit/layers/test_pooler_score_and_pool.py index 829b228ba..9ce8d33ff 100644 --- a/test/registered/unit/layers/test_pooler_score_and_pool.py +++ b/test/registered/unit/layers/test_pooler_score_and_pool.py @@ -19,7 +19,7 @@ from sglang.srt.layers.pooler import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=9, suite="stage-a-test-cpu") +register_cpu_ci(est_time=10, suite="stage-a-test-cpu") def _make_forward_batch( diff --git a/test/registered/unit/lora/test_mem_pool_ep_unit.py b/test/registered/unit/lora/test_mem_pool_ep_unit.py index b37248c30..6a374e058 100644 --- a/test/registered/unit/lora/test_mem_pool_ep_unit.py +++ b/test/registered/unit/lora/test_mem_pool_ep_unit.py @@ -16,7 +16,7 @@ Usage: from sglang.test.ci.ci_register import register_cuda_ci # CPU-only unit test; no CUDA/distributed dependencies. -register_cuda_ci(est_time=4, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") import types import unittest diff --git a/test/registered/unit/managers/test_dp_budget.py b/test/registered/unit/managers/test_dp_budget.py index ccf2f8449..5d4e66cea 100644 --- a/test/registered/unit/managers/test_dp_budget.py +++ b/test/registered/unit/managers/test_dp_budget.py @@ -17,7 +17,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.data_parallel_controller import DPBudget from sglang.srt.managers.io_struct import GetLoadsReqOutput, WatchLoadUpdateReq -register_cpu_ci(est_time=2, suite="stage-a-test-cpu") +register_cpu_ci(est_time=11, suite="stage-a-test-cpu") _BASE_LOAD = GetLoadsReqOutput( diff --git a/test/registered/unit/managers/test_hisparse_unit.py b/test/registered/unit/managers/test_hisparse_unit.py index 6c4028be6..e3f3d54a5 100644 --- a/test/registered/unit/managers/test_hisparse_unit.py +++ b/test/registered/unit/managers/test_hisparse_unit.py @@ -16,7 +16,7 @@ import torch from sglang.srt.utils import is_cuda, is_hip, is_npu, is_xpu from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=20, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") # --------------------------------------------------------------------------- # Test configuration (small-scale for fast CI runs) diff --git a/test/registered/unit/managers/test_prefill_adder.py b/test/registered/unit/managers/test_prefill_adder.py index 85a4acf39..182b78938 100644 --- a/test/registered/unit/managers/test_prefill_adder.py +++ b/test/registered/unit/managers/test_prefill_adder.py @@ -12,7 +12,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=2, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/managers/test_scheduler_flush_cache.py b/test/registered/unit/managers/test_scheduler_flush_cache.py index 249b4b8ce..0b5d5aadd 100644 --- a/test/registered/unit/managers/test_scheduler_flush_cache.py +++ b/test/registered/unit/managers/test_scheduler_flush_cache.py @@ -9,7 +9,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.io_struct import FlushCacheReqInput from sglang.srt.managers.scheduler import Scheduler -register_cpu_ci(est_time=10, suite="stage-a-test-cpu") +register_cpu_ci(est_time=14, suite="stage-a-test-cpu") class TestSchedulerFlushCache(unittest.TestCase): diff --git a/test/registered/unit/managers/test_scheduler_pause_generation.py b/test/registered/unit/managers/test_scheduler_pause_generation.py index 46bc664eb..b1059a33e 100644 --- a/test/registered/unit/managers/test_scheduler_pause_generation.py +++ b/test/registered/unit/managers/test_scheduler_pause_generation.py @@ -11,7 +11,7 @@ from sglang.srt.managers.io_struct import PauseGenerationReqInput from sglang.srt.managers.scheduler import Scheduler from sglang.srt.managers.scheduler_runtime_checker_mixin import PoolStats -register_cpu_ci(est_time=10, suite="stage-a-test-cpu") +register_cpu_ci(est_time=15, suite="stage-a-test-cpu") class TestSchedulerPauseGeneration(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_evict_policy.py b/test/registered/unit/mem_cache/test_evict_policy.py index 13e022acf..8365c0580 100644 --- a/test/registered/unit/mem_cache/test_evict_policy.py +++ b/test/registered/unit/mem_cache/test_evict_policy.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") import unittest from unittest.mock import MagicMock diff --git a/test/registered/unit/mem_cache/test_mamba_unittest.py b/test/registered/unit/mem_cache/test_mamba_unittest.py index bc7c75a9a..6158f622b 100755 --- a/test/registered/unit/mem_cache/test_mamba_unittest.py +++ b/test/registered/unit/mem_cache/test_mamba_unittest.py @@ -21,7 +21,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=9, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/mem_cache/test_nsa_pool_host_unit.py b/test/registered/unit/mem_cache/test_nsa_pool_host_unit.py index 2602e196a..6cac74027 100644 --- a/test/registered/unit/mem_cache/test_nsa_pool_host_unit.py +++ b/test/registered/unit/mem_cache/test_nsa_pool_host_unit.py @@ -12,7 +12,7 @@ from sglang.srt.mem_cache.memory_pool_host import ( from sglang.srt.utils import is_cuda, is_hip, is_npu, is_xpu from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") class TestNSAHiCacheTransfer(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py b/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py index bc28b40b7..46dc341a3 100644 --- a/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py +++ b/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py @@ -13,7 +13,7 @@ from sglang.srt.mem_cache.memory_pool import MHATokenToKVPool, ReqToTokenPool from sglang.srt.mem_cache.radix_cache import RadixCache, RadixKey from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=7, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") class TestSLRUAccuracy(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_radix_cache_unit.py b/test/registered/unit/mem_cache/test_radix_cache_unit.py index c45e3cef8..73ff4fd13 100644 --- a/test/registered/unit/mem_cache/test_radix_cache_unit.py +++ b/test/registered/unit/mem_cache/test_radix_cache_unit.py @@ -21,7 +21,7 @@ from sglang.srt.mem_cache.common import available_and_evictable_str from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # CPU-based unit test, runs quickly on any GPU runner -register_cuda_ci(est_time=16, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=15, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=5, suite="stage-b-test-1-gpu-small-amd") import random diff --git a/test/registered/unit/mem_cache/test_streaming_session_unit.py b/test/registered/unit/mem_cache/test_streaming_session_unit.py index b4ac9e8c3..7960470bb 100644 --- a/test/registered/unit/mem_cache/test_streaming_session_unit.py +++ b/test/registered/unit/mem_cache/test_streaming_session_unit.py @@ -7,7 +7,7 @@ from sglang.srt.mem_cache.base_prefix_cache import MatchResult from sglang.srt.session.streaming_session import SessionSlot, StreamingSession from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="stage-a-test-cpu") +register_cpu_ci(est_time=12, suite="stage-a-test-cpu") class _FakeAllocator: diff --git a/test/registered/unit/mem_cache/test_swa_eviction_boundary.py b/test/registered/unit/mem_cache/test_swa_eviction_boundary.py index b4c302261..751dccee2 100644 --- a/test/registered/unit/mem_cache/test_swa_eviction_boundary.py +++ b/test/registered/unit/mem_cache/test_swa_eviction_boundary.py @@ -26,7 +26,7 @@ from sglang.srt.mem_cache.swa_radix_cache import SWARadixCache from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=12, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/mem_cache/test_swa_unittest.py b/test/registered/unit/mem_cache/test_swa_unittest.py index e5b922166..d3a6e2c42 100644 --- a/test/registered/unit/mem_cache/test_swa_unittest.py +++ b/test/registered/unit/mem_cache/test_swa_unittest.py @@ -17,7 +17,7 @@ from sglang.srt.mem_cache.swa_radix_cache import SWARadixCache from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/mem_cache/test_unified_radix_cache_bench.py b/test/registered/unit/mem_cache/test_unified_radix_cache_bench.py index 5dce0295a..f775b213a 100644 --- a/test/registered/unit/mem_cache/test_unified_radix_cache_bench.py +++ b/test/registered/unit/mem_cache/test_unified_radix_cache_bench.py @@ -38,7 +38,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=25, suite="stage-b-test-1-gpu-small") # --------------------------------------------------------------------------- # Constants diff --git a/test/registered/unit/mem_cache/test_unified_radix_cache_unittest.py b/test/registered/unit/mem_cache/test_unified_radix_cache_unittest.py index 72d9da236..114a06e1b 100644 --- a/test/registered/unit/mem_cache/test_unified_radix_cache_unittest.py +++ b/test/registered/unit/mem_cache/test_unified_radix_cache_unittest.py @@ -39,7 +39,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") @dataclass(frozen=True) diff --git a/test/registered/unit/model_executor/test_pool_configurator.py b/test/registered/unit/model_executor/test_pool_configurator.py index 04dc59e12..ea98b2c4d 100644 --- a/test/registered/unit/model_executor/test_pool_configurator.py +++ b/test/registered/unit/model_executor/test_pool_configurator.py @@ -12,7 +12,7 @@ from unittest.mock import MagicMock, patch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=9, suite="stage-a-test-cpu") +register_cpu_ci(est_time=10, suite="stage-a-test-cpu") @contextlib.contextmanager diff --git a/test/registered/unit/model_loader/test_modelopt_export.py b/test/registered/unit/model_loader/test_modelopt_export.py index 697af4a2c..a1eb133c2 100644 --- a/test/registered/unit/model_loader/test_modelopt_export.py +++ b/test/registered/unit/model_loader/test_modelopt_export.py @@ -19,7 +19,7 @@ from sglang.srt.configs.model_config import ModelConfig from sglang.srt.model_loader.loader import ModelOptModelLoader from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=11, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=9, suite="stage-b-test-1-gpu-small-amd") # Note: PYTHONPATH=python should be set when running tests diff --git a/test/registered/unit/model_loader/test_modelopt_loader.py b/test/registered/unit/model_loader/test_modelopt_loader.py index a7afcaf24..7f9652c0e 100644 --- a/test/registered/unit/model_loader/test_modelopt_loader.py +++ b/test/registered/unit/model_loader/test_modelopt_loader.py @@ -30,7 +30,7 @@ CALIBRATION_BATCH_SIZE = 36 CALIBRATION_NUM_SAMPLES = 512 DEFAULT_DEVICE = "cuda:0" -register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=11, suite="stage-b-test-1-gpu-small") class TestModelOptModelLoader(CustomTestCase): diff --git a/test/registered/unit/model_loader/test_prefetch_checkpoints.py b/test/registered/unit/model_loader/test_prefetch_checkpoints.py index 9d234df2c..0a3e91faf 100644 --- a/test/registered/unit/model_loader/test_prefetch_checkpoints.py +++ b/test/registered/unit/model_loader/test_prefetch_checkpoints.py @@ -18,7 +18,7 @@ from sglang.srt.model_loader.weight_utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=10, suite="stage-a-test-cpu") class TestPrefetchWeightsIdentical(unittest.TestCase): diff --git a/test/registered/unit/models/test_llava.py b/test/registered/unit/models/test_llava.py index 1e4ca1ce2..4ebaecf8e 100644 --- a/test/registered/unit/models/test_llava.py +++ b/test/registered/unit/models/test_llava.py @@ -5,7 +5,7 @@ from sglang.srt.models.llava import AutoModel, LlavaForConditionalGeneration from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") class PixtralVisionConfig: diff --git a/test/registered/unit/observability/test_func_timer.py b/test/registered/unit/observability/test_func_timer.py index 988a5ca27..30608ca8e 100644 --- a/test/registered/unit/observability/test_func_timer.py +++ b/test/registered/unit/observability/test_func_timer.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") import asyncio import unittest diff --git a/test/registered/unit/observability/test_label_transform.py b/test/registered/unit/observability/test_label_transform.py index 2b941006a..f71c66bd1 100644 --- a/test/registered/unit/observability/test_label_transform.py +++ b/test/registered/unit/observability/test_label_transform.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") import unittest diff --git a/test/registered/unit/observability/test_metrics_utils.py b/test/registered/unit/observability/test_metrics_utils.py index 1d20fd944..6eb26d8ff 100644 --- a/test/registered/unit/observability/test_metrics_utils.py +++ b/test/registered/unit/observability/test_metrics_utils.py @@ -6,7 +6,7 @@ from sglang.srt.observability.utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") class TestMetricsUtils(unittest.TestCase): diff --git a/test/registered/unit/observability/test_request_metrics_exporter.py b/test/registered/unit/observability/test_request_metrics_exporter.py index 3dd4f618c..683bb10b6 100644 --- a/test/registered/unit/observability/test_request_metrics_exporter.py +++ b/test/registered/unit/observability/test_request_metrics_exporter.py @@ -5,7 +5,7 @@ from typing import Any, Dict, List, Optional from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") import asyncio import json diff --git a/test/registered/unit/observability/test_startup_func_log_and_timer.py b/test/registered/unit/observability/test_startup_func_log_and_timer.py index 5afcfab8f..90fcf5074 100644 --- a/test/registered/unit/observability/test_startup_func_log_and_timer.py +++ b/test/registered/unit/observability/test_startup_func_log_and_timer.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") import unittest from unittest.mock import MagicMock, patch diff --git a/test/registered/unit/observability/test_trace.py b/test/registered/unit/observability/test_trace.py index 78654030c..719f31270 100644 --- a/test/registered/unit/observability/test_trace.py +++ b/test/registered/unit/observability/test_trace.py @@ -4,7 +4,7 @@ import os from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") import threading import unittest diff --git a/test/registered/unit/parser/test_code_completion_parser.py b/test/registered/unit/parser/test_code_completion_parser.py index 1182e0910..b8a411585 100644 --- a/test/registered/unit/parser/test_code_completion_parser.py +++ b/test/registered/unit/parser/test_code_completion_parser.py @@ -18,7 +18,7 @@ from sglang.srt.parser.code_completion_parser import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") class TestFimPosition(CustomTestCase): diff --git a/test/registered/unit/parser/test_conversation.py b/test/registered/unit/parser/test_conversation.py index ed0a43c44..72bfb8cca 100644 --- a/test/registered/unit/parser/test_conversation.py +++ b/test/registered/unit/parser/test_conversation.py @@ -32,7 +32,7 @@ from sglang.srt.parser.conversation import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") class TestConversationGetPrompt(CustomTestCase): diff --git a/test/registered/unit/parser/test_harmony_parser.py b/test/registered/unit/parser/test_harmony_parser.py index 02c559146..26242a9db 100644 --- a/test/registered/unit/parser/test_harmony_parser.py +++ b/test/registered/unit/parser/test_harmony_parser.py @@ -14,7 +14,7 @@ from sglang.srt.parser.harmony_parser import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") class TestEvent(CustomTestCase): diff --git a/test/registered/unit/parser/test_jinja_template_utils.py b/test/registered/unit/parser/test_jinja_template_utils.py index c3845148e..3396de98a 100644 --- a/test/registered/unit/parser/test_jinja_template_utils.py +++ b/test/registered/unit/parser/test_jinja_template_utils.py @@ -9,7 +9,7 @@ from sglang.srt.parser.jinja_template_utils import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") class TestTemplateContentFormatDetection(CustomTestCase): diff --git a/test/registered/unit/parser/test_reasoning_content_without_parser.py b/test/registered/unit/parser/test_reasoning_content_without_parser.py index 265adb711..f8eada591 100644 --- a/test/registered/unit/parser/test_reasoning_content_without_parser.py +++ b/test/registered/unit/parser/test_reasoning_content_without_parser.py @@ -4,7 +4,7 @@ from sglang.srt.parser.reasoning_parser import ReasoningParser from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") # Simulated model output that contains think tags (e.g. from DeepSeek-R1) THINK_OUTPUT = ( diff --git a/test/registered/unit/parser/test_reasoning_parser.py b/test/registered/unit/parser/test_reasoning_parser.py index f33c88414..958168a7d 100644 --- a/test/registered/unit/parser/test_reasoning_parser.py +++ b/test/registered/unit/parser/test_reasoning_parser.py @@ -18,7 +18,7 @@ from sglang.srt.parser.reasoning_parser import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") class TestStreamingParseResult(CustomTestCase): diff --git a/test/registered/unit/platforms/test_platform_interface.py b/test/registered/unit/platforms/test_platform_interface.py index e77a83c6f..f5bfcd337 100644 --- a/test/registered/unit/platforms/test_platform_interface.py +++ b/test/registered/unit/platforms/test_platform_interface.py @@ -18,7 +18,7 @@ from sglang.srt.platforms.interface import SRTPlatform from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/plugins/test_hook_registry.py b/test/registered/unit/plugins/test_hook_registry.py index 4f066189a..b01ed3b37 100644 --- a/test/registered/unit/plugins/test_hook_registry.py +++ b/test/registered/unit/plugins/test_hook_registry.py @@ -16,7 +16,7 @@ from sglang.srt.plugins.hook_registry import HookRegistry, HookType, plugin_hook from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") # --------------------------------------------------------------------------- # Helpers: synthetic module creation diff --git a/test/registered/unit/plugins/test_load_plugins.py b/test/registered/unit/plugins/test_load_plugins.py index 218f0fc27..be2e13570 100644 --- a/test/registered/unit/plugins/test_load_plugins.py +++ b/test/registered/unit/plugins/test_load_plugins.py @@ -19,7 +19,7 @@ from sglang.srt.plugins import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") def _make_ep(name, dist_name=None, load_fn=None): diff --git a/test/registered/unit/sampling/test_custom_logit_processor.py b/test/registered/unit/sampling/test_custom_logit_processor.py index 6ef5544aa..eb9a76d0c 100644 --- a/test/registered/unit/sampling/test_custom_logit_processor.py +++ b/test/registered/unit/sampling/test_custom_logit_processor.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") import json import unittest diff --git a/test/registered/unit/sampling/test_penaltylib.py b/test/registered/unit/sampling/test_penaltylib.py index 4943ff887..5e39ed32c 100644 --- a/test/registered/unit/sampling/test_penaltylib.py +++ b/test/registered/unit/sampling/test_penaltylib.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="stage-a-test-cpu") +register_cpu_ci(est_time=9, suite="stage-a-test-cpu") import unittest from unittest.mock import MagicMock diff --git a/test/registered/unit/sampling/test_sampling_batch_info.py b/test/registered/unit/sampling/test_sampling_batch_info.py index 9af7587f2..c3df29892 100644 --- a/test/registered/unit/sampling/test_sampling_batch_info.py +++ b/test/registered/unit/sampling/test_sampling_batch_info.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="stage-a-test-cpu") +register_cpu_ci(est_time=9, suite="stage-a-test-cpu") import unittest from unittest.mock import MagicMock, patch diff --git a/test/registered/unit/sampling/test_sampling_params.py b/test/registered/unit/sampling/test_sampling_params.py index ce9a7c3c3..b849e6e85 100644 --- a/test/registered/unit/sampling/test_sampling_params.py +++ b/test/registered/unit/sampling/test_sampling_params.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") import unittest from unittest.mock import MagicMock diff --git a/test/registered/unit/server_args/test_server_args.py b/test/registered/unit/server_args/test_server_args.py index 29b962b74..a83a2c693 100644 --- a/test/registered/unit/server_args/test_server_args.py +++ b/test/registered/unit/server_args/test_server_args.py @@ -10,7 +10,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cpu_ci(est_time=9, suite="stage-a-test-cpu") +register_cpu_ci(est_time=10, suite="stage-a-test-cpu") # Mock get_device() so all tests run on CPU-only CI runners _mock_device = patch("sglang.srt.server_args.get_device", return_value="cuda") diff --git a/test/registered/unit/spec/test_adaptive_spec_params.py b/test/registered/unit/spec/test_adaptive_spec_params.py index 737908249..217064801 100644 --- a/test/registered/unit/spec/test_adaptive_spec_params.py +++ b/test/registered/unit/spec/test_adaptive_spec_params.py @@ -3,7 +3,7 @@ import unittest from sglang.srt.speculative.adaptive_spec_params import AdaptiveSpeculativeParams from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") class TestAdaptiveSpeculativeParams(unittest.TestCase): diff --git a/test/registered/unit/spec/test_ngram_corpus.py b/test/registered/unit/spec/test_ngram_corpus.py index 97b0906e1..8d491b5b7 100644 --- a/test/registered/unit/spec/test_ngram_corpus.py +++ b/test/registered/unit/spec/test_ngram_corpus.py @@ -13,7 +13,7 @@ from sglang.srt.speculative.cpp_ngram.ngram_corpus import NgramCorpus from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=18, suite="stage-a-test-cpu") +register_cpu_ci(est_time=26, suite="stage-a-test-cpu") def _make_corpus(match_type="BFS", **kwargs): diff --git a/test/registered/unit/test_runai_utils.py b/test/registered/unit/test_runai_utils.py index 865b3c7a9..83a0adf1a 100644 --- a/test/registered/unit/test_runai_utils.py +++ b/test/registered/unit/test_runai_utils.py @@ -6,7 +6,7 @@ from sglang.srt.utils.runai_utils import ObjectStorageModel, is_runai_obj_uri from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") class TestRunaiUtils(CustomTestCase): diff --git a/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py b/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py index c683d0178..8b3023317 100644 --- a/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py +++ b/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py @@ -6,7 +6,7 @@ from unittest.mock import MagicMock, patch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") from sglang.srt.tokenizer.tiktoken_tokenizer import ( CONTROL_TOKEN_TEXTS, diff --git a/test/registered/unit/tools/test_get_version_tag.py b/test/registered/unit/tools/test_get_version_tag.py index d64dac347..b6114fef1 100644 --- a/test/registered/unit/tools/test_get_version_tag.py +++ b/test/registered/unit/tools/test_get_version_tag.py @@ -33,7 +33,7 @@ def _load_module(name, path): register_cpu_ci = _load_module("ci_register", CI_REGISTER_PATH).register_cpu_ci -register_cpu_ci(est_time=2, suite="stage-a-test-cpu") +register_cpu_ci(est_time=0, suite="stage-a-test-cpu") class TestGetVersionTag(unittest.TestCase): diff --git a/test/registered/unit/utils/test_gauge_histogram.py b/test/registered/unit/utils/test_gauge_histogram.py index e208d3e7a..b2dac54f9 100644 --- a/test/registered/unit/utils/test_gauge_histogram.py +++ b/test/registered/unit/utils/test_gauge_histogram.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") import unittest diff --git a/test/registered/unit/utils/test_hf_transformers.py b/test/registered/unit/utils/test_hf_transformers.py index cc6226a73..df7fddb29 100644 --- a/test/registered/unit/utils/test_hf_transformers.py +++ b/test/registered/unit/utils/test_hf_transformers.py @@ -24,7 +24,7 @@ from sglang.srt.utils.hf_transformers.tokenizer import _fix_special_tokens_patte from sglang.srt.utils.hf_transformers_patches import normalize_rope_scaling_compat from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/utils/test_http_server_auth.py b/test/registered/unit/utils/test_http_server_auth.py index 25c948704..69f50154e 100644 --- a/test/registered/unit/utils/test_http_server_auth.py +++ b/test/registered/unit/utils/test_http_server_auth.py @@ -10,7 +10,7 @@ import unittest from sglang.srt.utils.auth import AuthLevel, decide_request_auth from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") class TestHttpServerAdminAuth(unittest.TestCase): diff --git a/test/registered/unit/utils/test_json_response.py b/test/registered/unit/utils/test_json_response.py index 20669d4ac..764de5f53 100644 --- a/test/registered/unit/utils/test_json_response.py +++ b/test/registered/unit/utils/test_json_response.py @@ -10,7 +10,7 @@ from sglang.srt.utils.json_response import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=4, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") class TestJSONResponseUtils(unittest.TestCase): diff --git a/test/registered/unit/utils/test_profile_merger.py b/test/registered/unit/utils/test_profile_merger.py index e410af33e..29455288d 100644 --- a/test/registered/unit/utils/test_profile_merger.py +++ b/test/registered/unit/utils/test_profile_merger.py @@ -17,7 +17,7 @@ from sglang.srt.managers.io_struct import ProfileReq, ProfileReqInput, ProfileRe from sglang.srt.utils.profile_merger import ProfileMerger from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=8, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/utils/test_subprocess_watchdog.py b/test/registered/unit/utils/test_subprocess_watchdog.py index 1e9f50f92..48873ecbe 100644 --- a/test/registered/unit/utils/test_subprocess_watchdog.py +++ b/test/registered/unit/utils/test_subprocess_watchdog.py @@ -24,7 +24,7 @@ from sglang.srt.utils.watchdog import SubprocessWatchdog from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="stage-a-test-cpu") +register_cpu_ci(est_time=9, suite="stage-a-test-cpu") def healthy_worker(): diff --git a/test/registered/utils/test_log_utils.py b/test/registered/utils/test_log_utils.py index 449b8a856..b3007e220 100644 --- a/test/registered/utils/test_log_utils.py +++ b/test/registered/utils/test_log_utils.py @@ -9,7 +9,7 @@ from pathlib import Path from sglang.srt.utils.log_utils import create_log_targets, log_json from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") class TestLogUtils(unittest.TestCase): diff --git a/test/registered/utils/test_network_address.py b/test/registered/utils/test_network_address.py index 529162f2c..ff05206c2 100644 --- a/test/registered/utils/test_network_address.py +++ b/test/registered/utils/test_network_address.py @@ -6,7 +6,7 @@ from sglang.srt.server_args import PortArgs, ServerArgs from sglang.srt.utils.network import NetworkAddress from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") # Mock get_device() so ServerArgs tests run on CPU-only CI runners _mock_device = patch("sglang.srt.server_args.get_device", return_value="cuda") diff --git a/test/registered/utils/test_numa_utils.py b/test/registered/utils/test_numa_utils.py index fc3fe61bc..27719d306 100644 --- a/test/registered/utils/test_numa_utils.py +++ b/test/registered/utils/test_numa_utils.py @@ -9,7 +9,7 @@ from sglang.srt.utils.numa_utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci, register_cuda_ci -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") register_cuda_ci(est_time=10, suite="stage-c-test-4-gpu-gb200") register_cuda_ci(est_time=10, suite="stage-c-test-8-gpu-b200") diff --git a/test/registered/utils/test_socket_utils.py b/test/registered/utils/test_socket_utils.py index 058b81711..63a42ac39 100644 --- a/test/registered/utils/test_socket_utils.py +++ b/test/registered/utils/test_socket_utils.py @@ -15,7 +15,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase from sglang.utils import normalize_base_url, release_port, reserve_port -register_cpu_ci(est_time=6, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") class TestTryBindSocket(CustomTestCase): diff --git a/test/registered/vlm/test_evs.py b/test/registered/vlm/test_evs.py index cd4aa8b48..881089abc 100644 --- a/test/registered/vlm/test_evs.py +++ b/test/registered/vlm/test_evs.py @@ -6,7 +6,7 @@ import pytest from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import run_doctests -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=11, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/vlm/test_video_utils.py b/test/registered/vlm/test_video_utils.py index f4dd0b027..7587bb9ee 100644 --- a/test/registered/vlm/test_video_utils.py +++ b/test/registered/vlm/test_video_utils.py @@ -5,7 +5,7 @@ import pytest from sglang.srt.utils import sample_video_frames from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=4, suite="stage-a-test-cpu") +register_cpu_ci(est_time=7, suite="stage-a-test-cpu") class DummyVideo: diff --git a/test/registered/vlm/test_vision_chunked_prefill.py b/test/registered/vlm/test_vision_chunked_prefill.py index 57739821d..762923353 100644 --- a/test/registered/vlm/test_vision_chunked_prefill.py +++ b/test/registered/vlm/test_vision_chunked_prefill.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=143, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=156, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=270, suite="stage-b-test-1-gpu-small-amd") """ Usage: diff --git a/test/registered/vlm/test_vision_openai_server_a.py b/test/registered/vlm/test_vision_openai_server_a.py index c41eb1f61..d7acd2c16 100644 --- a/test/registered/vlm/test_vision_openai_server_a.py +++ b/test/registered/vlm/test_vision_openai_server_a.py @@ -19,7 +19,7 @@ from sglang.test.vlm_utils import ( VideoOpenAITestMixin, ) -register_cuda_ci(est_time=736, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=780, suite="stage-b-test-1-gpu-large") class TestLlavaServer(ImageOpenAITestMixin): diff --git a/test/registered/vlm/test_vlm_input_format.py b/test/registered/vlm/test_vlm_input_format.py index 81dac3550..1a829ae91 100644 --- a/test/registered/vlm/test_vlm_input_format.py +++ b/test/registered/vlm/test_vlm_input_format.py @@ -37,7 +37,7 @@ from sglang.srt.entrypoints.openai.protocol import ChatCompletionRequest from sglang.srt.parser.conversation import generate_chat_conv from sglang.srt.utils.hf_transformers_utils import _fix_added_tokens_encoding -register_cuda_ci(est_time=602, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=747, suite="stage-b-test-1-gpu-large") IMAGE_MAN_IRONING_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/man_ironing_on_back_of_suv.png" IMAGE_SGL_LOGO_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/sgl_logo.png" diff --git a/test/registered/vlm/test_vlm_tp4.py b/test/registered/vlm/test_vlm_tp4.py index 33137dc00..2ad16ff80 100644 --- a/test/registered/vlm/test_vlm_tp4.py +++ b/test/registered/vlm/test_vlm_tp4.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=118, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=133, suite="stage-c-test-4-gpu-h100") QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" MMMU_ACCURACY_THRESHOLD = 0.65