diff --git a/test/registered/4-gpu-models/test_gpt_oss_4gpu.py b/test/registered/4-gpu-models/test_gpt_oss_4gpu.py index 5e4ceef2a..dfbfc4fb1 100644 --- a/test/registered/4-gpu-models/test_gpt_oss_4gpu.py +++ b/test/registered/4-gpu-models/test_gpt_oss_4gpu.py @@ -3,8 +3,8 @@ import unittest from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=300, suite="stage-c-test-4-gpu-h100") -register_cuda_ci(est_time=300, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=328, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=312, suite="stage-c-test-4-gpu-b200") class TestGptOss4Gpu(BaseTestGptOss): diff --git a/test/registered/4-gpu-models/test_nvidia_nemotron_3_super_nvfp4.py b/test/registered/4-gpu-models/test_nvidia_nemotron_3_super_nvfp4.py index f658b1b86..f1d68e69b 100644 --- a/test/registered/4-gpu-models/test_nvidia_nemotron_3_super_nvfp4.py +++ b/test/registered/4-gpu-models/test_nvidia_nemotron_3_super_nvfp4.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=290, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=294, suite="stage-c-test-4-gpu-b200") NEMOTRON_3_SUPER_NVFP4_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4" diff --git a/test/registered/4-gpu-models/test_qwen35_hicache.py b/test/registered/4-gpu-models/test_qwen35_hicache.py index ac001ff32..66b6cd9f3 100644 --- a/test/registered/4-gpu-models/test_qwen35_hicache.py +++ b/test/registered/4-gpu-models/test_qwen35_hicache.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=620, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=540, suite="stage-c-test-4-gpu-h100") QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" ACC_THRESHOLDS = {QWEN35_27B_MODEL: {"gsm8k": 0.8}} diff --git a/test/registered/4-gpu-models/test_qwen35_models.py b/test/registered/4-gpu-models/test_qwen35_models.py index 828857b55..667c62abd 100644 --- a/test/registered/4-gpu-models/test_qwen35_models.py +++ b/test/registered/4-gpu-models/test_qwen35_models.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=790, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=768, suite="stage-c-test-4-gpu-b200") QWEN35_FP4_MODEL = "nvidia/Qwen3.5-397B-A17B-NVFP4" ACC_THRESHOLDS = {QWEN35_FP4_MODEL: {"gsm8k": 0.95}} diff --git a/test/registered/4-gpu-models/test_qwen3_30b.py b/test/registered/4-gpu-models/test_qwen3_30b.py index 1e7ebbe33..079dbc985 100644 --- a/test/registered/4-gpu-models/test_qwen3_30b.py +++ b/test/registered/4-gpu-models/test_qwen3_30b.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=150, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=146, suite="stage-c-test-4-gpu-h100") QWEN3_30B_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8" diff --git a/test/registered/4-gpu-models/test_qwen3_next_models.py b/test/registered/4-gpu-models/test_qwen3_next_models.py index 48b711dd7..c9bc1839e 100644 --- a/test/registered/4-gpu-models/test_qwen3_next_models.py +++ b/test/registered/4-gpu-models/test_qwen3_next_models.py @@ -6,7 +6,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=120, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=119, suite="stage-c-test-4-gpu-h100") QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct" diff --git a/test/registered/4-gpu-models/test_qwen3_next_models_mtp.py b/test/registered/4-gpu-models/test_qwen3_next_models_mtp.py index 3be1ddd0c..e7edfbee9 100644 --- a/test/registered/4-gpu-models/test_qwen3_next_models_mtp.py +++ b/test/registered/4-gpu-models/test_qwen3_next_models_mtp.py @@ -7,7 +7,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=430, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=422, suite="stage-c-test-4-gpu-h100") QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct" diff --git a/test/registered/8-gpu-models/test_deepseek_v32_indexcache.py b/test/registered/8-gpu-models/test_deepseek_v32_indexcache.py index 4b769ec57..320e23028 100644 --- a/test/registered/8-gpu-models/test_deepseek_v32_indexcache.py +++ b/test/registered/8-gpu-models/test_deepseek_v32_indexcache.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=360, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=354, suite="stage-c-test-8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" diff --git a/test/registered/8-gpu-models/test_deepseek_v3_basic.py b/test/registered/8-gpu-models/test_deepseek_v3_basic.py index acbde5475..c814ed127 100644 --- a/test/registered/8-gpu-models/test_deepseek_v3_basic.py +++ b/test/registered/8-gpu-models/test_deepseek_v3_basic.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=275, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=320, suite="stage-c-test-8-gpu-h200") FULL_DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324" diff --git a/test/registered/8-gpu-models/test_deepseek_v3_mtp.py b/test/registered/8-gpu-models/test_deepseek_v3_mtp.py index e90cd4fb0..805db513d 100644 --- a/test/registered/8-gpu-models/test_deepseek_v3_mtp.py +++ b/test/registered/8-gpu-models/test_deepseek_v3_mtp.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=240, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=198, suite="stage-c-test-8-gpu-h200") FULL_DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324" diff --git a/test/registered/8-gpu-models/test_dsa_models_basic.py b/test/registered/8-gpu-models/test_dsa_models_basic.py index 3a7b405ea..cc6caffd2 100644 --- a/test/registered/8-gpu-models/test_dsa_models_basic.py +++ b/test/registered/8-gpu-models/test_dsa_models_basic.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=870, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=966, suite="stage-c-test-8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" GLM5_MODEL_PATH = "zai-org/GLM-5-FP8" diff --git a/test/registered/8-gpu-models/test_dsa_models_mtp.py b/test/registered/8-gpu-models/test_dsa_models_mtp.py index 55457f9fd..9c0b2dcef 100644 --- a/test/registered/8-gpu-models/test_dsa_models_mtp.py +++ b/test/registered/8-gpu-models/test_dsa_models_mtp.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=880, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=910, suite="stage-c-test-8-gpu-h200") FULL_DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" GLM5_MODEL_PATH = "zai-org/GLM-5-FP8" diff --git a/test/registered/8-gpu-models/test_mimo_models.py b/test/registered/8-gpu-models/test_mimo_models.py index aa9da353e..fe79139bd 100644 --- a/test/registered/8-gpu-models/test_mimo_models.py +++ b/test/registered/8-gpu-models/test_mimo_models.py @@ -5,7 +5,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.kits.spec_decoding_kit import SpecDecodingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=270, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=283, suite="stage-c-test-8-gpu-h200") class TestMiMoV2Flash(GSM8KMixin, SpecDecodingMixin, DefaultServerBase): diff --git a/test/registered/8-gpu-models/test_minimax_m25_basic.py b/test/registered/8-gpu-models/test_minimax_m25_basic.py index 61837d479..f99e4c3cd 100644 --- a/test/registered/8-gpu-models/test_minimax_m25_basic.py +++ b/test/registered/8-gpu-models/test_minimax_m25_basic.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=300, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=330, suite="stage-c-test-8-gpu-h200") MINIMAX_M25_MODEL_PATH = "MiniMaxAI/MiniMax-M2.5" diff --git a/test/registered/8-gpu-models/test_nvidia_nemotron_3_super_bf16.py b/test/registered/8-gpu-models/test_nvidia_nemotron_3_super_bf16.py index 973a5019a..5d2200f3c 100644 --- a/test/registered/8-gpu-models/test_nvidia_nemotron_3_super_bf16.py +++ b/test/registered/8-gpu-models/test_nvidia_nemotron_3_super_bf16.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=300, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=319, suite="stage-c-test-8-gpu-h200") NEMOTRON_3_SUPER_BF16_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16" diff --git a/test/registered/attention/test_chunk_gated_delta_rule.py b/test/registered/attention/test_chunk_gated_delta_rule.py index 5daeb6a1b..f1ac1a40f 100644 --- a/test/registered/attention/test_chunk_gated_delta_rule.py +++ b/test/registered/attention/test_chunk_gated_delta_rule.py @@ -8,7 +8,7 @@ from sglang.srt.layers.attention.fla.fused_recurrent import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=5, suite="stage-b-test-1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "Test requires CUDA") diff --git a/test/registered/attention/test_create_kvindices.py b/test/registered/attention/test_create_kvindices.py index 0b06e8222..c1bd28cac 100644 --- a/test/registered/attention/test_create_kvindices.py +++ b/test/registered/attention/test_create_kvindices.py @@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase # Triton kernel unit test for KV indices creation -register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=7, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_fa3.py b/test/registered/attention/test_fa3.py index d0c48cfcd..b941e134d 100644 --- a/test/registered/attention/test_fa3.py +++ b/test/registered/attention/test_fa3.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( # FlashAttention3 integration tests (requires SM 90+ / H100) # Multiple test classes: FA3, FA3+MLA, FA3+SpecDecode variants -register_cuda_ci(est_time=390, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=386, suite="stage-b-test-1-gpu-large") GSM_DATASET_PATH = None diff --git a/test/registered/attention/test_flash_attention_4.py b/test/registered/attention/test_flash_attention_4.py index ce61ec252..cae354fe5 100644 --- a/test/registered/attention/test_flash_attention_4.py +++ b/test/registered/attention/test_flash_attention_4.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( ) # FlashAttention4 integration test (requires SM 100+ / Blackwell B200) -register_cuda_ci(est_time=200, suite="stage-b-test-4-gpu-b200") +register_cuda_ci(est_time=259, suite="stage-b-test-4-gpu-b200") @unittest.skipIf(get_device_sm() < 100, "Test requires CUDA SM 100 or higher") diff --git a/test/registered/attention/test_hybrid_attn_backend.py b/test/registered/attention/test_hybrid_attn_backend.py index cb41c0cbd..dce9ca3c6 100644 --- a/test/registered/attention/test_hybrid_attn_backend.py +++ b/test/registered/attention/test_hybrid_attn_backend.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( # Hybrid attention backend tests (FA3 prefill + FlashInfer decode, requires SM 90+ / H100) # Multiple test classes: base, MLA, TorchCompile, SpecDecode variants -register_cuda_ci(est_time=350, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=342, suite="stage-b-test-1-gpu-large") GSM_DATASET_PATH = None diff --git a/test/registered/attention/test_kda_kernels.py b/test/registered/attention/test_kda_kernels.py index d7a971934..f3b18ad59 100644 --- a/test/registered/attention/test_kda_kernels.py +++ b/test/registered/attention/test_kda_kernels.py @@ -8,7 +8,7 @@ from sglang.srt.layers.attention.fla.fused_sigmoid_gating_recurrent import ( from sglang.srt.layers.attention.fla.kda import fused_kda_gate, fused_recurrent_kda from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=30, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "Test requires CUDA") diff --git a/test/registered/attention/test_local_attn.py b/test/registered/attention/test_local_attn.py index 229260c19..f14be8cf7 100644 --- a/test/registered/attention/test_local_attn.py +++ b/test/registered/attention/test_local_attn.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( ) # Local attention with FA3 (requires SM 90+ / H100, tp=4) -register_cuda_ci(est_time=200, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=208, suite="stage-c-test-4-gpu-h100") @unittest.skipIf(get_device_sm() < 90, "Test requires CUDA SM 90 or higher") diff --git a/test/registered/attention/test_normal_decode_set_metadata.py b/test/registered/attention/test_normal_decode_set_metadata.py index 21e701521..6906f6cfa 100644 --- a/test/registered/attention/test_normal_decode_set_metadata.py +++ b/test/registered/attention/test_normal_decode_set_metadata.py @@ -21,7 +21,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase # Register this test for CUDA CI in stage-b (fast attention/kernel tests) -register_cuda_ci(est_time=25, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-large") def reference_normal_decode_set_metadata( diff --git a/test/registered/attention/test_torch_native_attention_backend.py b/test/registered/attention/test_torch_native_attention_backend.py index 0d2c9f330..102a7816b 100644 --- a/test/registered/attention/test_torch_native_attention_backend.py +++ b/test/registered/attention/test_torch_native_attention_backend.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( ) # Torch native attention backend integration test with MMLU eval -register_cuda_ci(est_time=169, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=128, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=150, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_triton_attention_backend.py b/test/registered/attention/test_triton_attention_backend.py index 47900a20a..2034a89a6 100644 --- a/test/registered/attention/test_triton_attention_backend.py +++ b/test/registered/attention/test_triton_attention_backend.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( ) # Triton attention backend integration test with latency benchmark and MMLU eval -register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=164, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=1400, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_triton_attention_kernels.py b/test/registered/attention/test_triton_attention_kernels.py index 89bc81ee0..48b74cb72 100644 --- a/test/registered/attention/test_triton_attention_kernels.py +++ b/test/registered/attention/test_triton_attention_kernels.py @@ -23,7 +23,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase, is_in_amd_ci # Triton attention kernel unit tests (decode, extend, prefill) -register_cuda_ci(est_time=30, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=16, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=30, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_triton_sliding_window.py b/test/registered/attention/test_triton_sliding_window.py index dbc4ba3d5..faff86108 100644 --- a/test/registered/attention/test_triton_sliding_window.py +++ b/test/registered/attention/test_triton_sliding_window.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( ) # Sliding window attention with Triton backend (Gemma-3 model) -register_cuda_ci(est_time=100, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=95, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/backends/test_torch_compile.py b/test/registered/backends/test_torch_compile.py index 6afce40e8..3f5f1ca91 100644 --- a/test/registered/backends/test_torch_compile.py +++ b/test/registered/backends/test_torch_compile.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=144, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=115, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/bench_fn/test_benchmark_datasets_api.py b/test/registered/bench_fn/test_benchmark_datasets_api.py index 82c8573d7..d807b5033 100644 --- a/test/registered/bench_fn/test_benchmark_datasets_api.py +++ b/test/registered/bench_fn/test_benchmark_datasets_api.py @@ -26,7 +26,7 @@ from sglang.benchmark.datasets.random import sample_random_requests from sglang.benchmark.datasets.sharegpt import sample_sharegpt_requests from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") class _DummyTokenTensor: diff --git a/test/registered/constrained_decoding/test_constrained_decoding.py b/test/registered/constrained_decoding/test_constrained_decoding.py index b705b6f99..9e3cf9213 100644 --- a/test/registered/constrained_decoding/test_constrained_decoding.py +++ b/test/registered/constrained_decoding/test_constrained_decoding.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=111, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=110, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=179, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_deterministic.py b/test/registered/core/test_deterministic.py index 956504929..7b269a93f 100644 --- a/test/registered/core/test_deterministic.py +++ b/test/registered/core/test_deterministic.py @@ -16,7 +16,7 @@ from sglang.test.test_deterministic_utils import ( ) from sglang.test.test_utils import is_in_amd_ci -register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=194, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_gpt_oss_1gpu.py b/test/registered/core/test_gpt_oss_1gpu.py index c208e8077..692af9070 100644 --- a/test/registered/core/test_gpt_oss_1gpu.py +++ b/test/registered/core/test_gpt_oss_1gpu.py @@ -3,7 +3,7 @@ import unittest from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=420, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=372, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=750, suite="stage-b-test-1-gpu-small-amd-mi35x") diff --git a/test/registered/core/test_gpt_oss_sm120.py b/test/registered/core/test_gpt_oss_sm120.py index dcbe427e7..18ad85478 100644 --- a/test/registered/core/test_gpt_oss_sm120.py +++ b/test/registered/core/test_gpt_oss_sm120.py @@ -5,7 +5,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=330, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=329, suite="stage-b-test-1-gpu-small") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is not available") diff --git a/test/registered/core/test_hidden_states.py b/test/registered/core/test_hidden_states.py index 20c4db95e..1e8d8a764 100644 --- a/test/registered/core/test_hidden_states.py +++ b/test/registered/core/test_hidden_states.py @@ -8,7 +8,7 @@ from sglang.srt.utils import get_device, is_hip from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase -register_cuda_ci(est_time=55, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=47, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=55, suite="stage-b-test-1-gpu-small-amd") _is_hip = is_hip() diff --git a/test/registered/core/test_page_size.py b/test/registered/core/test_page_size.py index 1cf8cbcb6..bfd8d116c 100644 --- a/test/registered/core/test_page_size.py +++ b/test/registered/core/test_page_size.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=60, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=77, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=60, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_request_queue_validation.py b/test/registered/core/test_request_queue_validation.py index 36727c4de..d6293ae2f 100644 --- a/test/registered/core/test_request_queue_validation.py +++ b/test/registered/core/test_request_queue_validation.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( send_generate_requests, ) -register_cuda_ci(est_time=47, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=50, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=70, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_srt_endpoint.py b/test/registered/core/test_srt_endpoint.py index 22e3b468f..a639d7861 100644 --- a/test/registered/core/test_srt_endpoint.py +++ b/test/registered/core/test_srt_endpoint.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( run_logprob_check, ) -register_cuda_ci(est_time=127, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=132, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=130, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_srt_engine.py b/test/registered/core/test_srt_engine.py index ab70eaaf1..f6610ddf8 100644 --- a/test/registered/core/test_srt_engine.py +++ b/test/registered/core/test_srt_engine.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=252, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=311, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=261, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/cp/test_deepseek_v32_cp_single_node.py b/test/registered/cp/test_deepseek_v32_cp_single_node.py index 55595eff5..badcb2caa 100644 --- a/test/registered/cp/test_deepseek_v32_cp_single_node.py +++ b/test/registered/cp/test_deepseek_v32_cp_single_node.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=640, suite="stage-c-test-deepep-8-gpu-h200") +register_cuda_ci(est_time=614, suite="stage-c-test-deepep-8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" diff --git a/test/registered/disaggregation/test_disaggregation_basic.py b/test/registered/disaggregation/test_disaggregation_basic.py index a598ae438..fd63195b3 100644 --- a/test/registered/disaggregation/test_disaggregation_basic.py +++ b/test/registered/disaggregation/test_disaggregation_basic.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( DEFAULT_TARGET_MODEL_EAGLE3, ) -register_cuda_ci(est_time=400, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=394, suite="stage-b-test-2-gpu-large") class TestDisaggregationAccuracy(PDDisaggregationServerBase): diff --git a/test/registered/disaggregation/test_specv2_kvcache_offloading.py b/test/registered/disaggregation/test_specv2_kvcache_offloading.py index 5c403ba2e..639d5b44f 100644 --- a/test/registered/disaggregation/test_specv2_kvcache_offloading.py +++ b/test/registered/disaggregation/test_specv2_kvcache_offloading.py @@ -17,7 +17,7 @@ from sglang.srt.disaggregation.decode_kvcache_offload_manager import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") def _make_mock_req( diff --git a/test/registered/distributed/test_data_parallelism.py b/test/registered/distributed/test_data_parallelism.py index bb3eb29c7..a7d49ac19 100644 --- a/test/registered/distributed/test_data_parallelism.py +++ b/test/registered/distributed/test_data_parallelism.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=73, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=78, suite="stage-b-test-2-gpu-large") register_amd_ci(est_time=73, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/distributed/test_disaggregation_different_tp.py b/test/registered/distributed/test_disaggregation_different_tp.py index 7ea78bfbf..3fd1a9504 100644 --- a/test/registered/distributed/test_disaggregation_different_tp.py +++ b/test/registered/distributed/test_disaggregation_different_tp.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=330, suite="stage-c-test-8-gpu-h20") +register_cuda_ci(est_time=331, suite="stage-c-test-8-gpu-h20") class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase): diff --git a/test/registered/distributed/test_disaggregation_dp_attention.py b/test/registered/distributed/test_disaggregation_dp_attention.py index b76cf1b18..3eab31142 100644 --- a/test/registered/distributed/test_disaggregation_dp_attention.py +++ b/test/registered/distributed/test_disaggregation_dp_attention.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=400, suite="stage-c-test-8-gpu-h20") +register_cuda_ci(est_time=408, suite="stage-c-test-8-gpu-h20") class TestDisaggregationDPAttention(PDDisaggregationServerBase): diff --git a/test/registered/distributed/test_disaggregation_hybrid_attention.py b/test/registered/distributed/test_disaggregation_hybrid_attention.py index edbb177eb..87ef16974 100644 --- a/test/registered/distributed/test_disaggregation_hybrid_attention.py +++ b/test/registered/distributed/test_disaggregation_hybrid_attention.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_pd_server, ) -register_cuda_ci(est_time=450, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=317, suite="stage-c-test-8-gpu-h200") @unittest.skipIf(is_in_ci(), "Temporarily disable the flaky test.") diff --git a/test/registered/distributed/test_dp_attention.py b/test/registered/distributed/test_dp_attention.py index 4767d4355..4b9ab0ef5 100644 --- a/test/registered/distributed/test_dp_attention.py +++ b/test/registered/distributed/test_dp_attention.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=450, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=446, suite="stage-b-test-2-gpu-large") class TestDPAttentionDP2TP2( diff --git a/test/registered/distributed/test_epd_disaggregation.py b/test/registered/distributed/test_epd_disaggregation.py index 301128e19..a4bf5f2c6 100644 --- a/test/registered/distributed/test_epd_disaggregation.py +++ b/test/registered/distributed/test_epd_disaggregation.py @@ -36,7 +36,7 @@ DEFAULT_OMNI_MODEL = "Qwen/Qwen3-Omni-30B-A3B-Instruct" QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" -register_cuda_ci(est_time=150, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=97, suite="stage-c-test-4-gpu-h100") @unittest.skipIf( diff --git a/test/registered/distributed/test_load_weights_from_remote_instance.py b/test/registered/distributed/test_load_weights_from_remote_instance.py index 7d51101cd..645ecd82c 100644 --- a/test/registered/distributed/test_load_weights_from_remote_instance.py +++ b/test/registered/distributed/test_load_weights_from_remote_instance.py @@ -38,7 +38,7 @@ from sglang.utils import terminate_process mp.set_start_method("spawn", force=True) -register_cuda_ci(est_time=130, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=110, suite="stage-b-test-2-gpu-large") register_amd_ci(est_time=72, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/distributed/test_parallel_state.py b/test/registered/distributed/test_parallel_state.py index 900568139..3a9209b42 100644 --- a/test/registered/distributed/test_parallel_state.py +++ b/test/registered/distributed/test_parallel_state.py @@ -43,7 +43,7 @@ import pytest from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=5, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") # Import the actual parallel_state module parallel_state = pytest.importorskip("sglang.srt.distributed.parallel_state") diff --git a/test/registered/distributed/test_pp_single_node.py b/test/registered/distributed/test_pp_single_node.py index cfc26b638..4822ab11d 100644 --- a/test/registered/distributed/test_pp_single_node.py +++ b/test/registered/distributed/test_pp_single_node.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import ( run_bench_one_batch_server, ) -register_cuda_ci(est_time=460, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=462, suite="stage-c-test-4-gpu-h100") register_amd_ci(est_time=650, suite="stage-c-test-4-gpu-amd") diff --git a/test/registered/dllm/test_llada2_mini.py b/test/registered/dllm/test_llada2_mini.py index b44a8ab5c..139fc2b7a 100644 --- a/test/registered/dllm/test_llada2_mini.py +++ b/test/registered/dllm/test_llada2_mini.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=110, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=116, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=330, suite="stage-b-test-1-gpu-small-amd") import unittest diff --git a/test/registered/ep/test_deepep_large.py b/test/registered/ep/test_deepep_large.py index 11c18bab8..aa9d37ec2 100644 --- a/test/registered/ep/test_deepep_large.py +++ b/test/registered/ep/test_deepep_large.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=490, suite="stage-c-test-deepep-8-gpu-h200") +register_cuda_ci(est_time=462, suite="stage-c-test-deepep-8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" diff --git a/test/registered/ep/test_deepep_small.py b/test/registered/ep/test_deepep_small.py index 01e92d0bd..1f4e8a619 100644 --- a/test/registered/ep/test_deepep_small.py +++ b/test/registered/ep/test_deepep_small.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=430, suite="stage-c-test-deepep-4-gpu-h100") +register_cuda_ci(est_time=432, suite="stage-c-test-deepep-4-gpu-h100") class TestPureDP(CustomTestCase): diff --git a/test/registered/ep/test_mooncake_ep_small.py b/test/registered/ep/test_mooncake_ep_small.py index 37c618991..80f328c0d 100644 --- a/test/registered/ep/test_mooncake_ep_small.py +++ b/test/registered/ep/test_mooncake_ep_small.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=80, suite="stage-c-test-deepep-4-gpu-h100") +register_cuda_ci(est_time=77, suite="stage-c-test-deepep-4-gpu-h100") ib_devices = get_rdma_devices_args() diff --git a/test/registered/eval/test_eval_accuracy_large.py b/test/registered/eval/test_eval_accuracy_large.py index 97b441f41..7ac092d8a 100644 --- a/test/registered/eval/test_eval_accuracy_large.py +++ b/test/registered/eval/test_eval_accuracy_large.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=580, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=534, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=420, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/hicache/test_hicache_storage.py b/test/registered/hicache/test_hicache_storage.py index d6470b198..112178a76 100644 --- a/test/registered/hicache/test_hicache_storage.py +++ b/test/registered/hicache/test_hicache_storage.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=96, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=99, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=300, suite="stage-b-test-1-gpu-small-amd") import time diff --git a/test/registered/hicache/test_hicache_storage_3fs_backend.py b/test/registered/hicache/test_hicache_storage_3fs_backend.py index 6c478767a..8bf69623d 100644 --- a/test/registered/hicache/test_hicache_storage_3fs_backend.py +++ b/test/registered/hicache/test_hicache_storage_3fs_backend.py @@ -13,7 +13,7 @@ from test_hicache_storage_file_backend import HiCacheStorageBaseMixin from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=200, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=150, suite="stage-b-test-2-gpu-large") register_amd_ci(est_time=300, suite="stage-b-test-2-gpu-large") diff --git a/test/registered/hicache/test_hicache_storage_file_backend.py b/test/registered/hicache/test_hicache_storage_file_backend.py index 12f779412..99fd26b40 100644 --- a/test/registered/hicache/test_hicache_storage_file_backend.py +++ b/test/registered/hicache/test_hicache_storage_file_backend.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import wait_for_http_ready -register_cuda_ci(est_time=200, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=148, suite="stage-b-test-2-gpu-large") register_amd_ci(est_time=526, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/hicache/test_hicache_storage_mooncake_backend.py b/test/registered/hicache/test_hicache_storage_mooncake_backend.py index 5d928babd..1a9b75a39 100644 --- a/test/registered/hicache/test_hicache_storage_mooncake_backend.py +++ b/test/registered/hicache/test_hicache_storage_mooncake_backend.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( is_in_ci, ) -register_cuda_ci(est_time=230, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=236, suite="stage-b-test-2-gpu-large") class HiCacheStorageMooncakeBackendBaseMixin(HiCacheStorageBaseMixin): diff --git a/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py b/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py index 3c9f07224..1517d6d4f 100644 --- a/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py +++ b/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py @@ -28,7 +28,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import wait_for_http_ready -register_cuda_ci(est_time=130, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=139, suite="stage-b-test-2-gpu-large") class TestHiCacheStorageRuntimeAttachDetach(CustomTestCase): diff --git a/test/registered/hicache/test_hicache_variants.py b/test/registered/hicache/test_hicache_variants.py index 956d61d41..c769cf40d 100644 --- a/test/registered/hicache/test_hicache_variants.py +++ b/test/registered/hicache/test_hicache_variants.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=410, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=450, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=524, suite="stage-b-test-1-gpu-small-amd") """ Consolidated HiCache variant tests. diff --git a/test/registered/input_embedding/test_input_embeddings.py b/test/registered/input_embedding/test_input_embeddings.py index cbfc3dc19..373be99dd 100644 --- a/test/registered/input_embedding/test_input_embeddings.py +++ b/test/registered/input_embedding/test_input_embeddings.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=38, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=41, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=38, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/input_embedding/test_input_embeds_chunked.py b/test/registered/input_embedding/test_input_embeds_chunked.py index 13fc92cea..963a205ce 100644 --- a/test/registered/input_embedding/test_input_embeds_chunked.py +++ b/test/registered/input_embedding/test_input_embeds_chunked.py @@ -30,7 +30,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=45, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=42, suite="stage-b-test-1-gpu-small") CHUNKED_PREFILL_SIZE = 256 diff --git a/test/registered/language/test_srt_backend.py b/test/registered/language/test_srt_backend.py index 24278691c..551ec8103 100644 --- a/test/registered/language/test_srt_backend.py +++ b/test/registered/language/test_srt_backend.py @@ -20,7 +20,7 @@ from sglang.test.test_programs import ( ) from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST, CustomTestCase -register_cuda_ci(est_time=80, suite="stage-a-test-1-gpu-small") +register_cuda_ci(est_time=72, suite="stage-a-test-1-gpu-small") register_amd_ci(est_time=120, suite="stage-a-test-1-gpu-small-amd") diff --git a/test/registered/layers/mamba/test_causal_conv1d.py b/test/registered/layers/mamba/test_causal_conv1d.py index 820a6ff6f..bd10fe21a 100644 --- a/test/registered/layers/mamba/test_causal_conv1d.py +++ b/test/registered/layers/mamba/test_causal_conv1d.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=25, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=13, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-small-amd") # Adapted from https://github.com/vllm-project/vllm/blob/main/tests/kernels/mamba/test_causal_conv1d.py diff --git a/test/registered/layers/mamba/test_mamba2_mixer.py b/test/registered/layers/mamba/test_mamba2_mixer.py index d63179c1a..85aadbcd7 100644 --- a/test/registered/layers/mamba/test_mamba2_mixer.py +++ b/test/registered/layers/mamba/test_mamba2_mixer.py @@ -15,7 +15,7 @@ from sglang.srt.distributed.parallel_state import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=50, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=28, suite="stage-b-test-2-gpu-large") NUM_GPUS = 2 diff --git a/test/registered/layers/mamba/test_mamba_ssm.py b/test/registered/layers/mamba/test_mamba_ssm.py index 9847684a5..8c139fbdf 100644 --- a/test/registered/layers/mamba/test_mamba_ssm.py +++ b/test/registered/layers/mamba/test_mamba_ssm.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=7, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-small-amd") # Adapted from https://github.com/vllm-project/vllm/blob/633f943e30a4444d890d26b81850f7217736f840/tests/kernels/mamba/test_mamba_ssm_ssd.py diff --git a/test/registered/layers/mamba/test_mamba_ssm_ssd.py b/test/registered/layers/mamba/test_mamba_ssm_ssd.py index 670bceabb..2e42caa9b 100644 --- a/test/registered/layers/mamba/test_mamba_ssm_ssd.py +++ b/test/registered/layers/mamba/test_mamba_ssm_ssd.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=15, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=34, suite="stage-b-test-1-gpu-small-amd") # Adapted from https://github.com/vllm-project/vllm/blob/633f943e30a4444d890d26b81850f7217736f840/tests/kernels/mamba/test_mamba_ssm_ssd.py diff --git a/test/registered/lora/test_fused_moe_lora_kernel.py b/test/registered/lora/test_fused_moe_lora_kernel.py index 44179a5fa..50587579d 100644 --- a/test/registered/lora/test_fused_moe_lora_kernel.py +++ b/test/registered/lora/test_fused_moe_lora_kernel.py @@ -15,7 +15,7 @@ from sglang.test.ci.ci_register import register_cuda_ci # ============================================================================== -register_cuda_ci(est_time=25, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=14, suite="stage-b-test-1-gpu-large") def round_up(x, base): diff --git a/test/registered/lora/test_lora_backend.py b/test/registered/lora/test_lora_backend.py index 5d76cfced..9ac9f4167 100644 --- a/test/registered/lora/test_lora_backend.py +++ b/test/registered/lora/test_lora_backend.py @@ -29,7 +29,7 @@ from sglang.test.lora_utils import ( ) from sglang.test.test_utils import CustomTestCase, is_in_ci -register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=206, suite="stage-b-test-1-gpu-small") register_amd_ci( est_time=200, suite="stage-b-test-1-gpu-small-amd", diff --git a/test/registered/lora/test_lora_eviction.py b/test/registered/lora/test_lora_eviction.py index 5a765e9f9..c7c2a20d3 100644 --- a/test/registered/lora/test_lora_eviction.py +++ b/test/registered/lora/test_lora_eviction.py @@ -23,7 +23,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.runners import SRTRunner from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=224, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=238, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=224, suite="stage-b-test-1-gpu-small-amd") PROMPTS = [ diff --git a/test/registered/lora/test_lora_overlap_loading.py b/test/registered/lora/test_lora_overlap_loading.py index a35b5422b..3812b8c25 100644 --- a/test/registered/lora/test_lora_overlap_loading.py +++ b/test/registered/lora/test_lora_overlap_loading.py @@ -29,7 +29,7 @@ from sglang.test.lora_utils import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=75, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=45, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=75, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/lora/test_multi_lora_backend.py b/test/registered/lora/test_multi_lora_backend.py index a0b5db62b..ac0156bbd 100644 --- a/test/registered/lora/test_multi_lora_backend.py +++ b/test/registered/lora/test_multi_lora_backend.py @@ -25,7 +25,7 @@ from sglang.test.lora_utils import ( ) from sglang.test.test_utils import CustomTestCase, is_in_ci -register_cuda_ci(est_time=100, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=88, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/mla/test_flashmla.py b/test/registered/mla/test_flashmla.py index c5f084e42..edd26c2e5 100644 --- a/test/registered/mla/test_flashmla.py +++ b/test/registered/mla/test_flashmla.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( ) # FlashMLA attention backend tests with MTP speculative decoding -register_cuda_ci(est_time=284, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=296, suite="stage-b-test-1-gpu-large") class TestFlashMLAAttnBackend(unittest.TestCase): diff --git a/test/registered/mla/test_mla.py b/test/registered/mla/test_mla.py index 03fce55f4..0d6761bdb 100644 --- a/test/registered/mla/test_mla.py +++ b/test/registered/mla/test_mla.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( ) # MLA attention test with MGSM evaluation -register_cuda_ci(est_time=194, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=174, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/mla/test_mla_deepseek_v3.py b/test/registered/mla/test_mla_deepseek_v3.py index e1cf2ba83..c0a56c9e3 100644 --- a/test/registered/mla/test_mla_deepseek_v3.py +++ b/test/registered/mla/test_mla_deepseek_v3.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( ) # DeepSeek-V3 MLA tests with torch compile, FA3, and MTP speculative decoding -register_cuda_ci(est_time=442, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=543, suite="stage-b-test-1-gpu-large") register_amd_ci( est_time=221, suite="stage-b-test-1-gpu-small-amd", diff --git a/test/registered/mla/test_mla_flashinfer.py b/test/registered/mla/test_mla_flashinfer.py index 5bd665805..23a24aade 100644 --- a/test/registered/mla/test_mla_flashinfer.py +++ b/test/registered/mla/test_mla_flashinfer.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( ) # FlashInfer MLA backend tests with MTP speculative decoding -register_cuda_ci(est_time=302, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=256, suite="stage-b-test-1-gpu-large") class TestFlashinferMLA(CustomTestCase): diff --git a/test/registered/mla/test_mla_fp8.py b/test/registered/mla/test_mla_fp8.py index a256aad9d..62d27feb6 100644 --- a/test/registered/mla/test_mla_fp8.py +++ b/test/registered/mla/test_mla_fp8.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( ) # MLA FP8 KV cache test with MGSM evaluation -register_cuda_ci(est_time=77, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=106, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=800, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/mla/test_mla_int8_deepseek_v3.py b/test/registered/mla/test_mla_int8_deepseek_v3.py index 1eb00dcce..35cf4b229 100644 --- a/test/registered/mla/test_mla_int8_deepseek_v3.py +++ b/test/registered/mla/test_mla_int8_deepseek_v3.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( ) # DeepSeek-V3 INT8 quantization tests (channel and block INT8) -register_cuda_ci(est_time=290, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=282, suite="stage-b-test-1-gpu-large") class TestMLADeepseekV3ChannelInt8(CustomTestCase): diff --git a/test/registered/model_loading/test_external_models.py b/test/registered/model_loading/test_external_models.py index c4878abe6..d32adfcc9 100644 --- a/test/registered/model_loading/test_external_models.py +++ b/test/registered/model_loading/test_external_models.py @@ -5,7 +5,7 @@ from sglang.srt.environ import envs from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=28, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=45, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/model_loading/test_utils_update_weights.py b/test/registered/model_loading/test_utils_update_weights.py index 60f3800b0..f79b6306c 100644 --- a/test/registered/model_loading/test_utils_update_weights.py +++ b/test/registered/model_loading/test_utils_update_weights.py @@ -12,7 +12,7 @@ from sglang.srt.weight_sync.utils import update_weights from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST -register_cuda_ci(est_time=29, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=32, suite="stage-b-test-1-gpu-large") class AsyncEngine(Engine): diff --git a/test/registered/models/test_compressed_tensors_models.py b/test/registered/models/test_compressed_tensors_models.py index 3ffc328b2..2d191f40e 100644 --- a/test/registered/models/test_compressed_tensors_models.py +++ b/test/registered/models/test_compressed_tensors_models.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=42, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=63, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=42, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/models/test_generation_models.py b/test/registered/models/test_generation_models.py index 98e2bac4b..116fc62dc 100644 --- a/test/registered/models/test_generation_models.py +++ b/test/registered/models/test_generation_models.py @@ -1,7 +1,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Generation model tests (CUDA only) -register_cuda_ci(est_time=103, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=124, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=106, suite="stage-b-test-1-gpu-small-amd") # Copyright 2023-2024 SGLang Team diff --git a/test/registered/models/test_kimi_linear_models.py b/test/registered/models/test_kimi_linear_models.py index a97a3af8c..83f01d009 100644 --- a/test/registered/models/test_kimi_linear_models.py +++ b/test/registered/models/test_kimi_linear_models.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=180, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=168, suite="stage-b-test-2-gpu-large") class TestKimiLinear(CustomTestCase): diff --git a/test/registered/models/test_nvidia_nemotron_3_nano.py b/test/registered/models/test_nvidia_nemotron_3_nano.py index aba13bf7f..75933f4a4 100644 --- a/test/registered/models/test_nvidia_nemotron_3_nano.py +++ b/test/registered/models/test_nvidia_nemotron_3_nano.py @@ -4,7 +4,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kits.lm_eval_kit import LMEvalMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=540, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=564, suite="stage-b-test-2-gpu-large") NEMOTRON_3_NANO_THINKING_ARGS = [ "--trust-remote-code", diff --git a/test/registered/models/test_nvidia_nemotron_nano_v2.py b/test/registered/models/test_nvidia_nemotron_nano_v2.py index b12395a6a..d9e5883c5 100644 --- a/test/registered/models/test_nvidia_nemotron_nano_v2.py +++ b/test/registered/models/test_nvidia_nemotron_nano_v2.py @@ -5,7 +5,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=240, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=214, suite="stage-b-test-2-gpu-large") class TestNvidiaNemotronNanoV2BF16(GSM8KMixin, DefaultServerBase): diff --git a/test/registered/models/test_nvidia_nemotron_nano_v2_vl.py b/test/registered/models/test_nvidia_nemotron_nano_v2_vl.py index 71211b7ec..4c52c05d6 100644 --- a/test/registered/models/test_nvidia_nemotron_nano_v2_vl.py +++ b/test/registered/models/test_nvidia_nemotron_nano_v2_vl.py @@ -10,7 +10,7 @@ from sglang.test.server_fixtures.mmmu_fixture import MMMUServerBase # GSM8k + MMMU evaluation -register_cuda_ci(est_time=214, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=206, suite="stage-b-test-1-gpu-large") MODEL = "nvidia/NVIDIA-Nemotron-Nano-12B-v2-VL-BF16" diff --git a/test/registered/models/test_qwen_models.py b/test/registered/models/test_qwen_models.py index 24817c816..602de7f25 100644 --- a/test/registered/models/test_qwen_models.py +++ b/test/registered/models/test_qwen_models.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=90, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=109, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=130, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/models/test_transformers_backend_eval.py b/test/registered/models/test_transformers_backend_eval.py index 16125aa57..9d68505fa 100644 --- a/test/registered/models/test_transformers_backend_eval.py +++ b/test/registered/models/test_transformers_backend_eval.py @@ -7,7 +7,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.few_shot_gsm8k import run_eval from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=44, suite="stage-b-test-1-gpu-small") class TestTransformersBackendEval(DefaultServerBase): diff --git a/test/registered/models/test_transformers_models.py b/test/registered/models/test_transformers_models.py index 39339f6de..87fc3fbe5 100644 --- a/test/registered/models/test_transformers_models.py +++ b/test/registered/models/test_transformers_models.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=260, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=244, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=320, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/models/test_vlm_models.py b/test/registered/models/test_vlm_models.py index 7789bed9d..2ed573417 100644 --- a/test/registered/models/test_vlm_models.py +++ b/test/registered/models/test_vlm_models.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import is_in_ci # VLM (Vision Language Model) tests -register_cuda_ci(est_time=228, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=176, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=850, suite="stage-b-test-1-gpu-small-amd-nondeterministic") _is_hip = is_hip() diff --git a/test/registered/moe/test_cutedsl_moe.py b/test/registered/moe/test_cutedsl_moe.py index f8449c4c9..baed48c5b 100644 --- a/test/registered/moe/test_cutedsl_moe.py +++ b/test/registered/moe/test_cutedsl_moe.py @@ -16,7 +16,7 @@ except ImportError: CuteDslMoEWrapper = None convert_sf_to_mma_layout = None -register_cuda_ci(est_time=300, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=13, suite="stage-c-test-4-gpu-b200") SKIP_TEST = torch.cuda.get_device_capability() < (10, 0) SKIP_REASON = "Nvfp4 Requires compute capability of 10 or above." diff --git a/test/registered/moe/test_fused_moe.py b/test/registered/moe/test_fused_moe.py index d67f90356..2b267fa9e 100644 --- a/test/registered/moe/test_fused_moe.py +++ b/test/registered/moe/test_fused_moe.py @@ -13,7 +13,7 @@ from sglang.srt.utils import get_device, get_device_capability, is_hip from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase, empty_gpu_cache -register_cuda_ci(est_time=80, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=79, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=30, suite="stage-b-test-1-gpu-small-amd") _is_hip = is_hip() diff --git a/test/registered/moe/test_glm4_moe_models.py b/test/registered/moe/test_glm4_moe_models.py index 010556b83..58a54f25b 100644 --- a/test/registered/moe/test_glm4_moe_models.py +++ b/test/registered/moe/test_glm4_moe_models.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=100, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=150, suite="stage-b-test-2-gpu-large") class TestGLM4MoE(CustomTestCase): diff --git a/test/registered/moe/test_moe_ep.py b/test/registered/moe/test_moe_ep.py index 1d27d3c20..5aa4d4836 100644 --- a/test/registered/moe/test_moe_ep.py +++ b/test/registered/moe/test_moe_ep.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=250, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=232, suite="stage-b-test-2-gpu-large") class TestEp(CustomTestCase): diff --git a/test/registered/moe/test_torch_compile_moe.py b/test/registered/moe/test_torch_compile_moe.py index 998ddc61c..0da421835 100644 --- a/test/registered/moe/test_torch_compile_moe.py +++ b/test/registered/moe/test_torch_compile_moe.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=125, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=1400, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/moe/test_triton_fused_moe.py b/test/registered/moe/test_triton_fused_moe.py index 2255d64bf..b5c263a04 100644 --- a/test/registered/moe/test_triton_fused_moe.py +++ b/test/registered/moe/test_triton_fused_moe.py @@ -12,7 +12,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=12, suite="stage-b-test-1-gpu-large") class TestFusedMOE(CustomTestCase): diff --git a/test/registered/observability/test_metrics.py b/test/registered/observability/test_metrics.py index d1f0f381b..066999d02 100644 --- a/test/registered/observability/test_metrics.py +++ b/test/registered/observability/test_metrics.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=95, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=73, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=32, suite="stage-b-test-1-gpu-small-amd") _MODEL_NAME = "Qwen/Qwen3-0.6B" diff --git a/test/registered/observability/test_tracing.py b/test/registered/observability/test_tracing.py index 995c3196a..c79b325db 100644 --- a/test/registered/observability/test_tracing.py +++ b/test/registered/observability/test_tracing.py @@ -49,7 +49,7 @@ from sglang.test.test_utils import ( logger = logging.getLogger(__name__) # CI registration -register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=104, suite="stage-b-test-1-gpu-small") # ============================================================================ diff --git a/test/registered/observability/test_tracing_disaggregation.py b/test/registered/observability/test_tracing_disaggregation.py index df15ae101..f06d2718d 100644 --- a/test/registered/observability/test_tracing_disaggregation.py +++ b/test/registered/observability/test_tracing_disaggregation.py @@ -35,7 +35,7 @@ from sglang.utils import wait_for_http_ready logger = logging.getLogger(__name__) # CI registration - PD disaggregation requires 2 GPUs -register_cuda_ci(est_time=45, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=48, suite="stage-b-test-2-gpu-large") class TestTraceDisaggregation(CustomTestCase): diff --git a/test/registered/openai_server/basic/test_anthropic_server.py b/test/registered/openai_server/basic/test_anthropic_server.py index bdfb8b91f..3e50e6758 100644 --- a/test/registered/openai_server/basic/test_anthropic_server.py +++ b/test/registered/openai_server/basic/test_anthropic_server.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=39, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/basic/test_http2_server.py b/test/registered/openai_server/basic/test_http2_server.py index 31c21304c..d35204c31 100644 --- a/test/registered/openai_server/basic/test_http2_server.py +++ b/test/registered/openai_server/basic/test_http2_server.py @@ -27,7 +27,7 @@ try: except ImportError: _HAS_GRANIAN = False -register_cuda_ci(est_time=50, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=51, suite="stage-b-test-1-gpu-small") @unittest.skipUnless(_HAS_GRANIAN, "granian not installed (pip install sglang[http2])") diff --git a/test/registered/openai_server/basic/test_openai_server.py b/test/registered/openai_server/basic/test_openai_server.py index ce1b8ec51..967ef109b 100644 --- a/test/registered/openai_server/basic/test_openai_server.py +++ b/test/registered/openai_server/basic/test_openai_server.py @@ -28,7 +28,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=184, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=189, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/basic/test_protocol.py b/test/registered/openai_server/basic/test_protocol.py index bdbdff6a1..b707f35bf 100644 --- a/test/registered/openai_server/basic/test_protocol.py +++ b/test/registered/openai_server/basic/test_protocol.py @@ -30,7 +30,7 @@ from sglang.srt.entrypoints.openai.protocol import ( ) from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=3, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=2, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/basic/test_serving_chat.py b/test/registered/openai_server/basic/test_serving_chat.py index 2ca6135ac..e1d765aa8 100644 --- a/test/registered/openai_server/basic/test_serving_chat.py +++ b/test/registered/openai_server/basic/test_serving_chat.py @@ -24,7 +24,7 @@ from sglang.srt.managers.io_struct import GenerateReqInput from sglang.srt.utils import get_or_create_event_loop from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/basic/test_serving_completions.py b/test/registered/openai_server/basic/test_serving_completions.py index 026f1c2d8..1ded89c39 100644 --- a/test/registered/openai_server/basic/test_serving_completions.py +++ b/test/registered/openai_server/basic/test_serving_completions.py @@ -18,7 +18,7 @@ from sglang.srt.managers.tokenizer_manager import TokenizerManager from sglang.srt.utils import get_or_create_event_loop from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/features/test_json_mode.py b/test/registered/openai_server/features/test_json_mode.py index 8cb922ecb..fcdd6e792 100644 --- a/test/registered/openai_server/features/test_json_mode.py +++ b/test/registered/openai_server/features/test_json_mode.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=109, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=108, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=180, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/features/test_openai_server_ebnf.py b/test/registered/openai_server/features/test_openai_server_ebnf.py index 2ec7d2dcf..78327bc50 100644 --- a/test/registered/openai_server/features/test_openai_server_ebnf.py +++ b/test/registered/openai_server/features/test_openai_server_ebnf.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=55, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=42, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/features/test_openai_server_hidden_states.py b/test/registered/openai_server/features/test_openai_server_hidden_states.py index ff1070385..868e9aa7a 100644 --- a/test/registered/openai_server/features/test_openai_server_hidden_states.py +++ b/test/registered/openai_server/features/test_openai_server_hidden_states.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=186, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=193, suite="stage-b-test-1-gpu-small") register_amd_ci( est_time=186, suite="stage-b-test-1-gpu-small-amd", diff --git a/test/registered/openai_server/function_call/test_openai_function_calling.py b/test/registered/openai_server/function_call/test_openai_function_calling.py index 33cde4018..ea02b8951 100644 --- a/test/registered/openai_server/function_call/test_openai_function_calling.py +++ b/test/registered/openai_server/function_call/test_openai_function_calling.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=60, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=97, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=73, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/function_call/test_tool_choice.py b/test/registered/openai_server/function_call/test_tool_choice.py index 187cb8827..a20cd4e56 100644 --- a/test/registered/openai_server/function_call/test_tool_choice.py +++ b/test/registered/openai_server/function_call/test_tool_choice.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=250, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=194, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=258, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/validation/test_large_max_new_tokens.py b/test/registered/openai_server/validation/test_large_max_new_tokens.py index 981e3af72..c48ca4547 100644 --- a/test/registered/openai_server/validation/test_large_max_new_tokens.py +++ b/test/registered/openai_server/validation/test_large_max_new_tokens.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=41, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=56, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=41, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/validation/test_matched_stop.py b/test/registered/openai_server/validation/test_matched_stop.py index 0611a1ea2..da8ec59cf 100644 --- a/test/registered/openai_server/validation/test_matched_stop.py +++ b/test/registered/openai_server/validation/test_matched_stop.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=52, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=60, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/validation/test_openai_server_ignore_eos.py b/test/registered/openai_server/validation/test_openai_server_ignore_eos.py index 2f27699ee..2986c2f57 100644 --- a/test/registered/openai_server/validation/test_openai_server_ignore_eos.py +++ b/test/registered/openai_server/validation/test_openai_server_ignore_eos.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=55, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=42, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=47, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/validation/test_request_length_validation.py b/test/registered/openai_server/validation/test_request_length_validation.py index 0699d3917..1bc93e551 100644 --- a/test/registered/openai_server/validation/test_request_length_validation.py +++ b/test/registered/openai_server/validation/test_request_length_validation.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=38, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=39, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=31, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/ops/test_repeat_interleave.py b/test/registered/ops/test_repeat_interleave.py index acb45bd47..ca2c26b91 100644 --- a/test/registered/ops/test_repeat_interleave.py +++ b/test/registered/ops/test_repeat_interleave.py @@ -11,7 +11,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Ops - Repeat Interleave tests (1-GPU) -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=7, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=75, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/perf/test_bench_one_batch_1gpu.py b/test/registered/perf/test_bench_one_batch_1gpu.py index acc8ccafb..26c251ccd 100644 --- a/test/registered/perf/test_bench_one_batch_1gpu.py +++ b/test/registered/perf/test_bench_one_batch_1gpu.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=80, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=120, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/perf/test_bench_one_batch_2gpu.py b/test/registered/perf/test_bench_one_batch_2gpu.py index 38fe4b3c8..41ba7a030 100644 --- a/test/registered/perf/test_bench_one_batch_2gpu.py +++ b/test/registered/perf/test_bench_one_batch_2gpu.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=180, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=167, suite="stage-b-test-2-gpu-large") register_amd_ci(est_time=630, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/perf/test_bench_serving_1gpu_large.py b/test/registered/perf/test_bench_serving_1gpu_large.py index 36f17107d..43e0ad63e 100644 --- a/test/registered/perf/test_bench_serving_1gpu_large.py +++ b/test/registered/perf/test_bench_serving_1gpu_large.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=300, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=251, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=300, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/perf/test_bench_serving_1gpu_part1.py b/test/registered/perf/test_bench_serving_1gpu_part1.py index 9e2778c57..fffbd5525 100644 --- a/test/registered/perf/test_bench_serving_1gpu_part1.py +++ b/test/registered/perf/test_bench_serving_1gpu_part1.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=1140, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=1184, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/perf/test_bench_serving_1gpu_part2.py b/test/registered/perf/test_bench_serving_1gpu_part2.py index 5bb97ef49..9f3725302 100644 --- a/test/registered/perf/test_bench_serving_1gpu_part2.py +++ b/test/registered/perf/test_bench_serving_1gpu_part2.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=900, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=910, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=900, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/perf/test_bench_serving_2gpu.py b/test/registered/perf/test_bench_serving_2gpu.py index 78320decf..7da00c13f 100644 --- a/test/registered/perf/test_bench_serving_2gpu.py +++ b/test/registered/perf/test_bench_serving_2gpu.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=600, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=660, suite="stage-b-test-2-gpu-large") register_amd_ci(est_time=1100, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/piecewise_cuda_graph/test_piecewise_cuda_graph_support_1_gpu.py b/test/registered/piecewise_cuda_graph/test_piecewise_cuda_graph_support_1_gpu.py index ce6fe2291..25a542cfd 100644 --- a/test/registered/piecewise_cuda_graph/test_piecewise_cuda_graph_support_1_gpu.py +++ b/test/registered/piecewise_cuda_graph/test_piecewise_cuda_graph_support_1_gpu.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( ) # CI Registration -register_cuda_ci(est_time=220, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=262, suite="stage-b-test-1-gpu-large") class TestPiecewiseCudaGraphQwen25VL(CustomTestCase): diff --git a/test/registered/prefill_only/test_cross_encoder_models.py b/test/registered/prefill_only/test_cross_encoder_models.py index 453d67a60..d63323d54 100644 --- a/test/registered/prefill_only/test_cross_encoder_models.py +++ b/test/registered/prefill_only/test_cross_encoder_models.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import CustomTestCase, is_in_ci # Cross encoder model tests -register_cuda_ci(est_time=100, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=101, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=150, suite="stage-b-test-1-gpu-small-amd") MODELS = [ diff --git a/test/registered/prefill_only/test_embed_overrides.py b/test/registered/prefill_only/test_embed_overrides.py index 42a77c6a9..7075472e6 100644 --- a/test/registered/prefill_only/test_embed_overrides.py +++ b/test/registered/prefill_only/test_embed_overrides.py @@ -23,7 +23,7 @@ from sglang.srt.managers.tokenizer_manager_score_mixin import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=5, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") HIDDEN_DIM = 4 diff --git a/test/registered/prefill_only/test_embedding_models.py b/test/registered/prefill_only/test_embedding_models.py index bc8f48059..6776c8602 100644 --- a/test/registered/prefill_only/test_embedding_models.py +++ b/test/registered/prefill_only/test_embedding_models.py @@ -35,7 +35,7 @@ register_amd_ci( suite="stage-b-test-1-gpu-small-amd", disabled="see https://github.com/sgl-project/sglang/issues/11127", ) -register_cuda_ci(est_time=90, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=102, suite="stage-b-test-1-gpu-small") MODEL_TO_CONFIG = { "Alibaba-NLP/gte-Qwen2-1.5B-instruct": (1, 1e-5), diff --git a/test/registered/prefill_only/test_encoder_embedding_models.py b/test/registered/prefill_only/test_encoder_embedding_models.py index 64d9c5dba..90cfca661 100644 --- a/test/registered/prefill_only/test_encoder_embedding_models.py +++ b/test/registered/prefill_only/test_encoder_embedding_models.py @@ -29,7 +29,7 @@ from sglang.test.test_utils import CustomTestCase, get_similarities, is_in_ci # python -m unittest test_encoder_embedding_models.TestEncoderEmbeddingModels.test_prefill_logits -register_cuda_ci(est_time=310, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=198, suite="stage-b-test-1-gpu-small") MODELS = [("BAAI/bge-small-en", 1, 1e-5), ("BAAI/bge-m3", 1, 1e-5)] diff --git a/test/registered/prefill_only/test_openai_embedding.py b/test/registered/prefill_only/test_openai_embedding.py index 3c13198e8..cb3507027 100644 --- a/test/registered/prefill_only/test_openai_embedding.py +++ b/test/registered/prefill_only/test_openai_embedding.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=70, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=80, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=141, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/prefill_only/test_reward_models.py b/test/registered/prefill_only/test_reward_models.py index a26314e62..fb3084675 100644 --- a/test/registered/prefill_only/test_reward_models.py +++ b/test/registered/prefill_only/test_reward_models.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import CustomTestCase # ============================================================================== -register_cuda_ci(est_time=103, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=142, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=132, suite="stage-b-test-1-gpu-small-amd-nondeterministic") MODELS = [ diff --git a/test/registered/prefill_only/test_score_api.py b/test/registered/prefill_only/test_score_api.py index b1072ef34..c096290d6 100644 --- a/test/registered/prefill_only/test_score_api.py +++ b/test/registered/prefill_only/test_score_api.py @@ -26,7 +26,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=160, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=70, suite="stage-b-test-1-gpu-small") _MODEL = DEFAULT_SMALL_MODEL_NAME_FOR_TEST # Llama-3.2-1B-Instruct # <|eot_id|> for Llama-3.x Instruct — used as MIS delimiter diff --git a/test/registered/prefill_only/test_score_engine.py b/test/registered/prefill_only/test_score_engine.py index a282c1a05..767e8a91e 100644 --- a/test/registered/prefill_only/test_score_engine.py +++ b/test/registered/prefill_only/test_score_engine.py @@ -22,7 +22,7 @@ from sglang.srt.entrypoints.engine import Engine from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase -register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=85, suite="stage-b-test-1-gpu-small") _CAUSAL_LM_MODEL = DEFAULT_SMALL_MODEL_NAME_FOR_TEST # Llama-3.2-1B-Instruct _SEQCLS_MODEL = "Qwen/Qwen3-0.6B" # backbone; arch overridden to SeqCls below diff --git a/test/registered/prefill_only/test_serving_rerank.py b/test/registered/prefill_only/test_serving_rerank.py index edfb55657..411ea1c8e 100644 --- a/test/registered/prefill_only/test_serving_rerank.py +++ b/test/registered/prefill_only/test_serving_rerank.py @@ -7,7 +7,7 @@ from sglang.srt.managers.tokenizer_manager_score_mixin import ScoreResult from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Keep consistent with other openai_server/basic unit tests. -register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") try: diff --git a/test/registered/profiling/test_start_profile.py b/test/registered/profiling/test_start_profile.py index a2d25e8e9..edfb48fa5 100644 --- a/test/registered/profiling/test_start_profile.py +++ b/test/registered/profiling/test_start_profile.py @@ -29,7 +29,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=41, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=60, suite="stage-b-test-1-gpu-small-amd") OUTPUT_DIR = "./profiler_dir" diff --git a/test/registered/quant/test_autoround.py b/test/registered/quant/test_autoround.py index 89374ec56..9c1e3005f 100644 --- a/test/registered/quant/test_autoround.py +++ b/test/registered/quant/test_autoround.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=77, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=96, suite="stage-b-test-1-gpu-large") class TestAutoRound(CustomTestCase): diff --git a/test/registered/quant/test_awq.py b/test/registered/quant/test_awq.py index c2a267652..b94fe4006 100644 --- a/test/registered/quant/test_awq.py +++ b/test/registered/quant/test_awq.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=260, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=209, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/quant/test_block_int8.py b/test/registered/quant/test_block_int8.py index 68ddf2fc9..68829f90f 100644 --- a/test/registered/quant/test_block_int8.py +++ b/test/registered/quant/test_block_int8.py @@ -10,7 +10,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=44, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=39, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=22, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/quant/test_bnb.py b/test/registered/quant/test_bnb.py index 8ce583f22..ee7964256 100644 --- a/test/registered/quant/test_bnb.py +++ b/test/registered/quant/test_bnb.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=5, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=6, suite="stage-b-test-1-gpu-small") VISION_MODELS = [ "unsloth/Qwen2.5-VL-7B-Instruct-bnb-4bit", diff --git a/test/registered/quant/test_deepseek_v32_fp4_4gpu.py b/test/registered/quant/test_deepseek_v32_fp4_4gpu.py index f618d8332..dc5d2824b 100644 --- a/test/registered/quant/test_deepseek_v32_fp4_4gpu.py +++ b/test/registered/quant/test_deepseek_v32_fp4_4gpu.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=530, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=852, suite="stage-c-test-4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/quant/test_deepseek_v32_fp4_mtp_4gpu.py b/test/registered/quant/test_deepseek_v32_fp4_mtp_4gpu.py index db2298423..8ea65b8ca 100644 --- a/test/registered/quant/test_deepseek_v32_fp4_mtp_4gpu.py +++ b/test/registered/quant/test_deepseek_v32_fp4_mtp_4gpu.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=610, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=1030, suite="stage-c-test-4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/quant/test_deepseek_v3_fp4_4gpu.py b/test/registered/quant/test_deepseek_v3_fp4_4gpu.py index 3a9030cfd..ed32e53aa 100644 --- a/test/registered/quant/test_deepseek_v3_fp4_4gpu.py +++ b/test/registered/quant/test_deepseek_v3_fp4_4gpu.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=450, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=1146, suite="stage-c-test-4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/quant/test_eval_fp8_accuracy.py b/test/registered/quant/test_eval_fp8_accuracy.py index f60fcc7af..5fa425a24 100644 --- a/test/registered/quant/test_eval_fp8_accuracy.py +++ b/test/registered/quant/test_eval_fp8_accuracy.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=250, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=326, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=600, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/quant/test_fp8_blockwise_gemm.py b/test/registered/quant/test_fp8_blockwise_gemm.py index a9602d94c..aace46e55 100644 --- a/test/registered/quant/test_fp8_blockwise_gemm.py +++ b/test/registered/quant/test_fp8_blockwise_gemm.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=400, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=302, suite="stage-c-test-4-gpu-b200") MODEL_PATH = "Qwen/Qwen3-4B-Instruct-2507-FP8" MXFP8_MODEL_PATH = "zianglih/Qwen3-4B-Instruct-2507-MXFP8" diff --git a/test/registered/quant/test_fp8_gemm_sm120.py b/test/registered/quant/test_fp8_gemm_sm120.py index 9ca9ea7af..bbdf97fa6 100644 --- a/test/registered/quant/test_fp8_gemm_sm120.py +++ b/test/registered/quant/test_fp8_gemm_sm120.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=144, suite="stage-b-test-1-gpu-small") PERTENSOR_MODEL_PATH = "nvidia/Llama-3.1-8B-Instruct-FP8" BLOCKWISE_MODEL_PATH = "Qwen/Qwen3-4B-Instruct-2507-FP8" diff --git a/test/registered/quant/test_fp8_kernel.py b/test/registered/quant/test_fp8_kernel.py index ea5c60689..5ae5c0485 100644 --- a/test/registered/quant/test_fp8_kernel.py +++ b/test/registered/quant/test_fp8_kernel.py @@ -9,7 +9,7 @@ from sglang.srt.layers.quantization.fp8_kernel import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=15, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-large") class TestFP8Base(CustomTestCase): diff --git a/test/registered/quant/test_fp8_utils.py b/test/registered/quant/test_fp8_utils.py index 563a9123b..b4118d6f6 100644 --- a/test/registered/quant/test_fp8_utils.py +++ b/test/registered/quant/test_fp8_utils.py @@ -10,7 +10,7 @@ from sglang.srt.layers.quantization.fp8_utils import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-large") class TestInverseTransformScaleUe8m0(CustomTestCase): diff --git a/test/registered/quant/test_fp8kv_triton.py b/test/registered/quant/test_fp8kv_triton.py index df9573e22..8136f0109 100644 --- a/test/registered/quant/test_fp8kv_triton.py +++ b/test/registered/quant/test_fp8kv_triton.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=80, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=63, suite="stage-b-test-1-gpu-large") class TestFP8KVCacheTritonBackend(CustomTestCase): diff --git a/test/registered/quant/test_gguf.py b/test/registered/quant/test_gguf.py index 853d3dda7..4ae3bb8e0 100644 --- a/test/registered/quant/test_gguf.py +++ b/test/registered/quant/test_gguf.py @@ -6,7 +6,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=96, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=71, suite="stage-b-test-1-gpu-small") class TestGGUF(CustomTestCase): diff --git a/test/registered/quant/test_gptqmodel_dynamic.py b/test/registered/quant/test_gptqmodel_dynamic.py index 6fdbf676f..15927a7c9 100644 --- a/test/registered/quant/test_gptqmodel_dynamic.py +++ b/test/registered/quant/test_gptqmodel_dynamic.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=102, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=98, suite="stage-b-test-1-gpu-large") def check_quant_method(model_path: str, use_marlin_kernel: bool): diff --git a/test/registered/quant/test_int8_kernel.py b/test/registered/quant/test_int8_kernel.py index 0a5d3001a..84591e3b4 100644 --- a/test/registered/quant/test_int8_kernel.py +++ b/test/registered/quant/test_int8_kernel.py @@ -11,7 +11,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=16, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=13, suite="stage-b-test-1-gpu-small") def native_w8a8_per_token_matmul(A, B, As, Bs, output_dtype=torch.float16): diff --git a/test/registered/quant/test_marlin_moe.py b/test/registered/quant/test_marlin_moe.py index 9a043882f..9554c51f6 100644 --- a/test/registered/quant/test_marlin_moe.py +++ b/test/registered/quant/test_marlin_moe.py @@ -12,7 +12,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_marlin_utils import awq_marlin_quantize, marlin_quantize from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=130, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=85, suite="stage-b-test-1-gpu-small") set_global_server_args_for_scheduler(object.__new__(ServerArgs)) diff --git a/test/registered/quant/test_modelopt_fp8.py b/test/registered/quant/test_modelopt_fp8.py index a65e2e20c..9f1c7bdfc 100644 --- a/test/registered/quant/test_modelopt_fp8.py +++ b/test/registered/quant/test_modelopt_fp8.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=62, suite="stage-b-test-1-gpu-large") class TestModeloptFP8(CustomTestCase): diff --git a/test/registered/quant/test_nvfp4_gemm.py b/test/registered/quant/test_nvfp4_gemm.py index dacbb04b9..7325231e8 100644 --- a/test/registered/quant/test_nvfp4_gemm.py +++ b/test/registered/quant/test_nvfp4_gemm.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=300, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=322, suite="stage-c-test-4-gpu-b200") MODEL_PATH = "nvidia/Llama-3.1-8B-Instruct-NVFP4" diff --git a/test/registered/quant/test_nvfp4_gemm_sm120.py b/test/registered/quant/test_nvfp4_gemm_sm120.py index dea1e17cc..4f87b965b 100644 --- a/test/registered/quant/test_nvfp4_gemm_sm120.py +++ b/test/registered/quant/test_nvfp4_gemm_sm120.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=90, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=115, suite="stage-b-test-1-gpu-small") MODEL_PATH = "nvidia/Llama-3.1-8B-Instruct-NVFP4" diff --git a/test/registered/quant/test_quant_config_parsing.py b/test/registered/quant/test_quant_config_parsing.py index 5b9d12817..5db3be7b8 100644 --- a/test/registered/quant/test_quant_config_parsing.py +++ b/test/registered/quant/test_quant_config_parsing.py @@ -5,7 +5,7 @@ from sglang.srt.configs.model_config import ModelConfig from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=20, suite="stage-a-test-cpu") +register_cpu_ci(est_time=12, suite="stage-a-test-cpu") class TestQuantLogString(CustomTestCase): diff --git a/test/registered/quant/test_quantization.py b/test/registered/quant/test_quantization.py index 083282b87..30ccc18f8 100644 --- a/test/registered/quant/test_quantization.py +++ b/test/registered/quant/test_quantization.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_results_to_json, ) -register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=402, suite="stage-b-test-1-gpu-large") MODEL_SCORE_THRESHOLDS = { # Baselines observed with gsm8k 5-shot concatenated format via chat API, diff --git a/test/registered/quant/test_torchao.py b/test/registered/quant/test_torchao.py index 16dc187a7..018f1a02e 100644 --- a/test/registered/quant/test_torchao.py +++ b/test/registered/quant/test_torchao.py @@ -5,7 +5,7 @@ import requests from sglang import Engine from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=140, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=124, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=230, suite="stage-b-test-1-gpu-small-amd") from sglang.lang.chat_template import get_chat_template_by_model_path from sglang.srt.utils import kill_process_tree diff --git a/test/registered/quant/test_triton_scaled_mm.py b/test/registered/quant/test_triton_scaled_mm.py index 2a4010240..f66c33c5d 100644 --- a/test/registered/quant/test_triton_scaled_mm.py +++ b/test/registered/quant/test_triton_scaled_mm.py @@ -8,7 +8,7 @@ from sglang.srt.layers.quantization.fp8_kernel import triton_scaled_mm from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=12, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/quant/test_w8a8_quantization.py b/test/registered/quant/test_w8a8_quantization.py index a2a2a1cb4..33805704e 100644 --- a/test/registered/quant/test_w8a8_quantization.py +++ b/test/registered/quant/test_w8a8_quantization.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=160, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=204, suite="stage-b-test-1-gpu-large") class BaseW8A8Test(CustomTestCase): diff --git a/test/registered/radix_cache/test_radix_attention.py b/test/registered/radix_cache/test_radix_attention.py index 871dac26e..3ce4643da 100644 --- a/test/registered/radix_cache/test_radix_attention.py +++ b/test/registered/radix_cache/test_radix_attention.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( ) # RadixAttention server integration tests -register_cuda_ci(est_time=100, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=96, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/radix_cache/test_radix_cache_hit.py b/test/registered/radix_cache/test_radix_cache_hit.py index 43f63cad7..974adb866 100644 --- a/test/registered/radix_cache/test_radix_cache_hit.py +++ b/test/registered/radix_cache/test_radix_cache_hit.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=62, suite="stage-b-test-1-gpu-small") MODEL = DEFAULT_SMALL_MODEL_NAME_FOR_TEST diff --git a/test/registered/radix_cache/test_swa_radix_cache_kl.py b/test/registered/radix_cache/test_swa_radix_cache_kl.py index db60d0055..a58abd916 100644 --- a/test/registered/radix_cache/test_swa_radix_cache_kl.py +++ b/test/registered/radix_cache/test_swa_radix_cache_kl.py @@ -6,7 +6,7 @@ from sglang.test.server_fixtures.default_fixture import DefaultServerBase MODEL = "openai/gpt-oss-20b" -register_cuda_ci(est_time=100, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=142, suite="stage-b-test-1-gpu-large") class TestSWARadixCacheKL(KLDivergenceMixin, DefaultServerBase): diff --git a/test/registered/reasoning/test_reasoning.py b/test/registered/reasoning/test_reasoning.py index 0517e2c8f..b6295c3da 100644 --- a/test/registered/reasoning/test_reasoning.py +++ b/test/registered/reasoning/test_reasoning.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=109, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=111, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/rl/test_fp32_lm_head.py b/test/registered/rl/test_fp32_lm_head.py index 8b721cc4e..f98769cdb 100644 --- a/test/registered/rl/test_fp32_lm_head.py +++ b/test/registered/rl/test_fp32_lm_head.py @@ -15,7 +15,7 @@ from sglang.srt.server_args import ( from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=15, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/rl/test_lora_load_from_tensor.py b/test/registered/rl/test_lora_load_from_tensor.py index 690eb266a..14bb64c7d 100644 --- a/test/registered/rl/test_lora_load_from_tensor.py +++ b/test/registered/rl/test_lora_load_from_tensor.py @@ -10,7 +10,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=90, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=78, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=90, suite="stage-b-test-1-gpu-small-amd") MODEL_PATH = "Qwen/Qwen3-0.6B" diff --git a/test/registered/rl/test_multi_instance_release_memory_occupation.py b/test/registered/rl/test_multi_instance_release_memory_occupation.py index c3f8d4b1d..5484b55b8 100644 --- a/test/registered/rl/test_multi_instance_release_memory_occupation.py +++ b/test/registered/rl/test_multi_instance_release_memory_occupation.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( find_available_port, ) -register_cuda_ci(est_time=64, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=57, suite="stage-c-test-4-gpu-h100") register_amd_ci( est_time=64, suite="stage-c-test-4-gpu-amd", diff --git a/test/registered/rl/test_patch_torch.py b/test/registered/rl/test_patch_torch.py index 2c46e6754..445713165 100644 --- a/test/registered/rl/test_patch_torch.py +++ b/test/registered/rl/test_patch_torch.py @@ -12,7 +12,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_amd_ci( est_time=19, suite="stage-b-test-2-gpu-large-amd", disabled="see #11127" ) -register_cuda_ci(est_time=19, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=22, suite="stage-b-test-2-gpu-large") class TestReleaseMemoryOccupation(unittest.TestCase): diff --git a/test/registered/rl/test_pause_generation_tensor_consistency.py b/test/registered/rl/test_pause_generation_tensor_consistency.py index 761a963e2..0223cca11 100644 --- a/test/registered/rl/test_pause_generation_tensor_consistency.py +++ b/test/registered/rl/test_pause_generation_tensor_consistency.py @@ -9,7 +9,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") # --------------------------------------------------------------------------- diff --git a/test/registered/rl/test_return_routed_experts.py b/test/registered/rl/test_return_routed_experts.py index 7e3e3b517..d75bbd4e2 100644 --- a/test/registered/rl/test_return_routed_experts.py +++ b/test/registered/rl/test_return_routed_experts.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=200, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=164, suite="stage-b-test-2-gpu-large") register_amd_ci( est_time=200, suite="stage-b-test-2-gpu-large-amd", diff --git a/test/registered/rl/test_update_weights_from_disk_mxfp8.py b/test/registered/rl/test_update_weights_from_disk_mxfp8.py index a1111c138..12ac0758c 100644 --- a/test/registered/rl/test_update_weights_from_disk_mxfp8.py +++ b/test/registered/rl/test_update_weights_from_disk_mxfp8.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=100, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=149, suite="stage-c-test-4-gpu-b200") import unittest diff --git a/test/registered/rl/test_update_weights_from_distributed.py b/test/registered/rl/test_update_weights_from_distributed.py index d0cad0285..3d464db3f 100644 --- a/test/registered/rl/test_update_weights_from_distributed.py +++ b/test/registered/rl/test_update_weights_from_distributed.py @@ -43,7 +43,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import terminate_process -register_cuda_ci(est_time=103, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=91, suite="stage-b-test-2-gpu-large") register_amd_ci(est_time=103, suite="stage-b-test-2-gpu-large-amd") mp.set_start_method("spawn", force=True) diff --git a/test/registered/rl/test_update_weights_from_tensor.py b/test/registered/rl/test_update_weights_from_tensor.py index aebe71e2a..cdd1afdc4 100644 --- a/test/registered/rl/test_update_weights_from_tensor.py +++ b/test/registered/rl/test_update_weights_from_tensor.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=195, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=136, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=195, suite="stage-b-test-1-gpu-small-amd") import gc diff --git a/test/registered/rotary/test_mrope.py b/test/registered/rotary/test_mrope.py index 64a0b017b..87b34df91 100644 --- a/test/registered/rotary/test_mrope.py +++ b/test/registered/rotary/test_mrope.py @@ -20,7 +20,7 @@ from sglang.srt.utils import ( ) from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=7, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=15, suite="stage-b-test-1-gpu-small-amd") _is_cuda = is_cuda() diff --git a/test/registered/sampling/test_original_logprobs.py b/test/registered/sampling/test_original_logprobs.py index 47b4a9c57..b8125e407 100644 --- a/test/registered/sampling/test_original_logprobs.py +++ b/test/registered/sampling/test_original_logprobs.py @@ -25,7 +25,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST -register_cuda_ci(est_time=41, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=46, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=60, suite="stage-b-test-1-gpu-small-amd") # ------------------------- Configurable via env ------------------------- # diff --git a/test/registered/sampling/test_penalty.py b/test/registered/sampling/test_penalty.py index df456e0f7..06311c083 100644 --- a/test/registered/sampling/test_penalty.py +++ b/test/registered/sampling/test_penalty.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=82, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=50, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=82, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/sampling/test_pytorch_sampling_backend.py b/test/registered/sampling/test_pytorch_sampling_backend.py index 3b6df45f9..e53cb1df5 100644 --- a/test/registered/sampling/test_pytorch_sampling_backend.py +++ b/test/registered/sampling/test_pytorch_sampling_backend.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=80, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=77, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=66, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_abort.py b/test/registered/scheduler/test_abort.py index 47399bc4e..b82a22e9a 100644 --- a/test/registered/scheduler/test_abort.py +++ b/test/registered/scheduler/test_abort.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( run_and_check_memory_leak, ) -register_cuda_ci(est_time=350, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=328, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=300, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_no_chunked_prefill.py b/test/registered/scheduler/test_no_chunked_prefill.py index a255346d0..5aa67fc14 100644 --- a/test/registered/scheduler/test_no_chunked_prefill.py +++ b/test/registered/scheduler/test_no_chunked_prefill.py @@ -8,7 +8,7 @@ from sglang.test.test_utils import ( run_mmlu_test, ) -register_cuda_ci(est_time=108, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=121, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=108, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_no_overlap_scheduler.py b/test/registered/scheduler/test_no_overlap_scheduler.py index 8ae06fe16..b3e0b28f6 100644 --- a/test/registered/scheduler/test_no_overlap_scheduler.py +++ b/test/registered/scheduler/test_no_overlap_scheduler.py @@ -9,7 +9,7 @@ import unittest from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase, run_mmlu_test -register_cuda_ci(est_time=245, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=231, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=275, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_priority_scheduling.py b/test/registered/scheduler/test_priority_scheduling.py index 72321b694..c1244596c 100644 --- a/test/registered/scheduler/test_priority_scheduling.py +++ b/test/registered/scheduler/test_priority_scheduling.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( send_concurrent_generate_requests_with_custom_params, ) -register_cuda_ci(est_time=130, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=133, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=195, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_retract_decode.py b/test/registered/scheduler/test_retract_decode.py index 42735b245..45e120ca1 100644 --- a/test/registered/scheduler/test_retract_decode.py +++ b/test/registered/scheduler/test_retract_decode.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import is_in_ci -register_cuda_ci(est_time=470, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=305, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=600, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/sessions/test_session_control.py b/test/registered/sessions/test_session_control.py index 0e6b2a7f2..386d57b9b 100644 --- a/test/registered/sessions/test_session_control.py +++ b/test/registered/sessions/test_session_control.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=60, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=77, suite="stage-b-test-1-gpu-large") def remove_prefix(text: str, prefix: str) -> str: diff --git a/test/registered/sessions/test_streaming_session.py b/test/registered/sessions/test_streaming_session.py index ed2da9cc3..ffefe30be 100644 --- a/test/registered/sessions/test_streaming_session.py +++ b/test/registered/sessions/test_streaming_session.py @@ -28,7 +28,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=70, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=67, suite="stage-b-test-1-gpu-large") # --------------------------------------------------------------------------- # Logprob leak constants diff --git a/test/registered/spec/dflash/test_dflash.py b/test/registered/spec/dflash/test_dflash.py index aa9ee2327..1583bd92b 100644 --- a/test/registered/spec/dflash/test_dflash.py +++ b/test/registered/spec/dflash/test_dflash.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=300, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-small") class TestDFlashServerBase(CustomTestCase, MatchedStopMixin, GSM8KMixin): diff --git a/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py b/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py index fe589679f..7b92a5803 100644 --- a/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py +++ b/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=240, suite="stage-b-test-4-gpu-b200") +register_cuda_ci(est_time=416, suite="stage-b-test-4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/spec/eagle/test_eagle3_basic.py b/test/registered/spec/eagle/test_eagle3_basic.py index 2830228a3..19486829e 100644 --- a/test/registered/spec/eagle/test_eagle3_basic.py +++ b/test/registered/spec/eagle/test_eagle3_basic.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( DEFAULT_TARGET_MODEL_EAGLE3, ) -register_cuda_ci(est_time=160, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=70, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=50, suite="stage-b-test-1-gpu-small") _is_hip = is_hip() diff --git a/test/registered/spec/eagle/test_eagle_constrained_decoding.py b/test/registered/spec/eagle/test_eagle_constrained_decoding.py index 6fa1dd5a3..13712d152 100644 --- a/test/registered/spec/eagle/test_eagle_constrained_decoding.py +++ b/test/registered/spec/eagle/test_eagle_constrained_decoding.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=100, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=96, suite="stage-b-test-1-gpu-large") class TestEagleConstrainedDecoding( diff --git a/test/registered/spec/eagle/test_eagle_dp_attention.py b/test/registered/spec/eagle/test_eagle_dp_attention.py index fe04bdb10..3f9dc9d1c 100644 --- a/test/registered/spec/eagle/test_eagle_dp_attention.py +++ b/test/registered/spec/eagle/test_eagle_dp_attention.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( ) # EAGLE3 with DP attention (tp=2, dp=2, requires 4 GPUs) -register_cuda_ci(est_time=100, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=96, suite="stage-c-test-4-gpu-h100") register_amd_ci(est_time=200, suite="stage-c-test-4-gpu-amd") diff --git a/test/registered/spec/eagle/test_eagle_infer_a.py b/test/registered/spec/eagle/test_eagle_infer_a.py index bce64a0c4..e7bfd9936 100644 --- a/test/registered/spec/eagle/test_eagle_infer_a.py +++ b/test/registered/spec/eagle/test_eagle_infer_a.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=266, suite="stage-b-test-1-gpu-large") class TestEAGLEEngine(CustomTestCase): diff --git a/test/registered/spec/eagle/test_eagle_infer_b.py b/test/registered/spec/eagle/test_eagle_infer_b.py index 1585a4bcc..c603a04d8 100644 --- a/test/registered/spec/eagle/test_eagle_infer_b.py +++ b/test/registered/spec/eagle/test_eagle_infer_b.py @@ -22,7 +22,7 @@ from sglang.test.run_eval import run_eval from sglang.test.server_fixtures.eagle_fixture import EagleServerBase from sglang.test.test_utils import DEFAULT_TARGET_MODEL_EAGLE, run_logprob_check -register_cuda_ci(est_time=690, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=684, suite="stage-b-test-1-gpu-large") class TestEAGLEServerBasic(EagleServerBase): diff --git a/test/registered/spec/eagle/test_eagle_infer_beta.py b/test/registered/spec/eagle/test_eagle_infer_beta.py index efaa9d6d8..77a571c14 100644 --- a/test/registered/spec/eagle/test_eagle_infer_beta.py +++ b/test/registered/spec/eagle/test_eagle_infer_beta.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=283, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=333, suite="stage-b-test-1-gpu-small") class TestEagle3ServerBase(CustomTestCase, MatchedStopMixin): diff --git a/test/registered/spec/eagle/test_eagle_infer_beta_dp_attention.py b/test/registered/spec/eagle/test_eagle_infer_beta_dp_attention.py index 407004dc0..0b3d75f60 100644 --- a/test/registered/spec/eagle/test_eagle_infer_beta_dp_attention.py +++ b/test/registered/spec/eagle/test_eagle_infer_beta_dp_attention.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( ) # EAGLE with DP attention on B200 (tp=2, dp=2, requires 4 B200 GPUs) -register_cuda_ci(est_time=100, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=68, suite="stage-c-test-4-gpu-b200") def test_gsm8k(base_url: str, model: str): diff --git a/test/registered/spec/test_constrained_decoding_spec_reasoning.py b/test/registered/spec/test_constrained_decoding_spec_reasoning.py index 07f59bd2d..81e53d01e 100644 --- a/test/registered/spec/test_constrained_decoding_spec_reasoning.py +++ b/test/registered/spec/test_constrained_decoding_spec_reasoning.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( ) # Constrained decoding with EAGLE3 speculative reasoning (tp=2) -register_cuda_ci(est_time=60, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=80, suite="stage-b-test-2-gpu-large") class ServerWithGrammar(CustomTestCase): diff --git a/test/registered/spec/test_ngram_speculative_decoding.py b/test/registered/spec/test_ngram_speculative_decoding.py index d8e0c467b..f1fdfb11c 100644 --- a/test/registered/spec/test_ngram_speculative_decoding.py +++ b/test/registered/spec/test_ngram_speculative_decoding.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=230, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-large") GSM_DATASET_PATH = None diff --git a/test/registered/spec/test_standalone_speculative_decoding.py b/test/registered/spec/test_standalone_speculative_decoding.py index 37cb6fae7..cebe13467 100644 --- a/test/registered/spec/test_standalone_speculative_decoding.py +++ b/test/registered/spec/test_standalone_speculative_decoding.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( ) # Standalone speculative decoding tests (FA3, Triton, FlashInfer backends) -register_cuda_ci(est_time=308, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=294, suite="stage-b-test-1-gpu-large") GSM_DATASET_PATH = None diff --git a/test/registered/spec/utils/test_build_eagle_tree.py b/test/registered/spec/utils/test_build_eagle_tree.py index 103349fcc..d07afeb7c 100644 --- a/test/registered/spec/utils/test_build_eagle_tree.py +++ b/test/registered/spec/utils/test_build_eagle_tree.py @@ -9,7 +9,7 @@ from sglang.srt.speculative.eagle_utils import ( from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=6, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=4, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=3, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/tokenizer/test_multi_tokenizer.py b/test/registered/tokenizer/test_multi_tokenizer.py index b367cd4f8..3fb763159 100644 --- a/test/registered/tokenizer/test_multi_tokenizer.py +++ b/test/registered/tokenizer/test_multi_tokenizer.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=230, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=204, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=345, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/tokenizer/test_skip_tokenizer_init.py b/test/registered/tokenizer/test_skip_tokenizer_init.py index 5f821030f..3cb491979 100644 --- a/test/registered/tokenizer/test_skip_tokenizer_init.py +++ b/test/registered/tokenizer/test_skip_tokenizer_init.py @@ -23,7 +23,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=77, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=82, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=117, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/auto_benchmark/test_dataset_tools.py b/test/registered/unit/auto_benchmark/test_dataset_tools.py index b302ad86f..821921289 100644 --- a/test/registered/unit/auto_benchmark/test_dataset_tools.py +++ b/test/registered/unit/auto_benchmark/test_dataset_tools.py @@ -15,7 +15,7 @@ from sglang.auto_benchmark_lib import infer_backend, prepare_dataset from sglang.benchmark.datasets.autobench import sample_autobench_requests from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=1, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=5, suite="stage-b-test-1-gpu-small") class TestAutoBenchmarkDatasetTools(AutoBenchmarkTestCase): diff --git a/test/registered/unit/auto_benchmark/test_run_candidate.py b/test/registered/unit/auto_benchmark/test_run_candidate.py index ee919f2c1..7c3b78f22 100644 --- a/test/registered/unit/auto_benchmark/test_run_candidate.py +++ b/test/registered/unit/auto_benchmark/test_run_candidate.py @@ -14,7 +14,7 @@ from auto_benchmark import AutoBenchmarkTestCase from sglang.auto_benchmark_lib import SearchDeadlineExceeded, run_candidate from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=2, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=5, suite="stage-b-test-1-gpu-small") class TestAutoBenchmarkRunCandidate(AutoBenchmarkTestCase): diff --git a/test/registered/unit/auto_benchmark/test_search_tools.py b/test/registered/unit/auto_benchmark/test_search_tools.py index 2f304bca7..409d7e2f7 100644 --- a/test/registered/unit/auto_benchmark/test_search_tools.py +++ b/test/registered/unit/auto_benchmark/test_search_tools.py @@ -28,7 +28,7 @@ from sglang.auto_benchmark_lib import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=2, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=5, suite="stage-b-test-1-gpu-small") class TestAutoBenchmarkSearchTools(AutoBenchmarkTestCase): diff --git a/test/registered/unit/configs/test_linear_attn_model_registry.py b/test/registered/unit/configs/test_linear_attn_model_registry.py index 6fbd27d0a..8933a25d5 100644 --- a/test/registered/unit/configs/test_linear_attn_model_registry.py +++ b/test/registered/unit/configs/test_linear_attn_model_registry.py @@ -13,7 +13,7 @@ from sglang.srt.configs.linear_attn_model_registry import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") # Dummy config classes for testing diff --git a/test/registered/unit/entrypoints/openai/test_serving_embedding.py b/test/registered/unit/entrypoints/openai/test_serving_embedding.py index abbec63ec..ccbd03435 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_embedding.py +++ b/test/registered/unit/entrypoints/openai/test_serving_embedding.py @@ -54,7 +54,7 @@ from sglang.srt.entrypoints.openai.serving_embedding import OpenAIServingEmbeddi from sglang.srt.managers.io_struct import EmbeddingReqInput from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="stage-a-test-cpu") +register_cpu_ci(est_time=9, suite="stage-a-test-cpu") # Mock TokenizerManager for embedding tests diff --git a/test/registered/unit/entrypoints/test_ssl_cert_refresher.py b/test/registered/unit/entrypoints/test_ssl_cert_refresher.py index 8b8283d06..85393fd86 100644 --- a/test/registered/unit/entrypoints/test_ssl_cert_refresher.py +++ b/test/registered/unit/entrypoints/test_ssl_cert_refresher.py @@ -8,7 +8,7 @@ from sglang.srt.entrypoints.ssl_utils import SSLCertRefresher from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=9, suite="stage-a-test-cpu") +register_cpu_ci(est_time=13, suite="stage-a-test-cpu") def _make_temp_pem(content: bytes) -> str: diff --git a/test/registered/unit/layers/test_conv_layer.py b/test/registered/unit/layers/test_conv_layer.py index b2520f4d2..20ab6698a 100644 --- a/test/registered/unit/layers/test_conv_layer.py +++ b/test/registered/unit/layers/test_conv_layer.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=4, suite="stage-b-test-1-gpu-small") import unittest diff --git a/test/registered/unit/layers/test_mamba_state_scatter_triton.py b/test/registered/unit/layers/test_mamba_state_scatter_triton.py index 1a94dc6aa..c1f106c4b 100644 --- a/test/registered/unit/layers/test_mamba_state_scatter_triton.py +++ b/test/registered/unit/layers/test_mamba_state_scatter_triton.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=4, suite="stage-b-test-1-gpu-small") import os import unittest diff --git a/test/registered/unit/layers/test_pooler_score_and_pool.py b/test/registered/unit/layers/test_pooler_score_and_pool.py index 374e7ff02..b40c5afca 100644 --- a/test/registered/unit/layers/test_pooler_score_and_pool.py +++ b/test/registered/unit/layers/test_pooler_score_and_pool.py @@ -20,7 +20,7 @@ from sglang.srt.layers.pooler import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=9, suite="stage-a-test-cpu") def _make_forward_batch(extend_seq_lens, is_prefill_only=False): diff --git a/test/registered/unit/managers/test_profile_merger_http_api.py b/test/registered/unit/managers/test_profile_merger_http_api.py index 1270fdf83..53e49feb4 100644 --- a/test/registered/unit/managers/test_profile_merger_http_api.py +++ b/test/registered/unit/managers/test_profile_merger_http_api.py @@ -4,7 +4,7 @@ import unittest from sglang.srt.managers.io_struct import ProfileReqInput from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=9, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/managers/test_scheduler_flush_cache.py b/test/registered/unit/managers/test_scheduler_flush_cache.py index 828854ed4..249b4b8ce 100644 --- a/test/registered/unit/managers/test_scheduler_flush_cache.py +++ b/test/registered/unit/managers/test_scheduler_flush_cache.py @@ -9,7 +9,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.io_struct import FlushCacheReqInput from sglang.srt.managers.scheduler import Scheduler -register_cpu_ci(est_time=2, suite="stage-a-test-cpu") +register_cpu_ci(est_time=10, suite="stage-a-test-cpu") class TestSchedulerFlushCache(unittest.TestCase): diff --git a/test/registered/unit/managers/test_scheduler_pause_generation.py b/test/registered/unit/managers/test_scheduler_pause_generation.py index 210ba0aa6..4e94626d4 100644 --- a/test/registered/unit/managers/test_scheduler_pause_generation.py +++ b/test/registered/unit/managers/test_scheduler_pause_generation.py @@ -10,7 +10,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.io_struct import PauseGenerationReqInput from sglang.srt.managers.scheduler import Scheduler -register_cpu_ci(est_time=2, suite="stage-a-test-cpu") +register_cpu_ci(est_time=10, suite="stage-a-test-cpu") class TestSchedulerPauseGeneration(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_evict_policy.py b/test/registered/unit/mem_cache/test_evict_policy.py index c59af743f..13e022acf 100644 --- a/test/registered/unit/mem_cache/test_evict_policy.py +++ b/test/registered/unit/mem_cache/test_evict_policy.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="stage-a-test-cpu") +register_cpu_ci(est_time=1, suite="stage-a-test-cpu") import unittest from unittest.mock import MagicMock diff --git a/test/registered/unit/mem_cache/test_mamba_unittest.py b/test/registered/unit/mem_cache/test_mamba_unittest.py index c6219a46d..adadc5f3c 100644 --- a/test/registered/unit/mem_cache/test_mamba_unittest.py +++ b/test/registered/unit/mem_cache/test_mamba_unittest.py @@ -21,7 +21,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=9, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/mem_cache/test_nsa_pool_host_unit.py b/test/registered/unit/mem_cache/test_nsa_pool_host_unit.py index 64ca27493..f0462e267 100644 --- a/test/registered/unit/mem_cache/test_nsa_pool_host_unit.py +++ b/test/registered/unit/mem_cache/test_nsa_pool_host_unit.py @@ -11,7 +11,7 @@ from sglang.srt.mem_cache.memory_pool_host import ( from sglang.srt.utils import is_cuda, is_hip, is_npu, is_xpu from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") class TestNSAHiCacheTransfer(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py b/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py index 7d496f2e9..e407c1741 100644 --- a/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py +++ b/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py @@ -13,7 +13,7 @@ from sglang.srt.mem_cache.memory_pool import MHATokenToKVPool, ReqToTokenPool from sglang.srt.mem_cache.radix_cache import RadixCache, RadixKey from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=5, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=7, suite="stage-b-test-1-gpu-small") class TestSLRUAccuracy(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_radix_cache_unit.py b/test/registered/unit/mem_cache/test_radix_cache_unit.py index f7b8a43ce..f01bc7736 100644 --- a/test/registered/unit/mem_cache/test_radix_cache_unit.py +++ b/test/registered/unit/mem_cache/test_radix_cache_unit.py @@ -21,7 +21,7 @@ from sglang.srt.mem_cache.common import available_and_evictable_str from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # CPU-based unit test, runs quickly on any GPU runner -register_cuda_ci(est_time=20, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=16, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=5, suite="stage-b-test-1-gpu-small-amd") import random diff --git a/test/registered/unit/model_executor/test_pool_configurator.py b/test/registered/unit/model_executor/test_pool_configurator.py index e196045f9..04dc59e12 100644 --- a/test/registered/unit/model_executor/test_pool_configurator.py +++ b/test/registered/unit/model_executor/test_pool_configurator.py @@ -12,7 +12,7 @@ from unittest.mock import MagicMock, patch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=9, suite="stage-a-test-cpu") @contextlib.contextmanager diff --git a/test/registered/unit/model_loader/test_modelopt_export.py b/test/registered/unit/model_loader/test_modelopt_export.py index be448d467..8c2d634de 100644 --- a/test/registered/unit/model_loader/test_modelopt_export.py +++ b/test/registered/unit/model_loader/test_modelopt_export.py @@ -19,7 +19,7 @@ from sglang.srt.configs.model_config import ModelConfig from sglang.srt.model_loader.loader import ModelOptModelLoader from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=9, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=9, suite="stage-b-test-1-gpu-small-amd") # Note: PYTHONPATH=python should be set when running tests diff --git a/test/registered/unit/model_loader/test_modelopt_loader.py b/test/registered/unit/model_loader/test_modelopt_loader.py index 7f9652c0e..a7afcaf24 100644 --- a/test/registered/unit/model_loader/test_modelopt_loader.py +++ b/test/registered/unit/model_loader/test_modelopt_loader.py @@ -30,7 +30,7 @@ CALIBRATION_BATCH_SIZE = 36 CALIBRATION_NUM_SAMPLES = 512 DEFAULT_DEVICE = "cuda:0" -register_cuda_ci(est_time=11, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=10, suite="stage-b-test-1-gpu-small") class TestModelOptModelLoader(CustomTestCase): diff --git a/test/registered/unit/models/test_llava.py b/test/registered/unit/models/test_llava.py index a929dcfbd..1e4ca1ce2 100644 --- a/test/registered/unit/models/test_llava.py +++ b/test/registered/unit/models/test_llava.py @@ -5,7 +5,7 @@ from sglang.srt.models.llava import AutoModel, LlavaForConditionalGeneration from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=1, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") class PixtralVisionConfig: diff --git a/test/registered/unit/observability/test_func_timer.py b/test/registered/unit/observability/test_func_timer.py index 397fdafb7..988a5ca27 100644 --- a/test/registered/unit/observability/test_func_timer.py +++ b/test/registered/unit/observability/test_func_timer.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=1, suite="stage-a-test-cpu") import asyncio import unittest diff --git a/test/registered/unit/observability/test_request_metrics_exporter.py b/test/registered/unit/observability/test_request_metrics_exporter.py index 921c5dd1d..3dd4f618c 100644 --- a/test/registered/unit/observability/test_request_metrics_exporter.py +++ b/test/registered/unit/observability/test_request_metrics_exporter.py @@ -5,7 +5,7 @@ from typing import Any, Dict, List, Optional from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=1, suite="stage-a-test-cpu") import asyncio import json diff --git a/test/registered/unit/observability/test_startup_func_log_and_timer.py b/test/registered/unit/observability/test_startup_func_log_and_timer.py index 47281cf2d..5afcfab8f 100644 --- a/test/registered/unit/observability/test_startup_func_log_and_timer.py +++ b/test/registered/unit/observability/test_startup_func_log_and_timer.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=1, suite="stage-a-test-cpu") import unittest from unittest.mock import MagicMock, patch diff --git a/test/registered/unit/observability/test_trace.py b/test/registered/unit/observability/test_trace.py index 4a5efc92e..78654030c 100644 --- a/test/registered/unit/observability/test_trace.py +++ b/test/registered/unit/observability/test_trace.py @@ -4,7 +4,7 @@ import os from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=3, suite="stage-a-test-cpu") import threading import unittest diff --git a/test/registered/unit/parser/test_code_completion_parser.py b/test/registered/unit/parser/test_code_completion_parser.py index 1ee5f1f94..1182e0910 100644 --- a/test/registered/unit/parser/test_code_completion_parser.py +++ b/test/registered/unit/parser/test_code_completion_parser.py @@ -18,7 +18,7 @@ from sglang.srt.parser.code_completion_parser import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") class TestFimPosition(CustomTestCase): diff --git a/test/registered/unit/parser/test_conversation.py b/test/registered/unit/parser/test_conversation.py index b42445068..ed0a43c44 100644 --- a/test/registered/unit/parser/test_conversation.py +++ b/test/registered/unit/parser/test_conversation.py @@ -32,7 +32,7 @@ from sglang.srt.parser.conversation import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") class TestConversationGetPrompt(CustomTestCase): diff --git a/test/registered/unit/parser/test_jinja_template_utils.py b/test/registered/unit/parser/test_jinja_template_utils.py index 3396de98a..c3845148e 100644 --- a/test/registered/unit/parser/test_jinja_template_utils.py +++ b/test/registered/unit/parser/test_jinja_template_utils.py @@ -9,7 +9,7 @@ from sglang.srt.parser.jinja_template_utils import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") class TestTemplateContentFormatDetection(CustomTestCase): diff --git a/test/registered/unit/parser/test_reasoning_content_without_parser.py b/test/registered/unit/parser/test_reasoning_content_without_parser.py index 446dea6b3..265adb711 100644 --- a/test/registered/unit/parser/test_reasoning_content_without_parser.py +++ b/test/registered/unit/parser/test_reasoning_content_without_parser.py @@ -4,7 +4,7 @@ from sglang.srt.parser.reasoning_parser import ReasoningParser from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") # Simulated model output that contains think tags (e.g. from DeepSeek-R1) THINK_OUTPUT = ( diff --git a/test/registered/unit/parser/test_reasoning_parser.py b/test/registered/unit/parser/test_reasoning_parser.py index 8f05d7903..92ad536a8 100644 --- a/test/registered/unit/parser/test_reasoning_parser.py +++ b/test/registered/unit/parser/test_reasoning_parser.py @@ -17,7 +17,7 @@ from sglang.srt.parser.reasoning_parser import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") class TestStreamingParseResult(CustomTestCase): diff --git a/test/registered/unit/sampling/test_custom_logit_processor.py b/test/registered/unit/sampling/test_custom_logit_processor.py index 00922b45b..6ef5544aa 100644 --- a/test/registered/unit/sampling/test_custom_logit_processor.py +++ b/test/registered/unit/sampling/test_custom_logit_processor.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") import json import unittest diff --git a/test/registered/unit/sampling/test_penaltylib.py b/test/registered/unit/sampling/test_penaltylib.py index 8681bcb34..4943ff887 100644 --- a/test/registered/unit/sampling/test_penaltylib.py +++ b/test/registered/unit/sampling/test_penaltylib.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=8, suite="stage-a-test-cpu") import unittest from unittest.mock import MagicMock diff --git a/test/registered/unit/sampling/test_sampling_batch_info.py b/test/registered/unit/sampling/test_sampling_batch_info.py index 7b0189153..9af7587f2 100644 --- a/test/registered/unit/sampling/test_sampling_batch_info.py +++ b/test/registered/unit/sampling/test_sampling_batch_info.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=8, suite="stage-a-test-cpu") import unittest from unittest.mock import MagicMock, patch diff --git a/test/registered/unit/sampling/test_sampling_params.py b/test/registered/unit/sampling/test_sampling_params.py index 4d2431bf9..ce9a7c3c3 100644 --- a/test/registered/unit/sampling/test_sampling_params.py +++ b/test/registered/unit/sampling/test_sampling_params.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") import unittest from unittest.mock import MagicMock diff --git a/test/registered/unit/server_args/test_server_args.py b/test/registered/unit/server_args/test_server_args.py index a83a2c693..29b962b74 100644 --- a/test/registered/unit/server_args/test_server_args.py +++ b/test/registered/unit/server_args/test_server_args.py @@ -10,7 +10,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cpu_ci(est_time=10, suite="stage-a-test-cpu") +register_cpu_ci(est_time=9, suite="stage-a-test-cpu") # Mock get_device() so all tests run on CPU-only CI runners _mock_device = patch("sglang.srt.server_args.get_device", return_value="cuda") diff --git a/test/registered/unit/spec/test_ngram_corpus.py b/test/registered/unit/spec/test_ngram_corpus.py index 62ae418e3..1ecc30b4a 100644 --- a/test/registered/unit/spec/test_ngram_corpus.py +++ b/test/registered/unit/spec/test_ngram_corpus.py @@ -13,7 +13,7 @@ from sglang.srt.speculative.cpp_ngram.ngram_corpus import NgramCorpus from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="stage-a-test-cpu") +register_cpu_ci(est_time=18, suite="stage-a-test-cpu") def _make_corpus(match_type="BFS", **kwargs): diff --git a/test/registered/unit/test_runai_utils.py b/test/registered/unit/test_runai_utils.py index 4735b5d7f..865b3c7a9 100644 --- a/test/registered/unit/test_runai_utils.py +++ b/test/registered/unit/test_runai_utils.py @@ -6,7 +6,7 @@ from sglang.srt.utils.runai_utils import ObjectStorageModel, is_runai_obj_uri from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") class TestRunaiUtils(CustomTestCase): diff --git a/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py b/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py index 7a6f4d9dc..c683d0178 100644 --- a/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py +++ b/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py @@ -6,7 +6,7 @@ from unittest.mock import MagicMock, patch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") from sglang.srt.tokenizer.tiktoken_tokenizer import ( CONTROL_TOKEN_TEXTS, diff --git a/test/registered/unit/utils/test_gauge_histogram.py b/test/registered/unit/utils/test_gauge_histogram.py index 5f8dab542..e208d3e7a 100644 --- a/test/registered/unit/utils/test_gauge_histogram.py +++ b/test/registered/unit/utils/test_gauge_histogram.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=3, suite="stage-a-test-cpu") import unittest diff --git a/test/registered/unit/utils/test_http_server_auth.py b/test/registered/unit/utils/test_http_server_auth.py index 226c3bf88..25c948704 100644 --- a/test/registered/unit/utils/test_http_server_auth.py +++ b/test/registered/unit/utils/test_http_server_auth.py @@ -10,7 +10,7 @@ import unittest from sglang.srt.utils.auth import AuthLevel, decide_request_auth from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=3, suite="stage-a-test-cpu") class TestHttpServerAdminAuth(unittest.TestCase): diff --git a/test/registered/unit/utils/test_json_response.py b/test/registered/unit/utils/test_json_response.py index accc71fc5..20669d4ac 100644 --- a/test/registered/unit/utils/test_json_response.py +++ b/test/registered/unit/utils/test_json_response.py @@ -10,7 +10,7 @@ from sglang.srt.utils.json_response import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=4, suite="stage-a-test-cpu") class TestJSONResponseUtils(unittest.TestCase): diff --git a/test/registered/unit/utils/test_subprocess_watchdog.py b/test/registered/unit/utils/test_subprocess_watchdog.py index 2de995616..1e9f50f92 100644 --- a/test/registered/unit/utils/test_subprocess_watchdog.py +++ b/test/registered/unit/utils/test_subprocess_watchdog.py @@ -24,7 +24,7 @@ from sglang.srt.utils.watchdog import SubprocessWatchdog from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="stage-a-test-cpu") +register_cpu_ci(est_time=8, suite="stage-a-test-cpu") def healthy_worker(): diff --git a/test/registered/utils/test_log_utils.py b/test/registered/utils/test_log_utils.py index 74341c13b..449b8a856 100644 --- a/test/registered/utils/test_log_utils.py +++ b/test/registered/utils/test_log_utils.py @@ -9,7 +9,7 @@ from pathlib import Path from sglang.srt.utils.log_utils import create_log_targets, log_json from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=4, suite="stage-a-test-cpu") +register_cpu_ci(est_time=3, suite="stage-a-test-cpu") class TestLogUtils(unittest.TestCase): diff --git a/test/registered/utils/test_network_address.py b/test/registered/utils/test_network_address.py index ff05206c2..529162f2c 100644 --- a/test/registered/utils/test_network_address.py +++ b/test/registered/utils/test_network_address.py @@ -6,7 +6,7 @@ from sglang.srt.server_args import PortArgs, ServerArgs from sglang.srt.utils.network import NetworkAddress from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") # Mock get_device() so ServerArgs tests run on CPU-only CI runners _mock_device = patch("sglang.srt.server_args.get_device", return_value="cuda") diff --git a/test/registered/utils/test_numa_utils.py b/test/registered/utils/test_numa_utils.py index 1e084fef9..fc3fe61bc 100644 --- a/test/registered/utils/test_numa_utils.py +++ b/test/registered/utils/test_numa_utils.py @@ -9,7 +9,7 @@ from sglang.srt.utils.numa_utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci, register_cuda_ci -register_cpu_ci(est_time=1, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") register_cuda_ci(est_time=10, suite="stage-c-test-4-gpu-gb200") register_cuda_ci(est_time=10, suite="stage-c-test-8-gpu-b200") diff --git a/test/registered/utils/test_socket_utils.py b/test/registered/utils/test_socket_utils.py index 63a42ac39..058b81711 100644 --- a/test/registered/utils/test_socket_utils.py +++ b/test/registered/utils/test_socket_utils.py @@ -15,7 +15,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase from sglang.utils import normalize_base_url, release_port, reserve_port -register_cpu_ci(est_time=7, suite="stage-a-test-cpu") +register_cpu_ci(est_time=6, suite="stage-a-test-cpu") class TestTryBindSocket(CustomTestCase): diff --git a/test/registered/vlm/test_evs.py b/test/registered/vlm/test_evs.py index 1f1da070f..cd4aa8b48 100644 --- a/test/registered/vlm/test_evs.py +++ b/test/registered/vlm/test_evs.py @@ -6,7 +6,7 @@ import pytest from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import run_doctests -register_cuda_ci(est_time=20, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/vlm/test_patch_embed_perf.py b/test/registered/vlm/test_patch_embed_perf.py index 3ef3a6457..052d17095 100644 --- a/test/registered/vlm/test_patch_embed_perf.py +++ b/test/registered/vlm/test_patch_embed_perf.py @@ -8,7 +8,7 @@ import torch.nn as nn from sglang.srt.models.glm4v import Glm4vVisionPatchEmbed from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=12, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=8, suite="stage-b-test-1-gpu-large") PATCH_SIZE = 14 TEMPORAL_PATCH_SIZE = 2 diff --git a/test/registered/vlm/test_video_utils.py b/test/registered/vlm/test_video_utils.py index 5163f3519..f4dd0b027 100644 --- a/test/registered/vlm/test_video_utils.py +++ b/test/registered/vlm/test_video_utils.py @@ -5,7 +5,7 @@ import pytest from sglang.srt.utils import sample_video_frames from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="stage-a-test-cpu") +register_cpu_ci(est_time=4, suite="stage-a-test-cpu") class DummyVideo: diff --git a/test/registered/vlm/test_vision_chunked_prefill.py b/test/registered/vlm/test_vision_chunked_prefill.py index f078fab02..57739821d 100644 --- a/test/registered/vlm/test_vision_chunked_prefill.py +++ b/test/registered/vlm/test_vision_chunked_prefill.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=150, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=143, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=270, suite="stage-b-test-1-gpu-small-amd") """ Usage: diff --git a/test/registered/vlm/test_vision_openai_server_a.py b/test/registered/vlm/test_vision_openai_server_a.py index f64f7b8bc..c41eb1f61 100644 --- a/test/registered/vlm/test_vision_openai_server_a.py +++ b/test/registered/vlm/test_vision_openai_server_a.py @@ -19,7 +19,7 @@ from sglang.test.vlm_utils import ( VideoOpenAITestMixin, ) -register_cuda_ci(est_time=700, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=736, suite="stage-b-test-1-gpu-large") class TestLlavaServer(ImageOpenAITestMixin): diff --git a/test/registered/vlm/test_vlm_input_format.py b/test/registered/vlm/test_vlm_input_format.py index 44af1e5d8..792da109e 100644 --- a/test/registered/vlm/test_vlm_input_format.py +++ b/test/registered/vlm/test_vlm_input_format.py @@ -37,7 +37,7 @@ from sglang.srt.entrypoints.openai.protocol import ChatCompletionRequest from sglang.srt.parser.conversation import generate_chat_conv from sglang.srt.utils.hf_transformers_utils import _fix_added_tokens_encoding -register_cuda_ci(est_time=620, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=602, suite="stage-b-test-1-gpu-large") IMAGE_MAN_IRONING_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/man_ironing_on_back_of_suv.png" IMAGE_SGL_LOGO_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/sgl_logo.png" diff --git a/test/registered/vlm/test_vlm_tp4.py b/test/registered/vlm/test_vlm_tp4.py index 6f1a12394..33137dc00 100644 --- a/test/registered/vlm/test_vlm_tp4.py +++ b/test/registered/vlm/test_vlm_tp4.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=140, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=118, suite="stage-c-test-4-gpu-h100") QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" MMMU_ACCURACY_THRESHOLD = 0.65