diff --git a/test/registered/4-gpu-models/test_deepseek_v3_cutedsl_4gpu.py b/test/registered/4-gpu-models/test_deepseek_v3_cutedsl_4gpu.py index b5f875a0a..1aeb69b8b 100644 --- a/test/registered/4-gpu-models/test_deepseek_v3_cutedsl_4gpu.py +++ b/test/registered/4-gpu-models/test_deepseek_v3_cutedsl_4gpu.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=1800, stage="base-c", runner_config="4-gpu-gb300") +register_cuda_ci(est_time=384, stage="base-c", runner_config="4-gpu-gb300") # Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner. NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 100 diff --git a/test/registered/8-gpu-models/test_deepseek_v32_indexcache.py b/test/registered/8-gpu-models/test_deepseek_v32_indexcache.py index dbe61e287..a3895b360 100644 --- a/test/registered/8-gpu-models/test_deepseek_v32_indexcache.py +++ b/test/registered/8-gpu-models/test_deepseek_v32_indexcache.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=450, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=575, stage="extra-b", runner_config="8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" diff --git a/test/registered/attention/test_chunk_gated_delta_rule.py b/test/registered/attention/test_chunk_gated_delta_rule.py index 3ef2ab9b1..70ef9a28c 100644 --- a/test/registered/attention/test_chunk_gated_delta_rule.py +++ b/test/registered/attention/test_chunk_gated_delta_rule.py @@ -13,7 +13,7 @@ from sglang.test.ci.ci_register import ( register_xpu_ci, ) -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=11, stage="stage-b", runner_config="1-gpu-large-amd") register_xpu_ci(est_time=900, suite="stage-b-test-1-gpu-xpu") diff --git a/test/registered/attention/test_create_kvindices.py b/test/registered/attention/test_create_kvindices.py index 7e749301f..5124229d8 100644 --- a/test/registered/attention/test_create_kvindices.py +++ b/test/registered/attention/test_create_kvindices.py @@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase # Triton kernel unit test for KV indices creation -register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_deterministic.py b/test/registered/attention/test_deterministic.py index 4b0d46809..6873c47bf 100644 --- a/test/registered/attention/test_deterministic.py +++ b/test/registered/attention/test_deterministic.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( is_in_amd_ci, ) -register_cuda_ci(est_time=207, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=280, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd") register_xpu_ci(est_time=207, suite="stage-b-test-1-gpu-xpu") diff --git a/test/registered/attention/test_flash_attention_4.py b/test/registered/attention/test_flash_attention_4.py index 5ec464099..eb8e7de49 100644 --- a/test/registered/attention/test_flash_attention_4.py +++ b/test/registered/attention/test_flash_attention_4.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( ) # FlashAttention4 integration test (requires SM 100+ / Blackwell B200) -register_cuda_ci(est_time=260, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=230, stage="base-b", runner_config="4-gpu-b200") @unittest.skipIf(get_device_sm() < 100, "Test requires CUDA SM 100 or higher") diff --git a/test/registered/attention/test_gdn_fused_split_head_ratios.py b/test/registered/attention/test_gdn_fused_split_head_ratios.py index fd3081088..9c0d7bf8c 100644 --- a/test/registered/attention/test_gdn_fused_split_head_ratios.py +++ b/test/registered/attention/test_gdn_fused_split_head_ratios.py @@ -7,7 +7,7 @@ from sglang.kernels.ops.attention.triton_gdn_fused_proj import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=3, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large") def _reference_split(mixed_qkvz, mixed_ba, num_heads_qk, num_heads_v, head_qk, head_v): diff --git a/test/registered/attention/test_gdn_noncontiguous_stride.py b/test/registered/attention/test_gdn_noncontiguous_stride.py index f7debb162..65b801d54 100644 --- a/test/registered/attention/test_gdn_noncontiguous_stride.py +++ b/test/registered/attention/test_gdn_noncontiguous_stride.py @@ -14,7 +14,7 @@ from sglang.kernels.ops.attention.fla.fused_sigmoid_gating_recurrent import ( ) from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=7, stage="stage-b", runner_config="1-gpu-large-amd") diff --git a/test/registered/attention/test_gdn_prefill_layout.py b/test/registered/attention/test_gdn_prefill_layout.py index f6c9955f6..497004b4e 100644 --- a/test/registered/attention/test_gdn_prefill_layout.py +++ b/test/registered/attention/test_gdn_prefill_layout.py @@ -13,7 +13,7 @@ from sglang.kernels.ops.attention.triton_gdn_fused_proj import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "Test requires CUDA") diff --git a/test/registered/attention/test_gemma4_swa_triton_oob_regression.py b/test/registered/attention/test_gemma4_swa_triton_oob_regression.py index 675c7d6f9..fd51396b5 100644 --- a/test/registered/attention/test_gemma4_swa_triton_oob_regression.py +++ b/test/registered/attention/test_gemma4_swa_triton_oob_regression.py @@ -23,7 +23,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=107, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=90, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=160, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/attention/test_gemma4_unified_swa_virtual_ids.py b/test/registered/attention/test_gemma4_unified_swa_virtual_ids.py index aee45cef7..4b4377440 100644 --- a/test/registered/attention/test_gemma4_unified_swa_virtual_ids.py +++ b/test/registered/attention/test_gemma4_unified_swa_virtual_ids.py @@ -48,7 +48,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=65, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=72, stage="base-b", runner_config="1-gpu-large") # Healthy 0.865-0.880 (static pool 0.870); a died-mid-run server scores # 0.05-0.21. 1 sigma over 200 examples is ~0.024. diff --git a/test/registered/attention/test_hybrid_attn_backend.py b/test/registered/attention/test_hybrid_attn_backend.py index 03a15a341..d6564d5c0 100644 --- a/test/registered/attention/test_hybrid_attn_backend.py +++ b/test/registered/attention/test_hybrid_attn_backend.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( # Hybrid attention backend tests (FA3 prefill + FlashInfer decode, requires SM 90+ / H100) # Multiple test classes: base, MLA, TorchCompile, SpecDecode variants -register_cuda_ci(est_time=407, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=393, stage="extra-a", runner_config="1-gpu-large") class TestHybridAttnBackendMLA(TestHybridAttnBackendBase): diff --git a/test/registered/attention/test_kda_kernels.py b/test/registered/attention/test_kda_kernels.py index 055b0eb31..83b8d6de4 100644 --- a/test/registered/attention/test_kda_kernels.py +++ b/test/registered/attention/test_kda_kernels.py @@ -19,7 +19,7 @@ from sglang.srt.utils.common import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=12, stage="stage-b", runner_config="1-gpu-large-amd") diff --git a/test/registered/attention/test_mla_gluon_h12_fp8.py b/test/registered/attention/test_mla_gluon_h12_fp8.py index 5bbeedecc..47c6c1c0b 100644 --- a/test/registered/attention/test_mla_gluon_h12_fp8.py +++ b/test/registered/attention/test_mla_gluon_h12_fp8.py @@ -12,7 +12,7 @@ from sglang.srt.environ import envs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestMlaGluonCapability(CustomTestCase): diff --git a/test/registered/attention/test_qwen35_deterministic.py b/test/registered/attention/test_qwen35_deterministic.py index bb0d5c37c..6e8c19a88 100644 --- a/test/registered/attention/test_qwen35_deterministic.py +++ b/test/registered/attention/test_qwen35_deterministic.py @@ -12,7 +12,7 @@ from sglang.test.test_deterministic_utils import ( TestDeterministicBase, ) -register_cuda_ci(est_time=360, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=119, stage="extra-b", runner_config="4-gpu-h100") QWEN35 = "Qwen/Qwen3.5-35B-A3B" diff --git a/test/registered/attention/test_torch_native_attention_backend.py b/test/registered/attention/test_torch_native_attention_backend.py index 194442dcf..4e9f8ad30 100644 --- a/test/registered/attention/test_torch_native_attention_backend.py +++ b/test/registered/attention/test_torch_native_attention_backend.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( ) # Torch native attention backend integration test with MMLU eval -register_cuda_ci(est_time=140, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=310, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=150, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_triton_attention_kernels.py b/test/registered/attention/test_triton_attention_kernels.py index 01fdc595e..347e77b14 100644 --- a/test/registered/attention/test_triton_attention_kernels.py +++ b/test/registered/attention/test_triton_attention_kernels.py @@ -25,7 +25,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase, is_in_amd_ci # Triton attention kernel unit tests (decode, extend, prefill) -register_cuda_ci(est_time=19, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=30, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_triton_sliding_window.py b/test/registered/attention/test_triton_sliding_window.py index e23b1e528..24f88fcd1 100644 --- a/test/registered/attention/test_triton_sliding_window.py +++ b/test/registered/attention/test_triton_sliding_window.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( ) # Sliding window attention with Triton backend (Gemma-3 model) -register_cuda_ci(est_time=93, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=80, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_trtllm_mha_encoder_only.py b/test/registered/attention/test_trtllm_mha_encoder_only.py index 9aab0c8a1..831b99de4 100644 --- a/test/registered/attention/test_trtllm_mha_encoder_only.py +++ b/test/registered/attention/test_trtllm_mha_encoder_only.py @@ -17,7 +17,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase # trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell. -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") DEVICE = "cuda" PAGE_SIZE = 32 diff --git a/test/registered/attention/test_trtllm_mha_graph_metadata.py b/test/registered/attention/test_trtllm_mha_graph_metadata.py index b81327a28..edb38bc6d 100644 --- a/test/registered/attention/test_trtllm_mha_graph_metadata.py +++ b/test/registered/attention/test_trtllm_mha_graph_metadata.py @@ -23,7 +23,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cuda_ci # trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell. -register_cuda_ci(est_time=30, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=16, stage="base-b", runner_config="4-gpu-b200") DEVICE = "cuda" PAGE_SIZE = 128 diff --git a/test/registered/attention/test_trtllm_mha_page_table.py b/test/registered/attention/test_trtllm_mha_page_table.py index 32229b43b..c70e85222 100644 --- a/test/registered/attention/test_trtllm_mha_page_table.py +++ b/test/registered/attention/test_trtllm_mha_page_table.py @@ -25,7 +25,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase # Triton kernel unit test for the trtllm_mha device-side page-table build. -register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=14, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/attention/test_unified_memory_deterministic.py b/test/registered/attention/test_unified_memory_deterministic.py index ea7d0e111..4cd894fa0 100644 --- a/test/registered/attention/test_unified_memory_deterministic.py +++ b/test/registered/attention/test_unified_memory_deterministic.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=300, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=71, stage="base-b", runner_config="1-gpu-large") KIMI_LINEAR_MODEL = "yujiepan/kimi-linear-tiny-random" SERVER_ENV = {"SGLANG_BATCH_INVARIANT_OPS_ENABLE_MM_DEEPGEMM": "0"} diff --git a/test/registered/attention/test_verify_splitkv.py b/test/registered/attention/test_verify_splitkv.py index fd15aba0c..856d8e8a9 100644 --- a/test/registered/attention/test_verify_splitkv.py +++ b/test/registered/attention/test_verify_splitkv.py @@ -30,7 +30,7 @@ from sglang.kernels.ops.attention.verify_splitkv import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=30, suite="stage-b-test-1-gpu-small-amd-mi35x") # Split-KV accumulates the prefix in parallel splits and merges via log-sum-exp; diff --git a/test/registered/attention/unittests/dense/test_extend_init_contract.py b/test/registered/attention/unittests/dense/test_extend_init_contract.py index 4c3e6a921..177012a73 100644 --- a/test/registered/attention/unittests/dense/test_extend_init_contract.py +++ b/test/registered/attention/unittests/dense/test_extend_init_contract.py @@ -36,7 +36,7 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=11, stage="base-a", runner_config="1-gpu-small") _EXTEND_CASE = DenseAttentionCase( name="extend_no_prefix_smoke", diff --git a/test/registered/attention/unittests/dense/test_fa3.py b/test/registered/attention/unittests/dense/test_fa3.py index 515cf06ee..2c77f986f 100644 --- a/test/registered/attention/unittests/dense/test_fa3.py +++ b/test/registered/attention/unittests/dense/test_fa3.py @@ -30,7 +30,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/dense/test_fa4.py b/test/registered/attention/unittests/dense/test_fa4.py index 473e3bed6..2adbce5d6 100644 --- a/test/registered/attention/unittests/dense/test_fa4.py +++ b/test/registered/attention/unittests/dense/test_fa4.py @@ -29,8 +29,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=45, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=45, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=27, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=22, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/dense/test_flashinfer.py b/test/registered/attention/unittests/dense/test_flashinfer.py index 67f91c147..214bcecb7 100644 --- a/test/registered/attention/unittests/dense/test_flashinfer.py +++ b/test/registered/attention/unittests/dense/test_flashinfer.py @@ -26,8 +26,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf( diff --git a/test/registered/attention/unittests/dense/test_flex_attention.py b/test/registered/attention/unittests/dense/test_flex_attention.py index 4e8d8e025..123243368 100644 --- a/test/registered/attention/unittests/dense/test_flex_attention.py +++ b/test/registered/attention/unittests/dense/test_flex_attention.py @@ -14,8 +14,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/dense/test_hybrid_attn.py b/test/registered/attention/unittests/dense/test_hybrid_attn.py index 396d1b2d9..444dd5a41 100644 --- a/test/registered/attention/unittests/dense/test_hybrid_attn.py +++ b/test/registered/attention/unittests/dense/test_hybrid_attn.py @@ -18,8 +18,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf( diff --git a/test/registered/attention/unittests/dense/test_tbo.py b/test/registered/attention/unittests/dense/test_tbo.py index 992b9ae13..27cefebab 100644 --- a/test/registered/attention/unittests/dense/test_tbo.py +++ b/test/registered/attention/unittests/dense/test_tbo.py @@ -21,8 +21,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_ ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/dense/test_torch_native.py b/test/registered/attention/unittests/dense/test_torch_native.py index 650f16fea..9eebe7c4c 100644 --- a/test/registered/attention/unittests/dense/test_torch_native.py +++ b/test/registered/attention/unittests/dense/test_torch_native.py @@ -11,8 +11,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/dense/test_triton.py b/test/registered/attention/unittests/dense/test_triton.py index 5cb86c296..64559579c 100644 --- a/test/registered/attention/unittests/dense/test_triton.py +++ b/test/registered/attention/unittests/dense/test_triton.py @@ -30,8 +30,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=19, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/dense/test_trtllm_mha.py b/test/registered/attention/unittests/dense/test_trtllm_mha.py index 0d12a6c08..26678d9b2 100644 --- a/test/registered/attention/unittests/dense/test_trtllm_mha.py +++ b/test/registered/attention/unittests/dense/test_trtllm_mha.py @@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=17, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf( diff --git a/test/registered/attention/unittests/dsa/test_dsa.py b/test/registered/attention/unittests/dsa/test_dsa.py index d236cb29c..3c63513ce 100644 --- a/test/registered/attention/unittests/dsa/test_dsa.py +++ b/test/registered/attention/unittests/dsa/test_dsa.py @@ -30,8 +30,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_draft_runner i ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/dsv4/test_deepseek_v4.py b/test/registered/attention/unittests/dsv4/test_deepseek_v4.py index 1727e9e28..0f2fd7503 100644 --- a/test/registered/attention/unittests/dsv4/test_deepseek_v4.py +++ b/test/registered/attention/unittests/dsv4/test_deepseek_v4.py @@ -47,8 +47,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_ run_dsv4_eagle_verify_cuda_graph_case, ) -register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/dual_chunk/test_dual_chunk_flash_attn.py b/test/registered/attention/unittests/dual_chunk/test_dual_chunk_flash_attn.py index 4ecc7aef7..230aa4dda 100644 --- a/test/registered/attention/unittests/dual_chunk/test_dual_chunk_flash_attn.py +++ b/test/registered/attention/unittests/dual_chunk/test_dual_chunk_flash_attn.py @@ -60,8 +60,8 @@ _DUAL_CHUNK_FLASH_ATTN_AVAILABLE, _DUAL_CHUNK_SKIP_REASON = _dual_chunk_fa_suppo from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/gdn/test_flashinfer.py b/test/registered/attention/unittests/gdn/test_flashinfer.py index b8f1adebf..06de49b82 100644 --- a/test/registered/attention/unittests/gdn/test_flashinfer.py +++ b/test/registered/attention/unittests/gdn/test_flashinfer.py @@ -25,8 +25,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") _cuda_major = int(torch.version.cuda.split(".")[0]) if torch.version.cuda else 0 _sm_major = torch.cuda.get_device_capability()[0] if torch.cuda.is_available() else 0 diff --git a/test/registered/attention/unittests/gdn/test_gdn_cutedsl_ring_verify.py b/test/registered/attention/unittests/gdn/test_gdn_cutedsl_ring_verify.py index 01bbd9160..d0039b316 100644 --- a/test/registered/attention/unittests/gdn/test_gdn_cutedsl_ring_verify.py +++ b/test/registered/attention/unittests/gdn/test_gdn_cutedsl_ring_verify.py @@ -28,7 +28,7 @@ from sglang.kernels.ops.attention.fla.gdn_replayssm_spec_fold import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=23, stage="base-b", runner_config="1-gpu-large") T, H, HV, K, V, SLOTS = 4, 4, 16, 128, 128, 16 DEVICE = "cuda" diff --git a/test/registered/attention/unittests/gdn/test_gdn_replayssm_spec_fold.py b/test/registered/attention/unittests/gdn/test_gdn_replayssm_spec_fold.py index c9072071f..51f253fe4 100644 --- a/test/registered/attention/unittests/gdn/test_gdn_replayssm_spec_fold.py +++ b/test/registered/attention/unittests/gdn/test_gdn_replayssm_spec_fold.py @@ -20,7 +20,7 @@ from sglang.kernels.ops.attention.fla.gdn_replayssm_spec_fold import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") B, T = 3, 4 H, HV = 4, 8 diff --git a/test/registered/attention/unittests/gdn/test_linear_replayssm_decode.py b/test/registered/attention/unittests/gdn/test_linear_replayssm_decode.py index d43f08955..0c3ef19e7 100644 --- a/test/registered/attention/unittests/gdn/test_linear_replayssm_decode.py +++ b/test/registered/attention/unittests/gdn/test_linear_replayssm_decode.py @@ -45,7 +45,7 @@ import torch from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/gdn/test_torch_native.py b/test/registered/attention/unittests/gdn/test_torch_native.py index 9e92567b9..ef516ab5b 100644 --- a/test/registered/attention/unittests/gdn/test_torch_native.py +++ b/test/registered/attention/unittests/gdn/test_torch_native.py @@ -15,8 +15,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/gdn/test_triton.py b/test/registered/attention/unittests/gdn/test_triton.py index 3e7c501f1..ab00d553b 100644 --- a/test/registered/attention/unittests/gdn/test_triton.py +++ b/test/registered/attention/unittests/gdn/test_triton.py @@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/hybrid_linear/test_flashinfer_mla_chunk_metadata.py b/test/registered/attention/unittests/hybrid_linear/test_flashinfer_mla_chunk_metadata.py index 81abb6133..9a078c277 100644 --- a/test/registered/attention/unittests/hybrid_linear/test_flashinfer_mla_chunk_metadata.py +++ b/test/registered/attention/unittests/hybrid_linear/test_flashinfer_mla_chunk_metadata.py @@ -32,7 +32,7 @@ from sglang.test.kits.attention_unittest.attention_methods.mla_attention import ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") _KV_LORA_RANK = DEFAULT_KV_LORA_RANK diff --git a/test/registered/attention/unittests/hybrid_linear/test_kda_fused_accept_indices.py b/test/registered/attention/unittests/hybrid_linear/test_kda_fused_accept_indices.py index afc37719e..aba244cfd 100644 --- a/test/registered/attention/unittests/hybrid_linear/test_kda_fused_accept_indices.py +++ b/test/registered/attention/unittests/hybrid_linear/test_kda_fused_accept_indices.py @@ -24,7 +24,7 @@ from sglang.srt.layers.attention.linear.kernels.kda_flashinfer import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=2, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") class TestBuildFusedAcceptIndices(CustomTestCase): diff --git a/test/registered/attention/unittests/hybrid_linear/test_verify_buffer_fixup_hook.py b/test/registered/attention/unittests/hybrid_linear/test_verify_buffer_fixup_hook.py index 7f4472f04..8aa979bc5 100644 --- a/test/registered/attention/unittests/hybrid_linear/test_verify_buffer_fixup_hook.py +++ b/test/registered/attention/unittests/hybrid_linear/test_verify_buffer_fixup_hook.py @@ -22,7 +22,7 @@ from sglang.srt.speculative.eagle_info import EagleVerifyInput from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=2, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") _STALE = -555 _MAX_BS = 4 diff --git a/test/registered/attention/unittests/kda/test_triton.py b/test/registered/attention/unittests/kda/test_triton.py index 94044ddf6..d9f24bbab 100644 --- a/test/registered/attention/unittests/kda/test_triton.py +++ b/test/registered/attention/unittests/kda/test_triton.py @@ -22,7 +22,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/lightning/test_triton.py b/test/registered/attention/unittests/lightning/test_triton.py index 1fddcde79..961014bb1 100644 --- a/test/registered/attention/unittests/lightning/test_triton.py +++ b/test/registered/attention/unittests/lightning/test_triton.py @@ -19,8 +19,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_ ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/mamba/test_mamba2.py b/test/registered/attention/unittests/mamba/test_mamba2.py index fa13775c1..e635874c2 100644 --- a/test/registered/attention/unittests/mamba/test_mamba2.py +++ b/test/registered/attention/unittests/mamba/test_mamba2.py @@ -32,8 +32,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_ ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/mamba/test_replay_state_indices_validator.py b/test/registered/attention/unittests/mamba/test_replay_state_indices_validator.py index 30d679d22..b2f734e25 100644 --- a/test/registered/attention/unittests/mamba/test_replay_state_indices_validator.py +++ b/test/registered/attention/unittests/mamba/test_replay_state_indices_validator.py @@ -7,7 +7,7 @@ from sglang.srt.layers.attention.mamba.replay_state_indices_validator import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") class TestReplayStateIndicesValidator(unittest.TestCase): diff --git a/test/registered/attention/unittests/mla/test_cutlass_mla.py b/test/registered/attention/unittests/mla/test_cutlass_mla.py index 644f3234c..7587be457 100644 --- a/test/registered/attention/unittests/mla/test_cutlass_mla.py +++ b/test/registered/attention/unittests/mla/test_cutlass_mla.py @@ -42,8 +42,8 @@ _SUPPORTED, _SKIP_REASON = _supported() from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not _SUPPORTED, _SKIP_REASON) diff --git a/test/registered/attention/unittests/mla/test_flashinfer.py b/test/registered/attention/unittests/mla/test_flashinfer.py index 36d6e3baa..7005ebbf4 100644 --- a/test/registered/attention/unittests/mla/test_flashinfer.py +++ b/test/registered/attention/unittests/mla/test_flashinfer.py @@ -32,8 +32,8 @@ MLA_SHAPE_KWARGS = dict( from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/mla/test_flashmla.py b/test/registered/attention/unittests/mla/test_flashmla.py index c45e54032..2e63fc781 100644 --- a/test/registered/attention/unittests/mla/test_flashmla.py +++ b/test/registered/attention/unittests/mla/test_flashmla.py @@ -58,8 +58,8 @@ _DECODE_SKIP_REASON = ( from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/mla/test_tokenspeed_mla.py b/test/registered/attention/unittests/mla/test_tokenspeed_mla.py index a266d7b1c..5ba21ab87 100644 --- a/test/registered/attention/unittests/mla/test_tokenspeed_mla.py +++ b/test/registered/attention/unittests/mla/test_tokenspeed_mla.py @@ -55,8 +55,8 @@ MLA_SHAPE_KWARGS = dict( from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not _SUPPORTED, _SKIP_REASON) diff --git a/test/registered/attention/unittests/mla/test_triton.py b/test/registered/attention/unittests/mla/test_triton.py index eba285458..5c8956506 100644 --- a/test/registered/attention/unittests/mla/test_triton.py +++ b/test/registered/attention/unittests/mla/test_triton.py @@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=25, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/mla/test_trtllm_mla.py b/test/registered/attention/unittests/mla/test_trtllm_mla.py index bc8fed67e..afb20f068 100644 --- a/test/registered/attention/unittests/mla/test_trtllm_mla.py +++ b/test/registered/attention/unittests/mla/test_trtllm_mla.py @@ -42,8 +42,8 @@ _SUPPORTED, _SKIP_REASON = _supported() from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not _SUPPORTED, _SKIP_REASON) diff --git a/test/registered/attention/unittests/swa/test_flashinfer.py b/test/registered/attention/unittests/swa/test_flashinfer.py index 3f9b1ccbe..23496cf5f 100644 --- a/test/registered/attention/unittests/swa/test_flashinfer.py +++ b/test/registered/attention/unittests/swa/test_flashinfer.py @@ -24,8 +24,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf( diff --git a/test/registered/attention/unittests/swa/test_swa_out_cache_loc.py b/test/registered/attention/unittests/swa/test_swa_out_cache_loc.py index 772144a00..0d0317c5a 100644 --- a/test/registered/attention/unittests/swa/test_swa_out_cache_loc.py +++ b/test/registered/attention/unittests/swa/test_swa_out_cache_loc.py @@ -24,7 +24,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestSWAKVPoolSetKVBuffer(CustomTestCase): diff --git a/test/registered/attention/unittests/swa/test_torch_native.py b/test/registered/attention/unittests/swa/test_torch_native.py index 36f30eefa..f98a62100 100644 --- a/test/registered/attention/unittests/swa/test_torch_native.py +++ b/test/registered/attention/unittests/swa/test_torch_native.py @@ -12,8 +12,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/swa/test_triton.py b/test/registered/attention/unittests/swa/test_triton.py index f90d5b2fd..aeeb84c08 100644 --- a/test/registered/attention/unittests/swa/test_triton.py +++ b/test/registered/attention/unittests/swa/test_triton.py @@ -23,8 +23,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/backends/test_deepseek_v3_fp4_cutedsl_moe.py b/test/registered/backends/test_deepseek_v3_fp4_cutedsl_moe.py index 30f1e5c88..2da591e07 100644 --- a/test/registered/backends/test_deepseek_v3_fp4_cutedsl_moe.py +++ b/test/registered/backends/test_deepseek_v3_fp4_cutedsl_moe.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=900, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=243, stage="extra-b", runner_config="4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" SERVER_LAUNCH_TIMEOUT = 1000 diff --git a/test/registered/backends/test_flashinfer_fusion_preflight.py b/test/registered/backends/test_flashinfer_fusion_preflight.py index a0636a9cf..f99b931c3 100644 --- a/test/registered/backends/test_flashinfer_fusion_preflight.py +++ b/test/registered/backends/test_flashinfer_fusion_preflight.py @@ -11,7 +11,7 @@ from sglang.srt.utils import get_cuda_driver_bindings, is_flashinfer_available from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=28, stage="base-b", runner_config="2-gpu-large") WORLD_SIZE = 2 diff --git a/test/registered/backends/test_torch_compile.py b/test/registered/backends/test_torch_compile.py index 550f5cdd5..76e724522 100644 --- a/test/registered/backends/test_torch_compile.py +++ b/test/registered/backends/test_torch_compile.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=126, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=139, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/bench_fn/test_bench_serving_reasoning_stream.py b/test/registered/bench_fn/test_bench_serving_reasoning_stream.py index 1c46a913a..a4c4096d3 100644 --- a/test/registered/bench_fn/test_bench_serving_reasoning_stream.py +++ b/test/registered/bench_fn/test_bench_serving_reasoning_stream.py @@ -26,7 +26,7 @@ from sglang.benchmark.serving import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=16, suite="base-a-test-cpu") def _free_port() -> int: diff --git a/test/registered/bench_fn/test_benchmark_datasets_api.py b/test/registered/bench_fn/test_benchmark_datasets_api.py index 2fc659aaf..8cf03b505 100644 --- a/test/registered/bench_fn/test_benchmark_datasets_api.py +++ b/test/registered/bench_fn/test_benchmark_datasets_api.py @@ -60,7 +60,7 @@ from sglang.benchmark.serving import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=38, suite="base-a-test-cpu") register_cpu_ci(est_time=46, suite="stage-b-test-cpu-intel") diff --git a/test/registered/bench_fn/test_steady_state_benchmark.py b/test/registered/bench_fn/test_steady_state_benchmark.py index 534e34221..fe02fa1dd 100644 --- a/test/registered/bench_fn/test_steady_state_benchmark.py +++ b/test/registered/bench_fn/test_steady_state_benchmark.py @@ -13,7 +13,7 @@ from sglang.benchmark.steady_state import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _StringTokenizer: diff --git a/test/registered/chunked_prefill/test_mm_chunked_embedding_unit.py b/test/registered/chunked_prefill/test_mm_chunked_embedding_unit.py index b7245479e..593b705be 100644 --- a/test/registered/chunked_prefill/test_mm_chunked_embedding_unit.py +++ b/test/registered/chunked_prefill/test_mm_chunked_embedding_unit.py @@ -20,7 +20,7 @@ from sglang.srt.managers.schedule_batch import Modality, MultimodalDataItem from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") @pytest.fixture(autouse=True) diff --git a/test/registered/chunked_prefill/test_scripted_core_1gpu.py b/test/registered/chunked_prefill/test_scripted_core_1gpu.py index 4929b858c..e37010d75 100644 --- a/test/registered/chunked_prefill/test_scripted_core_1gpu.py +++ b/test/registered/chunked_prefill/test_scripted_core_1gpu.py @@ -10,7 +10,7 @@ from sglang.test.scripted_runtime_chunked_helpers import ( run_until_finished, ) -register_cuda_ci(est_time=300, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=106, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=198, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/chunked_prefill/test_scripted_core_4gpu.py b/test/registered/chunked_prefill/test_scripted_core_4gpu.py index 559962cd9..ff3f021db 100644 --- a/test/registered/chunked_prefill/test_scripted_core_4gpu.py +++ b/test/registered/chunked_prefill/test_scripted_core_4gpu.py @@ -11,7 +11,7 @@ from sglang.test.scripted_runtime_chunked_helpers import ( run_until_finished, ) -register_cuda_ci(est_time=900, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=55, stage="extra-b", runner_config="4-gpu-h100") _CHUNK_SIZE = 64 diff --git a/test/registered/chunked_prefill/test_scripted_swa_1gpu.py b/test/registered/chunked_prefill/test_scripted_swa_1gpu.py index 3a7468260..7937f4a15 100644 --- a/test/registered/chunked_prefill/test_scripted_swa_1gpu.py +++ b/test/registered/chunked_prefill/test_scripted_swa_1gpu.py @@ -5,7 +5,7 @@ from sglang.test.scripted_runtime.context import ScriptedContext from sglang.test.scripted_runtime.test_case import ScriptedTestCase from sglang.test.scripted_runtime_chunked_helpers import base_engine_kwargs -register_cuda_ci(est_time=400, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=130, stage="extra-a", runner_config="1-gpu-large") _SWA_MODEL = "openai/gpt-oss-20b" diff --git a/test/registered/constrained_decoding/test_constrained_decoding.py b/test/registered/constrained_decoding/test_constrained_decoding.py index 8d967fb14..3de939bcf 100644 --- a/test/registered/constrained_decoding/test_constrained_decoding.py +++ b/test/registered/constrained_decoding/test_constrained_decoding.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=135, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=161, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=220, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_basic_sanity.py b/test/registered/core/test_basic_sanity.py index d223eb97e..893dab228 100644 --- a/test/registered/core/test_basic_sanity.py +++ b/test/registered/core/test_basic_sanity.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=160, stage="base-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=97, stage="base-a", runner_config="1-gpu-small") register_amd_ci(est_time=160, suite="stage-a-test-1-gpu-small-amd") diff --git a/test/registered/core/test_basic_sanity_dflash.py b/test/registered/core/test_basic_sanity_dflash.py index 2bb03feb7..d220752a4 100644 --- a/test/registered/core/test_basic_sanity_dflash.py +++ b/test/registered/core/test_basic_sanity_dflash.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=200, stage="base-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=135, stage="base-a", runner_config="1-gpu-small") class TestBasicSanityDFlash( diff --git a/test/registered/core/test_basic_sanity_dspark.py b/test/registered/core/test_basic_sanity_dspark.py index 0b07364b7..4cc8f79c5 100644 --- a/test/registered/core/test_basic_sanity_dspark.py +++ b/test/registered/core/test_basic_sanity_dspark.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=180, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=97, stage="base-b", runner_config="1-gpu-large") TARGET_MODEL = "Qwen/Qwen3-14B" DRAFT_MODEL = "deepseek-ai/dspark_qwen3_14b_block7" diff --git a/test/registered/core/test_basic_sanity_eagle3.py b/test/registered/core/test_basic_sanity_eagle3.py index fc2c99c60..efe2f05e7 100644 --- a/test/registered/core/test_basic_sanity_eagle3.py +++ b/test/registered/core/test_basic_sanity_eagle3.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=200, stage="base-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=167, stage="base-a", runner_config="1-gpu-small") register_amd_ci(est_time=200, suite="stage-a-test-1-gpu-small-amd") diff --git a/test/registered/core/test_engine_child_pids.py b/test/registered/core/test_engine_child_pids.py index 16de9fe90..288a2fea9 100644 --- a/test/registered/core/test_engine_child_pids.py +++ b/test/registered/core/test_engine_child_pids.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=77, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=38, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=77, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_hidden_states.py b/test/registered/core/test_hidden_states.py index b6bbbb592..86d2a047f 100644 --- a/test/registered/core/test_hidden_states.py +++ b/test/registered/core/test_hidden_states.py @@ -8,7 +8,7 @@ from sglang.srt.utils import get_device, is_hip from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase -register_cuda_ci(est_time=45, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=32, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=55, suite="stage-b-test-1-gpu-small-amd") _is_hip = is_hip() diff --git a/test/registered/core/test_no_extra_forked_cuda_context.py b/test/registered/core/test_no_extra_forked_cuda_context.py index 064fcb0f0..21eafda78 100644 --- a/test/registered/core/test_no_extra_forked_cuda_context.py +++ b/test/registered/core/test_no_extra_forked_cuda_context.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=120, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=54, stage="base-b", runner_config="2-gpu-large") class TestTPServerGPUProcesses(CustomTestCase): diff --git a/test/registered/core/test_request_queue_validation.py b/test/registered/core/test_request_queue_validation.py index 3bc9841b9..65fa4bc91 100644 --- a/test/registered/core/test_request_queue_validation.py +++ b/test/registered/core/test_request_queue_validation.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( send_generate_requests, ) -register_cuda_ci(est_time=53, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=65, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=70, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_srt_empty_deps.py b/test/registered/core/test_srt_empty_deps.py index 3daeb4e28..192a8b7d9 100644 --- a/test/registered/core/test_srt_empty_deps.py +++ b/test/registered/core/test_srt_empty_deps.py @@ -12,7 +12,7 @@ import pytest from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") # Packages known to transitively depend on torch or triton. # If a new package is added to runtime_base and it pulls torch, diff --git a/test/registered/core/test_srt_endpoint.py b/test/registered/core/test_srt_endpoint.py index bb82925ce..d43465e75 100644 --- a/test/registered/core/test_srt_endpoint.py +++ b/test/registered/core/test_srt_endpoint.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import ( run_logprob_check, ) -register_cuda_ci(est_time=260, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=265, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=260, suite="stage-b-test-1-gpu-small-amd") SERVER_ENV = {"SGLANG_USE_PICKLE_IPC": "0"} diff --git a/test/registered/core/test_srt_engine.py b/test/registered/core/test_srt_engine.py index a142420bf..1559ad0e1 100644 --- a/test/registered/core/test_srt_engine.py +++ b/test/registered/core/test_srt_engine.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=387, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=276, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=261, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/cp/test_cp_strategy_unit.py b/test/registered/cp/test_cp_strategy_unit.py index 321f81f1f..cd41f9367 100644 --- a/test/registered/cp/test_cp_strategy_unit.py +++ b/test/registered/cp/test_cp_strategy_unit.py @@ -42,7 +42,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _ExtendMode: diff --git a/test/registered/cp/test_deepseek_v3_cp_single_node.py b/test/registered/cp/test_deepseek_v3_cp_single_node.py index 2faa11005..f6259096a 100644 --- a/test/registered/cp/test_deepseek_v3_cp_single_node.py +++ b/test/registered/cp/test_deepseek_v3_cp_single_node.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=500, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=275, stage="extra-b", runner_config="8-gpu-h200") DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324" diff --git a/test/registered/cp/test_deepseek_v4_flash_fp4_b200_cp.py b/test/registered/cp/test_deepseek_v4_flash_fp4_b200_cp.py index c618e0d31..d30d00678 100644 --- a/test/registered/cp/test_deepseek_v4_flash_fp4_b200_cp.py +++ b/test/registered/cp/test_deepseek_v4_flash_fp4_b200_cp.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=235, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=689, stage="extra-b", runner_config="4-gpu-b200") MODEL = "deepseek-ai/DeepSeek-V4-Flash" SERVER_LAUNCH_TIMEOUT = 3600 diff --git a/test/registered/cp/test_dsa_prefill_cp.py b/test/registered/cp/test_dsa_prefill_cp.py index 1aff2df21..9dace61a8 100644 --- a/test/registered/cp/test_dsa_prefill_cp.py +++ b/test/registered/cp/test_dsa_prefill_cp.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=320, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=314, stage="extra-b", runner_config="8-gpu-h200") GLM52_MODEL_PATH = "zai-org/GLM-5.2-FP8" SERVER_LAUNCH_TIMEOUT = max(DEFAULT_TIMEOUT_FOR_SERVER_LAUNCH, 1800) diff --git a/test/registered/cp/test_gpt_oss_4gpu_mxfp4_cp.py b/test/registered/cp/test_gpt_oss_4gpu_mxfp4_cp.py index 62f22880a..6039ed3a3 100644 --- a/test/registered/cp/test_gpt_oss_4gpu_mxfp4_cp.py +++ b/test/registered/cp/test_gpt_oss_4gpu_mxfp4_cp.py @@ -3,7 +3,7 @@ import unittest from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=220, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=121, stage="extra-b", runner_config="4-gpu-b200") class TestGptOss4GpuMxfp4CP(BaseTestGptOss): diff --git a/test/registered/cp/test_gqa_prefill_cp.py b/test/registered/cp/test_gqa_prefill_cp.py index a1570fadb..fafa40e29 100644 --- a/test/registered/cp/test_gqa_prefill_cp.py +++ b/test/registered/cp/test_gqa_prefill_cp.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=500, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=466, stage="extra-b", runner_config="4-gpu-h100") GQA_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8" diff --git a/test/registered/cuda_graph/breakable/test_bcg_with_lora.py b/test/registered/cuda_graph/breakable/test_bcg_with_lora.py index 370d04c0c..bbf70e6ed 100644 --- a/test/registered/cuda_graph/breakable/test_bcg_with_lora.py +++ b/test/registered/cuda_graph/breakable/test_bcg_with_lora.py @@ -26,7 +26,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=480, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=178, stage="base-b", runner_config="1-gpu-large") BASE_MODEL = "Qwen/Qwen3-4B" LORA_ADAPTER = "nissenj/Qwen3-4B-lora-v2" diff --git a/test/registered/cuda_graph/breakable/test_bcg_with_speculative_decoding.py b/test/registered/cuda_graph/breakable/test_bcg_with_speculative_decoding.py index faa760373..b67bc159a 100644 --- a/test/registered/cuda_graph/breakable/test_bcg_with_speculative_decoding.py +++ b/test/registered/cuda_graph/breakable/test_bcg_with_speculative_decoding.py @@ -12,7 +12,7 @@ import unittest from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.server_fixtures.pcg_spec_fixture import PCGSpecBase -register_cuda_ci(est_time=531, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=106, stage="base-b", runner_config="2-gpu-large") class TestBCGWithEAGLE3(PCGSpecBase, unittest.TestCase): diff --git a/test/registered/cuda_graph/breakable/test_breakable_cuda_graph.py b/test/registered/cuda_graph/breakable/test_breakable_cuda_graph.py index 6832403e4..d669c9570 100644 --- a/test/registered/cuda_graph/breakable/test_breakable_cuda_graph.py +++ b/test/registered/cuda_graph/breakable/test_breakable_cuda_graph.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( ) # CI Registration — large suite to fit the integration test's server startup. -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=200, suite="stage-c-test-large-8-gpu-amd-mi35x") diff --git a/test/registered/cuda_graph/full_prefill/test_full_cuda_graph_prefill.py b/test/registered/cuda_graph/full_prefill/test_full_cuda_graph_prefill.py index 2529f940b..c6fb04c79 100644 --- a/test/registered/cuda_graph/full_prefill/test_full_cuda_graph_prefill.py +++ b/test/registered/cuda_graph/full_prefill/test_full_cuda_graph_prefill.py @@ -33,7 +33,7 @@ from sglang.test.test_utils import ( # OSS FA4 coverage requires Blackwell. The PP test uses two GPUs; the other # tests use one GPU. -register_cuda_ci(est_time=300, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=251, stage="base-b", runner_config="4-gpu-b200") def _prefill_graph_count(base_url: str) -> float: diff --git a/test/registered/cuda_graph/test_cuda_piecewise_backend.py b/test/registered/cuda_graph/test_cuda_piecewise_backend.py index a7a80e3d8..7efb5f78d 100644 --- a/test/registered/cuda_graph/test_cuda_piecewise_backend.py +++ b/test/registered/cuda_graph/test_cuda_piecewise_backend.py @@ -5,7 +5,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") if not torch.cuda.is_available(): pytest.skip("CUDA piecewise backend requires CUDA", allow_module_level=True) diff --git a/test/registered/dcp/test_dcp_layout_unit.py b/test/registered/dcp/test_dcp_layout_unit.py index a4b277412..a98ad8325 100644 --- a/test/registered/dcp/test_dcp_layout_unit.py +++ b/test/registered/dcp/test_dcp_layout_unit.py @@ -33,7 +33,7 @@ from sglang.srt.mem_cache.memory_pool import HybridLinearKVPool from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") DCP_SIZES = [1, 2, 3, 4, 8] LENS = list(range(0, 41)) diff --git a/test/registered/dcp/test_dsv31_dcp8_gsm8k.py b/test/registered/dcp/test_dsv31_dcp8_gsm8k.py index addb570de..e147fdce4 100644 --- a/test/registered/dcp/test_dsv31_dcp8_gsm8k.py +++ b/test/registered/dcp/test_dsv31_dcp8_gsm8k.py @@ -55,7 +55,7 @@ from sglang.test.test_utils import ( # --------------------------------------------------------------------------- # CI registration — only TestDSV31DCP8TP8GSM8K runs in CI # --------------------------------------------------------------------------- -register_cuda_ci(est_time=600, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=213, stage="extra-b", runner_config="8-gpu-h200") DEEPSEEK_V31_MODEL_PATH = "deepseek-ai/DeepSeek-V3.1" diff --git a/test/registered/dcp/test_kimi_linear_dcp4.py b/test/registered/dcp/test_kimi_linear_dcp4.py index 227757292..a565553b2 100644 --- a/test/registered/dcp/test_kimi_linear_dcp4.py +++ b/test/registered/dcp/test_kimi_linear_dcp4.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=240, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=105, stage="extra-b", runner_config="4-gpu-b200") KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct" CUDA_GRAPH_MAX_BS_DECODE = 256 diff --git a/test/registered/dcp/test_kimi_linear_dcp_dspark4.py b/test/registered/dcp/test_kimi_linear_dcp_dspark4.py index f09f22d0e..49e9f448b 100644 --- a/test/registered/dcp/test_kimi_linear_dcp_dspark4.py +++ b/test/registered/dcp/test_kimi_linear_dcp_dspark4.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=350, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=201, stage="extra-b", runner_config="4-gpu-b200") KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct" GSM8K_SCORE_THRESHOLD = 0.88 diff --git a/test/registered/dcp/test_trtllm_mla_family_dcp_metadata.py b/test/registered/dcp/test_trtllm_mla_family_dcp_metadata.py index 2377f87d0..252c4dad8 100644 --- a/test/registered/dcp/test_trtllm_mla_family_dcp_metadata.py +++ b/test/registered/dcp/test_trtllm_mla_family_dcp_metadata.py @@ -23,7 +23,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") NUM_DRAFT_TOKENS = 8 DCP_SIZE = 4 diff --git a/test/registered/disaggregation/test_disaggregation_aarch64.py b/test/registered/disaggregation/test_disaggregation_aarch64.py index 2287da77c..18ad5b344 100644 --- a/test/registered/disaggregation/test_disaggregation_aarch64.py +++ b/test/registered/disaggregation/test_disaggregation_aarch64.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( QWEN3_8B_MODEL_PATH = "Qwen/Qwen3-8B" -register_cuda_ci(est_time=300, stage="base-c", runner_config="4-gpu-gb300") +register_cuda_ci(est_time=125, stage="base-c", runner_config="4-gpu-gb300") # Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner. NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 120 diff --git a/test/registered/disaggregation/test_disaggregation_basic.py b/test/registered/disaggregation/test_disaggregation_basic.py index c06476970..706225025 100644 --- a/test/registered/disaggregation/test_disaggregation_basic.py +++ b/test/registered/disaggregation/test_disaggregation_basic.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( DEFAULT_TARGET_MODEL_EAGLE3, ) -register_cuda_ci(est_time=730, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=1007, stage="base-b", runner_config="2-gpu-large") class TestDisaggregationAccuracy(PauseResumeInPlaceMixin, PDDisaggregationServerBase): diff --git a/test/registered/disaggregation/test_disaggregation_decode_radix_cache.py b/test/registered/disaggregation/test_disaggregation_decode_radix_cache.py index 6c5f4ca05..dc20b4a46 100644 --- a/test/registered/disaggregation/test_disaggregation_decode_radix_cache.py +++ b/test/registered/disaggregation/test_disaggregation_decode_radix_cache.py @@ -26,7 +26,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=300, stage="base-c", runner_config="8-gpu-h20") +register_cuda_ci(est_time=509, stage="base-c", runner_config="8-gpu-h20") def _has_nixl(): diff --git a/test/registered/disaggregation/test_disaggregation_decode_radix_cache_swa.py b/test/registered/disaggregation/test_disaggregation_decode_radix_cache_swa.py index 61e4d9891..bc38cac44 100644 --- a/test/registered/disaggregation/test_disaggregation_decode_radix_cache_swa.py +++ b/test/registered/disaggregation/test_disaggregation_decode_radix_cache_swa.py @@ -18,7 +18,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( ) from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST_MXFP4_WITH_MOE, is_in_ci -register_cuda_ci(est_time=600, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=365, stage="extra-b", runner_config="8-gpu-h200") SWA_SERVER_ARGS = ["--page-size", "64", "--attention-backend", "triton"] diff --git a/test/registered/disaggregation/test_disaggregation_different_tp.py b/test/registered/disaggregation/test_disaggregation_different_tp.py index 2849c3c50..add3c6a1d 100644 --- a/test/registered/disaggregation/test_disaggregation_different_tp.py +++ b/test/registered/disaggregation/test_disaggregation_different_tp.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=375, stage="base-c", runner_config="8-gpu-h20") +register_cuda_ci(est_time=1171, stage="base-c", runner_config="8-gpu-h20") class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase): diff --git a/test/registered/disaggregation/test_disaggregation_dp_attention.py b/test/registered/disaggregation/test_disaggregation_dp_attention.py index 7438e04f4..fcbab186f 100644 --- a/test/registered/disaggregation/test_disaggregation_dp_attention.py +++ b/test/registered/disaggregation/test_disaggregation_dp_attention.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=443, stage="base-c", runner_config="8-gpu-h20") +register_cuda_ci(est_time=191, stage="base-c", runner_config="8-gpu-h20") class TestDisaggregationDPAttention(PDDisaggregationServerBase): diff --git a/test/registered/disaggregation/test_disaggregation_dsv4.py b/test/registered/disaggregation/test_disaggregation_dsv4.py index e930eac41..c4a3b6bff 100644 --- a/test/registered/disaggregation/test_disaggregation_dsv4.py +++ b/test/registered/disaggregation/test_disaggregation_dsv4.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=500, stage="base-c", runner_config="8-gpu-h200") +register_cuda_ci(est_time=184, stage="base-c", runner_config="8-gpu-h200") DSV4_FLASH_MODEL = "sgl-project/DeepSeek-V4-Flash-FP8" diff --git a/test/registered/disaggregation/test_disaggregation_dwdp_gpt_oss.py b/test/registered/disaggregation/test_disaggregation_dwdp_gpt_oss.py index d11b738df..dfa894d02 100644 --- a/test/registered/disaggregation/test_disaggregation_dwdp_gpt_oss.py +++ b/test/registered/disaggregation/test_disaggregation_dwdp_gpt_oss.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_pd_server, ) -register_cuda_ci(est_time=600, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=170, stage="extra-b", runner_config="4-gpu-b200") GPT_OSS_MODEL_PATH = "openai/gpt-oss-120b" GSM8K_BASELINE_ACCURACY = 0.88 diff --git a/test/registered/disaggregation/test_disaggregation_hisparse.py b/test/registered/disaggregation/test_disaggregation_hisparse.py index 4560de7dd..602619a1e 100644 --- a/test/registered/disaggregation/test_disaggregation_hisparse.py +++ b/test/registered/disaggregation/test_disaggregation_hisparse.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=1000, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=212, stage="extra-b", runner_config="8-gpu-h200") DSV4_FLASH_MODEL = "sgl-project/DeepSeek-V4-Flash-FP8" DSV4_FLASH_LOADER_CONFIG = '{"enable_multithread_load": true, "num_threads": 64}' diff --git a/test/registered/disaggregation/test_disaggregation_hybrid_attention.py b/test/registered/disaggregation/test_disaggregation_hybrid_attention.py index a993f8b58..dc91c1c50 100644 --- a/test/registered/disaggregation/test_disaggregation_hybrid_attention.py +++ b/test/registered/disaggregation/test_disaggregation_hybrid_attention.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_pd_server, ) -register_cuda_ci(est_time=310, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=578, stage="extra-b", runner_config="8-gpu-h200") @unittest.skipIf(is_in_ci(), "Temporarily disable the flaky test.") diff --git a/test/registered/disaggregation/test_disaggregation_inkling_mxfp8.py b/test/registered/disaggregation/test_disaggregation_inkling_mxfp8.py index 354a7ebdb..9a2f4c555 100644 --- a/test/registered/disaggregation/test_disaggregation_inkling_mxfp8.py +++ b/test/registered/disaggregation/test_disaggregation_inkling_mxfp8.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=800, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=447, stage="extra-b", runner_config="4-gpu-b200") MODEL = os.environ.get( "INKLING_SMALL_TEST_MODEL_PATH", "thinkingmachines/Inkling-Small-NVFP4" diff --git a/test/registered/disaggregation/test_disaggregation_kimi_linear.py b/test/registered/disaggregation/test_disaggregation_kimi_linear.py index ebe3295e1..db6f37df7 100644 --- a/test/registered/disaggregation/test_disaggregation_kimi_linear.py +++ b/test/registered/disaggregation/test_disaggregation_kimi_linear.py @@ -6,7 +6,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( PDDisaggregationServerBase, ) -register_cuda_ci(est_time=480, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=259, stage="base-c", runner_config="4-gpu-h100") KIMI_LINEAR_MODEL = "yujiepan/kimi-linear-tiny-random" SERVER_ENV = {"SGLANG_BATCH_INVARIANT_OPS_ENABLE_MM_DEEPGEMM": "0"} diff --git a/test/registered/disaggregation/test_disaggregation_nixl.py b/test/registered/disaggregation/test_disaggregation_nixl.py index de43e596d..1820840a4 100644 --- a/test/registered/disaggregation/test_disaggregation_nixl.py +++ b/test/registered/disaggregation/test_disaggregation_nixl.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=700, stage="base-c", runner_config="8-gpu-h20") +register_cuda_ci(est_time=506, stage="base-c", runner_config="8-gpu-h20") # base-c 8-GPU runner is required for TP4 prefill + TP4 decode. NIXL_PREFILL_TP_SIZE = 4 diff --git a/test/registered/disaggregation/test_disaggregation_optimistic_prefill.py b/test/registered/disaggregation/test_disaggregation_optimistic_prefill.py index 58fa9b472..33194891f 100644 --- a/test/registered/disaggregation/test_disaggregation_optimistic_prefill.py +++ b/test/registered/disaggregation/test_disaggregation_optimistic_prefill.py @@ -16,7 +16,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( ) from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST -register_cuda_ci(est_time=120, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=193, stage="base-b", runner_config="2-gpu-large") FORCE_RETRY_PROB = 0.1 diff --git a/test/registered/disaggregation/test_disaggregation_pp.py b/test/registered/disaggregation/test_disaggregation_pp.py index 05d052214..cb40378c8 100644 --- a/test/registered/disaggregation/test_disaggregation_pp.py +++ b/test/registered/disaggregation/test_disaggregation_pp.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=216, stage="base-c", runner_config="8-gpu-h20") +register_cuda_ci(est_time=357, stage="base-c", runner_config="8-gpu-h20") class TestDisaggregationPrefillPPAccuracy(PDDisaggregationServerBase): diff --git a/test/registered/disaggregation/test_disaggregation_rust_server.py b/test/registered/disaggregation/test_disaggregation_rust_server.py index 86c9299b9..769a9fc79 100644 --- a/test/registered/disaggregation/test_disaggregation_rust_server.py +++ b/test/registered/disaggregation/test_disaggregation_rust_server.py @@ -27,7 +27,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( ) from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST, is_rust_server_built -register_cuda_ci(est_time=500, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=66, stage="base-b", runner_config="2-gpu-large") @unittest.skipUnless( diff --git a/test/registered/disaggregation/test_disaggregation_unified_memory.py b/test/registered/disaggregation/test_disaggregation_unified_memory.py index 3f63c1a87..78bc04b37 100644 --- a/test/registered/disaggregation/test_disaggregation_unified_memory.py +++ b/test/registered/disaggregation/test_disaggregation_unified_memory.py @@ -6,7 +6,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( PDDisaggregationServerBase, ) -register_cuda_ci(est_time=900, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=236, stage="base-b", runner_config="2-gpu-large") KIMI_LINEAR_MODEL = "yujiepan/kimi-linear-tiny-random" SERVER_ENV = {"SGLANG_BATCH_INVARIANT_OPS_ENABLE_MM_DEEPGEMM": "0"} diff --git a/test/registered/disaggregation/test_epd_disaggregation.py b/test/registered/disaggregation/test_epd_disaggregation.py index fbd4a66d7..3b0364f46 100644 --- a/test/registered/disaggregation/test_epd_disaggregation.py +++ b/test/registered/disaggregation/test_epd_disaggregation.py @@ -37,7 +37,7 @@ QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" KIMI_VL_MODEL = "moonshotai/Kimi-VL-A3B-Instruct" -register_cuda_ci(est_time=300, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=262, stage="base-c", runner_config="4-gpu-h100") @unittest.skipIf( diff --git a/test/registered/dllm/test_dllm_batching_fdfo.py b/test/registered/dllm/test_dllm_batching_fdfo.py index 5607d91be..556eae9b5 100644 --- a/test/registered/dllm/test_dllm_batching_fdfo.py +++ b/test/registered/dllm/test_dllm_batching_fdfo.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=139, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=126, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=330, suite="stage-b-test-1-gpu-small-amd") import unittest diff --git a/test/registered/dllm/test_dllm_fdfo_joint_threshold.py b/test/registered/dllm/test_dllm_fdfo_joint_threshold.py index a5671d93f..8e99b2464 100644 --- a/test/registered/dllm/test_dllm_fdfo_joint_threshold.py +++ b/test/registered/dllm/test_dllm_fdfo_joint_threshold.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=300, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=141, stage="base-b", runner_config="1-gpu-large") import unittest diff --git a/test/registered/dp_attn/test_dp_attention.py b/test/registered/dp_attn/test_dp_attention.py index 1fb2dcb66..301e03530 100644 --- a/test/registered/dp_attn/test_dp_attention.py +++ b/test/registered/dp_attn/test_dp_attention.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=420, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=443, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=500, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/dp_attn/test_dp_attention_bcg_kl.py b/test/registered/dp_attn/test_dp_attention_bcg_kl.py index b6b7978cd..0b5618746 100644 --- a/test/registered/dp_attn/test_dp_attention_bcg_kl.py +++ b/test/registered/dp_attn/test_dp_attention_bcg_kl.py @@ -28,7 +28,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=320, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=265, stage="base-b", runner_config="2-gpu-large") PREFILL_GRAPH_REPLAY_PATTERN = re.compile(r"Prefill batch.*cuda graph: True") CACHED_PREFIX_GRAPH_REPLAY_PATTERN = re.compile( diff --git a/test/registered/dp_engine/test_data_parallelism.py b/test/registered/dp_engine/test_data_parallelism.py index acf68ed27..c7b63fa3d 100644 --- a/test/registered/dp_engine/test_data_parallelism.py +++ b/test/registered/dp_engine/test_data_parallelism.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=91, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=84, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=73, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/ep/test_deepep_large.py b/test/registered/ep/test_deepep_large.py index c4bf5e959..ac7017bc5 100644 --- a/test/registered/ep/test_deepep_large.py +++ b/test/registered/ep/test_deepep_large.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=528, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=569, stage="extra-b", runner_config="8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" diff --git a/test/registered/ep/test_deepep_small.py b/test/registered/ep/test_deepep_small.py index 79dd30b78..98de51870 100644 --- a/test/registered/ep/test_deepep_small.py +++ b/test/registered/ep/test_deepep_small.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=270, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=407, stage="base-c", runner_config="4-gpu-h100") class TestPureDP(CustomTestCase): diff --git a/test/registered/ep/test_deepep_small_extra.py b/test/registered/ep/test_deepep_small_extra.py index 763f620eb..a3ffe2332 100644 --- a/test/registered/ep/test_deepep_small_extra.py +++ b/test/registered/ep/test_deepep_small_extra.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=210, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=283, stage="extra-b", runner_config="4-gpu-h100") class TestHybridDPTP(CustomTestCase): diff --git a/test/registered/ep/test_flashinfer_a2a.py b/test/registered/ep/test_flashinfer_a2a.py index 352f416bc..d95ed6615 100644 --- a/test/registered/ep/test_flashinfer_a2a.py +++ b/test/registered/ep/test_flashinfer_a2a.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=500, stage="base-c", runner_config="4-gpu-gb300") +register_cuda_ci(est_time=561, stage="base-c", runner_config="4-gpu-gb300") # Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner. NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 110 diff --git a/test/registered/ep/test_routed_experts_dp_readback.py b/test/registered/ep/test_routed_experts_dp_readback.py index cb21cc7bb..e32403b65 100644 --- a/test/registered/ep/test_routed_experts_dp_readback.py +++ b/test/registered/ep/test_routed_experts_dp_readback.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=900, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=72, stage="base-c", runner_config="4-gpu-h100") _MODEL = os.environ.get("SGLANG_ROUTED_EXPERTS_TEST_MODEL", "deepseek-ai/DeepSeek-V3") _NUM_EXPERTS = 24 diff --git a/test/registered/ep/test_tbo_shared_experts_fusion.py b/test/registered/ep/test_tbo_shared_experts_fusion.py index 088106976..6fa7d4e10 100644 --- a/test/registered/ep/test_tbo_shared_experts_fusion.py +++ b/test/registered/ep/test_tbo_shared_experts_fusion.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=900, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=253, stage="extra-b", runner_config="8-gpu-h200") DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324" diff --git a/test/registered/eplb/test_lplb_distributed.py b/test/registered/eplb/test_lplb_distributed.py index 444a61a50..06037297c 100644 --- a/test/registered/eplb/test_lplb_distributed.py +++ b/test/registered/eplb/test_lplb_distributed.py @@ -39,7 +39,7 @@ from sglang.srt.distributed.parallel_state import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=120, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=18, stage="base-b", runner_config="2-gpu-large") NUM_GPUS = 2 TOPK = 2 diff --git a/test/registered/expert_pack/test_expert_pack_mxfp4.py b/test/registered/expert_pack/test_expert_pack_mxfp4.py index 8018b32b3..ea6311ee4 100644 --- a/test/registered/expert_pack/test_expert_pack_mxfp4.py +++ b/test/registered/expert_pack/test_expert_pack_mxfp4.py @@ -11,7 +11,7 @@ from sglang.kernels.ops.moe.expert_pack_mxfp4 import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-small") _FP4_VALUES = ( diff --git a/test/registered/expert_pack/test_expert_pack_runtime.py b/test/registered/expert_pack/test_expert_pack_runtime.py index e5da27b44..e611f70c5 100644 --- a/test/registered/expert_pack/test_expert_pack_runtime.py +++ b/test/registered/expert_pack/test_expert_pack_runtime.py @@ -13,7 +13,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") from sglang.srt.layers.moe.expert_pack import ( # noqa: E402 ExpertPackStore, diff --git a/test/registered/expert_pack/test_kimi_k3_gguf.py b/test/registered/expert_pack/test_kimi_k3_gguf.py index ccdcf094f..def8f2e09 100644 --- a/test/registered/expert_pack/test_kimi_k3_gguf.py +++ b/test/registered/expert_pack/test_kimi_k3_gguf.py @@ -20,7 +20,7 @@ from sglang.srt.model_loader.kimi_k3_gguf import ( from sglang.srt.models.kimi_k3 import _uses_split_gguf_kv_b from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestKimiK3GGUFMapping(unittest.TestCase): diff --git a/test/registered/function_call/test_kimik3_detector.py b/test/registered/function_call/test_kimik3_detector.py index 704237b2d..478dcc3ca 100644 --- a/test/registered/function_call/test_kimik3_detector.py +++ b/test/registered/function_call/test_kimik3_detector.py @@ -16,7 +16,7 @@ from sglang.srt.function_call.kimik3_format import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _make_tool(name: str) -> Tool: diff --git a/test/registered/gemm/test_hopper_bf16_gemv.py b/test/registered/gemm/test_hopper_bf16_gemv.py index 9e85c4c1e..914c59028 100644 --- a/test/registered/gemm/test_hopper_bf16_gemv.py +++ b/test/registered/gemm/test_hopper_bf16_gemv.py @@ -9,7 +9,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-large") def _is_sm90() -> bool: diff --git a/test/registered/gemm/test_linear_bf16_fp32_hpc.py b/test/registered/gemm/test_linear_bf16_fp32_hpc.py index 7034a45ff..df49c93f2 100644 --- a/test/registered/gemm/test_linear_bf16_fp32_hpc.py +++ b/test/registered/gemm/test_linear_bf16_fp32_hpc.py @@ -20,7 +20,7 @@ from sglang.kernels.ops.attention.dsv4.gemm import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large") # (hidden_size, n_routed_experts + zero experts) for LongCat-Flash Chat / Lite. _ROUTER_SHAPES = ((6144, 768), (3072, 384)) diff --git a/test/registered/hicache/test_hicache_spec_file_storage.py b/test/registered/hicache/test_hicache_spec_file_storage.py index b05a63184..5a38f42c5 100644 --- a/test/registered/hicache/test_hicache_spec_file_storage.py +++ b/test/registered/hicache/test_hicache_spec_file_storage.py @@ -17,7 +17,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.hicache_spec_storage_common import HiCacheSpecStorageMixin from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=200, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=142, stage="extra-a", runner_config="1-gpu-large") @unittest.skipIf(is_hip(), "HiCache + EAGLE3 file-storage loadback e2e is CUDA-only.") diff --git a/test/registered/hicache/test_hicache_spec_mooncake_storage.py b/test/registered/hicache/test_hicache_spec_mooncake_storage.py index 3de31cd9c..721b5b1ec 100644 --- a/test/registered/hicache/test_hicache_spec_mooncake_storage.py +++ b/test/registered/hicache/test_hicache_spec_mooncake_storage.py @@ -29,7 +29,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.hicache_spec_storage_common import HiCacheSpecStorageMixin from sglang.test.test_utils import CustomTestCase, find_available_port -register_cuda_ci(est_time=240, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=186, stage="extra-a", runner_config="2-gpu-large") @unittest.skipIf( diff --git a/test/registered/hicache/test_hicache_storage.py b/test/registered/hicache/test_hicache_storage.py index 5f5e622cc..76afd3b1a 100644 --- a/test/registered/hicache/test_hicache_storage.py +++ b/test/registered/hicache/test_hicache_storage.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=99, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=242, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=300, suite="stage-b-test-1-gpu-small-amd") import time diff --git a/test/registered/hicache/test_hicache_storage_3fs_backend.py b/test/registered/hicache/test_hicache_storage_3fs_backend.py index 8f1c49384..89afd7497 100644 --- a/test/registered/hicache/test_hicache_storage_3fs_backend.py +++ b/test/registered/hicache/test_hicache_storage_3fs_backend.py @@ -13,7 +13,7 @@ from test_hicache_storage_file_backend import HiCacheStorageBaseMixin from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=300, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=210, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=300, suite="base-b-test-2-gpu-large") diff --git a/test/registered/hicache/test_hicache_storage_file_backend.py b/test/registered/hicache/test_hicache_storage_file_backend.py index 37860a1cb..c7051c3cf 100644 --- a/test/registered/hicache/test_hicache_storage_file_backend.py +++ b/test/registered/hicache/test_hicache_storage_file_backend.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import wait_for_http_ready -register_cuda_ci(est_time=148, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=191, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=526, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/hicache/test_hicache_storage_mooncake_backend.py b/test/registered/hicache/test_hicache_storage_mooncake_backend.py index d3fa80654..68ee795d1 100644 --- a/test/registered/hicache/test_hicache_storage_mooncake_backend.py +++ b/test/registered/hicache/test_hicache_storage_mooncake_backend.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( is_in_ci, ) -register_cuda_ci(est_time=236, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=391, stage="base-b", runner_config="2-gpu-large") class HiCacheStorageMooncakeBackendBaseMixin(HiCacheStorageBaseMixin): diff --git a/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py b/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py index 6e8d74043..feca2eba4 100644 --- a/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py +++ b/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py @@ -28,7 +28,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import wait_for_http_ready -register_cuda_ci(est_time=210, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=308, stage="base-b", runner_config="2-gpu-large") class TestHiCacheStorageRuntimeAttachDetach(CustomTestCase): diff --git a/test/registered/hicache/test_hicache_variants.py b/test/registered/hicache/test_hicache_variants.py index 5dac5764f..a80a82e4c 100644 --- a/test/registered/hicache/test_hicache_variants.py +++ b/test/registered/hicache/test_hicache_variants.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=450, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=534, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=524, suite="stage-b-test-1-gpu-small-amd") """ Consolidated HiCache variant tests. diff --git a/test/registered/hicache/test_pp_with_hicache.py b/test/registered/hicache/test_pp_with_hicache.py index 3c69b3759..5b03c3d70 100644 --- a/test/registered/hicache/test_pp_with_hicache.py +++ b/test/registered/hicache/test_pp_with_hicache.py @@ -5,7 +5,7 @@ python3 -m unittest test_pp_with_hicache.TestPPWithHiCache.test_eval_accuracy from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=60, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=138, stage="base-c", runner_config="4-gpu-h100") import os import subprocess diff --git a/test/registered/hicache/test_qwen35_hicache.py b/test/registered/hicache/test_qwen35_hicache.py index 1a912af5e..4e6e6f8b9 100644 --- a/test/registered/hicache/test_qwen35_hicache.py +++ b/test/registered/hicache/test_qwen35_hicache.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=540, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=369, stage="extra-b", runner_config="4-gpu-h100") QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" ACC_THRESHOLDS = {QWEN35_27B_MODEL: {"gsm8k": 0.8}} diff --git a/test/registered/input_embedding/test_input_embeddings.py b/test/registered/input_embedding/test_input_embeddings.py index 616d5ea68..de904880c 100644 --- a/test/registered/input_embedding/test_input_embeddings.py +++ b/test/registered/input_embedding/test_input_embeddings.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=42, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=53, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=38, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=58, suite="stage-b-test-cpu-intel") diff --git a/test/registered/input_embedding/test_input_embeds_chunked.py b/test/registered/input_embedding/test_input_embeds_chunked.py index bdab8c8fa..c45443db1 100644 --- a/test/registered/input_embedding/test_input_embeds_chunked.py +++ b/test/registered/input_embedding/test_input_embeds_chunked.py @@ -34,7 +34,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=43, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=54, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=43, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=54, suite="stage-b-test-cpu-intel") diff --git a/test/registered/kernels/ops/attention/test_dsa_indexer.py b/test/registered/kernels/ops/attention/test_dsa_indexer.py index 6d966922d..f02846869 100644 --- a/test/registered/kernels/ops/attention/test_dsa_indexer.py +++ b/test/registered/kernels/ops/attention/test_dsa_indexer.py @@ -34,7 +34,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardBatch, ForwardMo from sglang.srt.server_args import ServerArgs, set_global_server_args_for_scheduler from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") # Global configuration for all indexer tests DEFAULT_CONFIG = { diff --git a/test/registered/kernels/ops/attention/test_dsa_metadata.py b/test/registered/kernels/ops/attention/test_dsa_metadata.py index 3b7a985d5..971bf0df8 100644 --- a/test/registered/kernels/ops/attention/test_dsa_metadata.py +++ b/test/registered/kernels/ops/attention/test_dsa_metadata.py @@ -10,7 +10,7 @@ from sglang.kernels.ops.attention.dsa_metadata import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=15, stage="stage-b", runner_config="1-gpu-large-amd") diff --git a/test/registered/kernels/ops/attention/test_dsa_transform_index.py b/test/registered/kernels/ops/attention/test_dsa_transform_index.py index e4c32e359..4432d6896 100644 --- a/test/registered/kernels/ops/attention/test_dsa_transform_index.py +++ b/test/registered/kernels/ops/attention/test_dsa_transform_index.py @@ -11,7 +11,7 @@ from sglang.kernels.ops.attention.dsa.transform_index import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") TOPK = 2048 diff --git a/test/registered/kernels/ops/attention/test_dsv32_indexer_fusion.py b/test/registered/kernels/ops/attention/test_dsv32_indexer_fusion.py index f8c2039a0..268a1c4df 100644 --- a/test/registered/kernels/ops/attention/test_dsv32_indexer_fusion.py +++ b/test/registered/kernels/ops/attention/test_dsv32_indexer_fusion.py @@ -31,7 +31,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci _is_hip = is_hip() -register_cuda_ci(est_time=45, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=45, suite="jit-kernel-unit-test-amd") HEAD_DIM = 128 diff --git a/test/registered/kernels/ops/attention/test_dsv4_indexer_quant.py b/test/registered/kernels/ops/attention/test_dsv4_indexer_quant.py index 03f3fdd78..f7ba90917 100644 --- a/test/registered/kernels/ops/attention/test_dsv4_indexer_quant.py +++ b/test/registered/kernels/ops/attention/test_dsv4_indexer_quant.py @@ -28,7 +28,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci _is_hip = is_hip() -register_cuda_ci(est_time=45, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=45, suite="jit-kernel-unit-test-amd") HEAD_DIM = 128 diff --git a/test/registered/kernels/ops/attention/test_flash_mla_backends.py b/test/registered/kernels/ops/attention/test_flash_mla_backends.py index 5ccb25be4..a41568432 100644 --- a/test/registered/kernels/ops/attention/test_flash_mla_backends.py +++ b/test/registered/kernels/ops/attention/test_flash_mla_backends.py @@ -53,7 +53,7 @@ from sglang.srt.runtime_context import get_resources from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=45, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large") # Per-token byte layout diff --git a/test/registered/kernels/ops/attention/test_gdn_decode_fused_proj_conv.py b/test/registered/kernels/ops/attention/test_gdn_decode_fused_proj_conv.py index a9dc4bbb6..0bdb478de 100644 --- a/test/registered/kernels/ops/attention/test_gdn_decode_fused_proj_conv.py +++ b/test/registered/kernels/ops/attention/test_gdn_decode_fused_proj_conv.py @@ -14,7 +14,7 @@ from sglang.kernels.ops.attention.triton_gdn_fused_proj import ( from sglang.kernels.ops.mamba.causal_conv1d_triton import causal_conv1d_update from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-large") def _reference( diff --git a/test/registered/kernels/ops/attention/test_kda_prefill.py b/test/registered/kernels/ops/attention/test_kda_prefill.py index 73b33d1d3..157d911c3 100644 --- a/test/registered/kernels/ops/attention/test_kda_prefill.py +++ b/test/registered/kernels/ops/attention/test_kda_prefill.py @@ -14,7 +14,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase register_cuda_ci(est_time=180, stage="base-b-kernel-unit", runner_config="4-gpu-b200") -register_cuda_ci(est_time=180, stage="base-c", runner_config="4-gpu-gb300") +register_cuda_ci(est_time=80, stage="base-c", runner_config="4-gpu-gb300") def _inputs(seed, seq_len=128): diff --git a/test/registered/kernels/ops/attention/test_sm120_paged_mqa_logits.py b/test/registered/kernels/ops/attention/test_sm120_paged_mqa_logits.py index 23f71e8cb..8b609b561 100644 --- a/test/registered/kernels/ops/attention/test_sm120_paged_mqa_logits.py +++ b/test/registered/kernels/ops/attention/test_sm120_paged_mqa_logits.py @@ -29,7 +29,7 @@ from sglang.srt.layers.attention.dsv4.indexer import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") # DSv4 indexer cache layout (fixed by deepseek_v4_memory_pool.DeepSeekV4IndexerPool): diff --git a/test/registered/kernels/ops/communication/test_symm_mem_all_gather.py b/test/registered/kernels/ops/communication/test_symm_mem_all_gather.py index d24472ec9..5d613701f 100644 --- a/test/registered/kernels/ops/communication/test_symm_mem_all_gather.py +++ b/test/registered/kernels/ops/communication/test_symm_mem_all_gather.py @@ -34,7 +34,7 @@ from sglang.srt.distributed.device_communicators.triton_symm_mem_ag import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kernels.utils import multigpu_pytest_main -register_cuda_ci(est_time=240, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=38, stage="extra-b", runner_config="8-gpu-h200") # Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=70, stage="nightly", runner_config="8-gpu-h200") diff --git a/test/registered/kernels/ops/diffusion/test_import_surface.py b/test/registered/kernels/ops/diffusion/test_import_surface.py index f3e9ebb88..7f739406b 100644 --- a/test/registered/kernels/ops/diffusion/test_import_surface.py +++ b/test/registered/kernels/ops/diffusion/test_import_surface.py @@ -26,7 +26,7 @@ from sglang.kernels.ops.diffusion import _EXPORTS, _SPECS from sglang.kernels.registry import registry from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=25, suite="base-a-test-cpu") +register_cpu_ci(est_time=16, suite="base-a-test-cpu") PACKAGE = "sglang.kernels.ops.diffusion" _PACKAGE_DIR = pathlib.Path(importlib.import_module(PACKAGE).__file__ or "").parent diff --git a/test/registered/kernels/ops/diffusion/test_sites.py b/test/registered/kernels/ops/diffusion/test_sites.py index 7146125dc..a62595529 100644 --- a/test/registered/kernels/ops/diffusion/test_sites.py +++ b/test/registered/kernels/ops/diffusion/test_sites.py @@ -49,7 +49,7 @@ from sglang.kernels.ops.diffusion import ( from sglang.test.ci.ci_register import register_cpu_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") register_cuda_ci(est_time=38, stage="base-b-kernel-unit", runner_config="1-gpu-large") requires_cuda = pytest.mark.skipif( diff --git a/test/registered/kernels/ops/embeddings/test_vocab_parallel_embedding.py b/test/registered/kernels/ops/embeddings/test_vocab_parallel_embedding.py index ab0f2c96f..45f9841d7 100644 --- a/test/registered/kernels/ops/embeddings/test_vocab_parallel_embedding.py +++ b/test/registered/kernels/ops/embeddings/test_vocab_parallel_embedding.py @@ -14,7 +14,7 @@ from sglang.srt.layers.vocab_parallel_embedding import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-small") pytestmark = pytest.mark.skipif( not torch.cuda.is_available(), reason="CUDA is required for this test." diff --git a/test/registered/kernels/ops/kimi_k3/test_collectives.py b/test/registered/kernels/ops/kimi_k3/test_collectives.py index 10a99b106..dc286d3b7 100644 --- a/test/registered/kernels/ops/kimi_k3/test_collectives.py +++ b/test/registered/kernels/ops/kimi_k3/test_collectives.py @@ -23,7 +23,7 @@ from sglang.srt.distributed.device_communicators.custom_all_reduce_v2 import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kernels.utils import multigpu_pytest_main -register_cuda_ci(est_time=240, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=34, stage="base-c", runner_config="4-gpu-b200") register_cuda_ci(est_time=480, stage="nightly", runner_config="8-gpu-b200") _HIDDEN_SIZE = 7168 diff --git a/test/registered/kernels/ops/kv_canary/test_utils.py b/test/registered/kernels/ops/kv_canary/test_utils.py index 82736140a..ea41ffea9 100644 --- a/test/registered/kernels/ops/kv_canary/test_utils.py +++ b/test/registered/kernels/ops/kv_canary/test_utils.py @@ -8,7 +8,7 @@ from sglang.kernels.jit.benchmark.kv_canary.utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, stage="base-a", runner_config="cpu") +register_cpu_ci(est_time=7, stage="base-a", runner_config="cpu") def test_fast_matrix_cases_include_e2e_decode_and_chunked_prefill_scenarios() -> None: diff --git a/test/registered/kernels/ops/kvcache/test_hicache.py b/test/registered/kernels/ops/kvcache/test_hicache.py index 358f6d3b3..8dbf47cbe 100644 --- a/test/registered/kernels/ops/kvcache/test_hicache.py +++ b/test/registered/kernels/ops/kvcache/test_hicache.py @@ -14,7 +14,7 @@ from sglang.srt.mem_cache.pool_host.mla import MLATokenToKVPoolHost from sglang.srt.utils import is_cuda, is_hip, is_npu, is_xpu from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") pytestmark = pytest.mark.skipif( not torch.cuda.is_available() diff --git a/test/registered/kernels/ops/kvcache/test_hicache_page_first_write_back.py b/test/registered/kernels/ops/kvcache/test_hicache_page_first_write_back.py index 6b4f4870f..6bf9d13bb 100644 --- a/test/registered/kernels/ops/kvcache/test_hicache_page_first_write_back.py +++ b/test/registered/kernels/ops/kvcache/test_hicache_page_first_write_back.py @@ -24,7 +24,7 @@ from sglang.srt.mem_cache.pool_host.mla import MLATokenToKVPoolHost from sglang.srt.utils import is_cuda, is_hip, is_npu, is_xpu from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=30, stage="jit-kernel-unit", runner_config="amd") pytestmark = pytest.mark.skipif( diff --git a/test/registered/kernels/ops/kvcache/test_kvcacheio_asymmetric.py b/test/registered/kernels/ops/kvcache/test_kvcacheio_asymmetric.py index e13d99784..fa137f026 100644 --- a/test/registered/kernels/ops/kvcache/test_kvcacheio_asymmetric.py +++ b/test/registered/kernels/ops/kvcache/test_kvcacheio_asymmetric.py @@ -7,7 +7,7 @@ import torch from sglang.srt.mem_cache.pool_host.mha import AsymmetricMHATokenToKVPoolHost from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=10, suite="nightly-amd-kernel-1-gpu", nightly=True) # These tests use AsymmetricMHATokenToKVPoolHost methods and let that class call diff --git a/test/registered/kernels/ops/layernorm/test_fused_op.py b/test/registered/kernels/ops/layernorm/test_fused_op.py index 849d86776..1be24a480 100644 --- a/test/registered/kernels/ops/layernorm/test_fused_op.py +++ b/test/registered/kernels/ops/layernorm/test_fused_op.py @@ -16,7 +16,7 @@ from sglang.kernels.spec import CapabilityRequirement as Cap from sglang.kernels.spec import KernelBackend, KernelSpec from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class _ToyAdd(BaseFusedOp): diff --git a/test/registered/kernels/ops/layernorm/test_fused_op_gpu_parity.py b/test/registered/kernels/ops/layernorm/test_fused_op_gpu_parity.py index 920474439..71d129f94 100644 --- a/test/registered/kernels/ops/layernorm/test_fused_op_gpu_parity.py +++ b/test/registered/kernels/ops/layernorm/test_fused_op_gpu_parity.py @@ -11,7 +11,7 @@ import torch from sglang.kernels.spec import KernelBackend from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=60, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=12, stage="extra-a", runner_config="1-gpu-small") # torch_compile is native under the hood; skip it here (compile time dominates) # -- it is exercised in the CPU lane. diff --git a/test/registered/kernels/ops/layernorm/test_gemma4_fused_routing.py b/test/registered/kernels/ops/layernorm/test_gemma4_fused_routing.py index bdb6a2189..dddd49da9 100644 --- a/test/registered/kernels/ops/layernorm/test_gemma4_fused_routing.py +++ b/test/registered/kernels/ops/layernorm/test_gemma4_fused_routing.py @@ -16,7 +16,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-small") pytestmark = pytest.mark.skipif( not torch.cuda.is_available(), diff --git a/test/registered/kernels/ops/layernorm/test_kernels_namespace.py b/test/registered/kernels/ops/layernorm/test_kernels_namespace.py index 60abc2700..9c1ceb12b 100644 --- a/test/registered/kernels/ops/layernorm/test_kernels_namespace.py +++ b/test/registered/kernels/ops/layernorm/test_kernels_namespace.py @@ -15,7 +15,7 @@ from sglang.kernels import DeviceType, KernelBackend, PlatformInfo from sglang.kernels.spec import CapabilityRequirement as Cap from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=24, suite="base-a-test-cpu") GROUPS = K.ops.__all__ diff --git a/test/registered/kernels/ops/layernorm/test_mhc_kernels.py b/test/registered/kernels/ops/layernorm/test_mhc_kernels.py index 7e9a5a65c..f284cf84d 100644 --- a/test/registered/kernels/ops/layernorm/test_mhc_kernels.py +++ b/test/registered/kernels/ops/layernorm/test_mhc_kernels.py @@ -7,7 +7,7 @@ import sglang.kernels.ops.layernorm.mhc as mhc from sglang.kernels.ops.layernorm.mhc import mhc_fused_post_pre, mhc_post, mhc_pre from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") @pytest.mark.parametrize("hidden_size", [4096, 7168]) diff --git a/test/registered/kernels/ops/moe/test_moe_wna16_marlin.py b/test/registered/kernels/ops/moe/test_moe_wna16_marlin.py index 005e9bd37..09700073d 100644 --- a/test/registered/kernels/ops/moe/test_moe_wna16_marlin.py +++ b/test/registered/kernels/ops/moe/test_moe_wna16_marlin.py @@ -20,7 +20,7 @@ from sglang.test.test_marlin_utils import ( marlin_quantize, ) -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") def _has_aot_moe_wna16_marlin_gemm() -> bool: diff --git a/test/registered/kernels/ops/quantization/test_nvfp4_marlin.py b/test/registered/kernels/ops/quantization/test_nvfp4_marlin.py index 0f1efade4..9465ddd06 100644 --- a/test/registered/kernels/ops/quantization/test_nvfp4_marlin.py +++ b/test/registered/kernels/ops/quantization/test_nvfp4_marlin.py @@ -19,8 +19,8 @@ from sglang.srt.utils.common import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_marlin_utils import make_nvfp4_weight_and_ref -register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large") -register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") @pytest.mark.skipif( diff --git a/test/registered/kernels/ops/speculative/test_boundary_kv_fix_kernels.py b/test/registered/kernels/ops/speculative/test_boundary_kv_fix_kernels.py index 76e2a0921..6d48f4a11 100644 --- a/test/registered/kernels/ops/speculative/test_boundary_kv_fix_kernels.py +++ b/test/registered/kernels/ops/speculative/test_boundary_kv_fix_kernels.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") """Boundary-KV fix kernels (SGLANG_ENABLE_MTP_BOUNDARY_KV_FIX) vs a pure-torch reference. diff --git a/test/registered/kernels/test_dcp_lse_combine.py b/test/registered/kernels/test_dcp_lse_combine.py index 283986138..fadf5a417 100644 --- a/test/registered/kernels/test_dcp_lse_combine.py +++ b/test/registered/kernels/test_dcp_lse_combine.py @@ -16,7 +16,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") class TestLSECombineTritonVsCPU(CustomTestCase): diff --git a/test/registered/kernels/test_fused_kda_conv_recurrent_verify.py b/test/registered/kernels/test_fused_kda_conv_recurrent_verify.py index 81e0b08b0..f67fe4634 100644 --- a/test/registered/kernels/test_fused_kda_conv_recurrent_verify.py +++ b/test/registered/kernels/test_fused_kda_conv_recurrent_verify.py @@ -14,7 +14,7 @@ from sglang.kernels.ops.mamba.causal_conv1d_triton import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large") _DEVICE = "cuda" diff --git a/test/registered/kernels/test_fused_op_dispatch.py b/test/registered/kernels/test_fused_op_dispatch.py index 5bf549e41..4d4aa16b1 100644 --- a/test/registered/kernels/test_fused_op_dispatch.py +++ b/test/registered/kernels/test_fused_op_dispatch.py @@ -28,7 +28,7 @@ from sglang.kernels.spec import CapabilityRequirement as Cap from sglang.kernels.spec import KernelBackend, PlatformInfo from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=60, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") _CUDA = PlatformInfo(device_type="cuda", cuda_arch_major=9, cuda_arch_minor=0) _HIP = PlatformInfo(device_type="hip") diff --git a/test/registered/kernels/test_jit_cache.py b/test/registered/kernels/test_jit_cache.py index e547db11f..d70ca0386 100644 --- a/test/registered/kernels/test_jit_cache.py +++ b/test/registered/kernels/test_jit_cache.py @@ -19,7 +19,7 @@ from sglang.kernels.jit.utils.compile.paths import KERNEL_PATH from sglang.kernels.jit.utils.compile.spec import BuildSpec from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") @pytest.fixture(autouse=True) diff --git a/test/registered/kernels/test_kernel_inventory.py b/test/registered/kernels/test_kernel_inventory.py index 481b1209a..f3854471a 100644 --- a/test/registered/kernels/test_kernel_inventory.py +++ b/test/registered/kernels/test_kernel_inventory.py @@ -12,7 +12,7 @@ import pytest import sglang.kernels as kernels from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") REPO_ROOT = Path(__file__).resolve().parents[3] KERNELS_ROOT = REPO_ROOT / "python" / "sglang" / "kernels" diff --git a/test/registered/kv_canary/test_self_e2e_baseline.py b/test/registered/kv_canary/test_self_e2e_baseline.py index ed24240a9..500687723 100644 --- a/test/registered/kv_canary/test_self_e2e_baseline.py +++ b/test/registered/kv_canary/test_self_e2e_baseline.py @@ -7,7 +7,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.consts import SWA_POOL_SERVER_ARGS from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=60, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=135, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=236, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_e2e_bench_speed.py b/test/registered/kv_canary/test_self_e2e_bench_speed.py index f689082ce..b1fc8c8e5 100644 --- a/test/registered/kv_canary/test_self_e2e_bench_speed.py +++ b/test/registered/kv_canary/test_self_e2e_bench_speed.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import DEFAULT_PORT_FOR_SRT_TEST_RUNNER # CUDA-only: this self-bench asserts a 1.0% kv_canary overhead budget tuned on # the CUDA (H100) runner. On ROCm the measured overhead is ~1.26%, so the # benchmark is not portable as-is; keep it off AMD CI rather than register-and-skip. -register_cuda_ci(est_time=600, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=304, stage="extra-a", runner_config="1-gpu-large") _QWEN3_MODEL = "Qwen/Qwen3-30B-A3B" diff --git a/test/registered/kv_canary/test_self_e2e_pd_baseline.py b/test/registered/kv_canary/test_self_e2e_pd_baseline.py index 3e2905437..902b91259 100644 --- a/test/registered/kv_canary/test_self_e2e_pd_baseline.py +++ b/test/registered/kv_canary/test_self_e2e_pd_baseline.py @@ -5,7 +5,7 @@ import unittest from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.pd_fixture import CanaryPDFixture -register_cuda_ci(est_time=180, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=204, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=106, stage="extra-a", runner_config="2-gpu-large-amd") diff --git a/test/registered/kv_canary/test_self_e2e_pd_perturb.py b/test/registered/kv_canary/test_self_e2e_pd_perturb.py index a06232b84..c2ea1ff0a 100644 --- a/test/registered/kv_canary/test_self_e2e_pd_perturb.py +++ b/test/registered/kv_canary/test_self_e2e_pd_perturb.py @@ -7,7 +7,7 @@ from sglang.srt.kv_canary.perturb.config import TargetGroupKind from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.pd_fixture import CanaryPDFixture -register_cuda_ci(est_time=180, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=305, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=231, stage="extra-a", runner_config="2-gpu-large-amd") diff --git a/test/registered/kv_canary/test_self_e2e_perturb_raise.py b/test/registered/kv_canary/test_self_e2e_perturb_raise.py index 232e6eb88..fc66f0d2f 100644 --- a/test/registered/kv_canary/test_self_e2e_perturb_raise.py +++ b/test/registered/kv_canary/test_self_e2e_perturb_raise.py @@ -7,7 +7,7 @@ from sglang.srt.kv_canary.perturb.config import TargetGroupKind from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=60, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=54, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=50, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_e2e_perturb_real_kv_unused_cache.py b/test/registered/kv_canary/test_self_e2e_perturb_real_kv_unused_cache.py index da98c294a..dd9cbebea 100644 --- a/test/registered/kv_canary/test_self_e2e_perturb_real_kv_unused_cache.py +++ b/test/registered/kv_canary/test_self_e2e_perturb_real_kv_unused_cache.py @@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.consts import SWA_POOL_SERVER_ARGS from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=60, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=446, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=503, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_e2e_perturb_real_kv_used.py b/test/registered/kv_canary/test_self_e2e_perturb_real_kv_used.py index 9127c8549..d2c494e51 100644 --- a/test/registered/kv_canary/test_self_e2e_perturb_real_kv_used.py +++ b/test/registered/kv_canary/test_self_e2e_perturb_real_kv_used.py @@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.consts import SWA_POOL_SERVER_ARGS from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=60, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=290, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=256, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_e2e_perturb_req_to_token.py b/test/registered/kv_canary/test_self_e2e_perturb_req_to_token.py index 42509ba95..ce390bfd5 100644 --- a/test/registered/kv_canary/test_self_e2e_perturb_req_to_token.py +++ b/test/registered/kv_canary/test_self_e2e_perturb_req_to_token.py @@ -7,7 +7,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.consts import SWA_POOL_SERVER_ARGS from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=60, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=194, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=175, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_e2e_pp_baseline.py b/test/registered/kv_canary/test_self_e2e_pp_baseline.py index 2656bc7dc..8b7fd1e97 100644 --- a/test/registered/kv_canary/test_self_e2e_pp_baseline.py +++ b/test/registered/kv_canary/test_self_e2e_pp_baseline.py @@ -6,7 +6,7 @@ from sglang.srt.kv_canary.config import CanaryMode from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.pp_fixture import CanaryPPFixture -register_cuda_ci(est_time=220, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=207, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=243, stage="extra-a", runner_config="2-gpu-large-amd") diff --git a/test/registered/kv_canary/test_self_e2e_pp_perturb.py b/test/registered/kv_canary/test_self_e2e_pp_perturb.py index 8e4c32f1a..1a16bb4d0 100644 --- a/test/registered/kv_canary/test_self_e2e_pp_perturb.py +++ b/test/registered/kv_canary/test_self_e2e_pp_perturb.py @@ -8,7 +8,7 @@ from sglang.srt.kv_canary.perturb.config import TargetGroupKind from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.pp_fixture import CanaryPPFixture -register_cuda_ci(est_time=220, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=318, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=298, stage="extra-a", runner_config="2-gpu-large-amd") diff --git a/test/registered/kv_canary/test_self_e2e_pr_25015.py b/test/registered/kv_canary/test_self_e2e_pr_25015.py index f040238ad..ea004b2f0 100644 --- a/test/registered/kv_canary/test_self_e2e_pr_25015.py +++ b/test/registered/kv_canary/test_self_e2e_pr_25015.py @@ -9,7 +9,7 @@ from sglang.srt.kv_canary.config import CanaryMode from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=60, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=102, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=101, stage="extra-a", runner_config="1-gpu-small-amd") _SPEC_EAGLE_TOKEN_ORACLE_ENV = { diff --git a/test/registered/kv_canary/test_self_e2e_pr_26329.py b/test/registered/kv_canary/test_self_e2e_pr_26329.py index b7a8f695f..f1b4e4d7b 100644 --- a/test/registered/kv_canary/test_self_e2e_pr_26329.py +++ b/test/registered/kv_canary/test_self_e2e_pr_26329.py @@ -11,7 +11,7 @@ from sglang.srt.kv_canary.config import CanaryMode from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=60, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=105, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=99, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_buffer_alloc.py b/test/registered/kv_canary/test_self_unit_buffer_alloc.py index 296316510..91d21c8b0 100644 --- a/test/registered/kv_canary/test_self_unit_buffer_alloc.py +++ b/test/registered/kv_canary/test_self_unit_buffer_alloc.py @@ -15,7 +15,7 @@ from sglang.srt.kv_canary.pool_patcher.buffer_alloc import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=10, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_capacities.py b/test/registered/kv_canary/test_self_unit_capacities.py index 04f7ecba9..51f8e2daf 100644 --- a/test/registered/kv_canary/test_self_unit_capacities.py +++ b/test/registered/kv_canary/test_self_unit_capacities.py @@ -12,7 +12,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestComputeLaunchCapacities(CustomTestCase): diff --git a/test/registered/kv_canary/test_self_unit_endpoint.py b/test/registered/kv_canary/test_self_unit_endpoint.py index 3143226d6..95163abaa 100644 --- a/test/registered/kv_canary/test_self_unit_endpoint.py +++ b/test/registered/kv_canary/test_self_unit_endpoint.py @@ -25,7 +25,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.fixtures import DEFAULT_DEVICE from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=20, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_future_tensor.py b/test/registered/kv_canary/test_self_unit_future_tensor.py index a0256378f..a887b6f8c 100644 --- a/test/registered/kv_canary/test_self_unit_future_tensor.py +++ b/test/registered/kv_canary/test_self_unit_future_tensor.py @@ -9,7 +9,7 @@ from sglang.srt.kv_canary.runner.future_tensor import FutureTensors from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=20, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_plan_input.py b/test/registered/kv_canary/test_self_unit_plan_input.py index 7449b0947..eb25077ba 100644 --- a/test/registered/kv_canary/test_self_unit_plan_input.py +++ b/test/registered/kv_canary/test_self_unit_plan_input.py @@ -13,7 +13,7 @@ from sglang.test.kv_canary.fixtures import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=30, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_pool_patcher.py b/test/registered/kv_canary/test_self_unit_pool_patcher.py index 43af20f62..5dc608479 100644 --- a/test/registered/kv_canary/test_self_unit_pool_patcher.py +++ b/test/registered/kv_canary/test_self_unit_pool_patcher.py @@ -24,7 +24,7 @@ from sglang.test.kv_canary.fixtures import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=45, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=12, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=45, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_pool_patcher_utils.py b/test/registered/kv_canary/test_self_unit_pool_patcher_utils.py index eefa62bab..ea4012f59 100644 --- a/test/registered/kv_canary/test_self_unit_pool_patcher_utils.py +++ b/test/registered/kv_canary/test_self_unit_pool_patcher_utils.py @@ -6,7 +6,7 @@ from sglang.srt.kv_canary.pool_patcher.utils import wrap_method from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=10, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_radix_walker.py b/test/registered/kv_canary/test_self_unit_radix_walker.py index 4e72e41d9..7bc6c446c 100644 --- a/test/registered/kv_canary/test_self_unit_radix_walker.py +++ b/test/registered/kv_canary/test_self_unit_radix_walker.py @@ -20,7 +20,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.fixtures import DEFAULT_DEVICE, make_radix_cache from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=30, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_req_to_expected_token_ids_manager.py b/test/registered/kv_canary/test_self_unit_req_to_expected_token_ids_manager.py index a11db78c5..a5f615cf5 100644 --- a/test/registered/kv_canary/test_self_unit_req_to_expected_token_ids_manager.py +++ b/test/registered/kv_canary/test_self_unit_req_to_expected_token_ids_manager.py @@ -14,7 +14,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.fixtures import DEFAULT_DEVICE, make_forward_batch from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=15, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=11, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=15, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_runner_health.py b/test/registered/kv_canary/test_self_unit_runner_health.py index 26659a208..1ee396ea4 100644 --- a/test/registered/kv_canary/test_self_unit_runner_health.py +++ b/test/registered/kv_canary/test_self_unit_runner_health.py @@ -19,7 +19,7 @@ from sglang.test.kv_canary.runner_test_base import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=45, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=45, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_runner_per_forward.py b/test/registered/kv_canary/test_self_unit_runner_per_forward.py index 451524e92..0fc87917e 100644 --- a/test/registered/kv_canary/test_self_unit_runner_per_forward.py +++ b/test/registered/kv_canary/test_self_unit_runner_per_forward.py @@ -20,7 +20,7 @@ from sglang.test.kv_canary.runner_test_base import ( make_manager, ) -register_cuda_ci(est_time=45, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=45, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_runner_swa_divergence.py b/test/registered/kv_canary/test_self_unit_runner_swa_divergence.py index 38fb39253..1fc1887b0 100644 --- a/test/registered/kv_canary/test_self_unit_runner_swa_divergence.py +++ b/test/registered/kv_canary/test_self_unit_runner_swa_divergence.py @@ -20,7 +20,7 @@ from sglang.test.kv_canary.fixtures import make_buffer_group from sglang.test.kv_canary.runner_test_base import CanaryManagerTestCase, make_manager from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=45, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=11, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=45, suite="extra-a-test-1-gpu-small-amd") _DEVICE = torch.device("cuda") diff --git a/test/registered/kv_canary/test_self_unit_runner_sweep.py b/test/registered/kv_canary/test_self_unit_runner_sweep.py index 49e55f018..ee59aee51 100644 --- a/test/registered/kv_canary/test_self_unit_runner_sweep.py +++ b/test/registered/kv_canary/test_self_unit_runner_sweep.py @@ -16,7 +16,7 @@ from sglang.test.kv_canary.runner_test_base import ( make_manager, ) -register_cuda_ci(est_time=45, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=45, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_sweep_plan_builder.py b/test/registered/kv_canary/test_self_unit_sweep_plan_builder.py index 2cab72e1f..c4d973c83 100644 --- a/test/registered/kv_canary/test_self_unit_sweep_plan_builder.py +++ b/test/registered/kv_canary/test_self_unit_sweep_plan_builder.py @@ -13,7 +13,7 @@ from sglang.test.kv_canary.fixtures import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=11, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=30, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_token_oracle.py b/test/registered/kv_canary/test_self_unit_token_oracle.py index 67255fc93..563db9138 100644 --- a/test/registered/kv_canary/test_self_unit_token_oracle.py +++ b/test/registered/kv_canary/test_self_unit_token_oracle.py @@ -13,7 +13,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.fixtures import DEFAULT_DEVICE from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=1, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=1, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_violation.py b/test/registered/kv_canary/test_self_unit_violation.py index e84fe1066..66ca4bd03 100644 --- a/test/registered/kv_canary/test_self_unit_violation.py +++ b/test/registered/kv_canary/test_self_unit_violation.py @@ -18,7 +18,7 @@ from sglang.srt.kv_canary.runner.violation_reporter import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=5, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=5, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/layers/mamba/test_causal_conv1d.py b/test/registered/layers/mamba/test_causal_conv1d.py index c39d845f9..9148f33b8 100644 --- a/test/registered/layers/mamba/test_causal_conv1d.py +++ b/test/registered/layers/mamba/test_causal_conv1d.py @@ -2,7 +2,7 @@ # SPDX-FileCopyrightText: Copyright contributors to the vLLM project from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-small-amd") # Adapted from https://github.com/vllm-project/vllm/blob/main/tests/kernels/mamba/test_causal_conv1d.py diff --git a/test/registered/layers/mamba/test_mamba2_mixer.py b/test/registered/layers/mamba/test_mamba2_mixer.py index 173cd4e1a..69b38472b 100644 --- a/test/registered/layers/mamba/test_mamba2_mixer.py +++ b/test/registered/layers/mamba/test_mamba2_mixer.py @@ -17,7 +17,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.srt.utils import get_device, get_device_count from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=32, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=30, stage="base-b", runner_config="2-gpu-large") NUM_GPUS = 2 diff --git a/test/registered/layers/mamba/test_mamba_slot_fused.py b/test/registered/layers/mamba/test_mamba_slot_fused.py index 4583258b3..e7fc04afe 100644 --- a/test/registered/layers/mamba/test_mamba_slot_fused.py +++ b/test/registered/layers/mamba/test_mamba_slot_fused.py @@ -19,7 +19,7 @@ from sglang.srt.mem_cache.mamba_slot_fused import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") CONV_LEN = 3 # Representative hybrid conv-state trailing dims (a couple of KV-projection diff --git a/test/registered/layers/test_layernorm_fusion.py b/test/registered/layers/test_layernorm_fusion.py index 0a60e20d4..5e6bb7391 100644 --- a/test/registered/layers/test_layernorm_fusion.py +++ b/test/registered/layers/test_layernorm_fusion.py @@ -7,7 +7,7 @@ from sglang.srt.layers.layernorm import RMSNorm from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=2, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/lora/test_fused_moe_lora_kernel.py b/test/registered/lora/test_fused_moe_lora_kernel.py index 91fc5757e..efcc63b7a 100644 --- a/test/registered/lora/test_fused_moe_lora_kernel.py +++ b/test/registered/lora/test_fused_moe_lora_kernel.py @@ -16,7 +16,7 @@ from sglang.test.ci.ci_register import register_cuda_ci # ============================================================================== -register_cuda_ci(est_time=28, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large") def round_up(x, base): diff --git a/test/registered/lora/test_lora_drainer.py b/test/registered/lora/test_lora_drainer.py index 2aa385b64..9b4900cbd 100644 --- a/test/registered/lora/test_lora_drainer.py +++ b/test/registered/lora/test_lora_drainer.py @@ -12,7 +12,7 @@ from sglang.test.lora_utils import ( ) from sglang.test.test_utils import is_in_ci -register_cuda_ci(est_time=100, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=52, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=100, suite="stage-b-test-1-gpu-small-amd") MOCK_START_TIME = 1000.0 diff --git a/test/registered/lora/test_lora_eviction.py b/test/registered/lora/test_lora_eviction.py index c01310abf..c0f6be7e2 100644 --- a/test/registered/lora/test_lora_eviction.py +++ b/test/registered/lora/test_lora_eviction.py @@ -23,7 +23,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.runners import SRTRunner from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=263, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=319, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=224, suite="stage-b-test-1-gpu-small-amd") PROMPTS = [ diff --git a/test/registered/lora/test_lora_gpt_oss_20b_logprob_diff.py b/test/registered/lora/test_lora_gpt_oss_20b_logprob_diff.py index e305befa9..9d8b001a9 100644 --- a/test/registered/lora/test_lora_gpt_oss_20b_logprob_diff.py +++ b/test/registered/lora/test_lora_gpt_oss_20b_logprob_diff.py @@ -34,7 +34,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=90, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=96, stage="extra-b", runner_config="4-gpu-b200") BASE_MODEL = "lmsys/gpt-oss-20b-bf16" LORA_HF_REPO = "yushengsu/lora-diff-gpt-oss-20b" diff --git a/test/registered/lora/test_lora_moe_tp_logprob_diff.py b/test/registered/lora/test_lora_moe_tp_logprob_diff.py index 20b42e77e..2eb4a19d8 100644 --- a/test/registered/lora/test_lora_moe_tp_logprob_diff.py +++ b/test/registered/lora/test_lora_moe_tp_logprob_diff.py @@ -33,7 +33,7 @@ from sglang.test.test_utils import ( is_in_ci, ) -register_cuda_ci(est_time=280, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=130, stage="extra-a", runner_config="2-gpu-large") LOGPROB_THRESHOLD = 5e-04 # Chunked vs non-chunked runs differ only in lm_head matmul shape (16-row diff --git a/test/registered/lora/test_lora_nemotron_3_super_120b_a12b_logprob_diff.py b/test/registered/lora/test_lora_nemotron_3_super_120b_a12b_logprob_diff.py index 9a19d2826..c5518af0b 100644 --- a/test/registered/lora/test_lora_nemotron_3_super_120b_a12b_logprob_diff.py +++ b/test/registered/lora/test_lora_nemotron_3_super_120b_a12b_logprob_diff.py @@ -34,7 +34,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=100, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=154, stage="extra-b", runner_config="4-gpu-b200") BASE_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16" LORA_HF_REPO = "opherlie/lora-test-case-NVIDIA-Nemotron-3-Super-120B-A12B-BF16" diff --git a/test/registered/lora/test_lora_overlap_loading.py b/test/registered/lora/test_lora_overlap_loading.py index 2d73ef920..aa3f2c51e 100644 --- a/test/registered/lora/test_lora_overlap_loading.py +++ b/test/registered/lora/test_lora_overlap_loading.py @@ -30,7 +30,7 @@ from sglang.test.lora_utils import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=380, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=237, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=75, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/lora/test_lora_qwen3_30b_a3b_instruct_2507_logprob_diff.py b/test/registered/lora/test_lora_qwen3_30b_a3b_instruct_2507_logprob_diff.py index 259bf1c37..850a91169 100644 --- a/test/registered/lora/test_lora_qwen3_30b_a3b_instruct_2507_logprob_diff.py +++ b/test/registered/lora/test_lora_qwen3_30b_a3b_instruct_2507_logprob_diff.py @@ -34,7 +34,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=100, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=72, stage="extra-b", runner_config="4-gpu-b200") BASE_MODEL = "Qwen/Qwen3-30B-A3B-Instruct-2507" LORA_HF_REPO = "yushengsu/lora-diff-Qwen3-30B-A3B-Instruct-2507" diff --git a/test/registered/lora/test_lora_qwen3_5_4b_logprob_diff.py b/test/registered/lora/test_lora_qwen3_5_4b_logprob_diff.py index 948fc3e17..21bb051a7 100644 --- a/test/registered/lora/test_lora_qwen3_5_4b_logprob_diff.py +++ b/test/registered/lora/test_lora_qwen3_5_4b_logprob_diff.py @@ -34,7 +34,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=90, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=59, stage="extra-a", runner_config="1-gpu-large") BASE_MODEL = "Qwen/Qwen3.5-4B" LORA_HF_REPO = "opherlie/lora-test-case-Qwen3.5-4B" diff --git a/test/registered/lora/test_lora_qwen3_8b_logprob_diff.py b/test/registered/lora/test_lora_qwen3_8b_logprob_diff.py index b56ec7f09..9e5809ae5 100644 --- a/test/registered/lora/test_lora_qwen3_8b_logprob_diff.py +++ b/test/registered/lora/test_lora_qwen3_8b_logprob_diff.py @@ -37,7 +37,7 @@ from sglang.srt.lora.utils import auto_detect_lora_target_modules from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=40, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=56, stage="extra-a", runner_config="1-gpu-large") BASE_MODEL = "Qwen/Qwen3-8B" LORA_HF_REPO = "yushengsu/lora-diff-Qwen3-8B" diff --git a/test/registered/lora/test_lora_spec_decoding.py b/test/registered/lora/test_lora_spec_decoding.py index 050144fbd..ab81cf988 100644 --- a/test/registered/lora/test_lora_spec_decoding.py +++ b/test/registered/lora/test_lora_spec_decoding.py @@ -35,7 +35,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=600, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=95, stage="base-b", runner_config="1-gpu-large") PROMPTS = [ "What is the capital of France? Answer in one sentence.", diff --git a/test/registered/lora/test_moe_lora_info.py b/test/registered/lora/test_moe_lora_info.py index 6ed49ef5f..fbd3a49d7 100644 --- a/test/registered/lora/test_moe_lora_info.py +++ b/test/registered/lora/test_moe_lora_info.py @@ -6,7 +6,7 @@ import torch from sglang.srt.lora.backend.base_backend import _compute_moe_lora_info from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=5, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/lora/test_multi_lora_backend.py b/test/registered/lora/test_multi_lora_backend.py index 5f3e372e8..5ce5a5262 100644 --- a/test/registered/lora/test_multi_lora_backend.py +++ b/test/registered/lora/test_multi_lora_backend.py @@ -25,7 +25,7 @@ from sglang.test.lora_utils import ( ) from sglang.test.test_utils import CustomTestCase, is_in_ci -register_cuda_ci(est_time=99, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=100, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/lora/test_virtual_experts_kernels.py b/test/registered/lora/test_virtual_experts_kernels.py index 29c5b8a27..4db23391b 100644 --- a/test/registered/lora/test_virtual_experts_kernels.py +++ b/test/registered/lora/test_virtual_experts_kernels.py @@ -30,7 +30,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-small") from sglang.kernels.ops.moe.virtual_experts import ( _align_block_size_jit, diff --git a/test/registered/mem_cache/test_int8_checkpoint_store.py b/test/registered/mem_cache/test_int8_checkpoint_store.py index af6b03b6b..7fa42d651 100644 --- a/test/registered/mem_cache/test_int8_checkpoint_store.py +++ b/test/registered/mem_cache/test_int8_checkpoint_store.py @@ -22,7 +22,7 @@ from sglang.test.ci.ci_register import register_cpu_ci # case self-skips when no GPU is present), so they run on the cheapest CI tier. # The int8 GPU decode path is covered end-to-end by # test_int8_mamba_checkpoint_e2e (now in the extra stage). -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") H, V, K = 32, 128, 128 L = 4 diff --git a/test/registered/mem_cache/test_post_capture_kv_sizing.py b/test/registered/mem_cache/test_post_capture_kv_sizing.py index 1e029a0f3..0233d8b93 100644 --- a/test/registered/mem_cache/test_post_capture_kv_sizing.py +++ b/test/registered/mem_cache/test_post_capture_kv_sizing.py @@ -28,7 +28,7 @@ from sglang.test.test_utils import ( ) # CI Registration -register_cuda_ci(est_time=100, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=75, stage="base-b", runner_config="1-gpu-large") STDOUT_FILENAME = "post_capture_kv_sizing_stdout.log" STDERR_FILENAME = "post_capture_kv_sizing_stderr.log" diff --git a/test/registered/mla/test_mla_fp8.py b/test/registered/mla/test_mla_fp8.py index 6ef747c3b..1aaada1a2 100644 --- a/test/registered/mla/test_mla_fp8.py +++ b/test/registered/mla/test_mla_fp8.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( ) # MLA FP8 KV cache test with MGSM evaluation -register_cuda_ci(est_time=104, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=106, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=800, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/mla/test_mla_int8_deepseek_v3.py b/test/registered/mla/test_mla_int8_deepseek_v3.py index a0e5ea8d0..1e80de3ab 100644 --- a/test/registered/mla/test_mla_int8_deepseek_v3.py +++ b/test/registered/mla/test_mla_int8_deepseek_v3.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( # DeepSeek-V3 channel-INT8 + MTP smoke; int8 GEMM numerics live in # unit/layers/quantization/test_int8_linear_methods.py -register_cuda_ci(est_time=160, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=118, stage="base-b", runner_config="1-gpu-large") class TestDeepseekV3MTPChannelInt8(CustomTestCase): diff --git a/test/registered/mlx/models_e2e/test_gpt_oss_mlx_correctness.py b/test/registered/mlx/models_e2e/test_gpt_oss_mlx_correctness.py index e7a3cbe27..43f5529a6 100644 --- a/test/registered/mlx/models_e2e/test_gpt_oss_mlx_correctness.py +++ b/test/registered/mlx/models_e2e/test_gpt_oss_mlx_correctness.py @@ -54,7 +54,7 @@ from sglang.test.test_utils import ( # Registered on the CPU suite but skipped wherever mlx is absent; runs for real # only on Apple Silicon. Also registered under stage-b-e2e-mlx, which the # macOS CI lane (pr-test-mlx.yml) only dispatches via a gated workflow_dispatch. -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_mlx_ci(est_time=1, suite="stage-b-e2e-mlx") _HAS_MLX = ( diff --git a/test/registered/mlx/models_e2e/test_qwen2_moe_mlx_correctness.py b/test/registered/mlx/models_e2e/test_qwen2_moe_mlx_correctness.py index b8d5894e2..a4722ee6d 100644 --- a/test/registered/mlx/models_e2e/test_qwen2_moe_mlx_correctness.py +++ b/test/registered/mlx/models_e2e/test_qwen2_moe_mlx_correctness.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( # Registered on the CPU suite but skipped wherever mlx is absent; runs for real # only on Apple Silicon. Also registered under stage-b-e2e-mlx, which the # macOS CI lane (pr-test-mlx.yml) only dispatches via a gated workflow_dispatch. -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_mlx_ci(est_time=1, suite="stage-b-e2e-mlx") _HAS_MLX = importlib.util.find_spec("mlx") is not None diff --git a/test/registered/mlx/models_e2e/test_qwen3_moe_mlx_correctness.py b/test/registered/mlx/models_e2e/test_qwen3_moe_mlx_correctness.py index b5b7b5d18..430969a49 100644 --- a/test/registered/mlx/models_e2e/test_qwen3_moe_mlx_correctness.py +++ b/test/registered/mlx/models_e2e/test_qwen3_moe_mlx_correctness.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( # Registered on the CPU suite but skipped wherever mlx is absent; runs for real # only on Apple Silicon. Also registered under stage-b-e2e-mlx, which the # macOS CI lane (pr-test-mlx.yml) only dispatches via a gated workflow_dispatch. -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_mlx_ci(est_time=1, suite="stage-b-e2e-mlx") _HAS_MLX = importlib.util.find_spec("mlx") is not None diff --git a/test/registered/mock_model/test_e2e_pd.py b/test/registered/mock_model/test_e2e_pd.py index 8592077fc..1ecb535fc 100644 --- a/test/registered/mock_model/test_e2e_pd.py +++ b/test/registered/mock_model/test_e2e_pd.py @@ -19,7 +19,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( PDDisaggregationServerBase, ) -register_cuda_ci(est_time=600, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=266, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=165, stage="extra-a", runner_config="2-gpu-large-amd") # DO NOT pass --disable-cuda-graph in canary e2e tests. The canary kernel diff --git a/test/registered/mock_model/test_e2e_pp.py b/test/registered/mock_model/test_e2e_pp.py index 0256ba16f..7b3bed952 100644 --- a/test/registered/mock_model/test_e2e_pp.py +++ b/test/registered/mock_model/test_e2e_pp.py @@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.mock_model.utils import run_mock_model_bench_serving from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=600, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=67, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=67, stage="extra-a", runner_config="2-gpu-large-amd") diff --git a/test/registered/mock_model/test_e2e_spec_eagle.py b/test/registered/mock_model/test_e2e_spec_eagle.py index ccf43fd0a..f04361bbc 100644 --- a/test/registered/mock_model/test_e2e_spec_eagle.py +++ b/test/registered/mock_model/test_e2e_spec_eagle.py @@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.mock_model.utils import MOCK_MODEL_PATH, run_mock_model_bench_serving from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=600, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=96, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=77, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/mock_model/test_e2e_tp.py b/test/registered/mock_model/test_e2e_tp.py index 415b39726..030a6a016 100644 --- a/test/registered/mock_model/test_e2e_tp.py +++ b/test/registered/mock_model/test_e2e_tp.py @@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.mock_model.utils import run_mock_model_bench_serving from sglang.test.test_utils import CustomTestCase, is_in_amd_ci -register_cuda_ci(est_time=600, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=111, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=167, stage="extra-a", runner_config="2-gpu-large-amd") diff --git a/test/registered/mock_model/test_self_e2e_perturb_next_token_swap.py b/test/registered/mock_model/test_self_e2e_perturb_next_token_swap.py index 1c45cd6de..28ee1fa39 100644 --- a/test/registered/mock_model/test_self_e2e_perturb_next_token_swap.py +++ b/test/registered/mock_model/test_self_e2e_perturb_next_token_swap.py @@ -5,7 +5,7 @@ import unittest from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.mock_model.perturb_e2e_base import MockModelPerturbE2EBase -register_cuda_ci(est_time=60, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=55, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=131, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/mock_model/test_self_unit_canary_mock_wiring.py b/test/registered/mock_model/test_self_unit_canary_mock_wiring.py index 2b3fbd78e..84c0808d5 100644 --- a/test/registered/mock_model/test_self_unit_canary_mock_wiring.py +++ b/test/registered/mock_model/test_self_unit_canary_mock_wiring.py @@ -16,7 +16,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.mock_model.utils import mock_model_server_args, mock_model_server_env from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=60, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/mock_model/test_self_unit_canary_perturb.py b/test/registered/mock_model/test_self_unit_canary_perturb.py index b650691e8..ea0341cf9 100644 --- a/test/registered/mock_model/test_self_unit_canary_perturb.py +++ b/test/registered/mock_model/test_self_unit_canary_perturb.py @@ -7,7 +7,7 @@ from sglang.srt.kv_canary.perturb.config import PerturbConfig, TargetGroupKind from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestCanaryPerturb(CustomTestCase): diff --git a/test/registered/mock_model/test_self_unit_install.py b/test/registered/mock_model/test_self_unit_install.py index 45f52056e..a0a5204fc 100644 --- a/test/registered/mock_model/test_self_unit_install.py +++ b/test/registered/mock_model/test_self_unit_install.py @@ -12,7 +12,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=60, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/mock_model/test_self_unit_oracle.py b/test/registered/mock_model/test_self_unit_oracle.py index b7813fdcd..d90bb7536 100644 --- a/test/registered/mock_model/test_self_unit_oracle.py +++ b/test/registered/mock_model/test_self_unit_oracle.py @@ -13,7 +13,7 @@ from sglang.srt.kv_canary.token_oracle.oracle import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=60, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/mock_model/test_self_unit_oracle_torch_vs_ref.py b/test/registered/mock_model/test_self_unit_oracle_torch_vs_ref.py index 02705da9d..6a4e6010d 100644 --- a/test/registered/mock_model/test_self_unit_oracle_torch_vs_ref.py +++ b/test/registered/mock_model/test_self_unit_oracle_torch_vs_ref.py @@ -10,7 +10,7 @@ from sglang.srt.kv_canary.token_oracle.oracle import HashOracle from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=30, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/mock_model/test_self_unit_sampler_hookpoint.py b/test/registered/mock_model/test_self_unit_sampler_hookpoint.py index c46c07954..987666c29 100644 --- a/test/registered/mock_model/test_self_unit_sampler_hookpoint.py +++ b/test/registered/mock_model/test_self_unit_sampler_hookpoint.py @@ -21,7 +21,7 @@ from sglang.srt.server_args import SAMPLING_BACKEND_CHOICES from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=60, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/model_loading/test_external_models.py b/test/registered/model_loading/test_external_models.py index 9f54fd843..ac02cb23c 100644 --- a/test/registered/model_loading/test_external_models.py +++ b/test/registered/model_loading/test_external_models.py @@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=29, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=34, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=45, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=32, suite="stage-b-test-cpu-intel") diff --git a/test/registered/model_loading/test_load_weights_from_remote_instance.py b/test/registered/model_loading/test_load_weights_from_remote_instance.py index 245654044..a4e5a8966 100644 --- a/test/registered/model_loading/test_load_weights_from_remote_instance.py +++ b/test/registered/model_loading/test_load_weights_from_remote_instance.py @@ -38,7 +38,7 @@ from sglang.utils import terminate_process mp.set_start_method("spawn", force=True) -register_cuda_ci(est_time=145, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=131, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=72, stage="extra-a", runner_config="2-gpu-large-amd") diff --git a/test/registered/model_loading/test_startup_weight_load.py b/test/registered/model_loading/test_startup_weight_load.py index 71c3bf89a..cee4f1cec 100644 --- a/test/registered/model_loading/test_startup_weight_load.py +++ b/test/registered/model_loading/test_startup_weight_load.py @@ -9,7 +9,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=63, stage="base-b", runner_config="1-gpu-small") class TestStartupWeightLoad(CustomTestCase): diff --git a/test/registered/model_loading/test_utils_update_weights.py b/test/registered/model_loading/test_utils_update_weights.py index 89bca6240..36dd613c8 100644 --- a/test/registered/model_loading/test_utils_update_weights.py +++ b/test/registered/model_loading/test_utils_update_weights.py @@ -12,7 +12,7 @@ from sglang.srt.weight_sync.utils import update_weights from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST -register_cuda_ci(est_time=32, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=42, stage="base-b", runner_config="1-gpu-large") class AsyncEngine(Engine): diff --git a/test/registered/model_loading/test_weight_cache_daemon.py b/test/registered/model_loading/test_weight_cache_daemon.py index f7a90b2eb..1592d2969 100644 --- a/test/registered/model_loading/test_weight_cache_daemon.py +++ b/test/registered/model_loading/test_weight_cache_daemon.py @@ -29,8 +29,8 @@ DEFAULT_MODEL = "Qwen/Qwen3-0.6B" # IPC handoff is exercised on every PR. Since the CI runner executes the whole # file per suite, TestWeightCacheDaemonTP2 self-skips when fewer than 2 GPUs are # visible (i.e. on the 1-gpu runner). -register_cuda_ci(est_time=280, stage="extra-a", runner_config="2-gpu-large") -register_cuda_ci(est_time=45, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=313, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=68, stage="base-b", runner_config="1-gpu-small") # Capture the client server's logs so test_loaded_via_ipc can assert the IPC # load path actually ran (and did not silently fall back to disk). diff --git a/test/registered/model_loading/test_weight_loader_v2_e2e.py b/test/registered/model_loading/test_weight_loader_v2_e2e.py index 7ec68c9c3..005efe2ca 100644 --- a/test/registered/model_loading/test_weight_loader_v2_e2e.py +++ b/test/registered/model_loading/test_weight_loader_v2_e2e.py @@ -14,7 +14,7 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=62, stage="base-b", runner_config="1-gpu-small") import multiprocessing as mp diff --git a/test/registered/models_e2e/test_compressed_tensors_models.py b/test/registered/models_e2e/test_compressed_tensors_models.py index 6644a268b..b9135d57c 100644 --- a/test/registered/models_e2e/test_compressed_tensors_models.py +++ b/test/registered/models_e2e/test_compressed_tensors_models.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=65, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=63, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=42, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/models_e2e/test_deepseek_v3_fp4.py b/test/registered/models_e2e/test_deepseek_v3_fp4.py index a60db1025..dcfd0fca3 100644 --- a/test/registered/models_e2e/test_deepseek_v3_fp4.py +++ b/test/registered/models_e2e/test_deepseek_v3_fp4.py @@ -7,7 +7,7 @@ from sglang.test.server_fixtures.default_fixture import DefaultServerBase # Per-commit: SymmetricMemory variant only. # - TestDeepseekV3FP4 (TRTLLM) archived to test/manual/quant/test_deepseek_v3_fp4_4gpu_trtllm.py # - TestDeepseekV3FP4CutlassMoE moved to test_deepseek_v3_fp4_4gpu_extra.py -register_cuda_ci(est_time=960, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=339, stage="base-c", runner_config="4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" diff --git a/test/registered/models_e2e/test_deepseek_v3_mtp.py b/test/registered/models_e2e/test_deepseek_v3_mtp.py index 595413d52..e1f05d987 100644 --- a/test/registered/models_e2e/test_deepseek_v3_mtp.py +++ b/test/registered/models_e2e/test_deepseek_v3_mtp.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=300, stage="base-c", runner_config="8-gpu-h200") +register_cuda_ci(est_time=386, stage="base-c", runner_config="8-gpu-h200") FULL_DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324" diff --git a/test/registered/models_e2e/test_deepseek_v4_flash_fp4_b200.py b/test/registered/models_e2e/test_deepseek_v4_flash_fp4_b200.py index 37e5fc089..ebdbab507 100644 --- a/test/registered/models_e2e/test_deepseek_v4_flash_fp4_b200.py +++ b/test/registered/models_e2e/test_deepseek_v4_flash_fp4_b200.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=465, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=624, stage="base-c", runner_config="4-gpu-b200") MODEL = "deepseek-ai/DeepSeek-V4-Flash-0731" MTP_MODEL = "deepseek-ai/DeepSeek-V4-Flash" diff --git a/test/registered/models_e2e/test_deepseek_v4_flash_fp4_h200.py b/test/registered/models_e2e/test_deepseek_v4_flash_fp4_h200.py index 865852452..ffb70aed0 100644 --- a/test/registered/models_e2e/test_deepseek_v4_flash_fp4_h200.py +++ b/test/registered/models_e2e/test_deepseek_v4_flash_fp4_h200.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=600, stage="base-c", runner_config="8-gpu-h200") +register_cuda_ci(est_time=722, stage="base-c", runner_config="8-gpu-h200") def _flashinfer_has_sm90_cutlass_mxfp4() -> bool: diff --git a/test/registered/models_e2e/test_deepseek_v4_flash_fp4_megamoe_b200.py b/test/registered/models_e2e/test_deepseek_v4_flash_fp4_megamoe_b200.py index 4bfd79756..ac3f47d87 100644 --- a/test/registered/models_e2e/test_deepseek_v4_flash_fp4_megamoe_b200.py +++ b/test/registered/models_e2e/test_deepseek_v4_flash_fp4_megamoe_b200.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=900, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=283, stage="extra-b", runner_config="4-gpu-b200") MODEL = "deepseek-ai/DeepSeek-V4-Flash-0731" SERVER_LAUNCH_TIMEOUT = 3600 diff --git a/test/registered/models_e2e/test_deepseek_v4_flash_fp8_h200.py b/test/registered/models_e2e/test_deepseek_v4_flash_fp8_h200.py index 77bc8c7e9..4c956f245 100644 --- a/test/registered/models_e2e/test_deepseek_v4_flash_fp8_h200.py +++ b/test/registered/models_e2e/test_deepseek_v4_flash_fp8_h200.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=560, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=294, stage="extra-b", runner_config="8-gpu-h200") MODEL_FP8 = "sgl-project/DeepSeek-V4-Flash-FP8" SERVER_LAUNCH_TIMEOUT = 3600 diff --git a/test/registered/models_e2e/test_dsa_glm52_hisparse.py b/test/registered/models_e2e/test_dsa_glm52_hisparse.py index 231e6155f..5cfdd34dd 100644 --- a/test/registered/models_e2e/test_dsa_glm52_hisparse.py +++ b/test/registered/models_e2e/test_dsa_glm52_hisparse.py @@ -6,7 +6,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.test_utils import terminate_and_kill_process_tree -register_cuda_ci(est_time=720, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=483, stage="extra-b", runner_config="8-gpu-h200") GLM52_FP8_MODEL_PATH = "zai-org/GLM-5.2-FP8" diff --git a/test/registered/models_e2e/test_dsa_glm52_pd_mtp_cp_layersplit.py b/test/registered/models_e2e/test_dsa_glm52_pd_mtp_cp_layersplit.py index 495752e6b..63fe7024f 100644 --- a/test/registered/models_e2e/test_dsa_glm52_pd_mtp_cp_layersplit.py +++ b/test/registered/models_e2e/test_dsa_glm52_pd_mtp_cp_layersplit.py @@ -20,7 +20,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( PDDisaggregationServerBase, ) -register_cuda_ci(est_time=750, stage="base-c", runner_config="8-gpu-b300") +register_cuda_ci(est_time=898, stage="base-c", runner_config="8-gpu-b300") MODEL_LOADER_EXTRA_CONFIG = '{"enable_multithread_load": true, "num_threads": 6}' diff --git a/test/registered/models_e2e/test_gemma4_fp8_per_expert_loading.py b/test/registered/models_e2e/test_gemma4_fp8_per_expert_loading.py index 468b8baae..bb6892540 100644 --- a/test/registered/models_e2e/test_gemma4_fp8_per_expert_loading.py +++ b/test/registered/models_e2e/test_gemma4_fp8_per_expert_loading.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import ( # Compressed-tensors per-expert FP8 MoE checkpoint that exercises the # loader path (gated repo + ~27 GB download + 4 GPUs at TP=4). -register_cuda_ci(est_time=120, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=76, stage="base-c", runner_config="4-gpu-h100") @unittest.skipIf(get_device_sm() < 90, "Test requires CUDA SM 90 or higher") diff --git a/test/registered/models_e2e/test_generation_models.py b/test/registered/models_e2e/test_generation_models.py index 5d78c3d04..3812d3b29 100644 --- a/test/registered/models_e2e/test_generation_models.py +++ b/test/registered/models_e2e/test_generation_models.py @@ -1,7 +1,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Generation model tests (CUDA only) -register_cuda_ci(est_time=150, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=144, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=106, suite="stage-b-test-1-gpu-small-amd") # Copyright 2023-2024 SGLang Team diff --git a/test/registered/models_e2e/test_gpt_oss_4gpu_mxfp4.py b/test/registered/models_e2e/test_gpt_oss_4gpu_mxfp4.py index 7598e09ef..604fac094 100644 --- a/test/registered/models_e2e/test_gpt_oss_4gpu_mxfp4.py +++ b/test/registered/models_e2e/test_gpt_oss_4gpu_mxfp4.py @@ -3,8 +3,8 @@ import unittest from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=300, stage="base-c", runner_config="4-gpu-h100") -register_cuda_ci(est_time=300, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=128, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=119, stage="base-c", runner_config="4-gpu-b200") class TestGptOss4GpuMxfp4(BaseTestGptOss): diff --git a/test/registered/models_e2e/test_gpt_oss_sm120.py b/test/registered/models_e2e/test_gpt_oss_sm120.py index 6f12cd177..e06099987 100644 --- a/test/registered/models_e2e/test_gpt_oss_sm120.py +++ b/test/registered/models_e2e/test_gpt_oss_sm120.py @@ -5,7 +5,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=345, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=336, stage="extra-a", runner_config="1-gpu-small") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is not available") diff --git a/test/registered/models_e2e/test_inkling.py b/test/registered/models_e2e/test_inkling.py index 5ca5ef4ca..9bc93e4d0 100644 --- a/test/registered/models_e2e/test_inkling.py +++ b/test/registered/models_e2e/test_inkling.py @@ -32,7 +32,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=450, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=274, stage="base-b", runner_config="1-gpu-large") # Defaults to the HF `test` revision; override MODEL/REVISION to point at a # local checkpoint. Empty REVISION drops the flag (for local paths). diff --git a/test/registered/models_e2e/test_inkling_small_nvfp4.py b/test/registered/models_e2e/test_inkling_small_nvfp4.py index 6e02f6729..41f7b8d4f 100644 --- a/test/registered/models_e2e/test_inkling_small_nvfp4.py +++ b/test/registered/models_e2e/test_inkling_small_nvfp4.py @@ -48,7 +48,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=2000, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=1079, stage="extra-b", runner_config="4-gpu-b200") _MODEL_PATH = os.environ.get( "INKLING_SMALL_TEST_MODEL_PATH", "thinkingmachines/Inkling-Small-NVFP4" diff --git a/test/registered/models_e2e/test_inkling_unified.py b/test/registered/models_e2e/test_inkling_unified.py index 4e089d980..3ac9e7974 100644 --- a/test/registered/models_e2e/test_inkling_unified.py +++ b/test/registered/models_e2e/test_inkling_unified.py @@ -45,7 +45,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=600, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=115, stage="base-b", runner_config="1-gpu-large") _MODEL_PATH = os.environ.get("INKLING_TEST_MODEL_PATH", "thinkingmachines/Inkling") _MODEL_REVISION = os.environ.get("INKLING_TEST_MODEL_REVISION", "test") diff --git a/test/registered/models_e2e/test_kimi_k3_b300.py b/test/registered/models_e2e/test_kimi_k3_b300.py index 5eb20b772..78f186e8a 100644 --- a/test/registered/models_e2e/test_kimi_k3_b300.py +++ b/test/registered/models_e2e/test_kimi_k3_b300.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=1200, stage="base-c", runner_config="8-gpu-b300") +register_cuda_ci(est_time=578, stage="base-c", runner_config="8-gpu-b300") MODEL_PATH = "moonshotai/Kimi-K3" DSPARK_DRAFT_MODEL = "RadixArk/Kimi-K3-DSpark" diff --git a/test/registered/models_e2e/test_kimi_k3_b300_low_latency.py b/test/registered/models_e2e/test_kimi_k3_b300_low_latency.py index 5a5baa94a..3bfed6f26 100644 --- a/test/registered/models_e2e/test_kimi_k3_b300_low_latency.py +++ b/test/registered/models_e2e/test_kimi_k3_b300_low_latency.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=1800, stage="base-c", runner_config="8-gpu-b300") +register_cuda_ci(est_time=1472, stage="base-c", runner_config="8-gpu-b300") MODEL_PATH = "moonshotai/Kimi-K3" DSPARK_DRAFT_MODEL = "RadixArk/Kimi-K3-DSpark" diff --git a/test/registered/models_e2e/test_kimi_linear_models.py b/test/registered/models_e2e/test_kimi_linear_models.py index 9494085bf..683525040 100644 --- a/test/registered/models_e2e/test_kimi_linear_models.py +++ b/test/registered/models_e2e/test_kimi_linear_models.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=900, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=318, stage="base-b", runner_config="2-gpu-large") KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct" diff --git a/test/registered/models_e2e/test_kimi_linear_unified_memory_dcp_blackwell.py b/test/registered/models_e2e/test_kimi_linear_unified_memory_dcp_blackwell.py index 6d0d6cb1c..e9f954cf8 100644 --- a/test/registered/models_e2e/test_kimi_linear_unified_memory_dcp_blackwell.py +++ b/test/registered/models_e2e/test_kimi_linear_unified_memory_dcp_blackwell.py @@ -47,7 +47,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=250, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=161, stage="extra-b", runner_config="4-gpu-b200") KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct" diff --git a/test/registered/models_e2e/test_layernorm_sp.py b/test/registered/models_e2e/test_layernorm_sp.py index 7103ae63b..29429ed50 100644 --- a/test/registered/models_e2e/test_layernorm_sp.py +++ b/test/registered/models_e2e/test_layernorm_sp.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=420, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=74, stage="base-b", runner_config="2-gpu-large") # Qwen3 dense (architecture "Qwen3ForCausalLM") is the SP allowlist entry. LAYERNORM_SP_MODEL = "Qwen/Qwen3-8B" diff --git a/test/registered/models_e2e/test_mimo_v2.py b/test/registered/models_e2e/test_mimo_v2.py index 2c0bf3293..de1ae140a 100644 --- a/test/registered/models_e2e/test_mimo_v2.py +++ b/test/registered/models_e2e/test_mimo_v2.py @@ -5,7 +5,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.server_fixtures.mmmu_fixture import MMMUServerBase -register_cuda_ci(est_time=400, stage="base-c", runner_config="8-gpu-h200") +register_cuda_ci(est_time=317, stage="base-c", runner_config="8-gpu-h200") MIMO_V2_MODEL = "XiaomiMiMo/MiMo-V2.5" MIMO_V2_OTHER_ARGS = [ diff --git a/test/registered/models_e2e/test_mimo_v2_flash.py b/test/registered/models_e2e/test_mimo_v2_flash.py index 74d377fd2..8b6857719 100644 --- a/test/registered/models_e2e/test_mimo_v2_flash.py +++ b/test/registered/models_e2e/test_mimo_v2_flash.py @@ -7,7 +7,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.kits.spec_decoding_kit import SpecDecodingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=200, stage="base-c", runner_config="8-gpu-h200") +register_cuda_ci(est_time=262, stage="base-c", runner_config="8-gpu-h200") class TestMiMoV2Flash(GSM8KMixin, SpecDecodingMixin, DefaultServerBase): diff --git a/test/registered/models_e2e/test_minimax_m25_basic.py b/test/registered/models_e2e/test_minimax_m25_basic.py index ce9e65597..11707b527 100644 --- a/test/registered/models_e2e/test_minimax_m25_basic.py +++ b/test/registered/models_e2e/test_minimax_m25_basic.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=160, stage="base-c", runner_config="8-gpu-h200") +register_cuda_ci(est_time=167, stage="base-c", runner_config="8-gpu-h200") MINIMAX_M25_MODEL_PATH = "MiniMaxAI/MiniMax-M2.5" diff --git a/test/registered/models_e2e/test_ministral4_models.py b/test/registered/models_e2e/test_ministral4_models.py index 2f6656e1d..c44dbd723 100644 --- a/test/registered/models_e2e/test_ministral4_models.py +++ b/test/registered/models_e2e/test_ministral4_models.py @@ -6,7 +6,7 @@ from sglang.test.kits.mmmu_vlm_kit import MMMUMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.server_fixtures.mmmu_fixture import MMMUServerBase -register_cuda_ci(est_time=200, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=310, stage="extra-a", runner_config="2-gpu-large") MODEL = "mistralai/Mistral-Small-4-119B-2603" diff --git a/test/registered/models_e2e/test_nvidia_nemotron_3_nano.py b/test/registered/models_e2e/test_nvidia_nemotron_3_nano.py index 7042936a6..a2b5cfd72 100644 --- a/test/registered/models_e2e/test_nvidia_nemotron_3_nano.py +++ b/test/registered/models_e2e/test_nvidia_nemotron_3_nano.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=500, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=939, stage="extra-b", runner_config="4-gpu-b200") MODEL = "nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4" DFLASH_DRAFT_MODEL = "nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash" diff --git a/test/registered/models_e2e/test_nvidia_nemotron_3_super_bf16.py b/test/registered/models_e2e/test_nvidia_nemotron_3_super_bf16.py index 2b537eee8..4babd0982 100644 --- a/test/registered/models_e2e/test_nvidia_nemotron_3_super_bf16.py +++ b/test/registered/models_e2e/test_nvidia_nemotron_3_super_bf16.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=200, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=178, stage="extra-b", runner_config="8-gpu-h200") NEMOTRON_3_SUPER_BF16_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16" diff --git a/test/registered/models_e2e/test_nvidia_nemotron_3_super_bf16_mtp.py b/test/registered/models_e2e/test_nvidia_nemotron_3_super_bf16_mtp.py index 1d9f2692f..3eed2af0a 100644 --- a/test/registered/models_e2e/test_nvidia_nemotron_3_super_bf16_mtp.py +++ b/test/registered/models_e2e/test_nvidia_nemotron_3_super_bf16_mtp.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=200, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=165, stage="extra-b", runner_config="8-gpu-h200") NEMOTRON_3_SUPER_BF16_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16" diff --git a/test/registered/models_e2e/test_qwen35_fp4_mtp.py b/test/registered/models_e2e/test_qwen35_fp4_mtp.py index 9628b40f3..f514bad44 100644 --- a/test/registered/models_e2e/test_qwen35_fp4_mtp.py +++ b/test/registered/models_e2e/test_qwen35_fp4_mtp.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=800, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=720, stage="base-c", runner_config="4-gpu-b200") QWEN35_FP4_MODEL = "nvidia/Qwen3.5-397B-A17B-NVFP4" ACC_THRESHOLDS = {QWEN35_FP4_MODEL: {"gsm8k": 0.95}} diff --git a/test/registered/models_e2e/test_qwen3_next_models.py b/test/registered/models_e2e/test_qwen3_next_models.py index b67736130..1b30d363e 100644 --- a/test/registered/models_e2e/test_qwen3_next_models.py +++ b/test/registered/models_e2e/test_qwen3_next_models.py @@ -6,7 +6,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=260, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=343, stage="base-c", runner_config="4-gpu-h100") QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct" diff --git a/test/registered/models_e2e/test_qwen3_next_models_extra.py b/test/registered/models_e2e/test_qwen3_next_models_extra.py index 57d997599..0c4b9f5ad 100644 --- a/test/registered/models_e2e/test_qwen3_next_models_extra.py +++ b/test/registered/models_e2e/test_qwen3_next_models_extra.py @@ -5,7 +5,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=250, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=348, stage="extra-b", runner_config="4-gpu-h100") QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct" diff --git a/test/registered/models_e2e/test_qwen3_next_models_mtp.py b/test/registered/models_e2e/test_qwen3_next_models_mtp.py index 8ffd70fc8..b2edc5ee0 100644 --- a/test/registered/models_e2e/test_qwen3_next_models_mtp.py +++ b/test/registered/models_e2e/test_qwen3_next_models_mtp.py @@ -7,7 +7,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=290, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=400, stage="base-c", runner_config="4-gpu-h100") QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct" diff --git a/test/registered/models_e2e/test_step3p5_flash_chain_mtp.py b/test/registered/models_e2e/test_step3p5_flash_chain_mtp.py index bdba6eb6f..1c4353ce9 100644 --- a/test/registered/models_e2e/test_step3p5_flash_chain_mtp.py +++ b/test/registered/models_e2e/test_step3p5_flash_chain_mtp.py @@ -8,7 +8,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.test_utils import DEFAULT_TIMEOUT_FOR_SERVER_LAUNCH -register_cuda_ci(est_time=480, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=400, stage="extra-b", runner_config="8-gpu-h200") STEP3P5_FLASH_MODEL_PATH = "stepfun-ai/Step-3.5-Flash" diff --git a/test/registered/models_e2e/test_transformers_backend_eval.py b/test/registered/models_e2e/test_transformers_backend_eval.py index ab1cd08dd..a2b1aa2ba 100644 --- a/test/registered/models_e2e/test_transformers_backend_eval.py +++ b/test/registered/models_e2e/test_transformers_backend_eval.py @@ -11,7 +11,7 @@ from sglang.test.ci.ci_register import ( from sglang.test.few_shot_gsm8k import run_eval from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=48, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=66, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=48, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=206, suite="stage-b-test-cpu-intel") diff --git a/test/registered/models_e2e/test_transformers_models.py b/test/registered/models_e2e/test_transformers_models.py index 1168c827f..f8223f054 100644 --- a/test/registered/models_e2e/test_transformers_models.py +++ b/test/registered/models_e2e/test_transformers_models.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=177, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=217, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=320, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/models_e2e/test_vlm_models.py b/test/registered/models_e2e/test_vlm_models.py index 9e49f33ac..5c2f6e0ef 100644 --- a/test/registered/models_e2e/test_vlm_models.py +++ b/test/registered/models_e2e/test_vlm_models.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import is_in_amd_ci, is_in_ci # VLM (Vision Language Model) tests -register_cuda_ci(est_time=317, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=158, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=850, suite="stage-b-test-1-gpu-small-amd-nondeterministic") _is_hip = is_hip() diff --git a/test/registered/moe/test_cutedsl_moe.py b/test/registered/moe/test_cutedsl_moe.py index 452d187df..48d471ea8 100644 --- a/test/registered/moe/test_cutedsl_moe.py +++ b/test/registered/moe/test_cutedsl_moe.py @@ -21,7 +21,7 @@ except ImportError: CuteDslMoEWrapper = None convert_sf_to_mma_layout = None -register_cuda_ci(est_time=24, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=17, stage="extra-b", runner_config="4-gpu-b200") SKIP_TEST = torch.cuda.get_device_capability() < (10, 0) SKIP_REASON = "Nvfp4 Requires compute capability of 10 or above." diff --git a/test/registered/moe/test_flashinfer_a2a_cutedsl_v2.py b/test/registered/moe/test_flashinfer_a2a_cutedsl_v2.py index 251f9a38c..7fa1636ef 100644 --- a/test/registered/moe/test_flashinfer_a2a_cutedsl_v2.py +++ b/test/registered/moe/test_flashinfer_a2a_cutedsl_v2.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=600, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=556, stage="extra-b", runner_config="4-gpu-b200") MODEL = "nvidia/Qwen3.5-397B-A17B-NVFP4" diff --git a/test/registered/moe/test_fused_append_remap_per_rank_shared_slots.py b/test/registered/moe/test_fused_append_remap_per_rank_shared_slots.py index efafba563..b5090f5a1 100644 --- a/test/registered/moe/test_fused_append_remap_per_rank_shared_slots.py +++ b/test/registered/moe/test_fused_append_remap_per_rank_shared_slots.py @@ -25,7 +25,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/moe/test_fused_append_shared_experts.py b/test/registered/moe/test_fused_append_shared_experts.py index 2edc166a6..fbe98cbc1 100644 --- a/test/registered/moe/test_fused_append_shared_experts.py +++ b/test/registered/moe/test_fused_append_shared_experts.py @@ -22,7 +22,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase, empty_gpu_cache -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/moe/test_fused_append_shared_experts_top6.py b/test/registered/moe/test_fused_append_shared_experts_top6.py index d6edc8614..47393b691 100644 --- a/test/registered/moe/test_fused_append_shared_experts_top6.py +++ b/test/registered/moe/test_fused_append_shared_experts_top6.py @@ -21,7 +21,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/moe/test_fused_moe.py b/test/registered/moe/test_fused_moe.py index d7f22c2c6..ace128004 100644 --- a/test/registered/moe/test_fused_moe.py +++ b/test/registered/moe/test_fused_moe.py @@ -14,7 +14,7 @@ from sglang.srt.utils import get_device, get_device_capability, is_hip from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase, empty_gpu_cache -register_cuda_ci(est_time=87, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=30, suite="stage-b-test-1-gpu-small-amd") _is_hip = is_hip() diff --git a/test/registered/moe/test_glm4_moe_models.py b/test/registered/moe/test_glm4_moe_models.py index 3553605cd..e94a92a6e 100644 --- a/test/registered/moe/test_glm4_moe_models.py +++ b/test/registered/moe/test_glm4_moe_models.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=171, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=115, stage="base-b", runner_config="2-gpu-large") class TestGLM4MoE(CustomTestCase): diff --git a/test/registered/moe/test_hpc_ops_moe.py b/test/registered/moe/test_hpc_ops_moe.py index aca7cace2..40af9d009 100644 --- a/test/registered/moe/test_hpc_ops_moe.py +++ b/test/registered/moe/test_hpc_ops_moe.py @@ -24,7 +24,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.layer_ut_utils import init_single_process_dist from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") # Qwen3-30B-A3B-FP8 MoE shapes. E, TOPK, H, I = 128, 8, 2048, 768 diff --git a/test/registered/moe/test_moe_ep.py b/test/registered/moe/test_moe_ep.py index 6334a5d2b..3e7d27b4f 100644 --- a/test/registered/moe/test_moe_ep.py +++ b/test/registered/moe/test_moe_ep.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( # Per-commit: TP=2 EP=2 baseline. # DeepGEMM/FP8 variant moved to test_moe_ep_nightly.py. -register_cuda_ci(est_time=279, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=93, stage="base-b", runner_config="2-gpu-large") class TestEp(CustomTestCase): diff --git a/test/registered/moe/test_moe_ep_extra.py b/test/registered/moe/test_moe_ep_extra.py index 1047b1708..a04e0f761 100644 --- a/test/registered/moe/test_moe_ep_extra.py +++ b/test/registered/moe/test_moe_ep_extra.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=279, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=94, stage="extra-a", runner_config="2-gpu-large") class TestEpDeepGEMM(CustomTestCase): diff --git a/test/registered/moe/test_topk_padded_region.py b/test/registered/moe/test_topk_padded_region.py index 3dc446825..929c96d7a 100644 --- a/test/registered/moe/test_topk_padded_region.py +++ b/test/registered/moe/test_topk_padded_region.py @@ -15,7 +15,7 @@ from sglang.srt.utils import is_hip from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=60, stage="stage-b", runner_config="1-gpu-small-amd") _IS_HIP = is_hip() diff --git a/test/registered/moe/test_topk_renormalize_degenerate.py b/test/registered/moe/test_topk_renormalize_degenerate.py index b5ff48ff6..c48f9209a 100644 --- a/test/registered/moe/test_topk_renormalize_degenerate.py +++ b/test/registered/moe/test_topk_renormalize_degenerate.py @@ -25,7 +25,7 @@ from sglang.srt.layers.moe.topk import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=60, stage="stage-b", runner_config="1-gpu-small-amd") torch.manual_seed(1234) diff --git a/test/registered/moe/test_torch_compile_moe.py b/test/registered/moe/test_torch_compile_moe.py index 113e3ddce..de6308adb 100644 --- a/test/registered/moe/test_torch_compile_moe.py +++ b/test/registered/moe/test_torch_compile_moe.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=130, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=124, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=1400, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/moe/test_triton_fused_moe.py b/test/registered/moe/test_triton_fused_moe.py index 5edd08b1f..3591507b0 100644 --- a/test/registered/moe/test_triton_fused_moe.py +++ b/test/registered/moe/test_triton_fused_moe.py @@ -12,7 +12,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") class TestFusedMOE(CustomTestCase): diff --git a/test/registered/moe/test_triton_moe_channel_fp8_kernel.py b/test/registered/moe/test_triton_moe_channel_fp8_kernel.py index 603d59b7d..21b372a6a 100644 --- a/test/registered/moe/test_triton_moe_channel_fp8_kernel.py +++ b/test/registered/moe/test_triton_moe_channel_fp8_kernel.py @@ -11,7 +11,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") def native_w8a8_per_token_matmul(A, B, As, Bs, output_dtype=torch.float16): diff --git a/test/registered/moe/test_zero_experts.py b/test/registered/moe/test_zero_experts.py index 8b00448e4..7576ae2a1 100644 --- a/test/registered/moe/test_zero_experts.py +++ b/test/registered/moe/test_zero_experts.py @@ -6,7 +6,7 @@ from sglang.kernels.ops.moe.ep_moe_kernels import zero_experts_compute_triton from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=5, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/observability/test_encoder_server_metrics.py b/test/registered/observability/test_encoder_server_metrics.py index 5b51d2ffe..5bc7a84b8 100644 --- a/test/registered/observability/test_encoder_server_metrics.py +++ b/test/registered/observability/test_encoder_server_metrics.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=180, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=32, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=180, stage="stage-b", runner_config="1-gpu-small-amd") _MODEL_NAME = DEFAULT_SMALL_VLM_MODEL_NAME_FOR_TEST diff --git a/test/registered/observability/test_metrics.py b/test/registered/observability/test_metrics.py index a0ed860cb..5105e54d4 100644 --- a/test/registered/observability/test_metrics.py +++ b/test/registered/observability/test_metrics.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=74, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=144, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=32, suite="stage-b-test-1-gpu-small-amd") _MODEL_NAME = "Qwen/Qwen3-0.6B" diff --git a/test/registered/observability/test_tracing.py b/test/registered/observability/test_tracing.py index 4c9d416a8..48dbe4b92 100644 --- a/test/registered/observability/test_tracing.py +++ b/test/registered/observability/test_tracing.py @@ -46,7 +46,7 @@ from sglang.test.test_utils import ( logger = logging.getLogger(__name__) # CI registration -register_cuda_ci(est_time=113, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=172, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=113, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/observability/test_tracing_disaggregation.py b/test/registered/observability/test_tracing_disaggregation.py index 3d8c478e5..eeab8fc9f 100644 --- a/test/registered/observability/test_tracing_disaggregation.py +++ b/test/registered/observability/test_tracing_disaggregation.py @@ -34,7 +34,7 @@ from sglang.utils import wait_for_http_ready logger = logging.getLogger(__name__) # CI registration - PD disaggregation requires 2 GPUs -register_cuda_ci(est_time=65, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=68, stage="base-b", runner_config="2-gpu-large") class TestTraceDisaggregation(CustomTestCase): diff --git a/test/registered/openai_server/basic/test_http2_server.py b/test/registered/openai_server/basic/test_http2_server.py index db0ceddfb..7bea70a59 100644 --- a/test/registered/openai_server/basic/test_http2_server.py +++ b/test/registered/openai_server/basic/test_http2_server.py @@ -27,7 +27,7 @@ try: except ImportError: _HAS_GRANIAN = False -register_cuda_ci(est_time=150, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=108, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=150, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/basic/test_openai_completion_rust.py b/test/registered/openai_server/basic/test_openai_completion_rust.py index df77a893c..d39a1b14d 100644 --- a/test/registered/openai_server/basic/test_openai_completion_rust.py +++ b/test/registered/openai_server/basic/test_openai_completion_rust.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=80, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=156, stage="base-b", runner_config="1-gpu-small") @unittest.skipUnless( diff --git a/test/registered/openai_server/basic/test_openai_server.py b/test/registered/openai_server/basic/test_openai_server.py index 6b4f3f46c..09a550d85 100644 --- a/test/registered/openai_server/basic/test_openai_server.py +++ b/test/registered/openai_server/basic/test_openai_server.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=300, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=353, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=280, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/basic/test_serving_transcription.py b/test/registered/openai_server/basic/test_serving_transcription.py index 95d3b343e..d63b076b8 100644 --- a/test/registered/openai_server/basic/test_serving_transcription.py +++ b/test/registered/openai_server/basic/test_serving_transcription.py @@ -23,7 +23,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=59, stage="base-b", runner_config="1-gpu-small") WHISPER_MODEL = "openai/whisper-large-v3" AUDIO_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/audios/Trump_WEF_2018_10s.mp3" diff --git a/test/registered/openai_server/features/test_openai_server_hidden_states.py b/test/registered/openai_server/features/test_openai_server_hidden_states.py index 31b5fc2a5..04f49b73a 100644 --- a/test/registered/openai_server/features/test_openai_server_hidden_states.py +++ b/test/registered/openai_server/features/test_openai_server_hidden_states.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=165, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=196, stage="base-b", runner_config="1-gpu-small") register_amd_ci( est_time=140, suite="stage-b-test-1-gpu-small-amd", diff --git a/test/registered/openai_server/function_call/test_anthropic_tool_use.py b/test/registered/openai_server/function_call/test_anthropic_tool_use.py index 2a52e4378..4d3455041 100644 --- a/test/registered/openai_server/function_call/test_anthropic_tool_use.py +++ b/test/registered/openai_server/function_call/test_anthropic_tool_use.py @@ -29,7 +29,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=50, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=51, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=54, suite="stage-b-test-cpu-intel") diff --git a/test/registered/openai_server/function_call/test_openai_function_calling.py b/test/registered/openai_server/function_call/test_openai_function_calling.py index ed45d9e6e..56288335c 100644 --- a/test/registered/openai_server/function_call/test_openai_function_calling.py +++ b/test/registered/openai_server/function_call/test_openai_function_calling.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=100, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=210, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=73, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/validation/test_large_max_new_tokens.py b/test/registered/openai_server/validation/test_large_max_new_tokens.py index 4138d336f..8daa7a83b 100644 --- a/test/registered/openai_server/validation/test_large_max_new_tokens.py +++ b/test/registered/openai_server/validation/test_large_max_new_tokens.py @@ -26,7 +26,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=58, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=59, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=41, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=101, suite="stage-b-test-cpu-intel") diff --git a/test/registered/openai_server/validation/test_matched_stop.py b/test/registered/openai_server/validation/test_matched_stop.py index e8345c504..d2242d54b 100644 --- a/test/registered/openai_server/validation/test_matched_stop.py +++ b/test/registered/openai_server/validation/test_matched_stop.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=52, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=63, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=60, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=83, suite="stage-b-test-cpu-intel") diff --git a/test/registered/openai_server/validation/test_request_length_validation.py b/test/registered/openai_server/validation/test_request_length_validation.py index 3236a6630..c53a1148e 100644 --- a/test/registered/openai_server/validation/test_request_length_validation.py +++ b/test/registered/openai_server/validation/test_request_length_validation.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=49, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=50, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=31, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/page_major/test_page_major_gpt_oss.py b/test/registered/page_major/test_page_major_gpt_oss.py index 54992e93e..1fea671c6 100644 --- a/test/registered/page_major/test_page_major_gpt_oss.py +++ b/test/registered/page_major/test_page_major_gpt_oss.py @@ -14,7 +14,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST_MXFP4_WITH_MOE -register_cuda_ci(est_time=1000, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=276, stage="extra-a", runner_config="1-gpu-large") _UNIFIED_COMMON_ARGS = [ "--enable-unified-memory", diff --git a/test/registered/page_major/test_page_major_qwen_hybrid.py b/test/registered/page_major/test_page_major_qwen_hybrid.py index ea2a1d7f6..032edfcca 100644 --- a/test/registered/page_major/test_page_major_qwen_hybrid.py +++ b/test/registered/page_major/test_page_major_qwen_hybrid.py @@ -15,7 +15,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.test_utils import DEFAULT_HYBRID_GDN_SMALL_MODEL_NAME_FOR_TEST -register_cuda_ci(est_time=1200, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=261, stage="extra-a", runner_config="1-gpu-large") _UNIFIED_COMMON_ARGS = [ "--trust-remote-code", diff --git a/test/registered/perf/test_bench_one_batch_2gpu.py b/test/registered/perf/test_bench_one_batch_2gpu.py index 8be302f5c..212ae9625 100644 --- a/test/registered/perf/test_bench_one_batch_2gpu.py +++ b/test/registered/perf/test_bench_one_batch_2gpu.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=209, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=162, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=630, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/perf/test_bench_serving_1gpu_large.py b/test/registered/perf/test_bench_serving_1gpu_large.py index e178f58bf..69b1c8da5 100644 --- a/test/registered/perf/test_bench_serving_1gpu_large.py +++ b/test/registered/perf/test_bench_serving_1gpu_large.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=286, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=275, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=300, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/perf/test_bench_serving_1gpu_part1.py b/test/registered/perf/test_bench_serving_1gpu_part1.py index 09bc9905f..2a45eb929 100644 --- a/test/registered/perf/test_bench_serving_1gpu_part1.py +++ b/test/registered/perf/test_bench_serving_1gpu_part1.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=1210, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=1264, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/perf/test_bench_serving_1gpu_part2.py b/test/registered/perf/test_bench_serving_1gpu_part2.py index 97c5f6f57..589e21a32 100644 --- a/test/registered/perf/test_bench_serving_1gpu_part2.py +++ b/test/registered/perf/test_bench_serving_1gpu_part2.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=968, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=909, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=900, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/perf/test_bench_serving_2gpu.py b/test/registered/perf/test_bench_serving_2gpu.py index 56712d369..c51c86d56 100644 --- a/test/registered/perf/test_bench_serving_2gpu.py +++ b/test/registered/perf/test_bench_serving_2gpu.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=721, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=687, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=1450, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/perf/test_vlm_perf_5090.py b/test/registered/perf/test_vlm_perf_5090.py index d46c8a316..3193ab547 100644 --- a/test/registered/perf/test_vlm_perf_5090.py +++ b/test/registered/perf/test_vlm_perf_5090.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=180, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=200, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=300, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/pp/test_pp_gemma4.py b/test/registered/pp/test_pp_gemma4.py index 7a352b1d2..c07927c45 100644 --- a/test/registered/pp/test_pp_gemma4.py +++ b/test/registered/pp/test_pp_gemma4.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( ) # tp=1 pp=2 -- two GPUs. -register_cuda_ci(est_time=220, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=221, stage="base-b", runner_config="2-gpu-large") @unittest.skipIf( diff --git a/test/registered/pp/test_pp_parallel_compat.py b/test/registered/pp/test_pp_parallel_compat.py index be848cc4d..9719d3c57 100644 --- a/test/registered/pp/test_pp_parallel_compat.py +++ b/test/registered/pp/test_pp_parallel_compat.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=600, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=363, stage="extra-b", runner_config="4-gpu-h100") QWEN3_MOE_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8" diff --git a/test/registered/pp/test_pp_single_node.py b/test/registered/pp/test_pp_single_node.py index 8ca9c9cb2..d2b6f2e21 100644 --- a/test/registered/pp/test_pp_single_node.py +++ b/test/registered/pp/test_pp_single_node.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import ( run_bench_one_batch_server, ) -register_cuda_ci(est_time=280, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=295, stage="base-c", runner_config="4-gpu-h100") register_amd_ci(est_time=500, suite="stage-c-test-4-gpu-amd") diff --git a/test/registered/pp/test_pp_single_node_extra.py b/test/registered/pp/test_pp_single_node_extra.py index ba3c130a5..19f49f65a 100644 --- a/test/registered/pp/test_pp_single_node_extra.py +++ b/test/registered/pp/test_pp_single_node_extra.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=350, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=342, stage="extra-b", runner_config="4-gpu-h100") register_amd_ci(est_time=350, suite="stage-c-test-4-gpu-amd") diff --git a/test/registered/prefill_only/test_embedding_models.py b/test/registered/prefill_only/test_embedding_models.py index e3f0c4824..bd6d976ef 100644 --- a/test/registered/prefill_only/test_embedding_models.py +++ b/test/registered/prefill_only/test_embedding_models.py @@ -35,7 +35,7 @@ register_amd_ci( suite="stage-b-test-1-gpu-small-amd", disabled="see https://github.com/sgl-project/sglang/issues/11127", ) -register_cuda_ci(est_time=136, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=154, stage="base-b", runner_config="1-gpu-small") MODEL_TO_CONFIG = { "Alibaba-NLP/gte-Qwen2-1.5B-instruct": (1, 1e-5), diff --git a/test/registered/prefill_only/test_multi_item_scoring.py b/test/registered/prefill_only/test_multi_item_scoring.py index aa29486fc..c5c5ab855 100644 --- a/test/registered/prefill_only/test_multi_item_scoring.py +++ b/test/registered/prefill_only/test_multi_item_scoring.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=142, stage="base-b", runner_config="1-gpu-small") TEST_MODEL_NAME = os.environ.get("TEST_MODEL_NAME", DEFAULT_SMALL_MODEL_NAME_FOR_TEST) TEST_CLASSIFICATION_BASE_MODEL = os.environ.get( diff --git a/test/registered/prefill_only/test_openai_embedding.py b/test/registered/prefill_only/test_openai_embedding.py index 20f01951f..8388b3567 100644 --- a/test/registered/prefill_only/test_openai_embedding.py +++ b/test/registered/prefill_only/test_openai_embedding.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=91, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=94, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=141, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=91, suite="stage-b-test-cpu-intel") diff --git a/test/registered/prefill_only/test_pooled_hidden_states.py b/test/registered/prefill_only/test_pooled_hidden_states.py index 8c74cd651..49261a03b 100644 --- a/test/registered/prefill_only/test_pooled_hidden_states.py +++ b/test/registered/prefill_only/test_pooled_hidden_states.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=100, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=111, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/prefill_only/test_reward_models.py b/test/registered/prefill_only/test_reward_models.py index 90f8ead06..195a514f1 100644 --- a/test/registered/prefill_only/test_reward_models.py +++ b/test/registered/prefill_only/test_reward_models.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import CustomTestCase # ============================================================================== -register_cuda_ci(est_time=166, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=188, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=132, suite="stage-b-test-1-gpu-small-amd-nondeterministic") MODELS = [ diff --git a/test/registered/prefill_only/test_score_api.py b/test/registered/prefill_only/test_score_api.py index 0b5f07403..76d8f9873 100644 --- a/test/registered/prefill_only/test_score_api.py +++ b/test/registered/prefill_only/test_score_api.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=71, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=94, stage="base-b", runner_config="1-gpu-small") _MODEL = os.environ.get("TEST_MODEL_NAME", DEFAULT_SMALL_MODEL_NAME_FOR_TEST) diff --git a/test/registered/prefill_only/test_score_engine.py b/test/registered/prefill_only/test_score_engine.py index ded54740c..cab0f8e1c 100644 --- a/test/registered/prefill_only/test_score_engine.py +++ b/test/registered/prefill_only/test_score_engine.py @@ -26,7 +26,7 @@ from sglang.srt.entrypoints.engine import Engine from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase -register_cuda_ci(est_time=85, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=101, stage="base-b", runner_config="1-gpu-small") _CAUSAL_LM_MODEL = os.environ.get("TEST_MODEL_NAME", DEFAULT_SMALL_MODEL_NAME_FOR_TEST) _SEQCLS_MODEL = os.environ.get("TEST_CLASSIFICATION_BASE_MODEL", "Qwen/Qwen3-0.6B") diff --git a/test/registered/prefill_only/test_serving_rerank.py b/test/registered/prefill_only/test_serving_rerank.py index 0555d5f6a..ba7f07108 100644 --- a/test/registered/prefill_only/test_serving_rerank.py +++ b/test/registered/prefill_only/test_serving_rerank.py @@ -7,7 +7,7 @@ from sglang.srt.managers.tokenizer_manager_score_mixin import ScoreResult from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Keep consistent with other openai_server/basic unit tests. -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") try: diff --git a/test/registered/profiling/test_start_profile.py b/test/registered/profiling/test_start_profile.py index 15d2092de..8947b5932 100644 --- a/test/registered/profiling/test_start_profile.py +++ b/test/registered/profiling/test_start_profile.py @@ -29,7 +29,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=42, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=57, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=60, suite="stage-b-test-1-gpu-small-amd") OUTPUT_DIR = "./profiler_dir" diff --git a/test/registered/quant/test_autoround_quantization.py b/test/registered/quant/test_autoround_quantization.py index b2354adef..7ea13b35f 100644 --- a/test/registered/quant/test_autoround_quantization.py +++ b/test/registered/quant/test_autoround_quantization.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=120, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=220, stage="extra-a", runner_config="1-gpu-large") MMLU_NUM_EXAMPLES = 256 MMLU_NUM_THREADS = 32 diff --git a/test/registered/quant/test_awq.py b/test/registered/quant/test_awq.py index f6e219beb..4ef1bfa47 100644 --- a/test/registered/quant/test_awq.py +++ b/test/registered/quant/test_awq.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=160, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=220, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/quant/test_block_int8.py b/test/registered/quant/test_block_int8.py index 6ebd41af2..7dc11ced6 100644 --- a/test/registered/quant/test_block_int8.py +++ b/test/registered/quant/test_block_int8.py @@ -10,7 +10,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=44, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=22, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/quant/test_fp8_kernel.py b/test/registered/quant/test_fp8_kernel.py index 7765fa33c..6ee0b8a14 100644 --- a/test/registered/quant/test_fp8_kernel.py +++ b/test/registered/quant/test_fp8_kernel.py @@ -9,7 +9,7 @@ from sglang.kernels.ops.quantization.fp8_kernel import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") from sglang.srt.utils import get_device, is_cuda, is_xpu diff --git a/test/registered/quant/test_fp8_utils.py b/test/registered/quant/test_fp8_utils.py index 97d149f0c..261e54bd4 100644 --- a/test/registered/quant/test_fp8_utils.py +++ b/test/registered/quant/test_fp8_utils.py @@ -19,7 +19,7 @@ from sglang.srt.runtime_context import get_platform from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") class TestMxfp8MoeScaleLayout(CustomTestCase): diff --git a/test/registered/quant/test_fp8kv_triton.py b/test/registered/quant/test_fp8kv_triton.py index 48b3843c3..895e33494 100644 --- a/test/registered/quant/test_fp8kv_triton.py +++ b/test/registered/quant/test_fp8kv_triton.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=73, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=64, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=94, suite="extra-a-test-1-gpu-large-amd") diff --git a/test/registered/quant/test_gguf.py b/test/registered/quant/test_gguf.py index 55115ab8a..afd9dc7d9 100644 --- a/test/registered/quant/test_gguf.py +++ b/test/registered/quant/test_gguf.py @@ -6,7 +6,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=76, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=142, stage="base-b", runner_config="1-gpu-small") class TestGGUF(CustomTestCase): diff --git a/test/registered/quant/test_gptqmodel_dynamic.py b/test/registered/quant/test_gptqmodel_dynamic.py index 7c435e609..215524471 100644 --- a/test/registered/quant/test_gptqmodel_dynamic.py +++ b/test/registered/quant/test_gptqmodel_dynamic.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=100, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=101, stage="extra-a", runner_config="1-gpu-large") def check_quant_method(model_path: str, use_marlin_kernel: bool): diff --git a/test/registered/quant/test_int8_kernel.py b/test/registered/quant/test_int8_kernel.py index 85cc9ca41..3f22d9cab 100644 --- a/test/registered/quant/test_int8_kernel.py +++ b/test/registered/quant/test_int8_kernel.py @@ -11,7 +11,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=15, suite="nightly-amd-kernel-1-gpu", nightly=True) diff --git a/test/registered/quant/test_is_layer_skipped.py b/test/registered/quant/test_is_layer_skipped.py index 637edb74f..dcd076c76 100644 --- a/test/registered/quant/test_is_layer_skipped.py +++ b/test/registered/quant/test_is_layer_skipped.py @@ -4,7 +4,7 @@ from sglang.srt.layers.quantization.utils import is_layer_skipped from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") # Qwen3-Next FP8 actually publishes the equivalent of this in diff --git a/test/registered/quant/test_kvfp4_quant_dequant.py b/test/registered/quant/test_kvfp4_quant_dequant.py index 69371ac82..1fd0b9be8 100755 --- a/test/registered/quant/test_kvfp4_quant_dequant.py +++ b/test/registered/quant/test_kvfp4_quant_dequant.py @@ -10,7 +10,7 @@ import torch from sglang.srt.layers.quantization.kvfp4_tensor import FP4MXBlock16KVQuantizeUtil from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large") def calculate_accuracy_metrics( diff --git a/test/registered/quant/test_marlin_moe.py b/test/registered/quant/test_marlin_moe.py index e9d6fa18e..6a0260aa0 100644 --- a/test/registered/quant/test_marlin_moe.py +++ b/test/registered/quant/test_marlin_moe.py @@ -12,7 +12,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_marlin_utils import awq_marlin_quantize, marlin_quantize from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=108, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=88, stage="base-b", runner_config="1-gpu-small") set_global_server_args_for_scheduler(ServerArgs(model_path="dummy")) diff --git a/test/registered/quant/test_modelopt_fp8.py b/test/registered/quant/test_modelopt_fp8.py index 0e5b76fe0..3958fbdde 100644 --- a/test/registered/quant/test_modelopt_fp8.py +++ b/test/registered/quant/test_modelopt_fp8.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( # Two classes run from this file: the default server plus the Rust-frontend # variant (when the embedded extension is built), each launches a server + eval. -register_cuda_ci(est_time=124, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=149, stage="base-b", runner_config="1-gpu-large") class TestModeloptFP8(CustomTestCase): diff --git a/test/registered/quant/test_nvfp4_embedding.py b/test/registered/quant/test_nvfp4_embedding.py index 2716aa4eb..99d0c9257 100755 --- a/test/registered/quant/test_nvfp4_embedding.py +++ b/test/registered/quant/test_nvfp4_embedding.py @@ -11,7 +11,7 @@ from sglang.srt.layers.quantization.modelopt_quant import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") GROUP_SIZE = 16 diff --git a/test/registered/quant/test_nvfp4_gemm_sm120.py b/test/registered/quant/test_nvfp4_gemm_sm120.py index 004266df6..af1328a44 100644 --- a/test/registered/quant/test_nvfp4_gemm_sm120.py +++ b/test/registered/quant/test_nvfp4_gemm_sm120.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=109, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=101, stage="base-b", runner_config="1-gpu-small") MODEL_PATH = "nvidia/Llama-3.1-8B-Instruct-NVFP4" diff --git a/test/registered/quant/test_quant_config_parsing.py b/test/registered/quant/test_quant_config_parsing.py index b16ae0b33..164f441b8 100644 --- a/test/registered/quant/test_quant_config_parsing.py +++ b/test/registered/quant/test_quant_config_parsing.py @@ -5,7 +5,7 @@ from sglang.srt.configs.model_config import ModelConfig from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/quant/test_triton_scaled_mm.py b/test/registered/quant/test_triton_scaled_mm.py index 910aab6ff..ab800fcba 100644 --- a/test/registered/quant/test_triton_scaled_mm.py +++ b/test/registered/quant/test_triton_scaled_mm.py @@ -9,7 +9,7 @@ from sglang.srt.utils.common import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=12, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/quant/test_w8a8_quantization.py b/test/registered/quant/test_w8a8_quantization.py index 02160bc92..4989b79aa 100644 --- a/test/registered/quant/test_w8a8_quantization.py +++ b/test/registered/quant/test_w8a8_quantization.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=232, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=204, stage="extra-a", runner_config="1-gpu-large") class BaseW8A8Test(CustomTestCase): diff --git a/test/registered/radix_cache/test_int8_mamba_checkpoint_e2e.py b/test/registered/radix_cache/test_int8_mamba_checkpoint_e2e.py index 8e89e9dc0..82fedc0b1 100644 --- a/test/registered/radix_cache/test_int8_mamba_checkpoint_e2e.py +++ b/test/registered/radix_cache/test_int8_mamba_checkpoint_e2e.py @@ -38,7 +38,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=800, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=344, stage="extra-b", runner_config="4-gpu-h100") class TestInt8MambaCheckpointE2E(KLDivergenceMixin, DefaultServerBase): diff --git a/test/registered/radix_cache/test_mamba2_extra_buffer_kl.py b/test/registered/radix_cache/test_mamba2_extra_buffer_kl.py index 87a79082b..9e6ded12d 100644 --- a/test/registered/radix_cache/test_mamba2_extra_buffer_kl.py +++ b/test/registered/radix_cache/test_mamba2_extra_buffer_kl.py @@ -26,7 +26,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=600, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=154, stage="extra-a", runner_config="1-gpu-large") class TestMamba2ExtraBufferKL(KLDivergenceMixin, DefaultServerBase): diff --git a/test/registered/radix_cache/test_radix_attention.py b/test/registered/radix_cache/test_radix_attention.py index bdce80433..bd28af30b 100644 --- a/test/registered/radix_cache/test_radix_attention.py +++ b/test/registered/radix_cache/test_radix_attention.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( ) # RadixAttention server integration tests -register_cuda_ci(est_time=100, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=148, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=100, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=405, suite="stage-b-test-cpu-intel") diff --git a/test/registered/radix_cache/test_radix_cache_hit.py b/test/registered/radix_cache/test_radix_cache_hit.py index a62eba9ef..197ff9b54 100644 --- a/test/registered/radix_cache/test_radix_cache_hit.py +++ b/test/registered/radix_cache/test_radix_cache_hit.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=55, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=71, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=55, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=113, suite="stage-b-test-cpu-intel") diff --git a/test/registered/radix_cache/test_swa_radix_cache_kl.py b/test/registered/radix_cache/test_swa_radix_cache_kl.py index 918138fe5..a986ad9bd 100644 --- a/test/registered/radix_cache/test_swa_radix_cache_kl.py +++ b/test/registered/radix_cache/test_swa_radix_cache_kl.py @@ -6,7 +6,7 @@ from sglang.test.server_fixtures.default_fixture import DefaultServerBase MODEL = "openai/gpt-oss-20b" -register_cuda_ci(est_time=151, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=198, stage="base-b", runner_config="1-gpu-large") register_cpu_ci(est_time=1602, suite="stage-b-test-cpu-intel") diff --git a/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_dsv4.py b/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_dsv4.py index 59839147e..20224cd0d 100644 --- a/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_dsv4.py +++ b/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_dsv4.py @@ -20,7 +20,7 @@ DSV4_FLASH_MODEL = os.environ.get( ) DSV4_FLASH_LAUNCH_TIMEOUT = 3600 -register_cuda_ci(est_time=1500, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=210, stage="extra-b", runner_config="4-gpu-h100") class TestDeepSeekV4FlashUnifiedCacheLinkerKL( diff --git a/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_glm52.py b/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_glm52.py index 55b6d0b91..6f56b85f2 100644 --- a/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_glm52.py +++ b/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_glm52.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( GLM52_MODEL = os.environ.get("SGLANG_LINKER_GLM52_MODEL", "zai-org/GLM-5.2-FP8") GLM52_LAUNCH_TIMEOUT = 3600 -register_cuda_ci(est_time=1200, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=383, stage="extra-b", runner_config="8-gpu-h200") class TestGLM52UnifiedCacheLinkerKL(UnifiedRadixTreeTestMixin, CustomTestCase): diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_hicache_pp_kl.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_hicache_pp_kl.py index 4433dc30b..6e2e7c921 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_hicache_pp_kl.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_hicache_pp_kl.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=900, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=738, stage="base-c", runner_config="4-gpu-h100") QWEN3_32B_MODEL = "Qwen/Qwen3-32B" diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_cp.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_cp.py index f08194ce1..7e1b96986 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_cp.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_cp.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=950, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=346, stage="extra-b", runner_config="4-gpu-h100") QWEN3_32B_MODEL = "Qwen/Qwen3-32B" diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dcp.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dcp.py index b048f5290..0f1f057a5 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dcp.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dcp.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=1500, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=280, stage="extra-b", runner_config="4-gpu-b200") KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct" DCP_SIZE = 4 diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4.py index e553b433a..557fefadc 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4.py @@ -25,7 +25,7 @@ DSV4_FLASH_MODEL = "sgl-project/DeepSeek-V4-Flash-FP8" DSV4_DSPARK_MODEL = "deepseek-ai/DeepSeek-V4-Flash-DSpark" DSV4_FLASH_LAUNCH_TIMEOUT = 3600 -register_cuda_ci(est_time=4800, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=1865, stage="extra-b", runner_config="4-gpu-h100") def _assert_dsv4_decode_cached_tokens(result, history_len, output_len, label): diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4_pp.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4_pp.py index 6f61dc154..40b6893b5 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4_pp.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4_pp.py @@ -4,7 +4,7 @@ import test_unified_radix_cache_kl_dsv4 as dsv4_kl from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=900, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=478, stage="extra-b", runner_config="8-gpu-h200") class TestUnifiedDeepSeekV4FlashHiCachePP4TP2( diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_full.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_full.py index f8e60fcbd..ff50de352 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_full.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_full.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( unified_radix_tree_server_env, ) -register_cuda_ci(est_time=500, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=415, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=800, suite="stage-b-test-2-gpu-large-amd") FULL_MODEL = "Qwen/Qwen3-32B" diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_glm52.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_glm52.py index 6ec73ca79..5584ade97 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_glm52.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_glm52.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( GLM5_MODEL = "zai-org/GLM-5.2-FP8" GLM5_LAUNCH_TIMEOUT = 3600 -register_cuda_ci(est_time=900, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=340, stage="extra-b", runner_config="8-gpu-h200") class TestGLM5UnifiedRadixCacheL3Accuracy(AccuracyTwoPassMixin, CustomTestCase): diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_hybrid_bitexact.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_hybrid_bitexact.py index aa7583bee..f61553ae8 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_hybrid_bitexact.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_hybrid_bitexact.py @@ -73,7 +73,7 @@ from sglang.test.test_utils import ( unified_radix_tree_server_env, ) -register_cuda_ci(est_time=2300, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=790, stage="base-b", runner_config="1-gpu-large") _MODEL_PATH = os.environ.get("INKLING_TEST_MODEL_PATH", "thinkingmachines/Inkling") _MODEL_REVISION = os.environ.get("INKLING_TEST_MODEL_REVISION", "test") diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_mamba.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_mamba.py index f7bf79dd3..cfd5c9524 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_mamba.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_mamba.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=800, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=742, stage="extra-b", runner_config="4-gpu-h100") MAMBA_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct-FP8" MAMBA_CHUNK_SIZE = 64 diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_swa.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_swa.py index 747aa0364..78a9aaf54 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_swa.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_swa.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=250, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=301, stage="base-b", runner_config="2-gpu-large") SWA_MODEL = "openai/gpt-oss-20b" diff --git a/test/registered/reasoning/test_reasoning.py b/test/registered/reasoning/test_reasoning.py index ac570c635..6af8da2a0 100644 --- a/test/registered/reasoning/test_reasoning.py +++ b/test/registered/reasoning/test_reasoning.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=129, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=100, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/rl/test_fp32_lm_head.py b/test/registered/rl/test_fp32_lm_head.py index 82460fef3..2e0f1676b 100644 --- a/test/registered/rl/test_fp32_lm_head.py +++ b/test/registered/rl/test_fp32_lm_head.py @@ -12,7 +12,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=15, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/rl/test_lora_load_from_tensor.py b/test/registered/rl/test_lora_load_from_tensor.py index 586560e23..bb3a308ab 100644 --- a/test/registered/rl/test_lora_load_from_tensor.py +++ b/test/registered/rl/test_lora_load_from_tensor.py @@ -10,7 +10,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=102, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=104, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=90, suite="stage-b-test-1-gpu-small-amd") MODEL_PATH = "Qwen/Qwen3-0.6B" diff --git a/test/registered/rl/test_multi_instance_release_memory_occupation.py b/test/registered/rl/test_multi_instance_release_memory_occupation.py index 610e77c7b..fcb3b2523 100644 --- a/test/registered/rl/test_multi_instance_release_memory_occupation.py +++ b/test/registered/rl/test_multi_instance_release_memory_occupation.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( find_available_port, ) -register_cuda_ci(est_time=57, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=69, stage="extra-b", runner_config="4-gpu-h100") register_amd_ci( est_time=64, suite="stage-c-test-4-gpu-amd", diff --git a/test/registered/rl/test_patch_torch.py b/test/registered/rl/test_patch_torch.py index b28869e8a..58fb80554 100644 --- a/test/registered/rl/test_patch_torch.py +++ b/test/registered/rl/test_patch_torch.py @@ -9,7 +9,7 @@ import torch.multiprocessing as mp from sglang.srt.utils.patch_torch import monkey_patch_torch_reductions from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=15, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=13, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=30, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/rl/test_pause_generation_tensor_consistency.py b/test/registered/rl/test_pause_generation_tensor_consistency.py index 7871e812e..a6b6427bc 100644 --- a/test/registered/rl/test_pause_generation_tensor_consistency.py +++ b/test/registered/rl/test_pause_generation_tensor_consistency.py @@ -9,7 +9,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/rl/test_return_indexer_topk.py b/test/registered/rl/test_return_indexer_topk.py index 5a478928d..eb0c24096 100644 --- a/test/registered/rl/test_return_indexer_topk.py +++ b/test/registered/rl/test_return_indexer_topk.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=270, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=306, stage="extra-b", runner_config="8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" diff --git a/test/registered/rl/test_return_routed_experts.py b/test/registered/rl/test_return_routed_experts.py index d06e607a5..08533a2ea 100644 --- a/test/registered/rl/test_return_routed_experts.py +++ b/test/registered/rl/test_return_routed_experts.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=400, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=446, stage="extra-b", runner_config="4-gpu-h100") # FP8 variant of Qwen3-30B-A3B: required because DeepEP normal/LL fast paths in # ep_moe/layer.py only run for {Fp8Config (via deep_gemm), W4AFp8Config, aiter, diff --git a/test/registered/rl/test_update_weights_from_disk_blackwell.py b/test/registered/rl/test_update_weights_from_disk_blackwell.py index 67db50d7f..a70286dcb 100644 --- a/test/registered/rl/test_update_weights_from_disk_blackwell.py +++ b/test/registered/rl/test_update_weights_from_disk_blackwell.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=420, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=606, stage="extra-b", runner_config="4-gpu-b200") import time import unittest diff --git a/test/registered/rl/test_update_weights_from_distributed.py b/test/registered/rl/test_update_weights_from_distributed.py index f1cdf8b6d..ec47a3688 100644 --- a/test/registered/rl/test_update_weights_from_distributed.py +++ b/test/registered/rl/test_update_weights_from_distributed.py @@ -43,7 +43,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import terminate_process -register_cuda_ci(est_time=137, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=120, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=400, suite="stage-b-test-2-gpu-large-amd") mp.set_start_method("spawn", force=True) diff --git a/test/registered/rl/test_update_weights_from_tensor.py b/test/registered/rl/test_update_weights_from_tensor.py index 58d924601..d9dd41a60 100644 --- a/test/registered/rl/test_update_weights_from_tensor.py +++ b/test/registered/rl/test_update_weights_from_tensor.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=147, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=165, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=195, suite="stage-b-test-1-gpu-small-amd") import gc diff --git a/test/registered/rotary/test_mrope_axis_map.py b/test/registered/rotary/test_mrope_axis_map.py index 3898ee731..3d60aac50 100644 --- a/test/registered/rotary/test_mrope_axis_map.py +++ b/test/registered/rotary/test_mrope_axis_map.py @@ -12,7 +12,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def build_mrope( diff --git a/test/registered/rotary/test_rope_cache_invalidation.py b/test/registered/rotary/test_rope_cache_invalidation.py index 3fd170e63..be2fbdc5f 100644 --- a/test/registered/rotary/test_rope_cache_invalidation.py +++ b/test/registered/rotary/test_rope_cache_invalidation.py @@ -9,7 +9,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") _ROPE_KWARGS = dict( head_size=64, diff --git a/test/registered/rust/test_run_rust_tests.py b/test/registered/rust/test_run_rust_tests.py index 67679d19f..712d40495 100644 --- a/test/registered/rust/test_run_rust_tests.py +++ b/test/registered/rust/test_run_rust_tests.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import CustomTestCase BUILD_AND_RUN_TIMEOUT_S = 900 RUST_WORKSPACE = Path(__file__).resolve().parents[3] / "rust" -register_cpu_ci(est_time=900, suite="base-a-test-cpu") +register_cpu_ci(est_time=153, suite="base-a-test-cpu") # Exported by _pr-test-stage-cpu.yml as the negation of the check-changes diff --git a/test/registered/rust/test_run_sglang_radix_tree_rust_tests.py b/test/registered/rust/test_run_sglang_radix_tree_rust_tests.py index 4efbec94b..eafb0d188 100644 --- a/test/registered/rust/test_run_sglang_radix_tree_rust_tests.py +++ b/test/registered/rust/test_run_sglang_radix_tree_rust_tests.py @@ -14,7 +14,7 @@ BUILD_AND_RUN_TIMEOUT_S = 900 RUST_WORKSPACE = Path(__file__).resolve().parents[3] / "rust" SGLANG_RADIX_TREE_MANIFEST = RUST_WORKSPACE / "sglang-radix-tree" / "Cargo.toml" -register_cpu_ci(est_time=900, suite="base-a-test-cpu") +register_cpu_ci(est_time=80, suite="base-a-test-cpu") @unittest.skipIf( diff --git a/test/registered/rust/test_rust_extension.py b/test/registered/rust/test_rust_extension.py index 14765771a..b80f45806 100644 --- a/test/registered/rust/test_rust_extension.py +++ b/test/registered/rust/test_rust_extension.py @@ -18,7 +18,7 @@ from sglang.srt.rust_extensions.torch_build import torch_build_configuration from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _hold_filesystem_lock(path: str, ready, release) -> None: diff --git a/test/registered/sampling/test_deterministic_gumbel_u1.py b/test/registered/sampling/test_deterministic_gumbel_u1.py index 4a33fd55e..5457574e1 100644 --- a/test/registered/sampling/test_deterministic_gumbel_u1.py +++ b/test/registered/sampling/test_deterministic_gumbel_u1.py @@ -9,7 +9,7 @@ from sglang.srt.layers.sampler import sampling_from_probs_torch from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=60, suite="stage-b-test-1-gpu-small-amd") VOCAB = 248320 diff --git a/test/registered/sampling/test_original_logprobs.py b/test/registered/sampling/test_original_logprobs.py index c0e4263d1..029a8c784 100644 --- a/test/registered/sampling/test_original_logprobs.py +++ b/test/registered/sampling/test_original_logprobs.py @@ -25,7 +25,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST -register_cuda_ci(est_time=45, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=52, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=60, suite="stage-b-test-1-gpu-small-amd") # ------------------------- Configurable via env ------------------------- # diff --git a/test/registered/sampling/test_penalty.py b/test/registered/sampling/test_penalty.py index 5133d1fab..8f5765840 100644 --- a/test/registered/sampling/test_penalty.py +++ b/test/registered/sampling/test_penalty.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=53, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=61, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=82, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/sampling/test_pytorch_sampling_backend.py b/test/registered/sampling/test_pytorch_sampling_backend.py index d0d804a12..3973412b4 100644 --- a/test/registered/sampling/test_pytorch_sampling_backend.py +++ b/test/registered/sampling/test_pytorch_sampling_backend.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=80, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=108, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=66, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/sampling/test_sampling_mask.py b/test/registered/sampling/test_sampling_mask.py index 70dda4020..aeb9ec6b8 100644 --- a/test/registered/sampling/test_sampling_mask.py +++ b/test/registered/sampling/test_sampling_mask.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=240, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=139, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=320, suite="stage-b-test-1-gpu-small-amd") _MAX_NEW_TOKENS = 4 diff --git a/test/registered/scheduler/test_abort_with_metrics.py b/test/registered/scheduler/test_abort_with_metrics.py index b78d2a2b6..5e955eafa 100644 --- a/test/registered/scheduler/test_abort_with_metrics.py +++ b/test/registered/scheduler/test_abort_with_metrics.py @@ -18,7 +18,7 @@ from sglang.srt.utils.http_middleware_patch import _PureASGIDispatch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") _HTTP_SCOPE = { diff --git a/test/registered/scheduler/test_load_snapshot_server.py b/test/registered/scheduler/test_load_snapshot_server.py index 9dd701801..45e6f1713 100644 --- a/test/registered/scheduler/test_load_snapshot_server.py +++ b/test/registered/scheduler/test_load_snapshot_server.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=300, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=231, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=450, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/scheduler/test_min_free_slots_delayer.py b/test/registered/scheduler/test_min_free_slots_delayer.py index 960469471..1e573bee4 100644 --- a/test/registered/scheduler/test_min_free_slots_delayer.py +++ b/test/registered/scheduler/test_min_free_slots_delayer.py @@ -6,7 +6,7 @@ from sglang.srt.managers.min_free_slots_delayer import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") class TestResolveMinFreeSlots(unittest.TestCase): diff --git a/test/registered/scheduler/test_mixed_chunked_prefill.py b/test/registered/scheduler/test_mixed_chunked_prefill.py index 6af02f554..3a944bca4 100644 --- a/test/registered/scheduler/test_mixed_chunked_prefill.py +++ b/test/registered/scheduler/test_mixed_chunked_prefill.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=167, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=176, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=180, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_priority_scheduling.py b/test/registered/scheduler/test_priority_scheduling.py index 042ac7d2c..bbd2b13a8 100644 --- a/test/registered/scheduler/test_priority_scheduling.py +++ b/test/registered/scheduler/test_priority_scheduling.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( send_concurrent_generate_requests_with_custom_params, ) -register_cuda_ci(est_time=149, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=166, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=195, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_retract_decode.py b/test/registered/scheduler/test_retract_decode.py index 81c598c05..541671c6d 100644 --- a/test/registered/scheduler/test_retract_decode.py +++ b/test/registered/scheduler/test_retract_decode.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import is_in_ci -register_cuda_ci(est_time=215, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=316, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=300, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_retract_decode_logprob.py b/test/registered/scheduler/test_retract_decode_logprob.py index 688e844e3..0e63cccf9 100644 --- a/test/registered/scheduler/test_retract_decode_logprob.py +++ b/test/registered/scheduler/test_retract_decode_logprob.py @@ -56,7 +56,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=300, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=76, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=360, suite="stage-b-test-1-gpu-small-amd") N_REQUESTS = 32 diff --git a/test/registered/scheduler/test_scheduler_control.py b/test/registered/scheduler/test_scheduler_control.py index aa002bb54..4ac9ec28a 100644 --- a/test/registered/scheduler/test_scheduler_control.py +++ b/test/registered/scheduler/test_scheduler_control.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( run_and_check_memory_leak, ) -register_cuda_ci(est_time=367, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=421, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=300, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scripted_runtime/test_scripted_runtime_core.py b/test/registered/scripted_runtime/test_scripted_runtime_core.py index 5e731868d..d6829552e 100644 --- a/test/registered/scripted_runtime/test_scripted_runtime_core.py +++ b/test/registered/scripted_runtime/test_scripted_runtime_core.py @@ -16,7 +16,7 @@ from sglang.test.scripted_runtime_chunked_helpers import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=460, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=297, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=460, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/sessions/test_session_control.py b/test/registered/sessions/test_session_control.py index d255b6436..f7ed8c717 100644 --- a/test/registered/sessions/test_session_control.py +++ b/test/registered/sessions/test_session_control.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=87, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=102, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=87, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/sessions/test_session_latency.py b/test/registered/sessions/test_session_latency.py index 7d85632c7..558ec07fc 100644 --- a/test/registered/sessions/test_session_latency.py +++ b/test/registered/sessions/test_session_latency.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=122, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=113, stage="extra-a", runner_config="1-gpu-large") NUM_TURNS = 150 INPUT_LEN = 16 diff --git a/test/registered/sessions/test_streaming_session.py b/test/registered/sessions/test_streaming_session.py index 8e284a486..06f15f136 100644 --- a/test/registered/sessions/test_streaming_session.py +++ b/test/registered/sessions/test_streaming_session.py @@ -23,7 +23,7 @@ from sglang.test.test_utils import ( DEFAULT_TARGET_MODEL_EAGLE3, ) -register_cuda_ci(est_time=691, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=294, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=691, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/sessions/test_streaming_session_extra.py b/test/registered/sessions/test_streaming_session_extra.py index 2a059b307..96be186e5 100644 --- a/test/registered/sessions/test_streaming_session_extra.py +++ b/test/registered/sessions/test_streaming_session_extra.py @@ -10,7 +10,7 @@ from sglang.test.test_utils import ( DEFAULT_TARGET_MODEL_EAGLE3, ) -register_cuda_ci(est_time=691, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=466, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=562, suite="extra-a-test-1-gpu-large-amd") diff --git a/test/registered/sessions/test_streaming_session_swa.py b/test/registered/sessions/test_streaming_session_swa.py index e18d1541b..be61e8182 100644 --- a/test/registered/sessions/test_streaming_session_swa.py +++ b/test/registered/sessions/test_streaming_session_swa.py @@ -20,7 +20,7 @@ from sglang.test.server_fixtures.streaming_session_fixture import ( StreamingSessionServerBase, ) -register_cuda_ci(est_time=390, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=326, stage="base-b", runner_config="1-gpu-large") class TestStreamingSessionSWA(StreamingSessionServerBase, StreamingSessionKitMixin): diff --git a/test/registered/sessions/test_streaming_session_swa_extra.py b/test/registered/sessions/test_streaming_session_swa_extra.py index ba2dbda46..52b06fbc6 100644 --- a/test/registered/sessions/test_streaming_session_swa_extra.py +++ b/test/registered/sessions/test_streaming_session_swa_extra.py @@ -13,7 +13,7 @@ from sglang.test.server_fixtures.streaming_session_fixture import ( StreamingSessionServerBase, ) -register_cuda_ci(est_time=130, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=145, stage="extra-a", runner_config="1-gpu-large") register_cpu_ci(est_time=449, suite="stage-b-test-cpu-intel") diff --git a/test/registered/spec/dflash/test_dflash.py b/test/registered/spec/dflash/test_dflash.py index 3c831eb3e..ed87bd15f 100644 --- a/test/registered/spec/dflash/test_dflash.py +++ b/test/registered/spec/dflash/test_dflash.py @@ -23,7 +23,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=500, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=1078, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=420, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/spec/dspark/test_dspark_block_accept_estimator.py b/test/registered/spec/dspark/test_dspark_block_accept_estimator.py index ab11d2de1..583fba422 100644 --- a/test/registered/spec/dspark/test_dspark_block_accept_estimator.py +++ b/test/registered/spec/dspark/test_dspark_block_accept_estimator.py @@ -12,7 +12,7 @@ from sglang.srt.speculative.dspark_components.dspark_block_accept_estimator impo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") _GAMMA = 3 _VOCAB = 8 diff --git a/test/registered/spec/dspark/test_dspark_confidence_metrics.py b/test/registered/spec/dspark/test_dspark_confidence_metrics.py index a91eb777b..61d7436bc 100644 --- a/test/registered/spec/dspark/test_dspark_confidence_metrics.py +++ b/test/registered/spec/dspark/test_dspark_confidence_metrics.py @@ -10,7 +10,7 @@ from sglang.srt.speculative.dspark_components.dspark_observability import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _cpu_metrics(gamma: int) -> PerPositionConfidenceMetrics: diff --git a/test/registered/spec/dspark/test_dspark_dp_tier.py b/test/registered/spec/dspark/test_dspark_dp_tier.py index fea083eef..5ea44346e 100644 --- a/test/registered/spec/dspark/test_dspark_dp_tier.py +++ b/test/registered/spec/dspark/test_dspark_dp_tier.py @@ -13,7 +13,7 @@ from sglang.srt.speculative.dspark_components.dspark_planner import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestLocalVerifyTierNumTokens(CustomTestCase): diff --git a/test/registered/spec/dspark/test_dspark_draft_path_default.py b/test/registered/spec/dspark/test_dspark_draft_path_default.py index b6bd55bf7..c9cf44b58 100644 --- a/test/registered/spec/dspark/test_dspark_draft_path_default.py +++ b/test/registered/spec/dspark/test_dspark_draft_path_default.py @@ -11,7 +11,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") _BUNDLED_MODEL_PATH = "deepseek-ai/DeepSeek-V4-Flash-DSpark" _PLAIN_MODEL_PATH = "deepseek-ai/DeepSeek-V4-Flash" diff --git a/test/registered/spec/dspark/test_dspark_info_dumper.py b/test/registered/spec/dspark/test_dspark_info_dumper.py index 10703ca79..abd328735 100644 --- a/test/registered/spec/dspark/test_dspark_info_dumper.py +++ b/test/registered/spec/dspark/test_dspark_info_dumper.py @@ -22,7 +22,7 @@ from sglang.srt.utils.msgspec_utils import msgspec_to_builtins from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class FakeClock: diff --git a/test/registered/spec/dspark/test_dspark_kernel_parity.py b/test/registered/spec/dspark/test_dspark_kernel_parity.py index 376ab2182..ed583d08a 100644 --- a/test/registered/spec/dspark/test_dspark_kernel_parity.py +++ b/test/registered/spec/dspark/test_dspark_kernel_parity.py @@ -30,7 +30,7 @@ from sglang.srt.speculative.ragged_verify import RaggedVerifyLayout from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") DEVICE = torch.device("cuda") VOCAB = 129280 diff --git a/test/registered/spec/dspark/test_dspark_scheduler.py b/test/registered/spec/dspark/test_dspark_scheduler.py index a76131ca2..bc1a030a6 100644 --- a/test/registered/spec/dspark/test_dspark_scheduler.py +++ b/test/registered/spec/dspark/test_dspark_scheduler.py @@ -22,7 +22,7 @@ from sglang.srt.speculative.ragged_verify import RaggedVerifyLayout from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _flat_table( diff --git a/test/registered/spec/dspark/test_dspark_sps_profiler.py b/test/registered/spec/dspark/test_dspark_sps_profiler.py index be191e8a4..bee60c517 100644 --- a/test/registered/spec/dspark/test_dspark_sps_profiler.py +++ b/test/registered/spec/dspark/test_dspark_sps_profiler.py @@ -15,7 +15,7 @@ from sglang.benchmark.dspark_sps_profiler import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def make_load_info() -> LoadInfo: diff --git a/test/registered/spec/dspark/test_dspark_sps_table.py b/test/registered/spec/dspark/test_dspark_sps_table.py index ba78ea938..bdab10159 100644 --- a/test/registered/spec/dspark/test_dspark_sps_table.py +++ b/test/registered/spec/dspark/test_dspark_sps_table.py @@ -13,7 +13,7 @@ from sglang.srt.speculative.dspark_components.dspark_sps import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _make_table() -> SpsCostTable: diff --git a/test/registered/spec/dspark/test_dspark_stacked_ctx_kv_parity.py b/test/registered/spec/dspark/test_dspark_stacked_ctx_kv_parity.py index 951870fe7..6a5f6dda7 100644 --- a/test/registered/spec/dspark/test_dspark_stacked_ctx_kv_parity.py +++ b/test/registered/spec/dspark/test_dspark_stacked_ctx_kv_parity.py @@ -19,7 +19,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-small") DEVICE = torch.device("cuda") HEAD_DIM = 64 diff --git a/test/registered/spec/dspark/test_dspark_sts.py b/test/registered/spec/dspark/test_dspark_sts.py index 2d32a9bef..b7b890c65 100644 --- a/test/registered/spec/dspark/test_dspark_sts.py +++ b/test/registered/spec/dspark/test_dspark_sts.py @@ -17,7 +17,7 @@ from sglang.srt.speculative.dspark_components.dspark_sts import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestApplySts(CustomTestCase): diff --git a/test/registered/spec/eagle/test_adaptive_speculative.py b/test/registered/spec/eagle/test_adaptive_speculative.py index 15add0fa0..1250369a0 100644 --- a/test/registered/spec/eagle/test_adaptive_speculative.py +++ b/test/registered/spec/eagle/test_adaptive_speculative.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=160, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=240, suite="stage-b-test-1-gpu-large-amd") HIGH_ACCEPT_PROMPT = ( diff --git a/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py b/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py index 346886491..bc03a007c 100644 --- a/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py +++ b/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=340, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=351, stage="base-c", runner_config="4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/spec/eagle/test_eagle_constrained_decoding.py b/test/registered/spec/eagle/test_eagle_constrained_decoding.py index a1fecde38..1541354c6 100644 --- a/test/registered/spec/eagle/test_eagle_constrained_decoding.py +++ b/test/registered/spec/eagle/test_eagle_constrained_decoding.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=116, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=107, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=165, stage="stage-b", runner_config="1-gpu-large-amd") diff --git a/test/registered/spec/eagle/test_eagle_dp_attention.py b/test/registered/spec/eagle/test_eagle_dp_attention.py index a70e80814..111429a6f 100644 --- a/test/registered/spec/eagle/test_eagle_dp_attention.py +++ b/test/registered/spec/eagle/test_eagle_dp_attention.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( ) # EAGLE3 with DP attention (tp=2, dp=2, requires 4 GPUs). -register_cuda_ci(est_time=99, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=112, stage="base-c", runner_config="4-gpu-h100") register_amd_ci(est_time=200, suite="stage-c-test-4-gpu-amd") diff --git a/test/registered/spec/eagle/test_eagle_reject_sampling.py b/test/registered/spec/eagle/test_eagle_reject_sampling.py index 99fb23100..feb82f333 100644 --- a/test/registered/spec/eagle/test_eagle_reject_sampling.py +++ b/test/registered/spec/eagle/test_eagle_reject_sampling.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=300, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=81, stage="base-b", runner_config="2-gpu-large") QWEN35_MODEL = "Qwen/Qwen3.5-9B" SERVER_LAUNCH_TIMEOUT = 600 diff --git a/test/registered/spec/eagle/test_spec_eagle.py b/test/registered/spec/eagle/test_spec_eagle.py index 21ac87fc2..3a4337215 100644 --- a/test/registered/spec/eagle/test_spec_eagle.py +++ b/test/registered/spec/eagle/test_spec_eagle.py @@ -20,7 +20,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base -register_cuda_ci(est_time=480, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=403, stage="base-b", runner_config="1-gpu-small") _KITS = ( SpecCorrectnessKit, diff --git a/test/registered/spec/eagle/test_spec_eagle_fa3.py b/test/registered/spec/eagle/test_spec_eagle_fa3.py index 2992cfa1b..6196ff72e 100644 --- a/test/registered/spec/eagle/test_spec_eagle_fa3.py +++ b/test/registered/spec/eagle/test_spec_eagle_fa3.py @@ -17,7 +17,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base, EagleLlama2Base -register_cuda_ci(est_time=250, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=281, stage="base-b", runner_config="1-gpu-large") class TestEagle3Fa3(Eagle3Base, SpecAccuracyKit, SpecLogprobKit): diff --git a/test/registered/spec/eagle/test_spec_eagle_page.py b/test/registered/spec/eagle/test_spec_eagle_page.py index 375469767..182dd2585 100644 --- a/test/registered/spec/eagle/test_spec_eagle_page.py +++ b/test/registered/spec/eagle/test_spec_eagle_page.py @@ -16,7 +16,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base -register_cuda_ci(est_time=230, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=210, stage="base-b", runner_config="1-gpu-small") class TestEagle3Page64( diff --git a/test/registered/spec/eagle/test_spec_eagle_parity.py b/test/registered/spec/eagle/test_spec_eagle_parity.py index 751749511..8c114e693 100644 --- a/test/registered/spec/eagle/test_spec_eagle_parity.py +++ b/test/registered/spec/eagle/test_spec_eagle_parity.py @@ -12,7 +12,7 @@ from sglang.test.ci.ci_register import register_cuda_ci, register_xpu_ci from sglang.test.kits.spec_server_kits import SpecParityKit from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base -register_cuda_ci(est_time=360, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=126, stage="base-b", runner_config="1-gpu-large") register_xpu_ci(est_time=360, suite="nightly-xpu-1-gpu", nightly=True) _is_xpu = is_xpu() diff --git a/test/registered/spec/eagle/test_spec_eagle_stress.py b/test/registered/spec/eagle/test_spec_eagle_stress.py index 5e1a4d109..cea766e22 100644 --- a/test/registered/spec/eagle/test_spec_eagle_stress.py +++ b/test/registered/spec/eagle/test_spec_eagle_stress.py @@ -17,7 +17,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base, EagleLlama2Base -register_cuda_ci(est_time=440, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=675, stage="base-b", runner_config="1-gpu-large") class TestEagle3Perf(Eagle3Base, SpecPerfKit): diff --git a/test/registered/spec/eagle/test_spec_eagle_topk.py b/test/registered/spec/eagle/test_spec_eagle_topk.py index 7bf7113ea..0453bcf96 100644 --- a/test/registered/spec/eagle/test_spec_eagle_topk.py +++ b/test/registered/spec/eagle/test_spec_eagle_topk.py @@ -20,7 +20,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base, EagleLlama2Base -register_cuda_ci(est_time=870, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=876, stage="base-b", runner_config="1-gpu-small") class TestEagle3Topk16( diff --git a/test/registered/spec/eagle/test_spec_eagle_topk_page.py b/test/registered/spec/eagle/test_spec_eagle_topk_page.py index 7d38c42eb..3a7fb679f 100644 --- a/test/registered/spec/eagle/test_spec_eagle_topk_page.py +++ b/test/registered/spec/eagle/test_spec_eagle_topk_page.py @@ -18,7 +18,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base -register_cuda_ci(est_time=345, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=296, stage="base-b", runner_config="1-gpu-small") class TestEagle3Page4Topk8(Eagle3Base, SpecAccuracyKit, SpecLogprobKit, SpecFeatureKit): diff --git a/test/registered/spec/eagle/test_spec_eagle_triton.py b/test/registered/spec/eagle/test_spec_eagle_triton.py index e8f94e987..1143fd1b8 100644 --- a/test/registered/spec/eagle/test_spec_eagle_triton.py +++ b/test/registered/spec/eagle/test_spec_eagle_triton.py @@ -18,7 +18,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base -register_cuda_ci(est_time=230, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=191, stage="base-b", runner_config="1-gpu-small") class TestEagle3Triton( diff --git a/test/registered/spec/test_constrained_decoding_spec_reasoning.py b/test/registered/spec/test_constrained_decoding_spec_reasoning.py index 97eda0d8c..b6a088eca 100644 --- a/test/registered/spec/test_constrained_decoding_spec_reasoning.py +++ b/test/registered/spec/test_constrained_decoding_spec_reasoning.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( ) # Constrained decoding with EAGLE3 speculative reasoning (tp=2) -register_cuda_ci(est_time=137, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=113, stage="base-b", runner_config="2-gpu-large") class ServerWithGrammar(CustomTestCase): diff --git a/test/registered/spec/test_frozen_kv_mtp.py b/test/registered/spec/test_frozen_kv_mtp.py index 3f9bbd035..96d23882d 100644 --- a/test/registered/spec/test_frozen_kv_mtp.py +++ b/test/registered/spec/test_frozen_kv_mtp.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=300, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=450, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/spec/test_gemma4_dflash_31b_extra.py b/test/registered/spec/test_gemma4_dflash_31b_extra.py index d521a2caa..6b0d0d6ec 100644 --- a/test/registered/spec/test_gemma4_dflash_31b_extra.py +++ b/test/registered/spec/test_gemma4_dflash_31b_extra.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=720, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=92, stage="extra-a", runner_config="2-gpu-large") MODEL_NAME = "31B" TARGET_PATH = "google/gemma-4-31B-it" diff --git a/test/registered/spec/test_gemma4_mtp_31b_extra.py b/test/registered/spec/test_gemma4_mtp_31b_extra.py index 608848a56..ea8aecae7 100644 --- a/test/registered/spec/test_gemma4_mtp_31b_extra.py +++ b/test/registered/spec/test_gemma4_mtp_31b_extra.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=720, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=179, stage="extra-a", runner_config="2-gpu-large") MODEL_NAME = "31B" TARGET_PATH = "google/gemma-4-31B-it" diff --git a/test/registered/spec/test_spec_mixed_chunk.py b/test/registered/spec/test_spec_mixed_chunk.py index 8fe1d85ac..45e63e0b2 100644 --- a/test/registered/spec/test_spec_mixed_chunk.py +++ b/test/registered/spec/test_spec_mixed_chunk.py @@ -32,7 +32,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=800, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=196, stage="base-b", runner_config="1-gpu-large") class TestEagle3MixedChunk( diff --git a/test/registered/spec/test_spec_ngram.py b/test/registered/spec/test_spec_ngram.py index 4a96166d7..f388d0645 100644 --- a/test/registered/spec/test_spec_ngram.py +++ b/test/registered/spec/test_spec_ngram.py @@ -10,7 +10,7 @@ from sglang.test.server_fixtures.ngram_fixture import NgramServerBase # Per-commit: Paged backend only. # - FA3 base test archived to test/manual/spec/test_spec_ngram_fa3.py # - Triton + Flashinfer moved to test_spec_ngram_extra.py -register_cuda_ci(est_time=460, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=82, stage="base-b", runner_config="1-gpu-large") class TestNgramSpeculativeDecodingPaged( diff --git a/test/registered/spec/test_spec_ngram_extra.py b/test/registered/spec/test_spec_ngram_extra.py index b0cb4d44b..8a5f7096e 100644 --- a/test/registered/spec/test_spec_ngram_extra.py +++ b/test/registered/spec/test_spec_ngram_extra.py @@ -8,7 +8,7 @@ from sglang.test.server_fixtures.ngram_fixture import NgramServerBase # Extra: Triton + Flashinfer NGRAM backends + non-overlap (sync V2) variant. # Sibling per-commit file (test_spec_ngram.py) keeps the Paged variant. -register_cuda_ci(est_time=400, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=197, stage="extra-a", runner_config="1-gpu-large") class TestNgramSpeculativeDecodingTriton(NgramServerBase, GSM8KMixin): diff --git a/test/registered/spec/test_spec_standalone.py b/test/registered/spec/test_spec_standalone.py index 041791519..96d171b21 100644 --- a/test/registered/spec/test_spec_standalone.py +++ b/test/registered/spec/test_spec_standalone.py @@ -10,7 +10,7 @@ from sglang.test.test_utils import CustomTestCase, is_in_ci # deployed on); triton / flashinfer stay runnable locally, and their spec verify # numerics live in attention/unittests/dense/test_{triton,flashinfer}.py. # Non-V2 backends moved to test_spec_standalone_extra.py. -register_cuda_ci(est_time=170, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=74, stage="base-b", runner_config="1-gpu-large") class TestStandaloneV2SpeculativeDecodingBase( diff --git a/test/registered/spec/test_spec_standalone_extra.py b/test/registered/spec/test_spec_standalone_extra.py index 4a5c2da7a..c43dbeb02 100644 --- a/test/registered/spec/test_spec_standalone_extra.py +++ b/test/registered/spec/test_spec_standalone_extra.py @@ -7,7 +7,7 @@ from sglang.test.test_utils import CustomTestCase # Non-V2 standalone speculative decoding tests (FA3, Triton, FlashInfer # backends). Sibling V2 classes stay per-commit in test_spec_standalone.py. -register_cuda_ci(est_time=406, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=225, stage="extra-a", runner_config="1-gpu-large") # AMD: fa3 / flashinfer attention backends are not built in the ROCm # sgl_kernel, so only the triton-backend class runs on ROCm (the fa3 and # flashinfer classes are skipped on ROCm below). diff --git a/test/registered/spec/utils/test_build_eagle_tree.py b/test/registered/spec/utils/test_build_eagle_tree.py index b3b38a576..d2be6496b 100644 --- a/test/registered/spec/utils/test_build_eagle_tree.py +++ b/test/registered/spec/utils/test_build_eagle_tree.py @@ -9,7 +9,7 @@ from sglang.srt.speculative.eagle_utils import ( from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=4, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/tokenizer/test_skip_tokenizer_init.py b/test/registered/tokenizer/test_skip_tokenizer_init.py index f9861d8fe..92893a208 100644 --- a/test/registered/tokenizer/test_skip_tokenizer_init.py +++ b/test/registered/tokenizer/test_skip_tokenizer_init.py @@ -23,7 +23,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=79, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=117, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=117, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/batch_overlap/test_tbo_children_dummy_token_mask.py b/test/registered/unit/batch_overlap/test_tbo_children_dummy_token_mask.py index b020ec5da..9430a5faa 100644 --- a/test/registered/unit/batch_overlap/test_tbo_children_dummy_token_mask.py +++ b/test/registered/unit/batch_overlap/test_tbo_children_dummy_token_mask.py @@ -26,7 +26,7 @@ from sglang.srt.runtime_context import get_context, get_device, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _make_extend_batch(*, padded_num_tokens: int, global_num_token_non_padded_cpu: int): diff --git a/test/registered/unit/batch_overlap/test_tbo_cuda_graph_num_token_device.py b/test/registered/unit/batch_overlap/test_tbo_cuda_graph_num_token_device.py index b2ee74483..fc3fc7530 100644 --- a/test/registered/unit/batch_overlap/test_tbo_cuda_graph_num_token_device.py +++ b/test/registered/unit/batch_overlap/test_tbo_cuda_graph_num_token_device.py @@ -29,7 +29,7 @@ from sglang.srt.runtime_context import get_context, get_device from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestTboCudaGraphNumTokenDevice(CustomTestCase): diff --git a/test/registered/unit/batch_overlap/test_tbo_filter_batch_marker.py b/test/registered/unit/batch_overlap/test_tbo_filter_batch_marker.py index 2077e3b09..b18d00b49 100644 --- a/test/registered/unit/batch_overlap/test_tbo_filter_batch_marker.py +++ b/test/registered/unit/batch_overlap/test_tbo_filter_batch_marker.py @@ -15,7 +15,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _make_target_verify_batch(bs: int) -> ForwardBatch: diff --git a/test/registered/unit/beam_search/test_beam_search_core.py b/test/registered/unit/beam_search/test_beam_search_core.py index fb3d720be..c22fce99f 100644 --- a/test/registered/unit/beam_search/test_beam_search_core.py +++ b/test/registered/unit/beam_search/test_beam_search_core.py @@ -20,7 +20,7 @@ from sglang.srt.beam_search import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def T(data, dtype): diff --git a/test/registered/unit/beam_search/test_fork.py b/test/registered/unit/beam_search/test_fork.py index 21456d9af..a199b6155 100644 --- a/test/registered/unit/beam_search/test_fork.py +++ b/test/registered/unit/beam_search/test_fork.py @@ -18,7 +18,7 @@ from sglang.srt.managers.schedule_batch import ReqKvInfo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestRemapKvMapping(CustomTestCase): diff --git a/test/registered/unit/beam_search/test_output_decode.py b/test/registered/unit/beam_search/test_output_decode.py index 6680a2471..21a8f0e59 100644 --- a/test/registered/unit/beam_search/test_output_decode.py +++ b/test/registered/unit/beam_search/test_output_decode.py @@ -19,7 +19,7 @@ from sglang.srt.managers.detokenizer_manager import DetokenizerManager from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") STOP_ID = 99 diff --git a/test/registered/unit/bench/test_mmmu_eval_utils.py b/test/registered/unit/bench/test_mmmu_eval_utils.py index 950d973a1..bc72a8b55 100644 --- a/test/registered/unit/bench/test_mmmu_eval_utils.py +++ b/test/registered/unit/bench/test_mmmu_eval_utils.py @@ -15,7 +15,7 @@ except ModuleNotFoundError: pass -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _load_mmmu_eval_utils(): diff --git a/test/registered/unit/cli/test_serve_backends.py b/test/registered/unit/cli/test_serve_backends.py index 50e0fc97c..f76cb089b 100644 --- a/test/registered/unit/cli/test_serve_backends.py +++ b/test/registered/unit/cli/test_serve_backends.py @@ -14,7 +14,7 @@ from sglang.cli.serve_backends import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") def _make_entry_point(name, factory, distribution=None): diff --git a/test/registered/unit/compilation/test_torch_compile_decoration.py b/test/registered/unit/compilation/test_torch_compile_decoration.py index 82d7b2464..7d9446666 100644 --- a/test/registered/unit/compilation/test_torch_compile_decoration.py +++ b/test/registered/unit/compilation/test_torch_compile_decoration.py @@ -6,7 +6,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") from sglang.srt.compilation.compile import ( _infer_dynamic_arg_dims_from_annotations, diff --git a/test/registered/unit/configs/test_cohere2_moe_config.py b/test/registered/unit/configs/test_cohere2_moe_config.py index 6aada5d55..086674e8a 100644 --- a/test/registered/unit/configs/test_cohere2_moe_config.py +++ b/test/registered/unit/configs/test_cohere2_moe_config.py @@ -12,7 +12,7 @@ import unittest from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestCohere2MoeConfig(CustomTestCase): diff --git a/test/registered/unit/configs/test_embedding_model_spec.py b/test/registered/unit/configs/test_embedding_model_spec.py index bd8850c4b..23dff1878 100644 --- a/test/registered/unit/configs/test_embedding_model_spec.py +++ b/test/registered/unit/configs/test_embedding_model_spec.py @@ -14,7 +14,7 @@ from sglang.srt.configs.embedding_model_spec import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") class TestEmbeddingModelSpec(unittest.TestCase): diff --git a/test/registered/unit/configs/test_laguna_config.py b/test/registered/unit/configs/test_laguna_config.py index 04b1750f9..3e39b5987 100644 --- a/test/registered/unit/configs/test_laguna_config.py +++ b/test/registered/unit/configs/test_laguna_config.py @@ -19,7 +19,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") # (factor, attention_factor). S/XS ship attention_factor == the yarn default for # their factor; _NON_DEFAULT differs from both 1.0 and the default, so a naive diff --git a/test/registered/unit/configs/test_linear_attn_model_registry.py b/test/registered/unit/configs/test_linear_attn_model_registry.py index 6cb570b52..82c662c66 100644 --- a/test/registered/unit/configs/test_linear_attn_model_registry.py +++ b/test/registered/unit/configs/test_linear_attn_model_registry.py @@ -13,7 +13,7 @@ from sglang.srt.configs.linear_attn_model_registry import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") # Dummy config classes for testing diff --git a/test/registered/unit/configs/test_locate_anything_config.py b/test/registered/unit/configs/test_locate_anything_config.py index 35404cb8b..97ea6f700 100644 --- a/test/registered/unit/configs/test_locate_anything_config.py +++ b/test/registered/unit/configs/test_locate_anything_config.py @@ -9,7 +9,7 @@ from sglang.srt.configs.kimi_vl_moonvit import MoonViTConfig from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestLocateAnythingConfig(CustomTestCase): diff --git a/test/registered/unit/configs/test_minicpm_config.py b/test/registered/unit/configs/test_minicpm_config.py index 9d1955bed..e97f3c3b8 100644 --- a/test/registered/unit/configs/test_minicpm_config.py +++ b/test/registered/unit/configs/test_minicpm_config.py @@ -29,7 +29,7 @@ from sglang.srt.models.minicpm import ( from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def test_minicpm_lightning_config_defaults_are_complete(): diff --git a/test/registered/unit/configs/test_model_config.py b/test/registered/unit/configs/test_model_config.py index 778928154..6ef9629a4 100644 --- a/test/registered/unit/configs/test_model_config.py +++ b/test/registered/unit/configs/test_model_config.py @@ -11,7 +11,7 @@ from sglang.srt.configs.model_config import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestHybridLayerIds(CustomTestCase): diff --git a/test/registered/unit/configs/test_model_config_parser_registry.py b/test/registered/unit/configs/test_model_config_parser_registry.py index 01e319989..c64781426 100644 --- a/test/registered/unit/configs/test_model_config_parser_registry.py +++ b/test/registered/unit/configs/test_model_config_parser_registry.py @@ -13,7 +13,7 @@ from sglang.srt.configs.model_config_parser_registry import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _FakeParser(ModelConfigParserBase): diff --git a/test/registered/unit/configs/test_model_config_scaling.py b/test/registered/unit/configs/test_model_config_scaling.py index f2b0a6f76..6483890d2 100644 --- a/test/registered/unit/configs/test_model_config_scaling.py +++ b/test/registered/unit/configs/test_model_config_scaling.py @@ -6,7 +6,7 @@ from sglang.srt.configs.model_config import ModelConfig, compute_mla_mscale_scal from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _mla_scaling(rope_scaling) -> tuple[float, float]: diff --git a/test/registered/unit/configs/test_model_config_shapes.py b/test/registered/unit/configs/test_model_config_shapes.py index dc12db3ac..651dc87d7 100644 --- a/test/registered/unit/configs/test_model_config_shapes.py +++ b/test/registered/unit/configs/test_model_config_shapes.py @@ -10,7 +10,7 @@ from sglang.srt.configs.model_config import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _make_text_config(**overrides): diff --git a/test/registered/unit/configs/test_multimodal_piecewise_cuda_graph.py b/test/registered/unit/configs/test_multimodal_piecewise_cuda_graph.py index b92d46f54..a9f19642a 100644 --- a/test/registered/unit/configs/test_multimodal_piecewise_cuda_graph.py +++ b/test/registered/unit/configs/test_multimodal_piecewise_cuda_graph.py @@ -30,7 +30,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestMultimodalPiecewiseCudaGraph(CustomTestCase): diff --git a/test/registered/unit/configs/test_zaya_config.py b/test/registered/unit/configs/test_zaya_config.py index a51fd4f98..9642b889f 100644 --- a/test/registered/unit/configs/test_zaya_config.py +++ b/test/registered/unit/configs/test_zaya_config.py @@ -8,7 +8,7 @@ from sglang.srt.configs.zaya import ZayaConfig, register_zaya_config from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestZayaConfig(CustomTestCase): diff --git a/test/registered/unit/constrained/test_e2e_constrained_reasoning.py b/test/registered/unit/constrained/test_e2e_constrained_reasoning.py index 1be3c4e46..1d64425ac 100644 --- a/test/registered/unit/constrained/test_e2e_constrained_reasoning.py +++ b/test/registered/unit/constrained/test_e2e_constrained_reasoning.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=96, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=120, suite="stage-b-test-1-gpu-small-amd") MODEL = "Qwen/Qwen3-0.6B" diff --git a/test/registered/unit/constrained/test_llguidance_batched_mask.py b/test/registered/unit/constrained/test_llguidance_batched_mask.py index 23b4362ee..5737aa353 100644 --- a/test/registered/unit/constrained/test_llguidance_batched_mask.py +++ b/test/registered/unit/constrained/test_llguidance_batched_mask.py @@ -11,7 +11,7 @@ from sglang.srt.constrained.llguidance_backend import GuidanceBackend, GuidanceG from sglang.srt.runtime_context import get_resources from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _REGEX = r"[0-9]{1,8}" diff --git a/test/registered/unit/constrained/test_mistral_common_xgrammar.py b/test/registered/unit/constrained/test_mistral_common_xgrammar.py index 9fe118585..ca0a19690 100644 --- a/test/registered/unit/constrained/test_mistral_common_xgrammar.py +++ b/test/registered/unit/constrained/test_mistral_common_xgrammar.py @@ -7,7 +7,7 @@ from sglang.srt.utils.hf_transformers.mistral_utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") VOCAB_SIZE = 300 NUM_SPECIAL = 8 diff --git a/test/registered/unit/disaggregation/test_dcp_pack.py b/test/registered/unit/disaggregation/test_dcp_pack.py index 9bd7d9b6e..c8990ef39 100644 --- a/test/registered/unit/disaggregation/test_dcp_pack.py +++ b/test/registered/unit/disaggregation/test_dcp_pack.py @@ -16,7 +16,7 @@ from sglang.srt.disaggregation.common.utils import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestPackedDcpGrouping(CustomTestCase): diff --git a/test/registered/unit/disaggregation/test_decode_hicache_tree_core.py b/test/registered/unit/disaggregation/test_decode_hicache_tree_core.py index d5902cb14..245756b50 100644 --- a/test/registered/unit/disaggregation/test_decode_hicache_tree_core.py +++ b/test/registered/unit/disaggregation/test_decode_hicache_tree_core.py @@ -13,7 +13,7 @@ from sglang.srt.disaggregation.decode_hicache_mixin import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestDecodeHiCacheTreeCore(CustomTestCase): diff --git a/test/registered/unit/disaggregation/test_decode_queue_cleanup.py b/test/registered/unit/disaggregation/test_decode_queue_cleanup.py index 98115b6b5..8235cc6f8 100644 --- a/test/registered/unit/disaggregation/test_decode_queue_cleanup.py +++ b/test/registered/unit/disaggregation/test_decode_queue_cleanup.py @@ -18,7 +18,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class FakeReceiver: diff --git a/test/registered/unit/disaggregation/test_decode_req_to_token_pool.py b/test/registered/unit/disaggregation/test_decode_req_to_token_pool.py index ea38e92c6..654afe253 100644 --- a/test/registered/unit/disaggregation/test_decode_req_to_token_pool.py +++ b/test/registered/unit/disaggregation/test_decode_req_to_token_pool.py @@ -9,7 +9,7 @@ from sglang.srt.disaggregation.decode import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _init_decode_pool(pool): diff --git a/test/registered/unit/disaggregation/test_deferred_decode_kv_release.py b/test/registered/unit/disaggregation/test_deferred_decode_kv_release.py index 3f33c3d07..0a8936f21 100644 --- a/test/registered/unit/disaggregation/test_deferred_decode_kv_release.py +++ b/test/registered/unit/disaggregation/test_deferred_decode_kv_release.py @@ -18,7 +18,7 @@ from sglang.srt.disaggregation.decode import DecodeTransferQueue from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _make_manager(): diff --git a/test/registered/unit/disaggregation/test_disaggregation_wire.py b/test/registered/unit/disaggregation/test_disaggregation_wire.py index 15e6eda1a..a2bdf5aab 100644 --- a/test/registered/unit/disaggregation/test_disaggregation_wire.py +++ b/test/registered/unit/disaggregation/test_disaggregation_wire.py @@ -46,7 +46,7 @@ from sglang.srt.speculative.eagle_disaggregation import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestDisaggregationWire(unittest.TestCase): diff --git a/test/registered/unit/disaggregation/test_encode_receiver.py b/test/registered/unit/disaggregation/test_encode_receiver.py index b5f31c5bf..8e201e805 100644 --- a/test/registered/unit/disaggregation/test_encode_receiver.py +++ b/test/registered/unit/disaggregation/test_encode_receiver.py @@ -24,7 +24,7 @@ from sglang.srt.sampling.sampling_params import SamplingParams from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _make_registration_request(request_cls): diff --git a/test/registered/unit/disaggregation/test_encode_server.py b/test/registered/unit/disaggregation/test_encode_server.py index 2283a3da9..94724679c 100644 --- a/test/registered/unit/disaggregation/test_encode_server.py +++ b/test/registered/unit/disaggregation/test_encode_server.py @@ -52,7 +52,7 @@ from sglang.srt.utils.common import safe_pickle_loads from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestEncoderDPErrorHandling(CustomTestCase): diff --git a/test/registered/unit/disaggregation/test_encoder_health.py b/test/registered/unit/disaggregation/test_encoder_health.py index 5a6b64ed8..c90dd89fe 100644 --- a/test/registered/unit/disaggregation/test_encoder_health.py +++ b/test/registered/unit/disaggregation/test_encoder_health.py @@ -7,7 +7,7 @@ from sglang.srt.disaggregation.encoder import http_server from sglang.srt.managers.schedule_batch import Modality from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") class _FakeEncoder: diff --git a/test/registered/unit/disaggregation/test_encoder_scheduler.py b/test/registered/unit/disaggregation/test_encoder_scheduler.py index 94c69fc28..9843cdf5d 100644 --- a/test/registered/unit/disaggregation/test_encoder_scheduler.py +++ b/test/registered/unit/disaggregation/test_encoder_scheduler.py @@ -14,7 +14,7 @@ from sglang.srt.disaggregation.encoder.runtime import ( from sglang.srt.managers.schedule_batch import Modality from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _pending(modality: str = "image") -> PendingRequest: diff --git a/test/registered/unit/disaggregation/test_kimi_k3_encoder_mode.py b/test/registered/unit/disaggregation/test_kimi_k3_encoder_mode.py index d31223f90..beb3eaaa6 100644 --- a/test/registered/unit/disaggregation/test_kimi_k3_encoder_mode.py +++ b/test/registered/unit/disaggregation/test_kimi_k3_encoder_mode.py @@ -56,7 +56,7 @@ from sglang.srt.server_args import resolve_encoder_transfer_backend from sglang.srt.utils import ImageData from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=14, suite="base-a-test-cpu") def test_kimi_k3_encoder_transfer_backend_auto_avoids_tp_fanout(): diff --git a/test/registered/unit/disaggregation/test_kv_events.py b/test/registered/unit/disaggregation/test_kv_events.py index e1bf23478..e92a0c42b 100644 --- a/test/registered/unit/disaggregation/test_kv_events.py +++ b/test/registered/unit/disaggregation/test_kv_events.py @@ -24,7 +24,7 @@ from sglang.srt.disaggregation.kv_events import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestResolveLoadPubRange(CustomTestCase): diff --git a/test/registered/unit/disaggregation/test_kv_transfer_replica_metric.py b/test/registered/unit/disaggregation/test_kv_transfer_replica_metric.py index 0d167a4f9..75baa3f52 100644 --- a/test/registered/unit/disaggregation/test_kv_transfer_replica_metric.py +++ b/test/registered/unit/disaggregation/test_kv_transfer_replica_metric.py @@ -17,7 +17,7 @@ from sglang.srt.disaggregation.common.conn import CommonKVManager, CommonKVSende from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") KV_ITEM_LENS_SUM = 100 STATE_ITEM_LENS_SUM = 7 diff --git a/test/registered/unit/disaggregation/test_minimax_sparse_disagg_state_kv_args.py b/test/registered/unit/disaggregation/test_minimax_sparse_disagg_state_kv_args.py index eeb68a897..09b50f39d 100644 --- a/test/registered/unit/disaggregation/test_minimax_sparse_disagg_state_kv_args.py +++ b/test/registered/unit/disaggregation/test_minimax_sparse_disagg_state_kv_args.py @@ -7,7 +7,7 @@ from sglang.srt.disaggregation.utils import setup_state_kv_args from sglang.srt.mem_cache.memory_pool import MiniMaxSparseKVPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _make_k_only_pool(start_layer: int = 0) -> MiniMaxSparseKVPool: diff --git a/test/registered/unit/disaggregation/test_nixl_backend_basic.py b/test/registered/unit/disaggregation/test_nixl_backend_basic.py index c40cc8b1e..2bc8a2107 100644 --- a/test/registered/unit/disaggregation/test_nixl_backend_basic.py +++ b/test/registered/unit/disaggregation/test_nixl_backend_basic.py @@ -27,7 +27,7 @@ from sglang.srt.disaggregation.nixl.conn import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=23, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class NotificationFakeAgent: diff --git a/test/registered/unit/disaggregation/test_nixl_deferred_kv_release.py b/test/registered/unit/disaggregation/test_nixl_deferred_kv_release.py index 82d093bc0..752787665 100644 --- a/test/registered/unit/disaggregation/test_nixl_deferred_kv_release.py +++ b/test/registered/unit/disaggregation/test_nixl_deferred_kv_release.py @@ -16,7 +16,7 @@ from sglang.srt.disaggregation.nixl.conn import NixlKVManager from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _prefill_mgr(cls=CommonKVManager, enabled=True): diff --git a/test/registered/unit/disaggregation/test_nixl_sender_failure_cleanup.py b/test/registered/unit/disaggregation/test_nixl_sender_failure_cleanup.py index 81d3bb423..c3078d5a3 100644 --- a/test/registered/unit/disaggregation/test_nixl_sender_failure_cleanup.py +++ b/test/registered/unit/disaggregation/test_nixl_sender_failure_cleanup.py @@ -6,7 +6,7 @@ from sglang.srt.disaggregation.base.conn import KVPoll from sglang.srt.disaggregation.nixl.conn import NixlKVSender from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestNixlSenderFailureCleanup(unittest.TestCase): diff --git a/test/registered/unit/disaggregation/test_pp_hybrid_kv_transfer.py b/test/registered/unit/disaggregation/test_pp_hybrid_kv_transfer.py index e3a8bc7f4..7c7cb40f7 100644 --- a/test/registered/unit/disaggregation/test_pp_hybrid_kv_transfer.py +++ b/test/registered/unit/disaggregation/test_pp_hybrid_kv_transfer.py @@ -17,7 +17,7 @@ from sglang.srt.mem_cache.memory_pool import HybridLinearKVPool from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _full_attention_ids(*, num_layers: int, interval: int) -> list: diff --git a/test/registered/unit/disaggregation/test_receiver_connection_pool.py b/test/registered/unit/disaggregation/test_receiver_connection_pool.py index b28241d90..9cdbcf8a2 100644 --- a/test/registered/unit/disaggregation/test_receiver_connection_pool.py +++ b/test/registered/unit/disaggregation/test_receiver_connection_pool.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import threading diff --git a/test/registered/unit/disaggregation/test_register_to_bootstrap.py b/test/registered/unit/disaggregation/test_register_to_bootstrap.py index f8c5685de..76b55c27a 100644 --- a/test/registered/unit/disaggregation/test_register_to_bootstrap.py +++ b/test/registered/unit/disaggregation/test_register_to_bootstrap.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/disaggregation/test_specv2_kvcache_offloading.py b/test/registered/unit/disaggregation/test_specv2_kvcache_offloading.py index 70628017a..4c143ac3b 100644 --- a/test/registered/unit/disaggregation/test_specv2_kvcache_offloading.py +++ b/test/registered/unit/disaggregation/test_specv2_kvcache_offloading.py @@ -24,7 +24,7 @@ from sglang.srt.mem_cache.allocator import BaseTokenToKVPoolAllocator from sglang.srt.mem_cache.base_prefix_cache import BasePrefixCache from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _make_mock_req( diff --git a/test/registered/unit/disaggregation/test_unified_memory_move_gate.py b/test/registered/unit/disaggregation/test_unified_memory_move_gate.py index 91a1cfcd1..362e8b988 100644 --- a/test/registered/unit/disaggregation/test_unified_memory_move_gate.py +++ b/test/registered/unit/disaggregation/test_unified_memory_move_gate.py @@ -21,7 +21,7 @@ from sglang.srt.mem_cache.allocator.unified_sub_pool import MultiEndedAllocator from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _FakeTransferQueue: diff --git a/test/registered/unit/distributed/test_cuda_wrapper.py b/test/registered/unit/distributed/test_cuda_wrapper.py index 41f94c08a..9546e5d1e 100644 --- a/test/registered/unit/distributed/test_cuda_wrapper.py +++ b/test/registered/unit/distributed/test_cuda_wrapper.py @@ -4,7 +4,7 @@ import pytest from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") from sglang.srt.distributed.device_communicators import cuda_wrapper diff --git a/test/registered/unit/distributed/test_custom_all_reduce_v2_capability.py b/test/registered/unit/distributed/test_custom_all_reduce_v2_capability.py index 579781465..ea790dd02 100644 --- a/test/registered/unit/distributed/test_custom_all_reduce_v2_capability.py +++ b/test/registered/unit/distributed/test_custom_all_reduce_v2_capability.py @@ -5,7 +5,7 @@ import pytest from sglang.srt.distributed.device_communicators import custom_all_reduce_v2 from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _patch_group(monkeypatch, *, world_size, same_node): diff --git a/test/registered/unit/distributed/test_gated_launch.py b/test/registered/unit/distributed/test_gated_launch.py index e5a2336dd..8e583cd30 100644 --- a/test/registered/unit/distributed/test_gated_launch.py +++ b/test/registered/unit/distributed/test_gated_launch.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=34, suite="base-a-test-cpu") import multiprocessing import threading diff --git a/test/registered/unit/distributed/test_get_default_distributed_backend.py b/test/registered/unit/distributed/test_get_default_distributed_backend.py index c6fa3917d..8681c5dc5 100644 --- a/test/registered/unit/distributed/test_get_default_distributed_backend.py +++ b/test/registered/unit/distributed/test_get_default_distributed_backend.py @@ -8,7 +8,7 @@ from sglang.srt.platforms.interface import SRTPlatform from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") # Worked example: an out-of-tree platform that overrides the torch backend. diff --git a/test/registered/unit/distributed/test_parallel_state.py b/test/registered/unit/distributed/test_parallel_state.py index 3308b97eb..aad9a823f 100644 --- a/test/registered/unit/distributed/test_parallel_state.py +++ b/test/registered/unit/distributed/test_parallel_state.py @@ -44,7 +44,7 @@ import pytest from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") # Import the actual parallel_state module parallel_state = pytest.importorskip("sglang.srt.distributed.parallel_state") diff --git a/test/registered/unit/distributed/test_pynccl_allocator_import.py b/test/registered/unit/distributed/test_pynccl_allocator_import.py index 2a23f8d6c..40ee390ca 100644 --- a/test/registered/unit/distributed/test_pynccl_allocator_import.py +++ b/test/registered/unit/distributed/test_pynccl_allocator_import.py @@ -11,7 +11,7 @@ from pathlib import Path from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") # test/registered/unit/distributed/ -> repo root REPO_ROOT = Path(__file__).resolve().parents[4] diff --git a/test/registered/unit/entrypoints/anthropic/test_serving.py b/test/registered/unit/entrypoints/anthropic/test_serving.py index 8f5c5b61a..96a990bcc 100644 --- a/test/registered/unit/entrypoints/anthropic/test_serving.py +++ b/test/registered/unit/entrypoints/anthropic/test_serving.py @@ -24,7 +24,7 @@ from sglang.srt.parser.template_detection import ( # noqa: E402 ) from sglang.test.ci.ci_register import register_cpu_ci # noqa: E402 -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _FakeOpenAIServingChat: diff --git a/test/registered/unit/entrypoints/openai/test_audio_chunking.py b/test/registered/unit/entrypoints/openai/test_audio_chunking.py index c85066814..ff87e974e 100644 --- a/test/registered/unit/entrypoints/openai/test_audio_chunking.py +++ b/test/registered/unit/entrypoints/openai/test_audio_chunking.py @@ -24,7 +24,7 @@ from sglang.srt.entrypoints.openai.audio_chunking import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") SR = 16000 diff --git a/test/registered/unit/entrypoints/openai/test_exa_search.py b/test/registered/unit/entrypoints/openai/test_exa_search.py index 3578e7e3a..8b7cb06b9 100644 --- a/test/registered/unit/entrypoints/openai/test_exa_search.py +++ b/test/registered/unit/entrypoints/openai/test_exa_search.py @@ -16,7 +16,7 @@ from sglang.srt.entrypoints.search.exa_client import ( from sglang.srt.entrypoints.tool import HarmonyBrowserTool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class ExaClientTestCase(unittest.TestCase): diff --git a/test/registered/unit/entrypoints/openai/test_responses_protocol.py b/test/registered/unit/entrypoints/openai/test_responses_protocol.py index 5faa3b19f..3c10962d6 100644 --- a/test/registered/unit/entrypoints/openai/test_responses_protocol.py +++ b/test/registered/unit/entrypoints/openai/test_responses_protocol.py @@ -12,7 +12,7 @@ from sglang.srt.entrypoints.openai.protocol import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _in_progress_response(request: ResponsesRequest) -> ResponsesResponse: diff --git a/test/registered/unit/entrypoints/openai/test_serving_chat.py b/test/registered/unit/entrypoints/openai/test_serving_chat.py index f1123ae57..a8ed860e6 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_chat.py +++ b/test/registered/unit/entrypoints/openai/test_serving_chat.py @@ -49,7 +49,7 @@ from sglang.srt.sampling.sampling_params import ( from sglang.srt.utils import get_or_create_event_loop from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") # Every spec resolve_chat_encoding_spec can return; pinned by the guard below. _ALL_CHAT_ENCODING_SPECS = ("dsv4", "dsv32", "inkling", "kimi_k3") diff --git a/test/registered/unit/entrypoints/openai/test_serving_embedding.py b/test/registered/unit/entrypoints/openai/test_serving_embedding.py index a9624fb81..90d2f9587 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_embedding.py +++ b/test/registered/unit/entrypoints/openai/test_serving_embedding.py @@ -58,7 +58,7 @@ from sglang.srt.entrypoints.openai.serving_embedding import OpenAIServingEmbeddi from sglang.srt.managers.io_struct import EmbeddingReqInput from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/entrypoints/openai/test_serving_responses.py b/test/registered/unit/entrypoints/openai/test_serving_responses.py index f255739d3..50d39e9f8 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_responses.py +++ b/test/registered/unit/entrypoints/openai/test_serving_responses.py @@ -29,7 +29,7 @@ from sglang.srt.sampling.sampling_params import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class InputMessageConstructionTestCase(CustomTestCase): diff --git a/test/registered/unit/entrypoints/openai/test_serving_responses_stream.py b/test/registered/unit/entrypoints/openai/test_serving_responses_stream.py index f0059540c..699e6d88b 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_responses_stream.py +++ b/test/registered/unit/entrypoints/openai/test_serving_responses_stream.py @@ -14,7 +14,7 @@ from sglang.srt.entrypoints.openai.protocol import ResponsesRequest from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class NonHarmonyStreamTestCase(CustomTestCase): diff --git a/test/registered/unit/entrypoints/openai/test_serving_transcription.py b/test/registered/unit/entrypoints/openai/test_serving_transcription.py index 2c889812f..38a04e046 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_transcription.py +++ b/test/registered/unit/entrypoints/openai/test_serving_transcription.py @@ -36,7 +36,7 @@ from sglang.srt.utils import get_or_create_event_loop from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _chunk(text: str, finish: str = None) -> dict: diff --git a/test/registered/unit/entrypoints/openai/test_transcription_adapters.py b/test/registered/unit/entrypoints/openai/test_transcription_adapters.py index 52087751b..571f49b9d 100644 --- a/test/registered/unit/entrypoints/openai/test_transcription_adapters.py +++ b/test/registered/unit/entrypoints/openai/test_transcription_adapters.py @@ -24,7 +24,7 @@ from sglang.srt.entrypoints.openai.transcription_adapters import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") # Per-second scaling rate every speech-LM adapter uses for max_new_tokens. diff --git a/test/registered/unit/entrypoints/openai/test_whisper_adapter.py b/test/registered/unit/entrypoints/openai/test_whisper_adapter.py index 995324802..4abcedffa 100644 --- a/test/registered/unit/entrypoints/openai/test_whisper_adapter.py +++ b/test/registered/unit/entrypoints/openai/test_whisper_adapter.py @@ -21,7 +21,7 @@ from sglang.srt.entrypoints.openai.transcription_adapters.whisper import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestWhisperParseFusedOutput(CustomTestCase): diff --git a/test/registered/unit/entrypoints/test_effective_state_surfaces.py b/test/registered/unit/entrypoints/test_effective_state_surfaces.py index 5e3c2f864..32805722b 100644 --- a/test/registered/unit/entrypoints/test_effective_state_surfaces.py +++ b/test/registered/unit/entrypoints/test_effective_state_surfaces.py @@ -31,7 +31,7 @@ from sglang.srt.entrypoints.engine import Engine from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") _PACKAGE_ROOT = pathlib.Path(sglang.__file__).resolve().parent _RUST_MODEL_INFO = ( diff --git a/test/registered/unit/entrypoints/test_grpc_bridge.py b/test/registered/unit/entrypoints/test_grpc_bridge.py index 6aa741bb8..85cba4d2f 100644 --- a/test/registered/unit/entrypoints/test_grpc_bridge.py +++ b/test/registered/unit/entrypoints/test_grpc_bridge.py @@ -7,7 +7,7 @@ from sglang.srt.entrypoints.grpc_bridge import RuntimeHandle from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _ChunkStatus(enum.Enum): diff --git a/test/registered/unit/entrypoints/test_http2_server_config.py b/test/registered/unit/entrypoints/test_http2_server_config.py index a8be40f83..07791f3c8 100644 --- a/test/registered/unit/entrypoints/test_http2_server_config.py +++ b/test/registered/unit/entrypoints/test_http2_server_config.py @@ -5,7 +5,7 @@ from unittest.mock import patch from sglang.srt.entrypoints.http_server import _run_granian_server from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") @unittest.skipUnless( diff --git a/test/registered/unit/entrypoints/test_http_server_warmup.py b/test/registered/unit/entrypoints/test_http_server_warmup.py index a74d02b85..bfc3a8b48 100644 --- a/test/registered/unit/entrypoints/test_http_server_warmup.py +++ b/test/registered/unit/entrypoints/test_http_server_warmup.py @@ -9,7 +9,7 @@ from sglang.srt.entrypoints.http_server import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestDisaggregationServerWarmup(unittest.IsolatedAsyncioTestCase): diff --git a/test/registered/unit/entrypoints/test_server_info.py b/test/registered/unit/entrypoints/test_server_info.py index 49b25a998..0dee582f8 100644 --- a/test/registered/unit/entrypoints/test_server_info.py +++ b/test/registered/unit/entrypoints/test_server_info.py @@ -35,7 +35,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") def _stub_tokenizer_manager( diff --git a/test/registered/unit/entrypoints/test_server_warmup.py b/test/registered/unit/entrypoints/test_server_warmup.py index 293564277..824b88198 100644 --- a/test/registered/unit/entrypoints/test_server_warmup.py +++ b/test/registered/unit/entrypoints/test_server_warmup.py @@ -13,7 +13,7 @@ from sglang.srt.entrypoints.http_server import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestVlmWarmupImage(CustomTestCase): diff --git a/test/registered/unit/entrypoints/test_ssl_cert_refresher.py b/test/registered/unit/entrypoints/test_ssl_cert_refresher.py index 5b8f88370..677384848 100644 --- a/test/registered/unit/entrypoints/test_ssl_cert_refresher.py +++ b/test/registered/unit/entrypoints/test_ssl_cert_refresher.py @@ -8,7 +8,7 @@ from sglang.srt.entrypoints.ssl_utils import SSLCertRefresher from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=14, suite="base-a-test-cpu") +register_cpu_ci(est_time=17, suite="base-a-test-cpu") def _make_temp_pem(content: bytes) -> str: diff --git a/test/registered/unit/entrypoints/test_v1_loads_aggregate.py b/test/registered/unit/entrypoints/test_v1_loads_aggregate.py index d0974f14b..ad3ee9247 100644 --- a/test/registered/unit/entrypoints/test_v1_loads_aggregate.py +++ b/test/registered/unit/entrypoints/test_v1_loads_aggregate.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import CustomTestCase, maybe_stub_sgl_kernel maybe_stub_sgl_kernel() -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _temp_path() -> str: diff --git a/test/registered/unit/eplb/test_balanced_packing.py b/test/registered/unit/eplb/test_balanced_packing.py index a909814e5..2304dc82c 100644 --- a/test/registered/unit/eplb/test_balanced_packing.py +++ b/test/registered/unit/eplb/test_balanced_packing.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/eplb/test_compute_logical_to_rank_dispatch_physical_map.py b/test/registered/unit/eplb/test_compute_logical_to_rank_dispatch_physical_map.py index 0eb0e4278..973268ff3 100644 --- a/test/registered/unit/eplb/test_compute_logical_to_rank_dispatch_physical_map.py +++ b/test/registered/unit/eplb/test_compute_logical_to_rank_dispatch_physical_map.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/eplb/test_dispatch_dtype_preservation.py b/test/registered/unit/eplb/test_dispatch_dtype_preservation.py index f747dcadf..80c822a4d 100644 --- a/test/registered/unit/eplb/test_dispatch_dtype_preservation.py +++ b/test/registered/unit/eplb/test_dispatch_dtype_preservation.py @@ -9,7 +9,7 @@ a specific dtype (int32). from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/eplb/test_waterfill_eplb.py b/test/registered/unit/eplb/test_waterfill_eplb.py index ef881bde9..118ab4a8f 100644 --- a/test/registered/unit/eplb/test_waterfill_eplb.py +++ b/test/registered/unit/eplb/test_waterfill_eplb.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/function_call/test_dots_detector.py b/test/registered/unit/function_call/test_dots_detector.py index b37218861..ef40cd177 100644 --- a/test/registered/unit/function_call/test_dots_detector.py +++ b/test/registered/unit/function_call/test_dots_detector.py @@ -7,7 +7,7 @@ from sglang.srt.function_call.function_call_parser import FunctionCallParser from sglang.srt.parser.reasoning_parser import Qwen3Detector, ReasoningParser from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _tool(name: str, properties: dict) -> Tool: diff --git a/test/registered/unit/function_call/test_function_call_parser.py b/test/registered/unit/function_call/test_function_call_parser.py index 5b14add1f..200052947 100644 --- a/test/registered/unit/function_call/test_function_call_parser.py +++ b/test/registered/unit/function_call/test_function_call_parser.py @@ -36,7 +36,7 @@ from sglang.srt.function_call.qwen3_coder_detector import Qwen3CoderDetector from sglang.srt.function_call.utils import get_schema_properties from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_cpu_ci(est_time=70, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/function_call/test_hunyuan_detector.py b/test/registered/unit/function_call/test_hunyuan_detector.py index 80060a5e2..adba60d4b 100644 --- a/test/registered/unit/function_call/test_hunyuan_detector.py +++ b/test/registered/unit/function_call/test_hunyuan_detector.py @@ -8,7 +8,7 @@ from sglang.srt.function_call.hunyuan_detector import HunyuanDetector from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _make_tools(): diff --git a/test/registered/unit/function_call/test_k2_v3_detector.py b/test/registered/unit/function_call/test_k2_v3_detector.py index 613e6d80b..85d9f61cb 100644 --- a/test/registered/unit/function_call/test_k2_v3_detector.py +++ b/test/registered/unit/function_call/test_k2_v3_detector.py @@ -8,7 +8,7 @@ from sglang.srt.function_call.k2_v3_detector import K2V3Detector from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def make_weather_tool() -> Tool: diff --git a/test/registered/unit/function_call/test_minimax_m3_detector.py b/test/registered/unit/function_call/test_minimax_m3_detector.py index 8f6179ea0..0530df560 100644 --- a/test/registered/unit/function_call/test_minimax_m3_detector.py +++ b/test/registered/unit/function_call/test_minimax_m3_detector.py @@ -6,7 +6,7 @@ from sglang.srt.function_call.minimax_m3 import MINIMAX_NS_TOKEN, MinimaxM3Detec from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") NS = MINIMAX_NS_TOKEN diff --git a/test/registered/unit/function_call/test_spark25_detector.py b/test/registered/unit/function_call/test_spark25_detector.py index 43c2b3f61..32b75da26 100644 --- a/test/registered/unit/function_call/test_spark25_detector.py +++ b/test/registered/unit/function_call/test_spark25_detector.py @@ -10,7 +10,7 @@ from sglang.srt.function_call.spark25_detector import Spark25Detector from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _xml(name: str, arguments: list[tuple[str, str]]) -> str: diff --git a/test/registered/unit/hardware_backend/mlx/test_attention_patching.py b/test/registered/unit/hardware_backend/mlx/test_attention_patching.py index c5aefc8b8..4aa5bf528 100644 --- a/test/registered/unit/hardware_backend/mlx/test_attention_patching.py +++ b/test/registered/unit/hardware_backend/mlx/test_attention_patching.py @@ -10,7 +10,7 @@ from types import SimpleNamespace from sglang.srt.managers.schedule_batch import ReqKvInfo from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_mlx_ci(est_time=1, suite="stage-a-unit-test-mlx") _HAS_MLX = importlib.util.find_spec("mlx") is not None diff --git a/test/registered/unit/hardware_backend/mlx/test_attn_dp_request_capacity.py b/test/registered/unit/hardware_backend/mlx/test_attn_dp_request_capacity.py index 46f2a817b..ddf446e41 100644 --- a/test/registered/unit/hardware_backend/mlx/test_attn_dp_request_capacity.py +++ b/test/registered/unit/hardware_backend/mlx/test_attn_dp_request_capacity.py @@ -17,7 +17,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_mlx_ci(est_time=1, suite="stage-a-unit-test-mlx") _HAS_MLX = importlib.util.find_spec("mlx") is not None diff --git a/test/registered/unit/hardware_backend/mlx/test_fused_swiglu.py b/test/registered/unit/hardware_backend/mlx/test_fused_swiglu.py index 9eee6b5df..798f1c0ea 100644 --- a/test/registered/unit/hardware_backend/mlx/test_fused_swiglu.py +++ b/test/registered/unit/hardware_backend/mlx/test_fused_swiglu.py @@ -25,7 +25,7 @@ import pytest from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") register_mlx_ci(est_time=45, suite="stage-a-unit-test-mlx") _IS_APPLE_SILICON = platform.system() == "Darwin" and platform.machine() == "arm64" diff --git a/test/registered/unit/hardware_backend/mlx/test_max_running_requests.py b/test/registered/unit/hardware_backend/mlx/test_max_running_requests.py index 3a16d3a54..040fe5d0a 100644 --- a/test/registered/unit/hardware_backend/mlx/test_max_running_requests.py +++ b/test/registered/unit/hardware_backend/mlx/test_max_running_requests.py @@ -26,7 +26,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_mlx_ci(est_time=1, suite="stage-a-unit-test-mlx") diff --git a/test/registered/unit/hardware_backend/mlx/test_metal_profiler.py b/test/registered/unit/hardware_backend/mlx/test_metal_profiler.py index 90bb7a29c..bc11d7e89 100644 --- a/test/registered/unit/hardware_backend/mlx/test_metal_profiler.py +++ b/test/registered/unit/hardware_backend/mlx/test_metal_profiler.py @@ -22,7 +22,7 @@ from unittest.mock import MagicMock, patch from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") register_mlx_ci(est_time=5, suite="stage-a-unit-test-mlx") _IS_APPLE_SILICON = platform.system() == "Darwin" and platform.machine() == "arm64" diff --git a/test/registered/unit/hardware_backend/mlx/test_mlx_pool_dtype.py b/test/registered/unit/hardware_backend/mlx/test_mlx_pool_dtype.py index fcd5a37a5..1b98d4619 100644 --- a/test/registered/unit/hardware_backend/mlx/test_mlx_pool_dtype.py +++ b/test/registered/unit/hardware_backend/mlx/test_mlx_pool_dtype.py @@ -22,7 +22,7 @@ import unittest from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_mlx_ci(est_time=4, suite="stage-a-unit-test-mlx") _HAS_MLX = ( diff --git a/test/registered/unit/hardware_backend/mlx/test_mlx_quantization_override.py b/test/registered/unit/hardware_backend/mlx/test_mlx_quantization_override.py index 1df51d056..473464a75 100644 --- a/test/registered/unit/hardware_backend/mlx/test_mlx_quantization_override.py +++ b/test/registered/unit/hardware_backend/mlx/test_mlx_quantization_override.py @@ -11,7 +11,7 @@ import unittest from sglang.srt.layers.quantization.mlx import MlxQuantizationConfig from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_mlx_ci(est_time=1, suite="stage-a-unit-test-mlx") diff --git a/test/registered/unit/hardware_backend/mlx/test_mlx_reference_correctness.py b/test/registered/unit/hardware_backend/mlx/test_mlx_reference_correctness.py index 33ba76d89..313d35096 100644 --- a/test/registered/unit/hardware_backend/mlx/test_mlx_reference_correctness.py +++ b/test/registered/unit/hardware_backend/mlx/test_mlx_reference_correctness.py @@ -43,7 +43,7 @@ import unittest from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_mlx_ci(est_time=1, suite="stage-b-e2e-mlx") _HAS_MLX = ( diff --git a/test/registered/unit/hardware_backend/mlx/test_mlx_remote_code_gate.py b/test/registered/unit/hardware_backend/mlx/test_mlx_remote_code_gate.py index 8d44d12d0..ff65e651f 100644 --- a/test/registered/unit/hardware_backend/mlx/test_mlx_remote_code_gate.py +++ b/test/registered/unit/hardware_backend/mlx/test_mlx_remote_code_gate.py @@ -19,7 +19,7 @@ from unittest.mock import patch from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_mlx_ci(est_time=5, suite="stage-a-unit-test-mlx") _HAS_MLX = ( diff --git a/test/registered/unit/hardware_backend/mlx/test_mlx_runner_pool_contract.py b/test/registered/unit/hardware_backend/mlx/test_mlx_runner_pool_contract.py index 3af37759b..c2d579aa1 100644 --- a/test/registered/unit/hardware_backend/mlx/test_mlx_runner_pool_contract.py +++ b/test/registered/unit/hardware_backend/mlx/test_mlx_runner_pool_contract.py @@ -27,7 +27,7 @@ import unittest from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_mlx_ci(est_time=1, suite="stage-a-unit-test-mlx") _HAS_MLX = importlib.util.find_spec("mlx") is not None diff --git a/test/registered/unit/hardware_backend/mlx/test_mlx_sampling.py b/test/registered/unit/hardware_backend/mlx/test_mlx_sampling.py index 3cd08b813..5043984fe 100644 --- a/test/registered/unit/hardware_backend/mlx/test_mlx_sampling.py +++ b/test/registered/unit/hardware_backend/mlx/test_mlx_sampling.py @@ -9,7 +9,7 @@ from collections import Counter from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_mlx_ci(est_time=20, suite="stage-a-unit-test-mlx") _HAS_MLX = importlib.util.find_spec("mlx") is not None diff --git a/test/registered/unit/hardware_backend/mlx/test_muse_glimmer_mlx_model.py b/test/registered/unit/hardware_backend/mlx/test_muse_glimmer_mlx_model.py index 120c7debc..efb51a3b5 100644 --- a/test/registered/unit/hardware_backend/mlx/test_muse_glimmer_mlx_model.py +++ b/test/registered/unit/hardware_backend/mlx/test_muse_glimmer_mlx_model.py @@ -23,7 +23,7 @@ import unittest from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_mlx_ci(est_time=6, suite="stage-a-unit-test-mlx") _HAS_MLX = ( diff --git a/test/registered/unit/hardware_backend/mlx/test_quantization.py b/test/registered/unit/hardware_backend/mlx/test_quantization.py index 387d9aa56..3f6605cd7 100644 --- a/test/registered/unit/hardware_backend/mlx/test_quantization.py +++ b/test/registered/unit/hardware_backend/mlx/test_quantization.py @@ -27,7 +27,7 @@ from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci # fails with LocalEntryNotFoundError on a runner with no pre-warmed cache. The # macOS CI lane (pr-test-mlx.yml) only dispatches stage-b-e2e-mlx via a gated # workflow_dispatch, matching the models_e2e correctness tests' convention. -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") register_mlx_ci(est_time=10, suite="stage-b-e2e-mlx") _IS_APPLE_SILICON = platform.system() == "Darwin" and platform.machine() == "arm64" diff --git a/test/registered/unit/hardware_backend/mlx/test_runner_init_contract.py b/test/registered/unit/hardware_backend/mlx/test_runner_init_contract.py index 230104384..e150b5b0b 100644 --- a/test/registered/unit/hardware_backend/mlx/test_runner_init_contract.py +++ b/test/registered/unit/hardware_backend/mlx/test_runner_init_contract.py @@ -13,7 +13,7 @@ import unittest from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") register_mlx_ci(est_time=1, suite="stage-a-unit-test-mlx") _HAS_MLX = importlib.util.find_spec("mlx") is not None diff --git a/test/registered/unit/hardware_backend/mlx/test_scheduler_mixin.py b/test/registered/unit/hardware_backend/mlx/test_scheduler_mixin.py index fafcbb751..457344116 100644 --- a/test/registered/unit/hardware_backend/mlx/test_scheduler_mixin.py +++ b/test/registered/unit/hardware_backend/mlx/test_scheduler_mixin.py @@ -18,7 +18,7 @@ from unittest.mock import MagicMock, patch from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") register_mlx_ci(est_time=5, suite="stage-a-unit-test-mlx") _IS_APPLE_SILICON = platform.system() == "Darwin" and platform.machine() == "arm64" diff --git a/test/registered/unit/hardware_backend/mlx/test_sliding_window_attention.py b/test/registered/unit/hardware_backend/mlx/test_sliding_window_attention.py index 7a18427b8..a87a315ed 100644 --- a/test/registered/unit/hardware_backend/mlx/test_sliding_window_attention.py +++ b/test/registered/unit/hardware_backend/mlx/test_sliding_window_attention.py @@ -33,7 +33,7 @@ from types import SimpleNamespace from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_mlx_ci(est_time=6, suite="stage-a-unit-test-mlx") _HAS_MLX = ( diff --git a/test/registered/unit/hardware_backend/mlx/test_windowed_kv_cache.py b/test/registered/unit/hardware_backend/mlx/test_windowed_kv_cache.py index 60a1f0d87..b0ff3e4f1 100644 --- a/test/registered/unit/hardware_backend/mlx/test_windowed_kv_cache.py +++ b/test/registered/unit/hardware_backend/mlx/test_windowed_kv_cache.py @@ -20,7 +20,7 @@ import unittest from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_mlx_ci(est_time=10, suite="stage-a-unit-test-mlx") _HAS_MLX = ( diff --git a/test/registered/unit/layers/attention/linear/kernels/test_kda_nvidia.py b/test/registered/unit/layers/attention/linear/kernels/test_kda_nvidia.py index 0859e8c8f..ffa952a58 100644 --- a/test/registered/unit/layers/attention/linear/kernels/test_kda_nvidia.py +++ b/test/registered/unit/layers/attention/linear/kernels/test_kda_nvidia.py @@ -13,7 +13,7 @@ from sglang.srt.layers.attention.linear.kernels.kda_nvidia import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _RejectTriton: diff --git a/test/registered/unit/layers/attention/test_dots_hybrid_backend.py b/test/registered/unit/layers/attention/test_dots_hybrid_backend.py index 2e5989169..45ed6fe8f 100644 --- a/test/registered/unit/layers/attention/test_dots_hybrid_backend.py +++ b/test/registered/unit/layers/attention/test_dots_hybrid_backend.py @@ -22,7 +22,7 @@ from sglang.srt.layers.attention.swa_mla_fallback.ops import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _batch(*, bs: int, num_tokens: int, original_bs: int | None = None): diff --git a/test/registered/unit/layers/attention/test_dsa_head_gate_guard.py b/test/registered/unit/layers/attention/test_dsa_head_gate_guard.py index 3565ff5db..246b24c4a 100644 --- a/test/registered/unit/layers/attention/test_dsa_head_gate_guard.py +++ b/test/registered/unit/layers/attention/test_dsa_head_gate_guard.py @@ -4,7 +4,7 @@ from sglang.srt.utils import is_cuda, is_hip from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") HELPERS = ("logits_head_gate_graph", "scale_head_gate_graph") diff --git a/test/registered/unit/layers/attention/test_dsa_mqa_logits_chunking.py b/test/registered/unit/layers/attention/test_dsa_mqa_logits_chunking.py index c6bc7b295..0500512b0 100644 --- a/test/registered/unit/layers/attention/test_dsa_mqa_logits_chunking.py +++ b/test/registered/unit/layers/attention/test_dsa_mqa_logits_chunking.py @@ -17,7 +17,7 @@ torch = pytest.importorskip("torch") from sglang.srt.layers.attention.dsa import dsa_indexer # noqa: E402 from sglang.test.ci.ci_register import register_cpu_ci # noqa: E402 -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") CEILING = dsa_indexer.Indexer._MQA_LOGITS_MAX_BYTES_ROCM # More than any single logits tensor here needs, so it never decides a case. diff --git a/test/registered/unit/layers/attention/test_flashattention_graph_metadata.py b/test/registered/unit/layers/attention/test_flashattention_graph_metadata.py index 4b3996333..20e1c4a79 100644 --- a/test/registered/unit/layers/attention/test_flashattention_graph_metadata.py +++ b/test/registered/unit/layers/attention/test_flashattention_graph_metadata.py @@ -9,7 +9,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=2, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") class TestFlashAttentionGraphMetadata(CustomTestCase): diff --git a/test/registered/unit/layers/attention/test_gdn_flashinfer_alignment.py b/test/registered/unit/layers/attention/test_gdn_flashinfer_alignment.py index a05ddb63e..1e55579fe 100644 --- a/test/registered/unit/layers/attention/test_gdn_flashinfer_alignment.py +++ b/test/registered/unit/layers/attention/test_gdn_flashinfer_alignment.py @@ -8,7 +8,7 @@ from sglang.srt.layers.attention.linear.kernels.gdn_flashinfer import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") def _view_with_pointer_mod( diff --git a/test/registered/unit/layers/attention/test_gdn_prefill_backend_policy.py b/test/registered/unit/layers/attention/test_gdn_prefill_backend_policy.py index 296e834af..1e2b66f44 100644 --- a/test/registered/unit/layers/attention/test_gdn_prefill_backend_policy.py +++ b/test/registered/unit/layers/attention/test_gdn_prefill_backend_policy.py @@ -26,7 +26,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _publish(testcase, **fields): diff --git a/test/registered/unit/layers/attention/test_index_topk_share.py b/test/registered/unit/layers/attention/test_index_topk_share.py index 9332a3520..aa298bef3 100644 --- a/test/registered/unit/layers/attention/test_index_topk_share.py +++ b/test/registered/unit/layers/attention/test_index_topk_share.py @@ -7,7 +7,7 @@ import torch from sglang.srt.layers.attention.index_topk_share import IndexTopKShareState from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") def _batch( diff --git a/test/registered/unit/layers/attention/test_kda_helion_dispatcher.py b/test/registered/unit/layers/attention/test_kda_helion_dispatcher.py index bc0593f75..b4319ea03 100644 --- a/test/registered/unit/layers/attention/test_kda_helion_dispatcher.py +++ b/test/registered/unit/layers/attention/test_kda_helion_dispatcher.py @@ -12,7 +12,7 @@ from sglang.srt.runtime_context import override_platform from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestHelionKDADispatcher(unittest.TestCase): diff --git a/test/registered/unit/layers/attention/test_kv_translate_ownership.py b/test/registered/unit/layers/attention/test_kv_translate_ownership.py index 6a78b9de0..45ef31149 100644 --- a/test/registered/unit/layers/attention/test_kv_translate_ownership.py +++ b/test/registered/unit/layers/attention/test_kv_translate_ownership.py @@ -37,7 +37,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") # The attention package is a namespace package (no __init__), so anchor the # scan on a concrete module inside it. diff --git a/test/registered/unit/layers/attention/test_linear_attn_config.py b/test/registered/unit/layers/attention/test_linear_attn_config.py index 49108b839..57eb734de 100644 --- a/test/registered/unit/layers/attention/test_linear_attn_config.py +++ b/test/registered/unit/layers/attention/test_linear_attn_config.py @@ -25,7 +25,7 @@ from sglang.srt.layers.attention.linear.utils import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class _Runner: diff --git a/test/registered/unit/layers/attention/test_mla_decode_geometry.py b/test/registered/unit/layers/attention/test_mla_decode_geometry.py index f33ae2ab8..b76f95d6b 100644 --- a/test/registered/unit/layers/attention/test_mla_decode_geometry.py +++ b/test/registered/unit/layers/attention/test_mla_decode_geometry.py @@ -45,7 +45,7 @@ from sglang.srt.environ import envs from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") # gfx950 full-GPU. Passed in rather than read from the device so this stays a CPU test. CORE_COUNT = 256 diff --git a/test/registered/unit/layers/attention/test_verify_mask.py b/test/registered/unit/layers/attention/test_verify_mask.py index e829eea26..ac8a21b0f 100644 --- a/test/registered/unit/layers/attention/test_verify_mask.py +++ b/test/registered/unit/layers/attention/test_verify_mask.py @@ -15,7 +15,7 @@ from sglang.srt.speculative.eagle_utils import TreeMaskMode, default_tree_mask_m from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") _MAX_BS = 4 _DRAFT = 3 diff --git a/test/registered/unit/layers/attention/test_vision_backend_selection.py b/test/registered/unit/layers/attention/test_vision_backend_selection.py index 4ecf3cee7..3a91eaed8 100644 --- a/test/registered/unit/layers/attention/test_vision_backend_selection.py +++ b/test/registered/unit/layers/attention/test_vision_backend_selection.py @@ -10,7 +10,7 @@ from einops import rearrange from sglang.srt.layers.attention import vision from sglang.test.ci.ci_register import register_cpu_ci, register_npu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") register_npu_ci(est_time=2, suite="base-b-test-1-npu-a3") register_npu_ci(est_time=2, suite="nightly-1-npu-a3", nightly=True) diff --git a/test/registered/unit/layers/attention/test_vision_max_seqlen.py b/test/registered/unit/layers/attention/test_vision_max_seqlen.py index 84c5a6e74..4b9449182 100644 --- a/test/registered/unit/layers/attention/test_vision_max_seqlen.py +++ b/test/registered/unit/layers/attention/test_vision_max_seqlen.py @@ -9,7 +9,7 @@ from sglang.srt.models import kimi_k25 from sglang.srt.models.kimi_k25 import MoonViT3dEncoder, MoonViTEncoderLayer from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def test_vision_flash3_uses_precomputed_max_seqlen(monkeypatch): diff --git a/test/registered/unit/layers/attention/test_vision_seqlens.py b/test/registered/unit/layers/attention/test_vision_seqlens.py index 6e2ddf605..7187622d7 100644 --- a/test/registered/unit/layers/attention/test_vision_seqlens.py +++ b/test/registered/unit/layers/attention/test_vision_seqlens.py @@ -4,7 +4,7 @@ import torch from sglang.srt.layers.attention.vision import SingletonCache, resolve_max_seqlen from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def test_resolve_max_seqlen_accepts_raw_tensor_without_attribute_cache(): diff --git a/test/registered/unit/layers/attention/test_vision_strided_qkv.py b/test/registered/unit/layers/attention/test_vision_strided_qkv.py index d598686c0..380e542df 100644 --- a/test/registered/unit/layers/attention/test_vision_strided_qkv.py +++ b/test/registered/unit/layers/attention/test_vision_strided_qkv.py @@ -17,7 +17,7 @@ from sglang.srt.layers.attention import vision from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") EMBED_DIM = 32 NUM_HEADS = 4 diff --git a/test/registered/unit/layers/moe/test_copy_weight_views_before_h2d.py b/test/registered/unit/layers/moe/test_copy_weight_views_before_h2d.py index 7d59e0bb2..532c0778f 100644 --- a/test/registered/unit/layers/moe/test_copy_weight_views_before_h2d.py +++ b/test/registered/unit/layers/moe/test_copy_weight_views_before_h2d.py @@ -5,7 +5,7 @@ from sglang.srt.layers.moe.fused_moe_triton.layer import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _assert_independent_copy(source: torch.Tensor, result: torch.Tensor) -> None: diff --git a/test/registered/unit/layers/moe/test_deepep_v2_buffer_lifecycle.py b/test/registered/unit/layers/moe/test_deepep_v2_buffer_lifecycle.py index 91258cd88..362310a59 100644 --- a/test/registered/unit/layers/moe/test_deepep_v2_buffer_lifecycle.py +++ b/test/registered/unit/layers/moe/test_deepep_v2_buffer_lifecycle.py @@ -10,7 +10,7 @@ from sglang.srt.runtime_context import get_resources, reset_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _FakeGroup: diff --git a/test/registered/unit/layers/moe/test_flashinfer_cutedsl_dispatch.py b/test/registered/unit/layers/moe/test_flashinfer_cutedsl_dispatch.py index 2fd45d331..5a807ce35 100644 --- a/test/registered/unit/layers/moe/test_flashinfer_cutedsl_dispatch.py +++ b/test/registered/unit/layers/moe/test_flashinfer_cutedsl_dispatch.py @@ -13,7 +13,7 @@ from sglang.srt.layers.moe.token_dispatcher.standard import ( from sglang.srt.layers.moe.topk import StandardTopKOutput from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def test_flashinfer_prefill_returns_standard_combine_input(): diff --git a/test/registered/unit/layers/moe/test_fused_moe_common_utils.py b/test/registered/unit/layers/moe/test_fused_moe_common_utils.py index bf28872d4..992af4300 100644 --- a/test/registered/unit/layers/moe/test_fused_moe_common_utils.py +++ b/test/registered/unit/layers/moe/test_fused_moe_common_utils.py @@ -7,7 +7,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _load_common_utils(): diff --git a/test/registered/unit/layers/moe/test_fused_moe_native.py b/test/registered/unit/layers/moe/test_fused_moe_native.py index 4d52819b1..90d74c235 100644 --- a/test/registered/unit/layers/moe/test_fused_moe_native.py +++ b/test/registered/unit/layers/moe/test_fused_moe_native.py @@ -7,7 +7,7 @@ from sglang.srt.layers.moe.fused_moe_native import moe_forward_native from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestFusedMoeNative(CustomTestCase): diff --git a/test/registered/unit/layers/moe/test_fused_moe_triton_config.py b/test/registered/unit/layers/moe/test_fused_moe_triton_config.py index d5e62244d..167ae7f91 100644 --- a/test/registered/unit/layers/moe/test_fused_moe_triton_config.py +++ b/test/registered/unit/layers/moe/test_fused_moe_triton_config.py @@ -3,7 +3,7 @@ from pathlib import Path from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") from sglang.srt.layers.moe.moe_runner.triton_utils import fused_moe_triton_config diff --git a/test/registered/unit/layers/moe/test_fused_shared_expert_scaling.py b/test/registered/unit/layers/moe/test_fused_shared_expert_scaling.py index 233dbee81..4f3945e52 100644 --- a/test/registered/unit/layers/moe/test_fused_shared_expert_scaling.py +++ b/test/registered/unit/layers/moe/test_fused_shared_expert_scaling.py @@ -15,7 +15,7 @@ These tests pin the fused shared expert's topk weight contract on three paths: from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/layers/moe/test_mega_moe_deepgemm_api.py b/test/registered/unit/layers/moe/test_mega_moe_deepgemm_api.py index 6585db94b..17232b826 100644 --- a/test/registered/unit/layers/moe/test_mega_moe_deepgemm_api.py +++ b/test/registered/unit/layers/moe/test_mega_moe_deepgemm_api.py @@ -15,7 +15,7 @@ maybe_stub_sgl_kernel() from sglang.srt.layers.moe import mega_moe -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestDeepGemmMegaMoeApi(CustomTestCase): diff --git a/test/registered/unit/layers/moe/test_qwen35_flashinfer_fusion.py b/test/registered/unit/layers/moe/test_qwen35_flashinfer_fusion.py index cdc2baf0c..62c5a27e1 100644 --- a/test/registered/unit/layers/moe/test_qwen35_flashinfer_fusion.py +++ b/test/registered/unit/layers/moe/test_qwen35_flashinfer_fusion.py @@ -18,7 +18,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.srt.models.qwen3_5_text import Qwen3_5ForCausalLM from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") @dataclass(frozen=True) diff --git a/test/registered/unit/layers/moe/test_topk_correction_bias_cache.py b/test/registered/unit/layers/moe/test_topk_correction_bias_cache.py index 731837bb5..e1d282cbc 100644 --- a/test/registered/unit/layers/moe/test_topk_correction_bias_cache.py +++ b/test/registered/unit/layers/moe/test_topk_correction_bias_cache.py @@ -10,8 +10,8 @@ from sglang.test.ci.ci_register import ( ) from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") -register_cuda_ci(est_time=5, stage="base-a", runner_config="1-gpu-small") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cuda_ci(est_time=10, stage="base-a", runner_config="1-gpu-small") register_amd_ci(est_time=5, stage="stage-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/unit/layers/moe/test_w4afp8_deepep_dtype.py b/test/registered/unit/layers/moe/test_w4afp8_deepep_dtype.py index d9b05c7b4..4d28beb4c 100644 --- a/test/registered/unit/layers/moe/test_w4afp8_deepep_dtype.py +++ b/test/registered/unit/layers/moe/test_w4afp8_deepep_dtype.py @@ -17,7 +17,7 @@ from sglang.srt.layers.quantization import w4afp8 from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestW4AFP8DeepEPDispatcherDtype(CustomTestCase): diff --git a/test/registered/unit/layers/moe/test_w4afp8_deepep_post_reorder.py b/test/registered/unit/layers/moe/test_w4afp8_deepep_post_reorder.py index a504d4c04..1a5414c91 100644 --- a/test/registered/unit/layers/moe/test_w4afp8_deepep_post_reorder.py +++ b/test/registered/unit/layers/moe/test_w4afp8_deepep_post_reorder.py @@ -10,7 +10,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") # The function under test is a GPU implementation, but this test replaces every # launched kernel and only verifies the host-side call contract. Stub the diff --git a/test/registered/unit/layers/moe/test_w4afp8_requant_geometry.py b/test/registered/unit/layers/moe/test_w4afp8_requant_geometry.py index f0872ffa1..952ff9bef 100644 --- a/test/registered/unit/layers/moe/test_w4afp8_requant_geometry.py +++ b/test/registered/unit/layers/moe/test_w4afp8_requant_geometry.py @@ -6,7 +6,7 @@ from sglang.kernels.ops.moe.ep_moe_kernels import requant_launch_geometry from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") DSV3_GROUPS = 7168 // 128 # 56 K3_GROUPS = 3584 // 128 # 28 diff --git a/test/registered/unit/layers/quantization/test_compressed_tensors_kv_cache.py b/test/registered/unit/layers/quantization/test_compressed_tensors_kv_cache.py index 1333e221b..54c6dbb89 100644 --- a/test/registered/unit/layers/quantization/test_compressed_tensors_kv_cache.py +++ b/test/registered/unit/layers/quantization/test_compressed_tensors_kv_cache.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/layers/quantization/test_compressed_tensors_lm_head.py b/test/registered/unit/layers/quantization/test_compressed_tensors_lm_head.py index c5564a4bb..78bd0dc6f 100644 --- a/test/registered/unit/layers/quantization/test_compressed_tensors_lm_head.py +++ b/test/registered/unit/layers/quantization/test_compressed_tensors_lm_head.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import unittest from unittest.mock import patch diff --git a/test/registered/unit/layers/quantization/test_compressed_tensors_mixed_precision.py b/test/registered/unit/layers/quantization/test_compressed_tensors_mixed_precision.py index 90ca492c3..8cc3d347a 100644 --- a/test/registered/unit/layers/quantization/test_compressed_tensors_mixed_precision.py +++ b/test/registered/unit/layers/quantization/test_compressed_tensors_mixed_precision.py @@ -9,7 +9,7 @@ for every group. Both are config-parsing paths, so these tests run on CPU. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import unittest from unittest import mock diff --git a/test/registered/unit/layers/quantization/test_compressed_tensors_wna16_moe_no_linear.py b/test/registered/unit/layers/quantization/test_compressed_tensors_wna16_moe_no_linear.py index 5d712b1e8..ebd356fdf 100644 --- a/test/registered/unit/layers/quantization/test_compressed_tensors_wna16_moe_no_linear.py +++ b/test/registered/unit/layers/quantization/test_compressed_tensors_wna16_moe_no_linear.py @@ -16,7 +16,7 @@ from sglang.srt.runtime_context import override_platform from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") _WNA16_MOE_SCHEMES = (CompressedTensorsWNA16MoE, CompressedTensorsWNA16TritonMoE) EXPERTS_LAYER = "model.layers.0.mlp.experts" diff --git a/test/registered/unit/layers/quantization/test_deepgemm_ue8m0_requant.py b/test/registered/unit/layers/quantization/test_deepgemm_ue8m0_requant.py index 452c74996..ddc039fcd 100644 --- a/test/registered/unit/layers/quantization/test_deepgemm_ue8m0_requant.py +++ b/test/registered/unit/layers/quantization/test_deepgemm_ue8m0_requant.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import unittest from unittest.mock import call, patch diff --git a/test/registered/unit/layers/quantization/test_flashinfer_pr4266_bf16_gemm.py b/test/registered/unit/layers/quantization/test_flashinfer_pr4266_bf16_gemm.py index a4904a3ea..569426e56 100644 --- a/test/registered/unit/layers/quantization/test_flashinfer_pr4266_bf16_gemm.py +++ b/test/registered/unit/layers/quantization/test_flashinfer_pr4266_bf16_gemm.py @@ -9,7 +9,7 @@ from sglang.srt.layers.quantization.unquant import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") @pytest.mark.parametrize("m,n,k", _FLASHINFER_PR4266_TUNED_TACTICS) diff --git a/test/registered/unit/layers/quantization/test_flashinfer_trtllm_fp8_fallback.py b/test/registered/unit/layers/quantization/test_flashinfer_trtllm_fp8_fallback.py index f64b80b62..c5c0a11bb 100644 --- a/test/registered/unit/layers/quantization/test_flashinfer_trtllm_fp8_fallback.py +++ b/test/registered/unit/layers/quantization/test_flashinfer_trtllm_fp8_fallback.py @@ -20,7 +20,7 @@ backend selector and the two GEMM implementations so they run on CPU CI. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import unittest from unittest.mock import MagicMock, patch diff --git a/test/registered/unit/layers/quantization/test_fp4_kv_cache_quant_method.py b/test/registered/unit/layers/quantization/test_fp4_kv_cache_quant_method.py index 4926b2d67..695c0e80a 100644 --- a/test/registered/unit/layers/quantization/test_fp4_kv_cache_quant_method.py +++ b/test/registered/unit/layers/quantization/test_fp4_kv_cache_quant_method.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=35, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/layers/quantization/test_fp8_blockwise_linear_backends.py b/test/registered/unit/layers/quantization/test_fp8_blockwise_linear_backends.py index b25995b03..12e890326 100644 --- a/test/registered/unit/layers/quantization/test_fp8_blockwise_linear_backends.py +++ b/test/registered/unit/layers/quantization/test_fp8_blockwise_linear_backends.py @@ -24,9 +24,9 @@ from sglang.test.layer_ut_utils import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=120, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-small") -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") FP8_MAX = 448.0 diff --git a/test/registered/unit/layers/quantization/test_fp8_moe_runner_ownership.py b/test/registered/unit/layers/quantization/test_fp8_moe_runner_ownership.py index 08316b4f5..16a6ac9fe 100644 --- a/test/registered/unit/layers/quantization/test_fp8_moe_runner_ownership.py +++ b/test/registered/unit/layers/quantization/test_fp8_moe_runner_ownership.py @@ -20,7 +20,7 @@ from sglang.srt.runtime_context import get_flags from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") _ACTIVATION_PARAMS = ("gemm1_alpha", "gemm1_beta", "gemm1_clamp_limit") diff --git a/test/registered/unit/layers/quantization/test_fp8_moe_weight_gating.py b/test/registered/unit/layers/quantization/test_fp8_moe_weight_gating.py index e68d1bd51..85f4bb1ce 100644 --- a/test/registered/unit/layers/quantization/test_fp8_moe_weight_gating.py +++ b/test/registered/unit/layers/quantization/test_fp8_moe_weight_gating.py @@ -9,7 +9,7 @@ follow the same shard count, or the two describe different tensors. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import unittest from unittest.mock import MagicMock, patch diff --git a/test/registered/unit/layers/quantization/test_fp8_utils_mxfp4.py b/test/registered/unit/layers/quantization/test_fp8_utils_mxfp4.py index 2275f7de2..21bd427e2 100644 --- a/test/registered/unit/layers/quantization/test_fp8_utils_mxfp4.py +++ b/test/registered/unit/layers/quantization/test_fp8_utils_mxfp4.py @@ -11,7 +11,7 @@ from sglang.srt.layers.quantization.fp8_utils import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestFp8UtilsMxfp4(CustomTestCase): diff --git a/test/registered/unit/layers/quantization/test_gptq_scheme_attach.py b/test/registered/unit/layers/quantization/test_gptq_scheme_attach.py index 55ad0121c..1828b29f0 100644 --- a/test/registered/unit/layers/quantization/test_gptq_scheme_attach.py +++ b/test/registered/unit/layers/quantization/test_gptq_scheme_attach.py @@ -18,7 +18,7 @@ from sglang.srt.layers.vocab_parallel_embedding import VocabParallelEmbedding from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") _GPTQ_CHECKPOINT_CONFIG = { "bits": 4, diff --git a/test/registered/unit/layers/quantization/test_humming_w4afp8_schemas.py b/test/registered/unit/layers/quantization/test_humming_w4afp8_schemas.py index ceeb07629..40cdc9747 100644 --- a/test/registered/unit/layers/quantization/test_humming_w4afp8_schemas.py +++ b/test/registered/unit/layers/quantization/test_humming_w4afp8_schemas.py @@ -19,7 +19,7 @@ from sglang.srt.layers.quantization.humming import ( # noqa: E402 _W4AFp8CheckpointWeightSchema, ) -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestW4AFp8CheckpointSchema(CustomTestCase): diff --git a/test/registered/unit/layers/quantization/test_int8_linear_methods.py b/test/registered/unit/layers/quantization/test_int8_linear_methods.py index f6f3dd054..fa6f04329 100644 --- a/test/registered/unit/layers/quantization/test_int8_linear_methods.py +++ b/test/registered/unit/layers/quantization/test_int8_linear_methods.py @@ -23,7 +23,7 @@ from sglang.test.layer_ut_utils import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") INT8_MAX = 127.0 diff --git a/test/registered/unit/layers/quantization/test_marlin_utils_fp8.py b/test/registered/unit/layers/quantization/test_marlin_utils_fp8.py index 75e2602ae..ae095060b 100644 --- a/test/registered/unit/layers/quantization/test_marlin_utils_fp8.py +++ b/test/registered/unit/layers/quantization/test_marlin_utils_fp8.py @@ -9,7 +9,7 @@ from sglang.srt.layers.quantization import marlin_utils_fp8 from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestFp8MarlinBias(CustomTestCase): diff --git a/test/registered/unit/layers/quantization/test_modelopt_nvfp4.py b/test/registered/unit/layers/quantization/test_modelopt_nvfp4.py index cb2f4bdd0..923b886a1 100644 --- a/test/registered/unit/layers/quantization/test_modelopt_nvfp4.py +++ b/test/registered/unit/layers/quantization/test_modelopt_nvfp4.py @@ -14,7 +14,7 @@ from sglang.srt.model_loader.weight_utils import default_weight_loader from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestModelOptNvfp4(CustomTestCase): diff --git a/test/registered/unit/layers/quantization/test_modelopt_nvfp4_moe_scales.py b/test/registered/unit/layers/quantization/test_modelopt_nvfp4_moe_scales.py index 5424212f7..4ebb9f5fe 100644 --- a/test/registered/unit/layers/quantization/test_modelopt_nvfp4_moe_scales.py +++ b/test/registered/unit/layers/quantization/test_modelopt_nvfp4_moe_scales.py @@ -18,7 +18,7 @@ sizes, so a failure looks like one a real checkpoint would hit. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/layers/quantization/test_mxfp4_flashinfer_activation_prep.py b/test/registered/unit/layers/quantization/test_mxfp4_flashinfer_activation_prep.py index 5c63c85f9..37b2b1fc8 100644 --- a/test/registered/unit/layers/quantization/test_mxfp4_flashinfer_activation_prep.py +++ b/test/registered/unit/layers/quantization/test_mxfp4_flashinfer_activation_prep.py @@ -12,7 +12,7 @@ from sglang.srt.layers.quantization.mxfp4 import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") per_token_group_quant_module = importlib.import_module( "sglang.kernels.ops.quantization.per_token_group_quant" diff --git a/test/registered/unit/layers/quantization/test_mxfp4_sm120_cutlass.py b/test/registered/unit/layers/quantization/test_mxfp4_sm120_cutlass.py index b24090f5d..30b759085 100644 --- a/test/registered/unit/layers/quantization/test_mxfp4_sm120_cutlass.py +++ b/test/registered/unit/layers/quantization/test_mxfp4_sm120_cutlass.py @@ -14,7 +14,7 @@ import torch from sglang.srt.runtime_context import override_platform from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-small") def _random_weights(num_experts: int, hidden: int, intermediate: int): diff --git a/test/registered/unit/layers/quantization/test_mxfp4_sm90_cutlass.py b/test/registered/unit/layers/quantization/test_mxfp4_sm90_cutlass.py index e6cb81f2e..29dfbcd9d 100644 --- a/test/registered/unit/layers/quantization/test_mxfp4_sm90_cutlass.py +++ b/test/registered/unit/layers/quantization/test_mxfp4_sm90_cutlass.py @@ -20,7 +20,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") flashinfer_fused_moe = pytest.importorskip("flashinfer.fused_moe") diff --git a/test/registered/unit/layers/quantization/test_nvfp4_linear_backends.py b/test/registered/unit/layers/quantization/test_nvfp4_linear_backends.py index dd11a979a..484603e14 100644 --- a/test/registered/unit/layers/quantization/test_nvfp4_linear_backends.py +++ b/test/registered/unit/layers/quantization/test_nvfp4_linear_backends.py @@ -30,7 +30,7 @@ from sglang.test.quant_ref_utils import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=120, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") # (M, N, K). The second shape hits the padding paths: N=160 is not a multiple # of 128 (TRTLLM shuffle pad) and K=336 is neither a multiple of 32 (CUTLASS diff --git a/test/registered/unit/layers/quantization/test_nvfp4_moe_backends.py b/test/registered/unit/layers/quantization/test_nvfp4_moe_backends.py index f59998758..8ba5f246b 100644 --- a/test/registered/unit/layers/quantization/test_nvfp4_moe_backends.py +++ b/test/registered/unit/layers/quantization/test_nvfp4_moe_backends.py @@ -23,7 +23,7 @@ from sglang.test.quant_ref_utils import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=120, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200") E, H, I, TOPK, M = 8, 1024, 1024, 2, 32 diff --git a/test/registered/unit/layers/quantization/test_quark_config.py b/test/registered/unit/layers/quantization/test_quark_config.py index c2990d79b..a5753e6a5 100644 --- a/test/registered/unit/layers/quantization/test_quark_config.py +++ b/test/registered/unit/layers/quantization/test_quark_config.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") import unittest from unittest.mock import patch diff --git a/test/registered/unit/layers/quantization/test_quark_utils.py b/test/registered/unit/layers/quantization/test_quark_utils.py index 606dd346d..6ae108bd4 100644 --- a/test/registered/unit/layers/quantization/test_quark_utils.py +++ b/test/registered/unit/layers/quantization/test_quark_utils.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/layers/test_attn_residual.py b/test/registered/unit/layers/test_attn_residual.py index 79d85b682..ec09cff93 100644 --- a/test/registered/unit/layers/test_attn_residual.py +++ b/test/registered/unit/layers/test_attn_residual.py @@ -3,7 +3,7 @@ import unittest from sglang.srt.layers.attn_residual import _supports_attn_res_tma from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestAttnResidual(unittest.TestCase): diff --git a/test/registered/unit/layers/test_conv_layer.py b/test/registered/unit/layers/test_conv_layer.py index 49d82953e..7b5114dd5 100644 --- a/test/registered/unit/layers/test_conv_layer.py +++ b/test/registered/unit/layers/test_conv_layer.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/layers/test_dsv4_kv_splits_heuristic.py b/test/registered/unit/layers/test_dsv4_kv_splits_heuristic.py index 79997eaf6..9f0d5dad5 100644 --- a/test/registered/unit/layers/test_dsv4_kv_splits_heuristic.py +++ b/test/registered/unit/layers/test_dsv4_kv_splits_heuristic.py @@ -21,7 +21,7 @@ from sglang.kernels.ops.attention.dsv4.unified_kv_kernels.paged_decode import ( ) from sglang.test.ci.ci_register import register_cpu_ci # noqa: E402 -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # MI355X. Passed explicitly so the tests are device-independent and run on CPU. NUM_CU = 256 diff --git a/test/registered/unit/layers/test_dsv4_nonpaged_indexer.py b/test/registered/unit/layers/test_dsv4_nonpaged_indexer.py index 8d3af8edb..2f08b5c26 100644 --- a/test/registered/unit/layers/test_dsv4_nonpaged_indexer.py +++ b/test/registered/unit/layers/test_dsv4_nonpaged_indexer.py @@ -20,7 +20,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") _INDEXER = "sglang.srt.layers.attention.dsv4.indexer" diff --git a/test/registered/unit/layers/test_flashattention_paged_mha.py b/test/registered/unit/layers/test_flashattention_paged_mha.py index 711860095..7a1799be5 100644 --- a/test/registered/unit/layers/test_flashattention_paged_mha.py +++ b/test/registered/unit/layers/test_flashattention_paged_mha.py @@ -22,7 +22,7 @@ with patch.dict( FlashAttentionBackend, ) -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _backend(): diff --git a/test/registered/unit/layers/test_flashinfer_comm_fusion.py b/test/registered/unit/layers/test_flashinfer_comm_fusion.py index 337068682..a82ad8107 100644 --- a/test/registered/unit/layers/test_flashinfer_comm_fusion.py +++ b/test/registered/unit/layers/test_flashinfer_comm_fusion.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import CustomTestCase # Collectives are mocked and world_size is a plain int, so the world_size=4 # cases need one real CUDA device. -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") class _FakeWorkspace: diff --git a/test/registered/unit/layers/test_fp8_bpreshuffle_scale.py b/test/registered/unit/layers/test_fp8_bpreshuffle_scale.py index b13ee3384..c94e6a4ff 100644 --- a/test/registered/unit/layers/test_fp8_bpreshuffle_scale.py +++ b/test/registered/unit/layers/test_fp8_bpreshuffle_scale.py @@ -13,7 +13,7 @@ from sglang.srt.layers.quantization.fp8_utils import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _simulate_transpose_scale_emit(values: torch.Tensor) -> torch.Tensor: diff --git a/test/registered/unit/layers/test_kda_decode_mtp_slot_stride.py b/test/registered/unit/layers/test_kda_decode_mtp_slot_stride.py index 45c3b2e78..3e2899e9c 100644 --- a/test/registered/unit/layers/test_kda_decode_mtp_slot_stride.py +++ b/test/registered/unit/layers/test_kda_decode_mtp_slot_stride.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-small") import importlib.util import unittest diff --git a/test/registered/unit/layers/test_layer_communicator_fusion_gate.py b/test/registered/unit/layers/test_layer_communicator_fusion_gate.py index 6241aa9e5..aa52f9903 100644 --- a/test/registered/unit/layers/test_layer_communicator_fusion_gate.py +++ b/test/registered/unit/layers/test_layer_communicator_fusion_gate.py @@ -8,7 +8,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _fake_communicator(mlp_mode=ScatterMode.TP_ATTN_FULL): diff --git a/test/registered/unit/layers/test_layer_scatter_modes_cp_dense_mlp.py b/test/registered/unit/layers/test_layer_scatter_modes_cp_dense_mlp.py index 4d1867788..b725e75bc 100644 --- a/test/registered/unit/layers/test_layer_scatter_modes_cp_dense_mlp.py +++ b/test/registered/unit/layers/test_layer_scatter_modes_cp_dense_mlp.py @@ -6,7 +6,7 @@ from sglang.srt.layers.communicator import LayerScatterModes, ScatterMode from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestDenseMlpScatterModeUnderPrefillCP(CustomTestCase): diff --git a/test/registered/unit/layers/test_layernorm_sp.py b/test/registered/unit/layers/test_layernorm_sp.py index 23925d51a..47ca113cd 100644 --- a/test/registered/unit/layers/test_layernorm_sp.py +++ b/test/registered/unit/layers/test_layernorm_sp.py @@ -15,7 +15,7 @@ from sglang.srt.runtime_context import get_flags, get_forward, reset_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _initialize(*, enable=True, arch="Qwen3ForCausalLM"): diff --git a/test/registered/unit/layers/test_logprob_chunk_stitching.py b/test/registered/unit/layers/test_logprob_chunk_stitching.py index 31bc8e35b..f84507816 100644 --- a/test/registered/unit/layers/test_logprob_chunk_stitching.py +++ b/test/registered/unit/layers/test_logprob_chunk_stitching.py @@ -16,7 +16,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.logprob_test_utils import coverage_cases from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") VOCAB = 11 # Heterogeneous per-sequence parameters; uniform ones hide misalignment. diff --git a/test/registered/unit/layers/test_logprob_fast_input.py b/test/registered/unit/layers/test_logprob_fast_input.py index 8de8607e3..99e685f4f 100644 --- a/test/registered/unit/layers/test_logprob_fast_input.py +++ b/test/registered/unit/layers/test_logprob_fast_input.py @@ -20,7 +20,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.logprob_test_utils import coverage_cases from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") VOCAB = 11 # Heterogeneous per-sequence parameters; uniform ones hide misalignment. diff --git a/test/registered/unit/layers/test_mamba2_track_ssm_indices.py b/test/registered/unit/layers/test_mamba2_track_ssm_indices.py index b081f5425..d1bc4be93 100644 --- a/test/registered/unit/layers/test_mamba2_track_ssm_indices.py +++ b/test/registered/unit/layers/test_mamba2_track_ssm_indices.py @@ -11,7 +11,7 @@ import torch from sglang.srt.layers.attention.hybrid_linear_attn_backend import Mamba2AttnBackend from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") CHUNK = 128 diff --git a/test/registered/unit/layers/test_mamba_state_scatter_triton.py b/test/registered/unit/layers/test_mamba_state_scatter_triton.py index 74be3c848..aa0897e10 100644 --- a/test/registered/unit/layers/test_mamba_state_scatter_triton.py +++ b/test/registered/unit/layers/test_mamba_state_scatter_triton.py @@ -7,7 +7,7 @@ from sglang.test.ci.ci_register import ( register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=7, suite="stage-b-test-1-gpu-small-amd-mi35x") # The dst layout-contract tests run on CPU (no kernel launch). -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/layers/test_minicpm_attention_adapter.py b/test/registered/unit/layers/test_minicpm_attention_adapter.py index 0c67d7ea9..e08568c0a 100644 --- a/test/registered/unit/layers/test_minicpm_attention_adapter.py +++ b/test/registered/unit/layers/test_minicpm_attention_adapter.py @@ -24,7 +24,7 @@ with patch.dict( MiniCPMFlashInferAdapter, ) -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _metadata(rows=1): diff --git a/test/registered/unit/layers/test_minicpm_sparse_cache.py b/test/registered/unit/layers/test_minicpm_sparse_cache.py index 675c7ae00..8db2c22cf 100644 --- a/test/registered/unit/layers/test_minicpm_sparse_cache.py +++ b/test/registered/unit/layers/test_minicpm_sparse_cache.py @@ -19,7 +19,7 @@ from sglang.srt.mem_cache.memory_pool import ReqToTokenPool from sglang.srt.session.streaming_session import SessionSlot, StreamingSession from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class RecordingAllocator(BaseTokenToKVPoolAllocator): diff --git a/test/registered/unit/layers/test_minicpm_sparse_metadata.py b/test/registered/unit/layers/test_minicpm_sparse_metadata.py index de6bc153a..d11dca84f 100644 --- a/test/registered/unit/layers/test_minicpm_sparse_metadata.py +++ b/test/registered/unit/layers/test_minicpm_sparse_metadata.py @@ -37,7 +37,7 @@ with patch.dict( ) from sglang.srt.runtime_context import get_context, get_schedule -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=22, suite="base-a-test-cpu") def _compression_layout(): diff --git a/test/registered/unit/layers/test_moriep_mxfp8_dispatch.py b/test/registered/unit/layers/test_moriep_mxfp8_dispatch.py index c8d89d9d1..60fcc2ffc 100644 --- a/test/registered/unit/layers/test_moriep_mxfp8_dispatch.py +++ b/test/registered/unit/layers/test_moriep_mxfp8_dispatch.py @@ -21,7 +21,7 @@ from sglang.srt.layers.moe.token_dispatcher.moriep import ( # noqa: E402 ) from sglang.test.ci.ci_register import register_cpu_ci # noqa: E402 -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") HIDDEN = 7168 # DeepSeek-V4 diff --git a/test/registered/unit/layers/test_mova.py b/test/registered/unit/layers/test_mova.py index 6d69a9d2a..72d6b3584 100644 --- a/test/registered/unit/layers/test_mova.py +++ b/test/registered/unit/layers/test_mova.py @@ -21,7 +21,7 @@ from sglang.srt.layers.mova import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") def test_router_bias_changes_selection_but_not_mixture_weights(): diff --git a/test/registered/unit/layers/test_radix_attention.py b/test/registered/unit/layers/test_radix_attention.py index 8cf4cb633..2e65999cc 100644 --- a/test/registered/unit/layers/test_radix_attention.py +++ b/test/registered/unit/layers/test_radix_attention.py @@ -13,7 +13,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _RecordingAttentionBackend: diff --git a/test/registered/unit/layers/test_radix_linear_attention.py b/test/registered/unit/layers/test_radix_linear_attention.py index 100e1ed7f..a11230a8e 100644 --- a/test/registered/unit/layers/test_radix_linear_attention.py +++ b/test/registered/unit/layers/test_radix_linear_attention.py @@ -9,7 +9,7 @@ import sglang.srt.layers.radix_linear_attention as radix_linear_attention from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _FakeAttentionBackend: diff --git a/test/registered/unit/lora/test_deepseek_mla_correction.py b/test/registered/unit/lora/test_deepseek_mla_correction.py index 7c20fe2c2..37af119d6 100644 --- a/test/registered/unit/lora/test_deepseek_mla_correction.py +++ b/test/registered/unit/lora/test_deepseek_mla_correction.py @@ -4,7 +4,7 @@ from types import SimpleNamespace from sglang.srt.lora.deepseek_mla_correction import is_kv_b_lora_active from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestDeepseekMLACorrection(unittest.TestCase): diff --git a/test/registered/unit/lora/test_eviction_policy.py b/test/registered/unit/lora/test_eviction_policy.py index ef64a54a7..a70e87c1c 100644 --- a/test/registered/unit/lora/test_eviction_policy.py +++ b/test/registered/unit/lora/test_eviction_policy.py @@ -20,7 +20,7 @@ from sglang.srt.lora.eviction_policy import get_eviction_policy from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestLoRAEvictionPolicy(CustomTestCase): diff --git a/test/registered/unit/lora/test_experimental_sgl_marlin_multi_prefill.py b/test/registered/unit/lora/test_experimental_sgl_marlin_multi_prefill.py index 7bb98b355..25bb30675 100644 --- a/test/registered/unit/lora/test_experimental_sgl_marlin_multi_prefill.py +++ b/test/registered/unit/lora/test_experimental_sgl_marlin_multi_prefill.py @@ -9,7 +9,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") _CUDA_BF16_AVAILABLE = bool( diff --git a/test/registered/unit/lora/test_experimental_sgl_marlin_policy.py b/test/registered/unit/lora/test_experimental_sgl_marlin_policy.py index 16ee71a99..ded06e7e3 100644 --- a/test/registered/unit/lora/test_experimental_sgl_marlin_policy.py +++ b/test/registered/unit/lora/test_experimental_sgl_marlin_policy.py @@ -11,7 +11,7 @@ from sglang.srt.lora.marlin_lora_temp.policy import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") # Both spellings of "this server serves adapters". The validator must apply the diff --git a/test/registered/unit/lora/test_experimental_sgl_marlin_runtime_unit.py b/test/registered/unit/lora/test_experimental_sgl_marlin_runtime_unit.py index 117d97c47..5cd7a3bd0 100644 --- a/test/registered/unit/lora/test_experimental_sgl_marlin_runtime_unit.py +++ b/test/registered/unit/lora/test_experimental_sgl_marlin_runtime_unit.py @@ -19,7 +19,7 @@ from sglang.srt.lora.marlin_lora_temp import moe_runner from sglang.srt.lora.trtllm_lora_temp import environ as trtllm_lora_environ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") _SGLANG_ROOT = Path(sglang.__file__).resolve().parent diff --git a/test/registered/unit/lora/test_experimental_sgl_marlin_shared_outer_reduce.py b/test/registered/unit/lora/test_experimental_sgl_marlin_shared_outer_reduce.py index 9b8a918e8..a39349fde 100644 --- a/test/registered/unit/lora/test_experimental_sgl_marlin_shared_outer_reduce.py +++ b/test/registered/unit/lora/test_experimental_sgl_marlin_shared_outer_reduce.py @@ -9,7 +9,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-small") _CUDA_BF16_AVAILABLE = bool( diff --git a/test/registered/unit/lora/test_inkling_linearized_lora_unit.py b/test/registered/unit/lora/test_inkling_linearized_lora_unit.py index c019d36a9..c69de1a16 100644 --- a/test/registered/unit/lora/test_inkling_linearized_lora_unit.py +++ b/test/registered/unit/lora/test_inkling_linearized_lora_unit.py @@ -20,7 +20,7 @@ from sglang.srt.lora.lora_registry import LoRARef from sglang.test.ci.ci_register import register_cpu_ci # Pure layout / bookkeeping math: no CUDA, no distributed groups, no kernels. -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") _HIDDEN = 3 _ADAPTER_RANK = 2 diff --git a/test/registered/unit/lora/test_laguna_hidden_dim_unit.py b/test/registered/unit/lora/test_laguna_hidden_dim_unit.py index 1b410db27..f00bee250 100644 --- a/test/registered/unit/lora/test_laguna_hidden_dim_unit.py +++ b/test/registered/unit/lora/test_laguna_hidden_dim_unit.py @@ -19,7 +19,7 @@ Usage: from sglang.test.ci.ci_register import register_cpu_ci # CPU-only unit test; no CUDA/distributed dependencies. -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/lora/test_lm_head_pruning.py b/test/registered/unit/lora/test_lm_head_pruning.py index 1827df561..e3a052f15 100644 --- a/test/registered/unit/lora/test_lm_head_pruning.py +++ b/test/registered/unit/lora/test_lm_head_pruning.py @@ -25,7 +25,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestLMHeadPruning(CustomTestCase): diff --git a/test/registered/unit/lora/test_lora_manager_tied_lm_head.py b/test/registered/unit/lora/test_lora_manager_tied_lm_head.py index 94fdfec2c..0290bdfb9 100644 --- a/test/registered/unit/lora/test_lora_manager_tied_lm_head.py +++ b/test/registered/unit/lora/test_lora_manager_tied_lm_head.py @@ -27,7 +27,7 @@ from sglang.srt.lora.lora_manager import LoRAManager from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class _TiedEmbedding(torch.nn.Module): diff --git a/test/registered/unit/lora/test_lora_moe_inplace_unit.py b/test/registered/unit/lora/test_lora_moe_inplace_unit.py index 24a75a00f..b8ce80a82 100644 --- a/test/registered/unit/lora/test_lora_moe_inplace_unit.py +++ b/test/registered/unit/lora/test_lora_moe_inplace_unit.py @@ -24,7 +24,7 @@ Usage: from sglang.test.ci.ci_register import register_cpu_ci # CPU-only unit test; no CUDA/distributed dependencies. -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import types import unittest diff --git a/test/registered/unit/lora/test_lora_spec_verify_batch_info.py b/test/registered/unit/lora/test_lora_spec_verify_batch_info.py index 1aee79715..d7984eeaa 100644 --- a/test/registered/unit/lora/test_lora_spec_verify_batch_info.py +++ b/test/registered/unit/lora/test_lora_spec_verify_batch_info.py @@ -24,7 +24,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") def _verify_batch(bs: int, draft_token_num: int) -> SimpleNamespace: diff --git a/test/registered/unit/lora/test_mem_pool_ep_unit.py b/test/registered/unit/lora/test_mem_pool_ep_unit.py index 0329337f0..d33fc4414 100644 --- a/test/registered/unit/lora/test_mem_pool_ep_unit.py +++ b/test/registered/unit/lora/test_mem_pool_ep_unit.py @@ -16,7 +16,7 @@ Usage: from sglang.test.ci.ci_register import register_cpu_ci # CPU-only unit test; no CUDA/distributed dependencies. -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import ast import types diff --git a/test/registered/unit/lora/test_uno_inactive_lora_batch.py b/test/registered/unit/lora/test_uno_inactive_lora_batch.py index ade5ebae8..5b47794be 100644 --- a/test/registered/unit/lora/test_uno_inactive_lora_batch.py +++ b/test/registered/unit/lora/test_uno_inactive_lora_batch.py @@ -7,7 +7,7 @@ from sglang.srt.lora.lora_manager import LoRAManager from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _InactiveSkippingBackend: diff --git a/test/registered/unit/lora/test_uno_lora_targets.py b/test/registered/unit/lora/test_uno_lora_targets.py index e33500cf0..bfe058ed3 100644 --- a/test/registered/unit/lora/test_uno_lora_targets.py +++ b/test/registered/unit/lora/test_uno_lora_targets.py @@ -18,7 +18,7 @@ from sglang.srt.lora.lora_manager import LoRAManager from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestUnoLoRATargets(CustomTestCase): diff --git a/test/registered/unit/managers/scheduler_components/test_dp_attn.py b/test/registered/unit/managers/scheduler_components/test_dp_attn.py index f69979861..1cd9230ff 100644 --- a/test/registered/unit/managers/scheduler_components/test_dp_attn.py +++ b/test/registered/unit/managers/scheduler_components/test_dp_attn.py @@ -12,7 +12,7 @@ from sglang.srt.managers.scheduler_components import dp_attn # noqa: E402 from sglang.srt.model_executor.forward_batch_info import ForwardMode # noqa: E402 from sglang.srt.speculative.spec_info import SpeculativeAlgorithm # noqa: E402 -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestDPAttnSchedulerMetadata(CustomTestCase): diff --git a/test/registered/unit/managers/scheduler_components/test_invariant_checker.py b/test/registered/unit/managers/scheduler_components/test_invariant_checker.py index 33a0f9a8e..97eeb06f6 100644 --- a/test/registered/unit/managers/scheduler_components/test_invariant_checker.py +++ b/test/registered/unit/managers/scheduler_components/test_invariant_checker.py @@ -14,7 +14,7 @@ from sglang.srt.managers.scheduler_components.invariant_checker import ( SchedulerInvariantChecker, ) -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestCheckTreeCacheGate(CustomTestCase): diff --git a/test/registered/unit/managers/scheduler_components/test_output_sender.py b/test/registered/unit/managers/scheduler_components/test_output_sender.py index 2a1cc3725..85110137c 100644 --- a/test/registered/unit/managers/scheduler_components/test_output_sender.py +++ b/test/registered/unit/managers/scheduler_components/test_output_sender.py @@ -13,7 +13,7 @@ from sglang.srt.managers.schedule_batch import Req from sglang.srt.managers.scheduler_components.output_sender import SenderWrapper from sglang.srt.sampling.sampling_params import SamplingParams -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _make_scheduler_req(http_worker_ipc: str) -> Req: diff --git a/test/registered/unit/managers/test_batch_result_processor_hidden_states.py b/test/registered/unit/managers/test_batch_result_processor_hidden_states.py index f273100de..479c7ed0f 100644 --- a/test/registered/unit/managers/test_batch_result_processor_hidden_states.py +++ b/test/registered/unit/managers/test_batch_result_processor_hidden_states.py @@ -13,7 +13,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _make_processor(case, server_mode: str = "full") -> SchedulerBatchResultProcessor: diff --git a/test/registered/unit/managers/test_batch_result_processor_mamba_boundary.py b/test/registered/unit/managers/test_batch_result_processor_mamba_boundary.py index 1f9754e68..d9e90efe4 100644 --- a/test/registered/unit/managers/test_batch_result_processor_mamba_boundary.py +++ b/test/registered/unit/managers/test_batch_result_processor_mamba_boundary.py @@ -15,7 +15,7 @@ from sglang.srt.runtime_context import get_context from sglang.srt.sampling.sampling_params import SamplingParams from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") # The decode checkpoint grid is lcm(mamba_cache_chunk_size, tree page, diff --git a/test/registered/unit/managers/test_batch_result_processor_spec_grammar.py b/test/registered/unit/managers/test_batch_result_processor_spec_grammar.py index 796c7a99e..fa25f2548 100644 --- a/test/registered/unit/managers/test_batch_result_processor_spec_grammar.py +++ b/test/registered/unit/managers/test_batch_result_processor_spec_grammar.py @@ -22,7 +22,7 @@ from sglang.srt.sampling.sampling_params import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _FakeGrammar: diff --git a/test/registered/unit/managers/test_customized_info_streaming.py b/test/registered/unit/managers/test_customized_info_streaming.py index 71c814725..0a8104376 100644 --- a/test/registered/unit/managers/test_customized_info_streaming.py +++ b/test/registered/unit/managers/test_customized_info_streaming.py @@ -16,7 +16,7 @@ if TYPE_CHECKING: from sglang.srt.layers.logits_processor import LogitsProcessorOutput from sglang.srt.sampling.sampling_batch_info import SamplingBatchInfo -register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=26, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=120, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/unit/managers/test_data_parallel_controller.py b/test/registered/unit/managers/test_data_parallel_controller.py index 6ab3cfc53..85c373f45 100644 --- a/test/registered/unit/managers/test_data_parallel_controller.py +++ b/test/registered/unit/managers/test_data_parallel_controller.py @@ -29,7 +29,7 @@ from sglang.srt.managers.data_parallel_controller import ( ) from sglang.srt.managers.load_snapshot import LoadSnapshot -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") _BASE_LOAD = msgspec.structs.replace( diff --git a/test/registered/unit/managers/test_detailed_annotations.py b/test/registered/unit/managers/test_detailed_annotations.py index c5ad6a98c..5d8a12d19 100644 --- a/test/registered/unit/managers/test_detailed_annotations.py +++ b/test/registered/unit/managers/test_detailed_annotations.py @@ -25,7 +25,7 @@ from sglang.srt.model_executor.step_span_utils import ( ) from sglang.srt.utils.profile_utils import build_step_span_name -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _CpuMirror: diff --git a/test/registered/unit/managers/test_embed_overrides.py b/test/registered/unit/managers/test_embed_overrides.py index 015c1d59d..4c49d7120 100644 --- a/test/registered/unit/managers/test_embed_overrides.py +++ b/test/registered/unit/managers/test_embed_overrides.py @@ -24,7 +24,7 @@ from sglang.srt.managers.tokenizer_manager_score_mixin import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") HIDDEN_DIM = 4 diff --git a/test/registered/unit/managers/test_fanout_communicator.py b/test/registered/unit/managers/test_fanout_communicator.py index 07282e2fd..d40687af6 100644 --- a/test/registered/unit/managers/test_fanout_communicator.py +++ b/test/registered/unit/managers/test_fanout_communicator.py @@ -7,7 +7,7 @@ from sglang.srt.managers.communicator import FanOutCommunicator from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestQueueingCall(CustomTestCase): diff --git a/test/registered/unit/managers/test_finish_length_speculative.py b/test/registered/unit/managers/test_finish_length_speculative.py index ad4c167a5..5e1a174de 100644 --- a/test/registered/unit/managers/test_finish_length_speculative.py +++ b/test/registered/unit/managers/test_finish_length_speculative.py @@ -25,7 +25,7 @@ from sglang.srt.managers.schedule_batch import ( ) from sglang.srt.sampling.sampling_params import SamplingParams -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") EOS_ID = 2 STOP_ID = 1 diff --git a/test/registered/unit/managers/test_flat_raw_top_logprobs.py b/test/registered/unit/managers/test_flat_raw_top_logprobs.py index d1fe83257..f7e4e09e6 100644 --- a/test/registered/unit/managers/test_flat_raw_top_logprobs.py +++ b/test/registered/unit/managers/test_flat_raw_top_logprobs.py @@ -40,7 +40,7 @@ from sglang.srt.managers.tokenizer_manager import ( from sglang.srt.observability.req_time_stats import APIServerReqTimeStats from sglang.srt.sampling.sampling_params import SamplingParams -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") # Synthetic per-position top-k rows (k=2). The leading None mirrors the first # prompt position, which has no top logprobs. diff --git a/test/registered/unit/managers/test_generation_auxiliary_output.py b/test/registered/unit/managers/test_generation_auxiliary_output.py index 6626b2a93..723a82fce 100644 --- a/test/registered/unit/managers/test_generation_auxiliary_output.py +++ b/test/registered/unit/managers/test_generation_auxiliary_output.py @@ -18,7 +18,7 @@ from sglang.srt.model_executor.model_runner import ModelRunner from sglang.srt.speculative.spec_info import SpeculativeAlgorithm from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=14, suite="base-a-test-cpu") @dataclass diff --git a/test/registered/unit/managers/test_grammar_stop_speculative.py b/test/registered/unit/managers/test_grammar_stop_speculative.py index 564489ece..0a60c2b8f 100644 --- a/test/registered/unit/managers/test_grammar_stop_speculative.py +++ b/test/registered/unit/managers/test_grammar_stop_speculative.py @@ -7,7 +7,7 @@ from sglang.srt.managers.schedule_batch import Req from sglang.srt.sampling.sampling_params import SamplingParams from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") EOS_TOKEN_ID = 2 STOP_TOKEN_ID = 17 diff --git a/test/registered/unit/managers/test_hidden_state_server_mode.py b/test/registered/unit/managers/test_hidden_state_server_mode.py index 267478bf1..5aa30c20a 100644 --- a/test/registered/unit/managers/test_hidden_state_server_mode.py +++ b/test/registered/unit/managers/test_hidden_state_server_mode.py @@ -8,7 +8,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestHiddenStateServerMode(CustomTestCase): diff --git a/test/registered/unit/managers/test_hisparse_unit.py b/test/registered/unit/managers/test_hisparse_unit.py index e716f4057..d16e66c59 100644 --- a/test/registered/unit/managers/test_hisparse_unit.py +++ b/test/registered/unit/managers/test_hisparse_unit.py @@ -19,7 +19,7 @@ from sglang.srt.utils import is_cuda, is_hip, is_npu, is_xpu from sglang.srt.utils.common import Range from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/managers/test_io_struct.py b/test/registered/unit/managers/test_io_struct.py index 40c534f9d..c35ba141a 100644 --- a/test/registered/unit/managers/test_io_struct.py +++ b/test/registered/unit/managers/test_io_struct.py @@ -37,7 +37,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=8, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/managers/test_kv_page_invariants.py b/test/registered/unit/managers/test_kv_page_invariants.py index 2d2109c69..9ba86262b 100644 --- a/test/registered/unit/managers/test_kv_page_invariants.py +++ b/test/registered/unit/managers/test_kv_page_invariants.py @@ -9,7 +9,7 @@ from sglang.srt.managers.schedule_batch import ReqKvInfo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") _PAGE_SIZE = 256 diff --git a/test/registered/unit/managers/test_load_inquirer.py b/test/registered/unit/managers/test_load_inquirer.py index 133c4eef7..7fdfdef61 100644 --- a/test/registered/unit/managers/test_load_inquirer.py +++ b/test/registered/unit/managers/test_load_inquirer.py @@ -12,7 +12,7 @@ from sglang.srt.managers.scheduler_components.load_inquirer import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestSchedulePolicyWaitingQueueMatching(unittest.TestCase): diff --git a/test/registered/unit/managers/test_load_snapshot_backends.py b/test/registered/unit/managers/test_load_snapshot_backends.py index c3637889d..e93bbfcb8 100644 --- a/test/registered/unit/managers/test_load_snapshot_backends.py +++ b/test/registered/unit/managers/test_load_snapshot_backends.py @@ -26,7 +26,7 @@ from sglang.test.test_utils import CustomTestCase, maybe_stub_sgl_kernel maybe_stub_sgl_kernel() -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _temp_path() -> str: diff --git a/test/registered/unit/managers/test_loadstat_wire.py b/test/registered/unit/managers/test_loadstat_wire.py index 3211ac810..05a58b449 100644 --- a/test/registered/unit/managers/test_loadstat_wire.py +++ b/test/registered/unit/managers/test_loadstat_wire.py @@ -31,7 +31,7 @@ from sglang.srt.managers.scheduler_components.load_publisher import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestLoadStatWire(CustomTestCase): diff --git a/test/registered/unit/managers/test_lora_update_result_merge.py b/test/registered/unit/managers/test_lora_update_result_merge.py index fb4cc221b..c91b24a6d 100644 --- a/test/registered/unit/managers/test_lora_update_result_merge.py +++ b/test/registered/unit/managers/test_lora_update_result_merge.py @@ -21,7 +21,7 @@ from sglang.srt.managers.tokenizer_control_mixin import _merge_lora_update_resul from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _ok(adapters=None) -> LoRAUpdateOutput: diff --git a/test/registered/unit/managers/test_mamba_checkpoint_depth.py b/test/registered/unit/managers/test_mamba_checkpoint_depth.py index e2dd5c573..a08843cf6 100644 --- a/test/registered/unit/managers/test_mamba_checkpoint_depth.py +++ b/test/registered/unit/managers/test_mamba_checkpoint_depth.py @@ -22,7 +22,7 @@ from sglang.srt.server_args import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") CHUNK = 64 diff --git a/test/registered/unit/managers/test_mm_hashes.py b/test/registered/unit/managers/test_mm_hashes.py index 943586e34..c35dca362 100644 --- a/test/registered/unit/managers/test_mm_hashes.py +++ b/test/registered/unit/managers/test_mm_hashes.py @@ -25,7 +25,7 @@ from sglang.srt.managers.schedule_batch import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestMmHashesContract(CustomTestCase): diff --git a/test/registered/unit/managers/test_mm_process_config.py b/test/registered/unit/managers/test_mm_process_config.py index 5f52cdd65..f1ac81bbf 100644 --- a/test/registered/unit/managers/test_mm_process_config.py +++ b/test/registered/unit/managers/test_mm_process_config.py @@ -14,7 +14,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestMmProcessConfigValidation(CustomTestCase): diff --git a/test/registered/unit/managers/test_mm_shm_error_consensus.py b/test/registered/unit/managers/test_mm_shm_error_consensus.py index 595799de2..51d951709 100644 --- a/test/registered/unit/managers/test_mm_shm_error_consensus.py +++ b/test/registered/unit/managers/test_mm_shm_error_consensus.py @@ -33,7 +33,7 @@ from sglang.srt.managers.scheduler_components.request_receiver import ( # noqa: SchedulerRequestReceiver, ) -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=23, suite="base-a-test-cpu") class _CloneFailure: diff --git a/test/registered/unit/managers/test_mm_utils_split.py b/test/registered/unit/managers/test_mm_utils_split.py index 61ab59668..59bc87638 100644 --- a/test/registered/unit/managers/test_mm_utils_split.py +++ b/test/registered/unit/managers/test_mm_utils_split.py @@ -21,7 +21,7 @@ from sglang.srt.managers.schedule_batch import Modality, MultimodalDataItem from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _bundled_item(grid_key=None, grid=None, feature_len=10, num_images=2): diff --git a/test/registered/unit/managers/test_multi_tokenizer_mixin.py b/test/registered/unit/managers/test_multi_tokenizer_mixin.py index 75af05e31..7468d1fc5 100644 --- a/test/registered/unit/managers/test_multi_tokenizer_mixin.py +++ b/test/registered/unit/managers/test_multi_tokenizer_mixin.py @@ -13,7 +13,7 @@ from sglang.srt.managers.multi_tokenizer_mixin import ( get_tokenizer_worker_class, ) -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class CustomTokenizerWorker(TokenizerWorker): diff --git a/test/registered/unit/managers/test_multimodal_abort_cleanup.py b/test/registered/unit/managers/test_multimodal_abort_cleanup.py index 39888e8f0..8ddc42b2a 100644 --- a/test/registered/unit/managers/test_multimodal_abort_cleanup.py +++ b/test/registered/unit/managers/test_multimodal_abort_cleanup.py @@ -13,7 +13,7 @@ from sglang.srt.managers.schedule_batch import ( from sglang.srt.multimodal.transport.cuda_ipc import CudaIpcTensorTransportProxy from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _deferred_proxy(): diff --git a/test/registered/unit/managers/test_output_streamer_customized_info.py b/test/registered/unit/managers/test_output_streamer_customized_info.py index e9a816c28..cd103f7f7 100644 --- a/test/registered/unit/managers/test_output_streamer_customized_info.py +++ b/test/registered/unit/managers/test_output_streamer_customized_info.py @@ -15,7 +15,7 @@ from sglang.srt.utils.weight_versions import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _FakeReq: diff --git a/test/registered/unit/managers/test_output_streamer_logprobs.py b/test/registered/unit/managers/test_output_streamer_logprobs.py index b53a6155d..30b79283b 100644 --- a/test/registered/unit/managers/test_output_streamer_logprobs.py +++ b/test/registered/unit/managers/test_output_streamer_logprobs.py @@ -8,7 +8,7 @@ from sglang.srt.managers.scheduler_components.output_streamer import ( from sglang.srt.speculative.spec_info import SpeculativeAlgorithm from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _FakeReq: diff --git a/test/registered/unit/managers/test_pp_cp_rank_offsets.py b/test/registered/unit/managers/test_pp_cp_rank_offsets.py index fd61e7cc7..c0711b4db 100644 --- a/test/registered/unit/managers/test_pp_cp_rank_offsets.py +++ b/test/registered/unit/managers/test_pp_cp_rank_offsets.py @@ -13,7 +13,7 @@ from sglang.srt.managers.scheduler_components.request_receiver import ( # noqa: ) from sglang.srt.managers.scheduler_pp_mixin import SchedulerPPMixin # noqa: E402 -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _make_ps(**overrides) -> ParallelState: diff --git a/test/registered/unit/managers/test_prefill_adder.py b/test/registered/unit/managers/test_prefill_adder.py index d74db97d6..c881f6128 100644 --- a/test/registered/unit/managers/test_prefill_adder.py +++ b/test/registered/unit/managers/test_prefill_adder.py @@ -19,7 +19,7 @@ from sglang.srt.utils.common import Range from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _RecordingDelayer: diff --git a/test/registered/unit/managers/test_prefill_delayer_high_watermark.py b/test/registered/unit/managers/test_prefill_delayer_high_watermark.py index e97a8a742..2631f4e5b 100644 --- a/test/registered/unit/managers/test_prefill_delayer_high_watermark.py +++ b/test/registered/unit/managers/test_prefill_delayer_high_watermark.py @@ -9,7 +9,7 @@ from sglang.srt.managers.prefill_delayer import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestPrefillDelayerHighWatermark(CustomTestCase): diff --git a/test/registered/unit/managers/test_priority_scheduling_disaggregation.py b/test/registered/unit/managers/test_priority_scheduling_disaggregation.py index 397e27666..d8ba69fe5 100644 --- a/test/registered/unit/managers/test_priority_scheduling_disaggregation.py +++ b/test/registered/unit/managers/test_priority_scheduling_disaggregation.py @@ -22,7 +22,7 @@ from sglang.srt.managers.scheduler import Scheduler # noqa: E402 from sglang.srt.runtime_context import get_context # noqa: E402 from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestDisaggregationPriorityQueueing(unittest.TestCase): diff --git a/test/registered/unit/managers/test_profile_merger_http_api.py b/test/registered/unit/managers/test_profile_merger_http_api.py index 8908bfafe..1dd0836e2 100644 --- a/test/registered/unit/managers/test_profile_merger_http_api.py +++ b/test/registered/unit/managers/test_profile_merger_http_api.py @@ -4,7 +4,7 @@ from sglang.srt.managers.io_struct import ProfileReq from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestProfileMergerHTTPAPI(CustomTestCase): diff --git a/test/registered/unit/managers/test_retraction_order.py b/test/registered/unit/managers/test_retraction_order.py index 3e54473e4..abd831838 100644 --- a/test/registered/unit/managers/test_retraction_order.py +++ b/test/registered/unit/managers/test_retraction_order.py @@ -7,7 +7,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _req(output_len: int, input_len: int = 8, priority=None): diff --git a/test/registered/unit/managers/test_schedule_batch_convert_decode_to_extend.py b/test/registered/unit/managers/test_schedule_batch_convert_decode_to_extend.py index 929e8a4fc..176cb4cef 100644 --- a/test/registered/unit/managers/test_schedule_batch_convert_decode_to_extend.py +++ b/test/registered/unit/managers/test_schedule_batch_convert_decode_to_extend.py @@ -21,7 +21,7 @@ from sglang.srt.managers.schedule_batch import ( # noqa: E402 ScheduleBatch, ) -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeReq: diff --git a/test/registered/unit/managers/test_schedule_batch_out_of_place.py b/test/registered/unit/managers/test_schedule_batch_out_of_place.py index 67f551a03..867ab1ee4 100644 --- a/test/registered/unit/managers/test_schedule_batch_out_of_place.py +++ b/test/registered/unit/managers/test_schedule_batch_out_of_place.py @@ -19,7 +19,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode # noqa: E4 from sglang.srt.speculative.spec_info import SpeculativeAlgorithm # noqa: E402 from sglang.srt.utils.common import Range # noqa: E402 -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") AUTO_FILL_EXCLUDED_FIELDS = ["reqs"] diff --git a/test/registered/unit/managers/test_schedule_batch_prepare_for_decode.py b/test/registered/unit/managers/test_schedule_batch_prepare_for_decode.py index 79d5e75d7..4c3df0a42 100644 --- a/test/registered/unit/managers/test_schedule_batch_prepare_for_decode.py +++ b/test/registered/unit/managers/test_schedule_batch_prepare_for_decode.py @@ -12,7 +12,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.schedule_batch import ScheduleBatch # noqa: E402 -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _make_req(): diff --git a/test/registered/unit/managers/test_schedule_batch_req_pool_indices.py b/test/registered/unit/managers/test_schedule_batch_req_pool_indices.py index 1c7c5a5e1..3fc07caf2 100644 --- a/test/registered/unit/managers/test_schedule_batch_req_pool_indices.py +++ b/test/registered/unit/managers/test_schedule_batch_req_pool_indices.py @@ -13,7 +13,7 @@ from sglang.srt.managers.hisparse_coordinator import HiSparseCoordinator # noqa from sglang.srt.managers.scheduler import Scheduler # noqa: E402 from sglang.srt.model_executor.forward_batch_info import CaptureHiddenMode # noqa: E402 -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _make_req(req_pool_idx, origin_input_ids, output_ids): diff --git a/test/registered/unit/managers/test_schedule_policy_dfs_weight.py b/test/registered/unit/managers/test_schedule_policy_dfs_weight.py index 8afef7d55..683c5b7a1 100644 --- a/test/registered/unit/managers/test_schedule_policy_dfs_weight.py +++ b/test/registered/unit/managers/test_schedule_policy_dfs_weight.py @@ -8,7 +8,7 @@ from sglang.srt.mem_cache.base_prefix_cache import BasePrefixCache from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestSchedulePolicyDfsWeight(CustomTestCase): diff --git a/test/registered/unit/managers/test_scheduler_chunked_abort_race.py b/test/registered/unit/managers/test_scheduler_chunked_abort_race.py index 38f514383..b66ae334e 100644 --- a/test/registered/unit/managers/test_scheduler_chunked_abort_race.py +++ b/test/registered/unit/managers/test_scheduler_chunked_abort_race.py @@ -11,7 +11,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.scheduler import Scheduler # noqa: E402 -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _FakeReq: diff --git a/test/registered/unit/managers/test_scheduler_chunked_req_gate.py b/test/registered/unit/managers/test_scheduler_chunked_req_gate.py index 02f77d69a..3aac9df0f 100644 --- a/test/registered/unit/managers/test_scheduler_chunked_req_gate.py +++ b/test/registered/unit/managers/test_scheduler_chunked_req_gate.py @@ -17,7 +17,7 @@ from sglang.srt.managers.scheduler import Scheduler from sglang.srt.mem_cache.chunk_cache import ChunkCache from sglang.srt.utils.common import Range -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _make_req( diff --git a/test/registered/unit/managers/test_scheduler_decision_batch_params.py b/test/registered/unit/managers/test_scheduler_decision_batch_params.py index 30c888fef..049e07e40 100644 --- a/test/registered/unit/managers/test_scheduler_decision_batch_params.py +++ b/test/registered/unit/managers/test_scheduler_decision_batch_params.py @@ -12,7 +12,7 @@ from sglang.srt.disaggregation.decode import SchedulerDisaggregationDecodeMixin from sglang.srt.disaggregation.prefill import SchedulerDisaggregationPrefillMixin from sglang.srt.managers.scheduler import Scheduler -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") FORBIDDEN_TOKENS = ("self.running_batch", "self.last_batch", "self.cur_batch") diff --git a/test/registered/unit/managers/test_scheduler_flush_cache.py b/test/registered/unit/managers/test_scheduler_flush_cache.py index 233a45357..a5030fcd4 100644 --- a/test/registered/unit/managers/test_scheduler_flush_cache.py +++ b/test/registered/unit/managers/test_scheduler_flush_cache.py @@ -12,7 +12,7 @@ from sglang.srt.managers.scheduler_components.flush_wrapper import ( SchedulerFlushWrapper, ) -register_cpu_ci(est_time=14, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/managers/test_scheduler_hicache_attach.py b/test/registered/unit/managers/test_scheduler_hicache_attach.py index d23835705..f5e567b1a 100644 --- a/test/registered/unit/managers/test_scheduler_hicache_attach.py +++ b/test/registered/unit/managers/test_scheduler_hicache_attach.py @@ -19,7 +19,7 @@ from sglang.srt.runtime_context import get_context, get_memory from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestSchedulerHiCacheAttach(CustomTestCase): diff --git a/test/registered/unit/managers/test_scheduler_init_req_max_new_tokens.py b/test/registered/unit/managers/test_scheduler_init_req_max_new_tokens.py index 93f41fb5c..29b1402e5 100644 --- a/test/registered/unit/managers/test_scheduler_init_req_max_new_tokens.py +++ b/test/registered/unit/managers/test_scheduler_init_req_max_new_tokens.py @@ -7,7 +7,7 @@ from sglang.srt.managers.scheduler import Scheduler from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestSchedulerInitReqMaxNewTokens(unittest.TestCase): diff --git a/test/registered/unit/managers/test_scheduler_internal_state_env_vars.py b/test/registered/unit/managers/test_scheduler_internal_state_env_vars.py index 22c9f6c0e..d862e7650 100644 --- a/test/registered/unit/managers/test_scheduler_internal_state_env_vars.py +++ b/test/registered/unit/managers/test_scheduler_internal_state_env_vars.py @@ -13,7 +13,7 @@ from sglang.srt.managers.io_struct import GetInternalStateReq from sglang.srt.managers.scheduler import Scheduler from sglang.srt.runtime_context import get_context -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestSchedulerInternalStateEnvVars(unittest.TestCase): diff --git a/test/registered/unit/managers/test_scheduler_internal_state_world_size.py b/test/registered/unit/managers/test_scheduler_internal_state_world_size.py index 2b6dc1d8f..d5b40fecf 100644 --- a/test/registered/unit/managers/test_scheduler_internal_state_world_size.py +++ b/test/registered/unit/managers/test_scheduler_internal_state_world_size.py @@ -11,7 +11,7 @@ from sglang.srt.managers.scheduler import Scheduler from sglang.srt.runtime_context import get_context from sglang.srt.server_args import compute_world_size -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _shape( diff --git a/test/registered/unit/managers/test_scheduler_on_idle_load.py b/test/registered/unit/managers/test_scheduler_on_idle_load.py index 770d6f990..ec8529ac0 100644 --- a/test/registered/unit/managers/test_scheduler_on_idle_load.py +++ b/test/registered/unit/managers/test_scheduler_on_idle_load.py @@ -16,7 +16,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.scheduler import Scheduler -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestOnIdleStallPublish(CustomTestCase): diff --git a/test/registered/unit/managers/test_scheduler_pause_generation.py b/test/registered/unit/managers/test_scheduler_pause_generation.py index 3550eba96..716c59e57 100644 --- a/test/registered/unit/managers/test_scheduler_pause_generation.py +++ b/test/registered/unit/managers/test_scheduler_pause_generation.py @@ -23,7 +23,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.srt.runtime_context import publish, reset_context from sglang.srt.sampling.sampling_params import SamplingParams -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/managers/test_scheduler_prefill_decode_interval.py b/test/registered/unit/managers/test_scheduler_prefill_decode_interval.py index 8b0d683c4..d23891653 100644 --- a/test/registered/unit/managers/test_scheduler_prefill_decode_interval.py +++ b/test/registered/unit/managers/test_scheduler_prefill_decode_interval.py @@ -10,7 +10,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.scheduler import Scheduler -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _make_scheduler(*, interval: int, require_mlp_sync: bool) -> Scheduler: diff --git a/test/registered/unit/managers/test_scheduler_recv_skipper.py b/test/registered/unit/managers/test_scheduler_recv_skipper.py index 14305017c..e912ffabe 100644 --- a/test/registered/unit/managers/test_scheduler_recv_skipper.py +++ b/test/registered/unit/managers/test_scheduler_recv_skipper.py @@ -12,7 +12,7 @@ from sglang.srt.managers.scheduler_components.recv_skipper import ( # noqa: E40 ) from sglang.srt.model_executor.forward_batch_info import ForwardMode # noqa: E402 -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _publish(case, interval, enable_dp_attention=False): diff --git a/test/registered/unit/managers/test_scheduler_timeouts.py b/test/registered/unit/managers/test_scheduler_timeouts.py index d9bdc99a4..fba263af5 100644 --- a/test/registered/unit/managers/test_scheduler_timeouts.py +++ b/test/registered/unit/managers/test_scheduler_timeouts.py @@ -19,7 +19,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.scheduler import Scheduler -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class _FakeReq: diff --git a/test/registered/unit/managers/test_scheduler_uno_request_validation.py b/test/registered/unit/managers/test_scheduler_uno_request_validation.py index d008b3a1d..64c9b3988 100644 --- a/test/registered/unit/managers/test_scheduler_uno_request_validation.py +++ b/test/registered/unit/managers/test_scheduler_uno_request_validation.py @@ -12,7 +12,7 @@ maybe_stub_sgl_kernel() from sglang.srt.disaggregation.utils import DisaggregationMode from sglang.srt.managers.scheduler import Scheduler -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestSchedulerUnoRequestValidation(CustomTestCase): diff --git a/test/registered/unit/managers/test_scheduler_weight_version_tracking.py b/test/registered/unit/managers/test_scheduler_weight_version_tracking.py index d2439b079..a3d1c61da 100644 --- a/test/registered/unit/managers/test_scheduler_weight_version_tracking.py +++ b/test/registered/unit/managers/test_scheduler_weight_version_tracking.py @@ -9,7 +9,7 @@ from sglang.srt.managers.scheduler_components.weight_updater import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _ServingStub: diff --git a/test/registered/unit/managers/test_stop_str_speculative.py b/test/registered/unit/managers/test_stop_str_speculative.py index 9fa605a6a..b3c9a26ba 100644 --- a/test/registered/unit/managers/test_stop_str_speculative.py +++ b/test/registered/unit/managers/test_stop_str_speculative.py @@ -12,7 +12,7 @@ from sglang.srt.managers.schedule_batch import Req from sglang.srt.sampling.sampling_params import SamplingParams from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") # Token id -> decoded text; decode() concatenates. Distinct symbols so no # accidental cross-matches (10-39 are lowercase letters). diff --git a/test/registered/unit/managers/test_tokenizer_config_updates.py b/test/registered/unit/managers/test_tokenizer_config_updates.py index 5594d37c8..1c20e2865 100644 --- a/test/registered/unit/managers/test_tokenizer_config_updates.py +++ b/test/registered/unit/managers/test_tokenizer_config_updates.py @@ -17,7 +17,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _manager(case, **fields): diff --git a/test/registered/unit/managers/test_tokenizer_manager_rid_cleanup.py b/test/registered/unit/managers/test_tokenizer_manager_rid_cleanup.py index b57389b81..464fa5024 100644 --- a/test/registered/unit/managers/test_tokenizer_manager_rid_cleanup.py +++ b/test/registered/unit/managers/test_tokenizer_manager_rid_cleanup.py @@ -38,7 +38,7 @@ from sglang.srt.observability.req_time_stats import ( # noqa: E402 ) from sglang.srt.runtime_context import get_context -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") _NOT_FINISHED = object() # Sentinel: request has not finished yet diff --git a/test/registered/unit/managers/test_trim_matched_stop.py b/test/registered/unit/managers/test_trim_matched_stop.py index 3fd09e59c..8c5fe6cf4 100644 --- a/test/registered/unit/managers/test_trim_matched_stop.py +++ b/test/registered/unit/managers/test_trim_matched_stop.py @@ -12,7 +12,7 @@ from types import SimpleNamespace from sglang.srt.managers.detokenizer_manager import DetokenizerManager from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") GPT_OSS_CALL_TOKEN = 200012 diff --git a/test/registered/unit/managers/test_uno_token_accounting.py b/test/registered/unit/managers/test_uno_token_accounting.py index c450c5c99..989abb228 100644 --- a/test/registered/unit/managers/test_uno_token_accounting.py +++ b/test/registered/unit/managers/test_uno_token_accounting.py @@ -11,7 +11,7 @@ from sglang.srt.managers.utils import GenerationBatchResult from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestUnoTokenAccounting(CustomTestCase): diff --git a/test/registered/unit/managers/test_vocab_boundary_finish.py b/test/registered/unit/managers/test_vocab_boundary_finish.py index a0b632c22..9c90459a8 100644 --- a/test/registered/unit/managers/test_vocab_boundary_finish.py +++ b/test/registered/unit/managers/test_vocab_boundary_finish.py @@ -9,7 +9,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.schedule_batch import FINISH_MATCHED_STR, Req -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") VOCAB_SIZE = 1000 diff --git a/test/registered/unit/mem_cache/test_asymmetric_mha_pool.py b/test/registered/unit/mem_cache/test_asymmetric_mha_pool.py index 4f79fed3b..6fd07948c 100644 --- a/test/registered/unit/mem_cache/test_asymmetric_mha_pool.py +++ b/test/registered/unit/mem_cache/test_asymmetric_mha_pool.py @@ -21,7 +21,7 @@ from sglang.test.ci.ci_register import register_cuda_ci _HAS_CUDA = torch.cuda.is_available() -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") DTYPE = torch.bfloat16 HEAD_NUM = 2 diff --git a/test/registered/unit/mem_cache/test_asymmetric_mha_pool_host_unit.py b/test/registered/unit/mem_cache/test_asymmetric_mha_pool_host_unit.py index e75b99039..5313ce66e 100644 --- a/test/registered/unit/mem_cache/test_asymmetric_mha_pool_host_unit.py +++ b/test/registered/unit/mem_cache/test_asymmetric_mha_pool_host_unit.py @@ -14,7 +14,7 @@ from sglang.srt.mem_cache.pool_host.mha import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _make_host(layout: str) -> AsymmetricMHATokenToKVPoolHost: diff --git a/test/registered/unit/mem_cache/test_buffer_mode_sidecar.py b/test/registered/unit/mem_cache/test_buffer_mode_sidecar.py index 68d634617..f3d0ce6c4 100644 --- a/test/registered/unit/mem_cache/test_buffer_mode_sidecar.py +++ b/test/registered/unit/mem_cache/test_buffer_mode_sidecar.py @@ -27,7 +27,7 @@ from sglang.srt.mem_cache.unified_cache.unified_tree_core_interface import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestBufferModeSidecar(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_decode_radix_lock_ref.py b/test/registered/unit/mem_cache/test_decode_radix_lock_ref.py index 73528e65b..d36d01152 100644 --- a/test/registered/unit/mem_cache/test_decode_radix_lock_ref.py +++ b/test/registered/unit/mem_cache/test_decode_radix_lock_ref.py @@ -22,7 +22,7 @@ Usage: from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import unittest from array import array diff --git a/test/registered/unit/mem_cache/test_dllm_fdfo_kv_reuse.py b/test/registered/unit/mem_cache/test_dllm_fdfo_kv_reuse.py index 6152e59cc..7af5cea53 100644 --- a/test/registered/unit/mem_cache/test_dllm_fdfo_kv_reuse.py +++ b/test/registered/unit/mem_cache/test_dllm_fdfo_kv_reuse.py @@ -13,7 +13,7 @@ from sglang.srt.mem_cache.memory_pool import ReqToTokenPool from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _FakeAllocator: diff --git a/test/registered/unit/mem_cache/test_dsa_layer_shard_utils.py b/test/registered/unit/mem_cache/test_dsa_layer_shard_utils.py index b6ddb86eb..755ac7686 100644 --- a/test/registered/unit/mem_cache/test_dsa_layer_shard_utils.py +++ b/test/registered/unit/mem_cache/test_dsa_layer_shard_utils.py @@ -8,7 +8,7 @@ from sglang.srt.mem_cache.dsa_cache_layer_split import LayerSplitDSATokenToKVPoo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestDSALayerShardUtils(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_dsa_layer_split_broadcast.py b/test/registered/unit/mem_cache/test_dsa_layer_split_broadcast.py index 328f7e7fd..7d2d49e93 100644 --- a/test/registered/unit/mem_cache/test_dsa_layer_split_broadcast.py +++ b/test/registered/unit/mem_cache/test_dsa_layer_split_broadcast.py @@ -22,7 +22,7 @@ import torch.multiprocessing as mp from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=120, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=28, stage="base-c", runner_config="4-gpu-b200") LAYER_NUM = 4 PAGE_SIZE = 64 diff --git a/test/registered/unit/mem_cache/test_dsv4_compress_write_pad.py b/test/registered/unit/mem_cache/test_dsv4_compress_write_pad.py index 2f5d1007c..93c2c5c0a 100644 --- a/test/registered/unit/mem_cache/test_dsv4_compress_write_pad.py +++ b/test/registered/unit/mem_cache/test_dsv4_compress_write_pad.py @@ -7,7 +7,7 @@ from sglang.srt.mem_cache.deepseek_v4_memory_pool import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestCompressStateWritePad(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_embedding_cache_controller.py b/test/registered/unit/mem_cache/test_embedding_cache_controller.py index fb87afb49..caf170c30 100644 --- a/test/registered/unit/mem_cache/test_embedding_cache_controller.py +++ b/test/registered/unit/mem_cache/test_embedding_cache_controller.py @@ -21,7 +21,7 @@ from sglang.srt.mem_cache.embedding_cache_controller import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _make_pool(num_pages=16, dim=4, page_size=2, modality="vision"): diff --git a/test/registered/unit/mem_cache/test_full_loc_fast_path.py b/test/registered/unit/mem_cache/test_full_loc_fast_path.py index 438f65453..54ab0ab0e 100644 --- a/test/registered/unit/mem_cache/test_full_loc_fast_path.py +++ b/test/registered/unit/mem_cache/test_full_loc_fast_path.py @@ -27,7 +27,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _loc_info(virtual_loc, swa_phys=None, full_phys=None): diff --git a/test/registered/unit/mem_cache/test_hicache_dcp_host_pool.py b/test/registered/unit/mem_cache/test_hicache_dcp_host_pool.py index 6cb4b8e18..29153e139 100644 --- a/test/registered/unit/mem_cache/test_hicache_dcp_host_pool.py +++ b/test/registered/unit/mem_cache/test_hicache_dcp_host_pool.py @@ -20,7 +20,7 @@ from sglang.srt.mem_cache.pool_host.mla import MLATokenToKVPoolHost from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") DCP_SIZE = 8 PHYSICAL_PAGE = 64 diff --git a/test/registered/unit/mem_cache/test_hicache_file_lru_unit.py b/test/registered/unit/mem_cache/test_hicache_file_lru_unit.py index a083ae3ac..930741125 100644 --- a/test/registered/unit/mem_cache/test_hicache_file_lru_unit.py +++ b/test/registered/unit/mem_cache/test_hicache_file_lru_unit.py @@ -14,7 +14,7 @@ Run with: from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import os import shutil diff --git a/test/registered/unit/mem_cache/test_hicache_host_register.py b/test/registered/unit/mem_cache/test_hicache_host_register.py index 5086d11a5..2de076e8d 100644 --- a/test/registered/unit/mem_cache/test_hicache_host_register.py +++ b/test/registered/unit/mem_cache/test_hicache_host_register.py @@ -27,7 +27,7 @@ from sglang.srt.mem_cache.pool_host.mha import ( from sglang.srt.mem_cache.pool_host.mla import MLATokenToKVPoolHost from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _FakeBuffer: diff --git a/test/registered/unit/mem_cache/test_hicache_load_back_timing.py b/test/registered/unit/mem_cache/test_hicache_load_back_timing.py index 46c5db8ec..dbcbadf70 100644 --- a/test/registered/unit/mem_cache/test_hicache_load_back_timing.py +++ b/test/registered/unit/mem_cache/test_hicache_load_back_timing.py @@ -9,7 +9,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") @unittest.skipUnless(torch.cuda.is_available(), "CUDA required") diff --git a/test/registered/unit/mem_cache/test_hicache_nixl_cleaner.py b/test/registered/unit/mem_cache/test_hicache_nixl_cleaner.py index 2f7e4bb13..90f6e17af 100644 --- a/test/registered/unit/mem_cache/test_hicache_nixl_cleaner.py +++ b/test/registered/unit/mem_cache/test_hicache_nixl_cleaner.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") import os import shutil diff --git a/test/registered/unit/mem_cache/test_hicache_nixl_storage.py b/test/registered/unit/mem_cache/test_hicache_nixl_storage.py index 3452f111e..827525493 100644 --- a/test/registered/unit/mem_cache/test_hicache_nixl_storage.py +++ b/test/registered/unit/mem_cache/test_hicache_nixl_storage.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-small") import os import shutil diff --git a/test/registered/unit/mem_cache/test_hicache_staged_write_back_dispatch.py b/test/registered/unit/mem_cache/test_hicache_staged_write_back_dispatch.py index b58344a39..76bcea13a 100644 --- a/test/registered/unit/mem_cache/test_hicache_staged_write_back_dispatch.py +++ b/test/registered/unit/mem_cache/test_hicache_staged_write_back_dispatch.py @@ -32,7 +32,7 @@ from sglang.srt.mem_cache.pool_host.mla import MLATokenToKVPoolHost from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") MEMORY_POOL_HOST_MODULE = "sglang.srt.mem_cache.memory_pool_host" DSA_POOL_HOST_MODULE = "sglang.srt.mem_cache.pool_host.dsa" diff --git a/test/registered/unit/mem_cache/test_hiradix_cache_unit.py b/test/registered/unit/mem_cache/test_hiradix_cache_unit.py index 2c0b0a205..b2ebea42a 100644 --- a/test/registered/unit/mem_cache/test_hiradix_cache_unit.py +++ b/test/registered/unit/mem_cache/test_hiradix_cache_unit.py @@ -17,7 +17,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=15, stage="stage-b", runner_config="1-gpu-small-amd") PAGE_SIZE = 2 diff --git a/test/registered/unit/mem_cache/test_hiradix_pp_sync_drain.py b/test/registered/unit/mem_cache/test_hiradix_pp_sync_drain.py index 1089ef565..685028523 100644 --- a/test/registered/unit/mem_cache/test_hiradix_pp_sync_drain.py +++ b/test/registered/unit/mem_cache/test_hiradix_pp_sync_drain.py @@ -8,7 +8,7 @@ from sglang.srt.mem_cache.hiradix_cache import HiRadixCache from sglang.srt.mem_cache.unified_radix_cache import UnifiedRadixCache from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _FakeWork: diff --git a/test/registered/unit/mem_cache/test_hisparse_allocator.py b/test/registered/unit/mem_cache/test_hisparse_allocator.py index 7ea10c1f4..bc0a9ad15 100644 --- a/test/registered/unit/mem_cache/test_hisparse_allocator.py +++ b/test/registered/unit/mem_cache/test_hisparse_allocator.py @@ -14,7 +14,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestDeepSeekV4HiSparseAllocator(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_hisparse_max_token_pool_size.py b/test/registered/unit/mem_cache/test_hisparse_max_token_pool_size.py index eb76a1e56..4a5a97483 100644 --- a/test/registered/unit/mem_cache/test_hisparse_max_token_pool_size.py +++ b/test/registered/unit/mem_cache/test_hisparse_max_token_pool_size.py @@ -18,7 +18,7 @@ from sglang.srt.model_executor.model_runner import ModelRunner from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _make_model_runner(**attrs): diff --git a/test/registered/unit/mem_cache/test_hybrid_pool_assembler.py b/test/registered/unit/mem_cache/test_hybrid_pool_assembler.py index 66ed58723..8d203fc7a 100644 --- a/test/registered/unit/mem_cache/test_hybrid_pool_assembler.py +++ b/test/registered/unit/mem_cache/test_hybrid_pool_assembler.py @@ -15,7 +15,7 @@ from sglang.srt.mem_cache.memory_pool import HybridLinearKVPool from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _Pool: diff --git a/test/registered/unit/mem_cache/test_inkling_sconv_strided_conv_state.py b/test/registered/unit/mem_cache/test_inkling_sconv_strided_conv_state.py index 88ff13cc1..30d4e9c7e 100644 --- a/test/registered/unit/mem_cache/test_inkling_sconv_strided_conv_state.py +++ b/test/registered/unit/mem_cache/test_inkling_sconv_strided_conv_state.py @@ -53,7 +53,7 @@ import torch import sglang.kernels.jit as _jit_pkg from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") _KERNEL_DIR = Path(_jit_pkg.__file__).parent / "csrc" / "inkling" diff --git a/test/registered/unit/mem_cache/test_kv_index_translator.py b/test/registered/unit/mem_cache/test_kv_index_translator.py index e6b40408e..02fdb834e 100644 --- a/test/registered/unit/mem_cache/test_kv_index_translator.py +++ b/test/registered/unit/mem_cache/test_kv_index_translator.py @@ -19,7 +19,7 @@ Triton kernel. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/mem_cache/test_layout_compat.py b/test/registered/unit/mem_cache/test_layout_compat.py index 506c505ad..19a5e836d 100644 --- a/test/registered/unit/mem_cache/test_layout_compat.py +++ b/test/registered/unit/mem_cache/test_layout_compat.py @@ -21,7 +21,7 @@ envelope formula byte for byte. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/mem_cache/test_linker_pool_assembler.py b/test/registered/unit/mem_cache/test_linker_pool_assembler.py index 916c300b7..e26d597f2 100644 --- a/test/registered/unit/mem_cache/test_linker_pool_assembler.py +++ b/test/registered/unit/mem_cache/test_linker_pool_assembler.py @@ -19,7 +19,7 @@ from sglang.srt.mem_cache.unified_cache.component_type import ComponentType from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestDevicePoolEntry(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_mamba_donated_alloc_ratio.py b/test/registered/unit/mem_cache/test_mamba_donated_alloc_ratio.py index 3bcdb9722..227df68c8 100644 --- a/test/registered/unit/mem_cache/test_mamba_donated_alloc_ratio.py +++ b/test/registered/unit/mem_cache/test_mamba_donated_alloc_ratio.py @@ -25,7 +25,7 @@ from sglang.srt.mem_cache.unified_cache.unified_tree_core import UnifiedTreeCore from sglang.srt.mem_cache.unified_radix_cache import UnifiedTreeNode from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") N = 4 # concurrent distinct-prefix requests diff --git a/test/registered/unit/mem_cache/test_mamba_path_state_cap.py b/test/registered/unit/mem_cache/test_mamba_path_state_cap.py index 940a2c350..50d76c69e 100644 --- a/test/registered/unit/mem_cache/test_mamba_path_state_cap.py +++ b/test/registered/unit/mem_cache/test_mamba_path_state_cap.py @@ -3,8 +3,8 @@ from sglang.srt.arg_groups.mamba_hook import handle_mamba_backend from sglang.test.ci.ci_register import register_cpu_ci, register_cuda_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") -register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-small") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") import argparse import unittest diff --git a/test/registered/unit/mem_cache/test_mamba_state_transfer_buffers.py b/test/registered/unit/mem_cache/test_mamba_state_transfer_buffers.py index 12cb8b4bb..18e862f5b 100644 --- a/test/registered/unit/mem_cache/test_mamba_state_transfer_buffers.py +++ b/test/registered/unit/mem_cache/test_mamba_state_transfer_buffers.py @@ -5,7 +5,7 @@ import torch from sglang.srt.mem_cache.memory_pool import MambaPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") NUM_LAYERS = 2 NUM_SLOTS = 3 diff --git a/test/registered/unit/mem_cache/test_mamba_unittest.py b/test/registered/unit/mem_cache/test_mamba_unittest.py index 78cdc559c..8404ece04 100755 --- a/test/registered/unit/mem_cache/test_mamba_unittest.py +++ b/test/registered/unit/mem_cache/test_mamba_unittest.py @@ -28,7 +28,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=9, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/mem_cache/test_mem_cache_utils.py b/test/registered/unit/mem_cache/test_mem_cache_utils.py index 395a7965f..8e4443dcf 100644 --- a/test/registered/unit/mem_cache/test_mem_cache_utils.py +++ b/test/registered/unit/mem_cache/test_mem_cache_utils.py @@ -28,7 +28,7 @@ from sglang.srt.mem_cache.utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=15, suite="base-a-test-cpu") def _legacy_get_hash_str(token_ids, prior_hash=None): diff --git a/test/registered/unit/mem_cache/test_mem_pool_host.py b/test/registered/unit/mem_cache/test_mem_pool_host.py index 98e1b59b1..a080edab4 100644 --- a/test/registered/unit/mem_cache/test_mem_pool_host.py +++ b/test/registered/unit/mem_cache/test_mem_pool_host.py @@ -19,7 +19,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestHostKVCache(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_minimax_sparse_pool_pd_unit.py b/test/registered/unit/mem_cache/test_minimax_sparse_pool_pd_unit.py index 71e33e761..b1a0679f9 100644 --- a/test/registered/unit/mem_cache/test_minimax_sparse_pool_pd_unit.py +++ b/test/registered/unit/mem_cache/test_minimax_sparse_pool_pd_unit.py @@ -5,7 +5,7 @@ import torch from sglang.srt.mem_cache.memory_pool import MiniMaxSparseKVPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _make_k_only_pool(start_layer: int = 0) -> MiniMaxSparseKVPool: diff --git a/test/registered/unit/mem_cache/test_mooncake_group_semantics.py b/test/registered/unit/mem_cache/test_mooncake_group_semantics.py index 394f78036..0e814df53 100644 --- a/test/registered/unit/mem_cache/test_mooncake_group_semantics.py +++ b/test/registered/unit/mem_cache/test_mooncake_group_semantics.py @@ -12,7 +12,7 @@ from sglang.srt.mem_cache.hicache_storage import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class ReplicateConfigWithGroupIds: diff --git a/test/registered/unit/mem_cache/test_mooncake_standalone_dummy_mamba.py b/test/registered/unit/mem_cache/test_mooncake_standalone_dummy_mamba.py index 2ce3e58e3..cc17328f3 100644 --- a/test/registered/unit/mem_cache/test_mooncake_standalone_dummy_mamba.py +++ b/test/registered/unit/mem_cache/test_mooncake_standalone_dummy_mamba.py @@ -5,7 +5,7 @@ from unittest.mock import patch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _fake_mooncake_modules(fake_store_cls): diff --git a/test/registered/unit/mem_cache/test_mooncake_tenant_config.py b/test/registered/unit/mem_cache/test_mooncake_tenant_config.py index 339e93726..c938a18de 100644 --- a/test/registered/unit/mem_cache/test_mooncake_tenant_config.py +++ b/test/registered/unit/mem_cache/test_mooncake_tenant_config.py @@ -12,7 +12,7 @@ from sglang.srt.mem_cache.storage.mooncake_store.mooncake_store import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _fake_mooncake_modules(fake_store_cls): diff --git a/test/registered/unit/mem_cache/test_multi_ended_allocator.py b/test/registered/unit/mem_cache/test_multi_ended_allocator.py index 363f1c25e..9e7c6e868 100644 --- a/test/registered/unit/mem_cache/test_multi_ended_allocator.py +++ b/test/registered/unit/mem_cache/test_multi_ended_allocator.py @@ -20,7 +20,7 @@ suite runs on CPU apart from the cases that skip themselves without CUDA. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import contextlib import random diff --git a/test/registered/unit/mem_cache/test_mxfp8_scale_transfer_buffers.py b/test/registered/unit/mem_cache/test_mxfp8_scale_transfer_buffers.py index 9ed3689c1..5484c7ae4 100644 --- a/test/registered/unit/mem_cache/test_mxfp8_scale_transfer_buffers.py +++ b/test/registered/unit/mem_cache/test_mxfp8_scale_transfer_buffers.py @@ -5,7 +5,7 @@ import torch from sglang.srt.mem_cache.memory_pool import MHATokenToKVPoolMXFP8 from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") LAYERS = 2 PAGE_SIZE = 128 diff --git a/test/registered/unit/mem_cache/test_page_major_layout.py b/test/registered/unit/mem_cache/test_page_major_layout.py index 002ff97b3..090c3592b 100644 --- a/test/registered/unit/mem_cache/test_page_major_layout.py +++ b/test/registered/unit/mem_cache/test_page_major_layout.py @@ -12,7 +12,7 @@ Runs on CPU — pure-torch advanced indexing, no Triton. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/mem_cache/test_paged_allocator_lazy_release.py b/test/registered/unit/mem_cache/test_paged_allocator_lazy_release.py index ff1eb5c3d..908e3ecb6 100644 --- a/test/registered/unit/mem_cache/test_paged_allocator_lazy_release.py +++ b/test/registered/unit/mem_cache/test_paged_allocator_lazy_release.py @@ -9,7 +9,7 @@ from sglang.srt.mem_cache.allocator.paged import PagedTokenToKVPoolAllocator from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") PAGE_SIZE = 2 NUM_PAGES = 16 diff --git a/test/registered/unit/mem_cache/test_paged_free_segment.py b/test/registered/unit/mem_cache/test_paged_free_segment.py index b1cc88cef..30bdbac06 100644 --- a/test/registered/unit/mem_cache/test_paged_free_segment.py +++ b/test/registered/unit/mem_cache/test_paged_free_segment.py @@ -17,7 +17,7 @@ from sglang.srt.mem_cache.allocator.paged import PagedTokenToKVPoolAllocator from sglang.srt.mem_cache.common import _release_overallocated_kv_indices from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") PAGE_SIZE = 4 NUM_PAGES = 64 diff --git a/test/registered/unit/mem_cache/test_pd_envelope_transfer_layout.py b/test/registered/unit/mem_cache/test_pd_envelope_transfer_layout.py index eadb4b2d0..396168eb0 100644 --- a/test/registered/unit/mem_cache/test_pd_envelope_transfer_layout.py +++ b/test/registered/unit/mem_cache/test_pd_envelope_transfer_layout.py @@ -26,7 +26,7 @@ from sglang.srt.mem_cache.layout.page_major import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=60, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestMLAEnvelopeTransferAddressing(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_pure_swa_chunk_cache.py b/test/registered/unit/mem_cache/test_pure_swa_chunk_cache.py index 438159acb..39acb211c 100644 --- a/test/registered/unit/mem_cache/test_pure_swa_chunk_cache.py +++ b/test/registered/unit/mem_cache/test_pure_swa_chunk_cache.py @@ -9,7 +9,7 @@ from sglang.srt.mem_cache.chunk_cache import PureSWAChunkCache from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _FakeAllocator: diff --git a/test/registered/unit/mem_cache/test_quantized_kv_pool.py b/test/registered/unit/mem_cache/test_quantized_kv_pool.py index efb71885a..51da4b896 100644 --- a/test/registered/unit/mem_cache/test_quantized_kv_pool.py +++ b/test/registered/unit/mem_cache/test_quantized_kv_pool.py @@ -8,7 +8,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _FakeQuantMethod: diff --git a/test/registered/unit/mem_cache/test_radix_cache_cpp_unit.py b/test/registered/unit/mem_cache/test_radix_cache_cpp_unit.py index 48d204d58..49fdf0b83 100644 --- a/test/registered/unit/mem_cache/test_radix_cache_cpp_unit.py +++ b/test/registered/unit/mem_cache/test_radix_cache_cpp_unit.py @@ -9,7 +9,7 @@ from unittest.mock import patch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestRadixCacheCppCacheSalt(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py b/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py index 78d47c62b..1a28b67b6 100644 --- a/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py +++ b/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py @@ -14,7 +14,7 @@ from sglang.srt.mem_cache.memory_pool import MHATokenToKVPool, ReqToTokenPool from sglang.srt.mem_cache.radix_cache import RadixCache, RadixKey from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestSLRUAccuracy(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_radix_cache_unit.py b/test/registered/unit/mem_cache/test_radix_cache_unit.py index 38a4fa6f5..f635bf4f3 100644 --- a/test/registered/unit/mem_cache/test_radix_cache_unit.py +++ b/test/registered/unit/mem_cache/test_radix_cache_unit.py @@ -20,7 +20,7 @@ Usage: from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # CPU-based unit test, runs quickly on any GPU runner -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=5, suite="stage-b-test-1-gpu-small-amd") import random diff --git a/test/registered/unit/mem_cache/test_radix_force_miss.py b/test/registered/unit/mem_cache/test_radix_force_miss.py index c2eacc9dd..38d670712 100644 --- a/test/registered/unit/mem_cache/test_radix_force_miss.py +++ b/test/registered/unit/mem_cache/test_radix_force_miss.py @@ -7,7 +7,7 @@ RadixCache. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import unittest import unittest.mock diff --git a/test/registered/unit/mem_cache/test_registry.py b/test/registered/unit/mem_cache/test_registry.py index cd1b52fa2..f2a741cc9 100644 --- a/test/registered/unit/mem_cache/test_registry.py +++ b/test/registered/unit/mem_cache/test_registry.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import unittest from unittest.mock import MagicMock, patch diff --git a/test/registered/unit/mem_cache/test_replayssm_ring_accounting.py b/test/registered/unit/mem_cache/test_replayssm_ring_accounting.py index 4696e5ff1..6377f6c11 100644 --- a/test/registered/unit/mem_cache/test_replayssm_ring_accounting.py +++ b/test/registered/unit/mem_cache/test_replayssm_ring_accounting.py @@ -23,7 +23,7 @@ from sglang.srt.mem_cache.kv_cache_configurator import _pp_local_per_request_byt from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") # temporal = (hv=4, v_dim=8, k_dim=8), num_k_heads_per_tp = 4, record_len = 8, # 2 layers. conv bf16 (2B), fp32 gate/beta (4B). Ring tensors (per slot, per diff --git a/test/registered/unit/mem_cache/test_retraction_mamba_backup.py b/test/registered/unit/mem_cache/test_retraction_mamba_backup.py index 20829388a..adc138b6d 100644 --- a/test/registered/unit/mem_cache/test_retraction_mamba_backup.py +++ b/test/registered/unit/mem_cache/test_retraction_mamba_backup.py @@ -6,7 +6,7 @@ from sglang.srt.managers.schedule_batch import Req, ReqKvInfo from sglang.srt.mem_cache.memory_pool import HybridReqToTokenPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") MAMBA_STATE = object() diff --git a/test/registered/unit/mem_cache/test_rust_tree_core.py b/test/registered/unit/mem_cache/test_rust_tree_core.py index c74cee1d2..065eb326c 100644 --- a/test/registered/unit/mem_cache/test_rust_tree_core.py +++ b/test/registered/unit/mem_cache/test_rust_tree_core.py @@ -12,7 +12,7 @@ from unified_tree_core_inspection_interface import UnifiedTreeCoreInspectionInte from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=90, suite="base-a-test-cpu") +register_cpu_ci(est_time=17, suite="base-a-test-cpu") if shutil.which("cargo") is None: pytest.skip("the rust backend builds with cargo", allow_module_level=True) diff --git a/test/registered/unit/mem_cache/test_rust_tree_core_integration.py b/test/registered/unit/mem_cache/test_rust_tree_core_integration.py index 008e04269..347c1502e 100644 --- a/test/registered/unit/mem_cache/test_rust_tree_core_integration.py +++ b/test/registered/unit/mem_cache/test_rust_tree_core_integration.py @@ -11,7 +11,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=90, suite="base-a-test-cpu") +register_cpu_ci(est_time=17, suite="base-a-test-cpu") if shutil.which("cargo") is None: pytest.skip("the rust backend builds with cargo", allow_module_level=True) diff --git a/test/registered/unit/mem_cache/test_rust_unified_radix_cache_unittest.py b/test/registered/unit/mem_cache/test_rust_unified_radix_cache_unittest.py index 77f1dbddc..06227b4f7 100644 --- a/test/registered/unit/mem_cache/test_rust_unified_radix_cache_unittest.py +++ b/test/registered/unit/mem_cache/test_rust_unified_radix_cache_unittest.py @@ -6,7 +6,7 @@ import test_unified_radix_cache_unittest as shared_suite from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=180, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=57, stage="base-b", runner_config="1-gpu-small") class RustBackendSuite(unittest.TestSuite): diff --git a/test/registered/unit/mem_cache/test_session_token_share_unit.py b/test/registered/unit/mem_cache/test_session_token_share_unit.py index 9e08330e6..e3e04f60a 100644 --- a/test/registered/unit/mem_cache/test_session_token_share_unit.py +++ b/test/registered/unit/mem_cache/test_session_token_share_unit.py @@ -10,7 +10,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import unittest from array import array diff --git a/test/registered/unit/mem_cache/test_session_unified_radix_cache.py b/test/registered/unit/mem_cache/test_session_unified_radix_cache.py index 60f7e95bd..b85de9997 100644 --- a/test/registered/unit/mem_cache/test_session_unified_radix_cache.py +++ b/test/registered/unit/mem_cache/test_session_unified_radix_cache.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import ast import unittest diff --git a/test/registered/unit/mem_cache/test_swa_alloc_extend_page_estimation.py b/test/registered/unit/mem_cache/test_swa_alloc_extend_page_estimation.py index 7cef341de..ee759cfd4 100644 --- a/test/registered/unit/mem_cache/test_swa_alloc_extend_page_estimation.py +++ b/test/registered/unit/mem_cache/test_swa_alloc_extend_page_estimation.py @@ -15,7 +15,7 @@ from sglang.srt.mem_cache.allocator.swa import SWATokenToKVPoolAllocator from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _make_self(*, page_size: int, full_available: int, swa_available: int): diff --git a/test/registered/unit/mem_cache/test_swa_cpu_copy_filter.py b/test/registered/unit/mem_cache/test_swa_cpu_copy_filter.py index fa5c1a6d8..c1a398fee 100644 --- a/test/registered/unit/mem_cache/test_swa_cpu_copy_filter.py +++ b/test/registered/unit/mem_cache/test_swa_cpu_copy_filter.py @@ -6,7 +6,7 @@ import torch from sglang.srt.mem_cache.swa_memory_pool import SWAKVPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") ROWS = 4 diff --git a/test/registered/unit/mem_cache/test_swa_eviction_boundary.py b/test/registered/unit/mem_cache/test_swa_eviction_boundary.py index 773d5946c..daca35d52 100644 --- a/test/registered/unit/mem_cache/test_swa_eviction_boundary.py +++ b/test/registered/unit/mem_cache/test_swa_eviction_boundary.py @@ -28,7 +28,7 @@ from sglang.srt.mem_cache.swa_radix_cache import SWARadixCache from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/mem_cache/test_swa_lock_release_lifecycle.py b/test/registered/unit/mem_cache/test_swa_lock_release_lifecycle.py index bba260468..af7901653 100644 --- a/test/registered/unit/mem_cache/test_swa_lock_release_lifecycle.py +++ b/test/registered/unit/mem_cache/test_swa_lock_release_lifecycle.py @@ -32,7 +32,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=12, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/mem_cache/test_swa_locked_full_recover_unified.py b/test/registered/unit/mem_cache/test_swa_locked_full_recover_unified.py index 3ccf34783..0fafcb426 100644 --- a/test/registered/unit/mem_cache/test_swa_locked_full_recover_unified.py +++ b/test/registered/unit/mem_cache/test_swa_locked_full_recover_unified.py @@ -41,7 +41,7 @@ from sglang.srt.mem_cache.unified_cache.components.swa_component import SWACompo from sglang.srt.mem_cache.unified_memory_pool import MHASubPoolSpec, UnifiedKVPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") _DEV = "cpu" _SWA = ComponentType.SWA diff --git a/test/registered/unit/mem_cache/test_swa_pool_v_head_dim.py b/test/registered/unit/mem_cache/test_swa_pool_v_head_dim.py index e9dca5423..d3fd443af 100644 --- a/test/registered/unit/mem_cache/test_swa_pool_v_head_dim.py +++ b/test/registered/unit/mem_cache/test_swa_pool_v_head_dim.py @@ -27,7 +27,7 @@ import torch from sglang.srt.mem_cache.swa_memory_pool import SWAKVPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") _DEV = "cpu" _FULL_V_HEAD_DIM = 8 diff --git a/test/registered/unit/mem_cache/test_tree_core_registry.py b/test/registered/unit/mem_cache/test_tree_core_registry.py index 7a13599e3..983868e36 100644 --- a/test/registered/unit/mem_cache/test_tree_core_registry.py +++ b/test/registered/unit/mem_cache/test_tree_core_registry.py @@ -24,7 +24,7 @@ from sglang.srt.mem_cache.unified_radix_cache import UnifiedRadixCache from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _cache_init_params(**kwargs) -> CacheInitParams: diff --git a/test/registered/unit/mem_cache/test_umbp_host_allocator.py b/test/registered/unit/mem_cache/test_umbp_host_allocator.py index 070f0d70d..2c02f2957 100644 --- a/test/registered/unit/mem_cache/test_umbp_host_allocator.py +++ b/test/registered/unit/mem_cache/test_umbp_host_allocator.py @@ -12,7 +12,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") # These tests stub out mori with a fake in-process module, so they need neither # a real mori install nor a GPU and run on NVIDIA / CPU CI. diff --git a/test/registered/unit/mem_cache/test_unified_byte_accounting.py b/test/registered/unit/mem_cache/test_unified_byte_accounting.py index b309e7d61..e808d81ac 100644 --- a/test/registered/unit/mem_cache/test_unified_byte_accounting.py +++ b/test/registered/unit/mem_cache/test_unified_byte_accounting.py @@ -34,7 +34,7 @@ from test_multi_ended_allocator import ( from sglang.srt.mem_cache.allocator import unified_sub_pool as mea from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _swa_composite(): diff --git a/test/registered/unit/mem_cache/test_unified_byte_budget_sizing.py b/test/registered/unit/mem_cache/test_unified_byte_budget_sizing.py index b8d0060e7..f43ed5be8 100644 --- a/test/registered/unit/mem_cache/test_unified_byte_budget_sizing.py +++ b/test/registered/unit/mem_cache/test_unified_byte_budget_sizing.py @@ -40,7 +40,7 @@ from sglang.srt.mem_cache.unified_memory_pool import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") _DEV = "cpu" diff --git a/test/registered/unit/mem_cache/test_unified_cache_linker.py b/test/registered/unit/mem_cache/test_unified_cache_linker.py index 9fa239a0f..7082619dc 100644 --- a/test/registered/unit/mem_cache/test_unified_cache_linker.py +++ b/test/registered/unit/mem_cache/test_unified_cache_linker.py @@ -22,7 +22,7 @@ from sglang.srt.mem_cache.unified_cache.unified_cache_linker import ( from sglang.srt.mem_cache.unified_radix_cache import UnifiedRadixCache from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _FakeLinker(UnifiedCacheLinker): diff --git a/test/registered/unit/mem_cache/test_unified_capacity_memo.py b/test/registered/unit/mem_cache/test_unified_capacity_memo.py index 837f2c8fe..d28939aea 100644 --- a/test/registered/unit/mem_cache/test_unified_capacity_memo.py +++ b/test/registered/unit/mem_cache/test_unified_capacity_memo.py @@ -29,7 +29,7 @@ import unittest from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _build(lazy: bool): diff --git a/test/registered/unit/mem_cache/test_unified_free_no_host_sync.py b/test/registered/unit/mem_cache/test_unified_free_no_host_sync.py index f92def73d..198acd505 100644 --- a/test/registered/unit/mem_cache/test_unified_free_no_host_sync.py +++ b/test/registered/unit/mem_cache/test_unified_free_no_host_sync.py @@ -38,7 +38,7 @@ from sglang.srt.mem_cache.allocator import unified_sub_pool as mea from sglang.srt.mem_cache.allocator.base import BaseTokenToKVPoolAllocator from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") PAGE_SIZE = _PagedFixture.PAGE_SIZE diff --git a/test/registered/unit/mem_cache/test_unified_handout_zeroing.py b/test/registered/unit/mem_cache/test_unified_handout_zeroing.py index e17bd8200..51d46c38e 100644 --- a/test/registered/unit/mem_cache/test_unified_handout_zeroing.py +++ b/test/registered/unit/mem_cache/test_unified_handout_zeroing.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=4, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") import unittest diff --git a/test/registered/unit/mem_cache/test_unified_mamba_views.py b/test/registered/unit/mem_cache/test_unified_mamba_views.py index 840c40d0b..b9f1eef0a 100644 --- a/test/registered/unit/mem_cache/test_unified_mamba_views.py +++ b/test/registered/unit/mem_cache/test_unified_mamba_views.py @@ -31,7 +31,7 @@ import torch from sglang.test.ci.ci_register import register_amd_ci, register_cpu_ci -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") register_amd_ci(est_time=30, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/unit/mem_cache/test_unified_mha_views.py b/test/registered/unit/mem_cache/test_unified_mha_views.py index e415c9ff9..9fb4ce2b9 100644 --- a/test/registered/unit/mem_cache/test_unified_mha_views.py +++ b/test/registered/unit/mem_cache/test_unified_mha_views.py @@ -23,7 +23,7 @@ Addressing law under test: from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/mem_cache/test_unified_mla_block_table.py b/test/registered/unit/mem_cache/test_unified_mla_block_table.py index 35b34b02e..a8204c7e3 100644 --- a/test/registered/unit/mem_cache/test_unified_mla_block_table.py +++ b/test/registered/unit/mem_cache/test_unified_mla_block_table.py @@ -53,7 +53,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-small") _HAS_CUDA = torch.cuda.is_available() _DEV = "cuda" diff --git a/test/registered/unit/mem_cache/test_unified_mla_gpu_parity.py b/test/registered/unit/mem_cache/test_unified_mla_gpu_parity.py index 68b695ffd..9b6d1f278 100644 --- a/test/registered/unit/mem_cache/test_unified_mla_gpu_parity.py +++ b/test/registered/unit/mem_cache/test_unified_mla_gpu_parity.py @@ -28,7 +28,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") _HAS_CUDA = torch.cuda.is_available() _DEV = "cuda" diff --git a/test/registered/unit/mem_cache/test_unified_mla_views.py b/test/registered/unit/mem_cache/test_unified_mla_views.py index ab5313509..5cdb68f84 100644 --- a/test/registered/unit/mem_cache/test_unified_mla_views.py +++ b/test/registered/unit/mem_cache/test_unified_mla_views.py @@ -23,7 +23,7 @@ GPU parity of the read/write kernels (set_mla_kv_buffer TMA path etc.) lives in from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/mem_cache/test_unified_npool_sweep.py b/test/registered/unit/mem_cache/test_unified_npool_sweep.py index fea776dc3..6af10bdd4 100644 --- a/test/registered/unit/mem_cache/test_unified_npool_sweep.py +++ b/test/registered/unit/mem_cache/test_unified_npool_sweep.py @@ -36,7 +36,7 @@ from sglang.test.ci.ci_register import register_cpu_ci # Hermetic convention of this directory's pool tests: plain unittest.TestCase, # only ci_register imported (no heavy sglang.test.test_utils chain). -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=14, suite="base-a-test-cpu") _DEV = "cpu" diff --git a/test/registered/unit/mem_cache/test_unified_radix_allocation_eviction.py b/test/registered/unit/mem_cache/test_unified_radix_allocation_eviction.py index 669059511..9820849b6 100644 --- a/test/registered/unit/mem_cache/test_unified_radix_allocation_eviction.py +++ b/test/registered/unit/mem_cache/test_unified_radix_allocation_eviction.py @@ -10,7 +10,7 @@ from sglang.srt.mem_cache.unified_radix_cache import UnifiedRadixCache from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestUnifiedRadixAllocationEviction(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_unified_radix_cache_bench.py b/test/registered/unit/mem_cache/test_unified_radix_cache_bench.py index 1856aaf81..885e6f096 100644 --- a/test/registered/unit/mem_cache/test_unified_radix_cache_bench.py +++ b/test/registered/unit/mem_cache/test_unified_radix_cache_bench.py @@ -42,7 +42,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=29, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-small-amd") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/mem_cache/test_unified_radix_cache_unittest.py b/test/registered/unit/mem_cache/test_unified_radix_cache_unittest.py index 645019745..df4e258f1 100644 --- a/test/registered/unit/mem_cache/test_unified_radix_cache_unittest.py +++ b/test/registered/unit/mem_cache/test_unified_radix_cache_unittest.py @@ -102,7 +102,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=50, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=50, suite="stage-b-test-1-gpu-small-amd") # A dedicated test entry point overrides this without changing the process-wide diff --git a/test/registered/unit/mem_cache/test_unified_radix_hicache_dispatch.py b/test/registered/unit/mem_cache/test_unified_radix_hicache_dispatch.py index f9f492bfa..90a6ce417 100644 --- a/test/registered/unit/mem_cache/test_unified_radix_hicache_dispatch.py +++ b/test/registered/unit/mem_cache/test_unified_radix_hicache_dispatch.py @@ -20,7 +20,7 @@ from sglang.srt.mem_cache.hybrid_cache.hybrid_pool_assembler import ( from sglang.srt.mem_cache.unified_cache.components import ComponentType from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _mock_kvcache(cls): diff --git a/test/registered/unit/mem_cache/test_unified_radix_lock_ref.py b/test/registered/unit/mem_cache/test_unified_radix_lock_ref.py index 95e39bf13..8899d2820 100644 --- a/test/registered/unit/mem_cache/test_unified_radix_lock_ref.py +++ b/test/registered/unit/mem_cache/test_unified_radix_lock_ref.py @@ -10,7 +10,7 @@ import torch from sglang.srt.mem_cache.unified_radix_cache import UnifiedRadixCache from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestUnifiedRadixLockRefScenarios(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_unified_swa_shared_virtual_ids.py b/test/registered/unit/mem_cache/test_unified_swa_shared_virtual_ids.py index 48e88a457..919ff34b3 100644 --- a/test/registered/unit/mem_cache/test_unified_swa_shared_virtual_ids.py +++ b/test/registered/unit/mem_cache/test_unified_swa_shared_virtual_ids.py @@ -36,7 +36,7 @@ from sglang.srt.mem_cache.allocator.unified_hybrid_swa import ( from sglang.srt.mem_cache.unified_memory_pool import MHASubPoolSpec, UnifiedKVPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _build(n_full: int, n_swa: int, full_layers: int, swa_layers: int): diff --git a/test/registered/unit/mem_cache/test_unified_tri_pool.py b/test/registered/unit/mem_cache/test_unified_tri_pool.py index 834e00722..40c8100db 100644 --- a/test/registered/unit/mem_cache/test_unified_tri_pool.py +++ b/test/registered/unit/mem_cache/test_unified_tri_pool.py @@ -41,7 +41,7 @@ from sglang.test.ci.ci_register import register_cpu_ci # Hermetic convention of this directory's pool tests: plain unittest.TestCase, # only ci_register imported (no heavy sglang.test.test_utils chain). -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _DEV = "cpu" diff --git a/test/registered/unit/mem_cache/test_uno_allocation_sizing.py b/test/registered/unit/mem_cache/test_uno_allocation_sizing.py index c06724d2f..99b3c5fcb 100644 --- a/test/registered/unit/mem_cache/test_uno_allocation_sizing.py +++ b/test/registered/unit/mem_cache/test_uno_allocation_sizing.py @@ -11,7 +11,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestUnoAllocationSizing(CustomTestCase): diff --git a/test/registered/unit/model_executor/model_runner_components/test_attention_backend_setup.py b/test/registered/unit/model_executor/model_runner_components/test_attention_backend_setup.py index ec346140b..426145ea3 100644 --- a/test/registered/unit/model_executor/model_runner_components/test_attention_backend_setup.py +++ b/test/registered/unit/model_executor/model_runner_components/test_attention_backend_setup.py @@ -13,7 +13,7 @@ from sglang.srt.model_executor.model_runner_components.attention_backend_setup i ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class _FakeBackend: diff --git a/test/registered/unit/model_executor/model_runner_components/test_cuda_graph_setup.py b/test/registered/unit/model_executor/model_runner_components/test_cuda_graph_setup.py index 68308b548..b886ef3fb 100644 --- a/test/registered/unit/model_executor/model_runner_components/test_cuda_graph_setup.py +++ b/test/registered/unit/model_executor/model_runner_components/test_cuda_graph_setup.py @@ -12,7 +12,7 @@ from sglang.srt.model_executor.model_runner_components.cuda_graph_setup import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def test_standard_gqa_gate_uses_pipeline_local_layer_range(): diff --git a/test/registered/unit/model_executor/model_runner_components/test_layer_setup.py b/test/registered/unit/model_executor/model_runner_components/test_layer_setup.py index 1dc6490a5..94faa44d6 100644 --- a/test/registered/unit/model_executor/model_runner_components/test_layer_setup.py +++ b/test/registered/unit/model_executor/model_runner_components/test_layer_setup.py @@ -8,7 +8,7 @@ from sglang.srt.model_executor.model_runner_components.layer_setup import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") class TestComputeAttentionAndMoeLayers(unittest.TestCase): diff --git a/test/registered/unit/model_executor/model_runner_components/test_ngram_embedding_manager.py b/test/registered/unit/model_executor/model_runner_components/test_ngram_embedding_manager.py index 57270eea3..477c67930 100644 --- a/test/registered/unit/model_executor/model_runner_components/test_ngram_embedding_manager.py +++ b/test/registered/unit/model_executor/model_runner_components/test_ngram_embedding_manager.py @@ -15,7 +15,7 @@ from sglang.srt.model_executor.model_runner_components.ngram_embedding_manager i update_ngram_token_table_after_sampling, ) -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _make_ngram_info(batch_size: int, skip_token_table_update=None): diff --git a/test/registered/unit/model_executor/model_runner_components/test_spec_aux_hidden_state.py b/test/registered/unit/model_executor/model_runner_components/test_spec_aux_hidden_state.py index a04db9809..a48604188 100644 --- a/test/registered/unit/model_executor/model_runner_components/test_spec_aux_hidden_state.py +++ b/test/registered/unit/model_executor/model_runner_components/test_spec_aux_hidden_state.py @@ -8,7 +8,7 @@ from sglang.srt.model_executor.model_runner_components.spec_aux_hidden_state imp ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") @pytest.mark.parametrize( diff --git a/test/registered/unit/model_executor/model_runner_components/test_startup_weight_load.py b/test/registered/unit/model_executor/model_runner_components/test_startup_weight_load.py index 970127103..99c7e61e8 100644 --- a/test/registered/unit/model_executor/model_runner_components/test_startup_weight_load.py +++ b/test/registered/unit/model_executor/model_runner_components/test_startup_weight_load.py @@ -31,7 +31,7 @@ from sglang.srt.model_loader.weight_utils import initialize_capture_safe_weights from sglang.srt.runtime_context import get_context, publish, reset_context from sglang.srt.server_args import ServerArgs -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") _STARTUP_MODULE = ( diff --git a/test/registered/unit/model_executor/runner/test_decode_cuda_graph_runner.py b/test/registered/unit/model_executor/runner/test_decode_cuda_graph_runner.py index 90a91ac40..03990cd68 100644 --- a/test/registered/unit/model_executor/runner/test_decode_cuda_graph_runner.py +++ b/test/registered/unit/model_executor/runner/test_decode_cuda_graph_runner.py @@ -36,7 +36,7 @@ from sglang.srt.utils import profile_utils as putils from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") _CAPTURE_TRACE = "SGLANG_ENABLE_CUDA_GRAPH_CAPTURE_TRACE" _BATCH_CAPTURE = "SGLANG_GRAPH_BATCH_CAPTURE" diff --git a/test/registered/unit/model_executor/runner/test_decode_cuda_graph_shared_read_fence.py b/test/registered/unit/model_executor/runner/test_decode_cuda_graph_shared_read_fence.py index 1c5dee227..337408a25 100644 --- a/test/registered/unit/model_executor/runner/test_decode_cuda_graph_shared_read_fence.py +++ b/test/registered/unit/model_executor/runner/test_decode_cuda_graph_shared_read_fence.py @@ -13,7 +13,7 @@ from sglang.srt.model_executor.runner.decode_cuda_graph_runner import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") DECODE = ForwardMode.DECODE diff --git a/test/registered/unit/model_executor/runner/test_flashinfer_autotune.py b/test/registered/unit/model_executor/runner/test_flashinfer_autotune.py index cacb8bd00..47531e1cd 100644 --- a/test/registered/unit/model_executor/runner/test_flashinfer_autotune.py +++ b/test/registered/unit/model_executor/runner/test_flashinfer_autotune.py @@ -8,7 +8,7 @@ from sglang.srt.model_executor.forward_batch_info import CaptureHiddenMode, Forw from sglang.srt.model_executor.runner import base_runner, flashinfer_autotune from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") @pytest.mark.parametrize( diff --git a/test/registered/unit/model_executor/runner/test_flashinfer_autotune_sync.py b/test/registered/unit/model_executor/runner/test_flashinfer_autotune_sync.py index c2a783e91..f090f0be5 100644 --- a/test/registered/unit/model_executor/runner/test_flashinfer_autotune_sync.py +++ b/test/registered/unit/model_executor/runner/test_flashinfer_autotune_sync.py @@ -8,7 +8,7 @@ cover that gate and the digest it decides on. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=50, suite="base-a-test-cpu") +register_cpu_ci(est_time=52, suite="base-a-test-cpu") import json import multiprocessing diff --git a/test/registered/unit/model_executor/runner/test_hidden_state_graph_recapture.py b/test/registered/unit/model_executor/runner/test_hidden_state_graph_recapture.py index b3e52808c..99ab09f72 100644 --- a/test/registered/unit/model_executor/runner/test_hidden_state_graph_recapture.py +++ b/test/registered/unit/model_executor/runner/test_hidden_state_graph_recapture.py @@ -19,7 +19,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestHiddenStateGraphRecapture(CustomTestCase): diff --git a/test/registered/unit/model_executor/runner/test_prefill_cuda_graph_padding.py b/test/registered/unit/model_executor/runner/test_prefill_cuda_graph_padding.py index 8a04996df..af402b707 100644 --- a/test/registered/unit/model_executor/runner/test_prefill_cuda_graph_padding.py +++ b/test/registered/unit/model_executor/runner/test_prefill_cuda_graph_padding.py @@ -13,7 +13,7 @@ from sglang.srt.model_executor.runner.prefill_cuda_graph_runner import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestPrefillCudaGraphPadding(CustomTestCase): diff --git a/test/registered/unit/model_executor/runner/test_prefill_shared_read_done.py b/test/registered/unit/model_executor/runner/test_prefill_shared_read_done.py index 6842bff49..2eb82a753 100644 --- a/test/registered/unit/model_executor/runner/test_prefill_shared_read_done.py +++ b/test/registered/unit/model_executor/runner/test_prefill_shared_read_done.py @@ -15,7 +15,7 @@ from sglang.srt.model_executor.runner_utils import ( from sglang.srt.speculative.spec_info import SpeculativeAlgorithm from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _Event: diff --git a/test/registered/unit/model_executor/runner_utils/test_graph_pool_borrow.py b/test/registered/unit/model_executor/runner_utils/test_graph_pool_borrow.py index a88b0e529..7669ac431 100644 --- a/test/registered/unit/model_executor/runner_utils/test_graph_pool_borrow.py +++ b/test/registered/unit/model_executor/runner_utils/test_graph_pool_borrow.py @@ -17,7 +17,7 @@ from sglang.srt.speculative.dflash_worker_v2 import DFlashWorkerV2 from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-small") class TestGraphPoolBorrow(CustomTestCase): diff --git a/test/registered/unit/model_executor/test_chunked_prefix_cache_gate.py b/test/registered/unit/model_executor/test_chunked_prefix_cache_gate.py index 8b0c7f9f0..c689f3d92 100644 --- a/test/registered/unit/model_executor/test_chunked_prefix_cache_gate.py +++ b/test/registered/unit/model_executor/test_chunked_prefix_cache_gate.py @@ -7,7 +7,7 @@ saw the flip, so an unsupported backend kept chunked prefix enabled. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/model_executor/test_cuda_graph_buffer_registry.py b/test/registered/unit/model_executor/test_cuda_graph_buffer_registry.py index f11a35265..d56d90d42 100644 --- a/test/registered/unit/model_executor/test_cuda_graph_buffer_registry.py +++ b/test/registered/unit/model_executor/test_cuda_graph_buffer_registry.py @@ -29,7 +29,7 @@ from sglang.srt.model_executor.cuda_graph_buffer_registry import ( from sglang.srt.model_executor.input_buffers import ForwardInputBuffers from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") @dataclasses.dataclass diff --git a/test/registered/unit/model_executor/test_draft_runner_skips_lora.py b/test/registered/unit/model_executor/test_draft_runner_skips_lora.py index 31ba12d42..6476aea61 100644 --- a/test/registered/unit/model_executor/test_draft_runner_skips_lora.py +++ b/test/registered/unit/model_executor/test_draft_runner_skips_lora.py @@ -18,7 +18,7 @@ from sglang.srt.speculative.spec_info import SpeculativeAlgorithm from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class TestDraftRunnerSkipsLoRA(CustomTestCase): diff --git a/test/registered/unit/model_executor/test_forward_metadata_plan_record.py b/test/registered/unit/model_executor/test_forward_metadata_plan_record.py index 770e8c32c..ed8692127 100644 --- a/test/registered/unit/model_executor/test_forward_metadata_plan_record.py +++ b/test/registered/unit/model_executor/test_forward_metadata_plan_record.py @@ -21,7 +21,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardBatch, ForwardMo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _make_batch(bs: int = 2, num_tokens: int = 2) -> ForwardBatch: diff --git a/test/registered/unit/model_executor/test_hisparse_pool_configurator.py b/test/registered/unit/model_executor/test_hisparse_pool_configurator.py index 409ea2cdc..778907219 100644 --- a/test/registered/unit/model_executor/test_hisparse_pool_configurator.py +++ b/test/registered/unit/model_executor/test_hisparse_pool_configurator.py @@ -9,7 +9,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestHiSparsePoolConfigurator(CustomTestCase): diff --git a/test/registered/unit/model_executor/test_mlp_sync_pad_unpad.py b/test/registered/unit/model_executor/test_mlp_sync_pad_unpad.py index e51c5c7bc..376982a86 100644 --- a/test/registered/unit/model_executor/test_mlp_sync_pad_unpad.py +++ b/test/registered/unit/model_executor/test_mlp_sync_pad_unpad.py @@ -22,7 +22,7 @@ from sglang.srt.model_executor.runner.decode_cuda_graph_runner import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _mock_model_runner(seq_len_fill_value: int = 1) -> MagicMock: diff --git a/test/registered/unit/model_executor/test_model_runner_decode_rows.py b/test/registered/unit/model_executor/test_model_runner_decode_rows.py index d30352109..fe0668ba8 100644 --- a/test/registered/unit/model_executor/test_model_runner_decode_rows.py +++ b/test/registered/unit/model_executor/test_model_runner_decode_rows.py @@ -6,7 +6,7 @@ from unittest.mock import patch from sglang.srt.model_executor.model_runner import ModelRunner from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _FakeModelRunner: diff --git a/test/registered/unit/model_executor/test_num_token_non_padded_localization.py b/test/registered/unit/model_executor/test_num_token_non_padded_localization.py index 24dd96663..b8446fc68 100644 --- a/test/registered/unit/model_executor/test_num_token_non_padded_localization.py +++ b/test/registered/unit/model_executor/test_num_token_non_padded_localization.py @@ -13,7 +13,7 @@ tensor and host-int twin agree, so a change to the sharding math fails loudly. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/model_executor/test_pool_configurator.py b/test/registered/unit/model_executor/test_pool_configurator.py index 783ff64f4..86914d6b1 100644 --- a/test/registered/unit/model_executor/test_pool_configurator.py +++ b/test/registered/unit/model_executor/test_pool_configurator.py @@ -21,7 +21,7 @@ from sglang.srt.runtime_context import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") @contextlib.contextmanager diff --git a/test/registered/unit/model_executor/test_prefill_cuda_graph_runner.py b/test/registered/unit/model_executor/test_prefill_cuda_graph_runner.py index 1f39bb2c6..07a2c5f05 100644 --- a/test/registered/unit/model_executor/test_prefill_cuda_graph_runner.py +++ b/test/registered/unit/model_executor/test_prefill_cuda_graph_runner.py @@ -27,7 +27,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _FakeAttentionBackend: diff --git a/test/registered/unit/model_executor/test_prefill_cuda_graph_runner_helpers.py b/test/registered/unit/model_executor/test_prefill_cuda_graph_runner_helpers.py index cb7e4bd58..9e3764810 100644 --- a/test/registered/unit/model_executor/test_prefill_cuda_graph_runner_helpers.py +++ b/test/registered/unit/model_executor/test_prefill_cuda_graph_runner_helpers.py @@ -21,7 +21,7 @@ from sglang.srt.model_loader.utils import resolve_language_model from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _LayerModel: diff --git a/test/registered/unit/model_executor/test_unified_out_cache_loc_rebind.py b/test/registered/unit/model_executor/test_unified_out_cache_loc_rebind.py index f3b071b0b..4cc9b006e 100644 --- a/test/registered/unit/model_executor/test_unified_out_cache_loc_rebind.py +++ b/test/registered/unit/model_executor/test_unified_out_cache_loc_rebind.py @@ -36,7 +36,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardBatch, ForwardMo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") _DEV = "cpu" diff --git a/test/registered/unit/model_loader/test_modelopt_loader.py b/test/registered/unit/model_loader/test_modelopt_loader.py index 80230b90b..97c6011ab 100644 --- a/test/registered/unit/model_loader/test_modelopt_loader.py +++ b/test/registered/unit/model_loader/test_modelopt_loader.py @@ -53,7 +53,7 @@ CALIBRATION_BATCH_SIZE = 36 CALIBRATION_NUM_SAMPLES = 512 DEFAULT_DEVICE = "cuda:0" -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-small") class TestModelOptModelLoader(CustomTestCase): diff --git a/test/registered/unit/model_loader/test_prefetch_checkpoints.py b/test/registered/unit/model_loader/test_prefetch_checkpoints.py index 01f6e4f2b..1685cd323 100644 --- a/test/registered/unit/model_loader/test_prefetch_checkpoints.py +++ b/test/registered/unit/model_loader/test_prefetch_checkpoints.py @@ -28,7 +28,7 @@ from sglang.srt.model_loader.weight_utils import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _InlineThread: diff --git a/test/registered/unit/model_loader/test_remote_instance_loader.py b/test/registered/unit/model_loader/test_remote_instance_loader.py index 63f593e93..5962ccb99 100644 --- a/test/registered/unit/model_loader/test_remote_instance_loader.py +++ b/test/registered/unit/model_loader/test_remote_instance_loader.py @@ -10,7 +10,7 @@ from sglang.srt.model_loader.remote_instance_weight_loader_utils import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") EXTRA_CONFIG = {"enable_multithread_load": True, "num_threads": 64} diff --git a/test/registered/unit/model_loader/test_runai_model_streamer_loader.py b/test/registered/unit/model_loader/test_runai_model_streamer_loader.py index 0793f8dc9..ec195a4f7 100644 --- a/test/registered/unit/model_loader/test_runai_model_streamer_loader.py +++ b/test/registered/unit/model_loader/test_runai_model_streamer_loader.py @@ -23,7 +23,7 @@ from sglang.srt.models.deepseek_v4_dspark import DeepseekV4ForCausalLMDSpark from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class _FakeModel: diff --git a/test/registered/unit/model_loader/test_transformers_fallback.py b/test/registered/unit/model_loader/test_transformers_fallback.py index 743403bd4..671c20f05 100644 --- a/test/registered/unit/model_loader/test_transformers_fallback.py +++ b/test/registered/unit/model_loader/test_transformers_fallback.py @@ -8,7 +8,7 @@ from sglang.srt.models.transformers import TransformersBase from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestTransformersFallbackWeightMapper(CustomTestCase): diff --git a/test/registered/unit/model_loader/test_weight_cache_protocol.py b/test/registered/unit/model_loader/test_weight_cache_protocol.py index deb75ffd0..f7e8d6b1c 100644 --- a/test/registered/unit/model_loader/test_weight_cache_protocol.py +++ b/test/registered/unit/model_loader/test_weight_cache_protocol.py @@ -50,7 +50,7 @@ from sglang.srt.weight_cache.transport import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _make_cache_config(**overrides) -> CacheConfig: diff --git a/test/registered/unit/model_loader/test_weight_utils.py b/test/registered/unit/model_loader/test_weight_utils.py index 443f32da1..f63e642f0 100644 --- a/test/registered/unit/model_loader/test_weight_utils.py +++ b/test/registered/unit/model_loader/test_weight_utils.py @@ -9,7 +9,7 @@ from sglang.srt.model_loader.weight_utils import filter_duplicate_safetensors_fi from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") INDEX_NAME = "model.safetensors.index.json" diff --git a/test/registered/unit/models/test_cosmos3.py b/test/registered/unit/models/test_cosmos3.py index 4d91de871..de8b3b932 100644 --- a/test/registered/unit/models/test_cosmos3.py +++ b/test/registered/unit/models/test_cosmos3.py @@ -16,7 +16,7 @@ All of this is pure CPU logic (no server / engine launch). from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") import os import tempfile diff --git a/test/registered/unit/models/test_cosmos3_edge.py b/test/registered/unit/models/test_cosmos3_edge.py index 24cc291ac..539cf5a95 100644 --- a/test/registered/unit/models/test_cosmos3_edge.py +++ b/test/registered/unit/models/test_cosmos3_edge.py @@ -15,7 +15,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import asyncio import unittest diff --git a/test/registered/unit/models/test_deepseek_mla_dispatch.py b/test/registered/unit/models/test_deepseek_mla_dispatch.py index 57571eaa9..9c491f2ef 100644 --- a/test/registered/unit/models/test_deepseek_mla_dispatch.py +++ b/test/registered/unit/models/test_deepseek_mla_dispatch.py @@ -21,7 +21,7 @@ from sglang.srt.models.deepseek_common.attention_forward_methods.forward_methods from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _fake_forward_batch(is_decode: bool): diff --git a/test/registered/unit/models/test_deepseek_v4_amd_fused_mhc.py b/test/registered/unit/models/test_deepseek_v4_amd_fused_mhc.py index b5a107a94..52378f5b6 100644 --- a/test/registered/unit/models/test_deepseek_v4_amd_fused_mhc.py +++ b/test/registered/unit/models/test_deepseek_v4_amd_fused_mhc.py @@ -6,7 +6,7 @@ from sglang.srt.models.deepseek_common.amd import deepseek_v4_fused_mhc from sglang.srt.runtime_context import override_platform from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestAmdFusedMhcCrossLayerGating(unittest.TestCase): diff --git a/test/registered/unit/models/test_deepseek_v4_mxfp4_shared_expert_requant.py b/test/registered/unit/models/test_deepseek_v4_mxfp4_shared_expert_requant.py index 1de679c0e..88ecb9e9a 100644 --- a/test/registered/unit/models/test_deepseek_v4_mxfp4_shared_expert_requant.py +++ b/test/registered/unit/models/test_deepseek_v4_mxfp4_shared_expert_requant.py @@ -6,7 +6,7 @@ from sglang.srt.layers.quantization.fp8_utils import quantize_block_fp8_weight_t from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") _E2M1_LUT = torch.tensor([0.0, 0.5, 1.0, 1.5, 2.0, 3.0, 4.0, 6.0]) diff --git a/test/registered/unit/models/test_deepseek_v4_rope_policy.py b/test/registered/unit/models/test_deepseek_v4_rope_policy.py index 02abac0a3..fa8113de8 100644 --- a/test/registered/unit/models/test_deepseek_v4_rope_policy.py +++ b/test/registered/unit/models/test_deepseek_v4_rope_policy.py @@ -13,7 +13,7 @@ from sglang.srt.environ import envs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _ModuleStub(nn.Module): diff --git a/test/registered/unit/models/test_deepseek_v4_shared_expert_fusion.py b/test/registered/unit/models/test_deepseek_v4_shared_expert_fusion.py index 46be9817a..3ee807f37 100644 --- a/test/registered/unit/models/test_deepseek_v4_shared_expert_fusion.py +++ b/test/registered/unit/models/test_deepseek_v4_shared_expert_fusion.py @@ -16,7 +16,7 @@ from sglang.srt.runtime_context import get_context, get_exec, get_flags, get_par from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestDeepseekV4SharedExpertFusionPolicy(CustomTestCase): diff --git a/test/registered/unit/models/test_draft_entry_hook_parity.py b/test/registered/unit/models/test_draft_entry_hook_parity.py index b96ca4308..cd8b03678 100644 --- a/test/registered/unit/models/test_draft_entry_hook_parity.py +++ b/test/registered/unit/models/test_draft_entry_hook_parity.py @@ -29,7 +29,7 @@ from sglang.srt.models.registry import ModelRegistry from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=60, suite="base-a-test-cpu") +register_cpu_ci(est_time=14, suite="base-a-test-cpu") # The hooks the loader resolves on the entry class where a draft/target # disagreement is a defect rather than a difference. Weight-name maps diff --git a/test/registered/unit/models/test_flux2_fp8_norm_quant_gate.py b/test/registered/unit/models/test_flux2_fp8_norm_quant_gate.py index f3e8fcfe8..cfc11588b 100644 --- a/test/registered/unit/models/test_flux2_fp8_norm_quant_gate.py +++ b/test/registered/unit/models/test_flux2_fp8_norm_quant_gate.py @@ -16,7 +16,7 @@ from sglang.multimodal_gen.runtime.models.dits.flux_2 import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-small") def _fp8_linear(input_scale: float) -> nn.Module: diff --git a/test/registered/unit/models/test_fusion_gate_coverage.py b/test/registered/unit/models/test_fusion_gate_coverage.py index 49a2f1dbc..d37ba7ba1 100644 --- a/test/registered/unit/models/test_fusion_gate_coverage.py +++ b/test/registered/unit/models/test_fusion_gate_coverage.py @@ -25,7 +25,7 @@ from sglang.srt.models.registry import ModelRegistry from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=90, suite="base-a-test-cpu") +register_cpu_ci(est_time=22, suite="base-a-test-cpu") GATE = "shared_experts_fusion_disable_reason" FLAG_READERS = ( diff --git a/test/registered/unit/models/test_glm_moe_gate_fp32.py b/test/registered/unit/models/test_glm_moe_gate_fp32.py index 6489aeca6..f80c0a104 100644 --- a/test/registered/unit/models/test_glm_moe_gate_fp32.py +++ b/test/registered/unit/models/test_glm_moe_gate_fp32.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/models/test_hunyuan_v3_nextn_weight_loading.py b/test/registered/unit/models/test_hunyuan_v3_nextn_weight_loading.py index f417f6de8..8a5eb099c 100644 --- a/test/registered/unit/models/test_hunyuan_v3_nextn_weight_loading.py +++ b/test/registered/unit/models/test_hunyuan_v3_nextn_weight_loading.py @@ -9,7 +9,7 @@ being remapped to a nonexistent decoder parameter and silently dropped. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/models/test_hunyuan_v4.py b/test/registered/unit/models/test_hunyuan_v4.py index ce98b9382..a9069ee81 100644 --- a/test/registered/unit/models/test_hunyuan_v4.py +++ b/test/registered/unit/models/test_hunyuan_v4.py @@ -9,7 +9,7 @@ from sglang.srt.models import hunyuan_v4 from sglang.srt.models.deepseek_common.attention_forward_methods import forward_mla from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def test_attention_gate_uses_attention_tp(monkeypatch): diff --git a/test/registered/unit/models/test_hunyuan_v4_nextn_weight_loading.py b/test/registered/unit/models/test_hunyuan_v4_nextn_weight_loading.py index f93710d09..da3a16c45 100644 --- a/test/registered/unit/models/test_hunyuan_v4_nextn_weight_loading.py +++ b/test/registered/unit/models/test_hunyuan_v4_nextn_weight_loading.py @@ -6,7 +6,7 @@ import torch from sglang.srt.models.hunyuan_v4_nextn import HYV4ForCausalLMNextN from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestHunyuanV4NextNWeightLoading(unittest.TestCase): diff --git a/test/registered/unit/models/test_kimi_k25.py b/test/registered/unit/models/test_kimi_k25.py index 9fe089120..4d79380bf 100644 --- a/test/registered/unit/models/test_kimi_k25.py +++ b/test/registered/unit/models/test_kimi_k25.py @@ -76,7 +76,7 @@ from sglang.srt.server_args import ServerArgs from sglang.srt.utils import ImageData from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") class _MoonViT3dTower: diff --git a/test/registered/unit/models/test_kimi_k25_mm_projection.py b/test/registered/unit/models/test_kimi_k25_mm_projection.py index dfe39d9b6..09082ed6f 100644 --- a/test/registered/unit/models/test_kimi_k25_mm_projection.py +++ b/test/registered/unit/models/test_kimi_k25_mm_projection.py @@ -7,7 +7,7 @@ import torch.nn as nn from sglang.srt.models.kimi_k25 import mm_projection_auto from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class _FlattenProjector(nn.Module): diff --git a/test/registered/unit/models/test_kimi_k3_bfa_overlap.py b/test/registered/unit/models/test_kimi_k3_bfa_overlap.py index db856e293..1aa5520e8 100644 --- a/test/registered/unit/models/test_kimi_k3_bfa_overlap.py +++ b/test/registered/unit/models/test_kimi_k3_bfa_overlap.py @@ -15,7 +15,7 @@ from sglang.srt.models.kimi_k3 import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large") _H = 7168 _QKVG = 6144 # q,k,v,g slices per rank at TP8 diff --git a/test/registered/unit/models/test_kimi_k3_vision.py b/test/registered/unit/models/test_kimi_k3_vision.py index 91f4338ab..bf9e6ad08 100644 --- a/test/registered/unit/models/test_kimi_k3_vision.py +++ b/test/registered/unit/models/test_kimi_k3_vision.py @@ -24,7 +24,7 @@ from sglang.srt.multimodal.mm_utils import run_dp_sharded_mrope_vision_model from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") @pytest.mark.parametrize( diff --git a/test/registered/unit/models/test_kimi_vl.py b/test/registered/unit/models/test_kimi_vl.py index 10ae42d7a..1cd09aa7d 100644 --- a/test/registered/unit/models/test_kimi_vl.py +++ b/test/registered/unit/models/test_kimi_vl.py @@ -20,7 +20,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") class _VisionTower: diff --git a/test/registered/unit/models/test_kimi_vl_moonvit.py b/test/registered/unit/models/test_kimi_vl_moonvit.py index af2f34c17..dffe24e4d 100644 --- a/test/registered/unit/models/test_kimi_vl_moonvit.py +++ b/test/registered/unit/models/test_kimi_vl_moonvit.py @@ -3,7 +3,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") from sglang.srt.models import kimi_vl_moonvit from sglang.srt.models.kimi_vl_moonvit import Learnable2DInterpPosEmb diff --git a/test/registered/unit/models/test_llava.py b/test/registered/unit/models/test_llava.py index e7e5e6427..6f981a3c2 100644 --- a/test/registered/unit/models/test_llava.py +++ b/test/registered/unit/models/test_llava.py @@ -8,7 +8,7 @@ from sglang.srt.multimodal.processors.llava import LlavaImageProcessor from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class PixtralVisionConfig: diff --git a/test/registered/unit/models/test_llava_processor_pool.py b/test/registered/unit/models/test_llava_processor_pool.py index 61443c9f2..32623c4d1 100644 --- a/test/registered/unit/models/test_llava_processor_pool.py +++ b/test/registered/unit/models/test_llava_processor_pool.py @@ -10,7 +10,7 @@ import pytest from sglang.srt.multimodal.processors.llava import LlavaImageProcessor from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") class _BrokenExecutor(concurrent.futures.Executor): diff --git a/test/registered/unit/models/test_locate_anything.py b/test/registered/unit/models/test_locate_anything.py index e2aad3345..c870fd218 100644 --- a/test/registered/unit/models/test_locate_anything.py +++ b/test/registered/unit/models/test_locate_anything.py @@ -19,7 +19,7 @@ from sglang.srt.models.locate_anything import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _small_config(): diff --git a/test/registered/unit/models/test_longcat_flash_router_hpc_gemm.py b/test/registered/unit/models/test_longcat_flash_router_hpc_gemm.py index 834cff921..754263be1 100644 --- a/test/registered/unit/models/test_longcat_flash_router_hpc_gemm.py +++ b/test/registered/unit/models/test_longcat_flash_router_hpc_gemm.py @@ -13,7 +13,7 @@ maybe_stub_sgl_kernel() from sglang.srt.models.longcat_flash import LongcatFlashRouter # noqa: E402 -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _longcat_config(hidden_size, n_routed_experts, *, router_bias=False): diff --git a/test/registered/unit/models/test_mellum.py b/test/registered/unit/models/test_mellum.py index e45939769..112c43f75 100644 --- a/test/registered/unit/models/test_mellum.py +++ b/test/registered/unit/models/test_mellum.py @@ -8,7 +8,7 @@ from sglang.srt.models.mellum import MellumForCausalLM from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestMellumForCausalLM(CustomTestCase): diff --git a/test/registered/unit/models/test_moss_vl_processor.py b/test/registered/unit/models/test_moss_vl_processor.py index e901380a2..04c14ff8d 100644 --- a/test/registered/unit/models/test_moss_vl_processor.py +++ b/test/registered/unit/models/test_moss_vl_processor.py @@ -10,7 +10,7 @@ import torch from sglang.srt.multimodal.processors.moss_vl import MossVLImageProcessor from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _vision_info(frame_count: int): diff --git a/test/registered/unit/models/test_nemotron_h_weight_loading.py b/test/registered/unit/models/test_nemotron_h_weight_loading.py index ed4c21d23..0a4309992 100644 --- a/test/registered/unit/models/test_nemotron_h_weight_loading.py +++ b/test/registered/unit/models/test_nemotron_h_weight_loading.py @@ -7,7 +7,7 @@ parameters absent from the current runtime model. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/models/test_paddleocr_vl_serving_defaults.py b/test/registered/unit/models/test_paddleocr_vl_serving_defaults.py index cccc6f3de..fa146e8bf 100644 --- a/test/registered/unit/models/test_paddleocr_vl_serving_defaults.py +++ b/test/registered/unit/models/test_paddleocr_vl_serving_defaults.py @@ -25,7 +25,7 @@ from sglang.srt.multimodal.processors.base_processor import BaseMultimodalProces from sglang.srt.multimodal.processors.paddleocr_vlm import PaddleOCRVLImageProcessor from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def test_processor_preprocesses_pages_concurrently(): diff --git a/test/registered/unit/models/test_paddleocr_vl_vision.py b/test/registered/unit/models/test_paddleocr_vl_vision.py index 7f43b6a80..91189293c 100644 --- a/test/registered/unit/models/test_paddleocr_vl_vision.py +++ b/test/registered/unit/models/test_paddleocr_vl_vision.py @@ -18,7 +18,7 @@ from sglang.srt.models.paddleocr_vl import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") # Mixes repeated grids (LFU cache hits), an odd aspect ratio, and t > 1. GRIDS = [(1, 4, 6), (1, 8, 10), (2, 2, 4), (1, 8, 10)] diff --git a/test/registered/unit/models/test_qwen3_5_modelopt_fp4.py b/test/registered/unit/models/test_qwen3_5_modelopt_fp4.py index 59cc8e3c5..d0e3f60ad 100644 --- a/test/registered/unit/models/test_qwen3_5_modelopt_fp4.py +++ b/test/registered/unit/models/test_qwen3_5_modelopt_fp4.py @@ -21,7 +21,7 @@ from sglang.srt.models.qwen3_5 import QWEN3_5_KV_SCALE_MAPPER from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestModelOptFp4AttentionExclusion(CustomTestCase): diff --git a/test/registered/unit/models/test_qwen3_5_packed_weight_loader.py b/test/registered/unit/models/test_qwen3_5_packed_weight_loader.py index e384e1e95..57aa6457f 100644 --- a/test/registered/unit/models/test_qwen3_5_packed_weight_loader.py +++ b/test/registered/unit/models/test_qwen3_5_packed_weight_loader.py @@ -10,7 +10,7 @@ Regression test for https://github.com/sgl-project/sglang/issues/23051 from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/models/test_qwen3_5_pipeline_parallel.py b/test/registered/unit/models/test_qwen3_5_pipeline_parallel.py index 9a9116f08..402df38e7 100644 --- a/test/registered/unit/models/test_qwen3_5_pipeline_parallel.py +++ b/test/registered/unit/models/test_qwen3_5_pipeline_parallel.py @@ -9,7 +9,7 @@ from sglang.srt.models.qwen3_5_mtp import Qwen3_5ForCausalLMMTP from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestQwen3_5PipelineParallel(CustomTestCase): diff --git a/test/registered/unit/models/test_qwen3_embedding_registration.py b/test/registered/unit/models/test_qwen3_embedding_registration.py index 8b2d82a52..3f11f3c81 100644 --- a/test/registered/unit/models/test_qwen3_embedding_registration.py +++ b/test/registered/unit/models/test_qwen3_embedding_registration.py @@ -8,7 +8,7 @@ and be served as an embedding model, NOT fall back to the Transformers backend. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=17, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/models/test_qwen3_vl_feature_materialization.py b/test/registered/unit/models/test_qwen3_vl_feature_materialization.py index b0cbccf75..653663ce7 100644 --- a/test/registered/unit/models/test_qwen3_vl_feature_materialization.py +++ b/test/registered/unit/models/test_qwen3_vl_feature_materialization.py @@ -15,7 +15,7 @@ from sglang.srt.multimodal.transport.cuda_ipc import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _RecordingVisual: diff --git a/test/registered/unit/models/test_qwen_image_fp8_norm_quant.py b/test/registered/unit/models/test_qwen_image_fp8_norm_quant.py index 18d33803f..08db0c0e0 100644 --- a/test/registered/unit/models/test_qwen_image_fp8_norm_quant.py +++ b/test/registered/unit/models/test_qwen_image_fp8_norm_quant.py @@ -16,7 +16,7 @@ from sglang.multimodal_gen.runtime.models.dits.qwen_image import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") def _fp8_linear(input_scale: float) -> nn.Module: diff --git a/test/registered/unit/models/test_shared_experts_fusion_gates.py b/test/registered/unit/models/test_shared_experts_fusion_gates.py index e9a7ff710..e94dc1bf5 100644 --- a/test/registered/unit/models/test_shared_experts_fusion_gates.py +++ b/test/registered/unit/models/test_shared_experts_fusion_gates.py @@ -26,7 +26,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") def _quant(name: str): diff --git a/test/registered/unit/models/test_vit_pos_embed_interpolate.py b/test/registered/unit/models/test_vit_pos_embed_interpolate.py index 9ea7ba7f7..cffad7815 100644 --- a/test/registered/unit/models/test_vit_pos_embed_interpolate.py +++ b/test/registered/unit/models/test_vit_pos_embed_interpolate.py @@ -23,7 +23,7 @@ import torch.nn as nn from sglang.test.ci.ci_register import register_amd_ci, register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_amd_ci(est_time=20, stage="stage-a", runner_config="1-gpu-small-amd") NUM_POS = 2304 # Qwen3-VL num_position_embeddings -> 48x48 grid diff --git a/test/registered/unit/models/test_xllm.py b/test/registered/unit/models/test_xllm.py index f5107ed69..90e9e563a 100644 --- a/test/registered/unit/models/test_xllm.py +++ b/test/registered/unit/models/test_xllm.py @@ -35,7 +35,7 @@ from sglang.srt.runtime_context import get_context from sglang.srt.utils.hf_transformers.common import _CONFIG_REGISTRY from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _IdentityRotary: diff --git a/test/registered/unit/models/test_zaya_cca.py b/test/registered/unit/models/test_zaya_cca.py index 83fd2f1fd..c4d2c7498 100644 --- a/test/registered/unit/models/test_zaya_cca.py +++ b/test/registered/unit/models/test_zaya_cca.py @@ -34,7 +34,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.layer_ut_utils import init_single_process_dist from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _ensure_dist_initialized(cls) -> None: diff --git a/test/registered/unit/models/test_zaya_mod_tp.py b/test/registered/unit/models/test_zaya_mod_tp.py index e8deb64e3..d5d45d606 100644 --- a/test/registered/unit/models/test_zaya_mod_tp.py +++ b/test/registered/unit/models/test_zaya_mod_tp.py @@ -25,7 +25,7 @@ from sglang.srt.models.zaya import mod_blend, mod_premask_experts from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _reference_blend( diff --git a/test/registered/unit/multimodal/rust/inkling/test_bindings.py b/test/registered/unit/multimodal/rust/inkling/test_bindings.py index 23ab5a939..06893e5a2 100644 --- a/test/registered/unit/multimodal/rust/inkling/test_bindings.py +++ b/test/registered/unit/multimodal/rust/inkling/test_bindings.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import CustomTestCase sys.path.insert(0, str(Path(__file__).resolve().parents[1])) from _mm_rust_utils import image_bytes, load_core # noqa: E402 -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") CORE = load_core() PATCH_SIZE = 16 diff --git a/test/registered/unit/multimodal/rust/qwen/test_driver.py b/test/registered/unit/multimodal/rust/qwen/test_driver.py index c86c6583d..efd03b2ed 100644 --- a/test/registered/unit/multimodal/rust/qwen/test_driver.py +++ b/test/registered/unit/multimodal/rust/qwen/test_driver.py @@ -33,7 +33,7 @@ from _mm_rust_utils import ( # noqa: E402 spec_json, ) -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") QWEN_CORE = getattr(load_core(), "qwen_vl", None) SPEC = spec_json(PROCESSOR_CONFIGS["qwen2_5_vl"]) diff --git a/test/registered/unit/multimodal/rust/qwen/test_e2e_parity.py b/test/registered/unit/multimodal/rust/qwen/test_e2e_parity.py index 4e37bcb0a..c9531036a 100644 --- a/test/registered/unit/multimodal/rust/qwen/test_e2e_parity.py +++ b/test/registered/unit/multimodal/rust/qwen/test_e2e_parity.py @@ -30,7 +30,7 @@ sys.path.insert(0, str(Path(__file__).resolve().parents[1])) from _fixtures import make_processor, snapshot # noqa: E402 from _mm_rust_utils import PROCESSOR_CONFIGS, image_bytes, load_core # noqa: E402 -register_cpu_ci(est_time=40, suite="base-a-test-cpu") +register_cpu_ci(est_time=16, suite="base-a-test-cpu") CORE = load_core() DRIVER = getattr(getattr(CORE, "qwen_vl", None), "process_mm", None) diff --git a/test/registered/unit/multimodal/rust/qwen/test_preprocess.py b/test/registered/unit/multimodal/rust/qwen/test_preprocess.py index 72efeb937..f93222aff 100644 --- a/test/registered/unit/multimodal/rust/qwen/test_preprocess.py +++ b/test/registered/unit/multimodal/rust/qwen/test_preprocess.py @@ -32,7 +32,7 @@ from _mm_rust_utils import ( # noqa: E402 spec_json, ) -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=14, suite="base-a-test-cpu") QWEN_CORE = getattr(load_core(), "qwen_vl", None) diff --git a/test/registered/unit/multimodal/rust/qwen/test_rust_mm_processor.py b/test/registered/unit/multimodal/rust/qwen/test_rust_mm_processor.py index 6f408a92d..b0e5afc71 100644 --- a/test/registered/unit/multimodal/rust/qwen/test_rust_mm_processor.py +++ b/test/registered/unit/multimodal/rust/qwen/test_rust_mm_processor.py @@ -29,7 +29,7 @@ sys.path.insert(0, str(Path(__file__).resolve().parents[1])) from _fixtures import make_processor # noqa: E402 from _mm_rust_utils import PROCESSOR_CONFIGS, image_bytes, load_core # noqa: E402 -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=16, suite="base-a-test-cpu") CORE = load_core() DRIVER = getattr(getattr(CORE, "qwen_vl", None), "process_mm", None) diff --git a/test/registered/unit/multimodal/rust/shared/test_fetch.py b/test/registered/unit/multimodal/rust/shared/test_fetch.py index 7a036215e..996ff5304 100644 --- a/test/registered/unit/multimodal/rust/shared/test_fetch.py +++ b/test/registered/unit/multimodal/rust/shared/test_fetch.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import CustomTestCase sys.path.insert(0, str(Path(__file__).resolve().parents[1])) from _mm_rust_utils import load_core # noqa: E402 -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") CORE = load_core() FETCH = CORE and CORE.common.fetch_bytes diff --git a/test/registered/unit/multimodal/rust/shared/test_image_decode.py b/test/registered/unit/multimodal/rust/shared/test_image_decode.py index 7b3995ce7..fd174f860 100644 --- a/test/registered/unit/multimodal/rust/shared/test_image_decode.py +++ b/test/registered/unit/multimodal/rust/shared/test_image_decode.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import CustomTestCase sys.path.insert(0, str(Path(__file__).resolve().parents[1])) from _mm_rust_utils import load_core # noqa: E402 -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") CORE = load_core() DECODE = CORE and CORE.common.image_decode_rgb diff --git a/test/registered/unit/multimodal/rust/shared/test_partition_cores.py b/test/registered/unit/multimodal/rust/shared/test_partition_cores.py index 800abbd63..eb33f1026 100644 --- a/test/registered/unit/multimodal/rust/shared/test_partition_cores.py +++ b/test/registered/unit/multimodal/rust/shared/test_partition_cores.py @@ -14,7 +14,7 @@ maybe_stub_sgl_kernel() from sglang.srt.rust_server.config import _partition_cores # noqa: E402 -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def partition(node_cores, **kwargs): diff --git a/test/registered/unit/multimodal/rust/shared/test_rust_mm_gate.py b/test/registered/unit/multimodal/rust/shared/test_rust_mm_gate.py index b610b271a..c264cd62d 100644 --- a/test/registered/unit/multimodal/rust/shared/test_rust_mm_gate.py +++ b/test/registered/unit/multimodal/rust/shared/test_rust_mm_gate.py @@ -22,7 +22,7 @@ from sglang.srt.managers.multimodal_processor import ( # noqa: E402 ) from sglang.srt.rust_server.multimodal import rust_mm_family_for # noqa: E402 -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=14, suite="base-a-test-cpu") def processor_cls_for(architecture, model_type): diff --git a/test/registered/unit/multimodal/rust/shared/test_wrap_encoded.py b/test/registered/unit/multimodal/rust/shared/test_wrap_encoded.py index 35dd929ca..a11821de4 100644 --- a/test/registered/unit/multimodal/rust/shared/test_wrap_encoded.py +++ b/test/registered/unit/multimodal/rust/shared/test_wrap_encoded.py @@ -20,7 +20,7 @@ from sglang.srt.rust_server.multimodal import ( # noqa: E402 RustMmSpec, ) -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestWrapEncoded(CustomTestCase): diff --git a/test/registered/unit/multimodal/test_audio_container_decode.py b/test/registered/unit/multimodal/test_audio_container_decode.py index 5b895e013..2c65e329e 100644 --- a/test/registered/unit/multimodal/test_audio_container_decode.py +++ b/test/registered/unit/multimodal/test_audio_container_decode.py @@ -24,7 +24,7 @@ from sglang.srt.utils.common import load_audio from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _tone(*, sample_rate: int, channels: int = 1) -> np.ndarray: diff --git a/test/registered/unit/multimodal/test_base_processor_bad_input.py b/test/registered/unit/multimodal/test_base_processor_bad_input.py index 0de449b3b..c66a3f9b5 100644 --- a/test/registered/unit/multimodal/test_base_processor_bad_input.py +++ b/test/registered/unit/multimodal/test_base_processor_bad_input.py @@ -6,7 +6,7 @@ Media the client supplied but that cannot be fetched or decoded must raise from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import base64 import binascii diff --git a/test/registered/unit/multimodal/test_base_processor_image_decode.py b/test/registered/unit/multimodal/test_base_processor_image_decode.py index cc1fbaaba..f6ca7a223 100644 --- a/test/registered/unit/multimodal/test_base_processor_image_decode.py +++ b/test/registered/unit/multimodal/test_base_processor_image_decode.py @@ -11,7 +11,7 @@ No server, no model loading — pure CPU. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import asyncio import concurrent.futures diff --git a/test/registered/unit/multimodal/test_cuda_ipc_pool_budget.py b/test/registered/unit/multimodal/test_cuda_ipc_pool_budget.py index b09b3bb54..ad98e9f93 100644 --- a/test/registered/unit/multimodal/test_cuda_ipc_pool_budget.py +++ b/test/registered/unit/multimodal/test_cuda_ipc_pool_budget.py @@ -7,7 +7,7 @@ from sglang.srt.multimodal.transport.cuda_ipc import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") class TestCudaIpcPoolBudget(unittest.TestCase): diff --git a/test/registered/unit/multimodal/test_cuda_ipc_transport.py b/test/registered/unit/multimodal/test_cuda_ipc_transport.py index ffd516ff2..80bf3572e 100644 --- a/test/registered/unit/multimodal/test_cuda_ipc_transport.py +++ b/test/registered/unit/multimodal/test_cuda_ipc_transport.py @@ -28,7 +28,7 @@ from sglang.srt.multimodal.transport.cuda_ipc import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=37, stage="base-b", runner_config="1-gpu-large") def _produce_pooled_tensor(proxy_queue, consumer_done, result_queue): diff --git a/test/registered/unit/multimodal/test_cuda_vmm_transport.py b/test/registered/unit/multimodal/test_cuda_vmm_transport.py index 235f63e7e..5923d4836 100644 --- a/test/registered/unit/multimodal/test_cuda_vmm_transport.py +++ b/test/registered/unit/multimodal/test_cuda_vmm_transport.py @@ -23,7 +23,7 @@ from sglang.srt.utils.cuda_vmm_transport_utils import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="base-c", runner_config="4-gpu-gb300") +register_cuda_ci(est_time=31, stage="base-c", runner_config="4-gpu-gb300") class _FabricUnavailableCudaVmmMemoryPool(CudaVmmMemoryPool): diff --git a/test/registered/unit/multimodal/test_dots_note_omni.py b/test/registered/unit/multimodal/test_dots_note_omni.py index 7fcc9266c..1fb58fb9f 100644 --- a/test/registered/unit/multimodal/test_dots_note_omni.py +++ b/test/registered/unit/multimodal/test_dots_note_omni.py @@ -16,7 +16,7 @@ from sglang.srt.multimodal.processors.dots_note_omni import DotsNoteOmniProcesso from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") _IM_TOKEN_ID = 100 _AUDIO_TOKEN_ID = 200 diff --git a/test/registered/unit/multimodal/test_evs.py b/test/registered/unit/multimodal/test_evs.py index acbd79b48..047901ff9 100644 --- a/test/registered/unit/multimodal/test_evs.py +++ b/test/registered/unit/multimodal/test_evs.py @@ -7,7 +7,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import run_doctests -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def test_resolve_evs_config(): diff --git a/test/registered/unit/multimodal/test_feature_materialization.py b/test/registered/unit/multimodal/test_feature_materialization.py index 5f227ac76..6fcc28012 100644 --- a/test/registered/unit/multimodal/test_feature_materialization.py +++ b/test/registered/unit/multimodal/test_feature_materialization.py @@ -8,7 +8,7 @@ from sglang.srt.multimodal.mm_utils import materialize_multimodal_features from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestFeatureMaterialization(CustomTestCase): diff --git a/test/registered/unit/multimodal/test_glm4v_mixed_offsets.py b/test/registered/unit/multimodal/test_glm4v_mixed_offsets.py index 595a11a2f..1384c12c1 100644 --- a/test/registered/unit/multimodal/test_glm4v_mixed_offsets.py +++ b/test/registered/unit/multimodal/test_glm4v_mixed_offsets.py @@ -6,7 +6,7 @@ from sglang.srt.multimodal.processors.base_processor import MultimodalSpecialTok from sglang.srt.multimodal.processors.glm4v import Glm4vImageProcessor from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _processor(): diff --git a/test/registered/unit/multimodal/test_gpu_feature_transport.py b/test/registered/unit/multimodal/test_gpu_feature_transport.py index ded81ae54..6e95a24a3 100644 --- a/test/registered/unit/multimodal/test_gpu_feature_transport.py +++ b/test/registered/unit/multimodal/test_gpu_feature_transport.py @@ -10,7 +10,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestCudaVmmFeatureTransport(unittest.TestCase): diff --git a/test/registered/unit/multimodal/test_kimi_k3_gpu_preprocess.py b/test/registered/unit/multimodal/test_kimi_k3_gpu_preprocess.py index 1b978fd9e..f3988bd26 100644 --- a/test/registered/unit/multimodal/test_kimi_k3_gpu_preprocess.py +++ b/test/registered/unit/multimodal/test_kimi_k3_gpu_preprocess.py @@ -11,7 +11,7 @@ from sglang.srt.multimodal.processors.kimi_k3 import _fill_transparent_bg from sglang.srt.multimodal.processors.kimi_k25 import _resize_bicubic_if_needed from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _natural_image(height: int, width: int) -> np.ndarray: diff --git a/test/registered/unit/multimodal/test_media_artifact_processor.py b/test/registered/unit/multimodal/test_media_artifact_processor.py index 0cff8af8e..39a6c8054 100644 --- a/test/registered/unit/multimodal/test_media_artifact_processor.py +++ b/test/registered/unit/multimodal/test_media_artifact_processor.py @@ -16,7 +16,7 @@ from sglang.srt.multimodal.media_artifacts import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") @dataclass(frozen=True) diff --git a/test/registered/unit/multimodal/test_media_url_security.py b/test/registered/unit/multimodal/test_media_url_security.py index 07da63cbc..1959bf6b8 100644 --- a/test/registered/unit/multimodal/test_media_url_security.py +++ b/test/registered/unit/multimodal/test_media_url_security.py @@ -16,7 +16,7 @@ from sglang.srt.utils.common import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class _MediaHandler(http.server.BaseHTTPRequestHandler): diff --git a/test/registered/unit/multimodal/test_mrope_encoder_utils.py b/test/registered/unit/multimodal/test_mrope_encoder_utils.py index a725c8853..a493461f0 100644 --- a/test/registered/unit/multimodal/test_mrope_encoder_utils.py +++ b/test/registered/unit/multimodal/test_mrope_encoder_utils.py @@ -13,7 +13,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _RecordingGather: diff --git a/test/registered/unit/multimodal/test_pixtral_processor.py b/test/registered/unit/multimodal/test_pixtral_processor.py index b45607a08..22b4d637e 100644 --- a/test/registered/unit/multimodal/test_pixtral_processor.py +++ b/test/registered/unit/multimodal/test_pixtral_processor.py @@ -16,7 +16,7 @@ from sglang.srt.multimodal.processors.pixtral import PixtralProcessor from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestPixtralProcessor(CustomTestCase): diff --git a/test/registered/unit/multimodal/test_preprocess_cache.py b/test/registered/unit/multimodal/test_preprocess_cache.py index e6ea8298f..2e26fbb59 100644 --- a/test/registered/unit/multimodal/test_preprocess_cache.py +++ b/test/registered/unit/multimodal/test_preprocess_cache.py @@ -25,7 +25,7 @@ from sglang.srt.runtime_context import publish, reset_context from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestMediaIdentity(unittest.TestCase): diff --git a/test/registered/unit/multimodal/test_processor_async_call_sites.py b/test/registered/unit/multimodal/test_processor_async_call_sites.py index fe42b96e1..3b2fa338c 100644 --- a/test/registered/unit/multimodal/test_processor_async_call_sites.py +++ b/test/registered/unit/multimodal/test_processor_async_call_sites.py @@ -18,7 +18,7 @@ import pytest from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") _MULTIMODAL_ROOT = ( pathlib.Path(__file__).resolve().parents[4] diff --git a/test/registered/unit/multimodal/test_processor_clone_isolation.py b/test/registered/unit/multimodal/test_processor_clone_isolation.py index 6e1d2a8a0..0ab717dfa 100644 --- a/test/registered/unit/multimodal/test_processor_clone_isolation.py +++ b/test/registered/unit/multimodal/test_processor_clone_isolation.py @@ -19,7 +19,7 @@ from sglang.srt.multimodal.processors.sarashina2_vision import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _NarrowImageProcessor: diff --git a/test/registered/unit/multimodal/test_processor_device_selection.py b/test/registered/unit/multimodal/test_processor_device_selection.py index 2e08ca6ad..8b2da76a2 100644 --- a/test/registered/unit/multimodal/test_processor_device_selection.py +++ b/test/registered/unit/multimodal/test_processor_device_selection.py @@ -16,7 +16,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") BASE = "sglang.srt.multimodal.processors.base_processor" diff --git a/test/registered/unit/multimodal/test_tensor_transport_mode.py b/test/registered/unit/multimodal/test_tensor_transport_mode.py index f9e6325bd..18d550e54 100644 --- a/test/registered/unit/multimodal/test_tensor_transport_mode.py +++ b/test/registered/unit/multimodal/test_tensor_transport_mode.py @@ -7,7 +7,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestTensorTransportMode(CustomTestCase): diff --git a/test/registered/unit/multimodal/test_vit_cuda_graph_metadata_cuda.py b/test/registered/unit/multimodal/test_vit_cuda_graph_metadata_cuda.py index 3dabc128b..4b8280a09 100644 --- a/test/registered/unit/multimodal/test_vit_cuda_graph_metadata_cuda.py +++ b/test/registered/unit/multimodal/test_vit_cuda_graph_metadata_cuda.py @@ -7,7 +7,7 @@ from torch import nn from sglang.srt.multimodal.vit_cuda_graph_runner import ViTCudaGraphRunner from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") class _BoundaryBlock(nn.Module): diff --git a/test/registered/unit/multimodal/test_vit_cuda_graph_runner.py b/test/registered/unit/multimodal/test_vit_cuda_graph_runner.py index 427e12091..3858acb19 100644 --- a/test/registered/unit/multimodal/test_vit_cuda_graph_runner.py +++ b/test/registered/unit/multimodal/test_vit_cuda_graph_runner.py @@ -7,7 +7,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") from sglang.srt.multimodal.internvl_vit_cuda_graph_runner import ( InternViTCudaGraphRunner, diff --git a/test/registered/unit/observability/test_forward_pass_metrics.py b/test/registered/unit/observability/test_forward_pass_metrics.py index 4fcf909f7..808a93c94 100644 --- a/test/registered/unit/observability/test_forward_pass_metrics.py +++ b/test/registered/unit/observability/test_forward_pass_metrics.py @@ -1,7 +1,7 @@ from sglang.srt.runtime_context import get_context, get_observability from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import math import types diff --git a/test/registered/unit/observability/test_ray_wrappers.py b/test/registered/unit/observability/test_ray_wrappers.py index 068e22682..de44e262d 100644 --- a/test/registered/unit/observability/test_ray_wrappers.py +++ b/test/registered/unit/observability/test_ray_wrappers.py @@ -19,7 +19,7 @@ from sglang.test.observability.fake_ray import ( load_ray_wrappers_without_ray, ) -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/observability/test_req_time_stats.py b/test/registered/unit/observability/test_req_time_stats.py index 82c8e1f47..16b9169ea 100644 --- a/test/registered/unit/observability/test_req_time_stats.py +++ b/test/registered/unit/observability/test_req_time_stats.py @@ -18,7 +18,7 @@ import sglang.srt.observability.req_time_stats as rts from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestSetstatePreservesUnsetTimeSentinels(CustomTestCase): diff --git a/test/registered/unit/observability/test_scheduler_stage_metrics.py b/test/registered/unit/observability/test_scheduler_stage_metrics.py index 611920c9e..b115acb95 100644 --- a/test/registered/unit/observability/test_scheduler_stage_metrics.py +++ b/test/registered/unit/observability/test_scheduler_stage_metrics.py @@ -15,7 +15,7 @@ from sglang.srt.observability.scheduler_stage_metrics import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestSchedulerStageMetricsRecorder(CustomTestCase): diff --git a/test/registered/unit/observability/test_stat_loggers_di.py b/test/registered/unit/observability/test_stat_loggers_di.py index 2888f26de..d7ac7258f 100644 --- a/test/registered/unit/observability/test_stat_loggers_di.py +++ b/test/registered/unit/observability/test_stat_loggers_di.py @@ -20,7 +20,7 @@ GPU-backed metrics tests. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/observability/test_trace.py b/test/registered/unit/observability/test_trace.py index 4dec7e71d..f1107919b 100644 --- a/test/registered/unit/observability/test_trace.py +++ b/test/registered/unit/observability/test_trace.py @@ -4,7 +4,7 @@ import os from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import threading import unittest diff --git a/test/registered/unit/parser/test_code_completion_parser.py b/test/registered/unit/parser/test_code_completion_parser.py index c62db905b..54262d123 100644 --- a/test/registered/unit/parser/test_code_completion_parser.py +++ b/test/registered/unit/parser/test_code_completion_parser.py @@ -18,7 +18,7 @@ from sglang.srt.parser.code_completion_parser import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/parser/test_conversation.py b/test/registered/unit/parser/test_conversation.py index 8f7f3b013..868bf4a86 100644 --- a/test/registered/unit/parser/test_conversation.py +++ b/test/registered/unit/parser/test_conversation.py @@ -32,7 +32,7 @@ from sglang.srt.parser.conversation import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/parser/test_harmony_parser.py b/test/registered/unit/parser/test_harmony_parser.py index 7172eeca9..e1e966b9c 100644 --- a/test/registered/unit/parser/test_harmony_parser.py +++ b/test/registered/unit/parser/test_harmony_parser.py @@ -12,7 +12,7 @@ from sglang.srt.parser.harmony_parser import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/parser/test_hunyuan_reasoning.py b/test/registered/unit/parser/test_hunyuan_reasoning.py index 5013f28f3..d550fcae5 100644 --- a/test/registered/unit/parser/test_hunyuan_reasoning.py +++ b/test/registered/unit/parser/test_hunyuan_reasoning.py @@ -7,7 +7,7 @@ from sglang.srt.parser.hunyuan_reasoning import normalize_hunyuan_reasoning_effo from sglang.srt.parser.template_detection import ReasoningToggleConfig from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") @pytest.mark.parametrize( diff --git a/test/registered/unit/parser/test_inkling_renderer.py b/test/registered/unit/parser/test_inkling_renderer.py index c9c2c4781..2fad76f0e 100644 --- a/test/registered/unit/parser/test_inkling_renderer.py +++ b/test/registered/unit/parser/test_inkling_renderer.py @@ -19,7 +19,7 @@ from sglang.srt.parser.inkling_tokenizer import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") def _text(value: str) -> list[int]: diff --git a/test/registered/unit/parser/test_jinja_template_utils.py b/test/registered/unit/parser/test_jinja_template_utils.py index 716e356cc..53dc78a61 100644 --- a/test/registered/unit/parser/test_jinja_template_utils.py +++ b/test/registered/unit/parser/test_jinja_template_utils.py @@ -11,7 +11,7 @@ from sglang.srt.utils import VideoData from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/parser/test_k2_v3_reasoning_parser.py b/test/registered/unit/parser/test_k2_v3_reasoning_parser.py index c0db21b13..2169dbfdb 100644 --- a/test/registered/unit/parser/test_k2_v3_reasoning_parser.py +++ b/test/registered/unit/parser/test_k2_v3_reasoning_parser.py @@ -8,7 +8,7 @@ from sglang.srt.parser.reasoning_parser import K2V3Detector, ReasoningParser from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestK2V3ReasoningParser(CustomTestCase): diff --git a/test/registered/unit/parser/test_kimik3_reasoning_parser.py b/test/registered/unit/parser/test_kimik3_reasoning_parser.py index bc69c83e1..d46516c6a 100644 --- a/test/registered/unit/parser/test_kimik3_reasoning_parser.py +++ b/test/registered/unit/parser/test_kimik3_reasoning_parser.py @@ -14,7 +14,7 @@ from sglang.srt.function_call.kimik3_format import ( from sglang.srt.parser.reasoning_parser import KimiK3Detector, ReasoningParser from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _stream(detector: KimiK3Detector, chunks: list[str]) -> tuple[str, str]: diff --git a/test/registered/unit/parser/test_reasoning_content_without_parser.py b/test/registered/unit/parser/test_reasoning_content_without_parser.py index c2c3fc6e6..ebb982276 100644 --- a/test/registered/unit/parser/test_reasoning_content_without_parser.py +++ b/test/registered/unit/parser/test_reasoning_content_without_parser.py @@ -4,7 +4,7 @@ from sglang.srt.parser.reasoning_parser import ReasoningParser from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") # Simulated model output that contains think tags (e.g. from DeepSeek-R1) diff --git a/test/registered/unit/parser/test_reasoning_parser.py b/test/registered/unit/parser/test_reasoning_parser.py index e67f85c6b..a23935c69 100644 --- a/test/registered/unit/parser/test_reasoning_parser.py +++ b/test/registered/unit/parser/test_reasoning_parser.py @@ -22,7 +22,7 @@ from sglang.srt.parser.reasoning_parser import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestBaseReasoningFormatDetector(CustomTestCase): diff --git a/test/registered/unit/platforms/test_platform_interface.py b/test/registered/unit/platforms/test_platform_interface.py index c7fea8d27..35b1458df 100644 --- a/test/registered/unit/platforms/test_platform_interface.py +++ b/test/registered/unit/platforms/test_platform_interface.py @@ -24,7 +24,7 @@ from sglang.srt.platforms.xpu import XpuSRTPlatform from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/plugins/test_hook_registry.py b/test/registered/unit/plugins/test_hook_registry.py index e898735e1..41eb4fb3a 100644 --- a/test/registered/unit/plugins/test_hook_registry.py +++ b/test/registered/unit/plugins/test_hook_registry.py @@ -16,7 +16,7 @@ from sglang.srt.plugins.hook_registry import HookRegistry, HookType, plugin_hook from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") # --------------------------------------------------------------------------- # Helpers: synthetic module creation diff --git a/test/registered/unit/plugins/test_load_plugins.py b/test/registered/unit/plugins/test_load_plugins.py index af4774b95..3b84f8893 100644 --- a/test/registered/unit/plugins/test_load_plugins.py +++ b/test/registered/unit/plugins/test_load_plugins.py @@ -19,7 +19,7 @@ from sglang.srt.plugins import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _make_ep(name, dist_name=None, load_fn=None): diff --git a/test/registered/unit/sampling/test_custom_logit_processor.py b/test/registered/unit/sampling/test_custom_logit_processor.py index e3c0e0a1b..843b36b55 100644 --- a/test/registered/unit/sampling/test_custom_logit_processor.py +++ b/test/registered/unit/sampling/test_custom_logit_processor.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") import json diff --git a/test/registered/unit/sampling/test_penaltylib.py b/test/registered/unit/sampling/test_penaltylib.py index e25144d2e..3638c62c9 100644 --- a/test/registered/unit/sampling/test_penaltylib.py +++ b/test/registered/unit/sampling/test_penaltylib.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") import unittest diff --git a/test/registered/unit/sampling/test_sampling_batch_info.py b/test/registered/unit/sampling/test_sampling_batch_info.py index 475171a09..886223c74 100644 --- a/test/registered/unit/sampling/test_sampling_batch_info.py +++ b/test/registered/unit/sampling/test_sampling_batch_info.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=24, suite="base-a-test-cpu") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") import unittest diff --git a/test/registered/unit/sampling/test_sampling_params.py b/test/registered/unit/sampling/test_sampling_params.py index d23ef24ed..7edb6f860 100644 --- a/test/registered/unit/sampling/test_sampling_params.py +++ b/test/registered/unit/sampling/test_sampling_params.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci, register_xpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") register_xpu_ci(est_time=10, suite="stage-a-test-1-gpu-xpu") diff --git a/test/registered/unit/scripted_runtime/test_background_http_poster.py b/test/registered/unit/scripted_runtime/test_background_http_poster.py index 3f592d6c5..344970e21 100644 --- a/test/registered/unit/scripted_runtime/test_background_http_poster.py +++ b/test/registered/unit/scripted_runtime/test_background_http_poster.py @@ -11,7 +11,7 @@ from sglang.test.scripted_runtime import background_http_poster as bg_poster from sglang.test.scripted_runtime.background_http_poster import BackgroundHttpPoster from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _FakeResponse: diff --git a/test/registered/unit/scripted_runtime/test_http_server.py b/test/registered/unit/scripted_runtime/test_http_server.py index 97c76056f..e7a1a872f 100644 --- a/test/registered/unit/scripted_runtime/test_http_server.py +++ b/test/registered/unit/scripted_runtime/test_http_server.py @@ -16,7 +16,7 @@ from sglang.test.scripted_runtime.io_struct import ( ) from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _sample_script(ctx, *args): diff --git a/test/registered/unit/scripted_runtime/test_scripted_runtime_utils.py b/test/registered/unit/scripted_runtime/test_scripted_runtime_utils.py index 68e3e42fa..820c42543 100644 --- a/test/registered/unit/scripted_runtime/test_scripted_runtime_utils.py +++ b/test/registered/unit/scripted_runtime/test_scripted_runtime_utils.py @@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.scripted_runtime.utils import ensure_script_importable, resolve_fn from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestResolveFn(CustomTestCase): diff --git a/test/registered/unit/scripted_runtime/test_tokenizer_recv_proxy.py b/test/registered/unit/scripted_runtime/test_tokenizer_recv_proxy.py index 4eb2ba124..26446d1e4 100644 --- a/test/registered/unit/scripted_runtime/test_tokenizer_recv_proxy.py +++ b/test/registered/unit/scripted_runtime/test_tokenizer_recv_proxy.py @@ -11,7 +11,7 @@ from sglang.test.scripted_runtime.tokenizer_recv_proxy import ( ) from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/server_args/test_model_config_reads_resolved_input.py b/test/registered/unit/server_args/test_model_config_reads_resolved_input.py index 8fbba755c..7e988c91c 100644 --- a/test/registered/unit/server_args/test_model_config_reads_resolved_input.py +++ b/test/registered/unit/server_args/test_model_config_reads_resolved_input.py @@ -21,7 +21,7 @@ import sglang from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=17, suite="base-a-test-cpu") _SRT = pathlib.Path(sglang.__file__).resolve().parent / "srt" diff --git a/test/registered/unit/server_args/test_model_source_paths.py b/test/registered/unit/server_args/test_model_source_paths.py index f950de003..ef128727e 100644 --- a/test/registered/unit/server_args/test_model_source_paths.py +++ b/test/registered/unit/server_args/test_model_source_paths.py @@ -24,7 +24,7 @@ the model-configuration cache notices. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import json import os diff --git a/test/registered/unit/server_args/test_no_public_non_field_slot.py b/test/registered/unit/server_args/test_no_public_non_field_slot.py index 5fd2ca6da..8d4d9e33b 100644 --- a/test/registered/unit/server_args/test_no_public_non_field_slot.py +++ b/test/registered/unit/server_args/test_no_public_non_field_slot.py @@ -21,7 +21,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _self_written_attributes() -> set: diff --git a/test/registered/unit/server_args/test_page_major_backend_allowlist.py b/test/registered/unit/server_args/test_page_major_backend_allowlist.py index 94e80282a..bacd79616 100644 --- a/test/registered/unit/server_args/test_page_major_backend_allowlist.py +++ b/test/registered/unit/server_args/test_page_major_backend_allowlist.py @@ -36,7 +36,7 @@ from sglang.srt.configs.model_config import AttentionArch from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") def _accepts( diff --git a/test/registered/unit/server_args/test_record_holds_the_raw_input.py b/test/registered/unit/server_args/test_record_holds_the_raw_input.py index 219595a31..537592f89 100644 --- a/test/registered/unit/server_args/test_record_holds_the_raw_input.py +++ b/test/registered/unit/server_args/test_record_holds_the_raw_input.py @@ -19,7 +19,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") _MINI_CONFIG = { diff --git a/test/registered/unit/server_args/test_record_member_calls_resolve.py b/test/registered/unit/server_args/test_record_member_calls_resolve.py index 6f92ff217..238caa8c0 100644 --- a/test/registered/unit/server_args/test_record_member_calls_resolve.py +++ b/test/registered/unit/server_args/test_record_member_calls_resolve.py @@ -18,7 +18,7 @@ the other record ratchets also record. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=19, suite="base-a-test-cpu") import ast import dataclasses diff --git a/test/registered/unit/server_args/test_resolution_declarations.py b/test/registered/unit/server_args/test_resolution_declarations.py index 6eaaf7170..6262cb99b 100644 --- a/test/registered/unit/server_args/test_resolution_declarations.py +++ b/test/registered/unit/server_args/test_resolution_declarations.py @@ -29,7 +29,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=26, suite="base-a-test-cpu") _SRT = pathlib.Path(sglang.__file__).resolve().parent / "srt" diff --git a/test/registered/unit/server_args/test_resolution_is_reproducible.py b/test/registered/unit/server_args/test_resolution_is_reproducible.py index 4aa1acdc1..2b791107c 100644 --- a/test/registered/unit/server_args/test_resolution_is_reproducible.py +++ b/test/registered/unit/server_args/test_resolution_is_reproducible.py @@ -47,13 +47,13 @@ from sglang.test.ci.ci_register import ( ) from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=104, suite="base-a-test-cpu") # Also on a GPU runner: the resolution branches that matter most (backend # defaults, DeepSeek handlers, capability gates) go through `is_cuda()` / # `is_hip()` / device capability, which inspect the actual hardware -- passing # device="cuda" on a CPU box does not reach them, so a leak confined to a GPU # handler would never fail the CPU registration alone. -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=78, stage="base-b", runner_config="1-gpu-small") # ROCm too: `is_hip()` gates its own set of backend and DeepSeek handlers, which # neither the CPU suite nor a CUDA runner reaches. register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/server_args/test_resolution_reads_no_bag.py b/test/registered/unit/server_args/test_resolution_reads_no_bag.py index bdcb053a9..6929784d0 100644 --- a/test/registered/unit/server_args/test_resolution_reads_no_bag.py +++ b/test/registered/unit/server_args/test_resolution_reads_no_bag.py @@ -37,7 +37,7 @@ import sglang from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=22, suite="base-a-test-cpu") _SRT = pathlib.Path(sglang.__file__).resolve().parent / "srt" diff --git a/test/registered/unit/server_args/test_resolution_reads_the_declarations.py b/test/registered/unit/server_args/test_resolution_reads_the_declarations.py index 5ebb8eea6..3f3c78d64 100644 --- a/test/registered/unit/server_args/test_resolution_reads_the_declarations.py +++ b/test/registered/unit/server_args/test_resolution_reads_the_declarations.py @@ -31,7 +31,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=45, suite="base-a-test-cpu") _SRT = pathlib.Path(sglang.__file__).resolve().parent / "srt" _FIELDS = frozenset(field.name for field in dataclasses.fields(ServerArgs)) diff --git a/test/registered/unit/server_args/test_server_args.py b/test/registered/unit/server_args/test_server_args.py index 5aaedbbb1..729cf6cba 100644 --- a/test/registered/unit/server_args/test_server_args.py +++ b/test/registered/unit/server_args/test_server_args.py @@ -94,7 +94,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=14, suite="base-a-test-cpu") register_cpu_ci(est_time=11, suite="stage-b-test-cpu-intel") # Mock get_device() so all tests run on CPU-only CI runners diff --git a/test/registered/unit/server_args/test_unified_prefill_cuda_graph_gate.py b/test/registered/unit/server_args/test_unified_prefill_cuda_graph_gate.py index 3f950fe6e..0cde03f33 100644 --- a/test/registered/unit/server_args/test_unified_prefill_cuda_graph_gate.py +++ b/test/registered/unit/server_args/test_unified_prefill_cuda_graph_gate.py @@ -38,7 +38,7 @@ from sglang.srt.model_executor.cuda_graph_config import Backend from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _run_handler(*, prefill_backend, explicit): diff --git a/test/registered/unit/spec/test_adaptive_runtime_state.py b/test/registered/unit/spec/test_adaptive_runtime_state.py index 5d7891395..2cc15d89e 100644 --- a/test/registered/unit/spec/test_adaptive_runtime_state.py +++ b/test/registered/unit/spec/test_adaptive_runtime_state.py @@ -6,7 +6,7 @@ from sglang.srt.speculative.adaptive_runtime_state import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") def _make_state(steps: int) -> SpecRuntimeState: diff --git a/test/registered/unit/spec/test_decode_bookkeeping_ownership.py b/test/registered/unit/spec/test_decode_bookkeeping_ownership.py index a7e70a0b2..cea26addd 100644 --- a/test/registered/unit/spec/test_decode_bookkeeping_ownership.py +++ b/test/registered/unit/spec/test_decode_bookkeeping_ownership.py @@ -20,7 +20,7 @@ from pathlib import Path from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=22, suite="base-a-test-cpu") _REPO_ROOT = Path(__file__).resolve().parents[4] _SRT_DIR = _REPO_ROOT / "python" / "sglang" / "srt" diff --git a/test/registered/unit/spec/test_decoupled_spec_io.py b/test/registered/unit/spec/test_decoupled_spec_io.py index 8a7c81839..388a76a4d 100644 --- a/test/registered/unit/spec/test_decoupled_spec_io.py +++ b/test/registered/unit/spec/test_decoupled_spec_io.py @@ -24,7 +24,7 @@ from sglang.srt.speculative.decoupled_spec_io import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _commit(rid, *, pre, tokens, src_verifier_rank=0, drafter_rank=0) -> VerifyCommit: diff --git a/test/registered/unit/spec/test_dflash_extra_buffer_lazy.py b/test/registered/unit/spec/test_dflash_extra_buffer_lazy.py index d5ea7e7fc..2a7d73f71 100644 --- a/test/registered/unit/spec/test_dflash_extra_buffer_lazy.py +++ b/test/registered/unit/spec/test_dflash_extra_buffer_lazy.py @@ -13,7 +13,7 @@ from sglang.srt.arg_groups.mamba_hook import validate_mamba_extra_buffer from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.srt.runtime_context import override_platform diff --git a/test/registered/unit/spec/test_dflash_logits.py b/test/registered/unit/spec/test_dflash_logits.py index ceb479095..821375e07 100644 --- a/test/registered/unit/spec/test_dflash_logits.py +++ b/test/registered/unit/spec/test_dflash_logits.py @@ -12,7 +12,7 @@ from sglang.srt.models.dflash import ( from sglang.srt.speculative.dflash_utils import parse_dflash_draft_config from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=35, suite="base-a-test-cpu") +register_cpu_ci(est_time=38, suite="base-a-test-cpu") def test_dflash_unary_logit_transform(): diff --git a/test/registered/unit/spec/test_dflash_overlap_hostsync.py b/test/registered/unit/spec/test_dflash_overlap_hostsync.py index c9545234a..809f3466a 100644 --- a/test/registered/unit/spec/test_dflash_overlap_hostsync.py +++ b/test/registered/unit/spec/test_dflash_overlap_hostsync.py @@ -12,7 +12,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-small") _HAS_CUDA = torch.cuda.is_available() diff --git a/test/registered/unit/spec/test_draft_construction_isolation.py b/test/registered/unit/spec/test_draft_construction_isolation.py index 5609009d9..bf0aedd93 100644 --- a/test/registered/unit/spec/test_draft_construction_isolation.py +++ b/test/registered/unit/spec/test_draft_construction_isolation.py @@ -23,7 +23,7 @@ from sglang.srt.runtime_context import get_context, get_flags, get_model, publis from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class _AlwaysDisables: diff --git a/test/registered/unit/spec/test_draft_per_runner_config.py b/test/registered/unit/spec/test_draft_per_runner_config.py index 29c7ce928..1936b84b6 100644 --- a/test/registered/unit/spec/test_draft_per_runner_config.py +++ b/test/registered/unit/spec/test_draft_per_runner_config.py @@ -26,7 +26,7 @@ from sglang.srt.runtime_context import get_context, get_model from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class _StopConstruction(Exception): diff --git a/test/registered/unit/spec/test_dspark_target_hidden_projection.py b/test/registered/unit/spec/test_dspark_target_hidden_projection.py index 3cc4c2089..ae00228ba 100644 --- a/test/registered/unit/spec/test_dspark_target_hidden_projection.py +++ b/test/registered/unit/spec/test_dspark_target_hidden_projection.py @@ -12,7 +12,7 @@ from sglang.srt.speculative.dspark_components.dspark_kv_inject import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _Attention: diff --git a/test/registered/unit/spec/test_eagle_draft_cuda_graph_runner.py b/test/registered/unit/spec/test_eagle_draft_cuda_graph_runner.py index 51e4e9722..827128217 100644 --- a/test/registered/unit/spec/test_eagle_draft_cuda_graph_runner.py +++ b/test/registered/unit/spec/test_eagle_draft_cuda_graph_runner.py @@ -25,7 +25,7 @@ from sglang.srt.speculative.eagle_draft_cuda_graph_runner import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") CAPTURE_BS = 4 SEQ_LEN_FILL_VALUE = 1 diff --git a/test/registered/unit/spec/test_eagle_draft_extend_logits.py b/test/registered/unit/spec/test_eagle_draft_extend_logits.py index 00193ca49..f02c6970c 100644 --- a/test/registered/unit/spec/test_eagle_draft_extend_logits.py +++ b/test/registered/unit/spec/test_eagle_draft_extend_logits.py @@ -10,7 +10,7 @@ from sglang.srt.model_executor.forward_batch_info import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestEagleDraftExtendLogitsPruning(unittest.TestCase): diff --git a/test/registered/unit/spec/test_eagle_seeded_coins.py b/test/registered/unit/spec/test_eagle_seeded_coins.py index a089ca456..69905f237 100644 --- a/test/registered/unit/spec/test_eagle_seeded_coins.py +++ b/test/registered/unit/spec/test_eagle_seeded_coins.py @@ -21,7 +21,7 @@ from sglang.srt.speculative.eagle_utils import _seeded_verify_coins, _verify_coi from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") DRAFT_TOKEN_NUM = 4 diff --git a/test/registered/unit/spec/test_eagle_worker_v2_topk1_fastpath.py b/test/registered/unit/spec/test_eagle_worker_v2_topk1_fastpath.py index ecdc0612d..a35ce3ee1 100644 --- a/test/registered/unit/spec/test_eagle_worker_v2_topk1_fastpath.py +++ b/test/registered/unit/spec/test_eagle_worker_v2_topk1_fastpath.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import CustomTestCase register_amd_ci(est_time=20, stage="stage-b", runner_config="1-gpu-small-amd") -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") DEVICE = "cuda" if torch.cuda.is_available() else "cpu" diff --git a/test/registered/unit/spec/test_fast_prefill_plan.py b/test/registered/unit/spec/test_fast_prefill_plan.py index 9b3c14267..6e772b30b 100644 --- a/test/registered/unit/spec/test_fast_prefill_plan.py +++ b/test/registered/unit/spec/test_fast_prefill_plan.py @@ -27,7 +27,7 @@ try: except ImportError: _HAS_FLASHINFER = False -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") # Draft-extend layout: constant qo (num_tokens_per_req per req), page_size 1. # Non-uniform seq_lens make cumsum non-trivial, so a wrong per-row kv split is diff --git a/test/registered/unit/spec/test_multi_layer_eagle_shared_read_event.py b/test/registered/unit/spec/test_multi_layer_eagle_shared_read_event.py index 18af593f8..63c82fab2 100644 --- a/test/registered/unit/spec/test_multi_layer_eagle_shared_read_event.py +++ b/test/registered/unit/spec/test_multi_layer_eagle_shared_read_event.py @@ -14,7 +14,7 @@ from sglang.srt.speculative.multi_layer_eagle_worker_v2 import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") RAW_BS = 2 RAW_NUM_TOKENS = 3 diff --git a/test/registered/unit/spec/test_ngram_corpus.py b/test/registered/unit/spec/test_ngram_corpus.py index 888788db7..5c0c45a05 100644 --- a/test/registered/unit/spec/test_ngram_corpus.py +++ b/test/registered/unit/spec/test_ngram_corpus.py @@ -13,7 +13,7 @@ from sglang.srt.speculative.cpp_ngram.ngram_corpus import NgramCorpus from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=26, suite="base-a-test-cpu") +register_cpu_ci(est_time=20, suite="base-a-test-cpu") def _make_corpus(match_type="BFS", **kwargs): diff --git a/test/registered/unit/spec/test_ngram_mamba_verify_update.py b/test/registered/unit/spec/test_ngram_mamba_verify_update.py index 78d408309..fe062eb25 100644 --- a/test/registered/unit/spec/test_ngram_mamba_verify_update.py +++ b/test/registered/unit/spec/test_ngram_mamba_verify_update.py @@ -7,7 +7,7 @@ import sglang.srt from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=23, suite="base-a-test-cpu") class TestNgramLastCorrectStepIndices(CustomTestCase): diff --git a/test/registered/unit/spec/test_plugin_hook_signatures.py b/test/registered/unit/spec/test_plugin_hook_signatures.py index 44bc4505b..65e0b4b84 100644 --- a/test/registered/unit/spec/test_plugin_hook_signatures.py +++ b/test/registered/unit/spec/test_plugin_hook_signatures.py @@ -25,7 +25,7 @@ from sglang.srt.speculative.spec_registry import CustomSpecAlgo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _dispatched_methods(): diff --git a/test/registered/unit/spec/test_resolve_swa_kv_pool.py b/test/registered/unit/spec/test_resolve_swa_kv_pool.py index c8147be3c..57e40d633 100644 --- a/test/registered/unit/spec/test_resolve_swa_kv_pool.py +++ b/test/registered/unit/spec/test_resolve_swa_kv_pool.py @@ -11,7 +11,7 @@ from sglang.srt.speculative.spec_info import SpeculativeAlgorithm from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=8, suite="stage-b-test-1-gpu-large-amd") _RESOLVERS = ( diff --git a/test/registered/unit/spec/test_spec_cpu_overlap_constraint.py b/test/registered/unit/spec/test_spec_cpu_overlap_constraint.py index dabc6e95a..88cf080c8 100644 --- a/test/registered/unit/spec/test_spec_cpu_overlap_constraint.py +++ b/test/registered/unit/spec/test_spec_cpu_overlap_constraint.py @@ -7,7 +7,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _make_spec_args(device: str, algorithm: str = "EAGLE", **overrides) -> ServerArgs: diff --git a/test/registered/unit/spec/test_spec_registry.py b/test/registered/unit/spec/test_spec_registry.py index 047a8b717..685c6ede1 100644 --- a/test/registered/unit/spec/test_spec_registry.py +++ b/test/registered/unit/spec/test_spec_registry.py @@ -16,7 +16,7 @@ from sglang.srt.speculative.spec_registry import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class _RegistryIsolated(CustomTestCase): diff --git a/test/registered/unit/spec/test_spec_utils_traverse_tree.py b/test/registered/unit/spec/test_spec_utils_traverse_tree.py index ac0ec087f..5061d0d43 100644 --- a/test/registered/unit/spec/test_spec_utils_traverse_tree.py +++ b/test/registered/unit/spec/test_spec_utils_traverse_tree.py @@ -14,7 +14,7 @@ import torch from sglang.srt.speculative.spec_utils import GrammarTree, traverse_tree from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestTraverseTreePassesIntsToGrammar(unittest.TestCase): diff --git a/test/registered/unit/spec/test_suffix_attention_merge_dispatch.py b/test/registered/unit/spec/test_suffix_attention_merge_dispatch.py index ff8958671..6631f9e34 100644 --- a/test/registered/unit/spec/test_suffix_attention_merge_dispatch.py +++ b/test/registered/unit/spec/test_suffix_attention_merge_dispatch.py @@ -11,7 +11,7 @@ from sglang.kernels.ops.attention.suffix_attention_merge import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestSuffixAttentionMergeDispatch(CustomTestCase): diff --git a/test/registered/unit/spec/test_uno_request_validation.py b/test/registered/unit/spec/test_uno_request_validation.py index 8e9b7fc97..3b7bc3123 100644 --- a/test/registered/unit/spec/test_uno_request_validation.py +++ b/test/registered/unit/spec/test_uno_request_validation.py @@ -7,7 +7,7 @@ from sglang.srt.speculative.uno_validation import validate_uno_request from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _make_request(**overrides): diff --git a/test/registered/unit/spec/test_uno_tree_config.py b/test/registered/unit/spec/test_uno_tree_config.py index 3434dd701..76cf4c4b2 100644 --- a/test/registered/unit/spec/test_uno_tree_config.py +++ b/test/registered/unit/spec/test_uno_tree_config.py @@ -8,7 +8,7 @@ from sglang.srt.arg_groups.speculative_hook import _handle_uno from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestUnoTreeConfig(CustomTestCase): diff --git a/test/registered/unit/spec/test_uno_tree_sparse_sampling.py b/test/registered/unit/spec/test_uno_tree_sparse_sampling.py index 0ba50cffc..e5c5314f6 100644 --- a/test/registered/unit/spec/test_uno_tree_sparse_sampling.py +++ b/test/registered/unit/spec/test_uno_tree_sparse_sampling.py @@ -13,7 +13,7 @@ from sglang.srt.speculative.uno_utils import sample_uno_tree_target_tokens from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestUnoTreeSparseSampling(CustomTestCase): diff --git a/test/registered/unit/state_capturer/test_routed_experts_scattered_a2a.py b/test/registered/unit/state_capturer/test_routed_experts_scattered_a2a.py index 898591ab2..c8e3654df 100644 --- a/test/registered/unit/state_capturer/test_routed_experts_scattered_a2a.py +++ b/test/registered/unit/state_capturer/test_routed_experts_scattered_a2a.py @@ -11,7 +11,7 @@ from sglang.srt.state_capturer import routed_experts as re_mod from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestScatteredA2ABackendHelper(CustomTestCase): diff --git a/test/registered/unit/test_bench_long_context.py b/test/registered/unit/test_bench_long_context.py index 0c8b81bde..0af59ca67 100644 --- a/test/registered/unit/test_bench_long_context.py +++ b/test/registered/unit/test_bench_long_context.py @@ -16,7 +16,7 @@ from unittest.mock import MagicMock, patch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") REPO_ROOT = Path(__file__).resolve().parents[3] HICACHE_DIR = REPO_ROOT / "benchmark" / "hicache" diff --git a/test/registered/unit/test_cache_hit_kit_metrics.py b/test/registered/unit/test_cache_hit_kit_metrics.py index 00d336515..d99509e04 100644 --- a/test/registered/unit/test_cache_hit_kit_metrics.py +++ b/test/registered/unit/test_cache_hit_kit_metrics.py @@ -12,7 +12,7 @@ from sglang.test.kits.cache_hit_kit import ( ) from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestCacheHitKitMetrics(CustomTestCase): diff --git a/test/registered/unit/test_chain_read_ratchet.py b/test/registered/unit/test_chain_read_ratchet.py index ffd179f3e..4eca0f836 100644 --- a/test/registered/unit/test_chain_read_ratchet.py +++ b/test/registered/unit/test_chain_read_ratchet.py @@ -25,7 +25,7 @@ import sglang from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=28, suite="base-a-test-cpu") _PACKAGE = pathlib.Path(sglang.__file__).resolve().parent _SRT = _PACKAGE / "srt" diff --git a/test/registered/unit/test_checkpoint_quantization.py b/test/registered/unit/test_checkpoint_quantization.py index 5b26d3083..5f6f1a473 100644 --- a/test/registered/unit/test_checkpoint_quantization.py +++ b/test/registered/unit/test_checkpoint_quantization.py @@ -13,7 +13,7 @@ from sglang.srt.model_loader.checkpoint_quantization import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestResolveCheckpointQuantSpec(CustomTestCase): diff --git a/test/registered/unit/test_context_accessor_shadowing.py b/test/registered/unit/test_context_accessor_shadowing.py index abb673342..af57f830e 100644 --- a/test/registered/unit/test_context_accessor_shadowing.py +++ b/test/registered/unit/test_context_accessor_shadowing.py @@ -23,7 +23,7 @@ import sglang from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=24, suite="base-a-test-cpu") _PACKAGE_ROOT = Path(next(iter(sglang.__path__))) _CONTEXT_MODULE = "sglang.srt.runtime_context" diff --git a/test/registered/unit/test_cuda_vmm_utils.py b/test/registered/unit/test_cuda_vmm_utils.py index fa4b16a2d..374432a71 100644 --- a/test/registered/unit/test_cuda_vmm_utils.py +++ b/test/registered/unit/test_cuda_vmm_utils.py @@ -37,7 +37,7 @@ from sglang.srt.utils.cuda_vmm_utils import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kernels.utils import multigpu_pytest_main -register_cuda_ci(est_time=60, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=15, stage="base-b", runner_config="2-gpu-large") _FABRIC = drv.CUmemAllocationHandleType.CU_MEM_HANDLE_TYPE_FABRIC _POSIX_FD = drv.CUmemAllocationHandleType.CU_MEM_HANDLE_TYPE_POSIX_FILE_DESCRIPTOR diff --git a/test/registered/unit/test_dead_server_args_parameter_ratchet.py b/test/registered/unit/test_dead_server_args_parameter_ratchet.py index 3428bbd7d..87eb59827 100644 --- a/test/registered/unit/test_dead_server_args_parameter_ratchet.py +++ b/test/registered/unit/test_dead_server_args_parameter_ratchet.py @@ -19,7 +19,7 @@ import sglang from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=14, suite="base-a-test-cpu") _PACKAGE_ROOT = pathlib.Path(next(iter(sglang.__path__))) diff --git a/test/registered/unit/test_dsa_tilelang_fp8_validation.py b/test/registered/unit/test_dsa_tilelang_fp8_validation.py index e31dd99c5..42ed533fc 100644 --- a/test/registered/unit/test_dsa_tilelang_fp8_validation.py +++ b/test/registered/unit/test_dsa_tilelang_fp8_validation.py @@ -11,7 +11,7 @@ from sglang.srt.arg_groups.overrides import _check_tilelang_dsa_fp8_kv from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestDsaTilelangFp8Validation(CustomTestCase): diff --git a/test/registered/unit/test_environ.py b/test/registered/unit/test_environ.py index 54ad9a00a..f75a37a9a 100644 --- a/test/registered/unit/test_environ.py +++ b/test/registered/unit/test_environ.py @@ -11,7 +11,7 @@ from contextlib import ExitStack from sglang.srt.environ import _DEPRECATED_ENVS, _DeprecatedEnv, envs from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") class TestEnvField(unittest.TestCase): diff --git a/test/registered/unit/test_eval_accuracy_kit_sgl_eval.py b/test/registered/unit/test_eval_accuracy_kit_sgl_eval.py index 65f19ff86..915466371 100644 --- a/test/registered/unit/test_eval_accuracy_kit_sgl_eval.py +++ b/test/registered/unit/test_eval_accuracy_kit_sgl_eval.py @@ -24,7 +24,7 @@ from sglang.test.kits import eval_accuracy_kit as kit from sglang.test.kits.eval_accuracy_kit import GPQAMixin, GSM8KMixin, MMMUProMixin from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") def _fake_get(url, *args, **kwargs): diff --git a/test/registered/unit/test_flashinfer_sparse_mla.py b/test/registered/unit/test_flashinfer_sparse_mla.py index d9817d606..1b72d9440 100644 --- a/test/registered/unit/test_flashinfer_sparse_mla.py +++ b/test/registered/unit/test_flashinfer_sparse_mla.py @@ -11,7 +11,7 @@ from sglang.kernels.ops.attention.flash_mla_sm120 import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") class TestFlashInferSparseMLAAdapter(unittest.TestCase): diff --git a/test/registered/unit/test_fork_test_worker.py b/test/registered/unit/test_fork_test_worker.py index 3e1f795d5..39d39d969 100644 --- a/test/registered/unit/test_fork_test_worker.py +++ b/test/registered/unit/test_fork_test_worker.py @@ -11,7 +11,7 @@ from sglang.test.ci import fork_test_worker from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") @unittest.skipUnless(hasattr(os, "fork"), "fork requires a POSIX platform") diff --git a/test/registered/unit/test_global_config_read_ratchet.py b/test/registered/unit/test_global_config_read_ratchet.py index 7e745f9f3..a623462bf 100644 --- a/test/registered/unit/test_global_config_read_ratchet.py +++ b/test/registered/unit/test_global_config_read_ratchet.py @@ -27,7 +27,7 @@ caller decided which instance to hand over. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=16, suite="base-a-test-cpu") import ast import unittest diff --git a/test/registered/unit/test_legacy_global_ratchet.py b/test/registered/unit/test_legacy_global_ratchet.py index 294d8844b..5b4f2d96f 100644 --- a/test/registered/unit/test_legacy_global_ratchet.py +++ b/test/registered/unit/test_legacy_global_ratchet.py @@ -11,7 +11,7 @@ to the new count. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import re import unittest diff --git a/test/registered/unit/test_model_override_split.py b/test/registered/unit/test_model_override_split.py index b5a4858f0..1e693e5b3 100644 --- a/test/registered/unit/test_model_override_split.py +++ b/test/registered/unit/test_model_override_split.py @@ -20,7 +20,7 @@ gives: two censuses of one thing that disagree are worse than either alone. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import ast import importlib.util diff --git a/test/registered/unit/test_model_overrides.py b/test/registered/unit/test_model_overrides.py index dc82825f1..5387fbb4c 100644 --- a/test/registered/unit/test_model_overrides.py +++ b/test/registered/unit/test_model_overrides.py @@ -3,7 +3,7 @@ gate, publish wiring, and the per-arch golden diffs for migrated families.""" from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import dataclasses import json diff --git a/test/registered/unit/test_module_state_ratchet.py b/test/registered/unit/test_module_state_ratchet.py index 43fb2e347..562df28fd 100644 --- a/test/registered/unit/test_module_state_ratchet.py +++ b/test/registered/unit/test_module_state_ratchet.py @@ -9,7 +9,7 @@ migrating one must shrink it, adding one fails the ratchet. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import ast import unittest diff --git a/test/registered/unit/test_parallel_adoption_ratchet.py b/test/registered/unit/test_parallel_adoption_ratchet.py index 172d104a6..73d601f16 100644 --- a/test/registered/unit/test_parallel_adoption_ratchet.py +++ b/test/registered/unit/test_parallel_adoption_ratchet.py @@ -10,7 +10,7 @@ one must remove it from there. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") import re import unittest diff --git a/test/registered/unit/test_platform_address_not_frozen.py b/test/registered/unit/test_platform_address_not_frozen.py index 06b0628dc..faef851d2 100644 --- a/test/registered/unit/test_platform_address_not_frozen.py +++ b/test/registered/unit/test_platform_address_not_frozen.py @@ -14,7 +14,7 @@ conversion is the reader asking at the point of decision. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") import ast import pathlib diff --git a/test/registered/unit/test_platform_context.py b/test/registered/unit/test_platform_context.py index 70003b954..201c2a438 100644 --- a/test/registered/unit/test_platform_context.py +++ b/test/registered/unit/test_platform_context.py @@ -16,7 +16,7 @@ from sglang.srt.utils import common as _common from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestPlatformContext(CustomTestCase): diff --git a/test/registered/unit/test_pre_publish_readers.py b/test/registered/unit/test_pre_publish_readers.py index 388e42b13..c87c419e8 100644 --- a/test/registered/unit/test_pre_publish_readers.py +++ b/test/registered/unit/test_pre_publish_readers.py @@ -19,7 +19,7 @@ been published. A conversion of any of them turns this red without a boot. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") import ast import logging diff --git a/test/registered/unit/test_precision_baseline_store.py b/test/registered/unit/test_precision_baseline_store.py index dc5584240..61210e755 100644 --- a/test/registered/unit/test_precision_baseline_store.py +++ b/test/registered/unit/test_precision_baseline_store.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") import json import os diff --git a/test/registered/unit/test_publish_precedes_bag_reads.py b/test/registered/unit/test_publish_precedes_bag_reads.py index 78ced6117..65695bc80 100644 --- a/test/registered/unit/test_publish_precedes_bag_reads.py +++ b/test/registered/unit/test_publish_precedes_bag_reads.py @@ -45,7 +45,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.config_publishers import publisher_names from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=40, suite="base-a-test-cpu") +register_cpu_ci(est_time=24, suite="base-a-test-cpu") _PACKAGE_ROOT = pathlib.Path(sglang.__file__).resolve().parent diff --git a/test/registered/unit/test_quantization_post_load.py b/test/registered/unit/test_quantization_post_load.py index c290d3923..11a7fc1c5 100644 --- a/test/registered/unit/test_quantization_post_load.py +++ b/test/registered/unit/test_quantization_post_load.py @@ -9,7 +9,7 @@ from sglang.srt.model_loader.loader import device_loading_context from sglang.srt.model_loader.post_load import stage_module_for_post_load from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") def _process_device() -> torch.device | None: diff --git a/test/registered/unit/test_ray_driver_reads_the_bags.py b/test/registered/unit/test_ray_driver_reads_the_bags.py index 5b412148e..fa6c18979 100644 --- a/test/registered/unit/test_ray_driver_reads_the_bags.py +++ b/test/registered/unit/test_ray_driver_reads_the_bags.py @@ -19,7 +19,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") # `sglang.srt.ray.engine` imports `ray` at module scope, and the CPU runner has # no ray wheel. The file-scoped source scan below is the part that has to run diff --git a/test/registered/unit/test_runai_utils.py b/test/registered/unit/test_runai_utils.py index f5a28129a..56c50b37e 100644 --- a/test/registered/unit/test_runai_utils.py +++ b/test/registered/unit/test_runai_utils.py @@ -5,7 +5,7 @@ from sglang.srt.utils.runai_utils import ObjectStorageModel, is_runai_obj_uri from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/test_runtime_context.py b/test/registered/unit/test_runtime_context.py index 9bb5a3250..5d2a6ba9d 100644 --- a/test/registered/unit/test_runtime_context.py +++ b/test/registered/unit/test_runtime_context.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=33, suite="base-a-test-cpu") import dataclasses import json diff --git a/test/registered/unit/test_runtime_context_config_bags.py b/test/registered/unit/test_runtime_context_config_bags.py index db90fb3a1..890d3c034 100644 --- a/test/registered/unit/test_runtime_context_config_bags.py +++ b/test/registered/unit/test_runtime_context_config_bags.py @@ -16,7 +16,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") @dataclasses.dataclass diff --git a/test/registered/unit/test_runtime_context_override.py b/test/registered/unit/test_runtime_context_override.py index ce7504e57..44e0e0a70 100644 --- a/test/registered/unit/test_runtime_context_override.py +++ b/test/registered/unit/test_runtime_context_override.py @@ -13,7 +13,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestContextOverride(CustomTestCase): diff --git a/test/registered/unit/test_server_args_cli_metadata.py b/test/registered/unit/test_server_args_cli_metadata.py index 1a8fba3b4..7d5abd984 100644 --- a/test/registered/unit/test_server_args_cli_metadata.py +++ b/test/registered/unit/test_server_args_cli_metadata.py @@ -11,7 +11,7 @@ from sglang.srt.utils.common import human_readable_int from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") MIGRATED_OPTIONS = frozenset( diff --git a/test/registered/unit/test_server_args_mutation_ratchet.py b/test/registered/unit/test_server_args_mutation_ratchet.py index 123f80520..06828d9e2 100644 --- a/test/registered/unit/test_server_args_mutation_ratchet.py +++ b/test/registered/unit/test_server_args_mutation_ratchet.py @@ -15,7 +15,7 @@ resolution; this textual scan is what reaches the sites tests never execute. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") import re import unittest diff --git a/test/registered/unit/test_server_args_namespaces.py b/test/registered/unit/test_server_args_namespaces.py index 601758447..2e575eada 100644 --- a/test/registered/unit/test_server_args_namespaces.py +++ b/test/registered/unit/test_server_args_namespaces.py @@ -14,7 +14,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=31, suite="base-a-test-cpu") # Locked taxonomy (global_context/11-server-args-namespace-split.md). VALID_NAMESPACES = { diff --git a/test/registered/unit/test_server_args_no_instance_mutation_entry.py b/test/registered/unit/test_server_args_no_instance_mutation_entry.py index ea6ce5cd3..15153c77a 100644 --- a/test/registered/unit/test_server_args_no_instance_mutation_entry.py +++ b/test/registered/unit/test_server_args_no_instance_mutation_entry.py @@ -17,7 +17,7 @@ what the LoRA normalization used — is invisible to it. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=15, suite="base-a-test-cpu") import re import unittest diff --git a/test/registered/unit/test_split_attention_backend_decisions.py b/test/registered/unit/test_split_attention_backend_decisions.py index 049d350cb..446432928 100644 --- a/test/registered/unit/test_split_attention_backend_decisions.py +++ b/test/registered/unit/test_split_attention_backend_decisions.py @@ -31,7 +31,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") import sglang from sglang.srt.arg_groups.overrides import attention_backends_of, resolved_view diff --git a/test/registered/unit/test_supplied_instance_exposure_ratchet.py b/test/registered/unit/test_supplied_instance_exposure_ratchet.py index 3805f54ad..6dd35993f 100644 --- a/test/registered/unit/test_supplied_instance_exposure_ratchet.py +++ b/test/registered/unit/test_supplied_instance_exposure_ratchet.py @@ -56,7 +56,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=23, suite="base-a-test-cpu") # Also on a CUDA runner: the written set is derived by resolving on the running # host, and `is_cuda()` / capability gates only open on real hardware. The pin # is split by host so both registrations stay exact: `_EXPOSED` is asserted @@ -68,7 +68,7 @@ register_cpu_ci(est_time=20, suite="base-a-test-cpu") # shift the exact sets in ways none of the pinning hosts can verify; the ROCm # resolution surface is covered by `test_resolution_is_reproducible.py` # instead, whose assertion is device-agnostic.) -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-small") _PACKAGE_ROOT = Path(next(iter(sglang.__path__))) / "srt" diff --git a/test/registered/unit/tokenizer/test_mistral_empty_assistant.py b/test/registered/unit/tokenizer/test_mistral_empty_assistant.py index fdcd7a8b7..287d24fc4 100644 --- a/test/registered/unit/tokenizer/test_mistral_empty_assistant.py +++ b/test/registered/unit/tokenizer/test_mistral_empty_assistant.py @@ -5,7 +5,7 @@ from sglang.srt.utils.hf_transformers.mistral_utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") def _user(text): diff --git a/test/registered/unit/tokenizer/test_tekken_tokenizer_routing.py b/test/registered/unit/tokenizer/test_tekken_tokenizer_routing.py index e96ce850d..8a96bfb54 100644 --- a/test/registered/unit/tokenizer/test_tekken_tokenizer_routing.py +++ b/test/registered/unit/tokenizer/test_tekken_tokenizer_routing.py @@ -8,7 +8,7 @@ import unittest from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=60, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") from sglang.srt.utils.hf_transformers.mistral_utils import is_bare_tekken_checkpoint from sglang.srt.utils.hf_transformers.tokenizer import get_tokenizer diff --git a/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py b/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py index 774647612..115d6dd5c 100644 --- a/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py +++ b/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py @@ -6,7 +6,7 @@ from unittest.mock import MagicMock, patch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") from sglang.srt.tokenizer.tiktoken_tokenizer import ( CONTROL_TOKEN_TEXTS, diff --git a/test/registered/unit/tools/test_amd_ci_install_dependency.py b/test/registered/unit/tools/test_amd_ci_install_dependency.py index 5e599ef7a..45b22fb70 100644 --- a/test/registered/unit/tools/test_amd_ci_install_dependency.py +++ b/test/registered/unit/tools/test_amd_ci_install_dependency.py @@ -18,7 +18,7 @@ from pathlib import Path from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") INSTALL_SCRIPT = ( Path(__file__).resolve().parents[4] / "scripts/ci/amd/amd_ci_install_dependency.sh" diff --git a/test/registered/unit/tools/test_slash_command_handler.py b/test/registered/unit/tools/test_slash_command_handler.py index f9cdb51a7..86d6713ea 100644 --- a/test/registered/unit/tools/test_slash_command_handler.py +++ b/test/registered/unit/tools/test_slash_command_handler.py @@ -13,7 +13,7 @@ from unittest.mock import patch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _REPO_ROOT = Path(__file__).resolve().parents[4] _HANDLER_PATH = _REPO_ROOT / "scripts/ci/utils/slash_command_handler.py" diff --git a/test/registered/unit/utils/test_common.py b/test/registered/unit/utils/test_common.py index f7a1209ea..f93a65ecd 100644 --- a/test/registered/unit/utils/test_common.py +++ b/test/registered/unit/utils/test_common.py @@ -11,7 +11,7 @@ from sglang.srt.utils.common import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=5, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/unit/utils/test_diffusion_torch_fallback.py b/test/registered/unit/utils/test_diffusion_torch_fallback.py index c9a567b38..f4325b3fd 100644 --- a/test/registered/unit/utils/test_diffusion_torch_fallback.py +++ b/test/registered/unit/utils/test_diffusion_torch_fallback.py @@ -13,7 +13,7 @@ from sglang.kernels.ops.diffusion.common.fallback_torch import ( ) from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") register_cpu_ci(est_time=1, suite="stage-a-test-cpu-intel") register_cpu_ci(est_time=1, suite="base-b-test-cpu-arm64") register_mlx_ci(est_time=1, suite="stage-a-unit-test-mlx") diff --git a/test/registered/unit/utils/test_field_validators.py b/test/registered/unit/utils/test_field_validators.py index 024e3d606..619586c63 100644 --- a/test/registered/unit/utils/test_field_validators.py +++ b/test/registered/unit/utils/test_field_validators.py @@ -7,7 +7,7 @@ from sglang.srt.utils.field_validators import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestValidateListI64_1d(CustomTestCase): diff --git a/test/registered/unit/utils/test_hf_transformers.py b/test/registered/unit/utils/test_hf_transformers.py index 7f7f1e5ca..92cc43cc3 100644 --- a/test/registered/unit/utils/test_hf_transformers.py +++ b/test/registered/unit/utils/test_hf_transformers.py @@ -31,7 +31,7 @@ from sglang.srt.utils.hf_transformers.tokenizer import _fix_special_tokens_patte from sglang.srt.utils.hf_transformers_patches import normalize_rope_scaling_compat from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/utils/test_hf_transformers_fastokens.py b/test/registered/unit/utils/test_hf_transformers_fastokens.py index 0b8017833..07dedb047 100644 --- a/test/registered/unit/utils/test_hf_transformers_fastokens.py +++ b/test/registered/unit/utils/test_hf_transformers_fastokens.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( TOKENIZER_MODEL = DEFAULT_SMALL_MODEL_NAME_FOR_TEST_QWEN -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=14, suite="base-a-test-cpu") try: diff --git a/test/registered/unit/utils/test_invariants.py b/test/registered/unit/utils/test_invariants.py index a54fa5758..623233d94 100644 --- a/test/registered/unit/utils/test_invariants.py +++ b/test/registered/unit/utils/test_invariants.py @@ -22,7 +22,7 @@ from sglang.srt.utils.invariants import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") # "test." namespace so the coverage meta-test isolates these from real invariants. diff --git a/test/registered/unit/utils/test_json_response.py b/test/registered/unit/utils/test_json_response.py index 55c310945..70aac292c 100644 --- a/test/registered/unit/utils/test_json_response.py +++ b/test/registered/unit/utils/test_json_response.py @@ -10,7 +10,7 @@ from sglang.srt.utils.json_response import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/utils/test_profile_merger.py b/test/registered/unit/utils/test_profile_merger.py index 7df24afe9..b8fcf87d0 100644 --- a/test/registered/unit/utils/test_profile_merger.py +++ b/test/registered/unit/utils/test_profile_merger.py @@ -18,7 +18,7 @@ from sglang.srt.utils.profile_merger import ProfileMerger from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestProfileMerger(CustomTestCase): diff --git a/test/registered/unit/utils/test_subprocess_watchdog.py b/test/registered/unit/utils/test_subprocess_watchdog.py index a893c1c75..cabae0756 100644 --- a/test/registered/unit/utils/test_subprocess_watchdog.py +++ b/test/registered/unit/utils/test_subprocess_watchdog.py @@ -24,7 +24,7 @@ from sglang.srt.utils.watchdog import SubprocessWatchdog from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=14, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/utils/test_torch_npu_patch_utils.py b/test/registered/unit/utils/test_torch_npu_patch_utils.py index 09f08df25..1f177a7ff 100644 --- a/test/registered/unit/utils/test_torch_npu_patch_utils.py +++ b/test/registered/unit/utils/test_torch_npu_patch_utils.py @@ -4,7 +4,7 @@ import unittest from sglang.srt.utils.torch_npu_patch_utils import apply_torch_npu_patches from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") class TestTorchNpuPatchUtils(unittest.TestCase): diff --git a/test/registered/unit/utils/test_weight_checker.py b/test/registered/unit/utils/test_weight_checker.py index 8924e32e9..47c49eaa0 100644 --- a/test/registered/unit/utils/test_weight_checker.py +++ b/test/registered/unit/utils/test_weight_checker.py @@ -45,7 +45,7 @@ from sglang.srt.utils.weight_checker_comparator import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=30, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/utils/test_weight_checker_comparator.py b/test/registered/unit/utils/test_weight_checker_comparator.py index 5b59c75e7..5eeb0dcaa 100644 --- a/test/registered/unit/utils/test_weight_checker_comparator.py +++ b/test/registered/unit/utils/test_weight_checker_comparator.py @@ -31,7 +31,7 @@ from sglang.srt.utils.weight_checker_comparator import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/utils/test_weight_versions.py b/test/registered/unit/utils/test_weight_versions.py index 6ccb928f8..8a1146b7b 100644 --- a/test/registered/unit/utils/test_weight_versions.py +++ b/test/registered/unit/utils/test_weight_versions.py @@ -17,7 +17,7 @@ from sglang.srt.utils.weight_versions import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") class _ReqStub: diff --git a/test/registered/utils/test_numa_utils.py b/test/registered/utils/test_numa_utils.py index 25d060d64..2ed40ca30 100644 --- a/test/registered/utils/test_numa_utils.py +++ b/test/registered/utils/test_numa_utils.py @@ -20,8 +20,8 @@ from sglang.srt.utils.numa_utils import ( from sglang.test.ci.ci_register import register_cpu_ci, register_cuda_ci register_cpu_ci(est_time=7, suite="base-a-test-cpu") -register_cuda_ci(est_time=10, stage="base-c", runner_config="4-gpu-gb300") -register_cuda_ci(est_time=10, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=7, stage="base-c", runner_config="4-gpu-gb300") +register_cuda_ci(est_time=6, stage="base-c", runner_config="4-gpu-b200") class TestIsNumaAvailable(unittest.TestCase): diff --git a/test/registered/utils/test_phase_checker.py b/test/registered/utils/test_phase_checker.py index d9658fdd9..9c9675a63 100644 --- a/test/registered/utils/test_phase_checker.py +++ b/test/registered/utils/test_phase_checker.py @@ -14,7 +14,7 @@ from sglang.srt.utils.phase_checker import SimplePhaseChecker from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=120, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/utils/test_socket_utils.py b/test/registered/utils/test_socket_utils.py index 7ba20ad18..6119b9a6d 100644 --- a/test/registered/utils/test_socket_utils.py +++ b/test/registered/utils/test_socket_utils.py @@ -15,7 +15,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase from sglang.utils import normalize_base_url, release_port, reserve_port -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/vlm/test_paddleocr_vl_server.py b/test/registered/vlm/test_paddleocr_vl_server.py index 83bfa14fd..8dcdb59c3 100644 --- a/test/registered/vlm/test_paddleocr_vl_server.py +++ b/test/registered/vlm/test_paddleocr_vl_server.py @@ -18,7 +18,7 @@ from PIL import Image, ImageDraw, ImageFont from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.vlm_utils import TestOpenAIMLLMServerBase -register_cuda_ci(est_time=240, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=63, stage="base-b", runner_config="1-gpu-large") class TestPaddleOCRVLServer(TestOpenAIMLLMServerBase): diff --git a/test/registered/vlm/test_rust_native_mm_e2e.py b/test/registered/vlm/test_rust_native_mm_e2e.py index 98f25a034..32dea3420 100644 --- a/test/registered/vlm/test_rust_native_mm_e2e.py +++ b/test/registered/vlm/test_rust_native_mm_e2e.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=600, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=43, stage="base-b", runner_config="1-gpu-large") IMAGE_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/man_ironing_on_back_of_suv.png" VISION_BLOCK = "<|vision_start|><|image_pad|><|vision_end|>" diff --git a/test/registered/vlm/test_rust_native_mm_mmmu.py b/test/registered/vlm/test_rust_native_mm_mmmu.py index fb92d8960..9d8ba7f0a 100644 --- a/test/registered/vlm/test_rust_native_mm_mmmu.py +++ b/test/registered/vlm/test_rust_native_mm_mmmu.py @@ -30,7 +30,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=900, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=126, stage="base-b", runner_config="1-gpu-large") MODEL = "Qwen/Qwen3.5-0.8B" VISION_BLOCK = "<|vision_start|><|image_pad|><|vision_end|>" diff --git a/test/registered/vlm/test_token_id_retokenize_e2e.py b/test/registered/vlm/test_token_id_retokenize_e2e.py index 8fa796927..af37df453 100644 --- a/test/registered/vlm/test_token_id_retokenize_e2e.py +++ b/test/registered/vlm/test_token_id_retokenize_e2e.py @@ -35,7 +35,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=300, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=92, stage="base-b", runner_config="1-gpu-large") register_cpu_ci(est_time=123, suite="stage-b-test-cpu-intel") diff --git a/test/registered/vlm/test_unlimited_ocr_server.py b/test/registered/vlm/test_unlimited_ocr_server.py index af20c0742..2cdc6afde 100644 --- a/test/registered/vlm/test_unlimited_ocr_server.py +++ b/test/registered/vlm/test_unlimited_ocr_server.py @@ -8,7 +8,7 @@ from PIL import Image, ImageDraw, ImageFont from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.vlm_utils import TestOpenAIMLLMServerBase -register_cuda_ci(est_time=240, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=63, stage="base-b", runner_config="1-gpu-large") class TestUnlimitedOCRServer(TestOpenAIMLLMServerBase): diff --git a/test/registered/vlm/test_vision_chunked_prefill.py b/test/registered/vlm/test_vision_chunked_prefill.py index ba8279e42..f2a46090a 100644 --- a/test/registered/vlm/test_vision_chunked_prefill.py +++ b/test/registered/vlm/test_vision_chunked_prefill.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=156, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=146, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=270, suite="stage-b-test-1-gpu-small-amd") """ Usage: diff --git a/test/registered/vlm/test_vision_openai_server_a.py b/test/registered/vlm/test_vision_openai_server_a.py index 948733380..531c97aa9 100644 --- a/test/registered/vlm/test_vision_openai_server_a.py +++ b/test/registered/vlm/test_vision_openai_server_a.py @@ -29,7 +29,7 @@ from sglang.test.vlm_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=560, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=578, stage="base-b", runner_config="1-gpu-large") # --- Qwen3-VL grounding regression (deepstack fusion) -------------------------- diff --git a/test/registered/vlm/test_vision_openai_server_extra.py b/test/registered/vlm/test_vision_openai_server_extra.py index 4ad28ce99..2e50ddbdc 100644 --- a/test/registered/vlm/test_vision_openai_server_extra.py +++ b/test/registered/vlm/test_vision_openai_server_extra.py @@ -6,7 +6,7 @@ import unittest from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.vlm_utils import OmniOpenAITestMixin -register_cuda_ci(est_time=180, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=159, stage="extra-a", runner_config="1-gpu-large") class TestQwen3OmniServer(OmniOpenAITestMixin): diff --git a/test/registered/vlm/test_vlm_input_format.py b/test/registered/vlm/test_vlm_input_format.py index d0b2f76c2..6b5a94b6c 100644 --- a/test/registered/vlm/test_vlm_input_format.py +++ b/test/registered/vlm/test_vlm_input_format.py @@ -39,7 +39,7 @@ from sglang.srt.utils.common import is_cuda, is_xpu from sglang.srt.utils.hf_transformers_utils import _fix_added_tokens_encoding from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=300, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=232, stage="base-b", runner_config="1-gpu-large") IMAGE_MAN_IRONING_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/man_ironing_on_back_of_suv.png" IMAGE_SGL_LOGO_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/sgl_logo.png" diff --git a/test/registered/vlm/test_vlm_tp4.py b/test/registered/vlm/test_vlm_tp4.py index 9f4fdc58d..34d051269 100644 --- a/test/registered/vlm/test_vlm_tp4.py +++ b/test/registered/vlm/test_vlm_tp4.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=133, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=136, stage="base-c", runner_config="4-gpu-h100") QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" MMMU_ACCURACY_THRESHOLD = 0.65