diff --git a/test/registered/4-gpu-models/test_nvidia_nemotron_3_super_nvfp4.py b/test/registered/4-gpu-models/test_nvidia_nemotron_3_super_nvfp4.py index 9855a70a8..f658b1b86 100644 --- a/test/registered/4-gpu-models/test_nvidia_nemotron_3_super_nvfp4.py +++ b/test/registered/4-gpu-models/test_nvidia_nemotron_3_super_nvfp4.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=600, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=290, suite="stage-c-test-4-gpu-b200") NEMOTRON_3_SUPER_NVFP4_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4" diff --git a/test/registered/4-gpu-models/test_qwen35_hicache.py b/test/registered/4-gpu-models/test_qwen35_hicache.py index fedf461d5..ac001ff32 100644 --- a/test/registered/4-gpu-models/test_qwen35_hicache.py +++ b/test/registered/4-gpu-models/test_qwen35_hicache.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=600, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=620, suite="stage-c-test-4-gpu-h100") QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" ACC_THRESHOLDS = {QWEN35_27B_MODEL: {"gsm8k": 0.8}} diff --git a/test/registered/4-gpu-models/test_qwen3_30b.py b/test/registered/4-gpu-models/test_qwen3_30b.py index 073723dda..1e7ebbe33 100644 --- a/test/registered/4-gpu-models/test_qwen3_30b.py +++ b/test/registered/4-gpu-models/test_qwen3_30b.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=300, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=150, suite="stage-c-test-4-gpu-h100") QWEN3_30B_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8" diff --git a/test/registered/4-gpu-models/test_qwen3_next_models.py b/test/registered/4-gpu-models/test_qwen3_next_models.py index b18c463b3..48b711dd7 100644 --- a/test/registered/4-gpu-models/test_qwen3_next_models.py +++ b/test/registered/4-gpu-models/test_qwen3_next_models.py @@ -6,7 +6,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=350, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=120, suite="stage-c-test-4-gpu-h100") QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct" diff --git a/test/registered/4-gpu-models/test_qwen3_next_models_mtp.py b/test/registered/4-gpu-models/test_qwen3_next_models_mtp.py index 4d04780e2..3be1ddd0c 100644 --- a/test/registered/4-gpu-models/test_qwen3_next_models_mtp.py +++ b/test/registered/4-gpu-models/test_qwen3_next_models_mtp.py @@ -7,7 +7,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=500, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=430, suite="stage-c-test-4-gpu-h100") QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct" diff --git a/test/registered/8-gpu-models/test_deepseek_v3_mtp.py b/test/registered/8-gpu-models/test_deepseek_v3_mtp.py index 48e0847ac..e90cd4fb0 100644 --- a/test/registered/8-gpu-models/test_deepseek_v3_mtp.py +++ b/test/registered/8-gpu-models/test_deepseek_v3_mtp.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=275, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=240, suite="stage-c-test-8-gpu-h200") FULL_DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324" diff --git a/test/registered/8-gpu-models/test_dsa_models_basic.py b/test/registered/8-gpu-models/test_dsa_models_basic.py index b2687df9f..3a7b405ea 100644 --- a/test/registered/8-gpu-models/test_dsa_models_basic.py +++ b/test/registered/8-gpu-models/test_dsa_models_basic.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=720, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=870, suite="stage-c-test-8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" GLM5_MODEL_PATH = "zai-org/GLM-5-FP8" diff --git a/test/registered/8-gpu-models/test_dsa_models_mtp.py b/test/registered/8-gpu-models/test_dsa_models_mtp.py index 11b311ba8..55457f9fd 100644 --- a/test/registered/8-gpu-models/test_dsa_models_mtp.py +++ b/test/registered/8-gpu-models/test_dsa_models_mtp.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=720, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=880, suite="stage-c-test-8-gpu-h200") FULL_DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" GLM5_MODEL_PATH = "zai-org/GLM-5-FP8" diff --git a/test/registered/8-gpu-models/test_mimo_models.py b/test/registered/8-gpu-models/test_mimo_models.py index a32fd3ac5..aa9da353e 100644 --- a/test/registered/8-gpu-models/test_mimo_models.py +++ b/test/registered/8-gpu-models/test_mimo_models.py @@ -5,7 +5,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.kits.spec_decoding_kit import SpecDecodingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=200, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=270, suite="stage-c-test-8-gpu-h200") class TestMiMoV2Flash(GSM8KMixin, SpecDecodingMixin, DefaultServerBase): diff --git a/test/registered/8-gpu-models/test_ring_2_5_1t.py b/test/registered/8-gpu-models/test_ring_2_5_1t.py index 29c64160c..f42fa29f3 100644 --- a/test/registered/8-gpu-models/test_ring_2_5_1t.py +++ b/test/registered/8-gpu-models/test_ring_2_5_1t.py @@ -5,7 +5,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.run_combined_tests import run_combined_tests from sglang.test.test_utils import ModelLaunchSettings -register_cuda_ci(est_time=1800, suite="nightly-8-gpu-common", nightly=True) +register_cuda_ci(est_time=510, suite="nightly-8-gpu-common", nightly=True) RING_2_5_1T_MODEL_PATH = "inclusionAI/Ring-2.5-1T" diff --git a/test/registered/attention/test_fa3.py b/test/registered/attention/test_fa3.py index 472a2099a..d0c48cfcd 100644 --- a/test/registered/attention/test_fa3.py +++ b/test/registered/attention/test_fa3.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( # FlashAttention3 integration tests (requires SM 90+ / H100) # Multiple test classes: FA3, FA3+MLA, FA3+SpecDecode variants -register_cuda_ci(est_time=300, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=390, suite="stage-b-test-1-gpu-large") GSM_DATASET_PATH = None diff --git a/test/registered/core/test_deterministic.py b/test/registered/core/test_deterministic.py index 6d205a369..956504929 100644 --- a/test/registered/core/test_deterministic.py +++ b/test/registered/core/test_deterministic.py @@ -16,7 +16,7 @@ from sglang.test.test_deterministic_utils import ( ) from sglang.test.test_utils import is_in_amd_ci -register_cuda_ci(est_time=278, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_gpt_oss_1gpu.py b/test/registered/core/test_gpt_oss_1gpu.py index 179c5e8f3..c208e8077 100644 --- a/test/registered/core/test_gpt_oss_1gpu.py +++ b/test/registered/core/test_gpt_oss_1gpu.py @@ -3,7 +3,7 @@ import unittest from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=519, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=420, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=750, suite="stage-b-test-1-gpu-small-amd-mi35x") diff --git a/test/registered/core/test_gpt_oss_sm120.py b/test/registered/core/test_gpt_oss_sm120.py index 8fc74a9d7..dcbe427e7 100644 --- a/test/registered/core/test_gpt_oss_sm120.py +++ b/test/registered/core/test_gpt_oss_sm120.py @@ -5,7 +5,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=500, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=330, suite="stage-b-test-1-gpu-small") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is not available") diff --git a/test/registered/distributed/test_disaggregation_different_tp.py b/test/registered/distributed/test_disaggregation_different_tp.py index 1bd1b5102..7ea78bfbf 100644 --- a/test/registered/distributed/test_disaggregation_different_tp.py +++ b/test/registered/distributed/test_disaggregation_different_tp.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=600, suite="stage-c-test-8-gpu-h20") +register_cuda_ci(est_time=330, suite="stage-c-test-8-gpu-h20") class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase): diff --git a/test/registered/distributed/test_disaggregation_dp_attention.py b/test/registered/distributed/test_disaggregation_dp_attention.py index ba88a48d7..b76cf1b18 100644 --- a/test/registered/distributed/test_disaggregation_dp_attention.py +++ b/test/registered/distributed/test_disaggregation_dp_attention.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=580, suite="stage-c-test-8-gpu-h20") +register_cuda_ci(est_time=400, suite="stage-c-test-8-gpu-h20") class TestDisaggregationDPAttention(PDDisaggregationServerBase): diff --git a/test/registered/distributed/test_disaggregation_hybrid_attention.py b/test/registered/distributed/test_disaggregation_hybrid_attention.py index 87eb64f2f..edbb177eb 100644 --- a/test/registered/distributed/test_disaggregation_hybrid_attention.py +++ b/test/registered/distributed/test_disaggregation_hybrid_attention.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_pd_server, ) -register_cuda_ci(est_time=500, suite="stage-c-test-8-gpu-h200") +register_cuda_ci(est_time=450, suite="stage-c-test-8-gpu-h200") @unittest.skipIf(is_in_ci(), "Temporarily disable the flaky test.") diff --git a/test/registered/distributed/test_dp_attention.py b/test/registered/distributed/test_dp_attention.py index 077a0327a..4767d4355 100644 --- a/test/registered/distributed/test_dp_attention.py +++ b/test/registered/distributed/test_dp_attention.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=350, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=450, suite="stage-b-test-2-gpu-large") class TestDPAttentionDP2TP2( diff --git a/test/registered/distributed/test_dp_attention_large.py b/test/registered/distributed/test_dp_attention_large.py index 3e1d65f74..57e3f24ce 100644 --- a/test/registered/distributed/test_dp_attention_large.py +++ b/test/registered/distributed/test_dp_attention_large.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=350, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=230, suite="stage-c-test-4-gpu-h100") register_amd_ci(est_time=350, suite="stage-c-test-4-gpu-amd") diff --git a/test/registered/distributed/test_pp_single_node.py b/test/registered/distributed/test_pp_single_node.py index 0dd5d4fe8..cfc26b638 100644 --- a/test/registered/distributed/test_pp_single_node.py +++ b/test/registered/distributed/test_pp_single_node.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import ( run_bench_one_batch_server, ) -register_cuda_ci(est_time=650, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=460, suite="stage-c-test-4-gpu-h100") register_amd_ci(est_time=650, suite="stage-c-test-4-gpu-amd") diff --git a/test/registered/dllm/test_llada2_mini.py b/test/registered/dllm/test_llada2_mini.py index 28588b0fb..b44a8ab5c 100644 --- a/test/registered/dllm/test_llada2_mini.py +++ b/test/registered/dllm/test_llada2_mini.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=181, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=110, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=330, suite="stage-b-test-1-gpu-small-amd") import unittest diff --git a/test/registered/ep/test_deepep_large.py b/test/registered/ep/test_deepep_large.py index a8bb9b8a0..11c18bab8 100644 --- a/test/registered/ep/test_deepep_large.py +++ b/test/registered/ep/test_deepep_large.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=563, suite="stage-c-test-deepep-8-gpu-h200") +register_cuda_ci(est_time=490, suite="stage-c-test-deepep-8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" diff --git a/test/registered/ep/test_deepep_small.py b/test/registered/ep/test_deepep_small.py index d89670528..01e92d0bd 100644 --- a/test/registered/ep/test_deepep_small.py +++ b/test/registered/ep/test_deepep_small.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=531, suite="stage-c-test-deepep-4-gpu-h100") +register_cuda_ci(est_time=430, suite="stage-c-test-deepep-4-gpu-h100") class TestPureDP(CustomTestCase): diff --git a/test/registered/ep/test_mooncake_ep_small.py b/test/registered/ep/test_mooncake_ep_small.py index 5ef70914c..37c618991 100644 --- a/test/registered/ep/test_mooncake_ep_small.py +++ b/test/registered/ep/test_mooncake_ep_small.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=200, suite="stage-c-test-deepep-4-gpu-h100") +register_cuda_ci(est_time=80, suite="stage-c-test-deepep-4-gpu-h100") ib_devices = get_rdma_devices_args() diff --git a/test/registered/hicache/test_hicache_storage_mooncake_backend.py b/test/registered/hicache/test_hicache_storage_mooncake_backend.py index 066f14cb8..5d928babd 100644 --- a/test/registered/hicache/test_hicache_storage_mooncake_backend.py +++ b/test/registered/hicache/test_hicache_storage_mooncake_backend.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( is_in_ci, ) -register_cuda_ci(est_time=300, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=230, suite="stage-b-test-2-gpu-large") class HiCacheStorageMooncakeBackendBaseMixin(HiCacheStorageBaseMixin): diff --git a/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py b/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py index ea5a6a861..3c9f07224 100644 --- a/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py +++ b/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py @@ -28,7 +28,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import wait_for_http_ready -register_cuda_ci(est_time=200, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=130, suite="stage-b-test-2-gpu-large") class TestHiCacheStorageRuntimeAttachDetach(CustomTestCase): diff --git a/test/registered/hicache/test_hicache_variants.py b/test/registered/hicache/test_hicache_variants.py index 89c9006a1..956d61d41 100644 --- a/test/registered/hicache/test_hicache_variants.py +++ b/test/registered/hicache/test_hicache_variants.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=524, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=410, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=524, suite="stage-b-test-1-gpu-small-amd") """ Consolidated HiCache variant tests. diff --git a/test/registered/mla/test_mla_int8_deepseek_v3.py b/test/registered/mla/test_mla_int8_deepseek_v3.py index 1faf4846e..1eb00dcce 100644 --- a/test/registered/mla/test_mla_int8_deepseek_v3.py +++ b/test/registered/mla/test_mla_int8_deepseek_v3.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( ) # DeepSeek-V3 INT8 quantization tests (channel and block INT8) -register_cuda_ci(est_time=341, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=290, suite="stage-b-test-1-gpu-large") class TestMLADeepseekV3ChannelInt8(CustomTestCase): diff --git a/test/registered/models/test_nvidia_nemotron_3_nano.py b/test/registered/models/test_nvidia_nemotron_3_nano.py index 1d26abd21..aba13bf7f 100644 --- a/test/registered/models/test_nvidia_nemotron_3_nano.py +++ b/test/registered/models/test_nvidia_nemotron_3_nano.py @@ -4,7 +4,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kits.lm_eval_kit import LMEvalMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=660, suite="stage-b-test-2-gpu-large") +register_cuda_ci(est_time=540, suite="stage-b-test-2-gpu-large") NEMOTRON_3_NANO_THINKING_ARGS = [ "--trust-remote-code", diff --git a/test/registered/models/test_transformers_backend_eval.py b/test/registered/models/test_transformers_backend_eval.py index 3b7f17364..16125aa57 100644 --- a/test/registered/models/test_transformers_backend_eval.py +++ b/test/registered/models/test_transformers_backend_eval.py @@ -7,7 +7,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.few_shot_gsm8k import run_eval from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=180, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small") class TestTransformersBackendEval(DefaultServerBase): diff --git a/test/registered/models/test_transformers_models.py b/test/registered/models/test_transformers_models.py index d14cde01d..39339f6de 100644 --- a/test/registered/models/test_transformers_models.py +++ b/test/registered/models/test_transformers_models.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=450, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=260, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=320, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/moe/test_torch_compile_moe.py b/test/registered/moe/test_torch_compile_moe.py index e62af0cb9..998ddc61c 100644 --- a/test/registered/moe/test_torch_compile_moe.py +++ b/test/registered/moe/test_torch_compile_moe.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=210, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=1400, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/basic/test_anthropic_server.py b/test/registered/openai_server/basic/test_anthropic_server.py index 2ea535f84..bdfb8b91f 100644 --- a/test/registered/openai_server/basic/test_anthropic_server.py +++ b/test/registered/openai_server/basic/test_anthropic_server.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/basic/test_http2_server.py b/test/registered/openai_server/basic/test_http2_server.py index 6cfc3ee7e..31c21304c 100644 --- a/test/registered/openai_server/basic/test_http2_server.py +++ b/test/registered/openai_server/basic/test_http2_server.py @@ -27,7 +27,7 @@ try: except ImportError: _HAS_GRANIAN = False -register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=50, suite="stage-b-test-1-gpu-small") @unittest.skipUnless(_HAS_GRANIAN, "granian not installed (pip install sglang[http2])") diff --git a/test/registered/openai_server/function_call/test_anthropic_tool_use.py b/test/registered/openai_server/function_call/test_anthropic_tool_use.py index 1653b216d..7904b0b39 100644 --- a/test/registered/openai_server/function_call/test_anthropic_tool_use.py +++ b/test/registered/openai_server/function_call/test_anthropic_tool_use.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=50, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd") # System message to guide Llama3.2 to produce proper tool call format diff --git a/test/registered/perf/test_bench_serving_1gpu_part1.py b/test/registered/perf/test_bench_serving_1gpu_part1.py index a6ca1d336..9e2778c57 100644 --- a/test/registered/perf/test_bench_serving_1gpu_part1.py +++ b/test/registered/perf/test_bench_serving_1gpu_part1.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=1000, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=1140, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/perf/test_vlm_perf_5090.py b/test/registered/perf/test_vlm_perf_5090.py index 8f7d4cd04..8802c75b3 100644 --- a/test/registered/perf/test_vlm_perf_5090.py +++ b/test/registered/perf/test_vlm_perf_5090.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=600, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=410, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=500, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/prefill_only/test_embedding_models.py b/test/registered/prefill_only/test_embedding_models.py index 3060ae304..bc8f48059 100644 --- a/test/registered/prefill_only/test_embedding_models.py +++ b/test/registered/prefill_only/test_embedding_models.py @@ -35,7 +35,7 @@ register_amd_ci( suite="stage-b-test-1-gpu-small-amd", disabled="see https://github.com/sgl-project/sglang/issues/11127", ) -register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=90, suite="stage-b-test-1-gpu-small") MODEL_TO_CONFIG = { "Alibaba-NLP/gte-Qwen2-1.5B-instruct": (1, 1e-5), diff --git a/test/registered/prefill_only/test_encoder_embedding_models.py b/test/registered/prefill_only/test_encoder_embedding_models.py index 115b26b2c..64d9c5dba 100644 --- a/test/registered/prefill_only/test_encoder_embedding_models.py +++ b/test/registered/prefill_only/test_encoder_embedding_models.py @@ -29,7 +29,7 @@ from sglang.test.test_utils import CustomTestCase, get_similarities, is_in_ci # python -m unittest test_encoder_embedding_models.TestEncoderEmbeddingModels.test_prefill_logits -register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=310, suite="stage-b-test-1-gpu-small") MODELS = [("BAAI/bge-small-en", 1, 1e-5), ("BAAI/bge-m3", 1, 1e-5)] diff --git a/test/registered/quant/test_awq.py b/test/registered/quant/test_awq.py index 06c860a63..c2a267652 100644 --- a/test/registered/quant/test_awq.py +++ b/test/registered/quant/test_awq.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=700, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=260, suite="stage-b-test-1-gpu-large") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/quant/test_deepseek_v32_fp4_4gpu.py b/test/registered/quant/test_deepseek_v32_fp4_4gpu.py index 19b0a1dba..f618d8332 100644 --- a/test/registered/quant/test_deepseek_v32_fp4_4gpu.py +++ b/test/registered/quant/test_deepseek_v32_fp4_4gpu.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=1200, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=530, suite="stage-c-test-4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/quant/test_deepseek_v32_fp4_mtp_4gpu.py b/test/registered/quant/test_deepseek_v32_fp4_mtp_4gpu.py index 32eeb9e9b..db2298423 100644 --- a/test/registered/quant/test_deepseek_v32_fp4_mtp_4gpu.py +++ b/test/registered/quant/test_deepseek_v32_fp4_mtp_4gpu.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=1200, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=610, suite="stage-c-test-4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/quant/test_deepseek_v3_fp4_4gpu.py b/test/registered/quant/test_deepseek_v3_fp4_4gpu.py index f54149952..3a9030cfd 100644 --- a/test/registered/quant/test_deepseek_v3_fp4_4gpu.py +++ b/test/registered/quant/test_deepseek_v3_fp4_4gpu.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=1200, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=450, suite="stage-c-test-4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/quant/test_fp8_blockwise_gemm.py b/test/registered/quant/test_fp8_blockwise_gemm.py index 30a04a1fc..a9602d94c 100644 --- a/test/registered/quant/test_fp8_blockwise_gemm.py +++ b/test/registered/quant/test_fp8_blockwise_gemm.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=420, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=400, suite="stage-c-test-4-gpu-b200") MODEL_PATH = "Qwen/Qwen3-4B-Instruct-2507-FP8" MXFP8_MODEL_PATH = "zianglih/Qwen3-4B-Instruct-2507-MXFP8" diff --git a/test/registered/quant/test_marlin_moe.py b/test/registered/quant/test_marlin_moe.py index 310e56196..9a043882f 100644 --- a/test/registered/quant/test_marlin_moe.py +++ b/test/registered/quant/test_marlin_moe.py @@ -12,7 +12,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_marlin_utils import awq_marlin_quantize, marlin_quantize from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=130, suite="stage-b-test-1-gpu-small") set_global_server_args_for_scheduler(object.__new__(ServerArgs)) diff --git a/test/registered/quant/test_nvfp4_gemm.py b/test/registered/quant/test_nvfp4_gemm.py index f784973c9..dacbb04b9 100644 --- a/test/registered/quant/test_nvfp4_gemm.py +++ b/test/registered/quant/test_nvfp4_gemm.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=360, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=300, suite="stage-c-test-4-gpu-b200") MODEL_PATH = "nvidia/Llama-3.1-8B-Instruct-NVFP4" diff --git a/test/registered/quant/test_quantization.py b/test/registered/quant/test_quantization.py index cdf0b0e61..083282b87 100644 --- a/test/registered/quant/test_quantization.py +++ b/test/registered/quant/test_quantization.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_results_to_json, ) -register_cuda_ci(est_time=370, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-large") MODEL_SCORE_THRESHOLDS = { # Baselines observed with gsm8k 5-shot concatenated format via chat API, diff --git a/test/registered/quant/test_torchao.py b/test/registered/quant/test_torchao.py index a53b929a6..16dc187a7 100644 --- a/test/registered/quant/test_torchao.py +++ b/test/registered/quant/test_torchao.py @@ -5,7 +5,7 @@ import requests from sglang import Engine from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=140, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=230, suite="stage-b-test-1-gpu-small-amd") from sglang.lang.chat_template import get_chat_template_by_model_path from sglang.srt.utils import kill_process_tree diff --git a/test/registered/quant/test_w4a8_deepseek_v3.py b/test/registered/quant/test_w4a8_deepseek_v3.py index f30e16d2a..72e717eb8 100644 --- a/test/registered/quant/test_w4a8_deepseek_v3.py +++ b/test/registered/quant/test_w4a8_deepseek_v3.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=520, suite="stage-c-test-8-gpu-h20") +register_cuda_ci(est_time=700, suite="stage-c-test-8-gpu-h20") class TestDeepseekV3W4afp8(CustomTestCase): diff --git a/test/registered/rl/test_update_weights_from_disk_mxfp8.py b/test/registered/rl/test_update_weights_from_disk_mxfp8.py index 504eb1f1d..a1111c138 100644 --- a/test/registered/rl/test_update_weights_from_disk_mxfp8.py +++ b/test/registered/rl/test_update_weights_from_disk_mxfp8.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=200, suite="stage-c-test-4-gpu-b200") +register_cuda_ci(est_time=100, suite="stage-c-test-4-gpu-b200") import unittest diff --git a/test/registered/sampling/test_pytorch_sampling_backend.py b/test/registered/sampling/test_pytorch_sampling_backend.py index 6abea3c3e..3b6df45f9 100644 --- a/test/registered/sampling/test_pytorch_sampling_backend.py +++ b/test/registered/sampling/test_pytorch_sampling_backend.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=150, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=80, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=66, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_chunked_prefill.py b/test/registered/scheduler/test_chunked_prefill.py index bc22976c3..a4257dedb 100644 --- a/test/registered/scheduler/test_chunked_prefill.py +++ b/test/registered/scheduler/test_chunked_prefill.py @@ -7,7 +7,7 @@ import unittest from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase, run_mmlu_test, run_mulit_request_test -register_cuda_ci(est_time=550, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=360, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=312, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_retract_decode.py b/test/registered/scheduler/test_retract_decode.py index 0628c97e4..42735b245 100644 --- a/test/registered/scheduler/test_retract_decode.py +++ b/test/registered/scheduler/test_retract_decode.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import is_in_ci -register_cuda_ci(est_time=550, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=470, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=600, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py b/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py index d1bce0c96..fe589679f 100644 --- a/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py +++ b/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=900, suite="stage-b-test-4-gpu-b200") +register_cuda_ci(est_time=240, suite="stage-b-test-4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/spec/eagle/test_eagle3_basic.py b/test/registered/spec/eagle/test_eagle3_basic.py index 4cf48afc1..2830228a3 100644 --- a/test/registered/spec/eagle/test_eagle3_basic.py +++ b/test/registered/spec/eagle/test_eagle3_basic.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( DEFAULT_TARGET_MODEL_EAGLE3, ) -register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small") +register_cuda_ci(est_time=160, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=50, suite="stage-b-test-1-gpu-small") _is_hip = is_hip() diff --git a/test/registered/spec/eagle/test_eagle_dp_attention.py b/test/registered/spec/eagle/test_eagle_dp_attention.py index dc20b3981..fe04bdb10 100644 --- a/test/registered/spec/eagle/test_eagle_dp_attention.py +++ b/test/registered/spec/eagle/test_eagle_dp_attention.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( ) # EAGLE3 with DP attention (tp=2, dp=2, requires 4 GPUs) -register_cuda_ci(est_time=200, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=100, suite="stage-c-test-4-gpu-h100") register_amd_ci(est_time=200, suite="stage-c-test-4-gpu-amd") diff --git a/test/registered/spec/eagle/test_eagle_infer_a.py b/test/registered/spec/eagle/test_eagle_infer_a.py index cecc2eb53..bce64a0c4 100644 --- a/test/registered/spec/eagle/test_eagle_infer_a.py +++ b/test/registered/spec/eagle/test_eagle_infer_a.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=450, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-large") class TestEAGLEEngine(CustomTestCase): diff --git a/test/registered/spec/eagle/test_eagle_infer_b.py b/test/registered/spec/eagle/test_eagle_infer_b.py index 7c726acfb..1585a4bcc 100644 --- a/test/registered/spec/eagle/test_eagle_infer_b.py +++ b/test/registered/spec/eagle/test_eagle_infer_b.py @@ -22,7 +22,7 @@ from sglang.test.run_eval import run_eval from sglang.test.server_fixtures.eagle_fixture import EagleServerBase from sglang.test.test_utils import DEFAULT_TARGET_MODEL_EAGLE, run_logprob_check -register_cuda_ci(est_time=600, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=690, suite="stage-b-test-1-gpu-large") class TestEAGLEServerBasic(EagleServerBase): diff --git a/test/registered/vlm/test_vision_openai_server_a.py b/test/registered/vlm/test_vision_openai_server_a.py index ec4ab28df..f64f7b8bc 100644 --- a/test/registered/vlm/test_vision_openai_server_a.py +++ b/test/registered/vlm/test_vision_openai_server_a.py @@ -19,7 +19,7 @@ from sglang.test.vlm_utils import ( VideoOpenAITestMixin, ) -register_cuda_ci(est_time=957, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=700, suite="stage-b-test-1-gpu-large") class TestLlavaServer(ImageOpenAITestMixin): diff --git a/test/registered/vlm/test_vlm_input_format.py b/test/registered/vlm/test_vlm_input_format.py index de5369d80..44af1e5d8 100644 --- a/test/registered/vlm/test_vlm_input_format.py +++ b/test/registered/vlm/test_vlm_input_format.py @@ -37,7 +37,7 @@ from sglang.srt.entrypoints.openai.protocol import ChatCompletionRequest from sglang.srt.parser.conversation import generate_chat_conv from sglang.srt.utils.hf_transformers_utils import _fix_added_tokens_encoding -register_cuda_ci(est_time=447, suite="stage-b-test-1-gpu-large") +register_cuda_ci(est_time=620, suite="stage-b-test-1-gpu-large") IMAGE_MAN_IRONING_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/man_ironing_on_back_of_suv.png" IMAGE_SGL_LOGO_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/sgl_logo.png" diff --git a/test/registered/vlm/test_vlm_tp4.py b/test/registered/vlm/test_vlm_tp4.py index d62df9b0b..6f1a12394 100644 --- a/test/registered/vlm/test_vlm_tp4.py +++ b/test/registered/vlm/test_vlm_tp4.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=200, suite="stage-c-test-4-gpu-h100") +register_cuda_ci(est_time=140, suite="stage-c-test-4-gpu-h100") QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" MMMU_ACCURACY_THRESHOLD = 0.65