[CI] Update est_time for 64 tests based on actual elapsed times (#22305)

Co-authored-by: Alison Shao <alison.shao@Mac.lan>
Co-authored-by: Alison Shao <alison.shao@MacBook-Pro-D2W773R9CD.local>
This commit is contained in:
Alison Shao
2026-04-09 20:31:37 -07:00
committed by GitHub
co-authored by Alison Shao Alison Shao
parent 89553ff82b
commit 45b0182205
61 changed files with 61 additions and 61 deletions
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=600, suite="stage-c-test-4-gpu-b200") register_cuda_ci(est_time=290, suite="stage-c-test-4-gpu-b200")
NEMOTRON_3_SUPER_NVFP4_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4" NEMOTRON_3_SUPER_NVFP4_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4"
@@ -18,7 +18,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=600, suite="stage-c-test-4-gpu-h100") register_cuda_ci(est_time=620, suite="stage-c-test-4-gpu-h100")
QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B"
ACC_THRESHOLDS = {QWEN35_27B_MODEL: {"gsm8k": 0.8}} ACC_THRESHOLDS = {QWEN35_27B_MODEL: {"gsm8k": 0.8}}
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=300, suite="stage-c-test-4-gpu-h100") register_cuda_ci(est_time=150, suite="stage-c-test-4-gpu-h100")
QWEN3_30B_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8" QWEN3_30B_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8"
@@ -6,7 +6,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin
from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin
from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.server_fixtures.default_fixture import DefaultServerBase
register_cuda_ci(est_time=350, suite="stage-c-test-4-gpu-h100") register_cuda_ci(est_time=120, suite="stage-c-test-4-gpu-h100")
QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct" QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct"
@@ -7,7 +7,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin
from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin
from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.server_fixtures.default_fixture import DefaultServerBase
register_cuda_ci(est_time=500, suite="stage-c-test-4-gpu-h100") register_cuda_ci(est_time=430, suite="stage-c-test-4-gpu-h100")
QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct" QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct"
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
write_github_step_summary, write_github_step_summary,
) )
register_cuda_ci(est_time=275, suite="stage-c-test-8-gpu-h200") register_cuda_ci(est_time=240, suite="stage-c-test-8-gpu-h200")
FULL_DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324" FULL_DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324"
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
write_github_step_summary, write_github_step_summary,
) )
register_cuda_ci(est_time=720, suite="stage-c-test-8-gpu-h200") register_cuda_ci(est_time=870, suite="stage-c-test-8-gpu-h200")
DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
GLM5_MODEL_PATH = "zai-org/GLM-5-FP8" GLM5_MODEL_PATH = "zai-org/GLM-5-FP8"
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
write_github_step_summary, write_github_step_summary,
) )
register_cuda_ci(est_time=720, suite="stage-c-test-8-gpu-h200") register_cuda_ci(est_time=880, suite="stage-c-test-8-gpu-h200")
FULL_DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" FULL_DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
GLM5_MODEL_PATH = "zai-org/GLM-5-FP8" GLM5_MODEL_PATH = "zai-org/GLM-5-FP8"
@@ -5,7 +5,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin
from sglang.test.kits.spec_decoding_kit import SpecDecodingMixin from sglang.test.kits.spec_decoding_kit import SpecDecodingMixin
from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.server_fixtures.default_fixture import DefaultServerBase
register_cuda_ci(est_time=200, suite="stage-c-test-8-gpu-h200") register_cuda_ci(est_time=270, suite="stage-c-test-8-gpu-h200")
class TestMiMoV2Flash(GSM8KMixin, SpecDecodingMixin, DefaultServerBase): class TestMiMoV2Flash(GSM8KMixin, SpecDecodingMixin, DefaultServerBase):
@@ -5,7 +5,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.run_combined_tests import run_combined_tests from sglang.test.run_combined_tests import run_combined_tests
from sglang.test.test_utils import ModelLaunchSettings from sglang.test.test_utils import ModelLaunchSettings
register_cuda_ci(est_time=1800, suite="nightly-8-gpu-common", nightly=True) register_cuda_ci(est_time=510, suite="nightly-8-gpu-common", nightly=True)
RING_2_5_1T_MODEL_PATH = "inclusionAI/Ring-2.5-1T" RING_2_5_1T_MODEL_PATH = "inclusionAI/Ring-2.5-1T"
+1 -1
View File
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
# FlashAttention3 integration tests (requires SM 90+ / H100) # FlashAttention3 integration tests (requires SM 90+ / H100)
# Multiple test classes: FA3, FA3+MLA, FA3+SpecDecode variants # Multiple test classes: FA3, FA3+MLA, FA3+SpecDecode variants
register_cuda_ci(est_time=300, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=390, suite="stage-b-test-1-gpu-large")
GSM_DATASET_PATH = None GSM_DATASET_PATH = None
+1 -1
View File
@@ -16,7 +16,7 @@ from sglang.test.test_deterministic_utils import (
) )
from sglang.test.test_utils import is_in_amd_ci from sglang.test.test_utils import is_in_amd_ci
register_cuda_ci(est_time=278, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd")
+1 -1
View File
@@ -3,7 +3,7 @@ import unittest
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.gpt_oss_common import BaseTestGptOss from sglang.test.gpt_oss_common import BaseTestGptOss
register_cuda_ci(est_time=519, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=420, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=750, suite="stage-b-test-1-gpu-small-amd-mi35x") register_amd_ci(est_time=750, suite="stage-b-test-1-gpu-small-amd-mi35x")
+1 -1
View File
@@ -5,7 +5,7 @@ import torch
from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.gpt_oss_common import BaseTestGptOss from sglang.test.gpt_oss_common import BaseTestGptOss
register_cuda_ci(est_time=500, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=330, suite="stage-b-test-1-gpu-small")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is not available") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is not available")
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
try_cached_model, try_cached_model,
) )
register_cuda_ci(est_time=600, suite="stage-c-test-8-gpu-h20") register_cuda_ci(est_time=330, suite="stage-c-test-8-gpu-h20")
class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase): class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase):
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
try_cached_model, try_cached_model,
) )
register_cuda_ci(est_time=580, suite="stage-c-test-8-gpu-h20") register_cuda_ci(est_time=400, suite="stage-c-test-8-gpu-h20")
class TestDisaggregationDPAttention(PDDisaggregationServerBase): class TestDisaggregationDPAttention(PDDisaggregationServerBase):
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
popen_launch_pd_server, popen_launch_pd_server,
) )
register_cuda_ci(est_time=500, suite="stage-c-test-8-gpu-h200") register_cuda_ci(est_time=450, suite="stage-c-test-8-gpu-h200")
@unittest.skipIf(is_in_ci(), "Temporarily disable the flaky test.") @unittest.skipIf(is_in_ci(), "Temporarily disable the flaky test.")
@@ -25,7 +25,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=350, suite="stage-b-test-2-gpu-large") register_cuda_ci(est_time=450, suite="stage-b-test-2-gpu-large")
class TestDPAttentionDP2TP2( class TestDPAttentionDP2TP2(
@@ -22,7 +22,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=350, suite="stage-c-test-4-gpu-h100") register_cuda_ci(est_time=230, suite="stage-c-test-4-gpu-h100")
register_amd_ci(est_time=350, suite="stage-c-test-4-gpu-amd") register_amd_ci(est_time=350, suite="stage-c-test-4-gpu-amd")
@@ -31,7 +31,7 @@ from sglang.test.test_utils import (
run_bench_one_batch_server, run_bench_one_batch_server,
) )
register_cuda_ci(est_time=650, suite="stage-c-test-4-gpu-h100") register_cuda_ci(est_time=460, suite="stage-c-test-4-gpu-h100")
register_amd_ci(est_time=650, suite="stage-c-test-4-gpu-amd") register_amd_ci(est_time=650, suite="stage-c-test-4-gpu-amd")
+1 -1
View File
@@ -1,6 +1,6 @@
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
register_cuda_ci(est_time=181, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=110, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=330, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=330, suite="stage-b-test-1-gpu-small-amd")
import unittest import unittest
+1 -1
View File
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=563, suite="stage-c-test-deepep-8-gpu-h200") register_cuda_ci(est_time=490, suite="stage-c-test-deepep-8-gpu-h200")
DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
+1 -1
View File
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=531, suite="stage-c-test-deepep-4-gpu-h100") register_cuda_ci(est_time=430, suite="stage-c-test-deepep-4-gpu-h100")
class TestPureDP(CustomTestCase): class TestPureDP(CustomTestCase):
+1 -1
View File
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=200, suite="stage-c-test-deepep-4-gpu-h100") register_cuda_ci(est_time=80, suite="stage-c-test-deepep-4-gpu-h100")
ib_devices = get_rdma_devices_args() ib_devices = get_rdma_devices_args()
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
is_in_ci, is_in_ci,
) )
register_cuda_ci(est_time=300, suite="stage-b-test-2-gpu-large") register_cuda_ci(est_time=230, suite="stage-b-test-2-gpu-large")
class HiCacheStorageMooncakeBackendBaseMixin(HiCacheStorageBaseMixin): class HiCacheStorageMooncakeBackendBaseMixin(HiCacheStorageBaseMixin):
@@ -28,7 +28,7 @@ from sglang.test.test_utils import (
) )
from sglang.utils import wait_for_http_ready from sglang.utils import wait_for_http_ready
register_cuda_ci(est_time=200, suite="stage-b-test-2-gpu-large") register_cuda_ci(est_time=130, suite="stage-b-test-2-gpu-large")
class TestHiCacheStorageRuntimeAttachDetach(CustomTestCase): class TestHiCacheStorageRuntimeAttachDetach(CustomTestCase):
@@ -1,6 +1,6 @@
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
register_cuda_ci(est_time=524, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=410, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=524, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=524, suite="stage-b-test-1-gpu-small-amd")
""" """
Consolidated HiCache variant tests. Consolidated HiCache variant tests.
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
) )
# DeepSeek-V3 INT8 quantization tests (channel and block INT8) # DeepSeek-V3 INT8 quantization tests (channel and block INT8)
register_cuda_ci(est_time=341, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=290, suite="stage-b-test-1-gpu-large")
class TestMLADeepseekV3ChannelInt8(CustomTestCase): class TestMLADeepseekV3ChannelInt8(CustomTestCase):
@@ -4,7 +4,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.kits.lm_eval_kit import LMEvalMixin from sglang.test.kits.lm_eval_kit import LMEvalMixin
from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.server_fixtures.default_fixture import DefaultServerBase
register_cuda_ci(est_time=660, suite="stage-b-test-2-gpu-large") register_cuda_ci(est_time=540, suite="stage-b-test-2-gpu-large")
NEMOTRON_3_NANO_THINKING_ARGS = [ NEMOTRON_3_NANO_THINKING_ARGS = [
"--trust-remote-code", "--trust-remote-code",
@@ -7,7 +7,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.few_shot_gsm8k import run_eval from sglang.test.few_shot_gsm8k import run_eval
from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.server_fixtures.default_fixture import DefaultServerBase
register_cuda_ci(est_time=180, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small")
class TestTransformersBackendEval(DefaultServerBase): class TestTransformersBackendEval(DefaultServerBase):
@@ -21,7 +21,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=450, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=260, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=320, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=320, suite="stage-b-test-1-gpu-small-amd")
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=210, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=1400, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=1400, suite="stage-b-test-1-gpu-small-amd")
@@ -31,7 +31,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd")
@@ -27,7 +27,7 @@ try:
except ImportError: except ImportError:
_HAS_GRANIAN = False _HAS_GRANIAN = False
register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=50, suite="stage-b-test-1-gpu-small")
@unittest.skipUnless(_HAS_GRANIAN, "granian not installed (pip install sglang[http2])") @unittest.skipUnless(_HAS_GRANIAN, "granian not installed (pip install sglang[http2])")
@@ -25,7 +25,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=50, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd")
# System message to guide Llama3.2 to produce proper tool call format # System message to guide Llama3.2 to produce proper tool call format
@@ -19,7 +19,7 @@ from sglang.test.test_utils import (
write_github_step_summary, write_github_step_summary,
) )
register_cuda_ci(est_time=1000, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=1140, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-large-amd")
+1 -1
View File
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
write_github_step_summary, write_github_step_summary,
) )
register_cuda_ci(est_time=600, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=410, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=500, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=500, suite="stage-b-test-1-gpu-small-amd")
@@ -35,7 +35,7 @@ register_amd_ci(
suite="stage-b-test-1-gpu-small-amd", suite="stage-b-test-1-gpu-small-amd",
disabled="see https://github.com/sgl-project/sglang/issues/11127", disabled="see https://github.com/sgl-project/sglang/issues/11127",
) )
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=90, suite="stage-b-test-1-gpu-small")
MODEL_TO_CONFIG = { MODEL_TO_CONFIG = {
"Alibaba-NLP/gte-Qwen2-1.5B-instruct": (1, 1e-5), "Alibaba-NLP/gte-Qwen2-1.5B-instruct": (1, 1e-5),
@@ -29,7 +29,7 @@ from sglang.test.test_utils import CustomTestCase, get_similarities, is_in_ci
# python -m unittest test_encoder_embedding_models.TestEncoderEmbeddingModels.test_prefill_logits # python -m unittest test_encoder_embedding_models.TestEncoderEmbeddingModels.test_prefill_logits
register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=310, suite="stage-b-test-1-gpu-small")
MODELS = [("BAAI/bge-small-en", 1, 1e-5), ("BAAI/bge-m3", 1, 1e-5)] MODELS = [("BAAI/bge-small-en", 1, 1e-5), ("BAAI/bge-m3", 1, 1e-5)]
+1 -1
View File
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=700, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=260, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-large-amd") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-large-amd")
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
write_github_step_summary, write_github_step_summary,
) )
register_cuda_ci(est_time=1200, suite="stage-c-test-4-gpu-b200") register_cuda_ci(est_time=530, suite="stage-c-test-4-gpu-b200")
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4" FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4"
SERVER_LAUNCH_TIMEOUT = 1200 SERVER_LAUNCH_TIMEOUT = 1200
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
write_github_step_summary, write_github_step_summary,
) )
register_cuda_ci(est_time=1200, suite="stage-c-test-4-gpu-b200") register_cuda_ci(est_time=610, suite="stage-c-test-4-gpu-b200")
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4" FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4"
SERVER_LAUNCH_TIMEOUT = 1200 SERVER_LAUNCH_TIMEOUT = 1200
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
write_github_step_summary, write_github_step_summary,
) )
register_cuda_ci(est_time=1200, suite="stage-c-test-4-gpu-b200") register_cuda_ci(est_time=450, suite="stage-c-test-4-gpu-b200")
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4"
SERVER_LAUNCH_TIMEOUT = 1200 SERVER_LAUNCH_TIMEOUT = 1200
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
try_cached_model, try_cached_model,
) )
register_cuda_ci(est_time=420, suite="stage-c-test-4-gpu-b200") register_cuda_ci(est_time=400, suite="stage-c-test-4-gpu-b200")
MODEL_PATH = "Qwen/Qwen3-4B-Instruct-2507-FP8" MODEL_PATH = "Qwen/Qwen3-4B-Instruct-2507-FP8"
MXFP8_MODEL_PATH = "zianglih/Qwen3-4B-Instruct-2507-MXFP8" MXFP8_MODEL_PATH = "zianglih/Qwen3-4B-Instruct-2507-MXFP8"
+1 -1
View File
@@ -12,7 +12,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.test_marlin_utils import awq_marlin_quantize, marlin_quantize from sglang.test.test_marlin_utils import awq_marlin_quantize, marlin_quantize
from sglang.test.test_utils import CustomTestCase from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=130, suite="stage-b-test-1-gpu-small")
set_global_server_args_for_scheduler(object.__new__(ServerArgs)) set_global_server_args_for_scheduler(object.__new__(ServerArgs))
+1 -1
View File
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
try_cached_model, try_cached_model,
) )
register_cuda_ci(est_time=360, suite="stage-c-test-4-gpu-b200") register_cuda_ci(est_time=300, suite="stage-c-test-4-gpu-b200")
MODEL_PATH = "nvidia/Llama-3.1-8B-Instruct-NVFP4" MODEL_PATH = "nvidia/Llama-3.1-8B-Instruct-NVFP4"
+1 -1
View File
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
write_results_to_json, write_results_to_json,
) )
register_cuda_ci(est_time=370, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-large")
MODEL_SCORE_THRESHOLDS = { MODEL_SCORE_THRESHOLDS = {
# Baselines observed with gsm8k 5-shot concatenated format via chat API, # Baselines observed with gsm8k 5-shot concatenated format via chat API,
+1 -1
View File
@@ -5,7 +5,7 @@ import requests
from sglang import Engine from sglang import Engine
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=140, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=230, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=230, suite="stage-b-test-1-gpu-small-amd")
from sglang.lang.chat_template import get_chat_template_by_model_path from sglang.lang.chat_template import get_chat_template_by_model_path
from sglang.srt.utils import kill_process_tree from sglang.srt.utils import kill_process_tree
@@ -19,7 +19,7 @@ from sglang.test.test_utils import (
write_github_step_summary, write_github_step_summary,
) )
register_cuda_ci(est_time=520, suite="stage-c-test-8-gpu-h20") register_cuda_ci(est_time=700, suite="stage-c-test-8-gpu-h20")
class TestDeepseekV3W4afp8(CustomTestCase): class TestDeepseekV3W4afp8(CustomTestCase):
@@ -1,6 +1,6 @@
from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=200, suite="stage-c-test-4-gpu-b200") register_cuda_ci(est_time=100, suite="stage-c-test-4-gpu-b200")
import unittest import unittest
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=150, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=80, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=66, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=66, suite="stage-b-test-1-gpu-small-amd")
@@ -7,7 +7,7 @@ import unittest
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import CustomTestCase, run_mmlu_test, run_mulit_request_test from sglang.test.test_utils import CustomTestCase, run_mmlu_test, run_mulit_request_test
register_cuda_ci(est_time=550, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=360, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=312, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=312, suite="stage-b-test-1-gpu-small-amd")
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
) )
from sglang.utils import is_in_ci from sglang.utils import is_in_ci
register_cuda_ci(est_time=550, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=470, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=600, suite="stage-b-test-1-gpu-small-amd") register_amd_ci(est_time=600, suite="stage-b-test-1-gpu-small-amd")
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
write_github_step_summary, write_github_step_summary,
) )
register_cuda_ci(est_time=900, suite="stage-b-test-4-gpu-b200") register_cuda_ci(est_time=240, suite="stage-b-test-4-gpu-b200")
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4"
SERVER_LAUNCH_TIMEOUT = 1200 SERVER_LAUNCH_TIMEOUT = 1200
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
DEFAULT_TARGET_MODEL_EAGLE3, DEFAULT_TARGET_MODEL_EAGLE3,
) )
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small") register_cuda_ci(est_time=160, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=50, suite="stage-b-test-1-gpu-small") register_amd_ci(est_time=50, suite="stage-b-test-1-gpu-small")
_is_hip = is_hip() _is_hip = is_hip()
@@ -21,7 +21,7 @@ from sglang.test.test_utils import (
) )
# EAGLE3 with DP attention (tp=2, dp=2, requires 4 GPUs) # EAGLE3 with DP attention (tp=2, dp=2, requires 4 GPUs)
register_cuda_ci(est_time=200, suite="stage-c-test-4-gpu-h100") register_cuda_ci(est_time=100, suite="stage-c-test-4-gpu-h100")
register_amd_ci(est_time=200, suite="stage-c-test-4-gpu-amd") register_amd_ci(est_time=200, suite="stage-c-test-4-gpu-amd")
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
CustomTestCase, CustomTestCase,
) )
register_cuda_ci(est_time=450, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-large")
class TestEAGLEEngine(CustomTestCase): class TestEAGLEEngine(CustomTestCase):
@@ -22,7 +22,7 @@ from sglang.test.run_eval import run_eval
from sglang.test.server_fixtures.eagle_fixture import EagleServerBase from sglang.test.server_fixtures.eagle_fixture import EagleServerBase
from sglang.test.test_utils import DEFAULT_TARGET_MODEL_EAGLE, run_logprob_check from sglang.test.test_utils import DEFAULT_TARGET_MODEL_EAGLE, run_logprob_check
register_cuda_ci(est_time=600, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=690, suite="stage-b-test-1-gpu-large")
class TestEAGLEServerBasic(EagleServerBase): class TestEAGLEServerBasic(EagleServerBase):
@@ -19,7 +19,7 @@ from sglang.test.vlm_utils import (
VideoOpenAITestMixin, VideoOpenAITestMixin,
) )
register_cuda_ci(est_time=957, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=700, suite="stage-b-test-1-gpu-large")
class TestLlavaServer(ImageOpenAITestMixin): class TestLlavaServer(ImageOpenAITestMixin):
+1 -1
View File
@@ -37,7 +37,7 @@ from sglang.srt.entrypoints.openai.protocol import ChatCompletionRequest
from sglang.srt.parser.conversation import generate_chat_conv from sglang.srt.parser.conversation import generate_chat_conv
from sglang.srt.utils.hf_transformers_utils import _fix_added_tokens_encoding from sglang.srt.utils.hf_transformers_utils import _fix_added_tokens_encoding
register_cuda_ci(est_time=447, suite="stage-b-test-1-gpu-large") register_cuda_ci(est_time=620, suite="stage-b-test-1-gpu-large")
IMAGE_MAN_IRONING_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/man_ironing_on_back_of_suv.png" IMAGE_MAN_IRONING_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/man_ironing_on_back_of_suv.png"
IMAGE_SGL_LOGO_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/sgl_logo.png" IMAGE_SGL_LOGO_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/sgl_logo.png"
+1 -1
View File
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
popen_launch_server, popen_launch_server,
) )
register_cuda_ci(est_time=200, suite="stage-c-test-4-gpu-h100") register_cuda_ci(est_time=140, suite="stage-c-test-4-gpu-h100")
QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B"
MMMU_ACCURACY_THRESHOLD = 0.65 MMMU_ACCURACY_THRESHOLD = 0.65