[CI] Update est_time for 64 tests based on actual elapsed times (#22305)
Co-authored-by: Alison Shao <alison.shao@Mac.lan> Co-authored-by: Alison Shao <alison.shao@MacBook-Pro-D2W773R9CD.local>
This commit is contained in:
co-authored by
Alison Shao
Alison Shao
parent
89553ff82b
commit
45b0182205
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=600, suite="stage-c-test-4-gpu-b200")
|
register_cuda_ci(est_time=290, suite="stage-c-test-4-gpu-b200")
|
||||||
|
|
||||||
NEMOTRON_3_SUPER_NVFP4_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4"
|
NEMOTRON_3_SUPER_NVFP4_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4"
|
||||||
|
|
||||||
|
|||||||
@@ -18,7 +18,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=600, suite="stage-c-test-4-gpu-h100")
|
register_cuda_ci(est_time=620, suite="stage-c-test-4-gpu-h100")
|
||||||
|
|
||||||
QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B"
|
QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B"
|
||||||
ACC_THRESHOLDS = {QWEN35_27B_MODEL: {"gsm8k": 0.8}}
|
ACC_THRESHOLDS = {QWEN35_27B_MODEL: {"gsm8k": 0.8}}
|
||||||
|
|||||||
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=300, suite="stage-c-test-4-gpu-h100")
|
register_cuda_ci(est_time=150, suite="stage-c-test-4-gpu-h100")
|
||||||
|
|
||||||
QWEN3_30B_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8"
|
QWEN3_30B_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8"
|
||||||
|
|
||||||
|
|||||||
@@ -6,7 +6,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin
|
|||||||
from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin
|
from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin
|
||||||
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
|
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
|
||||||
|
|
||||||
register_cuda_ci(est_time=350, suite="stage-c-test-4-gpu-h100")
|
register_cuda_ci(est_time=120, suite="stage-c-test-4-gpu-h100")
|
||||||
|
|
||||||
QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct"
|
QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct"
|
||||||
|
|
||||||
|
|||||||
@@ -7,7 +7,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin
|
|||||||
from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin
|
from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin
|
||||||
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
|
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
|
||||||
|
|
||||||
register_cuda_ci(est_time=500, suite="stage-c-test-4-gpu-h100")
|
register_cuda_ci(est_time=430, suite="stage-c-test-4-gpu-h100")
|
||||||
|
|
||||||
QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct"
|
QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct"
|
||||||
|
|
||||||
|
|||||||
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
|
|||||||
write_github_step_summary,
|
write_github_step_summary,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=275, suite="stage-c-test-8-gpu-h200")
|
register_cuda_ci(est_time=240, suite="stage-c-test-8-gpu-h200")
|
||||||
|
|
||||||
FULL_DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324"
|
FULL_DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324"
|
||||||
|
|
||||||
|
|||||||
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
|
|||||||
write_github_step_summary,
|
write_github_step_summary,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=720, suite="stage-c-test-8-gpu-h200")
|
register_cuda_ci(est_time=870, suite="stage-c-test-8-gpu-h200")
|
||||||
|
|
||||||
DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
|
DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
|
||||||
GLM5_MODEL_PATH = "zai-org/GLM-5-FP8"
|
GLM5_MODEL_PATH = "zai-org/GLM-5-FP8"
|
||||||
|
|||||||
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
|
|||||||
write_github_step_summary,
|
write_github_step_summary,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=720, suite="stage-c-test-8-gpu-h200")
|
register_cuda_ci(est_time=880, suite="stage-c-test-8-gpu-h200")
|
||||||
|
|
||||||
FULL_DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
|
FULL_DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
|
||||||
GLM5_MODEL_PATH = "zai-org/GLM-5-FP8"
|
GLM5_MODEL_PATH = "zai-org/GLM-5-FP8"
|
||||||
|
|||||||
@@ -5,7 +5,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin
|
|||||||
from sglang.test.kits.spec_decoding_kit import SpecDecodingMixin
|
from sglang.test.kits.spec_decoding_kit import SpecDecodingMixin
|
||||||
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
|
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
|
||||||
|
|
||||||
register_cuda_ci(est_time=200, suite="stage-c-test-8-gpu-h200")
|
register_cuda_ci(est_time=270, suite="stage-c-test-8-gpu-h200")
|
||||||
|
|
||||||
|
|
||||||
class TestMiMoV2Flash(GSM8KMixin, SpecDecodingMixin, DefaultServerBase):
|
class TestMiMoV2Flash(GSM8KMixin, SpecDecodingMixin, DefaultServerBase):
|
||||||
|
|||||||
@@ -5,7 +5,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
|
|||||||
from sglang.test.run_combined_tests import run_combined_tests
|
from sglang.test.run_combined_tests import run_combined_tests
|
||||||
from sglang.test.test_utils import ModelLaunchSettings
|
from sglang.test.test_utils import ModelLaunchSettings
|
||||||
|
|
||||||
register_cuda_ci(est_time=1800, suite="nightly-8-gpu-common", nightly=True)
|
register_cuda_ci(est_time=510, suite="nightly-8-gpu-common", nightly=True)
|
||||||
|
|
||||||
RING_2_5_1T_MODEL_PATH = "inclusionAI/Ring-2.5-1T"
|
RING_2_5_1T_MODEL_PATH = "inclusionAI/Ring-2.5-1T"
|
||||||
|
|
||||||
|
|||||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
|||||||
|
|
||||||
# FlashAttention3 integration tests (requires SM 90+ / H100)
|
# FlashAttention3 integration tests (requires SM 90+ / H100)
|
||||||
# Multiple test classes: FA3, FA3+MLA, FA3+SpecDecode variants
|
# Multiple test classes: FA3, FA3+MLA, FA3+SpecDecode variants
|
||||||
register_cuda_ci(est_time=300, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=390, suite="stage-b-test-1-gpu-large")
|
||||||
|
|
||||||
GSM_DATASET_PATH = None
|
GSM_DATASET_PATH = None
|
||||||
|
|
||||||
|
|||||||
@@ -16,7 +16,7 @@ from sglang.test.test_deterministic_utils import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import is_in_amd_ci
|
from sglang.test.test_utils import is_in_amd_ci
|
||||||
|
|
||||||
register_cuda_ci(est_time=278, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-large")
|
||||||
register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -3,7 +3,7 @@ import unittest
|
|||||||
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||||
from sglang.test.gpt_oss_common import BaseTestGptOss
|
from sglang.test.gpt_oss_common import BaseTestGptOss
|
||||||
|
|
||||||
register_cuda_ci(est_time=519, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=420, suite="stage-b-test-1-gpu-large")
|
||||||
register_amd_ci(est_time=750, suite="stage-b-test-1-gpu-small-amd-mi35x")
|
register_amd_ci(est_time=750, suite="stage-b-test-1-gpu-small-amd-mi35x")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -5,7 +5,7 @@ import torch
|
|||||||
from sglang.test.ci.ci_register import register_cuda_ci
|
from sglang.test.ci.ci_register import register_cuda_ci
|
||||||
from sglang.test.gpt_oss_common import BaseTestGptOss
|
from sglang.test.gpt_oss_common import BaseTestGptOss
|
||||||
|
|
||||||
register_cuda_ci(est_time=500, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=330, suite="stage-b-test-1-gpu-small")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is not available")
|
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is not available")
|
||||||
|
|||||||
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
|
|||||||
try_cached_model,
|
try_cached_model,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=600, suite="stage-c-test-8-gpu-h20")
|
register_cuda_ci(est_time=330, suite="stage-c-test-8-gpu-h20")
|
||||||
|
|
||||||
|
|
||||||
class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase):
|
class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase):
|
||||||
|
|||||||
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
|
|||||||
try_cached_model,
|
try_cached_model,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=580, suite="stage-c-test-8-gpu-h20")
|
register_cuda_ci(est_time=400, suite="stage-c-test-8-gpu-h20")
|
||||||
|
|
||||||
|
|
||||||
class TestDisaggregationDPAttention(PDDisaggregationServerBase):
|
class TestDisaggregationDPAttention(PDDisaggregationServerBase):
|
||||||
|
|||||||
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_pd_server,
|
popen_launch_pd_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=500, suite="stage-c-test-8-gpu-h200")
|
register_cuda_ci(est_time=450, suite="stage-c-test-8-gpu-h200")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(is_in_ci(), "Temporarily disable the flaky test.")
|
@unittest.skipIf(is_in_ci(), "Temporarily disable the flaky test.")
|
||||||
|
|||||||
@@ -25,7 +25,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=350, suite="stage-b-test-2-gpu-large")
|
register_cuda_ci(est_time=450, suite="stage-b-test-2-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class TestDPAttentionDP2TP2(
|
class TestDPAttentionDP2TP2(
|
||||||
|
|||||||
@@ -22,7 +22,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=350, suite="stage-c-test-4-gpu-h100")
|
register_cuda_ci(est_time=230, suite="stage-c-test-4-gpu-h100")
|
||||||
register_amd_ci(est_time=350, suite="stage-c-test-4-gpu-amd")
|
register_amd_ci(est_time=350, suite="stage-c-test-4-gpu-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -31,7 +31,7 @@ from sglang.test.test_utils import (
|
|||||||
run_bench_one_batch_server,
|
run_bench_one_batch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=650, suite="stage-c-test-4-gpu-h100")
|
register_cuda_ci(est_time=460, suite="stage-c-test-4-gpu-h100")
|
||||||
register_amd_ci(est_time=650, suite="stage-c-test-4-gpu-amd")
|
register_amd_ci(est_time=650, suite="stage-c-test-4-gpu-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -1,6 +1,6 @@
|
|||||||
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||||
|
|
||||||
register_cuda_ci(est_time=181, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=110, suite="stage-b-test-1-gpu-large")
|
||||||
register_amd_ci(est_time=330, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=330, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
import unittest
|
import unittest
|
||||||
|
|||||||
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=563, suite="stage-c-test-deepep-8-gpu-h200")
|
register_cuda_ci(est_time=490, suite="stage-c-test-deepep-8-gpu-h200")
|
||||||
|
|
||||||
DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
|
DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
|
||||||
|
|
||||||
|
|||||||
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=531, suite="stage-c-test-deepep-4-gpu-h100")
|
register_cuda_ci(est_time=430, suite="stage-c-test-deepep-4-gpu-h100")
|
||||||
|
|
||||||
|
|
||||||
class TestPureDP(CustomTestCase):
|
class TestPureDP(CustomTestCase):
|
||||||
|
|||||||
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=200, suite="stage-c-test-deepep-4-gpu-h100")
|
register_cuda_ci(est_time=80, suite="stage-c-test-deepep-4-gpu-h100")
|
||||||
|
|
||||||
ib_devices = get_rdma_devices_args()
|
ib_devices = get_rdma_devices_args()
|
||||||
|
|
||||||
|
|||||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
|||||||
is_in_ci,
|
is_in_ci,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=300, suite="stage-b-test-2-gpu-large")
|
register_cuda_ci(est_time=230, suite="stage-b-test-2-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class HiCacheStorageMooncakeBackendBaseMixin(HiCacheStorageBaseMixin):
|
class HiCacheStorageMooncakeBackendBaseMixin(HiCacheStorageBaseMixin):
|
||||||
|
|||||||
@@ -28,7 +28,7 @@ from sglang.test.test_utils import (
|
|||||||
)
|
)
|
||||||
from sglang.utils import wait_for_http_ready
|
from sglang.utils import wait_for_http_ready
|
||||||
|
|
||||||
register_cuda_ci(est_time=200, suite="stage-b-test-2-gpu-large")
|
register_cuda_ci(est_time=130, suite="stage-b-test-2-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class TestHiCacheStorageRuntimeAttachDetach(CustomTestCase):
|
class TestHiCacheStorageRuntimeAttachDetach(CustomTestCase):
|
||||||
|
|||||||
@@ -1,6 +1,6 @@
|
|||||||
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||||
|
|
||||||
register_cuda_ci(est_time=524, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=410, suite="stage-b-test-1-gpu-large")
|
||||||
register_amd_ci(est_time=524, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=524, suite="stage-b-test-1-gpu-small-amd")
|
||||||
"""
|
"""
|
||||||
Consolidated HiCache variant tests.
|
Consolidated HiCache variant tests.
|
||||||
|
|||||||
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
|
|||||||
)
|
)
|
||||||
|
|
||||||
# DeepSeek-V3 INT8 quantization tests (channel and block INT8)
|
# DeepSeek-V3 INT8 quantization tests (channel and block INT8)
|
||||||
register_cuda_ci(est_time=341, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=290, suite="stage-b-test-1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class TestMLADeepseekV3ChannelInt8(CustomTestCase):
|
class TestMLADeepseekV3ChannelInt8(CustomTestCase):
|
||||||
|
|||||||
@@ -4,7 +4,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
|
|||||||
from sglang.test.kits.lm_eval_kit import LMEvalMixin
|
from sglang.test.kits.lm_eval_kit import LMEvalMixin
|
||||||
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
|
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
|
||||||
|
|
||||||
register_cuda_ci(est_time=660, suite="stage-b-test-2-gpu-large")
|
register_cuda_ci(est_time=540, suite="stage-b-test-2-gpu-large")
|
||||||
|
|
||||||
NEMOTRON_3_NANO_THINKING_ARGS = [
|
NEMOTRON_3_NANO_THINKING_ARGS = [
|
||||||
"--trust-remote-code",
|
"--trust-remote-code",
|
||||||
|
|||||||
@@ -7,7 +7,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
|
|||||||
from sglang.test.few_shot_gsm8k import run_eval
|
from sglang.test.few_shot_gsm8k import run_eval
|
||||||
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
|
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
|
||||||
|
|
||||||
register_cuda_ci(est_time=180, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small")
|
||||||
|
|
||||||
|
|
||||||
class TestTransformersBackendEval(DefaultServerBase):
|
class TestTransformersBackendEval(DefaultServerBase):
|
||||||
|
|||||||
@@ -21,7 +21,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=450, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=260, suite="stage-b-test-1-gpu-small")
|
||||||
register_amd_ci(est_time=320, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=320, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=210, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-large")
|
||||||
register_amd_ci(est_time=1400, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=1400, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -31,7 +31,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small")
|
||||||
register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -27,7 +27,7 @@ try:
|
|||||||
except ImportError:
|
except ImportError:
|
||||||
_HAS_GRANIAN = False
|
_HAS_GRANIAN = False
|
||||||
|
|
||||||
register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=50, suite="stage-b-test-1-gpu-small")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipUnless(_HAS_GRANIAN, "granian not installed (pip install sglang[http2])")
|
@unittest.skipUnless(_HAS_GRANIAN, "granian not installed (pip install sglang[http2])")
|
||||||
|
|||||||
@@ -25,7 +25,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=50, suite="stage-b-test-1-gpu-large")
|
||||||
register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
# System message to guide Llama3.2 to produce proper tool call format
|
# System message to guide Llama3.2 to produce proper tool call format
|
||||||
|
|||||||
@@ -19,7 +19,7 @@ from sglang.test.test_utils import (
|
|||||||
write_github_step_summary,
|
write_github_step_summary,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=1000, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=1140, suite="stage-b-test-1-gpu-large")
|
||||||
register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
|
|||||||
write_github_step_summary,
|
write_github_step_summary,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=600, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=410, suite="stage-b-test-1-gpu-small")
|
||||||
register_amd_ci(est_time=500, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=500, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -35,7 +35,7 @@ register_amd_ci(
|
|||||||
suite="stage-b-test-1-gpu-small-amd",
|
suite="stage-b-test-1-gpu-small-amd",
|
||||||
disabled="see https://github.com/sgl-project/sglang/issues/11127",
|
disabled="see https://github.com/sgl-project/sglang/issues/11127",
|
||||||
)
|
)
|
||||||
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=90, suite="stage-b-test-1-gpu-small")
|
||||||
|
|
||||||
MODEL_TO_CONFIG = {
|
MODEL_TO_CONFIG = {
|
||||||
"Alibaba-NLP/gte-Qwen2-1.5B-instruct": (1, 1e-5),
|
"Alibaba-NLP/gte-Qwen2-1.5B-instruct": (1, 1e-5),
|
||||||
|
|||||||
@@ -29,7 +29,7 @@ from sglang.test.test_utils import CustomTestCase, get_similarities, is_in_ci
|
|||||||
# python -m unittest test_encoder_embedding_models.TestEncoderEmbeddingModels.test_prefill_logits
|
# python -m unittest test_encoder_embedding_models.TestEncoderEmbeddingModels.test_prefill_logits
|
||||||
|
|
||||||
|
|
||||||
register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=310, suite="stage-b-test-1-gpu-small")
|
||||||
|
|
||||||
MODELS = [("BAAI/bge-small-en", 1, 1e-5), ("BAAI/bge-m3", 1, 1e-5)]
|
MODELS = [("BAAI/bge-small-en", 1, 1e-5), ("BAAI/bge-m3", 1, 1e-5)]
|
||||||
|
|
||||||
|
|||||||
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=700, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=260, suite="stage-b-test-1-gpu-large")
|
||||||
register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
|
|||||||
write_github_step_summary,
|
write_github_step_summary,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=1200, suite="stage-c-test-4-gpu-b200")
|
register_cuda_ci(est_time=530, suite="stage-c-test-4-gpu-b200")
|
||||||
|
|
||||||
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4"
|
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4"
|
||||||
SERVER_LAUNCH_TIMEOUT = 1200
|
SERVER_LAUNCH_TIMEOUT = 1200
|
||||||
|
|||||||
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
|
|||||||
write_github_step_summary,
|
write_github_step_summary,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=1200, suite="stage-c-test-4-gpu-b200")
|
register_cuda_ci(est_time=610, suite="stage-c-test-4-gpu-b200")
|
||||||
|
|
||||||
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4"
|
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4"
|
||||||
SERVER_LAUNCH_TIMEOUT = 1200
|
SERVER_LAUNCH_TIMEOUT = 1200
|
||||||
|
|||||||
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
|
|||||||
write_github_step_summary,
|
write_github_step_summary,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=1200, suite="stage-c-test-4-gpu-b200")
|
register_cuda_ci(est_time=450, suite="stage-c-test-4-gpu-b200")
|
||||||
|
|
||||||
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4"
|
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4"
|
||||||
SERVER_LAUNCH_TIMEOUT = 1200
|
SERVER_LAUNCH_TIMEOUT = 1200
|
||||||
|
|||||||
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
|
|||||||
try_cached_model,
|
try_cached_model,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=420, suite="stage-c-test-4-gpu-b200")
|
register_cuda_ci(est_time=400, suite="stage-c-test-4-gpu-b200")
|
||||||
|
|
||||||
MODEL_PATH = "Qwen/Qwen3-4B-Instruct-2507-FP8"
|
MODEL_PATH = "Qwen/Qwen3-4B-Instruct-2507-FP8"
|
||||||
MXFP8_MODEL_PATH = "zianglih/Qwen3-4B-Instruct-2507-MXFP8"
|
MXFP8_MODEL_PATH = "zianglih/Qwen3-4B-Instruct-2507-MXFP8"
|
||||||
|
|||||||
@@ -12,7 +12,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
|
|||||||
from sglang.test.test_marlin_utils import awq_marlin_quantize, marlin_quantize
|
from sglang.test.test_marlin_utils import awq_marlin_quantize, marlin_quantize
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=130, suite="stage-b-test-1-gpu-small")
|
||||||
|
|
||||||
set_global_server_args_for_scheduler(object.__new__(ServerArgs))
|
set_global_server_args_for_scheduler(object.__new__(ServerArgs))
|
||||||
|
|
||||||
|
|||||||
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
|
|||||||
try_cached_model,
|
try_cached_model,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=360, suite="stage-c-test-4-gpu-b200")
|
register_cuda_ci(est_time=300, suite="stage-c-test-4-gpu-b200")
|
||||||
|
|
||||||
MODEL_PATH = "nvidia/Llama-3.1-8B-Instruct-NVFP4"
|
MODEL_PATH = "nvidia/Llama-3.1-8B-Instruct-NVFP4"
|
||||||
|
|
||||||
|
|||||||
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
|
|||||||
write_results_to_json,
|
write_results_to_json,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=370, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-large")
|
||||||
|
|
||||||
MODEL_SCORE_THRESHOLDS = {
|
MODEL_SCORE_THRESHOLDS = {
|
||||||
# Baselines observed with gsm8k 5-shot concatenated format via chat API,
|
# Baselines observed with gsm8k 5-shot concatenated format via chat API,
|
||||||
|
|||||||
@@ -5,7 +5,7 @@ import requests
|
|||||||
from sglang import Engine
|
from sglang import Engine
|
||||||
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||||
|
|
||||||
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=140, suite="stage-b-test-1-gpu-small")
|
||||||
register_amd_ci(est_time=230, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=230, suite="stage-b-test-1-gpu-small-amd")
|
||||||
from sglang.lang.chat_template import get_chat_template_by_model_path
|
from sglang.lang.chat_template import get_chat_template_by_model_path
|
||||||
from sglang.srt.utils import kill_process_tree
|
from sglang.srt.utils import kill_process_tree
|
||||||
|
|||||||
@@ -19,7 +19,7 @@ from sglang.test.test_utils import (
|
|||||||
write_github_step_summary,
|
write_github_step_summary,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=520, suite="stage-c-test-8-gpu-h20")
|
register_cuda_ci(est_time=700, suite="stage-c-test-8-gpu-h20")
|
||||||
|
|
||||||
|
|
||||||
class TestDeepseekV3W4afp8(CustomTestCase):
|
class TestDeepseekV3W4afp8(CustomTestCase):
|
||||||
|
|||||||
@@ -1,6 +1,6 @@
|
|||||||
from sglang.test.ci.ci_register import register_cuda_ci
|
from sglang.test.ci.ci_register import register_cuda_ci
|
||||||
|
|
||||||
register_cuda_ci(est_time=200, suite="stage-c-test-4-gpu-b200")
|
register_cuda_ci(est_time=100, suite="stage-c-test-4-gpu-b200")
|
||||||
|
|
||||||
import unittest
|
import unittest
|
||||||
|
|
||||||
|
|||||||
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=150, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=80, suite="stage-b-test-1-gpu-small")
|
||||||
register_amd_ci(est_time=66, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=66, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -7,7 +7,7 @@ import unittest
|
|||||||
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||||
from sglang.test.test_utils import CustomTestCase, run_mmlu_test, run_mulit_request_test
|
from sglang.test.test_utils import CustomTestCase, run_mmlu_test, run_mulit_request_test
|
||||||
|
|
||||||
register_cuda_ci(est_time=550, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=360, suite="stage-b-test-1-gpu-small")
|
||||||
register_amd_ci(est_time=312, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=312, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
|
|||||||
)
|
)
|
||||||
from sglang.utils import is_in_ci
|
from sglang.utils import is_in_ci
|
||||||
|
|
||||||
register_cuda_ci(est_time=550, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=470, suite="stage-b-test-1-gpu-small")
|
||||||
register_amd_ci(est_time=600, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=600, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
|
|||||||
write_github_step_summary,
|
write_github_step_summary,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=900, suite="stage-b-test-4-gpu-b200")
|
register_cuda_ci(est_time=240, suite="stage-b-test-4-gpu-b200")
|
||||||
|
|
||||||
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4"
|
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4"
|
||||||
SERVER_LAUNCH_TIMEOUT = 1200
|
SERVER_LAUNCH_TIMEOUT = 1200
|
||||||
|
|||||||
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
|
|||||||
DEFAULT_TARGET_MODEL_EAGLE3,
|
DEFAULT_TARGET_MODEL_EAGLE3,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small")
|
register_cuda_ci(est_time=160, suite="stage-b-test-1-gpu-small")
|
||||||
register_amd_ci(est_time=50, suite="stage-b-test-1-gpu-small")
|
register_amd_ci(est_time=50, suite="stage-b-test-1-gpu-small")
|
||||||
|
|
||||||
_is_hip = is_hip()
|
_is_hip = is_hip()
|
||||||
|
|||||||
@@ -21,7 +21,7 @@ from sglang.test.test_utils import (
|
|||||||
)
|
)
|
||||||
|
|
||||||
# EAGLE3 with DP attention (tp=2, dp=2, requires 4 GPUs)
|
# EAGLE3 with DP attention (tp=2, dp=2, requires 4 GPUs)
|
||||||
register_cuda_ci(est_time=200, suite="stage-c-test-4-gpu-h100")
|
register_cuda_ci(est_time=100, suite="stage-c-test-4-gpu-h100")
|
||||||
register_amd_ci(est_time=200, suite="stage-c-test-4-gpu-amd")
|
register_amd_ci(est_time=200, suite="stage-c-test-4-gpu-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
|
|||||||
CustomTestCase,
|
CustomTestCase,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=450, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class TestEAGLEEngine(CustomTestCase):
|
class TestEAGLEEngine(CustomTestCase):
|
||||||
|
|||||||
@@ -22,7 +22,7 @@ from sglang.test.run_eval import run_eval
|
|||||||
from sglang.test.server_fixtures.eagle_fixture import EagleServerBase
|
from sglang.test.server_fixtures.eagle_fixture import EagleServerBase
|
||||||
from sglang.test.test_utils import DEFAULT_TARGET_MODEL_EAGLE, run_logprob_check
|
from sglang.test.test_utils import DEFAULT_TARGET_MODEL_EAGLE, run_logprob_check
|
||||||
|
|
||||||
register_cuda_ci(est_time=600, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=690, suite="stage-b-test-1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class TestEAGLEServerBasic(EagleServerBase):
|
class TestEAGLEServerBasic(EagleServerBase):
|
||||||
|
|||||||
@@ -19,7 +19,7 @@ from sglang.test.vlm_utils import (
|
|||||||
VideoOpenAITestMixin,
|
VideoOpenAITestMixin,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=957, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=700, suite="stage-b-test-1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class TestLlavaServer(ImageOpenAITestMixin):
|
class TestLlavaServer(ImageOpenAITestMixin):
|
||||||
|
|||||||
@@ -37,7 +37,7 @@ from sglang.srt.entrypoints.openai.protocol import ChatCompletionRequest
|
|||||||
from sglang.srt.parser.conversation import generate_chat_conv
|
from sglang.srt.parser.conversation import generate_chat_conv
|
||||||
from sglang.srt.utils.hf_transformers_utils import _fix_added_tokens_encoding
|
from sglang.srt.utils.hf_transformers_utils import _fix_added_tokens_encoding
|
||||||
|
|
||||||
register_cuda_ci(est_time=447, suite="stage-b-test-1-gpu-large")
|
register_cuda_ci(est_time=620, suite="stage-b-test-1-gpu-large")
|
||||||
|
|
||||||
IMAGE_MAN_IRONING_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/man_ironing_on_back_of_suv.png"
|
IMAGE_MAN_IRONING_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/man_ironing_on_back_of_suv.png"
|
||||||
IMAGE_SGL_LOGO_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/sgl_logo.png"
|
IMAGE_SGL_LOGO_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/sgl_logo.png"
|
||||||
|
|||||||
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=200, suite="stage-c-test-4-gpu-h100")
|
register_cuda_ci(est_time=140, suite="stage-c-test-4-gpu-h100")
|
||||||
|
|
||||||
QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B"
|
QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B"
|
||||||
MMMU_ACCURACY_THRESHOLD = 0.65
|
MMMU_ACCURACY_THRESHOLD = 0.65
|
||||||
|
|||||||
Reference in New Issue
Block a user