[CI] Update est_time for 64 tests based on actual elapsed times (#22305)

Co-authored-by: Alison Shao <alison.shao@Mac.lan>
Co-authored-by: Alison Shao <alison.shao@MacBook-Pro-D2W773R9CD.local>
This commit is contained in:
Alison Shao
2026-04-09 20:31:37 -07:00
committed by GitHub
co-authored by Alison Shao Alison Shao
parent 89553ff82b
commit 45b0182205
61 changed files with 61 additions and 61 deletions
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=600, suite="stage-c-test-4-gpu-b200")
register_cuda_ci(est_time=290, suite="stage-c-test-4-gpu-b200")
NEMOTRON_3_SUPER_NVFP4_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4"
@@ -18,7 +18,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=600, suite="stage-c-test-4-gpu-h100")
register_cuda_ci(est_time=620, suite="stage-c-test-4-gpu-h100")
QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B"
ACC_THRESHOLDS = {QWEN35_27B_MODEL: {"gsm8k": 0.8}}
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=300, suite="stage-c-test-4-gpu-h100")
register_cuda_ci(est_time=150, suite="stage-c-test-4-gpu-h100")
QWEN3_30B_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8"
@@ -6,7 +6,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin
from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
register_cuda_ci(est_time=350, suite="stage-c-test-4-gpu-h100")
register_cuda_ci(est_time=120, suite="stage-c-test-4-gpu-h100")
QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct"
@@ -7,7 +7,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin
from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
register_cuda_ci(est_time=500, suite="stage-c-test-4-gpu-h100")
register_cuda_ci(est_time=430, suite="stage-c-test-4-gpu-h100")
QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct"
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=275, suite="stage-c-test-8-gpu-h200")
register_cuda_ci(est_time=240, suite="stage-c-test-8-gpu-h200")
FULL_DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324"
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=720, suite="stage-c-test-8-gpu-h200")
register_cuda_ci(est_time=870, suite="stage-c-test-8-gpu-h200")
DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
GLM5_MODEL_PATH = "zai-org/GLM-5-FP8"
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=720, suite="stage-c-test-8-gpu-h200")
register_cuda_ci(est_time=880, suite="stage-c-test-8-gpu-h200")
FULL_DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
GLM5_MODEL_PATH = "zai-org/GLM-5-FP8"
@@ -5,7 +5,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin
from sglang.test.kits.spec_decoding_kit import SpecDecodingMixin
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
register_cuda_ci(est_time=200, suite="stage-c-test-8-gpu-h200")
register_cuda_ci(est_time=270, suite="stage-c-test-8-gpu-h200")
class TestMiMoV2Flash(GSM8KMixin, SpecDecodingMixin, DefaultServerBase):
@@ -5,7 +5,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.run_combined_tests import run_combined_tests
from sglang.test.test_utils import ModelLaunchSettings
register_cuda_ci(est_time=1800, suite="nightly-8-gpu-common", nightly=True)
register_cuda_ci(est_time=510, suite="nightly-8-gpu-common", nightly=True)
RING_2_5_1T_MODEL_PATH = "inclusionAI/Ring-2.5-1T"
+1 -1
View File
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
# FlashAttention3 integration tests (requires SM 90+ / H100)
# Multiple test classes: FA3, FA3+MLA, FA3+SpecDecode variants
register_cuda_ci(est_time=300, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=390, suite="stage-b-test-1-gpu-large")
GSM_DATASET_PATH = None
+1 -1
View File
@@ -16,7 +16,7 @@ from sglang.test.test_deterministic_utils import (
)
from sglang.test.test_utils import is_in_amd_ci
register_cuda_ci(est_time=278, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd")
+1 -1
View File
@@ -3,7 +3,7 @@ import unittest
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.gpt_oss_common import BaseTestGptOss
register_cuda_ci(est_time=519, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=420, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=750, suite="stage-b-test-1-gpu-small-amd-mi35x")
+1 -1
View File
@@ -5,7 +5,7 @@ import torch
from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.gpt_oss_common import BaseTestGptOss
register_cuda_ci(est_time=500, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=330, suite="stage-b-test-1-gpu-small")
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is not available")
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
try_cached_model,
)
register_cuda_ci(est_time=600, suite="stage-c-test-8-gpu-h20")
register_cuda_ci(est_time=330, suite="stage-c-test-8-gpu-h20")
class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase):
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
try_cached_model,
)
register_cuda_ci(est_time=580, suite="stage-c-test-8-gpu-h20")
register_cuda_ci(est_time=400, suite="stage-c-test-8-gpu-h20")
class TestDisaggregationDPAttention(PDDisaggregationServerBase):
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
popen_launch_pd_server,
)
register_cuda_ci(est_time=500, suite="stage-c-test-8-gpu-h200")
register_cuda_ci(est_time=450, suite="stage-c-test-8-gpu-h200")
@unittest.skipIf(is_in_ci(), "Temporarily disable the flaky test.")
@@ -25,7 +25,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=350, suite="stage-b-test-2-gpu-large")
register_cuda_ci(est_time=450, suite="stage-b-test-2-gpu-large")
class TestDPAttentionDP2TP2(
@@ -22,7 +22,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=350, suite="stage-c-test-4-gpu-h100")
register_cuda_ci(est_time=230, suite="stage-c-test-4-gpu-h100")
register_amd_ci(est_time=350, suite="stage-c-test-4-gpu-amd")
@@ -31,7 +31,7 @@ from sglang.test.test_utils import (
run_bench_one_batch_server,
)
register_cuda_ci(est_time=650, suite="stage-c-test-4-gpu-h100")
register_cuda_ci(est_time=460, suite="stage-c-test-4-gpu-h100")
register_amd_ci(est_time=650, suite="stage-c-test-4-gpu-amd")
+1 -1
View File
@@ -1,6 +1,6 @@
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
register_cuda_ci(est_time=181, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=110, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=330, suite="stage-b-test-1-gpu-small-amd")
import unittest
+1 -1
View File
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=563, suite="stage-c-test-deepep-8-gpu-h200")
register_cuda_ci(est_time=490, suite="stage-c-test-deepep-8-gpu-h200")
DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2"
+1 -1
View File
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=531, suite="stage-c-test-deepep-4-gpu-h100")
register_cuda_ci(est_time=430, suite="stage-c-test-deepep-4-gpu-h100")
class TestPureDP(CustomTestCase):
+1 -1
View File
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=200, suite="stage-c-test-deepep-4-gpu-h100")
register_cuda_ci(est_time=80, suite="stage-c-test-deepep-4-gpu-h100")
ib_devices = get_rdma_devices_args()
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
is_in_ci,
)
register_cuda_ci(est_time=300, suite="stage-b-test-2-gpu-large")
register_cuda_ci(est_time=230, suite="stage-b-test-2-gpu-large")
class HiCacheStorageMooncakeBackendBaseMixin(HiCacheStorageBaseMixin):
@@ -28,7 +28,7 @@ from sglang.test.test_utils import (
)
from sglang.utils import wait_for_http_ready
register_cuda_ci(est_time=200, suite="stage-b-test-2-gpu-large")
register_cuda_ci(est_time=130, suite="stage-b-test-2-gpu-large")
class TestHiCacheStorageRuntimeAttachDetach(CustomTestCase):
@@ -1,6 +1,6 @@
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
register_cuda_ci(est_time=524, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=410, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=524, suite="stage-b-test-1-gpu-small-amd")
"""
Consolidated HiCache variant tests.
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
)
# DeepSeek-V3 INT8 quantization tests (channel and block INT8)
register_cuda_ci(est_time=341, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=290, suite="stage-b-test-1-gpu-large")
class TestMLADeepseekV3ChannelInt8(CustomTestCase):
@@ -4,7 +4,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.kits.lm_eval_kit import LMEvalMixin
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
register_cuda_ci(est_time=660, suite="stage-b-test-2-gpu-large")
register_cuda_ci(est_time=540, suite="stage-b-test-2-gpu-large")
NEMOTRON_3_NANO_THINKING_ARGS = [
"--trust-remote-code",
@@ -7,7 +7,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.few_shot_gsm8k import run_eval
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
register_cuda_ci(est_time=180, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small")
class TestTransformersBackendEval(DefaultServerBase):
@@ -21,7 +21,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=450, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=260, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=320, suite="stage-b-test-1-gpu-small-amd")
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=210, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=1400, suite="stage-b-test-1-gpu-small-amd")
@@ -31,7 +31,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=40, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd")
@@ -27,7 +27,7 @@ try:
except ImportError:
_HAS_GRANIAN = False
register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=50, suite="stage-b-test-1-gpu-small")
@unittest.skipUnless(_HAS_GRANIAN, "granian not installed (pip install sglang[http2])")
@@ -25,7 +25,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=120, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=50, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=140, suite="stage-b-test-1-gpu-small-amd")
# System message to guide Llama3.2 to produce proper tool call format
@@ -19,7 +19,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=1000, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=1140, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-large-amd")
+1 -1
View File
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=600, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=410, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=500, suite="stage-b-test-1-gpu-small-amd")
@@ -35,7 +35,7 @@ register_amd_ci(
suite="stage-b-test-1-gpu-small-amd",
disabled="see https://github.com/sgl-project/sglang/issues/11127",
)
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=90, suite="stage-b-test-1-gpu-small")
MODEL_TO_CONFIG = {
"Alibaba-NLP/gte-Qwen2-1.5B-instruct": (1, 1e-5),
@@ -29,7 +29,7 @@ from sglang.test.test_utils import CustomTestCase, get_similarities, is_in_ci
# python -m unittest test_encoder_embedding_models.TestEncoderEmbeddingModels.test_prefill_logits
register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=310, suite="stage-b-test-1-gpu-small")
MODELS = [("BAAI/bge-small-en", 1, 1e-5), ("BAAI/bge-m3", 1, 1e-5)]
+1 -1
View File
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=700, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=260, suite="stage-b-test-1-gpu-large")
register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-large-amd")
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=1200, suite="stage-c-test-4-gpu-b200")
register_cuda_ci(est_time=530, suite="stage-c-test-4-gpu-b200")
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4"
SERVER_LAUNCH_TIMEOUT = 1200
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=1200, suite="stage-c-test-4-gpu-b200")
register_cuda_ci(est_time=610, suite="stage-c-test-4-gpu-b200")
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3.2-NVFP4"
SERVER_LAUNCH_TIMEOUT = 1200
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=1200, suite="stage-c-test-4-gpu-b200")
register_cuda_ci(est_time=450, suite="stage-c-test-4-gpu-b200")
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4"
SERVER_LAUNCH_TIMEOUT = 1200
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
try_cached_model,
)
register_cuda_ci(est_time=420, suite="stage-c-test-4-gpu-b200")
register_cuda_ci(est_time=400, suite="stage-c-test-4-gpu-b200")
MODEL_PATH = "Qwen/Qwen3-4B-Instruct-2507-FP8"
MXFP8_MODEL_PATH = "zianglih/Qwen3-4B-Instruct-2507-MXFP8"
+1 -1
View File
@@ -12,7 +12,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.test_marlin_utils import awq_marlin_quantize, marlin_quantize
from sglang.test.test_utils import CustomTestCase
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=130, suite="stage-b-test-1-gpu-small")
set_global_server_args_for_scheduler(object.__new__(ServerArgs))
+1 -1
View File
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
try_cached_model,
)
register_cuda_ci(est_time=360, suite="stage-c-test-4-gpu-b200")
register_cuda_ci(est_time=300, suite="stage-c-test-4-gpu-b200")
MODEL_PATH = "nvidia/Llama-3.1-8B-Instruct-NVFP4"
+1 -1
View File
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
write_results_to_json,
)
register_cuda_ci(est_time=370, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-large")
MODEL_SCORE_THRESHOLDS = {
# Baselines observed with gsm8k 5-shot concatenated format via chat API,
+1 -1
View File
@@ -5,7 +5,7 @@ import requests
from sglang import Engine
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=140, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=230, suite="stage-b-test-1-gpu-small-amd")
from sglang.lang.chat_template import get_chat_template_by_model_path
from sglang.srt.utils import kill_process_tree
@@ -19,7 +19,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=520, suite="stage-c-test-8-gpu-h20")
register_cuda_ci(est_time=700, suite="stage-c-test-8-gpu-h20")
class TestDeepseekV3W4afp8(CustomTestCase):
@@ -1,6 +1,6 @@
from sglang.test.ci.ci_register import register_cuda_ci
register_cuda_ci(est_time=200, suite="stage-c-test-4-gpu-b200")
register_cuda_ci(est_time=100, suite="stage-c-test-4-gpu-b200")
import unittest
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=150, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=80, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=66, suite="stage-b-test-1-gpu-small-amd")
@@ -7,7 +7,7 @@ import unittest
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.test_utils import CustomTestCase, run_mmlu_test, run_mulit_request_test
register_cuda_ci(est_time=550, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=360, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=312, suite="stage-b-test-1-gpu-small-amd")
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
)
from sglang.utils import is_in_ci
register_cuda_ci(est_time=550, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=470, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=600, suite="stage-b-test-1-gpu-small-amd")
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
write_github_step_summary,
)
register_cuda_ci(est_time=900, suite="stage-b-test-4-gpu-b200")
register_cuda_ci(est_time=240, suite="stage-b-test-4-gpu-b200")
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4"
SERVER_LAUNCH_TIMEOUT = 1200
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
DEFAULT_TARGET_MODEL_EAGLE3,
)
register_cuda_ci(est_time=200, suite="stage-b-test-1-gpu-small")
register_cuda_ci(est_time=160, suite="stage-b-test-1-gpu-small")
register_amd_ci(est_time=50, suite="stage-b-test-1-gpu-small")
_is_hip = is_hip()
@@ -21,7 +21,7 @@ from sglang.test.test_utils import (
)
# EAGLE3 with DP attention (tp=2, dp=2, requires 4 GPUs)
register_cuda_ci(est_time=200, suite="stage-c-test-4-gpu-h100")
register_cuda_ci(est_time=100, suite="stage-c-test-4-gpu-h100")
register_amd_ci(est_time=200, suite="stage-c-test-4-gpu-amd")
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
CustomTestCase,
)
register_cuda_ci(est_time=450, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=270, suite="stage-b-test-1-gpu-large")
class TestEAGLEEngine(CustomTestCase):
@@ -22,7 +22,7 @@ from sglang.test.run_eval import run_eval
from sglang.test.server_fixtures.eagle_fixture import EagleServerBase
from sglang.test.test_utils import DEFAULT_TARGET_MODEL_EAGLE, run_logprob_check
register_cuda_ci(est_time=600, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=690, suite="stage-b-test-1-gpu-large")
class TestEAGLEServerBasic(EagleServerBase):
@@ -19,7 +19,7 @@ from sglang.test.vlm_utils import (
VideoOpenAITestMixin,
)
register_cuda_ci(est_time=957, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=700, suite="stage-b-test-1-gpu-large")
class TestLlavaServer(ImageOpenAITestMixin):
+1 -1
View File
@@ -37,7 +37,7 @@ from sglang.srt.entrypoints.openai.protocol import ChatCompletionRequest
from sglang.srt.parser.conversation import generate_chat_conv
from sglang.srt.utils.hf_transformers_utils import _fix_added_tokens_encoding
register_cuda_ci(est_time=447, suite="stage-b-test-1-gpu-large")
register_cuda_ci(est_time=620, suite="stage-b-test-1-gpu-large")
IMAGE_MAN_IRONING_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/man_ironing_on_back_of_suv.png"
IMAGE_SGL_LOGO_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/sgl_logo.png"
+1 -1
View File
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
popen_launch_server,
)
register_cuda_ci(est_time=200, suite="stage-c-test-4-gpu-h100")
register_cuda_ci(est_time=140, suite="stage-c-test-4-gpu-h100")
QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B"
MMMU_ACCURACY_THRESHOLD = 0.65