Compare commits
1
Commits
| Author | SHA1 | Date | |
|---|---|---|---|
|
|
3d8df4b127 |
@@ -15,7 +15,7 @@ from sglang.srt.layers.attention import aiter_mla_gluon as mod
|
|||||||
from sglang.test.ci.ci_register import register_cpu_ci
|
from sglang.test.ci.ci_register import register_cpu_ci
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cpu_ci(est_time=15, suite="base-a-test-cpu")
|
register_cpu_ci(est_time=8, suite="base-a-test-cpu")
|
||||||
|
|
||||||
_GLUON_FN = "sglang.srt.layers.attention.aiter_mla_gluon._gluon_fn"
|
_GLUON_FN = "sglang.srt.layers.attention.aiter_mla_gluon._gluon_fn"
|
||||||
|
|
||||||
|
|||||||
@@ -13,7 +13,7 @@ from sglang.test.ci.ci_register import (
|
|||||||
register_xpu_ci,
|
register_xpu_ci,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=11, stage="stage-b", runner_config="1-gpu-large-amd")
|
register_amd_ci(est_time=11, stage="stage-b", runner_config="1-gpu-large-amd")
|
||||||
register_xpu_ci(est_time=900, suite="stage-b-test-1-gpu-xpu")
|
register_xpu_ci(est_time=900, suite="stage-b-test-1-gpu-xpu")
|
||||||
|
|
||||||
|
|||||||
@@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
|||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
# Triton kernel unit test for KV indices creation
|
# Triton kernel unit test for KV indices creation
|
||||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small")
|
||||||
register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -24,7 +24,7 @@ from sglang.test.test_utils import (
|
|||||||
is_in_amd_ci,
|
is_in_amd_ci,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=280, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=272, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd")
|
||||||
register_xpu_ci(est_time=207, suite="stage-b-test-1-gpu-xpu")
|
register_xpu_ci(est_time=207, suite="stage-b-test-1-gpu-xpu")
|
||||||
|
|
||||||
|
|||||||
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
|
|||||||
)
|
)
|
||||||
|
|
||||||
# FlashAttention4 integration test (requires SM 100+ / Blackwell B200)
|
# FlashAttention4 integration test (requires SM 100+ / Blackwell B200)
|
||||||
register_cuda_ci(est_time=230, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=220, stage="base-b", runner_config="4-gpu-b200")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(get_device_sm() < 100, "Test requires CUDA SM 100 or higher")
|
@unittest.skipIf(get_device_sm() < 100, "Test requires CUDA SM 100 or higher")
|
||||||
|
|||||||
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
|
|||||||
|
|
||||||
# Hybrid attention backend tests (FA3 prefill + FlashInfer decode, requires SM 90+ / H100)
|
# Hybrid attention backend tests (FA3 prefill + FlashInfer decode, requires SM 90+ / H100)
|
||||||
# Multiple test classes: base, MLA, TorchCompile, SpecDecode variants
|
# Multiple test classes: base, MLA, TorchCompile, SpecDecode variants
|
||||||
register_cuda_ci(est_time=393, stage="extra-a", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=368, stage="extra-a", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class TestHybridAttnBackendMLA(TestHybridAttnBackendBase):
|
class TestHybridAttnBackendMLA(TestHybridAttnBackendBase):
|
||||||
|
|||||||
@@ -19,7 +19,7 @@ from sglang.srt.utils.common import get_device
|
|||||||
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=32, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=12, stage="stage-b", runner_config="1-gpu-large-amd")
|
register_amd_ci(est_time=12, stage="stage-b", runner_config="1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -21,7 +21,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
|||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
# Register this test for CUDA CI in base-b (fast attention/kernel tests)
|
# Register this test for CUDA CI in base-b (fast attention/kernel tests)
|
||||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=17, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=17, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -12,7 +12,7 @@ from sglang.test.test_deterministic_utils import (
|
|||||||
TestDeterministicBase,
|
TestDeterministicBase,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=119, stage="extra-b", runner_config="4-gpu-h100")
|
register_cuda_ci(est_time=135, stage="extra-b", runner_config="4-gpu-h100")
|
||||||
|
|
||||||
QWEN35 = "Qwen/Qwen3.5-35B-A3B"
|
QWEN35 = "Qwen/Qwen3.5-35B-A3B"
|
||||||
|
|
||||||
|
|||||||
@@ -18,7 +18,7 @@ from sglang.test.test_utils import (
|
|||||||
)
|
)
|
||||||
|
|
||||||
# Torch native attention backend integration test with MMLU eval
|
# Torch native attention backend integration test with MMLU eval
|
||||||
register_cuda_ci(est_time=310, stage="extra-a", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=312, stage="extra-a", runner_config="1-gpu-small")
|
||||||
register_amd_ci(est_time=150, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=150, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
|
|||||||
)
|
)
|
||||||
|
|
||||||
# Sliding window attention with Triton backend (Gemma-3 model)
|
# Sliding window attention with Triton backend (Gemma-3 model)
|
||||||
register_cuda_ci(est_time=80, stage="extra-a", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=81, stage="extra-a", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -17,7 +17,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
|
|||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
# trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell.
|
# trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell.
|
||||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=8, stage="base-b", runner_config="4-gpu-b200")
|
||||||
|
|
||||||
DEVICE = "cuda"
|
DEVICE = "cuda"
|
||||||
PAGE_SIZE = 32
|
PAGE_SIZE = 32
|
||||||
|
|||||||
@@ -23,7 +23,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode
|
|||||||
from sglang.test.ci.ci_register import register_cuda_ci
|
from sglang.test.ci.ci_register import register_cuda_ci
|
||||||
|
|
||||||
# trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell.
|
# trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell.
|
||||||
register_cuda_ci(est_time=16, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
||||||
|
|
||||||
DEVICE = "cuda"
|
DEVICE = "cuda"
|
||||||
PAGE_SIZE = 128
|
PAGE_SIZE = 128
|
||||||
|
|||||||
@@ -25,7 +25,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
|||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
# Triton kernel unit test for the trtllm_mha device-side page-table build.
|
# Triton kernel unit test for the trtllm_mha device-side page-table build.
|
||||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small")
|
||||||
register_amd_ci(est_time=14, stage="stage-b", runner_config="1-gpu-small-amd")
|
register_amd_ci(est_time=14, stage="stage-b", runner_config="1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -27,7 +27,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=71, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
KIMI_LINEAR_MODEL = "yujiepan/kimi-linear-tiny-random"
|
KIMI_LINEAR_MODEL = "yujiepan/kimi-linear-tiny-random"
|
||||||
SERVER_ENV = {"SGLANG_BATCH_INVARIANT_OPS_ENABLE_MM_DEEPGEMM": "0"}
|
SERVER_ENV = {"SGLANG_BATCH_INVARIANT_OPS_ENABLE_MM_DEEPGEMM": "0"}
|
||||||
|
|||||||
@@ -36,7 +36,7 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=11, stage="base-a", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=10, stage="base-a", runner_config="1-gpu-small")
|
||||||
|
|
||||||
_EXTEND_CASE = DenseAttentionCase(
|
_EXTEND_CASE = DenseAttentionCase(
|
||||||
name="extend_no_prefix_smoke",
|
name="extend_no_prefix_smoke",
|
||||||
|
|||||||
@@ -30,7 +30,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=18, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||||
|
|||||||
@@ -29,8 +29,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=27, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=23, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=22, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||||
|
|||||||
@@ -26,8 +26,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=16, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=26, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(
|
@unittest.skipIf(
|
||||||
|
|||||||
@@ -14,8 +14,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=16, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=36, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||||
|
|||||||
@@ -18,8 +18,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(
|
@unittest.skipIf(
|
||||||
|
|||||||
@@ -21,8 +21,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||||
|
|||||||
@@ -11,8 +11,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -30,8 +30,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=38, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=19, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=36, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=17, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=18, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(
|
@unittest.skipIf(
|
||||||
|
|||||||
@@ -30,8 +30,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_draft_runner i
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=22, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=26, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||||
|
|||||||
@@ -48,7 +48,7 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
|
|||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||||
|
|||||||
@@ -25,7 +25,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
_cuda_major = int(torch.version.cuda.split(".")[0]) if torch.version.cuda else 0
|
_cuda_major = int(torch.version.cuda.split(".")[0]) if torch.version.cuda else 0
|
||||||
|
|||||||
@@ -45,7 +45,7 @@ import torch
|
|||||||
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -15,7 +15,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|||||||
@@ -29,8 +29,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
+1
-1
@@ -32,7 +32,7 @@ from sglang.test.kits.attention_unittest.attention_methods.mla_attention import
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
_KV_LORA_RANK = DEFAULT_KV_LORA_RANK
|
_KV_LORA_RANK = DEFAULT_KV_LORA_RANK
|
||||||
|
|||||||
@@ -24,7 +24,7 @@ from sglang.srt.layers.attention.linear.kernels.kda_flashinfer import (
|
|||||||
from sglang.test.ci.ci_register import register_cuda_ci
|
from sglang.test.ci.ci_register import register_cuda_ci
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class TestBuildFusedAcceptIndices(CustomTestCase):
|
class TestBuildFusedAcceptIndices(CustomTestCase):
|
||||||
|
|||||||
@@ -22,8 +22,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -19,7 +19,7 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|||||||
@@ -32,8 +32,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||||
|
|||||||
@@ -7,7 +7,7 @@ from sglang.srt.layers.attention.mamba.replay_state_indices_validator import (
|
|||||||
)
|
)
|
||||||
from sglang.test.ci.ci_register import register_cpu_ci
|
from sglang.test.ci.ci_register import register_cpu_ci
|
||||||
|
|
||||||
register_cpu_ci(est_time=6, suite="base-a-test-cpu")
|
register_cpu_ci(est_time=5, suite="base-a-test-cpu")
|
||||||
|
|
||||||
|
|
||||||
class TestReplayStateIndicesValidator(unittest.TestCase):
|
class TestReplayStateIndicesValidator(unittest.TestCase):
|
||||||
|
|||||||
@@ -32,7 +32,7 @@ MLA_SHAPE_KWARGS = dict(
|
|||||||
|
|
||||||
from sglang.test.ci.ci_register import register_cuda_ci
|
from sglang.test.ci.ci_register import register_cuda_ci
|
||||||
|
|
||||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -56,7 +56,7 @@ MLA_SHAPE_KWARGS = dict(
|
|||||||
from sglang.test.ci.ci_register import register_cuda_ci
|
from sglang.test.ci.ci_register import register_cuda_ci
|
||||||
|
|
||||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(not _SUPPORTED, _SKIP_REASON)
|
@unittest.skipIf(not _SUPPORTED, _SKIP_REASON)
|
||||||
|
|||||||
@@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=17, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
@unittest.skipIf(not torch.cuda.is_available(), "CUDA is required")
|
||||||
|
|||||||
@@ -24,8 +24,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
@unittest.skipIf(
|
@unittest.skipIf(
|
||||||
|
|||||||
@@ -24,7 +24,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode
|
|||||||
from sglang.test.ci.ci_register import register_cpu_ci
|
from sglang.test.ci.ci_register import register_cpu_ci
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cpu_ci(est_time=11, suite="base-a-test-cpu")
|
register_cpu_ci(est_time=8, suite="base-a-test-cpu")
|
||||||
|
|
||||||
|
|
||||||
class TestSWAKVPoolSetKVBuffer(CustomTestCase):
|
class TestSWAKVPoolSetKVBuffer(CustomTestCase):
|
||||||
|
|||||||
@@ -12,8 +12,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -23,8 +23,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200")
|
||||||
register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
|
|||||||
write_github_step_summary,
|
write_github_step_summary,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=243, stage="extra-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=259, stage="extra-b", runner_config="4-gpu-b200")
|
||||||
|
|
||||||
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4"
|
FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4"
|
||||||
SERVER_LAUNCH_TIMEOUT = 1000
|
SERVER_LAUNCH_TIMEOUT = 1000
|
||||||
|
|||||||
@@ -11,7 +11,7 @@ from sglang.srt.utils import get_cuda_driver_bindings, is_flashinfer_available
|
|||||||
from sglang.test.ci.ci_register import register_cuda_ci
|
from sglang.test.ci.ci_register import register_cuda_ci
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=28, stage="base-b", runner_config="2-gpu-large")
|
register_cuda_ci(est_time=26, stage="base-b", runner_config="2-gpu-large")
|
||||||
|
|
||||||
WORLD_SIZE = 2
|
WORLD_SIZE = 2
|
||||||
|
|
||||||
|
|||||||
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=139, stage="extra-a", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=131, stage="extra-a", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
|
|||||||
run_bench_serving,
|
run_bench_serving,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=145, stage="extra-a", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=136, stage="extra-a", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class TestEagle3Latency(CustomTestCase):
|
class TestEagle3Latency(CustomTestCase):
|
||||||
|
|||||||
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
|
|||||||
run_embeddings_benchmark_multi,
|
run_embeddings_benchmark_multi,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=245, stage="extra-a", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=215, stage="extra-a", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=240, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=240, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
|
|||||||
run_bench_serving,
|
run_bench_serving,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=490, stage="extra-a", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=247, stage="extra-a", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=430, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=430, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
|
|||||||
run_bench_serving,
|
run_bench_serving,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=290, stage="extra-a", runner_config="2-gpu-large")
|
register_cuda_ci(est_time=271, stage="extra-a", runner_config="2-gpu-large")
|
||||||
register_amd_ci(est_time=770, suite="stage-b-test-2-gpu-large-amd")
|
register_amd_ci(est_time=770, suite="stage-b-test-2-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
|
|||||||
run_bench_serving,
|
run_bench_serving,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=490, stage="extra-a", runner_config="2-gpu-large")
|
register_cuda_ci(est_time=325, stage="extra-a", runner_config="2-gpu-large")
|
||||||
register_amd_ci(est_time=1030, suite="stage-b-test-2-gpu-large-amd")
|
register_amd_ci(est_time=1030, suite="stage-b-test-2-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
|
|||||||
run_score_benchmark_multi,
|
run_score_benchmark_multi,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=215, stage="extra-a", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=185, stage="extra-a", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=210, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=210, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -10,7 +10,7 @@ from sglang.test.test_utils import (
|
|||||||
run_bench_serving,
|
run_bench_serving,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=190, stage="extra-a", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=182, stage="extra-a", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=165, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=165, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
|
|||||||
run_bench_serving,
|
run_bench_serving,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=710, stage="extra-a", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=660, stage="extra-a", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=810, suite="stage-b-test-1-gpu-large-amd")
|
register_amd_ci(est_time=810, suite="stage-b-test-1-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -10,7 +10,7 @@ from sglang.test.test_utils import (
|
|||||||
run_bench_offline_throughput,
|
run_bench_offline_throughput,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=75, stage="extra-a", runner_config="2-gpu-large")
|
register_cuda_ci(est_time=85, stage="extra-a", runner_config="2-gpu-large")
|
||||||
register_amd_ci(est_time=280, suite="stage-b-test-2-gpu-large-amd")
|
register_amd_ci(est_time=280, suite="stage-b-test-2-gpu-large-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
|
|||||||
from sglang.test.kits.vlm_perf_kit import check_vlm_serving_perf
|
from sglang.test.kits.vlm_perf_kit import check_vlm_serving_perf
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=150, stage="extra-a", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=152, stage="extra-a", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class TestVLMServingFa3(CustomTestCase):
|
class TestVLMServingFa3(CustomTestCase):
|
||||||
|
|||||||
@@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_cuda_ci
|
|||||||
from sglang.test.kits.vlm_perf_kit import check_vlm_serving_perf
|
from sglang.test.kits.vlm_perf_kit import check_vlm_serving_perf
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=195, stage="extra-a", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=191, stage="extra-a", runner_config="1-gpu-small")
|
||||||
|
|
||||||
|
|
||||||
class TestVLMServingFlashinfer(CustomTestCase):
|
class TestVLMServingFlashinfer(CustomTestCase):
|
||||||
|
|||||||
@@ -26,7 +26,7 @@ from sglang.benchmark.serving import (
|
|||||||
from sglang.test.ci.ci_register import register_cpu_ci
|
from sglang.test.ci.ci_register import register_cpu_ci
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cpu_ci(est_time=16, suite="base-a-test-cpu")
|
register_cpu_ci(est_time=13, suite="base-a-test-cpu")
|
||||||
|
|
||||||
|
|
||||||
def _free_port() -> int:
|
def _free_port() -> int:
|
||||||
|
|||||||
@@ -60,7 +60,7 @@ from sglang.benchmark.serving import (
|
|||||||
from sglang.test.ci.ci_register import register_cpu_ci
|
from sglang.test.ci.ci_register import register_cpu_ci
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cpu_ci(est_time=38, suite="base-a-test-cpu")
|
register_cpu_ci(est_time=36, suite="base-a-test-cpu")
|
||||||
register_cpu_ci(est_time=46, suite="stage-b-test-cpu-intel")
|
register_cpu_ci(est_time=46, suite="stage-b-test-cpu-intel")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -13,7 +13,7 @@ from sglang.benchmark.steady_state import (
|
|||||||
)
|
)
|
||||||
from sglang.test.ci.ci_register import register_cpu_ci
|
from sglang.test.ci.ci_register import register_cpu_ci
|
||||||
|
|
||||||
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
|
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
|
||||||
|
|
||||||
|
|
||||||
class _StringTokenizer:
|
class _StringTokenizer:
|
||||||
|
|||||||
@@ -25,7 +25,7 @@ from sglang.srt.multimodal.transport.cuda_ipc import (
|
|||||||
from sglang.srt.runtime_context import get_context, get_parallel
|
from sglang.srt.runtime_context import get_context, get_parallel
|
||||||
from sglang.test.ci.ci_register import register_cpu_ci
|
from sglang.test.ci.ci_register import register_cpu_ci
|
||||||
|
|
||||||
register_cpu_ci(est_time=12, suite="base-a-test-cpu")
|
register_cpu_ci(est_time=9, suite="base-a-test-cpu")
|
||||||
|
|
||||||
|
|
||||||
@pytest.fixture(autouse=True)
|
@pytest.fixture(autouse=True)
|
||||||
|
|||||||
@@ -10,7 +10,7 @@ from sglang.test.scripted_runtime_chunked_helpers import (
|
|||||||
run_until_finished,
|
run_until_finished,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=106, stage="extra-a", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=103, stage="extra-a", runner_config="1-gpu-small")
|
||||||
register_amd_ci(est_time=198, stage="extra-a", runner_config="1-gpu-small-amd")
|
register_amd_ci(est_time=198, stage="extra-a", runner_config="1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -11,7 +11,7 @@ from sglang.test.scripted_runtime_chunked_helpers import (
|
|||||||
run_until_finished,
|
run_until_finished,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=55, stage="extra-b", runner_config="4-gpu-h100")
|
register_cuda_ci(est_time=96, stage="extra-b", runner_config="4-gpu-h100")
|
||||||
|
|
||||||
|
|
||||||
_CHUNK_SIZE = 64
|
_CHUNK_SIZE = 64
|
||||||
|
|||||||
@@ -5,7 +5,7 @@ from sglang.test.scripted_runtime.context import ScriptedContext
|
|||||||
from sglang.test.scripted_runtime.test_case import ScriptedTestCase
|
from sglang.test.scripted_runtime.test_case import ScriptedTestCase
|
||||||
from sglang.test.scripted_runtime_chunked_helpers import base_engine_kwargs
|
from sglang.test.scripted_runtime_chunked_helpers import base_engine_kwargs
|
||||||
|
|
||||||
register_cuda_ci(est_time=130, stage="extra-a", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=137, stage="extra-a", runner_config="1-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
_SWA_MODEL = "openai/gpt-oss-20b"
|
_SWA_MODEL = "openai/gpt-oss-20b"
|
||||||
|
|||||||
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=161, stage="base-b", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=149, stage="base-b", runner_config="1-gpu-small")
|
||||||
register_amd_ci(est_time=220, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=220, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=97, stage="base-a", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=112, stage="base-a", runner_config="1-gpu-small")
|
||||||
register_amd_ci(est_time=160, suite="stage-a-test-1-gpu-small-amd")
|
register_amd_ci(est_time=160, suite="stage-a-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=135, stage="base-a", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=94, stage="base-a", runner_config="1-gpu-small")
|
||||||
|
|
||||||
|
|
||||||
class TestBasicSanityDFlash(
|
class TestBasicSanityDFlash(
|
||||||
|
|||||||
@@ -16,7 +16,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=97, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=92, stage="base-b", runner_config="1-gpu-large")
|
||||||
|
|
||||||
TARGET_MODEL = "Qwen/Qwen3-14B"
|
TARGET_MODEL = "Qwen/Qwen3-14B"
|
||||||
DRAFT_MODEL = "deepseek-ai/dspark_qwen3_14b_block7"
|
DRAFT_MODEL = "deepseek-ai/dspark_qwen3_14b_block7"
|
||||||
|
|||||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=167, stage="base-a", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=112, stage="base-a", runner_config="1-gpu-small")
|
||||||
register_amd_ci(est_time=200, suite="stage-a-test-1-gpu-small-amd")
|
register_amd_ci(est_time=200, suite="stage-a-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
|||||||
CustomTestCase,
|
CustomTestCase,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=77, stage="base-b", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=34, stage="base-b", runner_config="1-gpu-small")
|
||||||
|
|
||||||
|
|
||||||
class TestEngineChildPids(CustomTestCase):
|
class TestEngineChildPids(CustomTestCase):
|
||||||
|
|||||||
@@ -8,7 +8,7 @@ from sglang.srt.utils import get_device, is_hip
|
|||||||
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
||||||
from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase
|
from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=32, stage="base-b", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=31, stage="base-b", runner_config="1-gpu-small")
|
||||||
register_amd_ci(est_time=55, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=55, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
_is_hip = is_hip()
|
_is_hip = is_hip()
|
||||||
|
|||||||
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=54, stage="base-b", runner_config="2-gpu-large")
|
register_cuda_ci(est_time=53, stage="base-b", runner_config="2-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class TestTPServerGPUProcesses(CustomTestCase):
|
class TestTPServerGPUProcesses(CustomTestCase):
|
||||||
|
|||||||
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
|
|||||||
send_generate_requests,
|
send_generate_requests,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=53, stage="base-b", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=63, stage="base-b", runner_config="1-gpu-small")
|
||||||
|
|
||||||
|
|
||||||
class TestMaxQueuedRequests(CustomTestCase):
|
class TestMaxQueuedRequests(CustomTestCase):
|
||||||
|
|||||||
@@ -12,7 +12,7 @@ import pytest
|
|||||||
|
|
||||||
from sglang.test.ci.ci_register import register_cpu_ci
|
from sglang.test.ci.ci_register import register_cpu_ci
|
||||||
|
|
||||||
register_cpu_ci(est_time=7, suite="base-a-test-cpu")
|
register_cpu_ci(est_time=5, suite="base-a-test-cpu")
|
||||||
|
|
||||||
# Packages known to transitively depend on torch or triton.
|
# Packages known to transitively depend on torch or triton.
|
||||||
# If a new package is added to runtime_base and it pulls torch,
|
# If a new package is added to runtime_base and it pulls torch,
|
||||||
|
|||||||
@@ -31,7 +31,7 @@ from sglang.test.test_utils import (
|
|||||||
run_logprob_check,
|
run_logprob_check,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=265, stage="base-b", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=250, stage="base-b", runner_config="1-gpu-small")
|
||||||
register_amd_ci(est_time=260, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=260, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
SERVER_ENV = {"SGLANG_USE_PICKLE_IPC": "0"}
|
SERVER_ENV = {"SGLANG_USE_PICKLE_IPC": "0"}
|
||||||
|
|||||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
|||||||
CustomTestCase,
|
CustomTestCase,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=276, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=286, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=261, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=261, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -41,7 +41,7 @@ from sglang.srt.runtime_context import get_parallel
|
|||||||
from sglang.test.ci.ci_register import register_cpu_ci
|
from sglang.test.ci.ci_register import register_cpu_ci
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cpu_ci(est_time=11, suite="base-a-test-cpu")
|
register_cpu_ci(est_time=8, suite="base-a-test-cpu")
|
||||||
|
|
||||||
|
|
||||||
class _ExtendMode:
|
class _ExtendMode:
|
||||||
|
|||||||
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
|
|||||||
write_github_step_summary,
|
write_github_step_summary,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=275, stage="extra-b", runner_config="8-gpu-h200")
|
register_cuda_ci(est_time=334, stage="extra-b", runner_config="8-gpu-h200")
|
||||||
|
|
||||||
DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324"
|
DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324"
|
||||||
|
|
||||||
|
|||||||
@@ -22,7 +22,7 @@ from sglang.test.test_utils import (
|
|||||||
try_cached_model,
|
try_cached_model,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=689, stage="extra-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=654, stage="extra-b", runner_config="4-gpu-b200")
|
||||||
|
|
||||||
MODEL = "deepseek-ai/DeepSeek-V4-Flash"
|
MODEL = "deepseek-ai/DeepSeek-V4-Flash"
|
||||||
SERVER_LAUNCH_TIMEOUT = 3600
|
SERVER_LAUNCH_TIMEOUT = 3600
|
||||||
|
|||||||
@@ -13,7 +13,7 @@ from sglang.test.test_utils import (
|
|||||||
write_github_step_summary,
|
write_github_step_summary,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=314, stage="extra-b", runner_config="8-gpu-h200")
|
register_cuda_ci(est_time=433, stage="extra-b", runner_config="8-gpu-h200")
|
||||||
GLM52_MODEL_PATH = "zai-org/GLM-5.2-FP8"
|
GLM52_MODEL_PATH = "zai-org/GLM-5.2-FP8"
|
||||||
SERVER_LAUNCH_TIMEOUT = max(DEFAULT_TIMEOUT_FOR_SERVER_LAUNCH, 1800)
|
SERVER_LAUNCH_TIMEOUT = max(DEFAULT_TIMEOUT_FOR_SERVER_LAUNCH, 1800)
|
||||||
|
|
||||||
|
|||||||
@@ -3,7 +3,7 @@ import unittest
|
|||||||
from sglang.test.ci.ci_register import register_cuda_ci
|
from sglang.test.ci.ci_register import register_cuda_ci
|
||||||
from sglang.test.gpt_oss_common import BaseTestGptOss
|
from sglang.test.gpt_oss_common import BaseTestGptOss
|
||||||
|
|
||||||
register_cuda_ci(est_time=121, stage="extra-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=127, stage="extra-b", runner_config="4-gpu-b200")
|
||||||
|
|
||||||
|
|
||||||
class TestGptOss4GpuMxfp4CP(BaseTestGptOss):
|
class TestGptOss4GpuMxfp4CP(BaseTestGptOss):
|
||||||
|
|||||||
@@ -11,7 +11,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=466, stage="extra-b", runner_config="4-gpu-h100")
|
register_cuda_ci(est_time=553, stage="extra-b", runner_config="4-gpu-h100")
|
||||||
|
|
||||||
GQA_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8"
|
GQA_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8"
|
||||||
|
|
||||||
|
|||||||
@@ -12,7 +12,7 @@ import unittest
|
|||||||
from sglang.test.ci.ci_register import register_cuda_ci
|
from sglang.test.ci.ci_register import register_cuda_ci
|
||||||
from sglang.test.server_fixtures.pcg_spec_fixture import PCGSpecBase
|
from sglang.test.server_fixtures.pcg_spec_fixture import PCGSpecBase
|
||||||
|
|
||||||
register_cuda_ci(est_time=106, stage="base-b", runner_config="2-gpu-large")
|
register_cuda_ci(est_time=103, stage="base-b", runner_config="2-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class TestBCGWithEAGLE3(PCGSpecBase, unittest.TestCase):
|
class TestBCGWithEAGLE3(PCGSpecBase, unittest.TestCase):
|
||||||
|
|||||||
@@ -24,7 +24,7 @@ from sglang.test.test_utils import (
|
|||||||
)
|
)
|
||||||
|
|
||||||
# CI Registration — large suite to fit the integration test's server startup.
|
# CI Registration — large suite to fit the integration test's server startup.
|
||||||
register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-large")
|
register_cuda_ci(est_time=88, stage="base-b", runner_config="1-gpu-large")
|
||||||
register_amd_ci(est_time=200, suite="stage-c-test-large-8-gpu-amd-mi35x")
|
register_amd_ci(est_time=200, suite="stage-c-test-large-8-gpu-amd-mi35x")
|
||||||
|
|
||||||
|
|
||||||
|
|||||||
@@ -33,7 +33,7 @@ from sglang.test.test_utils import (
|
|||||||
|
|
||||||
# OSS FA4 coverage requires Blackwell. The PP test uses two GPUs; the other
|
# OSS FA4 coverage requires Blackwell. The PP test uses two GPUs; the other
|
||||||
# tests use one GPU.
|
# tests use one GPU.
|
||||||
register_cuda_ci(est_time=251, stage="base-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=278, stage="base-b", runner_config="4-gpu-b200")
|
||||||
|
|
||||||
|
|
||||||
def _prefill_graph_count(base_url: str) -> float:
|
def _prefill_graph_count(base_url: str) -> float:
|
||||||
|
|||||||
@@ -5,7 +5,7 @@ import torch
|
|||||||
|
|
||||||
from sglang.test.ci.ci_register import register_cuda_ci
|
from sglang.test.ci.ci_register import register_cuda_ci
|
||||||
|
|
||||||
register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small")
|
||||||
|
|
||||||
if not torch.cuda.is_available():
|
if not torch.cuda.is_available():
|
||||||
pytest.skip("CUDA piecewise backend requires CUDA", allow_module_level=True)
|
pytest.skip("CUDA piecewise backend requires CUDA", allow_module_level=True)
|
||||||
|
|||||||
@@ -33,7 +33,7 @@ from sglang.srt.mem_cache.memory_pool import HybridLinearKVPool
|
|||||||
from sglang.test.ci.ci_register import register_cpu_ci
|
from sglang.test.ci.ci_register import register_cpu_ci
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cpu_ci(est_time=11, suite="base-a-test-cpu")
|
register_cpu_ci(est_time=8, suite="base-a-test-cpu")
|
||||||
|
|
||||||
DCP_SIZES = [1, 2, 3, 4, 8]
|
DCP_SIZES = [1, 2, 3, 4, 8]
|
||||||
LENS = list(range(0, 41))
|
LENS = list(range(0, 41))
|
||||||
|
|||||||
@@ -55,7 +55,7 @@ from sglang.test.test_utils import (
|
|||||||
# ---------------------------------------------------------------------------
|
# ---------------------------------------------------------------------------
|
||||||
# CI registration — only TestDSV31DCP8TP8GSM8K runs in CI
|
# CI registration — only TestDSV31DCP8TP8GSM8K runs in CI
|
||||||
# ---------------------------------------------------------------------------
|
# ---------------------------------------------------------------------------
|
||||||
register_cuda_ci(est_time=213, stage="extra-b", runner_config="8-gpu-h200")
|
register_cuda_ci(est_time=248, stage="extra-b", runner_config="8-gpu-h200")
|
||||||
|
|
||||||
DEEPSEEK_V31_MODEL_PATH = "deepseek-ai/DeepSeek-V3.1"
|
DEEPSEEK_V31_MODEL_PATH = "deepseek-ai/DeepSeek-V3.1"
|
||||||
|
|
||||||
|
|||||||
@@ -20,7 +20,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=105, stage="extra-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=98, stage="extra-b", runner_config="4-gpu-b200")
|
||||||
|
|
||||||
KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct"
|
KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct"
|
||||||
CUDA_GRAPH_MAX_BS_DECODE = 256
|
CUDA_GRAPH_MAX_BS_DECODE = 256
|
||||||
|
|||||||
@@ -22,7 +22,7 @@ from sglang.test.test_utils import (
|
|||||||
popen_launch_server,
|
popen_launch_server,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=201, stage="extra-b", runner_config="4-gpu-b200")
|
register_cuda_ci(est_time=206, stage="extra-b", runner_config="4-gpu-b200")
|
||||||
|
|
||||||
KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct"
|
KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct"
|
||||||
GSM8K_SCORE_THRESHOLD = 0.88
|
GSM8K_SCORE_THRESHOLD = 0.88
|
||||||
|
|||||||
@@ -18,7 +18,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
|
|||||||
from sglang.test.layer_ut_utils import init_single_process_dist
|
from sglang.test.layer_ut_utils import init_single_process_dist
|
||||||
from sglang.test.test_utils import CustomTestCase
|
from sglang.test.test_utils import CustomTestCase
|
||||||
|
|
||||||
register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small")
|
register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small")
|
||||||
# Backend-specific: the hook resolves get_device() and the matching distributed
|
# Backend-specific: the hook resolves get_device() and the matching distributed
|
||||||
# backend, so only an AMD run exercises the HIP device and dump path.
|
# backend, so only an AMD run exercises the HIP device and dump path.
|
||||||
register_amd_ci(est_time=15, suite="stage-b-test-1-gpu-small-amd")
|
register_amd_ci(est_time=15, suite="stage-b-test-1-gpu-small-amd")
|
||||||
|
|||||||
@@ -15,7 +15,7 @@ from sglang.test.test_utils import (
|
|||||||
|
|
||||||
QWEN3_8B_MODEL_PATH = "Qwen/Qwen3-8B"
|
QWEN3_8B_MODEL_PATH = "Qwen/Qwen3-8B"
|
||||||
|
|
||||||
register_cuda_ci(est_time=125, stage="base-c", runner_config="4-gpu-gb300")
|
register_cuda_ci(est_time=137, stage="base-c", runner_config="4-gpu-gb300")
|
||||||
|
|
||||||
# Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner.
|
# Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner.
|
||||||
NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 120
|
NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 120
|
||||||
|
|||||||
@@ -27,7 +27,7 @@ from sglang.test.test_utils import (
|
|||||||
DEFAULT_TARGET_MODEL_EAGLE3,
|
DEFAULT_TARGET_MODEL_EAGLE3,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=1007, stage="base-b", runner_config="2-gpu-large")
|
register_cuda_ci(est_time=895, stage="base-b", runner_config="2-gpu-large")
|
||||||
|
|
||||||
|
|
||||||
class TestDisaggregationAccuracy(PauseResumeInPlaceMixin, PDDisaggregationServerBase):
|
class TestDisaggregationAccuracy(PauseResumeInPlaceMixin, PDDisaggregationServerBase):
|
||||||
|
|||||||
@@ -12,7 +12,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST
|
from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST
|
||||||
|
|
||||||
register_cuda_ci(est_time=120, stage="base-b", runner_config="2-gpu-large")
|
register_cuda_ci(est_time=98, stage="base-b", runner_config="2-gpu-large")
|
||||||
|
|
||||||
PD_CHUNKED_ABORT_EXTRA_ARGS = [
|
PD_CHUNKED_ABORT_EXTRA_ARGS = [
|
||||||
"--max-running-requests",
|
"--max-running-requests",
|
||||||
|
|||||||
@@ -26,7 +26,7 @@ from sglang.test.test_utils import (
|
|||||||
try_cached_model,
|
try_cached_model,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=170, stage="base-c", runner_config="8-gpu-h20")
|
register_cuda_ci(est_time=164, stage="base-c", runner_config="8-gpu-h20")
|
||||||
|
|
||||||
|
|
||||||
def _has_mooncake():
|
def _has_mooncake():
|
||||||
|
|||||||
@@ -17,7 +17,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import (
|
|||||||
)
|
)
|
||||||
from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST_MXFP4_WITH_MOE, is_in_ci
|
from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST_MXFP4_WITH_MOE, is_in_ci
|
||||||
|
|
||||||
register_cuda_ci(est_time=365, stage="extra-b", runner_config="8-gpu-h200")
|
register_cuda_ci(est_time=334, stage="extra-b", runner_config="8-gpu-h200")
|
||||||
|
|
||||||
SWA_SERVER_ARGS = ["--page-size", "64", "--attention-backend", "triton"]
|
SWA_SERVER_ARGS = ["--page-size", "64", "--attention-backend", "triton"]
|
||||||
|
|
||||||
|
|||||||
@@ -17,7 +17,7 @@ from sglang.test.test_utils import (
|
|||||||
try_cached_model,
|
try_cached_model,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=1171, stage="base-c", runner_config="8-gpu-h20")
|
register_cuda_ci(est_time=1180, stage="base-c", runner_config="8-gpu-h20")
|
||||||
|
|
||||||
|
|
||||||
class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase):
|
class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase):
|
||||||
|
|||||||
@@ -14,7 +14,7 @@ from sglang.test.test_utils import (
|
|||||||
try_cached_model,
|
try_cached_model,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=140, stage="base-c", runner_config="8-gpu-h20")
|
register_cuda_ci(est_time=141, stage="base-c", runner_config="8-gpu-h20")
|
||||||
|
|
||||||
|
|
||||||
class TestDisaggregationDPAttention(PDDisaggregationServerBase):
|
class TestDisaggregationDPAttention(PDDisaggregationServerBase):
|
||||||
|
|||||||
@@ -12,7 +12,7 @@ from sglang.test.test_utils import (
|
|||||||
try_cached_model,
|
try_cached_model,
|
||||||
)
|
)
|
||||||
|
|
||||||
register_cuda_ci(est_time=184, stage="base-c", runner_config="8-gpu-h200")
|
register_cuda_ci(est_time=206, stage="base-c", runner_config="8-gpu-h200")
|
||||||
|
|
||||||
DSV4_FLASH_MODEL = "sgl-project/DeepSeek-V4-Flash-FP8"
|
DSV4_FLASH_MODEL = "sgl-project/DeepSeek-V4-Flash-FP8"
|
||||||
|
|
||||||
|
|||||||
Some files were not shown because too many files have changed in this diff Show More
Reference in New Issue
Block a user