From e76cc75cfa5b4031f194849f363cdb29f834f58d Mon Sep 17 00:00:00 2001 From: Liangsheng Yin Date: Wed, 15 Jul 2026 14:12:07 -0700 Subject: [PATCH] [CI] Remove nightly registrations redundant with scheduled stage runs (#31371) --- test/registered/jit/deepseek_v4/test_c128_v2.py | 1 - test/registered/jit/deepseek_v4/test_c4_v2.py | 1 - test/registered/jit/deepseek_v4/test_fp4_indexer.py | 1 - .../jit/diffusion/test_diffusion_modelopt_fp8_scaled_mm.py | 1 - test/registered/jit/diffusion/test_fused_norm_scale_shift.py | 1 - test/registered/jit/diffusion/test_group_norm_silu.py | 1 - test/registered/jit/diffusion/test_qknorm_rope.py | 1 + test/registered/jit/diffusion/test_qwen_image_modulation.py | 1 + test/registered/jit/diffusion/test_varlen_pack_pad.py | 1 + .../jit/diffusion/test_varlen_uspattn_equivalence.py | 1 + test/registered/jit/test_activation.py | 1 + test/registered/jit/test_add_constant.py | 1 - test/registered/jit/test_awq_dequantize.py | 1 - test/registered/jit/test_awq_marlin_moe_repack.py | 1 - test/registered/jit/test_awq_marlin_repack.py | 1 - test/registered/jit/test_clamp_position.py | 1 - test/registered/jit/test_concat_mla.py | 1 - test/registered/jit/test_custom_all_reduce.py | 1 + test/registered/jit/test_cutedsl_gdn.py | 1 - test/registered/jit/test_dsv32_indexer_fusion.py | 1 - test/registered/jit/test_dsv3_router_gemm.py | 1 + test/registered/jit/test_flash_attention_4.py | 1 - test/registered/jit/test_fused_add_rmsnorm.py | 1 + test/registered/jit/test_fused_eh_norm.py | 1 - test/registered/jit/test_fused_metadata_copy.py | 1 - test/registered/jit/test_fused_store_index_cache.py | 1 - test/registered/jit/test_fused_verify_triton_gdn.py | 1 - test/registered/jit/test_gptq_marlin.py | 1 - test/registered/jit/test_gptq_marlin_repack.py | 1 - test/registered/jit/test_hadamard_jit.py | 1 - test/registered/jit/test_hicache.py | 1 - test/registered/jit/test_hisparse.py | 1 - test/registered/jit/test_moe_align_block_size.py | 1 + test/registered/jit/test_moe_lora_align_block_size.py | 1 - test/registered/jit/test_moe_wna16_marlin.py | 1 - test/registered/jit/test_mxfp8_moe.py | 1 - test/registered/jit/test_per_tensor_quant_fp8.py | 1 + test/registered/jit/test_per_token_group_quant_8bit.py | 1 + test/registered/jit/test_pos_enc.py | 1 - test/registered/jit/test_qknorm.py | 1 + test/registered/jit/test_qknorm_across_heads.py | 1 + test/registered/jit/test_renorm.py | 1 - test/registered/jit/test_resolve_future_token_ids.py | 1 - test/registered/jit/test_rmsnorm.py | 1 + test/registered/jit/test_rmsnorm_hf.py | 1 + test/registered/jit/test_rope.py | 1 + test/registered/jit/test_sparse_mla_q8kv8_prefill_sm90.py | 1 - test/registered/jit/test_store_cache.py | 1 + test/registered/jit/test_symm_mem_all_gather.py | 1 + test/registered/jit/test_timestep_embedding.py | 1 + test/registered/jit/test_tp_qknorm.py | 5 ----- 51 files changed, 19 insertions(+), 36 deletions(-) diff --git a/test/registered/jit/deepseek_v4/test_c128_v2.py b/test/registered/jit/deepseek_v4/test_c128_v2.py index f8818b501..b051c98d8 100644 --- a/test/registered/jit/deepseek_v4/test_c128_v2.py +++ b/test/registered/jit/deepseek_v4/test_c128_v2.py @@ -19,7 +19,6 @@ from sglang.jit_kernel.tests.deepseek_v4.common import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=30, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=30, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=30, suite="nightly-amd-kernel-1-gpu", nightly=True) Context = Union[LegacyContext, PagedContext] diff --git a/test/registered/jit/deepseek_v4/test_c4_v2.py b/test/registered/jit/deepseek_v4/test_c4_v2.py index 31233da29..845bc33a2 100644 --- a/test/registered/jit/deepseek_v4/test_c4_v2.py +++ b/test/registered/jit/deepseek_v4/test_c4_v2.py @@ -19,7 +19,6 @@ from sglang.jit_kernel.tests.deepseek_v4.common import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=30, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=30, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=30, suite="nightly-amd-kernel-1-gpu", nightly=True) Context = Union[LegacyContext, PagedContext] diff --git a/test/registered/jit/deepseek_v4/test_fp4_indexer.py b/test/registered/jit/deepseek_v4/test_fp4_indexer.py index 8d4264a71..df58a0081 100644 --- a/test/registered/jit/deepseek_v4/test_fp4_indexer.py +++ b/test/registered/jit/deepseek_v4/test_fp4_indexer.py @@ -22,7 +22,6 @@ from sglang.kernels.ops.attention.dsv4.fp4_indexer import ( from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=60, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=60, suite="nightly-kernel-1-gpu", nightly=True) HEAD_DIM = 128 FP4_DIM = HEAD_DIM // 2 diff --git a/test/registered/jit/diffusion/test_diffusion_modelopt_fp8_scaled_mm.py b/test/registered/jit/diffusion/test_diffusion_modelopt_fp8_scaled_mm.py index 689720003..0b060b854 100644 --- a/test/registered/jit/diffusion/test_diffusion_modelopt_fp8_scaled_mm.py +++ b/test/registered/jit/diffusion/test_diffusion_modelopt_fp8_scaled_mm.py @@ -15,7 +15,6 @@ from sglang.srt.layers.quantization.fp8_utils import ( from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=20, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=80, suite="nightly-kernel-1-gpu", nightly=True) DEVICE = "cuda" DTYPE = torch.bfloat16 diff --git a/test/registered/jit/diffusion/test_fused_norm_scale_shift.py b/test/registered/jit/diffusion/test_fused_norm_scale_shift.py index 74ff53083..bfee67887 100644 --- a/test/registered/jit/diffusion/test_fused_norm_scale_shift.py +++ b/test/registered/jit/diffusion/test_fused_norm_scale_shift.py @@ -14,7 +14,6 @@ from sglang.jit_kernel.diffusion.cutedsl.scale_residual_norm_scale_shift import from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=28, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) DEVICE = "cuda" SHAPE_MAP = { diff --git a/test/registered/jit/diffusion/test_group_norm_silu.py b/test/registered/jit/diffusion/test_group_norm_silu.py index 793acae53..7f2541c9b 100644 --- a/test/registered/jit/diffusion/test_group_norm_silu.py +++ b/test/registered/jit/diffusion/test_group_norm_silu.py @@ -10,7 +10,6 @@ from sglang.jit_kernel.diffusion.triton.group_norm_silu import triton_group_norm from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=8, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=15, suite="nightly-amd-kernel-1-gpu", nightly=True) DEVICE = "cuda" diff --git a/test/registered/jit/diffusion/test_qknorm_rope.py b/test/registered/jit/diffusion/test_qknorm_rope.py index 76b042095..8d775d7b8 100644 --- a/test/registered/jit/diffusion/test_qknorm_rope.py +++ b/test/registered/jit/diffusion/test_qknorm_rope.py @@ -9,6 +9,7 @@ from sglang.jit_kernel.utils import get_ci_test_range from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=44, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=176, suite="nightly-kernel-1-gpu", nightly=True) DEVICE = "cuda" diff --git a/test/registered/jit/diffusion/test_qwen_image_modulation.py b/test/registered/jit/diffusion/test_qwen_image_modulation.py index d16d58916..596f6bcc7 100644 --- a/test/registered/jit/diffusion/test_qwen_image_modulation.py +++ b/test/registered/jit/diffusion/test_qwen_image_modulation.py @@ -13,6 +13,7 @@ from sglang.jit_kernel.utils import get_ci_test_range from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=15, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=30, suite="nightly-amd-kernel-1-gpu", nightly=True) diff --git a/test/registered/jit/diffusion/test_varlen_pack_pad.py b/test/registered/jit/diffusion/test_varlen_pack_pad.py index fa95364bb..614c4b711 100644 --- a/test/registered/jit/diffusion/test_varlen_pack_pad.py +++ b/test/registered/jit/diffusion/test_varlen_pack_pad.py @@ -16,6 +16,7 @@ from sglang.jit_kernel.utils import get_ci_test_range from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=10, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=60, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=15, suite="nightly-amd-kernel-1-gpu", nightly=True) diff --git a/test/registered/jit/diffusion/test_varlen_uspattn_equivalence.py b/test/registered/jit/diffusion/test_varlen_uspattn_equivalence.py index bd276a76d..51837e17d 100644 --- a/test/registered/jit/diffusion/test_varlen_uspattn_equivalence.py +++ b/test/registered/jit/diffusion/test_varlen_uspattn_equivalence.py @@ -30,6 +30,7 @@ from sglang.multimodal_gen.runtime.layers.attention.layer import ( from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=15, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=60, suite="nightly-kernel-1-gpu", nightly=True) DEVICE = "cuda" diff --git a/test/registered/jit/test_activation.py b/test/registered/jit/test_activation.py index 4f7e92037..62c2becba 100644 --- a/test/registered/jit/test_activation.py +++ b/test/registered/jit/test_activation.py @@ -13,6 +13,7 @@ from sglang.jit_kernel.utils import get_ci_test_range from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=20, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=30, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=20, stage="jit-kernel-unit", runner_config="amd") diff --git a/test/registered/jit/test_add_constant.py b/test/registered/jit/test_add_constant.py index bb9f0be50..c82f94d22 100644 --- a/test/registered/jit/test_add_constant.py +++ b/test/registered/jit/test_add_constant.py @@ -7,7 +7,6 @@ from sglang.jit_kernel.add_constant import add_constant from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=45, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=180, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=8, stage="jit-kernel-unit", runner_config="amd") diff --git a/test/registered/jit/test_awq_dequantize.py b/test/registered/jit/test_awq_dequantize.py index b6f5cb37e..8f3ba88c8 100644 --- a/test/registered/jit/test_awq_dequantize.py +++ b/test/registered/jit/test_awq_dequantize.py @@ -8,7 +8,6 @@ from sglang.jit_kernel.awq_dequantize import awq_dequantize as jit_awq_dequantiz from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=9, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) try: from sgl_kernel import awq_dequantize as aot_awq_dequantize diff --git a/test/registered/jit/test_awq_marlin_moe_repack.py b/test/registered/jit/test_awq_marlin_moe_repack.py index d05708d20..caa191822 100644 --- a/test/registered/jit/test_awq_marlin_moe_repack.py +++ b/test/registered/jit/test_awq_marlin_moe_repack.py @@ -12,7 +12,6 @@ from sglang.srt.layers.quantization.utils import pack_cols, quantize_weights from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=10, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) def _has_aot_awq_marlin_moe_repack() -> bool: diff --git a/test/registered/jit/test_awq_marlin_repack.py b/test/registered/jit/test_awq_marlin_repack.py index 4034a5ac9..d067ce6ef 100644 --- a/test/registered/jit/test_awq_marlin_repack.py +++ b/test/registered/jit/test_awq_marlin_repack.py @@ -13,7 +13,6 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_marlin_utils import get_weight_perm, marlin_weights register_cuda_ci(est_time=10, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) def _has_aot_awq_marlin_repack() -> bool: diff --git a/test/registered/jit/test_clamp_position.py b/test/registered/jit/test_clamp_position.py index 1a7a68b6c..0805ed1d3 100644 --- a/test/registered/jit/test_clamp_position.py +++ b/test/registered/jit/test_clamp_position.py @@ -7,7 +7,6 @@ from sglang.jit_kernel.clamp_position import clamp_position_cuda from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=12, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=12, stage="jit-kernel-unit", runner_config="amd") diff --git a/test/registered/jit/test_concat_mla.py b/test/registered/jit/test_concat_mla.py index 94905bf93..84f1a175f 100644 --- a/test/registered/jit/test_concat_mla.py +++ b/test/registered/jit/test_concat_mla.py @@ -8,7 +8,6 @@ import triton from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=17, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) def torch_concat_mla_k( diff --git a/test/registered/jit/test_custom_all_reduce.py b/test/registered/jit/test_custom_all_reduce.py index 311521d59..c5edd024f 100644 --- a/test/registered/jit/test_custom_all_reduce.py +++ b/test/registered/jit/test_custom_all_reduce.py @@ -48,6 +48,7 @@ register_cuda_ci( stage="base-b-kernel-unit", runner_config="8-gpu-h200", ) +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci( est_time=300, suite="nightly-kernel-8-gpu-h200", diff --git a/test/registered/jit/test_cutedsl_gdn.py b/test/registered/jit/test_cutedsl_gdn.py index d6f48a052..584d645b5 100644 --- a/test/registered/jit/test_cutedsl_gdn.py +++ b/test/registered/jit/test_cutedsl_gdn.py @@ -30,7 +30,6 @@ except ImportError: TRITON_AVAILABLE = False register_cuda_ci(est_time=5, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) def run_triton_kernel(A_log, dt_bias, q, k, v, a, b, initial_state, indices, scale): diff --git a/test/registered/jit/test_dsv32_indexer_fusion.py b/test/registered/jit/test_dsv32_indexer_fusion.py index 51210b605..e1991e4df 100644 --- a/test/registered/jit/test_dsv32_indexer_fusion.py +++ b/test/registered/jit/test_dsv32_indexer_fusion.py @@ -32,7 +32,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci _is_hip = is_hip() register_cuda_ci(est_time=45, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=90, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=45, suite="jit-kernel-unit-test-amd") HEAD_DIM = 128 diff --git a/test/registered/jit/test_dsv3_router_gemm.py b/test/registered/jit/test_dsv3_router_gemm.py index af4200209..b934fe903 100644 --- a/test/registered/jit/test_dsv3_router_gemm.py +++ b/test/registered/jit/test_dsv3_router_gemm.py @@ -11,6 +11,7 @@ from sglang.jit_kernel.utils import get_ci_test_range, get_jit_cuda_arch, is_hip from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=37, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=148, suite="nightly-kernel-1-gpu", nightly=True) HIDDEN_DIMS = [1024, 4096, 5120, 6144, 7168] diff --git a/test/registered/jit/test_flash_attention_4.py b/test/registered/jit/test_flash_attention_4.py index d28af546e..c97e281a9 100644 --- a/test/registered/jit/test_flash_attention_4.py +++ b/test/registered/jit/test_flash_attention_4.py @@ -16,7 +16,6 @@ from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=120, stage="base-b-kernel-unit", runner_config="1-gpu-large") register_cuda_ci(est_time=120, stage="base-b-kernel-unit", runner_config="4-gpu-b200") -register_cuda_ci(est_time=900, suite="nightly-kernel-1-gpu", nightly=True) # Skip this test on Hopper machine skip_condition = torch.cuda.get_device_capability() < (10, 0) diff --git a/test/registered/jit/test_fused_add_rmsnorm.py b/test/registered/jit/test_fused_add_rmsnorm.py index 1408fefb1..8edb56345 100644 --- a/test/registered/jit/test_fused_add_rmsnorm.py +++ b/test/registered/jit/test_fused_add_rmsnorm.py @@ -8,6 +8,7 @@ from sglang.jit_kernel.utils import get_ci_test_range from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=10, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) diff --git a/test/registered/jit/test_fused_eh_norm.py b/test/registered/jit/test_fused_eh_norm.py index 967fe77fa..7149b6be7 100644 --- a/test/registered/jit/test_fused_eh_norm.py +++ b/test/registered/jit/test_fused_eh_norm.py @@ -7,7 +7,6 @@ from sglang.jit_kernel.fused_eh_norm import fused_eh_norm from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=45, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) pytestmark = pytest.mark.skipif( not torch.cuda.is_available() or torch.version.cuda is None, diff --git a/test/registered/jit/test_fused_metadata_copy.py b/test/registered/jit/test_fused_metadata_copy.py index 82b9ff6f7..c81a0b96d 100644 --- a/test/registered/jit/test_fused_metadata_copy.py +++ b/test/registered/jit/test_fused_metadata_copy.py @@ -17,7 +17,6 @@ import torch from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=100, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=400, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=100, suite="nightly-amd-kernel-1-gpu", nightly=True) # ============================================================================= diff --git a/test/registered/jit/test_fused_store_index_cache.py b/test/registered/jit/test_fused_store_index_cache.py index 1502b6822..7d8d73024 100644 --- a/test/registered/jit/test_fused_store_index_cache.py +++ b/test/registered/jit/test_fused_store_index_cache.py @@ -49,7 +49,6 @@ except ImportError: _is_fp8_fnuz = False register_cuda_ci(est_time=24, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=24, suite="nightly-amd-kernel-1-gpu", nightly=True) PAGE_SIZE = 64 diff --git a/test/registered/jit/test_fused_verify_triton_gdn.py b/test/registered/jit/test_fused_verify_triton_gdn.py index abca9a705..30e89f8d5 100644 --- a/test/registered/jit/test_fused_verify_triton_gdn.py +++ b/test/registered/jit/test_fused_verify_triton_gdn.py @@ -27,7 +27,6 @@ except ImportError: KERNELS_AVAILABLE = False register_cuda_ci(est_time=6, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=10, suite="nightly-amd-kernel-1-gpu", nightly=True) diff --git a/test/registered/jit/test_gptq_marlin.py b/test/registered/jit/test_gptq_marlin.py index 8d28ef782..62e7eb7be 100644 --- a/test/registered/jit/test_gptq_marlin.py +++ b/test/registered/jit/test_gptq_marlin.py @@ -24,7 +24,6 @@ from sglang.test.test_marlin_utils import ( ) register_cuda_ci(est_time=13, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) MNK_FACTORS = [ (1, 1, 1), diff --git a/test/registered/jit/test_gptq_marlin_repack.py b/test/registered/jit/test_gptq_marlin_repack.py index 0bb1075df..870098c4a 100644 --- a/test/registered/jit/test_gptq_marlin_repack.py +++ b/test/registered/jit/test_gptq_marlin_repack.py @@ -14,7 +14,6 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_marlin_utils import get_weight_perm, marlin_weights register_cuda_ci(est_time=16, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) MARLIN_K_CHUNKS = [128] MARLIN_N_CHUNKS = [64, 256] diff --git a/test/registered/jit/test_hadamard_jit.py b/test/registered/jit/test_hadamard_jit.py index a424fa30c..1e77fee35 100644 --- a/test/registered/jit/test_hadamard_jit.py +++ b/test/registered/jit/test_hadamard_jit.py @@ -17,7 +17,6 @@ from sglang.jit_kernel.hadamard import ( from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=128, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=512, suite="nightly-kernel-1-gpu", nightly=True) # Exact M×N Hadamard matrices (±1 entries) copied from # python/sglang/jit_kernel/csrc/fast-hadamard-transform/code_gen.py. diff --git a/test/registered/jit/test_hicache.py b/test/registered/jit/test_hicache.py index 6cebf2ec4..b2ed8a4ba 100644 --- a/test/registered/jit/test_hicache.py +++ b/test/registered/jit/test_hicache.py @@ -15,7 +15,6 @@ from sglang.srt.utils import is_cuda, is_hip, is_npu, is_xpu from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=10, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) pytestmark = pytest.mark.skipif( not torch.cuda.is_available() diff --git a/test/registered/jit/test_hisparse.py b/test/registered/jit/test_hisparse.py index 5f0c5cd87..7c80edeab 100644 --- a/test/registered/jit/test_hisparse.py +++ b/test/registered/jit/test_hisparse.py @@ -13,7 +13,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_amd_ci(est_time=30, stage="stage-b", runner_config="1-gpu-small-amd") register_cuda_ci(est_time=10, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) pytestmark = pytest.mark.skipif( not torch.cuda.is_available() diff --git a/test/registered/jit/test_moe_align_block_size.py b/test/registered/jit/test_moe_align_block_size.py index 95dbc963b..78bf6e121 100644 --- a/test/registered/jit/test_moe_align_block_size.py +++ b/test/registered/jit/test_moe_align_block_size.py @@ -11,6 +11,7 @@ from sglang.jit_kernel.utils import get_ci_test_range from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=28, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) diff --git a/test/registered/jit/test_moe_lora_align_block_size.py b/test/registered/jit/test_moe_lora_align_block_size.py index ca9915fe9..5ccb76210 100644 --- a/test/registered/jit/test_moe_lora_align_block_size.py +++ b/test/registered/jit/test_moe_lora_align_block_size.py @@ -12,7 +12,6 @@ from sglang.jit_kernel.moe_lora_align import moe_lora_align_block_size from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=28, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) def round_up(x, base): diff --git a/test/registered/jit/test_moe_wna16_marlin.py b/test/registered/jit/test_moe_wna16_marlin.py index e5c883dfc..5efbd3825 100644 --- a/test/registered/jit/test_moe_wna16_marlin.py +++ b/test/registered/jit/test_moe_wna16_marlin.py @@ -21,7 +21,6 @@ from sglang.test.test_marlin_utils import ( ) register_cuda_ci(est_time=10, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) def _has_aot_moe_wna16_marlin_gemm() -> bool: diff --git a/test/registered/jit/test_mxfp8_moe.py b/test/registered/jit/test_mxfp8_moe.py index c392d7478..1487f6748 100644 --- a/test/registered/jit/test_mxfp8_moe.py +++ b/test/registered/jit/test_mxfp8_moe.py @@ -11,7 +11,6 @@ from sglang.jit_kernel.mxfp8 import ( from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=5, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) def align(val: int, alignment: int = 128) -> int: diff --git a/test/registered/jit/test_per_tensor_quant_fp8.py b/test/registered/jit/test_per_tensor_quant_fp8.py index fdee171ce..75a389453 100644 --- a/test/registered/jit/test_per_tensor_quant_fp8.py +++ b/test/registered/jit/test_per_tensor_quant_fp8.py @@ -10,6 +10,7 @@ from sglang.jit_kernel.utils import get_ci_test_range from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=16, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) try: diff --git a/test/registered/jit/test_per_token_group_quant_8bit.py b/test/registered/jit/test_per_token_group_quant_8bit.py index 41bf4280d..41b5d7dc5 100644 --- a/test/registered/jit/test_per_token_group_quant_8bit.py +++ b/test/registered/jit/test_per_token_group_quant_8bit.py @@ -12,6 +12,7 @@ from sglang.srt.utils import is_hip from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=16, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) if not torch.cuda.is_available(): diff --git a/test/registered/jit/test_pos_enc.py b/test/registered/jit/test_pos_enc.py index e2a4f3c78..34bfaa6c5 100644 --- a/test/registered/jit/test_pos_enc.py +++ b/test/registered/jit/test_pos_enc.py @@ -11,7 +11,6 @@ from sglang.jit_kernel.rope import rotary_embedding from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=18, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) @triton.jit diff --git a/test/registered/jit/test_qknorm.py b/test/registered/jit/test_qknorm.py index c707a7fe4..a540ae3a1 100644 --- a/test/registered/jit/test_qknorm.py +++ b/test/registered/jit/test_qknorm.py @@ -9,6 +9,7 @@ from sglang.jit_kernel.utils import get_ci_test_range from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=37, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=148, suite="nightly-kernel-1-gpu", nightly=True) diff --git a/test/registered/jit/test_qknorm_across_heads.py b/test/registered/jit/test_qknorm_across_heads.py index 70daedac8..e21258b55 100644 --- a/test/registered/jit/test_qknorm_across_heads.py +++ b/test/registered/jit/test_qknorm_across_heads.py @@ -9,6 +9,7 @@ from sglang.jit_kernel.utils import get_ci_test_range from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=15, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) diff --git a/test/registered/jit/test_renorm.py b/test/registered/jit/test_renorm.py index b73513a0f..49142cfd4 100644 --- a/test/registered/jit/test_renorm.py +++ b/test/registered/jit/test_renorm.py @@ -10,7 +10,6 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=6, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) @pytest.mark.parametrize("batch_size", [1, 99, 989]) diff --git a/test/registered/jit/test_resolve_future_token_ids.py b/test/registered/jit/test_resolve_future_token_ids.py index bf46b12a5..51cde2724 100644 --- a/test/registered/jit/test_resolve_future_token_ids.py +++ b/test/registered/jit/test_resolve_future_token_ids.py @@ -7,7 +7,6 @@ from sglang.jit_kernel.resolve_future_token_ids import resolve_future_token_ids_ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=9, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=9, stage="jit-kernel-unit", runner_config="amd") diff --git a/test/registered/jit/test_rmsnorm.py b/test/registered/jit/test_rmsnorm.py index a7ba83ce4..824d77704 100644 --- a/test/registered/jit/test_rmsnorm.py +++ b/test/registered/jit/test_rmsnorm.py @@ -9,6 +9,7 @@ from sglang.srt.utils import is_hip from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=45, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=240, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=45, suite="jit-kernel-unit-test-amd") diff --git a/test/registered/jit/test_rmsnorm_hf.py b/test/registered/jit/test_rmsnorm_hf.py index f0a9eda19..8152e9456 100644 --- a/test/registered/jit/test_rmsnorm_hf.py +++ b/test/registered/jit/test_rmsnorm_hf.py @@ -14,6 +14,7 @@ from sglang.jit_kernel.utils import get_ci_test_range from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=30, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=30, stage="jit-kernel-unit", runner_config="amd") diff --git a/test/registered/jit/test_rope.py b/test/registered/jit/test_rope.py index 170739712..e1ceb7287 100644 --- a/test/registered/jit/test_rope.py +++ b/test/registered/jit/test_rope.py @@ -9,6 +9,7 @@ from sglang.srt.utils import is_hip from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=64, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=256, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=64, suite="jit-kernel-unit-test-amd") diff --git a/test/registered/jit/test_sparse_mla_q8kv8_prefill_sm90.py b/test/registered/jit/test_sparse_mla_q8kv8_prefill_sm90.py index 97319199c..13c4ec36e 100644 --- a/test/registered/jit/test_sparse_mla_q8kv8_prefill_sm90.py +++ b/test/registered/jit/test_sparse_mla_q8kv8_prefill_sm90.py @@ -10,7 +10,6 @@ from sglang.srt.utils import is_sm90_supported from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=120, stage="base-b-kernel-unit", runner_config="1-gpu-large") -register_cuda_ci(est_time=300, suite="nightly-kernel-1-gpu", nightly=True) DTYPE_FP8 = torch.float8_e4m3fn diff --git a/test/registered/jit/test_store_cache.py b/test/registered/jit/test_store_cache.py index b5496c8ce..c731da48c 100644 --- a/test/registered/jit/test_store_cache.py +++ b/test/registered/jit/test_store_cache.py @@ -9,6 +9,7 @@ from sglang.jit_kernel.utils import get_ci_test_range from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci register_cuda_ci(est_time=28, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) register_amd_ci(est_time=55, stage="jit-kernel-unit", runner_config="amd") diff --git a/test/registered/jit/test_symm_mem_all_gather.py b/test/registered/jit/test_symm_mem_all_gather.py index 069e018e9..973849a4d 100644 --- a/test/registered/jit/test_symm_mem_all_gather.py +++ b/test/registered/jit/test_symm_mem_all_gather.py @@ -35,6 +35,7 @@ from sglang.srt.distributed.device_communicators.triton_symm_mem_ag import ( from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=240, stage="base-b-kernel-unit", runner_config="8-gpu-h200") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=240, suite="nightly-kernel-8-gpu-h200", nightly=True) # --------------------------------------------------------------------------- diff --git a/test/registered/jit/test_timestep_embedding.py b/test/registered/jit/test_timestep_embedding.py index 38b4e951a..bb92a8e7d 100644 --- a/test/registered/jit/test_timestep_embedding.py +++ b/test/registered/jit/test_timestep_embedding.py @@ -17,6 +17,7 @@ from sglang.jit_kernel.utils import get_ci_test_range from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=16, stage="base-b-kernel-unit", runner_config="1-gpu-large") +# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=120, suite="nightly-kernel-1-gpu", nightly=True) CORRECTNESS_BATCH_SIZES = get_ci_test_range( diff --git a/test/registered/jit/test_tp_qknorm.py b/test/registered/jit/test_tp_qknorm.py index 03bb5dda8..c89109715 100644 --- a/test/registered/jit/test_tp_qknorm.py +++ b/test/registered/jit/test_tp_qknorm.py @@ -32,11 +32,6 @@ register_cuda_ci( stage="base-b-kernel-unit", runner_config="8-gpu-h200", ) -register_cuda_ci( - est_time=300, - suite="nightly-kernel-8-gpu-h200", - nightly=True, -) # ---------------------------------------------------------------------------