From 3d8df4b12703a92c2262de8f74e34f3212705c4a Mon Sep 17 00:00:00 2001 From: sglang-bot Date: Mon, 28 Sep 2026 00:00:30 +0000 Subject: [PATCH] chore: update CI test est_time from recent run data --- test/registered/attention/test_aiter_gluon_h12_fp8.py | 2 +- test/registered/attention/test_chunk_gated_delta_rule.py | 2 +- test/registered/attention/test_create_kvindices.py | 2 +- test/registered/attention/test_deterministic.py | 2 +- test/registered/attention/test_flash_attention_4.py | 2 +- test/registered/attention/test_hybrid_attn_backend.py | 2 +- test/registered/attention/test_kda_kernels.py | 2 +- test/registered/attention/test_normal_decode_set_metadata.py | 2 +- test/registered/attention/test_qwen35_deterministic.py | 2 +- .../attention/test_torch_native_attention_backend.py | 2 +- test/registered/attention/test_triton_sliding_window.py | 2 +- test/registered/attention/test_trtllm_mha_encoder_only.py | 2 +- test/registered/attention/test_trtllm_mha_graph_metadata.py | 2 +- test/registered/attention/test_trtllm_mha_page_table.py | 2 +- .../registered/attention/test_unified_memory_deterministic.py | 2 +- .../attention/unittests/dense/test_extend_init_contract.py | 2 +- test/registered/attention/unittests/dense/test_fa3.py | 2 +- test/registered/attention/unittests/dense/test_fa4.py | 4 ++-- test/registered/attention/unittests/dense/test_flashinfer.py | 4 ++-- .../attention/unittests/dense/test_flex_attention.py | 4 ++-- test/registered/attention/unittests/dense/test_hybrid_attn.py | 4 ++-- test/registered/attention/unittests/dense/test_tbo.py | 4 ++-- .../registered/attention/unittests/dense/test_torch_native.py | 4 ++-- test/registered/attention/unittests/dense/test_triton.py | 4 ++-- test/registered/attention/unittests/dense/test_trtllm_mha.py | 4 ++-- test/registered/attention/unittests/dsa/test_dsa.py | 4 ++-- test/registered/attention/unittests/dsv4/test_deepseek_v4.py | 2 +- test/registered/attention/unittests/gdn/test_flashinfer.py | 2 +- .../attention/unittests/gdn/test_linear_replayssm_decode.py | 2 +- test/registered/attention/unittests/gdn/test_torch_native.py | 2 +- test/registered/attention/unittests/gdn/test_triton.py | 4 ++-- .../hybrid_linear/test_flashinfer_mla_chunk_metadata.py | 2 +- .../unittests/hybrid_linear/test_kda_fused_accept_indices.py | 2 +- test/registered/attention/unittests/kda/test_triton.py | 4 ++-- test/registered/attention/unittests/lightning/test_triton.py | 2 +- test/registered/attention/unittests/mamba/test_mamba2.py | 4 ++-- .../unittests/mamba/test_replay_state_indices_validator.py | 2 +- test/registered/attention/unittests/mla/test_flashinfer.py | 2 +- .../registered/attention/unittests/mla/test_tokenspeed_mla.py | 2 +- test/registered/attention/unittests/mla/test_triton.py | 4 ++-- test/registered/attention/unittests/swa/test_flashinfer.py | 4 ++-- .../attention/unittests/swa/test_swa_out_cache_loc.py | 2 +- test/registered/attention/unittests/swa/test_torch_native.py | 4 ++-- test/registered/attention/unittests/swa/test_triton.py | 4 ++-- test/registered/backends/test_deepseek_v3_fp4_cutedsl_moe.py | 2 +- test/registered/backends/test_flashinfer_fusion_preflight.py | 2 +- test/registered/backends/test_torch_compile.py | 2 +- test/registered/basic_perf/test_eagle3_latency.py | 2 +- test/registered/basic_perf/test_embeddings_api.py | 2 +- test/registered/basic_perf/test_lora_latency.py | 2 +- test/registered/basic_perf/test_moe_throughput.py | 2 +- test/registered/basic_perf/test_pp_throughput.py | 2 +- test/registered/basic_perf/test_score_api.py | 2 +- test/registered/basic_perf/test_serving_latency.py | 2 +- test/registered/basic_perf/test_serving_throughput.py | 2 +- test/registered/basic_perf/test_torch_compile_throughput.py | 2 +- test/registered/basic_perf/test_vlm_serving_fa3.py | 2 +- test/registered/basic_perf/test_vlm_serving_flashinfer.py | 2 +- .../bench_fn/test_bench_serving_reasoning_stream.py | 2 +- test/registered/bench_fn/test_benchmark_datasets_api.py | 2 +- test/registered/bench_fn/test_steady_state_benchmark.py | 2 +- .../chunked_prefill/test_mm_chunked_embedding_unit.py | 2 +- test/registered/chunked_prefill/test_scripted_core_1gpu.py | 2 +- test/registered/chunked_prefill/test_scripted_core_4gpu.py | 2 +- test/registered/chunked_prefill/test_scripted_swa_1gpu.py | 2 +- .../constrained_decoding/test_constrained_decoding.py | 2 +- test/registered/core/test_basic_sanity.py | 2 +- test/registered/core/test_basic_sanity_dflash.py | 2 +- test/registered/core/test_basic_sanity_dspark.py | 2 +- test/registered/core/test_basic_sanity_eagle3.py | 2 +- test/registered/core/test_engine_child_pids.py | 2 +- test/registered/core/test_hidden_states.py | 2 +- test/registered/core/test_no_extra_forked_cuda_context.py | 2 +- test/registered/core/test_request_queue_validation.py | 2 +- test/registered/core/test_srt_empty_deps.py | 2 +- test/registered/core/test_srt_endpoint.py | 2 +- test/registered/core/test_srt_engine.py | 2 +- test/registered/cp/test_cp_strategy_unit.py | 2 +- test/registered/cp/test_deepseek_v3_cp_single_node.py | 2 +- test/registered/cp/test_deepseek_v4_flash_fp4_b200_cp.py | 2 +- test/registered/cp/test_dsa_prefill_cp.py | 2 +- test/registered/cp/test_gpt_oss_4gpu_mxfp4_cp.py | 2 +- test/registered/cp/test_gqa_prefill_cp.py | 2 +- .../breakable/test_bcg_with_speculative_decoding.py | 2 +- .../cuda_graph/breakable/test_breakable_cuda_graph.py | 2 +- .../cuda_graph/full_prefill/test_full_cuda_graph_prefill.py | 2 +- test/registered/cuda_graph/test_cuda_piecewise_backend.py | 2 +- test/registered/dcp/test_dcp_layout_unit.py | 2 +- test/registered/dcp/test_dsv31_dcp8_gsm8k.py | 2 +- test/registered/dcp/test_kimi_linear_dcp4.py | 2 +- test/registered/dcp/test_kimi_linear_dcp_dspark4.py | 2 +- test/registered/debug_utils/test_tensor_dump_forward_hook.py | 2 +- test/registered/disaggregation/test_disaggregation_aarch64.py | 2 +- test/registered/disaggregation/test_disaggregation_basic.py | 2 +- .../test_disaggregation_chunked_prefill_abort.py | 2 +- .../disaggregation/test_disaggregation_decode_radix_cache.py | 2 +- .../test_disaggregation_decode_radix_cache_swa.py | 2 +- .../disaggregation/test_disaggregation_different_tp.py | 2 +- .../disaggregation/test_disaggregation_dp_attention.py | 2 +- test/registered/disaggregation/test_disaggregation_dsv4.py | 2 +- .../disaggregation/test_disaggregation_dwdp_gpt_oss.py | 2 +- .../registered/disaggregation/test_disaggregation_hisparse.py | 2 +- .../disaggregation/test_disaggregation_hybrid_attention.py | 2 +- .../disaggregation/test_disaggregation_inkling_mxfp8.py | 2 +- .../disaggregation/test_disaggregation_kimi_linear.py | 2 +- test/registered/disaggregation/test_disaggregation_nixl.py | 2 +- .../disaggregation/test_disaggregation_optimistic_prefill.py | 2 +- test/registered/disaggregation/test_disaggregation_pp.py | 2 +- .../disaggregation/test_disaggregation_rust_server.py | 2 +- .../disaggregation/test_disaggregation_unified_memory.py | 2 +- test/registered/disaggregation/test_epd_disaggregation.py | 2 +- test/registered/dllm/test_dllm_fdfo_joint_threshold.py | 2 +- test/registered/dp_attn/test_dp_attention.py | 2 +- test/registered/dp_attn/test_dp_attention_bcg_kl.py | 2 +- test/registered/dp_engine/test_data_parallelism.py | 2 +- .../registered/e2e/disaggregation/test_disaggregation_lora.py | 2 +- .../disaggregation/test_disaggregation_unified_memory_swa.py | 2 +- .../disaggregation/test_disaggregation_unified_memory_tri.py | 2 +- .../e2e/dp_attn/test_dp_attention_local_control_broadcast.py | 2 +- test/registered/e2e/gdn/test_qwen35_gdn_multi_item_scoring.py | 2 +- test/registered/e2e/hicache/test_hicache_storage_lora.py | 2 +- test/registered/e2e/hicache/test_hicache_unified_memory.py | 2 +- test/registered/e2e/layers/test_logprob_memory_distributed.py | 2 +- test/registered/e2e/lora/test_lora_moe_prefill_cuda_graph.py | 2 +- test/registered/e2e/models/test_compressed_tensors_models.py | 2 +- test/registered/e2e/models/test_deepseek_v3_fp4.py | 2 +- test/registered/e2e/models/test_deepseek_v3_mtp.py | 2 +- test/registered/e2e/models/test_deepseek_v4_flash_fp4_b200.py | 2 +- .../e2e/models/test_deepseek_v4_flash_fp4_b200_trtllm.py | 2 +- test/registered/e2e/models/test_deepseek_v4_flash_fp4_h200.py | 2 +- .../e2e/models/test_deepseek_v4_flash_fp4_megamoe_b200.py | 2 +- test/registered/e2e/models/test_deepseek_v4_flash_fp8_h200.py | 2 +- test/registered/e2e/models/test_dsa_glm52_hisparse.py | 2 +- .../e2e/models/test_dsa_glm52_pd_mtp_cp_layersplit.py | 2 +- .../e2e/models/test_gemma4_fp8_per_expert_loading.py | 2 +- test/registered/e2e/models/test_generation_models.py | 2 +- test/registered/e2e/models/test_glm53_flash_b200.py | 2 +- test/registered/e2e/models/test_glm53_flash_h200.py | 2 +- test/registered/e2e/models/test_gpt_oss_4gpu_mxfp4.py | 2 +- test/registered/e2e/models/test_gpt_oss_sm120.py | 2 +- test/registered/e2e/models/test_inkling.py | 2 +- test/registered/e2e/models/test_inkling_small_nvfp4.py | 2 +- test/registered/e2e/models/test_inkling_unified.py | 2 +- test/registered/e2e/models/test_kimi_k3_b300.py | 2 +- test/registered/e2e/models/test_kimi_k3_b300_low_latency.py | 2 +- test/registered/e2e/models/test_kimi_linear_models.py | 2 +- .../models/test_kimi_linear_unified_memory_dcp_blackwell.py | 2 +- test/registered/e2e/models/test_layernorm_sp.py | 2 +- test/registered/e2e/models/test_mimo_v2.py | 2 +- test/registered/e2e/models/test_mimo_v2_flash.py | 2 +- test/registered/e2e/models/test_minimax_m25_basic.py | 2 +- test/registered/e2e/models/test_ministral4_models.py | 2 +- test/registered/e2e/models/test_nvidia_nemotron_3_nano.py | 2 +- .../e2e/models/test_nvidia_nemotron_3_super_bf16_mtp.py | 2 +- test/registered/e2e/models/test_qwen35_fp4_mtp.py | 2 +- test/registered/e2e/models/test_qwen3_next_models.py | 2 +- test/registered/e2e/models/test_qwen3_next_models_extra.py | 2 +- test/registered/e2e/models/test_qwen3_next_models_mtp.py | 2 +- test/registered/e2e/models/test_qwen4_exp_models.py | 2 +- test/registered/e2e/models/test_step3p5_flash_chain_mtp.py | 2 +- test/registered/e2e/models/test_transformers_backend_eval.py | 2 +- test/registered/e2e/models/test_transformers_models.py | 2 +- test/registered/e2e/models/test_vlm_models.py | 2 +- .../e2e/models_large/test_deepseek_v32_indexcache.py | 2 +- .../e2e/models_large/test_deepseek_v3_cutedsl_4gpu.py | 2 +- test/registered/e2e/pp/test_pp_spec.py | 2 +- test/registered/e2e/pp/test_pp_spec_embed_scan.py | 2 +- test/registered/e2e/speculative/test_dflash_domino.py | 2 +- test/registered/ep/test_deepep_large.py | 2 +- test/registered/ep/test_deepep_small.py | 2 +- test/registered/ep/test_deepep_small_extra.py | 2 +- test/registered/ep/test_flashinfer_a2a.py | 2 +- test/registered/ep/test_routed_experts_dp_readback.py | 2 +- test/registered/ep/test_tbo_shared_experts_fusion.py | 2 +- test/registered/eplb/test_lplb_distributed.py | 2 +- test/registered/expert_pack/test_expert_pack_mxfp4.py | 2 +- test/registered/expert_pack/test_expert_pack_runtime.py | 2 +- test/registered/expert_pack/test_kimi_k3_gguf.py | 2 +- test/registered/function_call/test_kimik3_detector.py | 2 +- test/registered/gemm/test_hopper_bf16_gemv.py | 2 +- test/registered/gemm/test_linear_bf16_fp32_hpc.py | 2 +- test/registered/hicache/test_hicache_spec_file_storage.py | 2 +- test/registered/hicache/test_hicache_spec_mooncake_storage.py | 2 +- test/registered/hicache/test_hicache_storage.py | 2 +- test/registered/hicache/test_hicache_storage_3fs_backend.py | 2 +- test/registered/hicache/test_hicache_storage_file_backend.py | 2 +- .../hicache/test_hicache_storage_mooncake_backend.py | 2 +- .../hicache/test_hicache_storage_runtime_attach_detach.py | 2 +- test/registered/hicache/test_hicache_variants.py | 2 +- test/registered/hicache/test_qwen35_hicache.py | 2 +- .../kernels/benchmark/gemm/bench_kda_fp8_skinny_gemm.py | 2 +- test/registered/kernels/ops/attention/test_dsa_indexer.py | 2 +- .../kernels/ops/attention/test_dsv32_indexer_fusion.py | 2 +- .../kernels/ops/attention/test_dsv4_indexer_quant.py | 2 +- test/registered/kernels/ops/attention/test_kda_prefill.py | 2 +- .../kernels/ops/attention/test_sm120_paged_mqa_logits.py | 2 +- .../kernels/ops/communication/test_symm_mem_all_gather.py | 2 +- test/registered/kernels/ops/diffusion/test_sites.py | 2 +- .../kernels/ops/embeddings/test_vocab_parallel_embedding.py | 2 +- test/registered/kernels/ops/gemm/test_sm120_fp8_linear.py | 2 +- test/registered/kernels/ops/kimi_k3/test_collectives.py | 2 +- test/registered/kernels/ops/kv_canary/test_utils.py | 2 +- test/registered/kernels/ops/kvcache/test_hicache.py | 2 +- .../kernels/ops/kvcache/test_hicache_page_first_write_back.py | 2 +- .../kernels/ops/kvcache/test_kvcacheio_asymmetric.py | 2 +- test/registered/kernels/ops/layernorm/test_fused_op.py | 2 +- .../kernels/ops/layernorm/test_fused_op_gpu_parity.py | 2 +- .../kernels/ops/layernorm/test_kernels_namespace.py | 2 +- test/registered/kernels/ops/layernorm/test_mhc_kernels.py | 2 +- test/registered/kernels/ops/moe/test_moe_wna16_marlin.py | 2 +- test/registered/kernels/ops/quantization/test_nvfp4_marlin.py | 4 ++-- .../kernels/ops/speculative/test_boundary_kv_fix_kernels.py | 2 +- test/registered/kv_canary/test_self_e2e_baseline.py | 2 +- test/registered/kv_canary/test_self_e2e_bench_speed.py | 2 +- test/registered/kv_canary/test_self_e2e_pd_baseline.py | 2 +- test/registered/kv_canary/test_self_e2e_pd_perturb.py | 2 +- test/registered/kv_canary/test_self_e2e_perturb_raise.py | 2 +- .../kv_canary/test_self_e2e_perturb_real_kv_unused_cache.py | 2 +- .../kv_canary/test_self_e2e_perturb_real_kv_used.py | 2 +- .../kv_canary/test_self_e2e_perturb_req_to_token.py | 2 +- test/registered/kv_canary/test_self_e2e_pp_baseline.py | 2 +- test/registered/kv_canary/test_self_e2e_pp_perturb.py | 2 +- test/registered/kv_canary/test_self_e2e_pr_25015.py | 2 +- test/registered/kv_canary/test_self_e2e_pr_26329.py | 2 +- test/registered/kv_canary/test_self_unit_buffer_alloc.py | 2 +- test/registered/kv_canary/test_self_unit_capacities.py | 2 +- test/registered/kv_canary/test_self_unit_capture_refusal.py | 2 +- test/registered/kv_canary/test_self_unit_endpoint.py | 2 +- test/registered/kv_canary/test_self_unit_future_tensor.py | 2 +- test/registered/kv_canary/test_self_unit_perturb.py | 2 +- test/registered/kv_canary/test_self_unit_pool_patcher.py | 2 +- .../registered/kv_canary/test_self_unit_pool_patcher_utils.py | 2 +- test/registered/kv_canary/test_self_unit_radix_walker.py | 2 +- .../test_self_unit_req_to_expected_token_ids_manager.py | 2 +- test/registered/kv_canary/test_self_unit_runner_health.py | 2 +- .../kv_canary/test_self_unit_runner_swa_divergence.py | 2 +- test/registered/kv_canary/test_self_unit_runner_sweep.py | 2 +- .../registered/kv_canary/test_self_unit_sweep_plan_builder.py | 2 +- test/registered/kv_canary/test_self_unit_token_oracle.py | 2 +- test/registered/kv_canary/test_self_unit_violation.py | 2 +- test/registered/layers/mamba/test_causal_conv1d.py | 2 +- test/registered/layers/mamba/test_mamba2_mixer.py | 2 +- test/registered/layers/mamba/test_mamba_slot_fused.py | 2 +- test/registered/layers/mamba/test_mamba_ssm.py | 2 +- test/registered/layers/mamba/test_mamba_ssm_ssd.py | 2 +- test/registered/layers/test_layernorm_fusion.py | 2 +- test/registered/lora/test_fused_moe_lora_kernel.py | 2 +- test/registered/lora/test_lora_drainer.py | 2 +- test/registered/lora/test_lora_gpt_oss_20b_logprob_diff.py | 2 +- test/registered/lora/test_lora_moe_tp_logprob_diff.py | 2 +- .../lora/test_lora_nemotron_3_super_120b_a12b_logprob_diff.py | 2 +- test/registered/lora/test_lora_overlap_loading.py | 2 +- test/registered/lora/test_lora_qwen3_8b_logprob_diff.py | 2 +- test/registered/lora/test_lora_spec_decoding.py | 2 +- test/registered/lora/test_moe_lora_info.py | 2 +- test/registered/lora/test_multi_lora_backend.py | 2 +- test/registered/lora/test_virtual_experts_kernels.py | 2 +- test/registered/mem_cache/test_int8_checkpoint_store.py | 2 +- test/registered/mem_cache/test_post_capture_kv_sizing.py | 2 +- test/registered/mla/test_mla_fp8.py | 2 +- test/registered/mla/test_mla_int8_deepseek_v3.py | 2 +- test/registered/mock_model/test_e2e_cp.py | 2 +- test/registered/mock_model/test_e2e_pd.py | 2 +- test/registered/mock_model/test_e2e_pp.py | 2 +- test/registered/mock_model/test_e2e_spec_eagle.py | 2 +- .../mock_model/test_self_e2e_perturb_next_token_swap.py | 2 +- test/registered/mock_model/test_self_unit_canary_perturb.py | 2 +- test/registered/mock_model/test_self_unit_oracle.py | 2 +- test/registered/model_loading/test_external_models.py | 2 +- .../model_loading/test_load_weights_from_remote_instance.py | 2 +- test/registered/model_loading/test_startup_weight_load.py | 2 +- test/registered/model_loading/test_utils_update_weights.py | 2 +- test/registered/model_loading/test_weight_cache_daemon.py | 4 ++-- test/registered/model_loading/test_weight_loader_v2_e2e.py | 2 +- test/registered/moe/test_cutedsl_moe.py | 2 +- test/registered/moe/test_flashinfer_a2a_cutedsl_v2.py | 2 +- .../moe/test_fused_append_remap_per_rank_shared_slots.py | 2 +- test/registered/moe/test_fused_append_shared_experts.py | 2 +- test/registered/moe/test_fused_append_shared_experts_top6.py | 2 +- test/registered/moe/test_fused_moe.py | 2 +- test/registered/moe/test_hpc_ops_moe.py | 2 +- test/registered/moe/test_moe_ep.py | 2 +- test/registered/moe/test_topk_padded_region.py | 2 +- test/registered/moe/test_topk_renormalize_degenerate.py | 2 +- test/registered/moe/test_torch_compile_moe.py | 2 +- test/registered/moe/test_triton_moe_channel_fp8_kernel.py | 2 +- test/registered/moe/test_zero_experts.py | 2 +- test/registered/observability/test_encoder_server_metrics.py | 2 +- test/registered/observability/test_metrics.py | 2 +- test/registered/observability/test_tracing.py | 2 +- test/registered/openai_server/basic/test_http2_server.py | 2 +- .../openai_server/basic/test_openai_completion_rust.py | 2 +- test/registered/openai_server/basic/test_openai_server.py | 2 +- .../openai_server/basic/test_serving_transcription.py | 2 +- .../features/test_openai_server_hidden_states.py | 2 +- .../function_call/test_openai_function_calling.py | 2 +- .../openai_server/validation/test_large_max_new_tokens.py | 2 +- test/registered/openai_server/validation/test_matched_stop.py | 2 +- .../validation/test_request_length_validation.py | 2 +- test/registered/page_major/test_page_major_gpt_oss.py | 2 +- test/registered/page_major/test_page_major_qwen_hybrid.py | 2 +- test/registered/pp/test_pp_gemma4.py | 2 +- test/registered/pp/test_pp_parallel_compat.py | 2 +- test/registered/pp/test_pp_single_node.py | 2 +- test/registered/pp/test_pp_single_node_extra.py | 2 +- test/registered/prefill_only/test_embedding_models.py | 2 +- test/registered/prefill_only/test_multi_item_scoring.py | 2 +- test/registered/prefill_only/test_pooled_hidden_states.py | 2 +- test/registered/prefill_only/test_reward_models.py | 2 +- test/registered/prefill_only/test_score_api.py | 2 +- test/registered/prefill_only/test_score_engine.py | 2 +- test/registered/prefill_only/test_serving_rerank.py | 2 +- test/registered/quant/test_autoround_quantization.py | 2 +- test/registered/quant/test_awq.py | 2 +- test/registered/quant/test_fp8_kernel.py | 2 +- test/registered/quant/test_fp8kv_triton.py | 2 +- test/registered/quant/test_gguf.py | 2 +- test/registered/quant/test_gptqmodel_dynamic.py | 2 +- test/registered/quant/test_int8_kernel.py | 2 +- test/registered/quant/test_is_layer_skipped.py | 2 +- test/registered/quant/test_marlin_moe.py | 2 +- test/registered/quant/test_nvfp4_embedding.py | 2 +- test/registered/quant/test_nvfp4_gemm_sm120.py | 2 +- test/registered/quant/test_quant_config_parsing.py | 2 +- test/registered/quant/test_triton_scaled_mm.py | 2 +- test/registered/quant/test_w8a8_quantization.py | 2 +- test/registered/radix_cache/test_int8_mamba_checkpoint_e2e.py | 2 +- test/registered/radix_cache/test_mamba2_extra_buffer_kl.py | 2 +- test/registered/radix_cache/test_swa_radix_cache_kl.py | 2 +- .../linker/test_unified_cache_linker_kl_dsv4.py | 2 +- .../linker/test_unified_cache_linker_kl_glm52.py | 2 +- .../unified_radix_tree/test_unified_radix_cache_kl_cp.py | 2 +- .../unified_radix_tree/test_unified_radix_cache_kl_dcp.py | 2 +- .../unified_radix_tree/test_unified_radix_cache_kl_dsv4.py | 2 +- .../unified_radix_tree/test_unified_radix_cache_kl_dsv4_pp.py | 2 +- .../unified_radix_tree/test_unified_radix_cache_kl_full.py | 2 +- .../unified_radix_tree/test_unified_radix_cache_kl_glm52.py | 2 +- .../test_unified_radix_cache_kl_hybrid_bitexact.py | 2 +- .../unified_radix_tree/test_unified_radix_cache_kl_mamba.py | 2 +- .../unified_radix_tree/test_unified_radix_cache_kl_swa.py | 2 +- test/registered/reasoning/test_reasoning.py | 2 +- test/registered/rl/test_lora_load_from_tensor.py | 2 +- .../rl/test_multi_instance_release_memory_occupation.py | 2 +- test/registered/rl/test_patch_torch.py | 2 +- .../registered/rl/test_pause_generation_tensor_consistency.py | 2 +- test/registered/rl/test_return_indexer_topk.py | 2 +- test/registered/rl/test_return_routed_experts.py | 2 +- test/registered/rl/test_update_weights_from_disk_blackwell.py | 2 +- test/registered/rl/test_update_weights_from_distributed.py | 2 +- test/registered/rl/test_update_weights_from_tensor.py | 2 +- test/registered/rotary/test_mrope_axis_map.py | 2 +- test/registered/rotary/test_rope_cache_invalidation.py | 2 +- test/registered/rust/test_run_rust_tests.py | 2 +- test/registered/rust/test_run_sglang_radix_tree_rust_tests.py | 2 +- test/registered/rust/test_rust_extension.py | 2 +- test/registered/sampling/test_original_logprobs.py | 2 +- test/registered/sampling/test_sampling_mask.py | 2 +- test/registered/scheduler/test_abort_with_metrics.py | 2 +- test/registered/scheduler/test_load_snapshot_server.py | 2 +- test/registered/scheduler/test_min_free_slots_delayer.py | 2 +- test/registered/scheduler/test_mixed_chunked_prefill.py | 2 +- test/registered/scheduler/test_priority_scheduling.py | 2 +- test/registered/scheduler/test_retract_decode.py | 2 +- test/registered/scheduler/test_retract_decode_logprob.py | 2 +- test/registered/scheduler/test_scheduler_control.py | 2 +- .../registered/scripted_runtime/test_scripted_runtime_core.py | 2 +- test/registered/sessions/test_session_control.py | 2 +- test/registered/sessions/test_session_latency.py | 2 +- test/registered/sessions/test_streaming_session.py | 2 +- test/registered/sessions/test_streaming_session_extra.py | 2 +- test/registered/sessions/test_streaming_session_swa.py | 2 +- test/registered/spec/dflash/test_dflash.py | 2 +- .../spec/dspark/test_dspark_block_accept_estimator.py | 2 +- test/registered/spec/dspark/test_dspark_confidence_metrics.py | 2 +- test/registered/spec/dspark/test_dspark_dp_tier.py | 2 +- test/registered/spec/dspark/test_dspark_draft_path_default.py | 2 +- test/registered/spec/dspark/test_dspark_info_dumper.py | 2 +- test/registered/spec/dspark/test_dspark_scheduler.py | 2 +- test/registered/spec/dspark/test_dspark_sps_profiler.py | 2 +- test/registered/spec/dspark/test_dspark_sps_table.py | 2 +- .../spec/dspark/test_dspark_stacked_ctx_kv_parity.py | 2 +- test/registered/spec/dspark/test_dspark_sts.py | 2 +- test/registered/spec/dspark/test_ragged_verify.py | 2 +- test/registered/spec/eagle/test_adaptive_speculative.py | 2 +- test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py | 2 +- test/registered/spec/eagle/test_eagle_constrained_decoding.py | 2 +- test/registered/spec/eagle/test_eagle_reject_sampling.py | 2 +- test/registered/spec/eagle/test_spec_eagle.py | 2 +- test/registered/spec/eagle/test_spec_eagle_fa3.py | 2 +- test/registered/spec/eagle/test_spec_eagle_page.py | 2 +- test/registered/spec/eagle/test_spec_eagle_parity.py | 2 +- test/registered/spec/eagle/test_spec_eagle_stress.py | 2 +- test/registered/spec/eagle/test_spec_eagle_topk.py | 2 +- test/registered/spec/eagle/test_spec_eagle_topk_page.py | 2 +- test/registered/spec/eagle/test_spec_eagle_triton.py | 2 +- .../spec/test_constrained_decoding_spec_reasoning.py | 2 +- test/registered/spec/test_frozen_kv_mtp.py | 2 +- test/registered/spec/test_gemma4_dflash_31b_extra.py | 2 +- test/registered/spec/test_gemma4_mtp_31b_extra.py | 2 +- test/registered/spec/test_spec_mixed_chunk.py | 2 +- test/registered/spec/test_spec_ngram.py | 2 +- test/registered/spec/test_spec_ngram_extra.py | 2 +- test/registered/spec/test_spec_standalone_extra.py | 2 +- test/registered/spec/utils/test_build_eagle_tree.py | 2 +- test/registered/tokenizer/test_multi_tokenizer.py | 2 +- test/registered/tokenizer/test_skip_tokenizer_init.py | 2 +- .../unit/batch_overlap/test_tbo_children_dummy_token_mask.py | 2 +- .../batch_overlap/test_tbo_cuda_graph_num_token_device.py | 2 +- .../unit/batch_overlap/test_tbo_filter_batch_marker.py | 2 +- test/registered/unit/beam_search/test_beam_search_core.py | 2 +- test/registered/unit/beam_search/test_fork.py | 2 +- test/registered/unit/beam_search/test_output_decode.py | 2 +- test/registered/unit/bench/test_benchmark_endpoint.py | 2 +- test/registered/unit/bench/test_mmmu_eval_utils.py | 2 +- .../unit/checkpoint_engine/test_checkpoint_engine_worker.py | 2 +- test/registered/unit/cli/test_serve_backends.py | 2 +- .../unit/compilation/test_torch_compile_decoration.py | 2 +- test/registered/unit/configs/test_cohere2_moe_config.py | 2 +- test/registered/unit/configs/test_embedding_model_spec.py | 2 +- test/registered/unit/configs/test_laguna_config.py | 2 +- .../unit/configs/test_linear_attn_model_registry.py | 2 +- test/registered/unit/configs/test_locate_anything_config.py | 2 +- test/registered/unit/configs/test_minicpm_config.py | 2 +- test/registered/unit/configs/test_model_config.py | 2 +- .../unit/configs/test_model_config_parser_registry.py | 2 +- test/registered/unit/configs/test_model_config_scaling.py | 2 +- test/registered/unit/configs/test_model_config_shapes.py | 2 +- .../unit/configs/test_multimodal_piecewise_cuda_graph.py | 2 +- test/registered/unit/configs/test_nano_nemotron_vl_config.py | 2 +- test/registered/unit/configs/test_zaya_config.py | 2 +- .../unit/constrained/test_llguidance_batched_mask.py | 2 +- .../unit/constrained/test_mistral_common_xgrammar.py | 2 +- .../unit/disaggregation/test_admission_abort_not_enqueued.py | 2 +- test/registered/unit/disaggregation/test_dcp_pack.py | 2 +- .../unit/disaggregation/test_decode_hicache_tree_core.py | 2 +- .../unit/disaggregation/test_decode_queue_cleanup.py | 2 +- .../unit/disaggregation/test_decode_req_to_token_pool.py | 2 +- .../unit/disaggregation/test_deferred_decode_kv_release.py | 2 +- .../unit/disaggregation/test_disaggregation_wire.py | 2 +- test/registered/unit/disaggregation/test_encode_receiver.py | 2 +- test/registered/unit/disaggregation/test_encode_server.py | 2 +- test/registered/unit/disaggregation/test_encoder_health.py | 2 +- test/registered/unit/disaggregation/test_encoder_scheduler.py | 2 +- test/registered/unit/disaggregation/test_fake_kv_sender.py | 2 +- .../unit/disaggregation/test_kimi_k3_encoder_mode.py | 2 +- test/registered/unit/disaggregation/test_kv_events.py | 2 +- .../unit/disaggregation/test_kv_transfer_replica_metric.py | 2 +- .../test_minimax_sparse_disagg_state_kv_args.py | 2 +- .../disaggregation/test_mooncake_custom_mem_pool_batch.py | 2 +- .../unit/disaggregation/test_mooncake_transfer_batching.py | 2 +- .../registered/unit/disaggregation/test_nixl_backend_basic.py | 2 +- .../unit/disaggregation/test_nixl_deferred_kv_release.py | 2 +- .../unit/disaggregation/test_nixl_sender_failure_cleanup.py | 2 +- test/registered/unit/disaggregation/test_pd_role_switch.py | 2 +- .../unit/disaggregation/test_pp_hybrid_kv_transfer.py | 2 +- .../registered/unit/disaggregation/test_pp_mla_kv_transfer.py | 2 +- .../unit/disaggregation/test_prefill_abort_result_cleanup.py | 2 +- .../unit/disaggregation/test_receiver_connection_pool.py | 2 +- .../unit/disaggregation/test_register_to_bootstrap.py | 2 +- .../unit/disaggregation/test_specv2_kvcache_offloading.py | 2 +- .../unit/disaggregation/test_staging_draft_kv_slots.py | 2 +- .../unit/disaggregation/test_unified_memory_move_gate.py | 2 +- test/registered/unit/distributed/test_cuda_wrapper.py | 2 +- .../unit/distributed/test_custom_all_reduce_v2_capability.py | 2 +- test/registered/unit/distributed/test_gated_launch.py | 2 +- .../unit/distributed/test_get_default_distributed_backend.py | 2 +- test/registered/unit/distributed/test_parallel_state.py | 2 +- test/registered/unit/distributed/test_pp_comm_overlap.py | 2 +- test/registered/unit/entrypoints/anthropic/test_serving.py | 2 +- .../registered/unit/entrypoints/openai/test_audio_chunking.py | 2 +- .../unit/entrypoints/openai/test_chat_prompt_round_trip.py | 2 +- test/registered/unit/entrypoints/openai/test_exa_search.py | 2 +- test/registered/unit/entrypoints/openai/test_matched_stop.py | 2 +- test/registered/unit/entrypoints/openai/test_protocol.py | 2 +- .../unit/entrypoints/openai/test_responses_custom_tools.py | 2 +- .../unit/entrypoints/openai/test_responses_protocol.py | 2 +- test/registered/unit/entrypoints/openai/test_serving_chat.py | 2 +- .../unit/entrypoints/openai/test_serving_completions.py | 2 +- .../unit/entrypoints/openai/test_serving_embedding.py | 2 +- .../unit/entrypoints/openai/test_serving_responses.py | 2 +- .../unit/entrypoints/openai/test_serving_responses_stream.py | 2 +- .../unit/entrypoints/openai/test_serving_transcription.py | 2 +- .../unit/entrypoints/openai/test_transcription_adapters.py | 2 +- .../unit/entrypoints/openai/test_whisper_adapter.py | 2 +- test/registered/unit/entrypoints/test_grpc_bridge.py | 2 +- test/registered/unit/entrypoints/test_http2_server_config.py | 2 +- test/registered/unit/entrypoints/test_http_server_warmup.py | 2 +- test/registered/unit/entrypoints/test_ready.py | 2 +- test/registered/unit/entrypoints/test_rust_server_dp_ports.py | 2 +- test/registered/unit/entrypoints/test_server_info.py | 2 +- test/registered/unit/entrypoints/test_server_warmup.py | 2 +- test/registered/unit/entrypoints/test_ssl_cert_refresher.py | 2 +- test/registered/unit/entrypoints/test_v1_loads_aggregate.py | 2 +- test/registered/unit/eplb/test_balanced_packing.py | 2 +- .../test_compute_logical_to_rank_dispatch_physical_map.py | 2 +- test/registered/unit/eplb/test_dispatch_dtype_preservation.py | 2 +- test/registered/unit/eplb/test_waterfill_eplb.py | 2 +- .../unit/function_call/test_deepseekv41_detector.py | 2 +- test/registered/unit/function_call/test_dots_detector.py | 2 +- .../unit/function_call/test_function_call_parser.py | 2 +- test/registered/unit/function_call/test_glm47_schema_types.py | 2 +- test/registered/unit/function_call/test_hunyuan_detector.py | 2 +- test/registered/unit/function_call/test_k2_v3_detector.py | 2 +- .../unit/function_call/test_kimik3_structural_tag.py | 2 +- .../registered/unit/function_call/test_minimax_m3_detector.py | 2 +- .../registered/unit/function_call/test_muse_glimmer_format.py | 2 +- test/registered/unit/function_call/test_spark25_detector.py | 2 +- .../registered/unit/hardware_backend/mlx/test_fused_swiglu.py | 2 +- .../hardware_backend/mlx/test_mlx_quantization_override.py | 2 +- .../unit/hardware_backend/mlx/test_mlx_remote_code_gate.py | 2 +- test/registered/unit/kernels/test_fused_op_dispatch.py | 2 +- test/registered/unit/kernels/test_jit_cache.py | 2 +- .../unit/layers/attention/linear/kernels/test_kda_nvidia.py | 2 +- .../unit/layers/attention/linear/kernels/test_kda_ptx.py | 2 +- .../unit/layers/attention/test_aiter_fp8_asm_gqa.py | 2 +- .../unit/layers/attention/test_dots_hybrid_backend.py | 2 +- .../unit/layers/attention/test_dsa_mqa_logits_chunking.py | 2 +- .../layers/attention/test_encoder_decoder_varlen_gather.py | 2 +- .../layers/attention/test_flashattention_graph_metadata.py | 2 +- .../unit/layers/attention/test_gdn_flashinfer_alignment.py | 2 +- .../unit/layers/attention/test_gdn_prefill_backend_policy.py | 2 +- .../registered/unit/layers/attention/test_index_topk_share.py | 2 +- .../unit/layers/attention/test_kda_helion_dispatcher.py | 2 +- test/registered/unit/layers/attention/test_kv_shard_hooks.py | 2 +- .../unit/layers/attention/test_kv_translate_ownership.py | 2 +- .../unit/layers/attention/test_linear_attn_config.py | 2 +- .../unit/layers/attention/test_mamba_track_state_dtype.py | 2 +- .../unit/layers/attention/test_mla_decode_geometry.py | 2 +- .../unit/layers/attention/test_triton_verify_metadata.py | 2 +- test/registered/unit/layers/attention/test_verify_mask.py | 2 +- .../unit/layers/attention/test_vision_backend_selection.py | 2 +- .../unit/layers/attention/test_vision_max_seqlen.py | 2 +- test/registered/unit/layers/attention/test_vision_seqlens.py | 2 +- .../unit/layers/attention/test_vision_strided_qkv.py | 2 +- .../unit/layers/moe/test_copy_weight_views_before_h2d.py | 2 +- .../unit/layers/moe/test_deepep_v2_buffer_lifecycle.py | 2 +- test/registered/unit/layers/moe/test_deepep_v2_masked_slab.py | 2 +- test/registered/unit/layers/moe/test_deepep_v2_wire_dtype.py | 2 +- test/registered/unit/layers/moe/test_flashinfer_dispatcher.py | 2 +- test/registered/unit/layers/moe/test_flashinfer_megamoe.py | 2 +- .../registered/unit/layers/moe/test_fused_moe_common_utils.py | 2 +- test/registered/unit/layers/moe/test_fused_moe_native.py | 2 +- .../unit/layers/moe/test_fused_moe_triton_config.py | 2 +- .../unit/layers/moe/test_fused_shared_expert_scaling.py | 2 +- .../unit/layers/moe/test_topk_correction_bias_cache.py | 4 ++-- test/registered/unit/layers/moe/test_w4afp8_deepep_dtype.py | 2 +- .../unit/layers/moe/test_w4afp8_deepep_post_reorder.py | 2 +- .../unit/layers/moe/test_w4afp8_requant_geometry.py | 2 +- .../unit/layers/quantization/test_bf16_splitk_gemm.py | 2 +- .../layers/quantization/test_compressed_tensors_kv_cache.py | 2 +- .../layers/quantization/test_compressed_tensors_lm_head.py | 2 +- .../quantization/test_compressed_tensors_mixed_precision.py | 2 +- .../test_compressed_tensors_wna16_moe_no_linear.py | 2 +- .../unit/layers/quantization/test_deepgemm_ue8m0_requant.py | 2 +- .../quantization/test_flashinfer_trtllm_fp8_fallback.py | 2 +- .../layers/quantization/test_fp4_kv_cache_quant_method.py | 2 +- .../layers/quantization/test_fp8_blockwise_linear_backends.py | 4 ++-- .../unit/layers/quantization/test_fp8_moe_runner_fallback.py | 2 +- .../unit/layers/quantization/test_fp8_moe_runner_ownership.py | 2 +- .../unit/layers/quantization/test_fp8_moe_weight_gating.py | 2 +- .../unit/layers/quantization/test_fp8_utils_mxfp4.py | 2 +- .../unit/layers/quantization/test_humming_w4afp8_schemas.py | 2 +- .../unit/layers/quantization/test_marlin_utils_fp8.py | 2 +- .../unit/layers/quantization/test_modelopt_nvfp4.py | 2 +- .../layers/quantization/test_modelopt_nvfp4_moe_dispatch.py | 2 +- .../layers/quantization/test_modelopt_nvfp4_moe_scales.py | 2 +- .../quantization/test_mxfp4_flashinfer_activation_prep.py | 2 +- .../unit/layers/quantization/test_mxfp4_sm100_trtllm_gen.py | 2 +- .../unit/layers/quantization/test_mxfp4_sm120_cutlass.py | 2 +- .../unit/layers/quantization/test_mxfp4_sm90_cutlass.py | 2 +- .../unit/layers/quantization/test_nvfp4_linear_backends.py | 2 +- .../unit/layers/quantization/test_nvfp4_moe_backends.py | 2 +- test/registered/unit/layers/quantization/test_quark_config.py | 2 +- test/registered/unit/layers/quantization/test_quark_utils.py | 2 +- .../layers/quantization/test_unquant_apply_with_addend.py | 2 +- test/registered/unit/layers/test_attn_residual.py | 2 +- test/registered/unit/layers/test_bailing_mrope_shape.py | 2 +- test/registered/unit/layers/test_conv_layer.py | 2 +- test/registered/unit/layers/test_dsv41_candidate_blocks.py | 2 +- test/registered/unit/layers/test_dsv4_kv_splits_heuristic.py | 2 +- test/registered/unit/layers/test_dsv4_nonpaged_indexer.py | 2 +- test/registered/unit/layers/test_flashattention_paged_mha.py | 2 +- test/registered/unit/layers/test_flashinfer_comm_fusion.py | 2 +- test/registered/unit/layers/test_fp8_bpreshuffle_scale.py | 2 +- test/registered/unit/layers/test_gdn_mis_metadata.py | 2 +- .../registered/unit/layers/test_kda_decode_mtp_slot_stride.py | 2 +- test/registered/unit/layers/test_kpool_planner_cpu_mirror.py | 2 +- test/registered/unit/layers/test_kpool_stream_scheduling.py | 2 +- .../unit/layers/test_layer_communicator_fusion_gate.py | 2 +- test/registered/unit/layers/test_layernorm_sp.py | 2 +- test/registered/unit/layers/test_logprob_chunk_stitching.py | 2 +- test/registered/unit/layers/test_logprob_fast_input.py | 2 +- test/registered/unit/layers/test_mamba2_track_ssm_indices.py | 2 +- .../unit/layers/test_mamba_prefill_track_metadata.py | 2 +- .../registered/unit/layers/test_mamba_state_scatter_triton.py | 4 ++-- test/registered/unit/layers/test_minicpm_attention_adapter.py | 2 +- test/registered/unit/layers/test_minicpm_sparse_cache.py | 2 +- test/registered/unit/layers/test_minicpm_sparse_metadata.py | 2 +- test/registered/unit/layers/test_moriep_mxfp8_dispatch.py | 2 +- test/registered/unit/layers/test_mova.py | 2 +- test/registered/unit/layers/test_pooler_score_and_pool.py | 2 +- test/registered/unit/layers/test_radix_attention.py | 2 +- test/registered/unit/layers/test_radix_linear_attention.py | 2 +- test/registered/unit/layers/test_yarn_cache_extension.py | 2 +- test/registered/unit/lora/test_eviction_policy.py | 2 +- .../unit/lora/test_experimental_sgl_marlin_multi_prefill.py | 2 +- .../unit/lora/test_experimental_sgl_marlin_policy.py | 2 +- .../unit/lora/test_experimental_sgl_marlin_runtime_unit.py | 2 +- .../lora/test_experimental_sgl_marlin_shared_outer_reduce.py | 2 +- .../registered/unit/lora/test_inkling_linearized_lora_unit.py | 2 +- test/registered/unit/lora/test_laguna_hidden_dim_unit.py | 2 +- test/registered/unit/lora/test_lm_head_pruning.py | 2 +- test/registered/unit/lora/test_lora_manager_tied_lm_head.py | 2 +- test/registered/unit/lora/test_lora_moe_inplace_unit.py | 2 +- test/registered/unit/lora/test_lora_spec_verify_batch_info.py | 2 +- test/registered/unit/lora/test_mem_pool_ep_unit.py | 2 +- .../unit/managers/scheduler_components/test_dp_attn.py | 2 +- .../managers/scheduler_components/test_invariant_checker.py | 2 +- .../unit/managers/scheduler_components/test_output_sender.py | 2 +- test/registered/unit/managers/test_auxiliary_output.py | 2 +- .../unit/managers/test_bailing_modality_metadata.py | 2 +- .../managers/test_batch_result_processor_hidden_states.py | 2 +- .../managers/test_batch_result_processor_mamba_boundary.py | 2 +- .../unit/managers/test_batch_result_processor_spec_grammar.py | 2 +- .../registered/unit/managers/test_data_parallel_controller.py | 2 +- test/registered/unit/managers/test_detailed_annotations.py | 2 +- .../unit/managers/test_disagg_idle_step_counters.py | 2 +- test/registered/unit/managers/test_embed_overrides.py | 2 +- test/registered/unit/managers/test_fanout_communicator.py | 2 +- .../unit/managers/test_finish_length_speculative.py | 2 +- test/registered/unit/managers/test_flat_raw_top_logprobs.py | 2 +- .../registered/unit/managers/test_grammar_stop_speculative.py | 2 +- .../registered/unit/managers/test_hidden_state_server_mode.py | 2 +- test/registered/unit/managers/test_hisparse_unit.py | 2 +- test/registered/unit/managers/test_io_struct.py | 2 +- test/registered/unit/managers/test_kv_page_invariants.py | 2 +- test/registered/unit/managers/test_load_inquirer.py | 2 +- test/registered/unit/managers/test_load_snapshot_backends.py | 2 +- test/registered/unit/managers/test_loadstat_wire.py | 2 +- .../registered/unit/managers/test_lora_update_result_merge.py | 2 +- test/registered/unit/managers/test_mamba_checkpoint_depth.py | 2 +- test/registered/unit/managers/test_mm_hashes.py | 2 +- test/registered/unit/managers/test_mm_process_config.py | 2 +- test/registered/unit/managers/test_mm_shm_error_consensus.py | 2 +- test/registered/unit/managers/test_mm_utils_split.py | 2 +- test/registered/unit/managers/test_multi_tokenizer_mixin.py | 2 +- .../registered/unit/managers/test_multimodal_abort_cleanup.py | 2 +- .../unit/managers/test_output_streamer_customized_info.py | 2 +- .../registered/unit/managers/test_output_streamer_logprobs.py | 2 +- test/registered/unit/managers/test_pp_cp_rank_offsets.py | 2 +- test/registered/unit/managers/test_prefill_adder.py | 2 +- .../unit/managers/test_prefill_delayer_high_watermark.py | 2 +- .../unit/managers/test_priority_scheduling_disaggregation.py | 2 +- test/registered/unit/managers/test_profile_merger_http_api.py | 2 +- test/registered/unit/managers/test_retraction_order.py | 2 +- .../registered/unit/managers/test_sampling_mask_validation.py | 2 +- .../unit/managers/test_schedule_batch_out_of_place.py | 2 +- .../unit/managers/test_schedule_batch_prepare_for_decode.py | 2 +- .../unit/managers/test_schedule_batch_req_pool_indices.py | 2 +- test/registered/unit/managers/test_schedule_policy.py | 2 +- .../unit/managers/test_schedule_policy_dfs_weight.py | 2 +- .../unit/managers/test_scheduler_chunked_abort_race.py | 2 +- .../unit/managers/test_scheduler_chunked_req_gate.py | 2 +- .../unit/managers/test_scheduler_decision_batch_params.py | 2 +- test/registered/unit/managers/test_scheduler_flush_cache.py | 2 +- .../registered/unit/managers/test_scheduler_hicache_attach.py | 2 +- .../registered/unit/managers/test_scheduler_hicache_events.py | 2 +- .../unit/managers/test_scheduler_init_req_max_new_tokens.py | 2 +- .../unit/managers/test_scheduler_internal_state_env_vars.py | 2 +- .../unit/managers/test_scheduler_internal_state_world_size.py | 2 +- test/registered/unit/managers/test_scheduler_on_idle_load.py | 2 +- .../unit/managers/test_scheduler_pause_generation.py | 2 +- .../unit/managers/test_scheduler_prefill_decode_interval.py | 2 +- test/registered/unit/managers/test_scheduler_recv_skipper.py | 2 +- .../unit/managers/test_scheduler_sampling_mask_validation.py | 2 +- test/registered/unit/managers/test_scheduler_timeouts.py | 2 +- .../unit/managers/test_scheduler_weight_version_tracking.py | 2 +- test/registered/unit/managers/test_stop_str_speculative.py | 2 +- .../registered/unit/managers/test_tokenizer_config_updates.py | 2 +- .../unit/managers/test_tokenizer_manager_rid_cleanup.py | 2 +- test/registered/unit/managers/test_trim_matched_stop.py | 2 +- test/registered/unit/managers/test_vocab_boundary_finish.py | 2 +- test/registered/unit/mem_cache/test_asymmetric_mha_pool.py | 2 +- .../unit/mem_cache/test_asymmetric_mha_pool_host_unit.py | 2 +- test/registered/unit/mem_cache/test_buffer_mode_sidecar.py | 2 +- test/registered/unit/mem_cache/test_decode_radix_lock_ref.py | 2 +- test/registered/unit/mem_cache/test_dllm_fdfo_kv_reuse.py | 2 +- test/registered/unit/mem_cache/test_dsa_layer_shard_utils.py | 2 +- .../unit/mem_cache/test_dsa_layer_split_broadcast.py | 2 +- test/registered/unit/mem_cache/test_dsa_pool_host_unit.py | 2 +- .../registered/unit/mem_cache/test_dsv4_c4_state_lifecycle.py | 2 +- .../registered/unit/mem_cache/test_dsv4_compress_write_pad.py | 2 +- test/registered/unit/mem_cache/test_dsv4_compressed_pools.py | 2 +- test/registered/unit/mem_cache/test_dsv4_hicache_l2.py | 2 +- test/registered/unit/mem_cache/test_dsv4_unified_fp8_pool.py | 2 +- .../unit/mem_cache/test_embedding_cache_controller.py | 2 +- test/registered/unit/mem_cache/test_evict_policy.py | 2 +- .../unit/mem_cache/test_flashkda_strided_state_access.py | 2 +- test/registered/unit/mem_cache/test_free_kv_row_coalesce.py | 2 +- test/registered/unit/mem_cache/test_full_loc_fast_path.py | 2 +- test/registered/unit/mem_cache/test_hicache_auto_size.py | 2 +- test/registered/unit/mem_cache/test_hicache_copy_rounds.py | 2 +- test/registered/unit/mem_cache/test_hicache_dcp_host_pool.py | 2 +- test/registered/unit/mem_cache/test_hicache_file_lru_unit.py | 2 +- test/registered/unit/mem_cache/test_hicache_host_register.py | 2 +- test/registered/unit/mem_cache/test_hicache_nixl_cleaner.py | 2 +- test/registered/unit/mem_cache/test_hicache_nixl_storage.py | 2 +- .../unit/mem_cache/test_hicache_staged_write_back_dispatch.py | 2 +- test/registered/unit/mem_cache/test_hiradix_cache_unit.py | 2 +- test/registered/unit/mem_cache/test_hiradix_pp_sync_drain.py | 2 +- test/registered/unit/mem_cache/test_hisparse_allocator.py | 2 +- .../unit/mem_cache/test_hisparse_max_token_pool_size.py | 2 +- .../unit/mem_cache/test_hisparse_slot_translation.py | 2 +- test/registered/unit/mem_cache/test_host_memory.py | 2 +- test/registered/unit/mem_cache/test_hybrid_pool_assembler.py | 2 +- .../unit/mem_cache/test_inkling_sconv_strided_conv_state.py | 2 +- test/registered/unit/mem_cache/test_kv_index_translator.py | 2 +- test/registered/unit/mem_cache/test_layout_compat.py | 2 +- test/registered/unit/mem_cache/test_linker_pool_assembler.py | 2 +- .../unit/mem_cache/test_mamba_donated_alloc_ratio.py | 2 +- test/registered/unit/mem_cache/test_mamba_path_state_cap.py | 4 ++-- .../unit/mem_cache/test_mamba_state_transfer_buffers.py | 2 +- test/registered/unit/mem_cache/test_mamba_unittest.py | 2 +- test/registered/unit/mem_cache/test_mem_cache_utils.py | 2 +- test/registered/unit/mem_cache/test_mem_pool_host.py | 2 +- .../unit/mem_cache/test_minimax_sparse_pool_host_unit.py | 2 +- .../unit/mem_cache/test_minimax_sparse_pool_pd_unit.py | 2 +- .../unit/mem_cache/test_mla_host_dedup_primitives.py | 2 +- test/registered/unit/mem_cache/test_mmap_allocator.py | 2 +- .../unit/mem_cache/test_mooncake_group_semantics.py | 2 +- .../unit/mem_cache/test_mooncake_ssd_offload_path.py | 2 +- .../unit/mem_cache/test_mooncake_standalone_dummy_mamba.py | 2 +- test/registered/unit/mem_cache/test_mooncake_store_config.py | 2 +- test/registered/unit/mem_cache/test_mooncake_tenant_config.py | 2 +- test/registered/unit/mem_cache/test_multi_ended_allocator.py | 2 +- .../unit/mem_cache/test_mxfp8_mha_pool_host_unit.py | 2 +- .../unit/mem_cache/test_mxfp8_scale_transfer_buffers.py | 2 +- test/registered/unit/mem_cache/test_npu_mamba_async_layout.py | 2 +- test/registered/unit/mem_cache/test_page_interleave_shard.py | 2 +- test/registered/unit/mem_cache/test_page_major_layout.py | 2 +- .../unit/mem_cache/test_paged_allocator_lazy_release.py | 2 +- test/registered/unit/mem_cache/test_paged_free_segment.py | 2 +- .../unit/mem_cache/test_pd_envelope_transfer_layout.py | 2 +- test/registered/unit/mem_cache/test_pp_prefetch_ticket.py | 2 +- test/registered/unit/mem_cache/test_prefill_memory_budget.py | 2 +- test/registered/unit/mem_cache/test_pure_swa_chunk_cache.py | 2 +- test/registered/unit/mem_cache/test_pure_swa_radix_cache.py | 2 +- test/registered/unit/mem_cache/test_qsa_kv_pool.py | 2 +- test/registered/unit/mem_cache/test_quantized_kv_pool.py | 2 +- test/registered/unit/mem_cache/test_radix_cache_cpp_unit.py | 2 +- .../unit/mem_cache/test_radix_cache_slru_accuracy.py | 2 +- test/registered/unit/mem_cache/test_radix_force_miss.py | 2 +- test/registered/unit/mem_cache/test_registry.py | 2 +- .../unit/mem_cache/test_replayssm_ring_accounting.py | 2 +- .../registered/unit/mem_cache/test_retraction_mamba_backup.py | 2 +- test/registered/unit/mem_cache/test_rust_tree_core.py | 2 +- .../unit/mem_cache/test_rust_tree_core_integration.py | 2 +- .../unit/mem_cache/test_rust_unified_radix_cache_bench.py | 2 +- .../unit/mem_cache/test_rust_unified_radix_cache_unittest.py | 2 +- .../unit/mem_cache/test_session_token_share_unit.py | 2 +- .../unit/mem_cache/test_session_unified_radix_cache.py | 2 +- .../unit/mem_cache/test_storage_prefetch_lifecycle.py | 2 +- test/registered/unit/mem_cache/test_streaming_session_unit.py | 2 +- .../unit/mem_cache/test_swa_alloc_extend_page_estimation.py | 2 +- test/registered/unit/mem_cache/test_swa_cpu_copy_filter.py | 2 +- .../unit/mem_cache/test_swa_locked_full_recover_unified.py | 2 +- test/registered/unit/mem_cache/test_swa_pool_v_head_dim.py | 2 +- test/registered/unit/mem_cache/test_swa_ring_page_return.py | 2 +- test/registered/unit/mem_cache/test_swa_unittest.py | 2 +- test/registered/unit/mem_cache/test_tlru_eviction_policy.py | 2 +- test/registered/unit/mem_cache/test_tree_core_registry.py | 2 +- test/registered/unit/mem_cache/test_umbp_host_allocator.py | 2 +- .../registered/unit/mem_cache/test_unified_byte_accounting.py | 2 +- .../unit/mem_cache/test_unified_byte_budget_sizing.py | 2 +- test/registered/unit/mem_cache/test_unified_cache_linker.py | 4 ++-- test/registered/unit/mem_cache/test_unified_capacity_memo.py | 2 +- .../unit/mem_cache/test_unified_free_no_host_sync.py | 2 +- .../unit/mem_cache/test_unified_hicache_regressions.py | 2 +- .../unit/mem_cache/test_unified_hicache_strided_state.py | 2 +- test/registered/unit/mem_cache/test_unified_mamba_views.py | 2 +- test/registered/unit/mem_cache/test_unified_mha_views.py | 2 +- .../registered/unit/mem_cache/test_unified_mla_block_table.py | 2 +- test/registered/unit/mem_cache/test_unified_mla_gpu_parity.py | 2 +- test/registered/unit/mem_cache/test_unified_mla_views.py | 2 +- test/registered/unit/mem_cache/test_unified_npool_sweep.py | 2 +- .../unit/mem_cache/test_unified_radix_allocation_eviction.py | 2 +- .../unit/mem_cache/test_unified_radix_cache_bench.py | 2 +- .../unit/mem_cache/test_unified_radix_cache_unittest.py | 2 +- .../unit/mem_cache/test_unified_radix_hicache_dispatch.py | 2 +- test/registered/unit/memory/test_ptr_table.py | 2 +- .../model_runner_components/test_attention_backend_setup.py | 2 +- .../model_runner_components/test_cuda_graph_setup.py | 2 +- .../model_runner_components/test_layer_setup.py | 2 +- .../model_runner_components/test_ngram_embedding_manager.py | 2 +- .../model_runner_components/test_spec_aux_hidden_state.py | 2 +- .../model_runner_components/test_startup_weight_load.py | 2 +- .../model_executor/runner/test_decode_cuda_graph_runner.py | 2 +- .../runner/test_decode_cuda_graph_shared_read_fence.py | 2 +- .../model_executor/runner/test_flashinfer_autotune_sync.py | 2 +- .../runner/test_hidden_state_graph_recapture.py | 2 +- .../model_executor/runner/test_prefill_cuda_graph_padding.py | 2 +- .../model_executor/runner/test_prefill_shared_read_done.py | 2 +- .../model_executor/runner_backend/test_backend_resolution.py | 2 +- .../runner_backend/test_full_cuda_graph_backend.py | 2 +- .../model_executor/runner_utils/test_graph_pool_borrow.py | 2 +- .../unit/model_executor/test_chunked_prefix_cache_gate.py | 2 +- .../unit/model_executor/test_compensated_mhc_update_guard.py | 2 +- .../unit/model_executor/test_cuda_graph_buffer_registry.py | 2 +- .../unit/model_executor/test_draft_runner_skips_lora.py | 2 +- .../unit/model_executor/test_forward_metadata_plan_record.py | 2 +- .../unit/model_executor/test_hisparse_pool_configurator.py | 2 +- .../registered/unit/model_executor/test_kv_canary_headroom.py | 2 +- .../registered/unit/model_executor/test_mlp_sync_pad_unpad.py | 2 +- .../unit/model_executor/test_model_runner_decode_rows.py | 2 +- test/registered/unit/model_executor/test_pool_configurator.py | 2 +- .../unit/model_executor/test_prefill_cuda_graph_runner.py | 2 +- .../model_executor/test_prefill_cuda_graph_runner_helpers.py | 2 +- .../unit/model_executor/test_unified_out_cache_loc_rebind.py | 2 +- .../registered/unit/model_loader/test_default_model_loader.py | 2 +- test/registered/unit/model_loader/test_modelopt_export.py | 2 +- .../registered/unit/model_loader/test_prefetch_checkpoints.py | 2 +- test/registered/unit/model_loader/test_presharded_loader.py | 2 +- .../unit/model_loader/test_remote_instance_loader.py | 2 +- .../unit/model_loader/test_runai_model_streamer_loader.py | 2 +- .../unit/model_loader/test_transformers_fallback.py | 2 +- .../unit/model_loader/test_weight_cache_protocol.py | 2 +- test/registered/unit/model_loader/test_weight_utils.py | 2 +- test/registered/unit/models/test_bailing_vl_loader.py | 2 +- test/registered/unit/models/test_cosmos3.py | 2 +- test/registered/unit/models/test_cosmos3_edge.py | 2 +- test/registered/unit/models/test_deepseek_mla_dispatch.py | 2 +- test/registered/unit/models/test_deepseek_nextn_mm_embed.py | 2 +- test/registered/unit/models/test_deepseek_pp_mtp_embedding.py | 2 +- test/registered/unit/models/test_deepseek_v4_amd_fused_mhc.py | 2 +- .../models/test_deepseek_v4_mxfp4_shared_expert_requant.py | 2 +- test/registered/unit/models/test_deepseek_v4_rope_policy.py | 2 +- .../unit/models/test_deepseek_v4_shared_expert_fusion.py | 2 +- .../unit/models/test_deepseek_v4_unified_fp8_q_pair.py | 2 +- test/registered/unit/models/test_draft_entry_hook_parity.py | 2 +- test/registered/unit/models/test_glm5_next_bfg_fusion.py | 2 +- test/registered/unit/models/test_glm5_next_dflash_capture.py | 2 +- test/registered/unit/models/test_glm5_next_modelopt.py | 2 +- test/registered/unit/models/test_glm_moe_gate_fp32.py | 2 +- test/registered/unit/models/test_glm_nextn_moe_ptpc.py | 2 +- .../unit/models/test_glmmoedsa_correction_bias_fp32.py | 2 +- test/registered/unit/models/test_gpt_oss_runai_ownership.py | 2 +- .../unit/models/test_granitemoe_split_expert_loading.py | 2 +- .../unit/models/test_hunyuan_v3_nextn_weight_loading.py | 2 +- .../unit/models/test_hunyuan_v4_nextn_weight_loading.py | 2 +- test/registered/unit/models/test_interns1pro_processor.py | 2 +- test/registered/unit/models/test_kimi_k25.py | 2 +- test/registered/unit/models/test_kimi_k3_bfa_overlap.py | 2 +- test/registered/unit/models/test_kimi_k3_vision.py | 2 +- test/registered/unit/models/test_kimi_vl.py | 2 +- test/registered/unit/models/test_kimi_vl_moonvit.py | 2 +- test/registered/unit/models/test_llava.py | 2 +- test/registered/unit/models/test_llava_processor_pool.py | 2 +- test/registered/unit/models/test_locate_anything.py | 2 +- .../unit/models/test_longcat_flash_router_hpc_gemm.py | 2 +- test/registered/unit/models/test_mellum.py | 2 +- test/registered/unit/models/test_mistral3_vision_feature.py | 2 +- test/registered/unit/models/test_moss_vl_processor.py | 2 +- test/registered/unit/models/test_nano_nemotron_vl.py | 2 +- test/registered/unit/models/test_nemotron_h_mtp.py | 2 +- test/registered/unit/models/test_nemotron_h_shared_add.py | 2 +- test/registered/unit/models/test_nemotron_h_weight_loading.py | 2 +- .../unit/models/test_paddleocr_vl_serving_defaults.py | 2 +- test/registered/unit/models/test_paddleocr_vl_vision.py | 2 +- test/registered/unit/models/test_qwen3_5_modelopt_fp4.py | 2 +- .../unit/models/test_qwen3_5_packed_weight_loader.py | 2 +- test/registered/unit/models/test_qwen3_5_pipeline_parallel.py | 2 +- .../unit/models/test_qwen3_embedding_registration.py | 2 +- .../unit/models/test_qwen3_vl_feature_materialization.py | 2 +- test/registered/unit/models/test_qwen4_exp_ple_table.py | 2 +- test/registered/unit/models/test_radio.py | 2 +- test/registered/unit/models/test_rocm_hisparse_fused_kv.py | 2 +- .../unit/models/test_shared_experts_fusion_gates.py | 2 +- test/registered/unit/models/test_vit_pos_embed_interpolate.py | 2 +- test/registered/unit/models/test_xllm.py | 2 +- test/registered/unit/models/test_zaya_cca.py | 2 +- test/registered/unit/models/test_zaya_mod_tp.py | 2 +- test/registered/unit/multimodal/rust/inkling/test_bindings.py | 2 +- test/registered/unit/multimodal/rust/qwen/test_driver.py | 2 +- test/registered/unit/multimodal/rust/qwen/test_e2e_parity.py | 2 +- test/registered/unit/multimodal/rust/qwen/test_preprocess.py | 2 +- .../unit/multimodal/rust/qwen/test_rust_mm_processor.py | 2 +- .../unit/multimodal/rust/qwen/test_token_layout_mrope.py | 2 +- test/registered/unit/multimodal/rust/shared/test_fetch.py | 2 +- .../unit/multimodal/rust/shared/test_image_decode.py | 2 +- .../unit/multimodal/rust/shared/test_partition_cores.py | 2 +- .../unit/multimodal/rust/shared/test_rust_server_extension.py | 2 +- .../unit/multimodal/rust/shared/test_wrap_encoded.py | 2 +- .../registered/unit/multimodal/test_audio_container_decode.py | 2 +- test/registered/unit/multimodal/test_bailing_mm_processor.py | 2 +- .../unit/multimodal/test_base_processor_bad_input.py | 2 +- .../unit/multimodal/test_base_processor_image_decode.py | 2 +- test/registered/unit/multimodal/test_cuda_ipc_pool_budget.py | 2 +- test/registered/unit/multimodal/test_cuda_ipc_transport.py | 2 +- test/registered/unit/multimodal/test_cuda_vmm_transport.py | 2 +- test/registered/unit/multimodal/test_deepseek_ocr_geometry.py | 2 +- test/registered/unit/multimodal/test_dots_note_omni.py | 2 +- test/registered/unit/multimodal/test_evs.py | 2 +- .../unit/multimodal/test_feature_materialization.py | 2 +- test/registered/unit/multimodal/test_gpu_feature_transport.py | 2 +- .../registered/unit/multimodal/test_kimi_k3_gpu_preprocess.py | 2 +- .../unit/multimodal/test_media_artifact_processor.py | 2 +- test/registered/unit/multimodal/test_media_url_security.py | 2 +- test/registered/unit/multimodal/test_mrope_encoder_utils.py | 2 +- .../unit/multimodal/test_nano_nemotron_vl_processor.py | 2 +- test/registered/unit/multimodal/test_pixtral_processor.py | 2 +- .../unit/multimodal/test_precomputed_embedding_validation.py | 2 +- test/registered/unit/multimodal/test_preprocess_cache.py | 2 +- .../unit/multimodal/test_processor_async_call_sites.py | 2 +- .../unit/multimodal/test_processor_clone_isolation.py | 2 +- .../unit/multimodal/test_processor_device_selection.py | 2 +- test/registered/unit/multimodal/test_tensor_transport_mode.py | 2 +- test/registered/unit/multimodal/test_vit_cuda_graph_runner.py | 2 +- test/registered/unit/multimodal/test_vit_npu_graph_runner.py | 2 +- .../unit/npu/test_sparsity_driven_kv_offload_config.py | 2 +- .../unit/observability/test_forward_pass_metrics.py | 2 +- test/registered/unit/observability/test_func_timer.py | 2 +- test/registered/unit/observability/test_label_transform.py | 2 +- test/registered/unit/observability/test_metrics_utils.py | 2 +- test/registered/unit/observability/test_ray_wrappers.py | 2 +- test/registered/unit/observability/test_req_time_stats.py | 2 +- .../unit/observability/test_request_metrics_exporter.py | 2 +- .../unit/observability/test_scheduler_stage_metrics.py | 2 +- .../unit/observability/test_startup_func_log_and_timer.py | 2 +- test/registered/unit/observability/test_stat_loggers_di.py | 2 +- test/registered/unit/observability/test_trace.py | 2 +- test/registered/unit/parser/test_code_completion_parser.py | 2 +- test/registered/unit/parser/test_conversation.py | 2 +- test/registered/unit/parser/test_harmony_parser.py | 2 +- test/registered/unit/parser/test_hunyuan_reasoning.py | 2 +- test/registered/unit/parser/test_inkling_renderer.py | 2 +- test/registered/unit/parser/test_jinja_template_utils.py | 2 +- test/registered/unit/parser/test_k2_v3_reasoning_parser.py | 2 +- test/registered/unit/parser/test_kimik3_reasoning_parser.py | 2 +- .../unit/parser/test_reasoning_content_without_parser.py | 2 +- test/registered/unit/parser/test_reasoning_parser.py | 2 +- test/registered/unit/platforms/test_platform_interface.py | 2 +- test/registered/unit/plugins/test_hook_registry.py | 2 +- test/registered/unit/plugins/test_load_plugins.py | 2 +- test/registered/unit/sampling/test_ascend_sampler.py | 2 +- test/registered/unit/sampling/test_custom_logit_processor.py | 2 +- test/registered/unit/sampling/test_penaltylib.py | 2 +- test/registered/unit/sampling/test_sampling_batch_info.py | 2 +- .../unit/sampling/test_sampling_metadata_staging.py | 2 +- test/registered/unit/sampling/test_sampling_params.py | 2 +- .../unit/scripted_runtime/test_background_http_poster.py | 2 +- test/registered/unit/scripted_runtime/test_http_server.py | 2 +- test/registered/unit/scripted_runtime/test_scheduler_hook.py | 2 +- .../unit/scripted_runtime/test_scripted_runtime_utils.py | 2 +- .../unit/scripted_runtime/test_tokenizer_recv_proxy.py | 2 +- test/registered/unit/server_args/test_declared_fallbacks.py | 2 +- test/registered/unit/server_args/test_model_config_cache.py | 2 +- test/registered/unit/server_args/test_model_source_paths.py | 2 +- .../unit/server_args/test_page_major_backend_allowlist.py | 2 +- .../unit/server_args/test_platform_prefill_cp_deprecation.py | 2 +- .../unit/server_args/test_record_holds_the_raw_input.py | 2 +- .../unit/server_args/test_resolution_declarations.py | 2 +- .../unit/server_args/test_resolution_hook_registry.py | 2 +- .../unit/server_args/test_resolution_is_reproducible.py | 4 ++-- test/registered/unit/server_args/test_server_args.py | 2 +- .../unit/server_args/test_unified_prefill_cuda_graph_gate.py | 2 +- test/registered/unit/spec/test_adaptive_spec_params.py | 2 +- .../registered/unit/spec/test_decode_bookkeeping_ownership.py | 2 +- test/registered/unit/spec/test_decoupled_spec_io.py | 2 +- test/registered/unit/spec/test_dflash_domino.py | 2 +- test/registered/unit/spec/test_dflash_extra_buffer_lazy.py | 2 +- test/registered/unit/spec/test_dflash_logits.py | 2 +- test/registered/unit/spec/test_dflash_overlap_hostsync.py | 2 +- .../registered/unit/spec/test_draft_construction_isolation.py | 2 +- test/registered/unit/spec/test_draft_per_runner_config.py | 2 +- .../unit/spec/test_eagle_draft_cuda_graph_runner.py | 2 +- test/registered/unit/spec/test_eagle_gate_routing.py | 2 +- .../unit/spec/test_eagle_worker_v2_topk1_fastpath.py | 2 +- test/registered/unit/spec/test_multimodal_draft_embeddings.py | 2 +- test/registered/unit/spec/test_ngram_corpus.py | 2 +- test/registered/unit/spec/test_ngram_mamba_verify_update.py | 2 +- test/registered/unit/spec/test_oot_dflash_hooks.py | 2 +- test/registered/unit/spec/test_plugin_hook_signatures.py | 2 +- test/registered/unit/spec/test_spec_cpu_overlap_constraint.py | 2 +- test/registered/unit/spec/test_spec_registry.py | 2 +- test/registered/unit/spec/test_spec_utils_traverse_tree.py | 2 +- .../unit/spec/test_suffix_attention_merge_dispatch.py | 2 +- test/registered/unit/spec/test_uno_tree_config.py | 2 +- .../unit/state_capturer/test_routed_experts_scattered_a2a.py | 2 +- test/registered/unit/test_cache_hit_kit_metrics.py | 2 +- test/registered/unit/test_checkpoint_quantization.py | 2 +- test/registered/unit/test_cuda_vmm_utils.py | 2 +- test/registered/unit/test_dsa_tilelang_fp8_validation.py | 2 +- test/registered/unit/test_environ.py | 2 +- test/registered/unit/test_eval_accuracy_kit_sgl_eval.py | 2 +- test/registered/unit/test_flashinfer_sparse_mla.py | 2 +- test/registered/unit/test_fork_test_worker.py | 2 +- test/registered/unit/test_global_config_read_ratchet.py | 2 +- test/registered/unit/test_model_overrides.py | 2 +- test/registered/unit/test_platform_context.py | 2 +- test/registered/unit/test_pre_publish_readers.py | 2 +- test/registered/unit/test_precision_baseline_store.py | 2 +- test/registered/unit/test_quantization_post_load.py | 2 +- test/registered/unit/test_ray_driver_reads_the_bags.py | 2 +- test/registered/unit/test_rocm_pageable_h2d_staging.py | 2 +- test/registered/unit/test_runai_utils.py | 2 +- test/registered/unit/test_runtime_context.py | 2 +- test/registered/unit/test_runtime_context_config_bags.py | 2 +- test/registered/unit/test_runtime_context_override.py | 2 +- test/registered/unit/test_server_args_cli_metadata.py | 2 +- test/registered/unit/test_server_args_migration.py | 2 +- test/registered/unit/test_server_args_namespaces.py | 2 +- .../registered/unit/test_split_attention_backend_decisions.py | 2 +- .../registered/unit/tokenizer/test_mistral_empty_assistant.py | 2 +- .../unit/tokenizer/test_tekken_tokenizer_routing.py | 2 +- test/registered/unit/tokenizer/test_tiktoken_tokenizer.py | 2 +- test/registered/unit/tools/test_slash_command_handler.py | 2 +- test/registered/unit/utils/test_common.py | 2 +- test/registered/unit/utils/test_diffusion_torch_fallback.py | 2 +- test/registered/unit/utils/test_field_validators.py | 2 +- test/registered/unit/utils/test_gauge_histogram.py | 2 +- test/registered/unit/utils/test_hf_transformers.py | 2 +- test/registered/unit/utils/test_hf_transformers_fastokens.py | 2 +- test/registered/unit/utils/test_hf_transformers_loading.py | 2 +- test/registered/unit/utils/test_http_server_auth.py | 2 +- test/registered/unit/utils/test_invariants.py | 2 +- test/registered/unit/utils/test_json_response.py | 2 +- test/registered/unit/utils/test_profile_merger.py | 2 +- test/registered/unit/utils/test_safe_unpickler.py | 2 +- test/registered/unit/utils/test_subprocess_watchdog.py | 2 +- test/registered/unit/utils/test_weight_checker_comparator.py | 2 +- test/registered/unit/utils/test_weight_versions.py | 2 +- test/registered/utils/test_log_utils.py | 2 +- test/registered/utils/test_network_address.py | 2 +- test/registered/utils/test_numa_utils.py | 2 +- test/registered/utils/test_phase_checker.py | 2 +- test/registered/utils/test_socket_utils.py | 2 +- test/registered/utils/test_stale_shm_cleanup.py | 2 +- test/registered/vlm/test_paddleocr_vl_server.py | 2 +- test/registered/vlm/test_rust_native_mm_e2e.py | 2 +- test/registered/vlm/test_rust_native_mm_mmmu.py | 2 +- test/registered/vlm/test_token_id_retokenize_e2e.py | 2 +- test/registered/vlm/test_unlimited_ocr_server.py | 2 +- test/registered/vlm/test_video_utils.py | 2 +- test/registered/vlm/test_vision_chunked_prefill.py | 2 +- test/registered/vlm/test_vision_openai_server_a.py | 2 +- test/registered/vlm/test_vision_openai_server_extra.py | 2 +- test/registered/vlm/test_vlm_input_format.py | 2 +- test/registered/vlm/test_vlm_tp4.py | 2 +- test/registered/xpu/test_numa_utils_xpu.py | 2 +- 1049 files changed, 1073 insertions(+), 1073 deletions(-) diff --git a/test/registered/attention/test_aiter_gluon_h12_fp8.py b/test/registered/attention/test_aiter_gluon_h12_fp8.py index aa759cb3b..e0e5326dc 100644 --- a/test/registered/attention/test_aiter_gluon_h12_fp8.py +++ b/test/registered/attention/test_aiter_gluon_h12_fp8.py @@ -15,7 +15,7 @@ from sglang.srt.layers.attention import aiter_mla_gluon as mod from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _GLUON_FN = "sglang.srt.layers.attention.aiter_mla_gluon._gluon_fn" diff --git a/test/registered/attention/test_chunk_gated_delta_rule.py b/test/registered/attention/test_chunk_gated_delta_rule.py index 83cff71ac..f1c0894db 100644 --- a/test/registered/attention/test_chunk_gated_delta_rule.py +++ b/test/registered/attention/test_chunk_gated_delta_rule.py @@ -13,7 +13,7 @@ from sglang.test.ci.ci_register import ( register_xpu_ci, ) -register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=11, stage="stage-b", runner_config="1-gpu-large-amd") register_xpu_ci(est_time=900, suite="stage-b-test-1-gpu-xpu") diff --git a/test/registered/attention/test_create_kvindices.py b/test/registered/attention/test_create_kvindices.py index 5124229d8..bd7c18c76 100644 --- a/test/registered/attention/test_create_kvindices.py +++ b/test/registered/attention/test_create_kvindices.py @@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase # Triton kernel unit test for KV indices creation -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_deterministic.py b/test/registered/attention/test_deterministic.py index 6873c47bf..011ae522b 100644 --- a/test/registered/attention/test_deterministic.py +++ b/test/registered/attention/test_deterministic.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( is_in_amd_ci, ) -register_cuda_ci(est_time=280, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=272, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=278, suite="stage-b-test-1-gpu-small-amd") register_xpu_ci(est_time=207, suite="stage-b-test-1-gpu-xpu") diff --git a/test/registered/attention/test_flash_attention_4.py b/test/registered/attention/test_flash_attention_4.py index eb8e7de49..ac7e451e3 100644 --- a/test/registered/attention/test_flash_attention_4.py +++ b/test/registered/attention/test_flash_attention_4.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( ) # FlashAttention4 integration test (requires SM 100+ / Blackwell B200) -register_cuda_ci(est_time=230, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=220, stage="base-b", runner_config="4-gpu-b200") @unittest.skipIf(get_device_sm() < 100, "Test requires CUDA SM 100 or higher") diff --git a/test/registered/attention/test_hybrid_attn_backend.py b/test/registered/attention/test_hybrid_attn_backend.py index d6564d5c0..c3a0f5052 100644 --- a/test/registered/attention/test_hybrid_attn_backend.py +++ b/test/registered/attention/test_hybrid_attn_backend.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( # Hybrid attention backend tests (FA3 prefill + FlashInfer decode, requires SM 90+ / H100) # Multiple test classes: base, MLA, TorchCompile, SpecDecode variants -register_cuda_ci(est_time=393, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=368, stage="extra-a", runner_config="1-gpu-large") class TestHybridAttnBackendMLA(TestHybridAttnBackendBase): diff --git a/test/registered/attention/test_kda_kernels.py b/test/registered/attention/test_kda_kernels.py index 83b8d6de4..9c08eac4f 100644 --- a/test/registered/attention/test_kda_kernels.py +++ b/test/registered/attention/test_kda_kernels.py @@ -19,7 +19,7 @@ from sglang.srt.utils.common import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=32, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=12, stage="stage-b", runner_config="1-gpu-large-amd") diff --git a/test/registered/attention/test_normal_decode_set_metadata.py b/test/registered/attention/test_normal_decode_set_metadata.py index d9d4f927e..e57dea9f0 100644 --- a/test/registered/attention/test_normal_decode_set_metadata.py +++ b/test/registered/attention/test_normal_decode_set_metadata.py @@ -21,7 +21,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase # Register this test for CUDA CI in base-b (fast attention/kernel tests) -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=17, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/test_qwen35_deterministic.py b/test/registered/attention/test_qwen35_deterministic.py index 60b9fee3c..5d20f488f 100644 --- a/test/registered/attention/test_qwen35_deterministic.py +++ b/test/registered/attention/test_qwen35_deterministic.py @@ -12,7 +12,7 @@ from sglang.test.test_deterministic_utils import ( TestDeterministicBase, ) -register_cuda_ci(est_time=119, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=135, stage="extra-b", runner_config="4-gpu-h100") QWEN35 = "Qwen/Qwen3.5-35B-A3B" diff --git a/test/registered/attention/test_torch_native_attention_backend.py b/test/registered/attention/test_torch_native_attention_backend.py index 4e9f8ad30..863de3d36 100644 --- a/test/registered/attention/test_torch_native_attention_backend.py +++ b/test/registered/attention/test_torch_native_attention_backend.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( ) # Torch native attention backend integration test with MMLU eval -register_cuda_ci(est_time=310, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=312, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=150, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_triton_sliding_window.py b/test/registered/attention/test_triton_sliding_window.py index 24f88fcd1..c09aee5a4 100644 --- a/test/registered/attention/test_triton_sliding_window.py +++ b/test/registered/attention/test_triton_sliding_window.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( ) # Sliding window attention with Triton backend (Gemma-3 model) -register_cuda_ci(est_time=80, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=81, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/attention/test_trtllm_mha_encoder_only.py b/test/registered/attention/test_trtllm_mha_encoder_only.py index 831b99de4..3361e3ce3 100644 --- a/test/registered/attention/test_trtllm_mha_encoder_only.py +++ b/test/registered/attention/test_trtllm_mha_encoder_only.py @@ -17,7 +17,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase # trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell. -register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=8, stage="base-b", runner_config="4-gpu-b200") DEVICE = "cuda" PAGE_SIZE = 32 diff --git a/test/registered/attention/test_trtllm_mha_graph_metadata.py b/test/registered/attention/test_trtllm_mha_graph_metadata.py index 3a80a52b6..826be7543 100644 --- a/test/registered/attention/test_trtllm_mha_graph_metadata.py +++ b/test/registered/attention/test_trtllm_mha_graph_metadata.py @@ -23,7 +23,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cuda_ci # trtllm_mha kernels are sm100-only; run this kernel-unit test on Blackwell. -register_cuda_ci(est_time=16, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") DEVICE = "cuda" PAGE_SIZE = 128 diff --git a/test/registered/attention/test_trtllm_mha_page_table.py b/test/registered/attention/test_trtllm_mha_page_table.py index c70e85222..1e6323e1f 100644 --- a/test/registered/attention/test_trtllm_mha_page_table.py +++ b/test/registered/attention/test_trtllm_mha_page_table.py @@ -25,7 +25,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase # Triton kernel unit test for the trtllm_mha device-side page-table build. -register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=14, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/attention/test_unified_memory_deterministic.py b/test/registered/attention/test_unified_memory_deterministic.py index 4cd894fa0..68a288bc5 100644 --- a/test/registered/attention/test_unified_memory_deterministic.py +++ b/test/registered/attention/test_unified_memory_deterministic.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=71, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-large") KIMI_LINEAR_MODEL = "yujiepan/kimi-linear-tiny-random" SERVER_ENV = {"SGLANG_BATCH_INVARIANT_OPS_ENABLE_MM_DEEPGEMM": "0"} diff --git a/test/registered/attention/unittests/dense/test_extend_init_contract.py b/test/registered/attention/unittests/dense/test_extend_init_contract.py index 177012a73..4c3e6a921 100644 --- a/test/registered/attention/unittests/dense/test_extend_init_contract.py +++ b/test/registered/attention/unittests/dense/test_extend_init_contract.py @@ -36,7 +36,7 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=11, stage="base-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-a", runner_config="1-gpu-small") _EXTEND_CASE = DenseAttentionCase( name="extend_no_prefix_smoke", diff --git a/test/registered/attention/unittests/dense/test_fa3.py b/test/registered/attention/unittests/dense/test_fa3.py index 2c77f986f..1a17f2c0f 100644 --- a/test/registered/attention/unittests/dense/test_fa3.py +++ b/test/registered/attention/unittests/dense/test_fa3.py @@ -30,7 +30,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=18, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/dense/test_fa4.py b/test/registered/attention/unittests/dense/test_fa4.py index 2adbce5d6..29dad959e 100644 --- a/test/registered/attention/unittests/dense/test_fa4.py +++ b/test/registered/attention/unittests/dense/test_fa4.py @@ -29,8 +29,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=27, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=22, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=23, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/dense/test_flashinfer.py b/test/registered/attention/unittests/dense/test_flashinfer.py index 214bcecb7..19cc87202 100644 --- a/test/registered/attention/unittests/dense/test_flashinfer.py +++ b/test/registered/attention/unittests/dense/test_flashinfer.py @@ -26,8 +26,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=16, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=26, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf( diff --git a/test/registered/attention/unittests/dense/test_flex_attention.py b/test/registered/attention/unittests/dense/test_flex_attention.py index 123243368..ff103bb43 100644 --- a/test/registered/attention/unittests/dense/test_flex_attention.py +++ b/test/registered/attention/unittests/dense/test_flex_attention.py @@ -14,8 +14,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=16, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=36, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/dense/test_hybrid_attn.py b/test/registered/attention/unittests/dense/test_hybrid_attn.py index 444dd5a41..ff535becf 100644 --- a/test/registered/attention/unittests/dense/test_hybrid_attn.py +++ b/test/registered/attention/unittests/dense/test_hybrid_attn.py @@ -18,8 +18,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf( diff --git a/test/registered/attention/unittests/dense/test_tbo.py b/test/registered/attention/unittests/dense/test_tbo.py index 90a49fae6..7ebf9ba26 100644 --- a/test/registered/attention/unittests/dense/test_tbo.py +++ b/test/registered/attention/unittests/dense/test_tbo.py @@ -21,8 +21,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_ ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/dense/test_torch_native.py b/test/registered/attention/unittests/dense/test_torch_native.py index 9eebe7c4c..685f36f59 100644 --- a/test/registered/attention/unittests/dense/test_torch_native.py +++ b/test/registered/attention/unittests/dense/test_torch_native.py @@ -11,8 +11,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/dense/test_triton.py b/test/registered/attention/unittests/dense/test_triton.py index 64559579c..a9b9ff5ce 100644 --- a/test/registered/attention/unittests/dense/test_triton.py +++ b/test/registered/attention/unittests/dense/test_triton.py @@ -30,8 +30,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=19, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=38, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=36, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/dense/test_trtllm_mha.py b/test/registered/attention/unittests/dense/test_trtllm_mha.py index 26678d9b2..27e79730c 100644 --- a/test/registered/attention/unittests/dense/test_trtllm_mha.py +++ b/test/registered/attention/unittests/dense/test_trtllm_mha.py @@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=17, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=18, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf( diff --git a/test/registered/attention/unittests/dsa/test_dsa.py b/test/registered/attention/unittests/dsa/test_dsa.py index 3c63513ce..2c253329f 100644 --- a/test/registered/attention/unittests/dsa/test_dsa.py +++ b/test/registered/attention/unittests/dsa/test_dsa.py @@ -30,8 +30,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_draft_runner i ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=22, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=26, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/dsv4/test_deepseek_v4.py b/test/registered/attention/unittests/dsv4/test_deepseek_v4.py index 82d4142b9..9e5cd8d8f 100644 --- a/test/registered/attention/unittests/dsv4/test_deepseek_v4.py +++ b/test/registered/attention/unittests/dsv4/test_deepseek_v4.py @@ -48,7 +48,7 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_ ) register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/gdn/test_flashinfer.py b/test/registered/attention/unittests/gdn/test_flashinfer.py index 06de49b82..53d3353c3 100644 --- a/test/registered/attention/unittests/gdn/test_flashinfer.py +++ b/test/registered/attention/unittests/gdn/test_flashinfer.py @@ -25,7 +25,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") _cuda_major = int(torch.version.cuda.split(".")[0]) if torch.version.cuda else 0 diff --git a/test/registered/attention/unittests/gdn/test_linear_replayssm_decode.py b/test/registered/attention/unittests/gdn/test_linear_replayssm_decode.py index 0c3ef19e7..590d1232d 100644 --- a/test/registered/attention/unittests/gdn/test_linear_replayssm_decode.py +++ b/test/registered/attention/unittests/gdn/test_linear_replayssm_decode.py @@ -45,7 +45,7 @@ import torch from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/gdn/test_torch_native.py b/test/registered/attention/unittests/gdn/test_torch_native.py index ef516ab5b..10b4831db 100644 --- a/test/registered/attention/unittests/gdn/test_torch_native.py +++ b/test/registered/attention/unittests/gdn/test_torch_native.py @@ -15,7 +15,7 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/gdn/test_triton.py b/test/registered/attention/unittests/gdn/test_triton.py index 129e76a5c..9e6346a30 100644 --- a/test/registered/attention/unittests/gdn/test_triton.py +++ b/test/registered/attention/unittests/gdn/test_triton.py @@ -29,8 +29,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/hybrid_linear/test_flashinfer_mla_chunk_metadata.py b/test/registered/attention/unittests/hybrid_linear/test_flashinfer_mla_chunk_metadata.py index 9a078c277..81abb6133 100644 --- a/test/registered/attention/unittests/hybrid_linear/test_flashinfer_mla_chunk_metadata.py +++ b/test/registered/attention/unittests/hybrid_linear/test_flashinfer_mla_chunk_metadata.py @@ -32,7 +32,7 @@ from sglang.test.kits.attention_unittest.attention_methods.mla_attention import ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") _KV_LORA_RANK = DEFAULT_KV_LORA_RANK diff --git a/test/registered/attention/unittests/hybrid_linear/test_kda_fused_accept_indices.py b/test/registered/attention/unittests/hybrid_linear/test_kda_fused_accept_indices.py index aba244cfd..d3b317374 100644 --- a/test/registered/attention/unittests/hybrid_linear/test_kda_fused_accept_indices.py +++ b/test/registered/attention/unittests/hybrid_linear/test_kda_fused_accept_indices.py @@ -24,7 +24,7 @@ from sglang.srt.layers.attention.linear.kernels.kda_flashinfer import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large") class TestBuildFusedAcceptIndices(CustomTestCase): diff --git a/test/registered/attention/unittests/kda/test_triton.py b/test/registered/attention/unittests/kda/test_triton.py index d9f24bbab..a9c64de59 100644 --- a/test/registered/attention/unittests/kda/test_triton.py +++ b/test/registered/attention/unittests/kda/test_triton.py @@ -22,8 +22,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/lightning/test_triton.py b/test/registered/attention/unittests/lightning/test_triton.py index 961014bb1..805ec903e 100644 --- a/test/registered/attention/unittests/lightning/test_triton.py +++ b/test/registered/attention/unittests/lightning/test_triton.py @@ -19,7 +19,7 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_ ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/mamba/test_mamba2.py b/test/registered/attention/unittests/mamba/test_mamba2.py index e635874c2..3b90ed3ef 100644 --- a/test/registered/attention/unittests/mamba/test_mamba2.py +++ b/test/registered/attention/unittests/mamba/test_mamba2.py @@ -32,8 +32,8 @@ from sglang.test.kits.attention_unittest.runner_modes.speculative_target_verify_ ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/mamba/test_replay_state_indices_validator.py b/test/registered/attention/unittests/mamba/test_replay_state_indices_validator.py index b2f734e25..30d679d22 100644 --- a/test/registered/attention/unittests/mamba/test_replay_state_indices_validator.py +++ b/test/registered/attention/unittests/mamba/test_replay_state_indices_validator.py @@ -7,7 +7,7 @@ from sglang.srt.layers.attention.mamba.replay_state_indices_validator import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") class TestReplayStateIndicesValidator(unittest.TestCase): diff --git a/test/registered/attention/unittests/mla/test_flashinfer.py b/test/registered/attention/unittests/mla/test_flashinfer.py index 7005ebbf4..ed75ed3ee 100644 --- a/test/registered/attention/unittests/mla/test_flashinfer.py +++ b/test/registered/attention/unittests/mla/test_flashinfer.py @@ -32,7 +32,7 @@ MLA_SHAPE_KWARGS = dict( from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") diff --git a/test/registered/attention/unittests/mla/test_tokenspeed_mla.py b/test/registered/attention/unittests/mla/test_tokenspeed_mla.py index 5ba21ab87..311adcffd 100644 --- a/test/registered/attention/unittests/mla/test_tokenspeed_mla.py +++ b/test/registered/attention/unittests/mla/test_tokenspeed_mla.py @@ -56,7 +56,7 @@ MLA_SHAPE_KWARGS = dict( from sglang.test.ci.ci_register import register_cuda_ci register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not _SUPPORTED, _SKIP_REASON) diff --git a/test/registered/attention/unittests/mla/test_triton.py b/test/registered/attention/unittests/mla/test_triton.py index 5c8956506..78df5f659 100644 --- a/test/registered/attention/unittests/mla/test_triton.py +++ b/test/registered/attention/unittests/mla/test_triton.py @@ -28,8 +28,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=18, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=17, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is required") diff --git a/test/registered/attention/unittests/swa/test_flashinfer.py b/test/registered/attention/unittests/swa/test_flashinfer.py index 23496cf5f..5a44bb847 100644 --- a/test/registered/attention/unittests/swa/test_flashinfer.py +++ b/test/registered/attention/unittests/swa/test_flashinfer.py @@ -24,8 +24,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") @unittest.skipIf( diff --git a/test/registered/attention/unittests/swa/test_swa_out_cache_loc.py b/test/registered/attention/unittests/swa/test_swa_out_cache_loc.py index 0d0317c5a..7fa7ccb68 100644 --- a/test/registered/attention/unittests/swa/test_swa_out_cache_loc.py +++ b/test/registered/attention/unittests/swa/test_swa_out_cache_loc.py @@ -24,7 +24,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestSWAKVPoolSetKVBuffer(CustomTestCase): diff --git a/test/registered/attention/unittests/swa/test_torch_native.py b/test/registered/attention/unittests/swa/test_torch_native.py index f98a62100..83c0e582e 100644 --- a/test/registered/attention/unittests/swa/test_torch_native.py +++ b/test/registered/attention/unittests/swa/test_torch_native.py @@ -12,8 +12,8 @@ from sglang.test.kits.attention_unittest.attention_methods.dense_attention impor ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/attention/unittests/swa/test_triton.py b/test/registered/attention/unittests/swa/test_triton.py index aeeb84c08..9313bf65e 100644 --- a/test/registered/attention/unittests/swa/test_triton.py +++ b/test/registered/attention/unittests/swa/test_triton.py @@ -23,8 +23,8 @@ from sglang.test.kits.attention_unittest.runner_modes.split_op_runner import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=12, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/backends/test_deepseek_v3_fp4_cutedsl_moe.py b/test/registered/backends/test_deepseek_v3_fp4_cutedsl_moe.py index 2da591e07..e5e0a3ec9 100644 --- a/test/registered/backends/test_deepseek_v3_fp4_cutedsl_moe.py +++ b/test/registered/backends/test_deepseek_v3_fp4_cutedsl_moe.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=243, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=259, stage="extra-b", runner_config="4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" SERVER_LAUNCH_TIMEOUT = 1000 diff --git a/test/registered/backends/test_flashinfer_fusion_preflight.py b/test/registered/backends/test_flashinfer_fusion_preflight.py index f99b931c3..e3d817edb 100644 --- a/test/registered/backends/test_flashinfer_fusion_preflight.py +++ b/test/registered/backends/test_flashinfer_fusion_preflight.py @@ -11,7 +11,7 @@ from sglang.srt.utils import get_cuda_driver_bindings, is_flashinfer_available from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=28, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=26, stage="base-b", runner_config="2-gpu-large") WORLD_SIZE = 2 diff --git a/test/registered/backends/test_torch_compile.py b/test/registered/backends/test_torch_compile.py index 76e724522..dcb437d83 100644 --- a/test/registered/backends/test_torch_compile.py +++ b/test/registered/backends/test_torch_compile.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=139, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=131, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=1100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/basic_perf/test_eagle3_latency.py b/test/registered/basic_perf/test_eagle3_latency.py index 53738018c..7d707f2d1 100644 --- a/test/registered/basic_perf/test_eagle3_latency.py +++ b/test/registered/basic_perf/test_eagle3_latency.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( run_bench_serving, ) -register_cuda_ci(est_time=145, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=136, stage="extra-a", runner_config="1-gpu-large") class TestEagle3Latency(CustomTestCase): diff --git a/test/registered/basic_perf/test_embeddings_api.py b/test/registered/basic_perf/test_embeddings_api.py index 4e81fbf06..306a9d3ea 100644 --- a/test/registered/basic_perf/test_embeddings_api.py +++ b/test/registered/basic_perf/test_embeddings_api.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( run_embeddings_benchmark_multi, ) -register_cuda_ci(est_time=245, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=215, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=240, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/basic_perf/test_lora_latency.py b/test/registered/basic_perf/test_lora_latency.py index 02eec8cc3..c632b09b9 100644 --- a/test/registered/basic_perf/test_lora_latency.py +++ b/test/registered/basic_perf/test_lora_latency.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( run_bench_serving, ) -register_cuda_ci(est_time=490, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=247, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=430, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/basic_perf/test_moe_throughput.py b/test/registered/basic_perf/test_moe_throughput.py index c86befa15..ddcbacf84 100644 --- a/test/registered/basic_perf/test_moe_throughput.py +++ b/test/registered/basic_perf/test_moe_throughput.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( run_bench_serving, ) -register_cuda_ci(est_time=290, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=271, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=770, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/basic_perf/test_pp_throughput.py b/test/registered/basic_perf/test_pp_throughput.py index 80355b5e7..ad68c55ee 100644 --- a/test/registered/basic_perf/test_pp_throughput.py +++ b/test/registered/basic_perf/test_pp_throughput.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( run_bench_serving, ) -register_cuda_ci(est_time=490, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=325, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=1030, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/basic_perf/test_score_api.py b/test/registered/basic_perf/test_score_api.py index 10011da22..5e9218447 100644 --- a/test/registered/basic_perf/test_score_api.py +++ b/test/registered/basic_perf/test_score_api.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( run_score_benchmark_multi, ) -register_cuda_ci(est_time=215, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=185, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=210, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/basic_perf/test_serving_latency.py b/test/registered/basic_perf/test_serving_latency.py index b6136d99c..94024af83 100644 --- a/test/registered/basic_perf/test_serving_latency.py +++ b/test/registered/basic_perf/test_serving_latency.py @@ -10,7 +10,7 @@ from sglang.test.test_utils import ( run_bench_serving, ) -register_cuda_ci(est_time=190, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=182, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=165, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/basic_perf/test_serving_throughput.py b/test/registered/basic_perf/test_serving_throughput.py index af2d47b8d..64eefb6b6 100644 --- a/test/registered/basic_perf/test_serving_throughput.py +++ b/test/registered/basic_perf/test_serving_throughput.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( run_bench_serving, ) -register_cuda_ci(est_time=710, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=660, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=810, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/basic_perf/test_torch_compile_throughput.py b/test/registered/basic_perf/test_torch_compile_throughput.py index 53ab7db8b..3ce518048 100644 --- a/test/registered/basic_perf/test_torch_compile_throughput.py +++ b/test/registered/basic_perf/test_torch_compile_throughput.py @@ -10,7 +10,7 @@ from sglang.test.test_utils import ( run_bench_offline_throughput, ) -register_cuda_ci(est_time=75, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=85, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=280, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/basic_perf/test_vlm_serving_fa3.py b/test/registered/basic_perf/test_vlm_serving_fa3.py index 2ac8cce5f..7d130fc90 100644 --- a/test/registered/basic_perf/test_vlm_serving_fa3.py +++ b/test/registered/basic_perf/test_vlm_serving_fa3.py @@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kits.vlm_perf_kit import check_vlm_serving_perf from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=150, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=152, stage="extra-a", runner_config="1-gpu-large") class TestVLMServingFa3(CustomTestCase): diff --git a/test/registered/basic_perf/test_vlm_serving_flashinfer.py b/test/registered/basic_perf/test_vlm_serving_flashinfer.py index 6ea0bb40b..7d3bcdc4c 100644 --- a/test/registered/basic_perf/test_vlm_serving_flashinfer.py +++ b/test/registered/basic_perf/test_vlm_serving_flashinfer.py @@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kits.vlm_perf_kit import check_vlm_serving_perf from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=195, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=191, stage="extra-a", runner_config="1-gpu-small") class TestVLMServingFlashinfer(CustomTestCase): diff --git a/test/registered/bench_fn/test_bench_serving_reasoning_stream.py b/test/registered/bench_fn/test_bench_serving_reasoning_stream.py index a4c4096d3..31878bbc6 100644 --- a/test/registered/bench_fn/test_bench_serving_reasoning_stream.py +++ b/test/registered/bench_fn/test_bench_serving_reasoning_stream.py @@ -26,7 +26,7 @@ from sglang.benchmark.serving import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=16, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") def _free_port() -> int: diff --git a/test/registered/bench_fn/test_benchmark_datasets_api.py b/test/registered/bench_fn/test_benchmark_datasets_api.py index 8cf03b505..9680ce5ac 100644 --- a/test/registered/bench_fn/test_benchmark_datasets_api.py +++ b/test/registered/bench_fn/test_benchmark_datasets_api.py @@ -60,7 +60,7 @@ from sglang.benchmark.serving import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=38, suite="base-a-test-cpu") +register_cpu_ci(est_time=36, suite="base-a-test-cpu") register_cpu_ci(est_time=46, suite="stage-b-test-cpu-intel") diff --git a/test/registered/bench_fn/test_steady_state_benchmark.py b/test/registered/bench_fn/test_steady_state_benchmark.py index fe02fa1dd..7aa8456bc 100644 --- a/test/registered/bench_fn/test_steady_state_benchmark.py +++ b/test/registered/bench_fn/test_steady_state_benchmark.py @@ -13,7 +13,7 @@ from sglang.benchmark.steady_state import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class _StringTokenizer: diff --git a/test/registered/chunked_prefill/test_mm_chunked_embedding_unit.py b/test/registered/chunked_prefill/test_mm_chunked_embedding_unit.py index fa1063506..5d8d0b905 100644 --- a/test/registered/chunked_prefill/test_mm_chunked_embedding_unit.py +++ b/test/registered/chunked_prefill/test_mm_chunked_embedding_unit.py @@ -25,7 +25,7 @@ from sglang.srt.multimodal.transport.cuda_ipc import ( from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") @pytest.fixture(autouse=True) diff --git a/test/registered/chunked_prefill/test_scripted_core_1gpu.py b/test/registered/chunked_prefill/test_scripted_core_1gpu.py index e37010d75..167ba84a9 100644 --- a/test/registered/chunked_prefill/test_scripted_core_1gpu.py +++ b/test/registered/chunked_prefill/test_scripted_core_1gpu.py @@ -10,7 +10,7 @@ from sglang.test.scripted_runtime_chunked_helpers import ( run_until_finished, ) -register_cuda_ci(est_time=106, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=103, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=198, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/chunked_prefill/test_scripted_core_4gpu.py b/test/registered/chunked_prefill/test_scripted_core_4gpu.py index ff3f021db..a78271db0 100644 --- a/test/registered/chunked_prefill/test_scripted_core_4gpu.py +++ b/test/registered/chunked_prefill/test_scripted_core_4gpu.py @@ -11,7 +11,7 @@ from sglang.test.scripted_runtime_chunked_helpers import ( run_until_finished, ) -register_cuda_ci(est_time=55, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=96, stage="extra-b", runner_config="4-gpu-h100") _CHUNK_SIZE = 64 diff --git a/test/registered/chunked_prefill/test_scripted_swa_1gpu.py b/test/registered/chunked_prefill/test_scripted_swa_1gpu.py index 7937f4a15..99d52ba44 100644 --- a/test/registered/chunked_prefill/test_scripted_swa_1gpu.py +++ b/test/registered/chunked_prefill/test_scripted_swa_1gpu.py @@ -5,7 +5,7 @@ from sglang.test.scripted_runtime.context import ScriptedContext from sglang.test.scripted_runtime.test_case import ScriptedTestCase from sglang.test.scripted_runtime_chunked_helpers import base_engine_kwargs -register_cuda_ci(est_time=130, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=137, stage="extra-a", runner_config="1-gpu-large") _SWA_MODEL = "openai/gpt-oss-20b" diff --git a/test/registered/constrained_decoding/test_constrained_decoding.py b/test/registered/constrained_decoding/test_constrained_decoding.py index 3de939bcf..f5bcdf344 100644 --- a/test/registered/constrained_decoding/test_constrained_decoding.py +++ b/test/registered/constrained_decoding/test_constrained_decoding.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=161, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=149, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=220, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/core/test_basic_sanity.py b/test/registered/core/test_basic_sanity.py index 4dca71625..727891f4c 100644 --- a/test/registered/core/test_basic_sanity.py +++ b/test/registered/core/test_basic_sanity.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=97, stage="base-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=112, stage="base-a", runner_config="1-gpu-small") register_amd_ci(est_time=160, suite="stage-a-test-1-gpu-small-amd") diff --git a/test/registered/core/test_basic_sanity_dflash.py b/test/registered/core/test_basic_sanity_dflash.py index d37085677..f4b9fcea7 100644 --- a/test/registered/core/test_basic_sanity_dflash.py +++ b/test/registered/core/test_basic_sanity_dflash.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=135, stage="base-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=94, stage="base-a", runner_config="1-gpu-small") class TestBasicSanityDFlash( diff --git a/test/registered/core/test_basic_sanity_dspark.py b/test/registered/core/test_basic_sanity_dspark.py index bc0d55a27..e2dfbf0c7 100644 --- a/test/registered/core/test_basic_sanity_dspark.py +++ b/test/registered/core/test_basic_sanity_dspark.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=97, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=92, stage="base-b", runner_config="1-gpu-large") TARGET_MODEL = "Qwen/Qwen3-14B" DRAFT_MODEL = "deepseek-ai/dspark_qwen3_14b_block7" diff --git a/test/registered/core/test_basic_sanity_eagle3.py b/test/registered/core/test_basic_sanity_eagle3.py index 1ad5185a1..3c84e7874 100644 --- a/test/registered/core/test_basic_sanity_eagle3.py +++ b/test/registered/core/test_basic_sanity_eagle3.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=167, stage="base-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=112, stage="base-a", runner_config="1-gpu-small") register_amd_ci(est_time=200, suite="stage-a-test-1-gpu-small-amd") diff --git a/test/registered/core/test_engine_child_pids.py b/test/registered/core/test_engine_child_pids.py index 5b38585c5..f385e32c2 100644 --- a/test/registered/core/test_engine_child_pids.py +++ b/test/registered/core/test_engine_child_pids.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=77, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=34, stage="base-b", runner_config="1-gpu-small") class TestEngineChildPids(CustomTestCase): diff --git a/test/registered/core/test_hidden_states.py b/test/registered/core/test_hidden_states.py index 86d2a047f..8bf37f8e5 100644 --- a/test/registered/core/test_hidden_states.py +++ b/test/registered/core/test_hidden_states.py @@ -8,7 +8,7 @@ from sglang.srt.utils import get_device, is_hip from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase -register_cuda_ci(est_time=32, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=31, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=55, suite="stage-b-test-1-gpu-small-amd") _is_hip = is_hip() diff --git a/test/registered/core/test_no_extra_forked_cuda_context.py b/test/registered/core/test_no_extra_forked_cuda_context.py index 21eafda78..08a4014fd 100644 --- a/test/registered/core/test_no_extra_forked_cuda_context.py +++ b/test/registered/core/test_no_extra_forked_cuda_context.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=54, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=53, stage="base-b", runner_config="2-gpu-large") class TestTPServerGPUProcesses(CustomTestCase): diff --git a/test/registered/core/test_request_queue_validation.py b/test/registered/core/test_request_queue_validation.py index 6bd35a636..886942398 100644 --- a/test/registered/core/test_request_queue_validation.py +++ b/test/registered/core/test_request_queue_validation.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( send_generate_requests, ) -register_cuda_ci(est_time=53, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=63, stage="base-b", runner_config="1-gpu-small") class TestMaxQueuedRequests(CustomTestCase): diff --git a/test/registered/core/test_srt_empty_deps.py b/test/registered/core/test_srt_empty_deps.py index 192a8b7d9..111cd080d 100644 --- a/test/registered/core/test_srt_empty_deps.py +++ b/test/registered/core/test_srt_empty_deps.py @@ -12,7 +12,7 @@ import pytest from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") # Packages known to transitively depend on torch or triton. # If a new package is added to runtime_base and it pulls torch, diff --git a/test/registered/core/test_srt_endpoint.py b/test/registered/core/test_srt_endpoint.py index d43465e75..9388af044 100644 --- a/test/registered/core/test_srt_endpoint.py +++ b/test/registered/core/test_srt_endpoint.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import ( run_logprob_check, ) -register_cuda_ci(est_time=265, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=250, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=260, suite="stage-b-test-1-gpu-small-amd") SERVER_ENV = {"SGLANG_USE_PICKLE_IPC": "0"} diff --git a/test/registered/core/test_srt_engine.py b/test/registered/core/test_srt_engine.py index 1559ad0e1..d1412ea28 100644 --- a/test/registered/core/test_srt_engine.py +++ b/test/registered/core/test_srt_engine.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=276, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=286, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=261, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/cp/test_cp_strategy_unit.py b/test/registered/cp/test_cp_strategy_unit.py index 70da8f1e5..d45e16598 100644 --- a/test/registered/cp/test_cp_strategy_unit.py +++ b/test/registered/cp/test_cp_strategy_unit.py @@ -41,7 +41,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _ExtendMode: diff --git a/test/registered/cp/test_deepseek_v3_cp_single_node.py b/test/registered/cp/test_deepseek_v3_cp_single_node.py index f6259096a..ef17deef6 100644 --- a/test/registered/cp/test_deepseek_v3_cp_single_node.py +++ b/test/registered/cp/test_deepseek_v3_cp_single_node.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=275, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=334, stage="extra-b", runner_config="8-gpu-h200") DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324" diff --git a/test/registered/cp/test_deepseek_v4_flash_fp4_b200_cp.py b/test/registered/cp/test_deepseek_v4_flash_fp4_b200_cp.py index 812053168..619a8cdcd 100644 --- a/test/registered/cp/test_deepseek_v4_flash_fp4_b200_cp.py +++ b/test/registered/cp/test_deepseek_v4_flash_fp4_b200_cp.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=689, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=654, stage="extra-b", runner_config="4-gpu-b200") MODEL = "deepseek-ai/DeepSeek-V4-Flash" SERVER_LAUNCH_TIMEOUT = 3600 diff --git a/test/registered/cp/test_dsa_prefill_cp.py b/test/registered/cp/test_dsa_prefill_cp.py index 8671a9a97..4ee11d0dc 100644 --- a/test/registered/cp/test_dsa_prefill_cp.py +++ b/test/registered/cp/test_dsa_prefill_cp.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=314, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=433, stage="extra-b", runner_config="8-gpu-h200") GLM52_MODEL_PATH = "zai-org/GLM-5.2-FP8" SERVER_LAUNCH_TIMEOUT = max(DEFAULT_TIMEOUT_FOR_SERVER_LAUNCH, 1800) diff --git a/test/registered/cp/test_gpt_oss_4gpu_mxfp4_cp.py b/test/registered/cp/test_gpt_oss_4gpu_mxfp4_cp.py index 6039ed3a3..0bba0b956 100644 --- a/test/registered/cp/test_gpt_oss_4gpu_mxfp4_cp.py +++ b/test/registered/cp/test_gpt_oss_4gpu_mxfp4_cp.py @@ -3,7 +3,7 @@ import unittest from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=121, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=127, stage="extra-b", runner_config="4-gpu-b200") class TestGptOss4GpuMxfp4CP(BaseTestGptOss): diff --git a/test/registered/cp/test_gqa_prefill_cp.py b/test/registered/cp/test_gqa_prefill_cp.py index 69ea296d7..119270bad 100644 --- a/test/registered/cp/test_gqa_prefill_cp.py +++ b/test/registered/cp/test_gqa_prefill_cp.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=466, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=553, stage="extra-b", runner_config="4-gpu-h100") GQA_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8" diff --git a/test/registered/cuda_graph/breakable/test_bcg_with_speculative_decoding.py b/test/registered/cuda_graph/breakable/test_bcg_with_speculative_decoding.py index b67bc159a..437ebc82a 100644 --- a/test/registered/cuda_graph/breakable/test_bcg_with_speculative_decoding.py +++ b/test/registered/cuda_graph/breakable/test_bcg_with_speculative_decoding.py @@ -12,7 +12,7 @@ import unittest from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.server_fixtures.pcg_spec_fixture import PCGSpecBase -register_cuda_ci(est_time=106, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=103, stage="base-b", runner_config="2-gpu-large") class TestBCGWithEAGLE3(PCGSpecBase, unittest.TestCase): diff --git a/test/registered/cuda_graph/breakable/test_breakable_cuda_graph.py b/test/registered/cuda_graph/breakable/test_breakable_cuda_graph.py index 9c9faa1eb..413205b03 100644 --- a/test/registered/cuda_graph/breakable/test_breakable_cuda_graph.py +++ b/test/registered/cuda_graph/breakable/test_breakable_cuda_graph.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( ) # CI Registration — large suite to fit the integration test's server startup. -register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=88, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=200, suite="stage-c-test-large-8-gpu-amd-mi35x") diff --git a/test/registered/cuda_graph/full_prefill/test_full_cuda_graph_prefill.py b/test/registered/cuda_graph/full_prefill/test_full_cuda_graph_prefill.py index c6fb04c79..a4f0f6feb 100644 --- a/test/registered/cuda_graph/full_prefill/test_full_cuda_graph_prefill.py +++ b/test/registered/cuda_graph/full_prefill/test_full_cuda_graph_prefill.py @@ -33,7 +33,7 @@ from sglang.test.test_utils import ( # OSS FA4 coverage requires Blackwell. The PP test uses two GPUs; the other # tests use one GPU. -register_cuda_ci(est_time=251, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=278, stage="base-b", runner_config="4-gpu-b200") def _prefill_graph_count(base_url: str) -> float: diff --git a/test/registered/cuda_graph/test_cuda_piecewise_backend.py b/test/registered/cuda_graph/test_cuda_piecewise_backend.py index 7efb5f78d..ba7f5cdd3 100644 --- a/test/registered/cuda_graph/test_cuda_piecewise_backend.py +++ b/test/registered/cuda_graph/test_cuda_piecewise_backend.py @@ -5,7 +5,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") if not torch.cuda.is_available(): pytest.skip("CUDA piecewise backend requires CUDA", allow_module_level=True) diff --git a/test/registered/dcp/test_dcp_layout_unit.py b/test/registered/dcp/test_dcp_layout_unit.py index 7c63381f2..1174f3b78 100644 --- a/test/registered/dcp/test_dcp_layout_unit.py +++ b/test/registered/dcp/test_dcp_layout_unit.py @@ -33,7 +33,7 @@ from sglang.srt.mem_cache.memory_pool import HybridLinearKVPool from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") DCP_SIZES = [1, 2, 3, 4, 8] LENS = list(range(0, 41)) diff --git a/test/registered/dcp/test_dsv31_dcp8_gsm8k.py b/test/registered/dcp/test_dsv31_dcp8_gsm8k.py index dc075a85e..23eb571da 100644 --- a/test/registered/dcp/test_dsv31_dcp8_gsm8k.py +++ b/test/registered/dcp/test_dsv31_dcp8_gsm8k.py @@ -55,7 +55,7 @@ from sglang.test.test_utils import ( # --------------------------------------------------------------------------- # CI registration — only TestDSV31DCP8TP8GSM8K runs in CI # --------------------------------------------------------------------------- -register_cuda_ci(est_time=213, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=248, stage="extra-b", runner_config="8-gpu-h200") DEEPSEEK_V31_MODEL_PATH = "deepseek-ai/DeepSeek-V3.1" diff --git a/test/registered/dcp/test_kimi_linear_dcp4.py b/test/registered/dcp/test_kimi_linear_dcp4.py index a565553b2..9378fc437 100644 --- a/test/registered/dcp/test_kimi_linear_dcp4.py +++ b/test/registered/dcp/test_kimi_linear_dcp4.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=105, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=98, stage="extra-b", runner_config="4-gpu-b200") KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct" CUDA_GRAPH_MAX_BS_DECODE = 256 diff --git a/test/registered/dcp/test_kimi_linear_dcp_dspark4.py b/test/registered/dcp/test_kimi_linear_dcp_dspark4.py index 49e9f448b..fb2d73cba 100644 --- a/test/registered/dcp/test_kimi_linear_dcp_dspark4.py +++ b/test/registered/dcp/test_kimi_linear_dcp_dspark4.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=201, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=206, stage="extra-b", runner_config="4-gpu-b200") KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct" GSM8K_SCORE_THRESHOLD = 0.88 diff --git a/test/registered/debug_utils/test_tensor_dump_forward_hook.py b/test/registered/debug_utils/test_tensor_dump_forward_hook.py index 1d0d7b114..fe7d2b32b 100644 --- a/test/registered/debug_utils/test_tensor_dump_forward_hook.py +++ b/test/registered/debug_utils/test_tensor_dump_forward_hook.py @@ -18,7 +18,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.layer_ut_utils import init_single_process_dist from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") # Backend-specific: the hook resolves get_device() and the matching distributed # backend, so only an AMD run exercises the HIP device and dump path. register_amd_ci(est_time=15, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/disaggregation/test_disaggregation_aarch64.py b/test/registered/disaggregation/test_disaggregation_aarch64.py index 9c6a2aa79..6fe9bd95b 100644 --- a/test/registered/disaggregation/test_disaggregation_aarch64.py +++ b/test/registered/disaggregation/test_disaggregation_aarch64.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( QWEN3_8B_MODEL_PATH = "Qwen/Qwen3-8B" -register_cuda_ci(est_time=125, stage="base-c", runner_config="4-gpu-gb300") +register_cuda_ci(est_time=137, stage="base-c", runner_config="4-gpu-gb300") # Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner. NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 120 diff --git a/test/registered/disaggregation/test_disaggregation_basic.py b/test/registered/disaggregation/test_disaggregation_basic.py index 1764b7f03..7a9be5337 100644 --- a/test/registered/disaggregation/test_disaggregation_basic.py +++ b/test/registered/disaggregation/test_disaggregation_basic.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( DEFAULT_TARGET_MODEL_EAGLE3, ) -register_cuda_ci(est_time=1007, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=895, stage="base-b", runner_config="2-gpu-large") class TestDisaggregationAccuracy(PauseResumeInPlaceMixin, PDDisaggregationServerBase): diff --git a/test/registered/disaggregation/test_disaggregation_chunked_prefill_abort.py b/test/registered/disaggregation/test_disaggregation_chunked_prefill_abort.py index 3550ca062..9452e4f1c 100644 --- a/test/registered/disaggregation/test_disaggregation_chunked_prefill_abort.py +++ b/test/registered/disaggregation/test_disaggregation_chunked_prefill_abort.py @@ -12,7 +12,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( ) from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST -register_cuda_ci(est_time=120, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=98, stage="base-b", runner_config="2-gpu-large") PD_CHUNKED_ABORT_EXTRA_ARGS = [ "--max-running-requests", diff --git a/test/registered/disaggregation/test_disaggregation_decode_radix_cache.py b/test/registered/disaggregation/test_disaggregation_decode_radix_cache.py index a78a7a933..008ede256 100644 --- a/test/registered/disaggregation/test_disaggregation_decode_radix_cache.py +++ b/test/registered/disaggregation/test_disaggregation_decode_radix_cache.py @@ -26,7 +26,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=170, stage="base-c", runner_config="8-gpu-h20") +register_cuda_ci(est_time=164, stage="base-c", runner_config="8-gpu-h20") def _has_mooncake(): diff --git a/test/registered/disaggregation/test_disaggregation_decode_radix_cache_swa.py b/test/registered/disaggregation/test_disaggregation_decode_radix_cache_swa.py index 58ab20604..959bf9fc9 100644 --- a/test/registered/disaggregation/test_disaggregation_decode_radix_cache_swa.py +++ b/test/registered/disaggregation/test_disaggregation_decode_radix_cache_swa.py @@ -17,7 +17,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( ) from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST_MXFP4_WITH_MOE, is_in_ci -register_cuda_ci(est_time=365, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=334, stage="extra-b", runner_config="8-gpu-h200") SWA_SERVER_ARGS = ["--page-size", "64", "--attention-backend", "triton"] diff --git a/test/registered/disaggregation/test_disaggregation_different_tp.py b/test/registered/disaggregation/test_disaggregation_different_tp.py index 67145d595..6829862a9 100644 --- a/test/registered/disaggregation/test_disaggregation_different_tp.py +++ b/test/registered/disaggregation/test_disaggregation_different_tp.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=1171, stage="base-c", runner_config="8-gpu-h20") +register_cuda_ci(est_time=1180, stage="base-c", runner_config="8-gpu-h20") class TestDisaggregationMooncakePrefillLargerTP(PDDisaggregationServerBase): diff --git a/test/registered/disaggregation/test_disaggregation_dp_attention.py b/test/registered/disaggregation/test_disaggregation_dp_attention.py index 50a8a4f1c..693e52eb2 100644 --- a/test/registered/disaggregation/test_disaggregation_dp_attention.py +++ b/test/registered/disaggregation/test_disaggregation_dp_attention.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=140, stage="base-c", runner_config="8-gpu-h20") +register_cuda_ci(est_time=141, stage="base-c", runner_config="8-gpu-h20") class TestDisaggregationDPAttention(PDDisaggregationServerBase): diff --git a/test/registered/disaggregation/test_disaggregation_dsv4.py b/test/registered/disaggregation/test_disaggregation_dsv4.py index 4d5722f54..6b23d25e4 100644 --- a/test/registered/disaggregation/test_disaggregation_dsv4.py +++ b/test/registered/disaggregation/test_disaggregation_dsv4.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=184, stage="base-c", runner_config="8-gpu-h200") +register_cuda_ci(est_time=206, stage="base-c", runner_config="8-gpu-h200") DSV4_FLASH_MODEL = "sgl-project/DeepSeek-V4-Flash-FP8" diff --git a/test/registered/disaggregation/test_disaggregation_dwdp_gpt_oss.py b/test/registered/disaggregation/test_disaggregation_dwdp_gpt_oss.py index d45ada047..7a5d75628 100644 --- a/test/registered/disaggregation/test_disaggregation_dwdp_gpt_oss.py +++ b/test/registered/disaggregation/test_disaggregation_dwdp_gpt_oss.py @@ -7,7 +7,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( PDDisaggregationServerBase, ) -register_cuda_ci(est_time=170, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=187, stage="extra-b", runner_config="4-gpu-b200") GPT_OSS_MODEL_PATH = "openai/gpt-oss-120b" GSM8K_BASELINE_ACCURACY = 0.88 diff --git a/test/registered/disaggregation/test_disaggregation_hisparse.py b/test/registered/disaggregation/test_disaggregation_hisparse.py index 1b212012b..d34e00b09 100644 --- a/test/registered/disaggregation/test_disaggregation_hisparse.py +++ b/test/registered/disaggregation/test_disaggregation_hisparse.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=212, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=235, stage="extra-b", runner_config="8-gpu-h200") DSV4_FLASH_MODEL = "sgl-project/DeepSeek-V4-Flash-FP8" DSV4_FLASH_LOADER_CONFIG = '{"enable_multithread_load": true, "num_threads": 64}' diff --git a/test/registered/disaggregation/test_disaggregation_hybrid_attention.py b/test/registered/disaggregation/test_disaggregation_hybrid_attention.py index 66f19afee..1395e4c58 100644 --- a/test/registered/disaggregation/test_disaggregation_hybrid_attention.py +++ b/test/registered/disaggregation/test_disaggregation_hybrid_attention.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_pd_server, ) -register_cuda_ci(est_time=578, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=649, stage="extra-b", runner_config="8-gpu-h200") @unittest.skipIf(is_in_ci(), "Temporarily disable the flaky test.") diff --git a/test/registered/disaggregation/test_disaggregation_inkling_mxfp8.py b/test/registered/disaggregation/test_disaggregation_inkling_mxfp8.py index 6821e91b8..a31219711 100644 --- a/test/registered/disaggregation/test_disaggregation_inkling_mxfp8.py +++ b/test/registered/disaggregation/test_disaggregation_inkling_mxfp8.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=447, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=427, stage="extra-b", runner_config="4-gpu-b200") MODEL = os.environ.get( "INKLING_SMALL_TEST_MODEL_PATH", "thinkingmachines/Inkling-Small-NVFP4" diff --git a/test/registered/disaggregation/test_disaggregation_kimi_linear.py b/test/registered/disaggregation/test_disaggregation_kimi_linear.py index db6f37df7..a6a341576 100644 --- a/test/registered/disaggregation/test_disaggregation_kimi_linear.py +++ b/test/registered/disaggregation/test_disaggregation_kimi_linear.py @@ -6,7 +6,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( PDDisaggregationServerBase, ) -register_cuda_ci(est_time=259, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=278, stage="base-c", runner_config="4-gpu-h100") KIMI_LINEAR_MODEL = "yujiepan/kimi-linear-tiny-random" SERVER_ENV = {"SGLANG_BATCH_INVARIANT_OPS_ENABLE_MM_DEEPGEMM": "0"} diff --git a/test/registered/disaggregation/test_disaggregation_nixl.py b/test/registered/disaggregation/test_disaggregation_nixl.py index 04850bc32..28d8f95e0 100644 --- a/test/registered/disaggregation/test_disaggregation_nixl.py +++ b/test/registered/disaggregation/test_disaggregation_nixl.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=350, stage="base-c", runner_config="8-gpu-h20") +register_cuda_ci(est_time=352, stage="base-c", runner_config="8-gpu-h20") # base-c 8-GPU runner is required for TP4 prefill + TP4 decode. NIXL_PREFILL_TP_SIZE = 4 diff --git a/test/registered/disaggregation/test_disaggregation_optimistic_prefill.py b/test/registered/disaggregation/test_disaggregation_optimistic_prefill.py index 8ae3a54b7..6ab4228a2 100644 --- a/test/registered/disaggregation/test_disaggregation_optimistic_prefill.py +++ b/test/registered/disaggregation/test_disaggregation_optimistic_prefill.py @@ -41,7 +41,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( ) from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST, CustomTestCase -register_cuda_ci(est_time=300, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=417, stage="base-b", runner_config="2-gpu-large") FORCE_RETRY_PROB = 0.1 diff --git a/test/registered/disaggregation/test_disaggregation_pp.py b/test/registered/disaggregation/test_disaggregation_pp.py index 47be3e223..10c61f6e6 100644 --- a/test/registered/disaggregation/test_disaggregation_pp.py +++ b/test/registered/disaggregation/test_disaggregation_pp.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=250, stage="base-c", runner_config="8-gpu-h20") +register_cuda_ci(est_time=251, stage="base-c", runner_config="8-gpu-h20") class TestDisaggregationPrefillPPDynamicChunkAccuracy(PDDisaggregationServerBase): diff --git a/test/registered/disaggregation/test_disaggregation_rust_server.py b/test/registered/disaggregation/test_disaggregation_rust_server.py index 769a9fc79..57c90af89 100644 --- a/test/registered/disaggregation/test_disaggregation_rust_server.py +++ b/test/registered/disaggregation/test_disaggregation_rust_server.py @@ -27,7 +27,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( ) from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST, is_rust_server_built -register_cuda_ci(est_time=66, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=73, stage="base-b", runner_config="2-gpu-large") @unittest.skipUnless( diff --git a/test/registered/disaggregation/test_disaggregation_unified_memory.py b/test/registered/disaggregation/test_disaggregation_unified_memory.py index 382f625b6..690aeede4 100644 --- a/test/registered/disaggregation/test_disaggregation_unified_memory.py +++ b/test/registered/disaggregation/test_disaggregation_unified_memory.py @@ -6,7 +6,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( PDDisaggregationServerBase, ) -register_cuda_ci(est_time=236, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=382, stage="base-b", runner_config="2-gpu-large") KIMI_LINEAR_MODEL = "yujiepan/kimi-linear-tiny-random" # Smallest in-tree GDN hybrid: MHA full attention + gated-delta-net linear diff --git a/test/registered/disaggregation/test_epd_disaggregation.py b/test/registered/disaggregation/test_epd_disaggregation.py index 506db9a46..36f44b0cb 100644 --- a/test/registered/disaggregation/test_epd_disaggregation.py +++ b/test/registered/disaggregation/test_epd_disaggregation.py @@ -38,7 +38,7 @@ QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" KIMI_VL_MODEL = "moonshotai/Kimi-VL-A3B-Instruct" -register_cuda_ci(est_time=262, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=263, stage="base-c", runner_config="4-gpu-h100") @unittest.skipIf( diff --git a/test/registered/dllm/test_dllm_fdfo_joint_threshold.py b/test/registered/dllm/test_dllm_fdfo_joint_threshold.py index 15dd2f4c4..3d14444d4 100644 --- a/test/registered/dllm/test_dllm_fdfo_joint_threshold.py +++ b/test/registered/dllm/test_dllm_fdfo_joint_threshold.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=141, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=151, stage="base-b", runner_config="1-gpu-large") import unittest diff --git a/test/registered/dp_attn/test_dp_attention.py b/test/registered/dp_attn/test_dp_attention.py index 7e7ea2b6f..f7925efda 100644 --- a/test/registered/dp_attn/test_dp_attention.py +++ b/test/registered/dp_attn/test_dp_attention.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=443, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=418, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=500, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/dp_attn/test_dp_attention_bcg_kl.py b/test/registered/dp_attn/test_dp_attention_bcg_kl.py index 0b5618746..c0f866087 100644 --- a/test/registered/dp_attn/test_dp_attention_bcg_kl.py +++ b/test/registered/dp_attn/test_dp_attention_bcg_kl.py @@ -28,7 +28,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=265, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=244, stage="base-b", runner_config="2-gpu-large") PREFILL_GRAPH_REPLAY_PATTERN = re.compile(r"Prefill batch.*cuda graph: True") CACHED_PREFIX_GRAPH_REPLAY_PATTERN = re.compile( diff --git a/test/registered/dp_engine/test_data_parallelism.py b/test/registered/dp_engine/test_data_parallelism.py index c7b63fa3d..fc0cfd209 100644 --- a/test/registered/dp_engine/test_data_parallelism.py +++ b/test/registered/dp_engine/test_data_parallelism.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=84, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=81, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=73, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/e2e/disaggregation/test_disaggregation_lora.py b/test/registered/e2e/disaggregation/test_disaggregation_lora.py index 18f792539..e32e5ec8f 100644 --- a/test/registered/e2e/disaggregation/test_disaggregation_lora.py +++ b/test/registered/e2e/disaggregation/test_disaggregation_lora.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=400, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=209, stage="base-b", runner_config="2-gpu-large") ADAPTERS = { "fact": "algoprog/fact-generation-llama-3.1-8b-instruct-lora", diff --git a/test/registered/e2e/disaggregation/test_disaggregation_unified_memory_swa.py b/test/registered/e2e/disaggregation/test_disaggregation_unified_memory_swa.py index 7a5ced975..f021df6e8 100644 --- a/test/registered/e2e/disaggregation/test_disaggregation_unified_memory_swa.py +++ b/test/registered/e2e/disaggregation/test_disaggregation_unified_memory_swa.py @@ -29,7 +29,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( ) from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST_MXFP4_WITH_MOE -register_cuda_ci(est_time=1200, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=134, stage="extra-a", runner_config="2-gpu-large") UNIFIED_SWA_ARGS = [ "--skip-tokenizer-init", diff --git a/test/registered/e2e/disaggregation/test_disaggregation_unified_memory_tri.py b/test/registered/e2e/disaggregation/test_disaggregation_unified_memory_tri.py index 3e213c019..2f349453d 100644 --- a/test/registered/e2e/disaggregation/test_disaggregation_unified_memory_tri.py +++ b/test/registered/e2e/disaggregation/test_disaggregation_unified_memory_tri.py @@ -32,7 +32,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( PDDisaggregationServerBase, ) -register_cuda_ci(est_time=900, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=132, stage="extra-a", runner_config="2-gpu-large") _MODEL_PATH = os.environ.get("INKLING_TEST_MODEL_PATH", "thinkingmachines/Inkling") _MODEL_REVISION = os.environ.get("INKLING_TEST_MODEL_REVISION", "test") diff --git a/test/registered/e2e/dp_attn/test_dp_attention_local_control_broadcast.py b/test/registered/e2e/dp_attn/test_dp_attention_local_control_broadcast.py index 556d986d3..cd6dfeb21 100644 --- a/test/registered/e2e/dp_attn/test_dp_attention_local_control_broadcast.py +++ b/test/registered/e2e/dp_attn/test_dp_attention_local_control_broadcast.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=400, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=123, stage="base-c", runner_config="4-gpu-h100") _INPUT_IDS = list(range(10, 30)) _REQUEST_TIMEOUT = 120 diff --git a/test/registered/e2e/gdn/test_qwen35_gdn_multi_item_scoring.py b/test/registered/e2e/gdn/test_qwen35_gdn_multi_item_scoring.py index fe9737147..c82a0137c 100644 --- a/test/registered/e2e/gdn/test_qwen35_gdn_multi_item_scoring.py +++ b/test/registered/e2e/gdn/test_qwen35_gdn_multi_item_scoring.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=240, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=35, stage="extra-a", runner_config="1-gpu-large") class TestQwen35GDNMultiItemScoring(CustomTestCase): diff --git a/test/registered/e2e/hicache/test_hicache_storage_lora.py b/test/registered/e2e/hicache/test_hicache_storage_lora.py index fd8051b09..41f538fb1 100644 --- a/test/registered/e2e/hicache/test_hicache_storage_lora.py +++ b/test/registered/e2e/hicache/test_hicache_storage_lora.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=300, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=126, stage="base-b", runner_config="1-gpu-large") LORA_NAME = "sql" LORA_PATH = "philschmid/code-llama-3-1-8b-text-to-sql-lora" diff --git a/test/registered/e2e/hicache/test_hicache_unified_memory.py b/test/registered/e2e/hicache/test_hicache_unified_memory.py index ffccb2476..99444de88 100644 --- a/test/registered/e2e/hicache/test_hicache_unified_memory.py +++ b/test/registered/e2e/hicache/test_hicache_unified_memory.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=600, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=531, stage="extra-a", runner_config="2-gpu-large") _COMMON_ARGS = [ "--trust-remote-code", diff --git a/test/registered/e2e/layers/test_logprob_memory_distributed.py b/test/registered/e2e/layers/test_logprob_memory_distributed.py index cbeacc64b..58aefdd1a 100644 --- a/test/registered/e2e/layers/test_logprob_memory_distributed.py +++ b/test/registered/e2e/layers/test_logprob_memory_distributed.py @@ -15,7 +15,7 @@ from sglang.srt.layers.logprob_processor import InputLogprobProcessor from sglang.srt.model_executor.runner_utils import pool from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=60, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=20, stage="base-b", runner_config="2-gpu-large") def _run_rank(rank, rendezvous): diff --git a/test/registered/e2e/lora/test_lora_moe_prefill_cuda_graph.py b/test/registered/e2e/lora/test_lora_moe_prefill_cuda_graph.py index f43e3a581..d98a2ef19 100644 --- a/test/registered/e2e/lora/test_lora_moe_prefill_cuda_graph.py +++ b/test/registered/e2e/lora/test_lora_moe_prefill_cuda_graph.py @@ -27,7 +27,7 @@ from sglang.test.lora_utils import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=600, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=153, stage="extra-a", runner_config="1-gpu-large") # Missing adapters shift logprobs by 7-17. LOGPROB_THRESHOLD = 1.0 diff --git a/test/registered/e2e/models/test_compressed_tensors_models.py b/test/registered/e2e/models/test_compressed_tensors_models.py index b9135d57c..fd94e9fcc 100644 --- a/test/registered/e2e/models/test_compressed_tensors_models.py +++ b/test/registered/e2e/models/test_compressed_tensors_models.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=63, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=64, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=42, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/e2e/models/test_deepseek_v3_fp4.py b/test/registered/e2e/models/test_deepseek_v3_fp4.py index dcfd0fca3..a0242a1b4 100644 --- a/test/registered/e2e/models/test_deepseek_v3_fp4.py +++ b/test/registered/e2e/models/test_deepseek_v3_fp4.py @@ -7,7 +7,7 @@ from sglang.test.server_fixtures.default_fixture import DefaultServerBase # Per-commit: SymmetricMemory variant only. # - TestDeepseekV3FP4 (TRTLLM) archived to test/manual/quant/test_deepseek_v3_fp4_4gpu_trtllm.py # - TestDeepseekV3FP4CutlassMoE moved to test_deepseek_v3_fp4_4gpu_extra.py -register_cuda_ci(est_time=339, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=305, stage="base-c", runner_config="4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" diff --git a/test/registered/e2e/models/test_deepseek_v3_mtp.py b/test/registered/e2e/models/test_deepseek_v3_mtp.py index e5c34d044..dcac7e50a 100644 --- a/test/registered/e2e/models/test_deepseek_v3_mtp.py +++ b/test/registered/e2e/models/test_deepseek_v3_mtp.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=386, stage="base-c", runner_config="8-gpu-h200") +register_cuda_ci(est_time=289, stage="base-c", runner_config="8-gpu-h200") FULL_DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324" diff --git a/test/registered/e2e/models/test_deepseek_v4_flash_fp4_b200.py b/test/registered/e2e/models/test_deepseek_v4_flash_fp4_b200.py index 4958d2f2c..076eb97c9 100644 --- a/test/registered/e2e/models/test_deepseek_v4_flash_fp4_b200.py +++ b/test/registered/e2e/models/test_deepseek_v4_flash_fp4_b200.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=624, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=663, stage="base-c", runner_config="4-gpu-b200") MODEL = "deepseek-ai/DeepSeek-V4-Flash-0731" MTP_MODEL = "deepseek-ai/DeepSeek-V4-Flash" diff --git a/test/registered/e2e/models/test_deepseek_v4_flash_fp4_b200_trtllm.py b/test/registered/e2e/models/test_deepseek_v4_flash_fp4_b200_trtllm.py index 80173c0e5..d5018bd9c 100644 --- a/test/registered/e2e/models/test_deepseek_v4_flash_fp4_b200_trtllm.py +++ b/test/registered/e2e/models/test_deepseek_v4_flash_fp4_b200_trtllm.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=500, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=334, stage="base-c", runner_config="4-gpu-b200") MODEL = "deepseek-ai/DeepSeek-V4-Flash" SERVER_LAUNCH_TIMEOUT = 3600 diff --git a/test/registered/e2e/models/test_deepseek_v4_flash_fp4_h200.py b/test/registered/e2e/models/test_deepseek_v4_flash_fp4_h200.py index ffb70aed0..07a89d9af 100644 --- a/test/registered/e2e/models/test_deepseek_v4_flash_fp4_h200.py +++ b/test/registered/e2e/models/test_deepseek_v4_flash_fp4_h200.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=722, stage="base-c", runner_config="8-gpu-h200") +register_cuda_ci(est_time=920, stage="base-c", runner_config="8-gpu-h200") def _flashinfer_has_sm90_cutlass_mxfp4() -> bool: diff --git a/test/registered/e2e/models/test_deepseek_v4_flash_fp4_megamoe_b200.py b/test/registered/e2e/models/test_deepseek_v4_flash_fp4_megamoe_b200.py index ac3f47d87..b093a3a8f 100644 --- a/test/registered/e2e/models/test_deepseek_v4_flash_fp4_megamoe_b200.py +++ b/test/registered/e2e/models/test_deepseek_v4_flash_fp4_megamoe_b200.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=283, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=294, stage="extra-b", runner_config="4-gpu-b200") MODEL = "deepseek-ai/DeepSeek-V4-Flash-0731" SERVER_LAUNCH_TIMEOUT = 3600 diff --git a/test/registered/e2e/models/test_deepseek_v4_flash_fp8_h200.py b/test/registered/e2e/models/test_deepseek_v4_flash_fp8_h200.py index 4c956f245..e4df1a084 100644 --- a/test/registered/e2e/models/test_deepseek_v4_flash_fp8_h200.py +++ b/test/registered/e2e/models/test_deepseek_v4_flash_fp8_h200.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=294, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=286, stage="extra-b", runner_config="8-gpu-h200") MODEL_FP8 = "sgl-project/DeepSeek-V4-Flash-FP8" SERVER_LAUNCH_TIMEOUT = 3600 diff --git a/test/registered/e2e/models/test_dsa_glm52_hisparse.py b/test/registered/e2e/models/test_dsa_glm52_hisparse.py index 5cfdd34dd..237ede237 100644 --- a/test/registered/e2e/models/test_dsa_glm52_hisparse.py +++ b/test/registered/e2e/models/test_dsa_glm52_hisparse.py @@ -6,7 +6,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.test_utils import terminate_and_kill_process_tree -register_cuda_ci(est_time=483, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=560, stage="extra-b", runner_config="8-gpu-h200") GLM52_FP8_MODEL_PATH = "zai-org/GLM-5.2-FP8" diff --git a/test/registered/e2e/models/test_dsa_glm52_pd_mtp_cp_layersplit.py b/test/registered/e2e/models/test_dsa_glm52_pd_mtp_cp_layersplit.py index 63fe7024f..697376cce 100644 --- a/test/registered/e2e/models/test_dsa_glm52_pd_mtp_cp_layersplit.py +++ b/test/registered/e2e/models/test_dsa_glm52_pd_mtp_cp_layersplit.py @@ -20,7 +20,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( PDDisaggregationServerBase, ) -register_cuda_ci(est_time=898, stage="base-c", runner_config="8-gpu-b300") +register_cuda_ci(est_time=1187, stage="base-c", runner_config="8-gpu-b300") MODEL_LOADER_EXTRA_CONFIG = '{"enable_multithread_load": true, "num_threads": 6}' diff --git a/test/registered/e2e/models/test_gemma4_fp8_per_expert_loading.py b/test/registered/e2e/models/test_gemma4_fp8_per_expert_loading.py index bb6892540..afe23ce19 100644 --- a/test/registered/e2e/models/test_gemma4_fp8_per_expert_loading.py +++ b/test/registered/e2e/models/test_gemma4_fp8_per_expert_loading.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import ( # Compressed-tensors per-expert FP8 MoE checkpoint that exercises the # loader path (gated repo + ~27 GB download + 4 GPUs at TP=4). -register_cuda_ci(est_time=76, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=98, stage="base-c", runner_config="4-gpu-h100") @unittest.skipIf(get_device_sm() < 90, "Test requires CUDA SM 90 or higher") diff --git a/test/registered/e2e/models/test_generation_models.py b/test/registered/e2e/models/test_generation_models.py index 3812d3b29..00c77e036 100644 --- a/test/registered/e2e/models/test_generation_models.py +++ b/test/registered/e2e/models/test_generation_models.py @@ -1,7 +1,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Generation model tests (CUDA only) -register_cuda_ci(est_time=144, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=138, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=106, suite="stage-b-test-1-gpu-small-amd") # Copyright 2023-2024 SGLang Team diff --git a/test/registered/e2e/models/test_glm53_flash_b200.py b/test/registered/e2e/models/test_glm53_flash_b200.py index cd9993dd0..c28e9d0f2 100644 --- a/test/registered/e2e/models/test_glm53_flash_b200.py +++ b/test/registered/e2e/models/test_glm53_flash_b200.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=2400, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=831, stage="base-c", runner_config="4-gpu-b200") MODEL_PATH = "zai-org/GLM-5.3-Flash" DFLASH2_DRAFT_MODEL_PATH = "incoai/GLM-5.3-Flash-DFlash2" diff --git a/test/registered/e2e/models/test_glm53_flash_h200.py b/test/registered/e2e/models/test_glm53_flash_h200.py index 4105d21ac..18dde2652 100644 --- a/test/registered/e2e/models/test_glm53_flash_h200.py +++ b/test/registered/e2e/models/test_glm53_flash_h200.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=2400, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=824, stage="extra-b", runner_config="8-gpu-h200") MODEL_PATH = "zai-org/GLM-5.3-Flash" SERVER_LAUNCH_TIMEOUT = 3600 diff --git a/test/registered/e2e/models/test_gpt_oss_4gpu_mxfp4.py b/test/registered/e2e/models/test_gpt_oss_4gpu_mxfp4.py index 8ffe7dda9..eb4e5ff7b 100644 --- a/test/registered/e2e/models/test_gpt_oss_4gpu_mxfp4.py +++ b/test/registered/e2e/models/test_gpt_oss_4gpu_mxfp4.py @@ -3,7 +3,7 @@ import unittest from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=119, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=231, stage="base-c", runner_config="4-gpu-b200") class TestGptOss4GpuMxfp4(BaseTestGptOss): diff --git a/test/registered/e2e/models/test_gpt_oss_sm120.py b/test/registered/e2e/models/test_gpt_oss_sm120.py index e06099987..cece74488 100644 --- a/test/registered/e2e/models/test_gpt_oss_sm120.py +++ b/test/registered/e2e/models/test_gpt_oss_sm120.py @@ -5,7 +5,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.gpt_oss_common import BaseTestGptOss -register_cuda_ci(est_time=336, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=348, stage="extra-a", runner_config="1-gpu-small") @unittest.skipIf(not torch.cuda.is_available(), "CUDA is not available") diff --git a/test/registered/e2e/models/test_inkling.py b/test/registered/e2e/models/test_inkling.py index 9bc93e4d0..c08bde2e2 100644 --- a/test/registered/e2e/models/test_inkling.py +++ b/test/registered/e2e/models/test_inkling.py @@ -32,7 +32,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=274, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=192, stage="base-b", runner_config="1-gpu-large") # Defaults to the HF `test` revision; override MODEL/REVISION to point at a # local checkpoint. Empty REVISION drops the flag (for local paths). diff --git a/test/registered/e2e/models/test_inkling_small_nvfp4.py b/test/registered/e2e/models/test_inkling_small_nvfp4.py index 41f7b8d4f..8a45f1a5e 100644 --- a/test/registered/e2e/models/test_inkling_small_nvfp4.py +++ b/test/registered/e2e/models/test_inkling_small_nvfp4.py @@ -48,7 +48,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=1079, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=930, stage="extra-b", runner_config="4-gpu-b200") _MODEL_PATH = os.environ.get( "INKLING_SMALL_TEST_MODEL_PATH", "thinkingmachines/Inkling-Small-NVFP4" diff --git a/test/registered/e2e/models/test_inkling_unified.py b/test/registered/e2e/models/test_inkling_unified.py index defecd9b2..09f0bcc38 100644 --- a/test/registered/e2e/models/test_inkling_unified.py +++ b/test/registered/e2e/models/test_inkling_unified.py @@ -45,7 +45,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=115, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=163, stage="base-b", runner_config="1-gpu-large") _MODEL_PATH = os.environ.get("INKLING_TEST_MODEL_PATH", "thinkingmachines/Inkling") _MODEL_REVISION = os.environ.get("INKLING_TEST_MODEL_REVISION", "test") diff --git a/test/registered/e2e/models/test_kimi_k3_b300.py b/test/registered/e2e/models/test_kimi_k3_b300.py index 78f186e8a..644e996d6 100644 --- a/test/registered/e2e/models/test_kimi_k3_b300.py +++ b/test/registered/e2e/models/test_kimi_k3_b300.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=578, stage="base-c", runner_config="8-gpu-b300") +register_cuda_ci(est_time=603, stage="base-c", runner_config="8-gpu-b300") MODEL_PATH = "moonshotai/Kimi-K3" DSPARK_DRAFT_MODEL = "RadixArk/Kimi-K3-DSpark" diff --git a/test/registered/e2e/models/test_kimi_k3_b300_low_latency.py b/test/registered/e2e/models/test_kimi_k3_b300_low_latency.py index e7e9e69cb..e56e077f0 100644 --- a/test/registered/e2e/models/test_kimi_k3_b300_low_latency.py +++ b/test/registered/e2e/models/test_kimi_k3_b300_low_latency.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=1472, stage="extra-b", runner_config="8-gpu-b300") +register_cuda_ci(est_time=1632, stage="extra-b", runner_config="8-gpu-b300") MODEL_PATH = "moonshotai/Kimi-K3" DSPARK_DRAFT_MODEL = "RadixArk/Kimi-K3-DSpark" diff --git a/test/registered/e2e/models/test_kimi_linear_models.py b/test/registered/e2e/models/test_kimi_linear_models.py index 683525040..281894240 100644 --- a/test/registered/e2e/models/test_kimi_linear_models.py +++ b/test/registered/e2e/models/test_kimi_linear_models.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=318, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=299, stage="base-b", runner_config="2-gpu-large") KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct" diff --git a/test/registered/e2e/models/test_kimi_linear_unified_memory_dcp_blackwell.py b/test/registered/e2e/models/test_kimi_linear_unified_memory_dcp_blackwell.py index e9f954cf8..7e1ae0a9f 100644 --- a/test/registered/e2e/models/test_kimi_linear_unified_memory_dcp_blackwell.py +++ b/test/registered/e2e/models/test_kimi_linear_unified_memory_dcp_blackwell.py @@ -47,7 +47,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=161, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=119, stage="extra-b", runner_config="4-gpu-b200") KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct" diff --git a/test/registered/e2e/models/test_layernorm_sp.py b/test/registered/e2e/models/test_layernorm_sp.py index 29429ed50..2a2a90580 100644 --- a/test/registered/e2e/models/test_layernorm_sp.py +++ b/test/registered/e2e/models/test_layernorm_sp.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=74, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=64, stage="base-b", runner_config="2-gpu-large") # Qwen3 dense (architecture "Qwen3ForCausalLM") is the SP allowlist entry. LAYERNORM_SP_MODEL = "Qwen/Qwen3-8B" diff --git a/test/registered/e2e/models/test_mimo_v2.py b/test/registered/e2e/models/test_mimo_v2.py index e239d0525..1b59434de 100644 --- a/test/registered/e2e/models/test_mimo_v2.py +++ b/test/registered/e2e/models/test_mimo_v2.py @@ -5,7 +5,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.server_fixtures.mmmu_fixture import MMMUServerBase -register_cuda_ci(est_time=317, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=347, stage="extra-b", runner_config="8-gpu-h200") MIMO_V2_MODEL = "XiaomiMiMo/MiMo-V2.5" MIMO_V2_OTHER_ARGS = [ diff --git a/test/registered/e2e/models/test_mimo_v2_flash.py b/test/registered/e2e/models/test_mimo_v2_flash.py index 8b6857719..7b49bcc07 100644 --- a/test/registered/e2e/models/test_mimo_v2_flash.py +++ b/test/registered/e2e/models/test_mimo_v2_flash.py @@ -7,7 +7,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.kits.spec_decoding_kit import SpecDecodingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=262, stage="base-c", runner_config="8-gpu-h200") +register_cuda_ci(est_time=310, stage="base-c", runner_config="8-gpu-h200") class TestMiMoV2Flash(GSM8KMixin, SpecDecodingMixin, DefaultServerBase): diff --git a/test/registered/e2e/models/test_minimax_m25_basic.py b/test/registered/e2e/models/test_minimax_m25_basic.py index 11707b527..516654cf7 100644 --- a/test/registered/e2e/models/test_minimax_m25_basic.py +++ b/test/registered/e2e/models/test_minimax_m25_basic.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=167, stage="base-c", runner_config="8-gpu-h200") +register_cuda_ci(est_time=189, stage="base-c", runner_config="8-gpu-h200") MINIMAX_M25_MODEL_PATH = "MiniMaxAI/MiniMax-M2.5" diff --git a/test/registered/e2e/models/test_ministral4_models.py b/test/registered/e2e/models/test_ministral4_models.py index c44dbd723..d8d17d6b2 100644 --- a/test/registered/e2e/models/test_ministral4_models.py +++ b/test/registered/e2e/models/test_ministral4_models.py @@ -6,7 +6,7 @@ from sglang.test.kits.mmmu_vlm_kit import MMMUMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.server_fixtures.mmmu_fixture import MMMUServerBase -register_cuda_ci(est_time=310, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=331, stage="extra-a", runner_config="2-gpu-large") MODEL = "mistralai/Mistral-Small-4-119B-2603" diff --git a/test/registered/e2e/models/test_nvidia_nemotron_3_nano.py b/test/registered/e2e/models/test_nvidia_nemotron_3_nano.py index a2b5cfd72..09468e5d4 100644 --- a/test/registered/e2e/models/test_nvidia_nemotron_3_nano.py +++ b/test/registered/e2e/models/test_nvidia_nemotron_3_nano.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=939, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=886, stage="extra-b", runner_config="4-gpu-b200") MODEL = "nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4" DFLASH_DRAFT_MODEL = "nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash" diff --git a/test/registered/e2e/models/test_nvidia_nemotron_3_super_bf16_mtp.py b/test/registered/e2e/models/test_nvidia_nemotron_3_super_bf16_mtp.py index 3eed2af0a..64e7d2b8e 100644 --- a/test/registered/e2e/models/test_nvidia_nemotron_3_super_bf16_mtp.py +++ b/test/registered/e2e/models/test_nvidia_nemotron_3_super_bf16_mtp.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=165, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=202, stage="extra-b", runner_config="8-gpu-h200") NEMOTRON_3_SUPER_BF16_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16" diff --git a/test/registered/e2e/models/test_qwen35_fp4_mtp.py b/test/registered/e2e/models/test_qwen35_fp4_mtp.py index bb3191b31..5523a7a45 100644 --- a/test/registered/e2e/models/test_qwen35_fp4_mtp.py +++ b/test/registered/e2e/models/test_qwen35_fp4_mtp.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=720, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=712, stage="base-c", runner_config="4-gpu-b200") QWEN35_FP4_MODEL = "nvidia/Qwen3.5-397B-A17B-NVFP4" ACC_THRESHOLDS = {QWEN35_FP4_MODEL: {"gsm8k": 0.95}} diff --git a/test/registered/e2e/models/test_qwen3_next_models.py b/test/registered/e2e/models/test_qwen3_next_models.py index 57e2c804a..f4bedd6b9 100644 --- a/test/registered/e2e/models/test_qwen3_next_models.py +++ b/test/registered/e2e/models/test_qwen3_next_models.py @@ -6,7 +6,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=343, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=356, stage="base-c", runner_config="4-gpu-h100") QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct" diff --git a/test/registered/e2e/models/test_qwen3_next_models_extra.py b/test/registered/e2e/models/test_qwen3_next_models_extra.py index d32e358fe..5562f58fd 100644 --- a/test/registered/e2e/models/test_qwen3_next_models_extra.py +++ b/test/registered/e2e/models/test_qwen3_next_models_extra.py @@ -5,7 +5,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=348, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=328, stage="extra-b", runner_config="4-gpu-h100") QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct" diff --git a/test/registered/e2e/models/test_qwen3_next_models_mtp.py b/test/registered/e2e/models/test_qwen3_next_models_mtp.py index 0ecf55e01..81f6cbbb2 100644 --- a/test/registered/e2e/models/test_qwen3_next_models_mtp.py +++ b/test/registered/e2e/models/test_qwen3_next_models_mtp.py @@ -7,7 +7,7 @@ from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=400, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=414, stage="base-c", runner_config="4-gpu-h100") QWEN3_NEXT_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct" diff --git a/test/registered/e2e/models/test_qwen4_exp_models.py b/test/registered/e2e/models/test_qwen4_exp_models.py index abe59c800..cfe887e21 100644 --- a/test/registered/e2e/models/test_qwen4_exp_models.py +++ b/test/registered/e2e/models/test_qwen4_exp_models.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=1500, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=682, stage="base-c", runner_config="4-gpu-b200") MODEL = "nvidia/Qwen3.8-Flash-Next-NVFP4" diff --git a/test/registered/e2e/models/test_step3p5_flash_chain_mtp.py b/test/registered/e2e/models/test_step3p5_flash_chain_mtp.py index 1c4353ce9..0cdb8a639 100644 --- a/test/registered/e2e/models/test_step3p5_flash_chain_mtp.py +++ b/test/registered/e2e/models/test_step3p5_flash_chain_mtp.py @@ -8,7 +8,7 @@ from sglang.test.kits.eval_accuracy_kit import GSM8KMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.test_utils import DEFAULT_TIMEOUT_FOR_SERVER_LAUNCH -register_cuda_ci(est_time=400, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=404, stage="extra-b", runner_config="8-gpu-h200") STEP3P5_FLASH_MODEL_PATH = "stepfun-ai/Step-3.5-Flash" diff --git a/test/registered/e2e/models/test_transformers_backend_eval.py b/test/registered/e2e/models/test_transformers_backend_eval.py index a2b1aa2ba..9a11376a8 100644 --- a/test/registered/e2e/models/test_transformers_backend_eval.py +++ b/test/registered/e2e/models/test_transformers_backend_eval.py @@ -11,7 +11,7 @@ from sglang.test.ci.ci_register import ( from sglang.test.few_shot_gsm8k import run_eval from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=66, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=63, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=48, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=206, suite="stage-b-test-cpu-intel") diff --git a/test/registered/e2e/models/test_transformers_models.py b/test/registered/e2e/models/test_transformers_models.py index f8223f054..aa8a6aa4e 100644 --- a/test/registered/e2e/models/test_transformers_models.py +++ b/test/registered/e2e/models/test_transformers_models.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=217, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=241, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=320, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/e2e/models/test_vlm_models.py b/test/registered/e2e/models/test_vlm_models.py index 5c2f6e0ef..79d9231de 100644 --- a/test/registered/e2e/models/test_vlm_models.py +++ b/test/registered/e2e/models/test_vlm_models.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import is_in_amd_ci, is_in_ci # VLM (Vision Language Model) tests -register_cuda_ci(est_time=158, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=153, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=850, suite="stage-b-test-1-gpu-small-amd-nondeterministic") _is_hip = is_hip() diff --git a/test/registered/e2e/models_large/test_deepseek_v32_indexcache.py b/test/registered/e2e/models_large/test_deepseek_v32_indexcache.py index a3895b360..f615f7362 100644 --- a/test/registered/e2e/models_large/test_deepseek_v32_indexcache.py +++ b/test/registered/e2e/models_large/test_deepseek_v32_indexcache.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=575, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=558, stage="extra-b", runner_config="8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" diff --git a/test/registered/e2e/models_large/test_deepseek_v3_cutedsl_4gpu.py b/test/registered/e2e/models_large/test_deepseek_v3_cutedsl_4gpu.py index 26905799a..466752506 100644 --- a/test/registered/e2e/models_large/test_deepseek_v3_cutedsl_4gpu.py +++ b/test/registered/e2e/models_large/test_deepseek_v3_cutedsl_4gpu.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=384, stage="base-c", runner_config="4-gpu-gb300") +register_cuda_ci(est_time=282, stage="base-c", runner_config="4-gpu-gb300") # Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner. NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 100 diff --git a/test/registered/e2e/pp/test_pp_spec.py b/test/registered/e2e/pp/test_pp_spec.py index 264a6504b..fcb3474a2 100644 --- a/test/registered/e2e/pp/test_pp_spec.py +++ b/test/registered/e2e/pp/test_pp_spec.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=900, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=270, stage="extra-b", runner_config="4-gpu-h100") # topk=1 chains and a topk=2 tree: the relayed topology is constant for the # former and data-dependent for the latter, so both shapes are covered. diff --git a/test/registered/e2e/pp/test_pp_spec_embed_scan.py b/test/registered/e2e/pp/test_pp_spec_embed_scan.py index f42b5f85f..114fc8dd0 100644 --- a/test/registered/e2e/pp/test_pp_spec_embed_scan.py +++ b/test/registered/e2e/pp/test_pp_spec_embed_scan.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( publish_build_topology, ) -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") # Shrunk from inclusionAI/Ling-mini-2.0; the field names are the real # checkpoint's, only the sizes are cut down for test speed. diff --git a/test/registered/e2e/speculative/test_dflash_domino.py b/test/registered/e2e/speculative/test_dflash_domino.py index 2c2a75f33..990d2620c 100644 --- a/test/registered/e2e/speculative/test_dflash_domino.py +++ b/test/registered/e2e/speculative/test_dflash_domino.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=600, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=122, stage="base-b", runner_config="2-gpu-large") class TestDFlashDominoFullVocab(CustomTestCase): diff --git a/test/registered/ep/test_deepep_large.py b/test/registered/ep/test_deepep_large.py index 24c68344a..59d59f87f 100644 --- a/test/registered/ep/test_deepep_large.py +++ b/test/registered/ep/test_deepep_large.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=569, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=646, stage="extra-b", runner_config="8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" diff --git a/test/registered/ep/test_deepep_small.py b/test/registered/ep/test_deepep_small.py index cb526f829..a6f9f6c24 100644 --- a/test/registered/ep/test_deepep_small.py +++ b/test/registered/ep/test_deepep_small.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=407, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=432, stage="base-c", runner_config="4-gpu-h100") class TestPureDP(CustomTestCase): diff --git a/test/registered/ep/test_deepep_small_extra.py b/test/registered/ep/test_deepep_small_extra.py index 3b0a2c6b4..bbf833b6d 100644 --- a/test/registered/ep/test_deepep_small_extra.py +++ b/test/registered/ep/test_deepep_small_extra.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=283, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=301, stage="extra-b", runner_config="4-gpu-h100") class TestHybridDPTP(CustomTestCase): diff --git a/test/registered/ep/test_flashinfer_a2a.py b/test/registered/ep/test_flashinfer_a2a.py index a8bd95cd7..8abebfdc7 100644 --- a/test/registered/ep/test_flashinfer_a2a.py +++ b/test/registered/ep/test_flashinfer_a2a.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=561, stage="base-c", runner_config="4-gpu-gb300") +register_cuda_ci(est_time=699, stage="base-c", runner_config="4-gpu-gb300") # Keep rendezvous ports below the ephemeral range on the 4-GPU GB300 runner. NCCL_PORT_BASE = DEFAULT_PORT_FOR_SRT_TEST_RUNNER + 110 diff --git a/test/registered/ep/test_routed_experts_dp_readback.py b/test/registered/ep/test_routed_experts_dp_readback.py index c8a990532..ff34edcf3 100644 --- a/test/registered/ep/test_routed_experts_dp_readback.py +++ b/test/registered/ep/test_routed_experts_dp_readback.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=72, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=85, stage="base-c", runner_config="4-gpu-h100") _MODEL = os.environ.get("SGLANG_ROUTED_EXPERTS_TEST_MODEL", "deepseek-ai/DeepSeek-V3") _NUM_EXPERTS = 24 diff --git a/test/registered/ep/test_tbo_shared_experts_fusion.py b/test/registered/ep/test_tbo_shared_experts_fusion.py index b31ed171c..4d18b4fdb 100644 --- a/test/registered/ep/test_tbo_shared_experts_fusion.py +++ b/test/registered/ep/test_tbo_shared_experts_fusion.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=253, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=341, stage="extra-b", runner_config="8-gpu-h200") DEEPSEEK_V3_MODEL_PATH = "deepseek-ai/DeepSeek-V3-0324" diff --git a/test/registered/eplb/test_lplb_distributed.py b/test/registered/eplb/test_lplb_distributed.py index 5d9220d61..e2f7a8992 100644 --- a/test/registered/eplb/test_lplb_distributed.py +++ b/test/registered/eplb/test_lplb_distributed.py @@ -40,7 +40,7 @@ from sglang.srt.distributed.parallel_state import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import publish_build_topology -register_cuda_ci(est_time=18, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=25, stage="base-b", runner_config="2-gpu-large") NUM_GPUS = 2 TOPK = 2 diff --git a/test/registered/expert_pack/test_expert_pack_mxfp4.py b/test/registered/expert_pack/test_expert_pack_mxfp4.py index ea6311ee4..7cf25c1b1 100644 --- a/test/registered/expert_pack/test_expert_pack_mxfp4.py +++ b/test/registered/expert_pack/test_expert_pack_mxfp4.py @@ -11,7 +11,7 @@ from sglang.kernels.ops.moe.expert_pack_mxfp4 import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-small") _FP4_VALUES = ( diff --git a/test/registered/expert_pack/test_expert_pack_runtime.py b/test/registered/expert_pack/test_expert_pack_runtime.py index e611f70c5..a0be02585 100644 --- a/test/registered/expert_pack/test_expert_pack_runtime.py +++ b/test/registered/expert_pack/test_expert_pack_runtime.py @@ -13,7 +13,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") from sglang.srt.layers.moe.expert_pack import ( # noqa: E402 ExpertPackStore, diff --git a/test/registered/expert_pack/test_kimi_k3_gguf.py b/test/registered/expert_pack/test_kimi_k3_gguf.py index def8f2e09..90013c5d6 100644 --- a/test/registered/expert_pack/test_kimi_k3_gguf.py +++ b/test/registered/expert_pack/test_kimi_k3_gguf.py @@ -20,7 +20,7 @@ from sglang.srt.model_loader.kimi_k3_gguf import ( from sglang.srt.models.kimi_k3 import _uses_split_gguf_kv_b from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestKimiK3GGUFMapping(unittest.TestCase): diff --git a/test/registered/function_call/test_kimik3_detector.py b/test/registered/function_call/test_kimik3_detector.py index 478dcc3ca..704237b2d 100644 --- a/test/registered/function_call/test_kimik3_detector.py +++ b/test/registered/function_call/test_kimik3_detector.py @@ -16,7 +16,7 @@ from sglang.srt.function_call.kimik3_format import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") def _make_tool(name: str) -> Tool: diff --git a/test/registered/gemm/test_hopper_bf16_gemv.py b/test/registered/gemm/test_hopper_bf16_gemv.py index 914c59028..5b673411a 100644 --- a/test/registered/gemm/test_hopper_bf16_gemv.py +++ b/test/registered/gemm/test_hopper_bf16_gemv.py @@ -9,7 +9,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=47, stage="base-b", runner_config="1-gpu-large") def _is_sm90() -> bool: diff --git a/test/registered/gemm/test_linear_bf16_fp32_hpc.py b/test/registered/gemm/test_linear_bf16_fp32_hpc.py index df49c93f2..d3cba79be 100644 --- a/test/registered/gemm/test_linear_bf16_fp32_hpc.py +++ b/test/registered/gemm/test_linear_bf16_fp32_hpc.py @@ -20,7 +20,7 @@ from sglang.kernels.ops.attention.dsv4.gemm import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") # (hidden_size, n_routed_experts + zero experts) for LongCat-Flash Chat / Lite. _ROUTER_SHAPES = ((6144, 768), (3072, 384)) diff --git a/test/registered/hicache/test_hicache_spec_file_storage.py b/test/registered/hicache/test_hicache_spec_file_storage.py index 1023531a7..c7ad437ed 100644 --- a/test/registered/hicache/test_hicache_spec_file_storage.py +++ b/test/registered/hicache/test_hicache_spec_file_storage.py @@ -17,7 +17,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.hicache_spec_storage_common import HiCacheSpecStorageMixin from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=142, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=158, stage="extra-a", runner_config="1-gpu-large") @unittest.skipIf(is_hip(), "HiCache + EAGLE3 file-storage loadback e2e is CUDA-only.") diff --git a/test/registered/hicache/test_hicache_spec_mooncake_storage.py b/test/registered/hicache/test_hicache_spec_mooncake_storage.py index 804ded688..527f0518a 100644 --- a/test/registered/hicache/test_hicache_spec_mooncake_storage.py +++ b/test/registered/hicache/test_hicache_spec_mooncake_storage.py @@ -29,7 +29,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.hicache_spec_storage_common import HiCacheSpecStorageMixin from sglang.test.test_utils import CustomTestCase, find_available_port -register_cuda_ci(est_time=186, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=194, stage="extra-a", runner_config="2-gpu-large") @unittest.skipIf( diff --git a/test/registered/hicache/test_hicache_storage.py b/test/registered/hicache/test_hicache_storage.py index 31af74f38..aecdbdf92 100644 --- a/test/registered/hicache/test_hicache_storage.py +++ b/test/registered/hicache/test_hicache_storage.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=242, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=224, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=300, suite="stage-b-test-1-gpu-small-amd") import time diff --git a/test/registered/hicache/test_hicache_storage_3fs_backend.py b/test/registered/hicache/test_hicache_storage_3fs_backend.py index 89afd7497..153145561 100644 --- a/test/registered/hicache/test_hicache_storage_3fs_backend.py +++ b/test/registered/hicache/test_hicache_storage_3fs_backend.py @@ -13,7 +13,7 @@ from test_hicache_storage_file_backend import HiCacheStorageBaseMixin from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=210, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=200, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=300, suite="base-b-test-2-gpu-large") diff --git a/test/registered/hicache/test_hicache_storage_file_backend.py b/test/registered/hicache/test_hicache_storage_file_backend.py index 5372381c2..5876a7930 100644 --- a/test/registered/hicache/test_hicache_storage_file_backend.py +++ b/test/registered/hicache/test_hicache_storage_file_backend.py @@ -29,7 +29,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import wait_for_http_ready -register_cuda_ci(est_time=191, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=98, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=526, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/hicache/test_hicache_storage_mooncake_backend.py b/test/registered/hicache/test_hicache_storage_mooncake_backend.py index e2e036fd3..4edeff4db 100644 --- a/test/registered/hicache/test_hicache_storage_mooncake_backend.py +++ b/test/registered/hicache/test_hicache_storage_mooncake_backend.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( get_gpu_count, ) -register_cuda_ci(est_time=391, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=396, stage="base-b", runner_config="2-gpu-large") class HiCacheStorageMooncakeBackendBaseMixin(HiCacheStorageBaseMixin): diff --git a/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py b/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py index e4e0f7894..043ee7cb2 100644 --- a/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py +++ b/test/registered/hicache/test_hicache_storage_runtime_attach_detach.py @@ -28,7 +28,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import wait_for_http_ready -register_cuda_ci(est_time=308, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=300, stage="base-b", runner_config="2-gpu-large") class TestHiCacheStorageRuntimeAttachDetach(CustomTestCase): diff --git a/test/registered/hicache/test_hicache_variants.py b/test/registered/hicache/test_hicache_variants.py index 8828e80d4..77f1799e3 100644 --- a/test/registered/hicache/test_hicache_variants.py +++ b/test/registered/hicache/test_hicache_variants.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=534, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=562, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=524, suite="stage-b-test-1-gpu-small-amd") """ Consolidated HiCache variant tests. diff --git a/test/registered/hicache/test_qwen35_hicache.py b/test/registered/hicache/test_qwen35_hicache.py index e42de0a6f..e302cb733 100644 --- a/test/registered/hicache/test_qwen35_hicache.py +++ b/test/registered/hicache/test_qwen35_hicache.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=369, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=404, stage="extra-b", runner_config="4-gpu-h100") QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" ACC_THRESHOLDS = {QWEN35_27B_MODEL: {"gsm8k": 0.8}} diff --git a/test/registered/kernels/benchmark/gemm/bench_kda_fp8_skinny_gemm.py b/test/registered/kernels/benchmark/gemm/bench_kda_fp8_skinny_gemm.py index cd8af5a86..8564d2219 100644 --- a/test/registered/kernels/benchmark/gemm/bench_kda_fp8_skinny_gemm.py +++ b/test/registered/kernels/benchmark/gemm/bench_kda_fp8_skinny_gemm.py @@ -18,7 +18,7 @@ from sglang.srt.layers.quantization.fp8_utils import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") def _make_inputs(m: int, n: int, k: int): diff --git a/test/registered/kernels/ops/attention/test_dsa_indexer.py b/test/registered/kernels/ops/attention/test_dsa_indexer.py index f02846869..459dbefea 100644 --- a/test/registered/kernels/ops/attention/test_dsa_indexer.py +++ b/test/registered/kernels/ops/attention/test_dsa_indexer.py @@ -34,7 +34,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardBatch, ForwardMo from sglang.srt.server_args import ServerArgs, set_global_server_args_for_scheduler from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large") # Global configuration for all indexer tests DEFAULT_CONFIG = { diff --git a/test/registered/kernels/ops/attention/test_dsv32_indexer_fusion.py b/test/registered/kernels/ops/attention/test_dsv32_indexer_fusion.py index 268a1c4df..712686b84 100644 --- a/test/registered/kernels/ops/attention/test_dsv32_indexer_fusion.py +++ b/test/registered/kernels/ops/attention/test_dsv32_indexer_fusion.py @@ -31,7 +31,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci _is_hip = is_hip() -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=18, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=45, suite="jit-kernel-unit-test-amd") HEAD_DIM = 128 diff --git a/test/registered/kernels/ops/attention/test_dsv4_indexer_quant.py b/test/registered/kernels/ops/attention/test_dsv4_indexer_quant.py index fe2d562b9..5f73c91ca 100644 --- a/test/registered/kernels/ops/attention/test_dsv4_indexer_quant.py +++ b/test/registered/kernels/ops/attention/test_dsv4_indexer_quant.py @@ -29,7 +29,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci _is_hip = is_hip() -register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") # the mi35x suite rather than the default AMD one: the ROCm case below is gfx95-only, and # everything else in here skips on HIP, so the mi300 registration only ever produced skips register_amd_ci(est_time=45, suite="stage-b-test-1-gpu-small-amd-mi35x") diff --git a/test/registered/kernels/ops/attention/test_kda_prefill.py b/test/registered/kernels/ops/attention/test_kda_prefill.py index a15bac22a..393b7c476 100644 --- a/test/registered/kernels/ops/attention/test_kda_prefill.py +++ b/test/registered/kernels/ops/attention/test_kda_prefill.py @@ -17,7 +17,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase register_cuda_ci(est_time=180, stage="base-b-kernel-unit", runner_config="4-gpu-b200") -register_cuda_ci(est_time=80, stage="base-c", runner_config="4-gpu-gb300") +register_cuda_ci(est_time=99, stage="base-c", runner_config="4-gpu-gb300") def _inputs(seed, seq_len=128): diff --git a/test/registered/kernels/ops/attention/test_sm120_paged_mqa_logits.py b/test/registered/kernels/ops/attention/test_sm120_paged_mqa_logits.py index 8b609b561..7ded09653 100644 --- a/test/registered/kernels/ops/attention/test_sm120_paged_mqa_logits.py +++ b/test/registered/kernels/ops/attention/test_sm120_paged_mqa_logits.py @@ -29,7 +29,7 @@ from sglang.srt.layers.attention.dsv4.indexer import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") # DSv4 indexer cache layout (fixed by deepseek_v4_memory_pool.DeepSeekV4IndexerPool): diff --git a/test/registered/kernels/ops/communication/test_symm_mem_all_gather.py b/test/registered/kernels/ops/communication/test_symm_mem_all_gather.py index 75f0aaf9e..3a62e0ea6 100644 --- a/test/registered/kernels/ops/communication/test_symm_mem_all_gather.py +++ b/test/registered/kernels/ops/communication/test_symm_mem_all_gather.py @@ -35,7 +35,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kernels.utils import multigpu_pytest_main -register_cuda_ci(est_time=38, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=54, stage="extra-b", runner_config="8-gpu-h200") # Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps. register_cuda_ci(est_time=70, stage="nightly", runner_config="8-gpu-h200") diff --git a/test/registered/kernels/ops/diffusion/test_sites.py b/test/registered/kernels/ops/diffusion/test_sites.py index a62595529..109fff9ce 100644 --- a/test/registered/kernels/ops/diffusion/test_sites.py +++ b/test/registered/kernels/ops/diffusion/test_sites.py @@ -49,7 +49,7 @@ from sglang.kernels.ops.diffusion import ( from sglang.test.ci.ci_register import register_cpu_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_cuda_ci(est_time=38, stage="base-b-kernel-unit", runner_config="1-gpu-large") requires_cuda = pytest.mark.skipif( diff --git a/test/registered/kernels/ops/embeddings/test_vocab_parallel_embedding.py b/test/registered/kernels/ops/embeddings/test_vocab_parallel_embedding.py index 45f9841d7..2a33acbe2 100644 --- a/test/registered/kernels/ops/embeddings/test_vocab_parallel_embedding.py +++ b/test/registered/kernels/ops/embeddings/test_vocab_parallel_embedding.py @@ -14,7 +14,7 @@ from sglang.srt.layers.vocab_parallel_embedding import ( ) from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") pytestmark = pytest.mark.skipif( not torch.cuda.is_available(), reason="CUDA is required for this test." diff --git a/test/registered/kernels/ops/gemm/test_sm120_fp8_linear.py b/test/registered/kernels/ops/gemm/test_sm120_fp8_linear.py index 96cd27dbf..bf450e3e5 100644 --- a/test/registered/kernels/ops/gemm/test_sm120_fp8_linear.py +++ b/test/registered/kernels/ops/gemm/test_sm120_fp8_linear.py @@ -11,7 +11,7 @@ from sglang.kernels.ops.gemm import try_sm120_fp8_linear from sglang.srt.layers.quantization.fp8_utils import apply_fp8_linear_bmm_flashinfer from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=180, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-small") if not (torch.cuda.is_available() and torch.cuda.get_device_capability() == (12, 0)): pytest.skip( diff --git a/test/registered/kernels/ops/kimi_k3/test_collectives.py b/test/registered/kernels/ops/kimi_k3/test_collectives.py index 66d228e66..f24e5df34 100644 --- a/test/registered/kernels/ops/kimi_k3/test_collectives.py +++ b/test/registered/kernels/ops/kimi_k3/test_collectives.py @@ -24,7 +24,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kernels.utils import multigpu_pytest_main -register_cuda_ci(est_time=34, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=49, stage="base-c", runner_config="4-gpu-b200") register_cuda_ci(est_time=480, stage="nightly", runner_config="8-gpu-b200") _HIDDEN_SIZE = 7168 diff --git a/test/registered/kernels/ops/kv_canary/test_utils.py b/test/registered/kernels/ops/kv_canary/test_utils.py index ea41ffea9..204b3557a 100644 --- a/test/registered/kernels/ops/kv_canary/test_utils.py +++ b/test/registered/kernels/ops/kv_canary/test_utils.py @@ -8,7 +8,7 @@ from sglang.kernels.jit.benchmark.kv_canary.utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, stage="base-a", runner_config="cpu") +register_cpu_ci(est_time=6, stage="base-a", runner_config="cpu") def test_fast_matrix_cases_include_e2e_decode_and_chunked_prefill_scenarios() -> None: diff --git a/test/registered/kernels/ops/kvcache/test_hicache.py b/test/registered/kernels/ops/kvcache/test_hicache.py index 2bc89d94f..d328700b6 100644 --- a/test/registered/kernels/ops/kvcache/test_hicache.py +++ b/test/registered/kernels/ops/kvcache/test_hicache.py @@ -14,7 +14,7 @@ from sglang.srt.mem_cache.pool_host.mla import MLATokenToKVPoolHost from sglang.srt.utils import is_cuda, is_hip, is_npu, is_xpu from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=62, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=12, stage="jit-kernel-unit", runner_config="amd") pytestmark = pytest.mark.skipif( diff --git a/test/registered/kernels/ops/kvcache/test_hicache_page_first_write_back.py b/test/registered/kernels/ops/kvcache/test_hicache_page_first_write_back.py index 73499e35c..5297c1f39 100644 --- a/test/registered/kernels/ops/kvcache/test_hicache_page_first_write_back.py +++ b/test/registered/kernels/ops/kvcache/test_hicache_page_first_write_back.py @@ -30,7 +30,7 @@ from sglang.srt.mem_cache.pool_host.mla import MLATokenToKVPoolHost from sglang.srt.utils import is_cuda, is_hip, is_npu, is_xpu from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=36, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=30, stage="jit-kernel-unit", runner_config="amd") pytestmark = pytest.mark.skipif( diff --git a/test/registered/kernels/ops/kvcache/test_kvcacheio_asymmetric.py b/test/registered/kernels/ops/kvcache/test_kvcacheio_asymmetric.py index fa137f026..e13d99784 100644 --- a/test/registered/kernels/ops/kvcache/test_kvcacheio_asymmetric.py +++ b/test/registered/kernels/ops/kvcache/test_kvcacheio_asymmetric.py @@ -7,7 +7,7 @@ import torch from sglang.srt.mem_cache.pool_host.mha import AsymmetricMHATokenToKVPoolHost from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=10, suite="nightly-amd-kernel-1-gpu", nightly=True) # These tests use AsymmetricMHATokenToKVPoolHost methods and let that class call diff --git a/test/registered/kernels/ops/layernorm/test_fused_op.py b/test/registered/kernels/ops/layernorm/test_fused_op.py index 1be24a480..a73de9fa1 100644 --- a/test/registered/kernels/ops/layernorm/test_fused_op.py +++ b/test/registered/kernels/ops/layernorm/test_fused_op.py @@ -16,7 +16,7 @@ from sglang.kernels.spec import CapabilityRequirement as Cap from sglang.kernels.spec import KernelBackend, KernelSpec from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") class _ToyAdd(BaseFusedOp): diff --git a/test/registered/kernels/ops/layernorm/test_fused_op_gpu_parity.py b/test/registered/kernels/ops/layernorm/test_fused_op_gpu_parity.py index 71d129f94..b8df018e4 100644 --- a/test/registered/kernels/ops/layernorm/test_fused_op_gpu_parity.py +++ b/test/registered/kernels/ops/layernorm/test_fused_op_gpu_parity.py @@ -11,7 +11,7 @@ import torch from sglang.kernels.spec import KernelBackend from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=12, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=31, stage="extra-a", runner_config="1-gpu-small") # torch_compile is native under the hood; skip it here (compile time dominates) # -- it is exercised in the CPU lane. diff --git a/test/registered/kernels/ops/layernorm/test_kernels_namespace.py b/test/registered/kernels/ops/layernorm/test_kernels_namespace.py index ae0523631..aa903ee66 100644 --- a/test/registered/kernels/ops/layernorm/test_kernels_namespace.py +++ b/test/registered/kernels/ops/layernorm/test_kernels_namespace.py @@ -13,7 +13,7 @@ from sglang.kernels import KernelBackend, PlatformInfo from sglang.kernels.spec import CapabilityRequirement as Cap from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=24, suite="base-a-test-cpu") +register_cpu_ci(est_time=21, suite="base-a-test-cpu") _CPU = PlatformInfo(device_type="cpu") _SM90 = PlatformInfo(device_type="cuda", cuda_arch_major=9, cuda_arch_minor=0) diff --git a/test/registered/kernels/ops/layernorm/test_mhc_kernels.py b/test/registered/kernels/ops/layernorm/test_mhc_kernels.py index b2010cd6c..ce34dab86 100644 --- a/test/registered/kernels/ops/layernorm/test_mhc_kernels.py +++ b/test/registered/kernels/ops/layernorm/test_mhc_kernels.py @@ -8,7 +8,7 @@ import sglang.kernels.ops.layernorm.mhc as mhc from sglang.kernels.ops.layernorm.mhc import mhc_fused_post_pre, mhc_post, mhc_pre from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") @pytest.fixture diff --git a/test/registered/kernels/ops/moe/test_moe_wna16_marlin.py b/test/registered/kernels/ops/moe/test_moe_wna16_marlin.py index 09700073d..3933eead2 100644 --- a/test/registered/kernels/ops/moe/test_moe_wna16_marlin.py +++ b/test/registered/kernels/ops/moe/test_moe_wna16_marlin.py @@ -20,7 +20,7 @@ from sglang.test.test_marlin_utils import ( marlin_quantize, ) -register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=530, stage="base-b", runner_config="1-gpu-large") def _has_aot_moe_wna16_marlin_gemm() -> bool: diff --git a/test/registered/kernels/ops/quantization/test_nvfp4_marlin.py b/test/registered/kernels/ops/quantization/test_nvfp4_marlin.py index 9465ddd06..2074ad9c0 100644 --- a/test/registered/kernels/ops/quantization/test_nvfp4_marlin.py +++ b/test/registered/kernels/ops/quantization/test_nvfp4_marlin.py @@ -19,8 +19,8 @@ from sglang.srt.utils.common import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_marlin_utils import make_nvfp4_weight_and_ref -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") -register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=370, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") @pytest.mark.skipif( diff --git a/test/registered/kernels/ops/speculative/test_boundary_kv_fix_kernels.py b/test/registered/kernels/ops/speculative/test_boundary_kv_fix_kernels.py index 6d48f4a11..a86c7732d 100644 --- a/test/registered/kernels/ops/speculative/test_boundary_kv_fix_kernels.py +++ b/test/registered/kernels/ops/speculative/test_boundary_kv_fix_kernels.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") """Boundary-KV fix kernels (SGLANG_ENABLE_MTP_BOUNDARY_KV_FIX) vs a pure-torch reference. diff --git a/test/registered/kv_canary/test_self_e2e_baseline.py b/test/registered/kv_canary/test_self_e2e_baseline.py index 500687723..a76a6a48b 100644 --- a/test/registered/kv_canary/test_self_e2e_baseline.py +++ b/test/registered/kv_canary/test_self_e2e_baseline.py @@ -7,7 +7,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.consts import SWA_POOL_SERVER_ARGS from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=135, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=130, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=236, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_e2e_bench_speed.py b/test/registered/kv_canary/test_self_e2e_bench_speed.py index e0e4d7e4d..a7983ce17 100644 --- a/test/registered/kv_canary/test_self_e2e_bench_speed.py +++ b/test/registered/kv_canary/test_self_e2e_bench_speed.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import DEFAULT_PORT_FOR_SRT_TEST_RUNNER # CUDA-only: this self-bench asserts a 1.0% kv_canary overhead budget tuned on # the CUDA (H100) runner. On ROCm the measured overhead is ~1.26%, so the # benchmark is not portable as-is; keep it off AMD CI rather than register-and-skip. -register_cuda_ci(est_time=304, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=360, stage="extra-a", runner_config="1-gpu-large") _QWEN3_MODEL = "Qwen/Qwen3-30B-A3B" diff --git a/test/registered/kv_canary/test_self_e2e_pd_baseline.py b/test/registered/kv_canary/test_self_e2e_pd_baseline.py index 902b91259..5cea15fdd 100644 --- a/test/registered/kv_canary/test_self_e2e_pd_baseline.py +++ b/test/registered/kv_canary/test_self_e2e_pd_baseline.py @@ -5,7 +5,7 @@ import unittest from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.pd_fixture import CanaryPDFixture -register_cuda_ci(est_time=204, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=207, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=106, stage="extra-a", runner_config="2-gpu-large-amd") diff --git a/test/registered/kv_canary/test_self_e2e_pd_perturb.py b/test/registered/kv_canary/test_self_e2e_pd_perturb.py index c2ea1ff0a..64e2b02f4 100644 --- a/test/registered/kv_canary/test_self_e2e_pd_perturb.py +++ b/test/registered/kv_canary/test_self_e2e_pd_perturb.py @@ -7,7 +7,7 @@ from sglang.srt.kv_canary.perturb.config import TargetGroupKind from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.pd_fixture import CanaryPDFixture -register_cuda_ci(est_time=305, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=339, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=231, stage="extra-a", runner_config="2-gpu-large-amd") diff --git a/test/registered/kv_canary/test_self_e2e_perturb_raise.py b/test/registered/kv_canary/test_self_e2e_perturb_raise.py index fc66f0d2f..0c1ee801c 100644 --- a/test/registered/kv_canary/test_self_e2e_perturb_raise.py +++ b/test/registered/kv_canary/test_self_e2e_perturb_raise.py @@ -7,7 +7,7 @@ from sglang.srt.kv_canary.perturb.config import TargetGroupKind from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=54, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=48, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=50, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_e2e_perturb_real_kv_unused_cache.py b/test/registered/kv_canary/test_self_e2e_perturb_real_kv_unused_cache.py index dd9cbebea..5ff227a2b 100644 --- a/test/registered/kv_canary/test_self_e2e_perturb_real_kv_unused_cache.py +++ b/test/registered/kv_canary/test_self_e2e_perturb_real_kv_unused_cache.py @@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.consts import SWA_POOL_SERVER_ARGS from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=446, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=491, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=503, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_e2e_perturb_real_kv_used.py b/test/registered/kv_canary/test_self_e2e_perturb_real_kv_used.py index d2c494e51..359e1badc 100644 --- a/test/registered/kv_canary/test_self_e2e_perturb_real_kv_used.py +++ b/test/registered/kv_canary/test_self_e2e_perturb_real_kv_used.py @@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.consts import SWA_POOL_SERVER_ARGS from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=290, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=317, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=256, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_e2e_perturb_req_to_token.py b/test/registered/kv_canary/test_self_e2e_perturb_req_to_token.py index ce390bfd5..493330804 100644 --- a/test/registered/kv_canary/test_self_e2e_perturb_req_to_token.py +++ b/test/registered/kv_canary/test_self_e2e_perturb_req_to_token.py @@ -7,7 +7,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.consts import SWA_POOL_SERVER_ARGS from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=194, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=202, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=175, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_e2e_pp_baseline.py b/test/registered/kv_canary/test_self_e2e_pp_baseline.py index 8b7fd1e97..817226ecf 100644 --- a/test/registered/kv_canary/test_self_e2e_pp_baseline.py +++ b/test/registered/kv_canary/test_self_e2e_pp_baseline.py @@ -6,7 +6,7 @@ from sglang.srt.kv_canary.config import CanaryMode from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.pp_fixture import CanaryPPFixture -register_cuda_ci(est_time=207, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=206, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=243, stage="extra-a", runner_config="2-gpu-large-amd") diff --git a/test/registered/kv_canary/test_self_e2e_pp_perturb.py b/test/registered/kv_canary/test_self_e2e_pp_perturb.py index 1a16bb4d0..6f1933df7 100644 --- a/test/registered/kv_canary/test_self_e2e_pp_perturb.py +++ b/test/registered/kv_canary/test_self_e2e_pp_perturb.py @@ -8,7 +8,7 @@ from sglang.srt.kv_canary.perturb.config import TargetGroupKind from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.pp_fixture import CanaryPPFixture -register_cuda_ci(est_time=318, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=334, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=298, stage="extra-a", runner_config="2-gpu-large-amd") diff --git a/test/registered/kv_canary/test_self_e2e_pr_25015.py b/test/registered/kv_canary/test_self_e2e_pr_25015.py index ea004b2f0..7383dce5b 100644 --- a/test/registered/kv_canary/test_self_e2e_pr_25015.py +++ b/test/registered/kv_canary/test_self_e2e_pr_25015.py @@ -9,7 +9,7 @@ from sglang.srt.kv_canary.config import CanaryMode from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=102, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=89, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=101, stage="extra-a", runner_config="1-gpu-small-amd") _SPEC_EAGLE_TOKEN_ORACLE_ENV = { diff --git a/test/registered/kv_canary/test_self_e2e_pr_26329.py b/test/registered/kv_canary/test_self_e2e_pr_26329.py index f1b4e4d7b..9fb4579ae 100644 --- a/test/registered/kv_canary/test_self_e2e_pr_26329.py +++ b/test/registered/kv_canary/test_self_e2e_pr_26329.py @@ -11,7 +11,7 @@ from sglang.srt.kv_canary.config import CanaryMode from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.e2e_base import CanaryE2EBase -register_cuda_ci(est_time=105, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=89, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=99, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_buffer_alloc.py b/test/registered/kv_canary/test_self_unit_buffer_alloc.py index 91d21c8b0..2e7c7b62b 100644 --- a/test/registered/kv_canary/test_self_unit_buffer_alloc.py +++ b/test/registered/kv_canary/test_self_unit_buffer_alloc.py @@ -15,7 +15,7 @@ from sglang.srt.kv_canary.pool_patcher.buffer_alloc import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=8, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=10, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_capacities.py b/test/registered/kv_canary/test_self_unit_capacities.py index 31325b437..6adec6f26 100644 --- a/test/registered/kv_canary/test_self_unit_capacities.py +++ b/test/registered/kv_canary/test_self_unit_capacities.py @@ -18,7 +18,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestComputeLaunchCapacities(CustomTestCase): diff --git a/test/registered/kv_canary/test_self_unit_capture_refusal.py b/test/registered/kv_canary/test_self_unit_capture_refusal.py index 84a1009c2..89454071f 100644 --- a/test/registered/kv_canary/test_self_unit_capture_refusal.py +++ b/test/registered/kv_canary/test_self_unit_capture_refusal.py @@ -16,7 +16,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestTorchReferenceConflictsWithDecodeGraph(CustomTestCase): diff --git a/test/registered/kv_canary/test_self_unit_endpoint.py b/test/registered/kv_canary/test_self_unit_endpoint.py index 95163abaa..dd4fd94a8 100644 --- a/test/registered/kv_canary/test_self_unit_endpoint.py +++ b/test/registered/kv_canary/test_self_unit_endpoint.py @@ -25,7 +25,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.fixtures import DEFAULT_DEVICE from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=20, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_future_tensor.py b/test/registered/kv_canary/test_self_unit_future_tensor.py index 6b6cb6e66..c5441cb0c 100644 --- a/test/registered/kv_canary/test_self_unit_future_tensor.py +++ b/test/registered/kv_canary/test_self_unit_future_tensor.py @@ -14,7 +14,7 @@ from sglang.test.ci.ci_register import ( from sglang.test.kv_canary.fixtures import DEFAULT_DEVICE from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=20, suite="extra-a-test-1-gpu-small-amd") register_xpu_ci(est_time=20, suite="stage-b-test-1-gpu-xpu") diff --git a/test/registered/kv_canary/test_self_unit_perturb.py b/test/registered/kv_canary/test_self_unit_perturb.py index 10a21dc54..7921d9da0 100644 --- a/test/registered/kv_canary/test_self_unit_perturb.py +++ b/test/registered/kv_canary/test_self_unit_perturb.py @@ -40,7 +40,7 @@ from sglang.test.test_utils import CustomTestCase if TYPE_CHECKING: from sglang.srt.mem_cache.base_prefix_cache import BasePrefixCache -register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=10, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_pool_patcher.py b/test/registered/kv_canary/test_self_unit_pool_patcher.py index 5dc608479..8bb9b2205 100644 --- a/test/registered/kv_canary/test_self_unit_pool_patcher.py +++ b/test/registered/kv_canary/test_self_unit_pool_patcher.py @@ -24,7 +24,7 @@ from sglang.test.kv_canary.fixtures import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=12, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=45, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_pool_patcher_utils.py b/test/registered/kv_canary/test_self_unit_pool_patcher_utils.py index ea4012f59..f6406c1bc 100644 --- a/test/registered/kv_canary/test_self_unit_pool_patcher_utils.py +++ b/test/registered/kv_canary/test_self_unit_pool_patcher_utils.py @@ -6,7 +6,7 @@ from sglang.srt.kv_canary.pool_patcher.utils import wrap_method from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=8, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=10, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_radix_walker.py b/test/registered/kv_canary/test_self_unit_radix_walker.py index 3d94ca4ae..6db672bc7 100644 --- a/test/registered/kv_canary/test_self_unit_radix_walker.py +++ b/test/registered/kv_canary/test_self_unit_radix_walker.py @@ -19,7 +19,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.fixtures import DEFAULT_DEVICE, make_radix_cache from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=30, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_req_to_expected_token_ids_manager.py b/test/registered/kv_canary/test_self_unit_req_to_expected_token_ids_manager.py index 575336628..83f598ab3 100644 --- a/test/registered/kv_canary/test_self_unit_req_to_expected_token_ids_manager.py +++ b/test/registered/kv_canary/test_self_unit_req_to_expected_token_ids_manager.py @@ -22,7 +22,7 @@ from sglang.test.kv_canary.fixtures import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=11, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=15, suite="extra-a-test-1-gpu-small-amd") register_xpu_ci(est_time=30, suite="stage-b-test-1-gpu-xpu") diff --git a/test/registered/kv_canary/test_self_unit_runner_health.py b/test/registered/kv_canary/test_self_unit_runner_health.py index 1ee396ea4..0c7c011ef 100644 --- a/test/registered/kv_canary/test_self_unit_runner_health.py +++ b/test/registered/kv_canary/test_self_unit_runner_health.py @@ -19,7 +19,7 @@ from sglang.test.kv_canary.runner_test_base import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=45, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_runner_swa_divergence.py b/test/registered/kv_canary/test_self_unit_runner_swa_divergence.py index 2c1a350db..ed21a00b9 100644 --- a/test/registered/kv_canary/test_self_unit_runner_swa_divergence.py +++ b/test/registered/kv_canary/test_self_unit_runner_swa_divergence.py @@ -25,7 +25,7 @@ from sglang.test.kv_canary.fixtures import DEFAULT_DEVICE, make_buffer_group from sglang.test.kv_canary.runner_test_base import CanaryManagerTestCase, make_manager from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=11, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=45, suite="extra-a-test-1-gpu-small-amd") register_xpu_ci(est_time=60, suite="stage-b-test-1-gpu-xpu") diff --git a/test/registered/kv_canary/test_self_unit_runner_sweep.py b/test/registered/kv_canary/test_self_unit_runner_sweep.py index ee59aee51..96be8c8f2 100644 --- a/test/registered/kv_canary/test_self_unit_runner_sweep.py +++ b/test/registered/kv_canary/test_self_unit_runner_sweep.py @@ -16,7 +16,7 @@ from sglang.test.kv_canary.runner_test_base import ( make_manager, ) -register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=45, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_sweep_plan_builder.py b/test/registered/kv_canary/test_self_unit_sweep_plan_builder.py index c4d973c83..5efacb1d1 100644 --- a/test/registered/kv_canary/test_self_unit_sweep_plan_builder.py +++ b/test/registered/kv_canary/test_self_unit_sweep_plan_builder.py @@ -13,7 +13,7 @@ from sglang.test.kv_canary.fixtures import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=11, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=30, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_token_oracle.py b/test/registered/kv_canary/test_self_unit_token_oracle.py index 563db9138..93f6e6a05 100644 --- a/test/registered/kv_canary/test_self_unit_token_oracle.py +++ b/test/registered/kv_canary/test_self_unit_token_oracle.py @@ -13,7 +13,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.kv_canary.fixtures import DEFAULT_DEVICE from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=1, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/kv_canary/test_self_unit_violation.py b/test/registered/kv_canary/test_self_unit_violation.py index 66ca4bd03..94ee2aa0a 100644 --- a/test/registered/kv_canary/test_self_unit_violation.py +++ b/test/registered/kv_canary/test_self_unit_violation.py @@ -18,7 +18,7 @@ from sglang.srt.kv_canary.runner.violation_reporter import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=8, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=5, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/layers/mamba/test_causal_conv1d.py b/test/registered/layers/mamba/test_causal_conv1d.py index 638da5dd0..622a796a6 100644 --- a/test/registered/layers/mamba/test_causal_conv1d.py +++ b/test/registered/layers/mamba/test_causal_conv1d.py @@ -2,7 +2,7 @@ # SPDX-FileCopyrightText: Copyright contributors to the vLLM project from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-small-amd") # Adapted from https://github.com/vllm-project/vllm/blob/main/tests/kernels/mamba/test_causal_conv1d.py diff --git a/test/registered/layers/mamba/test_mamba2_mixer.py b/test/registered/layers/mamba/test_mamba2_mixer.py index 463118595..45ba141c9 100644 --- a/test/registered/layers/mamba/test_mamba2_mixer.py +++ b/test/registered/layers/mamba/test_mamba2_mixer.py @@ -19,7 +19,7 @@ from sglang.srt.utils import get_device, get_device_count from sglang.test.ci.ci_register import register_cuda_ci, register_xpu_ci from sglang.test.test_utils import publish_build_topology -register_cuda_ci(est_time=30, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=32, stage="base-b", runner_config="2-gpu-large") register_xpu_ci(est_time=60, suite="nightly-xpu-2-gpu", nightly=True) NUM_GPUS = 2 diff --git a/test/registered/layers/mamba/test_mamba_slot_fused.py b/test/registered/layers/mamba/test_mamba_slot_fused.py index 484518be4..644b58c94 100644 --- a/test/registered/layers/mamba/test_mamba_slot_fused.py +++ b/test/registered/layers/mamba/test_mamba_slot_fused.py @@ -24,7 +24,7 @@ from sglang.srt.utils.common import get_device_module from sglang.test.ci.ci_register import register_cuda_ci, register_xpu_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") register_xpu_ci(est_time=20, suite="stage-b-test-1-gpu-xpu") # Backends these kernels are verified against; extend as others gain Triton. diff --git a/test/registered/layers/mamba/test_mamba_ssm.py b/test/registered/layers/mamba/test_mamba_ssm.py index 250c9ae53..cd189e4f7 100644 --- a/test/registered/layers/mamba/test_mamba_ssm.py +++ b/test/registered/layers/mamba/test_mamba_ssm.py @@ -2,7 +2,7 @@ # SPDX-FileCopyrightText: Copyright contributors to the vLLM project from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-small-amd") # Adapted from https://github.com/vllm-project/vllm/blob/633f943e30a4444d890d26b81850f7217736f840/tests/kernels/mamba/test_mamba_ssm_ssd.py diff --git a/test/registered/layers/mamba/test_mamba_ssm_ssd.py b/test/registered/layers/mamba/test_mamba_ssm_ssd.py index 6933ea72e..c68de1402 100644 --- a/test/registered/layers/mamba/test_mamba_ssm_ssd.py +++ b/test/registered/layers/mamba/test_mamba_ssm_ssd.py @@ -2,7 +2,7 @@ # SPDX-FileCopyrightText: Copyright contributors to the vLLM project from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=34, suite="stage-b-test-1-gpu-small-amd") # Adapted from https://github.com/vllm-project/vllm/blob/633f943e30a4444d890d26b81850f7217736f840/tests/kernels/mamba/test_mamba_ssm_ssd.py diff --git a/test/registered/layers/test_layernorm_fusion.py b/test/registered/layers/test_layernorm_fusion.py index 5e6bb7391..3f973c947 100644 --- a/test/registered/layers/test_layernorm_fusion.py +++ b/test/registered/layers/test_layernorm_fusion.py @@ -7,7 +7,7 @@ from sglang.srt.layers.layernorm import RMSNorm from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=2, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/lora/test_fused_moe_lora_kernel.py b/test/registered/lora/test_fused_moe_lora_kernel.py index 8b63796ce..69c5ed5c3 100644 --- a/test/registered/lora/test_fused_moe_lora_kernel.py +++ b/test/registered/lora/test_fused_moe_lora_kernel.py @@ -17,7 +17,7 @@ from sglang.test.ci.ci_register import register_cuda_ci # ============================================================================== -register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=18, stage="base-b", runner_config="1-gpu-large") def round_up(x, base): diff --git a/test/registered/lora/test_lora_drainer.py b/test/registered/lora/test_lora_drainer.py index ae25ffc2b..40e0c5ece 100644 --- a/test/registered/lora/test_lora_drainer.py +++ b/test/registered/lora/test_lora_drainer.py @@ -11,7 +11,7 @@ from sglang.test.lora_utils import ( run_lora_batch_splitting_equivalence_test, ) -register_cuda_ci(est_time=52, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=51, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=100, suite="stage-b-test-1-gpu-small-amd") MOCK_START_TIME = 1000.0 diff --git a/test/registered/lora/test_lora_gpt_oss_20b_logprob_diff.py b/test/registered/lora/test_lora_gpt_oss_20b_logprob_diff.py index aae7814d4..082199c2e 100644 --- a/test/registered/lora/test_lora_gpt_oss_20b_logprob_diff.py +++ b/test/registered/lora/test_lora_gpt_oss_20b_logprob_diff.py @@ -35,7 +35,7 @@ from sglang.srt.utils import is_hip from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=96, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=103, stage="extra-b", runner_config="4-gpu-b200") register_amd_ci(est_time=180, suite="stage-c-test-4-gpu-amd") BASE_MODEL = "lmsys/gpt-oss-20b-bf16" diff --git a/test/registered/lora/test_lora_moe_tp_logprob_diff.py b/test/registered/lora/test_lora_moe_tp_logprob_diff.py index 2eb4a19d8..148cf46be 100644 --- a/test/registered/lora/test_lora_moe_tp_logprob_diff.py +++ b/test/registered/lora/test_lora_moe_tp_logprob_diff.py @@ -33,7 +33,7 @@ from sglang.test.test_utils import ( is_in_ci, ) -register_cuda_ci(est_time=130, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=168, stage="extra-a", runner_config="2-gpu-large") LOGPROB_THRESHOLD = 5e-04 # Chunked vs non-chunked runs differ only in lm_head matmul shape (16-row diff --git a/test/registered/lora/test_lora_nemotron_3_super_120b_a12b_logprob_diff.py b/test/registered/lora/test_lora_nemotron_3_super_120b_a12b_logprob_diff.py index c5518af0b..99522fe37 100644 --- a/test/registered/lora/test_lora_nemotron_3_super_120b_a12b_logprob_diff.py +++ b/test/registered/lora/test_lora_nemotron_3_super_120b_a12b_logprob_diff.py @@ -34,7 +34,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=154, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=250, stage="extra-b", runner_config="4-gpu-b200") BASE_MODEL = "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16" LORA_HF_REPO = "opherlie/lora-test-case-NVIDIA-Nemotron-3-Super-120B-A12B-BF16" diff --git a/test/registered/lora/test_lora_overlap_loading.py b/test/registered/lora/test_lora_overlap_loading.py index e88e5c6b7..68502e78f 100644 --- a/test/registered/lora/test_lora_overlap_loading.py +++ b/test/registered/lora/test_lora_overlap_loading.py @@ -31,7 +31,7 @@ from sglang.test.lora_utils import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=237, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=52, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=75, suite="stage-b-test-1-gpu-small-amd") DEVICE = get_device(0) diff --git a/test/registered/lora/test_lora_qwen3_8b_logprob_diff.py b/test/registered/lora/test_lora_qwen3_8b_logprob_diff.py index c08ef5ffc..2ff935747 100644 --- a/test/registered/lora/test_lora_qwen3_8b_logprob_diff.py +++ b/test/registered/lora/test_lora_qwen3_8b_logprob_diff.py @@ -37,7 +37,7 @@ from sglang.srt.lora.utils import auto_detect_lora_target_modules from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=56, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=50, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=120, suite="stage-b-test-1-gpu-small-amd") BASE_MODEL = "Qwen/Qwen3-8B" diff --git a/test/registered/lora/test_lora_spec_decoding.py b/test/registered/lora/test_lora_spec_decoding.py index ab81cf988..5adf269e0 100644 --- a/test/registered/lora/test_lora_spec_decoding.py +++ b/test/registered/lora/test_lora_spec_decoding.py @@ -35,7 +35,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=95, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=90, stage="base-b", runner_config="1-gpu-large") PROMPTS = [ "What is the capital of France? Answer in one sentence.", diff --git a/test/registered/lora/test_moe_lora_info.py b/test/registered/lora/test_moe_lora_info.py index 484253791..efd0112cc 100644 --- a/test/registered/lora/test_moe_lora_info.py +++ b/test/registered/lora/test_moe_lora_info.py @@ -19,7 +19,7 @@ from sglang.test.ci.ci_register import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=5, stage="stage-b", runner_config="1-gpu-small-amd") register_xpu_ci(est_time=20, suite="stage-a-test-1-gpu-xpu") diff --git a/test/registered/lora/test_multi_lora_backend.py b/test/registered/lora/test_multi_lora_backend.py index 5ce5a5262..eb3fb6e01 100644 --- a/test/registered/lora/test_multi_lora_backend.py +++ b/test/registered/lora/test_multi_lora_backend.py @@ -25,7 +25,7 @@ from sglang.test.lora_utils import ( ) from sglang.test.test_utils import CustomTestCase, is_in_ci -register_cuda_ci(est_time=100, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=96, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/lora/test_virtual_experts_kernels.py b/test/registered/lora/test_virtual_experts_kernels.py index e6c8d6596..5d04c90a3 100644 --- a/test/registered/lora/test_virtual_experts_kernels.py +++ b/test/registered/lora/test_virtual_experts_kernels.py @@ -32,7 +32,7 @@ from sglang.srt.utils import get_device, is_cuda, is_xpu from sglang.test.ci.ci_register import register_cuda_ci, register_xpu_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-small") register_xpu_ci(est_time=20, suite="stage-a-test-1-gpu-xpu") diff --git a/test/registered/mem_cache/test_int8_checkpoint_store.py b/test/registered/mem_cache/test_int8_checkpoint_store.py index 7fa42d651..d9bd60c63 100644 --- a/test/registered/mem_cache/test_int8_checkpoint_store.py +++ b/test/registered/mem_cache/test_int8_checkpoint_store.py @@ -22,7 +22,7 @@ from sglang.test.ci.ci_register import register_cpu_ci # case self-skips when no GPU is present), so they run on the cheapest CI tier. # The int8 GPU decode path is covered end-to-end by # test_int8_mamba_checkpoint_e2e (now in the extra stage). -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") H, V, K = 32, 128, 128 L = 4 diff --git a/test/registered/mem_cache/test_post_capture_kv_sizing.py b/test/registered/mem_cache/test_post_capture_kv_sizing.py index bbe344509..463ffbe94 100644 --- a/test/registered/mem_cache/test_post_capture_kv_sizing.py +++ b/test/registered/mem_cache/test_post_capture_kv_sizing.py @@ -28,7 +28,7 @@ from sglang.test.test_utils import ( ) # CI Registration -register_cuda_ci(est_time=75, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=79, stage="base-b", runner_config="1-gpu-large") STDOUT_FILENAME = "post_capture_kv_sizing_stdout.log" STDERR_FILENAME = "post_capture_kv_sizing_stderr.log" diff --git a/test/registered/mla/test_mla_fp8.py b/test/registered/mla/test_mla_fp8.py index 1aaada1a2..9de79537e 100644 --- a/test/registered/mla/test_mla_fp8.py +++ b/test/registered/mla/test_mla_fp8.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( ) # MLA FP8 KV cache test with MGSM evaluation -register_cuda_ci(est_time=106, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=114, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=800, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/mla/test_mla_int8_deepseek_v3.py b/test/registered/mla/test_mla_int8_deepseek_v3.py index 1e80de3ab..a1b2e892d 100644 --- a/test/registered/mla/test_mla_int8_deepseek_v3.py +++ b/test/registered/mla/test_mla_int8_deepseek_v3.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( # DeepSeek-V3 channel-INT8 + MTP smoke; int8 GEMM numerics live in # unit/layers/quantization/test_int8_linear_methods.py -register_cuda_ci(est_time=118, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=126, stage="base-b", runner_config="1-gpu-large") class TestDeepseekV3MTPChannelInt8(CustomTestCase): diff --git a/test/registered/mock_model/test_e2e_cp.py b/test/registered/mock_model/test_e2e_cp.py index 700d22b3f..d1b11f1f8 100644 --- a/test/registered/mock_model/test_e2e_cp.py +++ b/test/registered/mock_model/test_e2e_cp.py @@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.mock_model.utils import run_mock_model_bench_serving from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=50, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=45, stage="extra-a", runner_config="2-gpu-large") class TestE2EContextParallel(CustomTestCase): diff --git a/test/registered/mock_model/test_e2e_pd.py b/test/registered/mock_model/test_e2e_pd.py index bb1c84f8c..b1f9afc27 100644 --- a/test/registered/mock_model/test_e2e_pd.py +++ b/test/registered/mock_model/test_e2e_pd.py @@ -19,7 +19,7 @@ from sglang.test.server_fixtures.disaggregation_fixture import ( PDDisaggregationServerBase, ) -register_cuda_ci(est_time=266, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=265, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=165, stage="extra-a", runner_config="2-gpu-large-amd") # DO NOT pass --disable-cuda-graph in canary e2e tests. The canary kernel diff --git a/test/registered/mock_model/test_e2e_pp.py b/test/registered/mock_model/test_e2e_pp.py index 7b3bed952..0e441c8c9 100644 --- a/test/registered/mock_model/test_e2e_pp.py +++ b/test/registered/mock_model/test_e2e_pp.py @@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.mock_model.utils import run_mock_model_bench_serving from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=67, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=66, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=67, stage="extra-a", runner_config="2-gpu-large-amd") diff --git a/test/registered/mock_model/test_e2e_spec_eagle.py b/test/registered/mock_model/test_e2e_spec_eagle.py index f04361bbc..4503bbab7 100644 --- a/test/registered/mock_model/test_e2e_spec_eagle.py +++ b/test/registered/mock_model/test_e2e_spec_eagle.py @@ -6,7 +6,7 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.mock_model.utils import MOCK_MODEL_PATH, run_mock_model_bench_serving from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=96, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=94, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=77, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/mock_model/test_self_e2e_perturb_next_token_swap.py b/test/registered/mock_model/test_self_e2e_perturb_next_token_swap.py index 28ee1fa39..54019f4ec 100644 --- a/test/registered/mock_model/test_self_e2e_perturb_next_token_swap.py +++ b/test/registered/mock_model/test_self_e2e_perturb_next_token_swap.py @@ -5,7 +5,7 @@ import unittest from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.mock_model.perturb_e2e_base import MockModelPerturbE2EBase -register_cuda_ci(est_time=55, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=54, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=131, stage="extra-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/mock_model/test_self_unit_canary_perturb.py b/test/registered/mock_model/test_self_unit_canary_perturb.py index ea0341cf9..7692d7587 100644 --- a/test/registered/mock_model/test_self_unit_canary_perturb.py +++ b/test/registered/mock_model/test_self_unit_canary_perturb.py @@ -7,7 +7,7 @@ from sglang.srt.kv_canary.perturb.config import PerturbConfig, TargetGroupKind from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestCanaryPerturb(CustomTestCase): diff --git a/test/registered/mock_model/test_self_unit_oracle.py b/test/registered/mock_model/test_self_unit_oracle.py index d90bb7536..8ab59daf4 100644 --- a/test/registered/mock_model/test_self_unit_oracle.py +++ b/test/registered/mock_model/test_self_unit_oracle.py @@ -13,7 +13,7 @@ from sglang.srt.kv_canary.token_oracle.oracle import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=8, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=60, suite="extra-a-test-1-gpu-small-amd") diff --git a/test/registered/model_loading/test_external_models.py b/test/registered/model_loading/test_external_models.py index ac02cb23c..f1dcf2ebd 100644 --- a/test/registered/model_loading/test_external_models.py +++ b/test/registered/model_loading/test_external_models.py @@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=34, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=35, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=45, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=32, suite="stage-b-test-cpu-intel") diff --git a/test/registered/model_loading/test_load_weights_from_remote_instance.py b/test/registered/model_loading/test_load_weights_from_remote_instance.py index a4e5a8966..14af4c769 100644 --- a/test/registered/model_loading/test_load_weights_from_remote_instance.py +++ b/test/registered/model_loading/test_load_weights_from_remote_instance.py @@ -38,7 +38,7 @@ from sglang.utils import terminate_process mp.set_start_method("spawn", force=True) -register_cuda_ci(est_time=131, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=124, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=72, stage="extra-a", runner_config="2-gpu-large-amd") diff --git a/test/registered/model_loading/test_startup_weight_load.py b/test/registered/model_loading/test_startup_weight_load.py index cee4f1cec..baf91089e 100644 --- a/test/registered/model_loading/test_startup_weight_load.py +++ b/test/registered/model_loading/test_startup_weight_load.py @@ -9,7 +9,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=63, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=56, stage="base-b", runner_config="1-gpu-small") class TestStartupWeightLoad(CustomTestCase): diff --git a/test/registered/model_loading/test_utils_update_weights.py b/test/registered/model_loading/test_utils_update_weights.py index 36dd613c8..ee07fb2a8 100644 --- a/test/registered/model_loading/test_utils_update_weights.py +++ b/test/registered/model_loading/test_utils_update_weights.py @@ -12,7 +12,7 @@ from sglang.srt.weight_sync.utils import update_weights from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST -register_cuda_ci(est_time=42, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=40, stage="base-b", runner_config="1-gpu-large") class AsyncEngine(Engine): diff --git a/test/registered/model_loading/test_weight_cache_daemon.py b/test/registered/model_loading/test_weight_cache_daemon.py index 1592d2969..48afebfe0 100644 --- a/test/registered/model_loading/test_weight_cache_daemon.py +++ b/test/registered/model_loading/test_weight_cache_daemon.py @@ -29,8 +29,8 @@ DEFAULT_MODEL = "Qwen/Qwen3-0.6B" # IPC handoff is exercised on every PR. Since the CI runner executes the whole # file per suite, TestWeightCacheDaemonTP2 self-skips when fewer than 2 GPUs are # visible (i.e. on the 1-gpu runner). -register_cuda_ci(est_time=313, stage="extra-a", runner_config="2-gpu-large") -register_cuda_ci(est_time=68, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=302, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=66, stage="base-b", runner_config="1-gpu-small") # Capture the client server's logs so test_loaded_via_ipc can assert the IPC # load path actually ran (and did not silently fall back to disk). diff --git a/test/registered/model_loading/test_weight_loader_v2_e2e.py b/test/registered/model_loading/test_weight_loader_v2_e2e.py index 005efe2ca..850dfe814 100644 --- a/test/registered/model_loading/test_weight_loader_v2_e2e.py +++ b/test/registered/model_loading/test_weight_loader_v2_e2e.py @@ -14,7 +14,7 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=62, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=64, stage="base-b", runner_config="1-gpu-small") import multiprocessing as mp diff --git a/test/registered/moe/test_cutedsl_moe.py b/test/registered/moe/test_cutedsl_moe.py index 48d471ea8..a32681dbc 100644 --- a/test/registered/moe/test_cutedsl_moe.py +++ b/test/registered/moe/test_cutedsl_moe.py @@ -21,7 +21,7 @@ except ImportError: CuteDslMoEWrapper = None convert_sf_to_mma_layout = None -register_cuda_ci(est_time=17, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=16, stage="extra-b", runner_config="4-gpu-b200") SKIP_TEST = torch.cuda.get_device_capability() < (10, 0) SKIP_REASON = "Nvfp4 Requires compute capability of 10 or above." diff --git a/test/registered/moe/test_flashinfer_a2a_cutedsl_v2.py b/test/registered/moe/test_flashinfer_a2a_cutedsl_v2.py index 7fa1636ef..283a0b1d4 100644 --- a/test/registered/moe/test_flashinfer_a2a_cutedsl_v2.py +++ b/test/registered/moe/test_flashinfer_a2a_cutedsl_v2.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=556, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=550, stage="extra-b", runner_config="4-gpu-b200") MODEL = "nvidia/Qwen3.5-397B-A17B-NVFP4" diff --git a/test/registered/moe/test_fused_append_remap_per_rank_shared_slots.py b/test/registered/moe/test_fused_append_remap_per_rank_shared_slots.py index b5090f5a1..a19930952 100644 --- a/test/registered/moe/test_fused_append_remap_per_rank_shared_slots.py +++ b/test/registered/moe/test_fused_append_remap_per_rank_shared_slots.py @@ -25,7 +25,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/moe/test_fused_append_shared_experts.py b/test/registered/moe/test_fused_append_shared_experts.py index fbe98cbc1..d8fdf8a4b 100644 --- a/test/registered/moe/test_fused_append_shared_experts.py +++ b/test/registered/moe/test_fused_append_shared_experts.py @@ -22,7 +22,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase, empty_gpu_cache -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/moe/test_fused_append_shared_experts_top6.py b/test/registered/moe/test_fused_append_shared_experts_top6.py index 47393b691..10268176f 100644 --- a/test/registered/moe/test_fused_append_shared_experts_top6.py +++ b/test/registered/moe/test_fused_append_shared_experts_top6.py @@ -21,7 +21,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=20, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/moe/test_fused_moe.py b/test/registered/moe/test_fused_moe.py index ace128004..56e4596ee 100644 --- a/test/registered/moe/test_fused_moe.py +++ b/test/registered/moe/test_fused_moe.py @@ -14,7 +14,7 @@ from sglang.srt.utils import get_device, get_device_capability, is_hip from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase, empty_gpu_cache -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=30, suite="stage-b-test-1-gpu-small-amd") _is_hip = is_hip() diff --git a/test/registered/moe/test_hpc_ops_moe.py b/test/registered/moe/test_hpc_ops_moe.py index 40af9d009..93db6bd76 100644 --- a/test/registered/moe/test_hpc_ops_moe.py +++ b/test/registered/moe/test_hpc_ops_moe.py @@ -24,7 +24,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.layer_ut_utils import init_single_process_dist from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large") # Qwen3-30B-A3B-FP8 MoE shapes. E, TOPK, H, I = 128, 8, 2048, 768 diff --git a/test/registered/moe/test_moe_ep.py b/test/registered/moe/test_moe_ep.py index 900f98d7f..06fd5ef6b 100644 --- a/test/registered/moe/test_moe_ep.py +++ b/test/registered/moe/test_moe_ep.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( # Per-commit: TP=2 EP=2 baseline. # DeepGEMM/FP8 variant: test_moe_ep_extra.py (extra-a). -register_cuda_ci(est_time=93, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=94, stage="base-b", runner_config="2-gpu-large") class TestEp(CustomTestCase): diff --git a/test/registered/moe/test_topk_padded_region.py b/test/registered/moe/test_topk_padded_region.py index 929c96d7a..3be8204fe 100644 --- a/test/registered/moe/test_topk_padded_region.py +++ b/test/registered/moe/test_topk_padded_region.py @@ -15,7 +15,7 @@ from sglang.srt.utils import is_hip from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=60, stage="stage-b", runner_config="1-gpu-small-amd") _IS_HIP = is_hip() diff --git a/test/registered/moe/test_topk_renormalize_degenerate.py b/test/registered/moe/test_topk_renormalize_degenerate.py index c48f9209a..67befbbcd 100644 --- a/test/registered/moe/test_topk_renormalize_degenerate.py +++ b/test/registered/moe/test_topk_renormalize_degenerate.py @@ -25,7 +25,7 @@ from sglang.srt.layers.moe.topk import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=60, stage="stage-b", runner_config="1-gpu-small-amd") torch.manual_seed(1234) diff --git a/test/registered/moe/test_torch_compile_moe.py b/test/registered/moe/test_torch_compile_moe.py index de6308adb..a4af2bab0 100644 --- a/test/registered/moe/test_torch_compile_moe.py +++ b/test/registered/moe/test_torch_compile_moe.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=124, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=122, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=1400, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/moe/test_triton_moe_channel_fp8_kernel.py b/test/registered/moe/test_triton_moe_channel_fp8_kernel.py index 21b372a6a..87a8c99cc 100644 --- a/test/registered/moe/test_triton_moe_channel_fp8_kernel.py +++ b/test/registered/moe/test_triton_moe_channel_fp8_kernel.py @@ -11,7 +11,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-large") def native_w8a8_per_token_matmul(A, B, As, Bs, output_dtype=torch.float16): diff --git a/test/registered/moe/test_zero_experts.py b/test/registered/moe/test_zero_experts.py index 7576ae2a1..72cb7d3c2 100644 --- a/test/registered/moe/test_zero_experts.py +++ b/test/registered/moe/test_zero_experts.py @@ -6,7 +6,7 @@ from sglang.kernels.ops.moe.ep_moe_kernels import zero_experts_compute_triton from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=5, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/observability/test_encoder_server_metrics.py b/test/registered/observability/test_encoder_server_metrics.py index 4a6bc2679..355735814 100644 --- a/test/registered/observability/test_encoder_server_metrics.py +++ b/test/registered/observability/test_encoder_server_metrics.py @@ -23,7 +23,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=32, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=254, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=180, stage="stage-b", runner_config="1-gpu-small-amd") _MODEL_NAME = DEFAULT_SMALL_VLM_MODEL_NAME_FOR_TEST diff --git a/test/registered/observability/test_metrics.py b/test/registered/observability/test_metrics.py index 5105e54d4..193c93abd 100644 --- a/test/registered/observability/test_metrics.py +++ b/test/registered/observability/test_metrics.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=144, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=142, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=32, suite="stage-b-test-1-gpu-small-amd") _MODEL_NAME = "Qwen/Qwen3-0.6B" diff --git a/test/registered/observability/test_tracing.py b/test/registered/observability/test_tracing.py index 3bda14241..fbd4196d6 100644 --- a/test/registered/observability/test_tracing.py +++ b/test/registered/observability/test_tracing.py @@ -46,7 +46,7 @@ from sglang.test.test_utils import ( logger = logging.getLogger(__name__) # CI registration -register_cuda_ci(est_time=113, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=167, stage="extra-a", runner_config="1-gpu-small") # Backend-specific: the span assertions require PREFILL_FORWARD/DECODE_FORWARD # to be emitted from the scheduler forward path, which ROCm reaches through its # own attention backend and graph replay. diff --git a/test/registered/openai_server/basic/test_http2_server.py b/test/registered/openai_server/basic/test_http2_server.py index db2d5d71b..466ea2023 100644 --- a/test/registered/openai_server/basic/test_http2_server.py +++ b/test/registered/openai_server/basic/test_http2_server.py @@ -27,7 +27,7 @@ try: except ImportError: _HAS_GRANIAN = False -register_cuda_ci(est_time=150, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=107, stage="base-b", runner_config="1-gpu-small") @unittest.skipUnless(_HAS_GRANIAN, "granian not installed (pip install sglang[http2])") diff --git a/test/registered/openai_server/basic/test_openai_completion_rust.py b/test/registered/openai_server/basic/test_openai_completion_rust.py index d39a1b14d..1e38b2032 100644 --- a/test/registered/openai_server/basic/test_openai_completion_rust.py +++ b/test/registered/openai_server/basic/test_openai_completion_rust.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=156, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=86, stage="base-b", runner_config="1-gpu-small") @unittest.skipUnless( diff --git a/test/registered/openai_server/basic/test_openai_server.py b/test/registered/openai_server/basic/test_openai_server.py index 09a550d85..dfc674382 100644 --- a/test/registered/openai_server/basic/test_openai_server.py +++ b/test/registered/openai_server/basic/test_openai_server.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=353, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=361, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=280, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/basic/test_serving_transcription.py b/test/registered/openai_server/basic/test_serving_transcription.py index d63b076b8..21085203c 100644 --- a/test/registered/openai_server/basic/test_serving_transcription.py +++ b/test/registered/openai_server/basic/test_serving_transcription.py @@ -23,7 +23,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=59, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=94, stage="base-b", runner_config="1-gpu-small") WHISPER_MODEL = "openai/whisper-large-v3" AUDIO_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/audios/Trump_WEF_2018_10s.mp3" diff --git a/test/registered/openai_server/features/test_openai_server_hidden_states.py b/test/registered/openai_server/features/test_openai_server_hidden_states.py index 04f49b73a..2363a18e5 100644 --- a/test/registered/openai_server/features/test_openai_server_hidden_states.py +++ b/test/registered/openai_server/features/test_openai_server_hidden_states.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=196, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=172, stage="base-b", runner_config="1-gpu-small") register_amd_ci( est_time=140, suite="stage-b-test-1-gpu-small-amd", diff --git a/test/registered/openai_server/function_call/test_openai_function_calling.py b/test/registered/openai_server/function_call/test_openai_function_calling.py index ca1afd434..1f5f4e61a 100644 --- a/test/registered/openai_server/function_call/test_openai_function_calling.py +++ b/test/registered/openai_server/function_call/test_openai_function_calling.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=100, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=195, stage="base-b", runner_config="1-gpu-large") # Backend-specific: the llama3 and pythonic parsers run on real decoded text, # so ROCm decode divergence surfaces as tool calls that no longer parse. register_amd_ci(est_time=73, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/openai_server/validation/test_large_max_new_tokens.py b/test/registered/openai_server/validation/test_large_max_new_tokens.py index 2ce6f44c4..8f5c1fbcc 100644 --- a/test/registered/openai_server/validation/test_large_max_new_tokens.py +++ b/test/registered/openai_server/validation/test_large_max_new_tokens.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=58, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-large") register_cpu_ci(est_time=101, suite="stage-b-test-cpu-intel") diff --git a/test/registered/openai_server/validation/test_matched_stop.py b/test/registered/openai_server/validation/test_matched_stop.py index 4846103f8..94eec24a9 100644 --- a/test/registered/openai_server/validation/test_matched_stop.py +++ b/test/registered/openai_server/validation/test_matched_stop.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=52, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=63, stage="base-b", runner_config="1-gpu-small") register_cpu_ci(est_time=83, suite="stage-b-test-cpu-intel") diff --git a/test/registered/openai_server/validation/test_request_length_validation.py b/test/registered/openai_server/validation/test_request_length_validation.py index f8810771c..038885943 100644 --- a/test/registered/openai_server/validation/test_request_length_validation.py +++ b/test/registered/openai_server/validation/test_request_length_validation.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=49, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=50, stage="base-b", runner_config="1-gpu-large") class TestRequestLengthValidation(CustomTestCase): diff --git a/test/registered/page_major/test_page_major_gpt_oss.py b/test/registered/page_major/test_page_major_gpt_oss.py index 1fea671c6..3da451ae9 100644 --- a/test/registered/page_major/test_page_major_gpt_oss.py +++ b/test/registered/page_major/test_page_major_gpt_oss.py @@ -14,7 +14,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.test_utils import DEFAULT_MODEL_NAME_FOR_TEST_MXFP4_WITH_MOE -register_cuda_ci(est_time=276, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=191, stage="extra-a", runner_config="1-gpu-large") _UNIFIED_COMMON_ARGS = [ "--enable-unified-memory", diff --git a/test/registered/page_major/test_page_major_qwen_hybrid.py b/test/registered/page_major/test_page_major_qwen_hybrid.py index 032edfcca..be1e3d7fe 100644 --- a/test/registered/page_major/test_page_major_qwen_hybrid.py +++ b/test/registered/page_major/test_page_major_qwen_hybrid.py @@ -15,7 +15,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.server_fixtures.default_fixture import DefaultServerBase from sglang.test.test_utils import DEFAULT_HYBRID_GDN_SMALL_MODEL_NAME_FOR_TEST -register_cuda_ci(est_time=261, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=207, stage="extra-a", runner_config="1-gpu-large") _UNIFIED_COMMON_ARGS = [ "--trust-remote-code", diff --git a/test/registered/pp/test_pp_gemma4.py b/test/registered/pp/test_pp_gemma4.py index c07927c45..f0243ac27 100644 --- a/test/registered/pp/test_pp_gemma4.py +++ b/test/registered/pp/test_pp_gemma4.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( ) # tp=1 pp=2 -- two GPUs. -register_cuda_ci(est_time=221, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=206, stage="base-b", runner_config="2-gpu-large") @unittest.skipIf( diff --git a/test/registered/pp/test_pp_parallel_compat.py b/test/registered/pp/test_pp_parallel_compat.py index ceb431b43..94f2729a3 100644 --- a/test/registered/pp/test_pp_parallel_compat.py +++ b/test/registered/pp/test_pp_parallel_compat.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=363, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=350, stage="extra-b", runner_config="4-gpu-h100") QWEN3_MOE_MODEL_PATH = "Qwen/Qwen3-30B-A3B-FP8" diff --git a/test/registered/pp/test_pp_single_node.py b/test/registered/pp/test_pp_single_node.py index d2b6f2e21..63e2fd310 100644 --- a/test/registered/pp/test_pp_single_node.py +++ b/test/registered/pp/test_pp_single_node.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import ( run_bench_one_batch_server, ) -register_cuda_ci(est_time=295, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=310, stage="base-c", runner_config="4-gpu-h100") register_amd_ci(est_time=500, suite="stage-c-test-4-gpu-amd") diff --git a/test/registered/pp/test_pp_single_node_extra.py b/test/registered/pp/test_pp_single_node_extra.py index 19f49f65a..6ca75d503 100644 --- a/test/registered/pp/test_pp_single_node_extra.py +++ b/test/registered/pp/test_pp_single_node_extra.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=342, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=358, stage="extra-b", runner_config="4-gpu-h100") register_amd_ci(est_time=350, suite="stage-c-test-4-gpu-amd") diff --git a/test/registered/prefill_only/test_embedding_models.py b/test/registered/prefill_only/test_embedding_models.py index bd6d976ef..5e93fce04 100644 --- a/test/registered/prefill_only/test_embedding_models.py +++ b/test/registered/prefill_only/test_embedding_models.py @@ -35,7 +35,7 @@ register_amd_ci( suite="stage-b-test-1-gpu-small-amd", disabled="see https://github.com/sgl-project/sglang/issues/11127", ) -register_cuda_ci(est_time=154, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=146, stage="base-b", runner_config="1-gpu-small") MODEL_TO_CONFIG = { "Alibaba-NLP/gte-Qwen2-1.5B-instruct": (1, 1e-5), diff --git a/test/registered/prefill_only/test_multi_item_scoring.py b/test/registered/prefill_only/test_multi_item_scoring.py index e94346408..5e1243bea 100644 --- a/test/registered/prefill_only/test_multi_item_scoring.py +++ b/test/registered/prefill_only/test_multi_item_scoring.py @@ -28,7 +28,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=142, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=143, stage="base-b", runner_config="1-gpu-small") TEST_MODEL_NAME = os.environ.get("TEST_MODEL_NAME", DEFAULT_SMALL_MODEL_NAME_FOR_TEST) TEST_CLASSIFICATION_BASE_MODEL = os.environ.get( diff --git a/test/registered/prefill_only/test_pooled_hidden_states.py b/test/registered/prefill_only/test_pooled_hidden_states.py index 49261a03b..267c9320d 100644 --- a/test/registered/prefill_only/test_pooled_hidden_states.py +++ b/test/registered/prefill_only/test_pooled_hidden_states.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=111, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=118, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=100, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/prefill_only/test_reward_models.py b/test/registered/prefill_only/test_reward_models.py index 195a514f1..239c2ea11 100644 --- a/test/registered/prefill_only/test_reward_models.py +++ b/test/registered/prefill_only/test_reward_models.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import CustomTestCase # ============================================================================== -register_cuda_ci(est_time=188, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=192, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=132, suite="stage-b-test-1-gpu-small-amd-nondeterministic") MODELS = [ diff --git a/test/registered/prefill_only/test_score_api.py b/test/registered/prefill_only/test_score_api.py index 76d8f9873..641f05d76 100644 --- a/test/registered/prefill_only/test_score_api.py +++ b/test/registered/prefill_only/test_score_api.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=94, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=97, stage="base-b", runner_config="1-gpu-small") _MODEL = os.environ.get("TEST_MODEL_NAME", DEFAULT_SMALL_MODEL_NAME_FOR_TEST) diff --git a/test/registered/prefill_only/test_score_engine.py b/test/registered/prefill_only/test_score_engine.py index cab0f8e1c..38571aa88 100644 --- a/test/registered/prefill_only/test_score_engine.py +++ b/test/registered/prefill_only/test_score_engine.py @@ -26,7 +26,7 @@ from sglang.srt.entrypoints.engine import Engine from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST, CustomTestCase -register_cuda_ci(est_time=101, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=99, stage="base-b", runner_config="1-gpu-small") _CAUSAL_LM_MODEL = os.environ.get("TEST_MODEL_NAME", DEFAULT_SMALL_MODEL_NAME_FOR_TEST) _SEQCLS_MODEL = os.environ.get("TEST_CLASSIFICATION_BASE_MODEL", "Qwen/Qwen3-0.6B") diff --git a/test/registered/prefill_only/test_serving_rerank.py b/test/registered/prefill_only/test_serving_rerank.py index ba7f07108..0555d5f6a 100644 --- a/test/registered/prefill_only/test_serving_rerank.py +++ b/test/registered/prefill_only/test_serving_rerank.py @@ -7,7 +7,7 @@ from sglang.srt.managers.tokenizer_manager_score_mixin import ScoreResult from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci # Keep consistent with other openai_server/basic unit tests. -register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") try: diff --git a/test/registered/quant/test_autoround_quantization.py b/test/registered/quant/test_autoround_quantization.py index 7ea13b35f..9b3727c4c 100644 --- a/test/registered/quant/test_autoround_quantization.py +++ b/test/registered/quant/test_autoround_quantization.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=220, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=210, stage="extra-a", runner_config="1-gpu-large") MMLU_NUM_EXAMPLES = 256 MMLU_NUM_THREADS = 32 diff --git a/test/registered/quant/test_awq.py b/test/registered/quant/test_awq.py index 4ef1bfa47..0aa2979fd 100644 --- a/test/registered/quant/test_awq.py +++ b/test/registered/quant/test_awq.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=220, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=755, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=200, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/quant/test_fp8_kernel.py b/test/registered/quant/test_fp8_kernel.py index 6ee0b8a14..883069a61 100644 --- a/test/registered/quant/test_fp8_kernel.py +++ b/test/registered/quant/test_fp8_kernel.py @@ -9,7 +9,7 @@ from sglang.kernels.ops.quantization.fp8_kernel import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-large") from sglang.srt.utils import get_device, is_cuda, is_xpu diff --git a/test/registered/quant/test_fp8kv_triton.py b/test/registered/quant/test_fp8kv_triton.py index 895e33494..2d8efbda8 100644 --- a/test/registered/quant/test_fp8kv_triton.py +++ b/test/registered/quant/test_fp8kv_triton.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=64, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=62, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=94, suite="extra-a-test-1-gpu-large-amd") diff --git a/test/registered/quant/test_gguf.py b/test/registered/quant/test_gguf.py index afd9dc7d9..d94c7fdb7 100644 --- a/test/registered/quant/test_gguf.py +++ b/test/registered/quant/test_gguf.py @@ -6,7 +6,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=142, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=163, stage="base-b", runner_config="1-gpu-small") class TestGGUF(CustomTestCase): diff --git a/test/registered/quant/test_gptqmodel_dynamic.py b/test/registered/quant/test_gptqmodel_dynamic.py index 418e8c926..a97bd6e65 100644 --- a/test/registered/quant/test_gptqmodel_dynamic.py +++ b/test/registered/quant/test_gptqmodel_dynamic.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=50, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=218, stage="extra-a", runner_config="1-gpu-large") def check_quant_method(model_path: str): diff --git a/test/registered/quant/test_int8_kernel.py b/test/registered/quant/test_int8_kernel.py index 3f22d9cab..5d665f84b 100644 --- a/test/registered/quant/test_int8_kernel.py +++ b/test/registered/quant/test_int8_kernel.py @@ -11,7 +11,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=15, suite="nightly-amd-kernel-1-gpu", nightly=True) diff --git a/test/registered/quant/test_is_layer_skipped.py b/test/registered/quant/test_is_layer_skipped.py index dcd076c76..a4b2e95ca 100644 --- a/test/registered/quant/test_is_layer_skipped.py +++ b/test/registered/quant/test_is_layer_skipped.py @@ -4,7 +4,7 @@ from sglang.srt.layers.quantization.utils import is_layer_skipped from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") # Qwen3-Next FP8 actually publishes the equivalent of this in diff --git a/test/registered/quant/test_marlin_moe.py b/test/registered/quant/test_marlin_moe.py index 6a0260aa0..cf9d1e169 100644 --- a/test/registered/quant/test_marlin_moe.py +++ b/test/registered/quant/test_marlin_moe.py @@ -12,7 +12,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_marlin_utils import awq_marlin_quantize, marlin_quantize from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=88, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=86, stage="base-b", runner_config="1-gpu-small") set_global_server_args_for_scheduler(ServerArgs(model_path="dummy")) diff --git a/test/registered/quant/test_nvfp4_embedding.py b/test/registered/quant/test_nvfp4_embedding.py index 99d0c9257..e73cc7e03 100755 --- a/test/registered/quant/test_nvfp4_embedding.py +++ b/test/registered/quant/test_nvfp4_embedding.py @@ -11,7 +11,7 @@ from sglang.srt.layers.quantization.modelopt_quant import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") GROUP_SIZE = 16 diff --git a/test/registered/quant/test_nvfp4_gemm_sm120.py b/test/registered/quant/test_nvfp4_gemm_sm120.py index af1328a44..6d8a733bf 100644 --- a/test/registered/quant/test_nvfp4_gemm_sm120.py +++ b/test/registered/quant/test_nvfp4_gemm_sm120.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( try_cached_model, ) -register_cuda_ci(est_time=101, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=107, stage="base-b", runner_config="1-gpu-small") MODEL_PATH = "nvidia/Llama-3.1-8B-Instruct-NVFP4" diff --git a/test/registered/quant/test_quant_config_parsing.py b/test/registered/quant/test_quant_config_parsing.py index 164f441b8..b349d6b99 100644 --- a/test/registered/quant/test_quant_config_parsing.py +++ b/test/registered/quant/test_quant_config_parsing.py @@ -5,7 +5,7 @@ from sglang.srt.configs.model_config import ModelConfig from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/quant/test_triton_scaled_mm.py b/test/registered/quant/test_triton_scaled_mm.py index ab800fcba..b911adfb6 100644 --- a/test/registered/quant/test_triton_scaled_mm.py +++ b/test/registered/quant/test_triton_scaled_mm.py @@ -9,7 +9,7 @@ from sglang.srt.utils.common import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=12, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/quant/test_w8a8_quantization.py b/test/registered/quant/test_w8a8_quantization.py index 4989b79aa..d824608d6 100644 --- a/test/registered/quant/test_w8a8_quantization.py +++ b/test/registered/quant/test_w8a8_quantization.py @@ -14,7 +14,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=204, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=201, stage="extra-a", runner_config="1-gpu-large") class BaseW8A8Test(CustomTestCase): diff --git a/test/registered/radix_cache/test_int8_mamba_checkpoint_e2e.py b/test/registered/radix_cache/test_int8_mamba_checkpoint_e2e.py index 068084513..21d2cf3ec 100644 --- a/test/registered/radix_cache/test_int8_mamba_checkpoint_e2e.py +++ b/test/registered/radix_cache/test_int8_mamba_checkpoint_e2e.py @@ -38,7 +38,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=344, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=293, stage="extra-b", runner_config="4-gpu-h100") class TestInt8MambaCheckpointE2E(KLDivergenceMixin, DefaultServerBase): diff --git a/test/registered/radix_cache/test_mamba2_extra_buffer_kl.py b/test/registered/radix_cache/test_mamba2_extra_buffer_kl.py index 0fe222028..a2947cda2 100644 --- a/test/registered/radix_cache/test_mamba2_extra_buffer_kl.py +++ b/test/registered/radix_cache/test_mamba2_extra_buffer_kl.py @@ -26,7 +26,7 @@ from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin from sglang.test.server_fixtures.default_fixture import DefaultServerBase -register_cuda_ci(est_time=154, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=132, stage="extra-a", runner_config="1-gpu-large") class TestMamba2ExtraBufferKL(KLDivergenceMixin, DefaultServerBase): diff --git a/test/registered/radix_cache/test_swa_radix_cache_kl.py b/test/registered/radix_cache/test_swa_radix_cache_kl.py index eda7c0e65..5891dce48 100644 --- a/test/registered/radix_cache/test_swa_radix_cache_kl.py +++ b/test/registered/radix_cache/test_swa_radix_cache_kl.py @@ -6,7 +6,7 @@ from sglang.test.server_fixtures.default_fixture import DefaultServerBase MODEL = "openai/gpt-oss-20b" -register_cuda_ci(est_time=198, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=170, stage="base-b", runner_config="1-gpu-large") register_cpu_ci(est_time=1602, suite="stage-b-test-cpu-intel") diff --git a/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_dsv4.py b/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_dsv4.py index 20224cd0d..f70c9f4eb 100644 --- a/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_dsv4.py +++ b/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_dsv4.py @@ -20,7 +20,7 @@ DSV4_FLASH_MODEL = os.environ.get( ) DSV4_FLASH_LAUNCH_TIMEOUT = 3600 -register_cuda_ci(est_time=210, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=174, stage="extra-b", runner_config="4-gpu-h100") class TestDeepSeekV4FlashUnifiedCacheLinkerKL( diff --git a/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_glm52.py b/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_glm52.py index 50792565d..f39ca5e4b 100644 --- a/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_glm52.py +++ b/test/registered/radix_cache/unified_radix_tree/linker/test_unified_cache_linker_kl_glm52.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( GLM52_MODEL = os.environ.get("SGLANG_LINKER_GLM52_MODEL", "zai-org/GLM-5.2-FP8") GLM52_LAUNCH_TIMEOUT = 3600 -register_cuda_ci(est_time=383, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=349, stage="extra-b", runner_config="8-gpu-h200") class TestGLM52UnifiedCacheLinkerKL(UnifiedRadixTreeTestMixin, CustomTestCase): diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_cp.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_cp.py index 2f8543047..85e3f2425 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_cp.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_cp.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=346, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=265, stage="extra-b", runner_config="4-gpu-h100") QWEN3_32B_MODEL = "Qwen/Qwen3-32B" diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dcp.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dcp.py index 1d72c8612..a961105a8 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dcp.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dcp.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=280, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=295, stage="extra-b", runner_config="4-gpu-b200") KIMI_LINEAR_MODEL = "moonshotai/Kimi-Linear-48B-A3B-Instruct" DCP_SIZE = 4 diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4.py index 557fefadc..567756924 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4.py @@ -25,7 +25,7 @@ DSV4_FLASH_MODEL = "sgl-project/DeepSeek-V4-Flash-FP8" DSV4_DSPARK_MODEL = "deepseek-ai/DeepSeek-V4-Flash-DSpark" DSV4_FLASH_LAUNCH_TIMEOUT = 3600 -register_cuda_ci(est_time=1865, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=2024, stage="extra-b", runner_config="4-gpu-h100") def _assert_dsv4_decode_cached_tokens(result, history_len, output_len, label): diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4_pp.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4_pp.py index 40b6893b5..62b449245 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4_pp.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_dsv4_pp.py @@ -4,7 +4,7 @@ import test_unified_radix_cache_kl_dsv4 as dsv4_kl from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=478, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=464, stage="extra-b", runner_config="8-gpu-h200") class TestUnifiedDeepSeekV4FlashHiCachePP4TP2( diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_full.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_full.py index b7588ac6f..2348ffbeb 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_full.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_full.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( unified_radix_tree_server_env, ) -register_cuda_ci(est_time=415, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=488, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=800, suite="stage-b-test-2-gpu-large-amd") FULL_MODEL = "Qwen/Qwen3-32B" diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_glm52.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_glm52.py index 9a3591e7f..4760b1505 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_glm52.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_glm52.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( GLM5_MODEL = "zai-org/GLM-5.2-FP8" GLM5_LAUNCH_TIMEOUT = 3600 -register_cuda_ci(est_time=340, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=392, stage="extra-b", runner_config="8-gpu-h200") class TestGLM5UnifiedRadixCacheL3Accuracy(AccuracyTwoPassMixin, CustomTestCase): diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_hybrid_bitexact.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_hybrid_bitexact.py index c7c5358ba..d127d73d8 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_hybrid_bitexact.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_hybrid_bitexact.py @@ -73,7 +73,7 @@ from sglang.test.test_utils import ( unified_radix_tree_server_env, ) -register_cuda_ci(est_time=2300, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=746, stage="extra-a", runner_config="1-gpu-large") _MODEL_PATH = os.environ.get("INKLING_TEST_MODEL_PATH", "thinkingmachines/Inkling") _MODEL_REVISION = os.environ.get("INKLING_TEST_MODEL_REVISION", "test") diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_mamba.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_mamba.py index 940a5a214..e49c4e80a 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_mamba.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_mamba.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=742, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=795, stage="extra-b", runner_config="4-gpu-h100") MAMBA_MODEL = "Qwen/Qwen3-Next-80B-A3B-Instruct-FP8" MAMBA_CHUNK_SIZE = 64 diff --git a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_swa.py b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_swa.py index b997006fe..36ae1f8e7 100644 --- a/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_swa.py +++ b/test/registered/radix_cache/unified_radix_tree/test_unified_radix_cache_kl_swa.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=301, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=291, stage="base-b", runner_config="2-gpu-large") SWA_MODEL = "openai/gpt-oss-20b" diff --git a/test/registered/reasoning/test_reasoning.py b/test/registered/reasoning/test_reasoning.py index 81931c042..d83e3bc54 100644 --- a/test/registered/reasoning/test_reasoning.py +++ b/test/registered/reasoning/test_reasoning.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=129, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=100, stage="base-b", runner_config="1-gpu-large") # Backend-specific: the thinking-token and separate-reasoning assertions read # decoded output from a 30B MoE, so a ROCm fused-MoE or sampling regression # shows up here as malformed reasoning_content that CUDA cannot catch. diff --git a/test/registered/rl/test_lora_load_from_tensor.py b/test/registered/rl/test_lora_load_from_tensor.py index bb3a308ab..f3a755722 100644 --- a/test/registered/rl/test_lora_load_from_tensor.py +++ b/test/registered/rl/test_lora_load_from_tensor.py @@ -10,7 +10,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=104, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=105, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=90, suite="stage-b-test-1-gpu-small-amd") MODEL_PATH = "Qwen/Qwen3-0.6B" diff --git a/test/registered/rl/test_multi_instance_release_memory_occupation.py b/test/registered/rl/test_multi_instance_release_memory_occupation.py index fcb3b2523..23e86da60 100644 --- a/test/registered/rl/test_multi_instance_release_memory_occupation.py +++ b/test/registered/rl/test_multi_instance_release_memory_occupation.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( find_available_port, ) -register_cuda_ci(est_time=69, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=70, stage="extra-b", runner_config="4-gpu-h100") register_amd_ci( est_time=64, suite="stage-c-test-4-gpu-amd", diff --git a/test/registered/rl/test_patch_torch.py b/test/registered/rl/test_patch_torch.py index 58fb80554..1f7d1d6c3 100644 --- a/test/registered/rl/test_patch_torch.py +++ b/test/registered/rl/test_patch_torch.py @@ -9,7 +9,7 @@ import torch.multiprocessing as mp from sglang.srt.utils.patch_torch import monkey_patch_torch_reductions from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=13, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=30, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/rl/test_pause_generation_tensor_consistency.py b/test/registered/rl/test_pause_generation_tensor_consistency.py index a6b6427bc..7871e812e 100644 --- a/test/registered/rl/test_pause_generation_tensor_consistency.py +++ b/test/registered/rl/test_pause_generation_tensor_consistency.py @@ -9,7 +9,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/rl/test_return_indexer_topk.py b/test/registered/rl/test_return_indexer_topk.py index eb0c24096..1bbd7e8e9 100644 --- a/test/registered/rl/test_return_indexer_topk.py +++ b/test/registered/rl/test_return_indexer_topk.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=306, stage="extra-b", runner_config="8-gpu-h200") +register_cuda_ci(est_time=268, stage="extra-b", runner_config="8-gpu-h200") DEEPSEEK_V32_MODEL_PATH = "deepseek-ai/DeepSeek-V3.2" diff --git a/test/registered/rl/test_return_routed_experts.py b/test/registered/rl/test_return_routed_experts.py index fc54a43f3..067c0602b 100644 --- a/test/registered/rl/test_return_routed_experts.py +++ b/test/registered/rl/test_return_routed_experts.py @@ -24,7 +24,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=446, stage="extra-b", runner_config="4-gpu-h100") +register_cuda_ci(est_time=447, stage="extra-b", runner_config="4-gpu-h100") # FP8 variant of Qwen3-30B-A3B: required because DeepEP normal/LL fast paths in # ep_moe/layer.py only run for {Fp8Config (via deep_gemm), W4AFp8Config, aiter, diff --git a/test/registered/rl/test_update_weights_from_disk_blackwell.py b/test/registered/rl/test_update_weights_from_disk_blackwell.py index a70286dcb..c8b746856 100644 --- a/test/registered/rl/test_update_weights_from_disk_blackwell.py +++ b/test/registered/rl/test_update_weights_from_disk_blackwell.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=606, stage="extra-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=584, stage="extra-b", runner_config="4-gpu-b200") import time import unittest diff --git a/test/registered/rl/test_update_weights_from_distributed.py b/test/registered/rl/test_update_weights_from_distributed.py index ec47a3688..3625251d6 100644 --- a/test/registered/rl/test_update_weights_from_distributed.py +++ b/test/registered/rl/test_update_weights_from_distributed.py @@ -43,7 +43,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import terminate_process -register_cuda_ci(est_time=120, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=121, stage="extra-a", runner_config="2-gpu-large") register_amd_ci(est_time=400, suite="stage-b-test-2-gpu-large-amd") mp.set_start_method("spawn", force=True) diff --git a/test/registered/rl/test_update_weights_from_tensor.py b/test/registered/rl/test_update_weights_from_tensor.py index d9dd41a60..8815c27d6 100644 --- a/test/registered/rl/test_update_weights_from_tensor.py +++ b/test/registered/rl/test_update_weights_from_tensor.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=165, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=162, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=195, suite="stage-b-test-1-gpu-small-amd") import gc diff --git a/test/registered/rotary/test_mrope_axis_map.py b/test/registered/rotary/test_mrope_axis_map.py index 3d60aac50..43dcf0f99 100644 --- a/test/registered/rotary/test_mrope_axis_map.py +++ b/test/registered/rotary/test_mrope_axis_map.py @@ -12,7 +12,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def build_mrope( diff --git a/test/registered/rotary/test_rope_cache_invalidation.py b/test/registered/rotary/test_rope_cache_invalidation.py index be2fbdc5f..0fbfe31bd 100644 --- a/test/registered/rotary/test_rope_cache_invalidation.py +++ b/test/registered/rotary/test_rope_cache_invalidation.py @@ -9,7 +9,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") _ROPE_KWARGS = dict( head_size=64, diff --git a/test/registered/rust/test_run_rust_tests.py b/test/registered/rust/test_run_rust_tests.py index 712d40495..468d08c28 100644 --- a/test/registered/rust/test_run_rust_tests.py +++ b/test/registered/rust/test_run_rust_tests.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import CustomTestCase BUILD_AND_RUN_TIMEOUT_S = 900 RUST_WORKSPACE = Path(__file__).resolve().parents[3] / "rust" -register_cpu_ci(est_time=153, suite="base-a-test-cpu") +register_cpu_ci(est_time=156, suite="base-a-test-cpu") # Exported by _pr-test-stage-cpu.yml as the negation of the check-changes diff --git a/test/registered/rust/test_run_sglang_radix_tree_rust_tests.py b/test/registered/rust/test_run_sglang_radix_tree_rust_tests.py index eafb0d188..bd1394fe8 100644 --- a/test/registered/rust/test_run_sglang_radix_tree_rust_tests.py +++ b/test/registered/rust/test_run_sglang_radix_tree_rust_tests.py @@ -14,7 +14,7 @@ BUILD_AND_RUN_TIMEOUT_S = 900 RUST_WORKSPACE = Path(__file__).resolve().parents[3] / "rust" SGLANG_RADIX_TREE_MANIFEST = RUST_WORKSPACE / "sglang-radix-tree" / "Cargo.toml" -register_cpu_ci(est_time=80, suite="base-a-test-cpu") +register_cpu_ci(est_time=78, suite="base-a-test-cpu") @unittest.skipIf( diff --git a/test/registered/rust/test_rust_extension.py b/test/registered/rust/test_rust_extension.py index 532081379..b2374e978 100644 --- a/test/registered/rust/test_rust_extension.py +++ b/test/registered/rust/test_rust_extension.py @@ -18,7 +18,7 @@ from sglang.srt.rust_extensions.torch_build import torch_build_configuration from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _hold_filesystem_lock(path: str, ready, release) -> None: diff --git a/test/registered/sampling/test_original_logprobs.py b/test/registered/sampling/test_original_logprobs.py index 029a8c784..8f84e7ef1 100644 --- a/test/registered/sampling/test_original_logprobs.py +++ b/test/registered/sampling/test_original_logprobs.py @@ -25,7 +25,7 @@ import sglang as sgl from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import DEFAULT_SMALL_MODEL_NAME_FOR_TEST -register_cuda_ci(est_time=52, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=49, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=60, suite="stage-b-test-1-gpu-small-amd") # ------------------------- Configurable via env ------------------------- # diff --git a/test/registered/sampling/test_sampling_mask.py b/test/registered/sampling/test_sampling_mask.py index f43faa1c8..b40380432 100644 --- a/test/registered/sampling/test_sampling_mask.py +++ b/test/registered/sampling/test_sampling_mask.py @@ -34,7 +34,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=250, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=222, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=320, suite="stage-b-test-1-gpu-small-amd") _MAX_NEW_TOKENS = 4 diff --git a/test/registered/scheduler/test_abort_with_metrics.py b/test/registered/scheduler/test_abort_with_metrics.py index 5e955eafa..629c1f8e7 100644 --- a/test/registered/scheduler/test_abort_with_metrics.py +++ b/test/registered/scheduler/test_abort_with_metrics.py @@ -18,7 +18,7 @@ from sglang.srt.utils.http_middleware_patch import _PureASGIDispatch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") _HTTP_SCOPE = { diff --git a/test/registered/scheduler/test_load_snapshot_server.py b/test/registered/scheduler/test_load_snapshot_server.py index 45e6f1713..0344eb4ad 100644 --- a/test/registered/scheduler/test_load_snapshot_server.py +++ b/test/registered/scheduler/test_load_snapshot_server.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=231, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=223, stage="base-b", runner_config="2-gpu-large") register_amd_ci(est_time=450, suite="stage-b-test-2-gpu-large-amd") diff --git a/test/registered/scheduler/test_min_free_slots_delayer.py b/test/registered/scheduler/test_min_free_slots_delayer.py index 1e573bee4..960469471 100644 --- a/test/registered/scheduler/test_min_free_slots_delayer.py +++ b/test/registered/scheduler/test_min_free_slots_delayer.py @@ -6,7 +6,7 @@ from sglang.srt.managers.min_free_slots_delayer import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") class TestResolveMinFreeSlots(unittest.TestCase): diff --git a/test/registered/scheduler/test_mixed_chunked_prefill.py b/test/registered/scheduler/test_mixed_chunked_prefill.py index 3a944bca4..ee0919e50 100644 --- a/test/registered/scheduler/test_mixed_chunked_prefill.py +++ b/test/registered/scheduler/test_mixed_chunked_prefill.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=176, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=178, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=180, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_priority_scheduling.py b/test/registered/scheduler/test_priority_scheduling.py index bbd2b13a8..4ce647098 100644 --- a/test/registered/scheduler/test_priority_scheduling.py +++ b/test/registered/scheduler/test_priority_scheduling.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( send_concurrent_generate_requests_with_custom_params, ) -register_cuda_ci(est_time=166, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=153, stage="extra-a", runner_config="1-gpu-small") register_amd_ci(est_time=195, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_retract_decode.py b/test/registered/scheduler/test_retract_decode.py index 541671c6d..9f048983b 100644 --- a/test/registered/scheduler/test_retract_decode.py +++ b/test/registered/scheduler/test_retract_decode.py @@ -17,7 +17,7 @@ from sglang.test.test_utils import ( ) from sglang.utils import is_in_ci -register_cuda_ci(est_time=316, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=312, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=300, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scheduler/test_retract_decode_logprob.py b/test/registered/scheduler/test_retract_decode_logprob.py index 0e63cccf9..8e81f2599 100644 --- a/test/registered/scheduler/test_retract_decode_logprob.py +++ b/test/registered/scheduler/test_retract_decode_logprob.py @@ -56,7 +56,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=76, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=75, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=360, suite="stage-b-test-1-gpu-small-amd") N_REQUESTS = 32 diff --git a/test/registered/scheduler/test_scheduler_control.py b/test/registered/scheduler/test_scheduler_control.py index 4ac9ec28a..c4bc560fe 100644 --- a/test/registered/scheduler/test_scheduler_control.py +++ b/test/registered/scheduler/test_scheduler_control.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import ( run_and_check_memory_leak, ) -register_cuda_ci(est_time=421, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=420, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=300, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/scripted_runtime/test_scripted_runtime_core.py b/test/registered/scripted_runtime/test_scripted_runtime_core.py index d6829552e..2b36527d6 100644 --- a/test/registered/scripted_runtime/test_scripted_runtime_core.py +++ b/test/registered/scripted_runtime/test_scripted_runtime_core.py @@ -16,7 +16,7 @@ from sglang.test.scripted_runtime_chunked_helpers import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=297, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=302, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=460, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/sessions/test_session_control.py b/test/registered/sessions/test_session_control.py index fbe2498d4..013cd5a78 100644 --- a/test/registered/sessions/test_session_control.py +++ b/test/registered/sessions/test_session_control.py @@ -28,7 +28,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=137, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=142, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=87, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/sessions/test_session_latency.py b/test/registered/sessions/test_session_latency.py index 558ec07fc..7a5187625 100644 --- a/test/registered/sessions/test_session_latency.py +++ b/test/registered/sessions/test_session_latency.py @@ -27,7 +27,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=113, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=111, stage="extra-a", runner_config="1-gpu-large") NUM_TURNS = 150 INPUT_LEN = 16 diff --git a/test/registered/sessions/test_streaming_session.py b/test/registered/sessions/test_streaming_session.py index 06f15f136..db4eef7cc 100644 --- a/test/registered/sessions/test_streaming_session.py +++ b/test/registered/sessions/test_streaming_session.py @@ -23,7 +23,7 @@ from sglang.test.test_utils import ( DEFAULT_TARGET_MODEL_EAGLE3, ) -register_cuda_ci(est_time=294, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=266, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=691, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/sessions/test_streaming_session_extra.py b/test/registered/sessions/test_streaming_session_extra.py index 96be186e5..b6bd4fee3 100644 --- a/test/registered/sessions/test_streaming_session_extra.py +++ b/test/registered/sessions/test_streaming_session_extra.py @@ -10,7 +10,7 @@ from sglang.test.test_utils import ( DEFAULT_TARGET_MODEL_EAGLE3, ) -register_cuda_ci(est_time=466, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=469, stage="extra-a", runner_config="1-gpu-large") register_amd_ci(est_time=562, suite="extra-a-test-1-gpu-large-amd") diff --git a/test/registered/sessions/test_streaming_session_swa.py b/test/registered/sessions/test_streaming_session_swa.py index be61e8182..2d27d0427 100644 --- a/test/registered/sessions/test_streaming_session_swa.py +++ b/test/registered/sessions/test_streaming_session_swa.py @@ -20,7 +20,7 @@ from sglang.test.server_fixtures.streaming_session_fixture import ( StreamingSessionServerBase, ) -register_cuda_ci(est_time=326, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=332, stage="base-b", runner_config="1-gpu-large") class TestStreamingSessionSWA(StreamingSessionServerBase, StreamingSessionKitMixin): diff --git a/test/registered/spec/dflash/test_dflash.py b/test/registered/spec/dflash/test_dflash.py index b412baa91..dd2a7d068 100644 --- a/test/registered/spec/dflash/test_dflash.py +++ b/test/registered/spec/dflash/test_dflash.py @@ -23,7 +23,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=1078, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=1064, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=420, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/spec/dspark/test_dspark_block_accept_estimator.py b/test/registered/spec/dspark/test_dspark_block_accept_estimator.py index 583fba422..842fda136 100644 --- a/test/registered/spec/dspark/test_dspark_block_accept_estimator.py +++ b/test/registered/spec/dspark/test_dspark_block_accept_estimator.py @@ -12,7 +12,7 @@ from sglang.srt.speculative.dspark_components.dspark_block_accept_estimator impo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _GAMMA = 3 _VOCAB = 8 diff --git a/test/registered/spec/dspark/test_dspark_confidence_metrics.py b/test/registered/spec/dspark/test_dspark_confidence_metrics.py index 61d7436bc..ce1f317f9 100644 --- a/test/registered/spec/dspark/test_dspark_confidence_metrics.py +++ b/test/registered/spec/dspark/test_dspark_confidence_metrics.py @@ -10,7 +10,7 @@ from sglang.srt.speculative.dspark_components.dspark_observability import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _cpu_metrics(gamma: int) -> PerPositionConfidenceMetrics: diff --git a/test/registered/spec/dspark/test_dspark_dp_tier.py b/test/registered/spec/dspark/test_dspark_dp_tier.py index 95f3a1ca8..b8922ae36 100644 --- a/test/registered/spec/dspark/test_dspark_dp_tier.py +++ b/test/registered/spec/dspark/test_dspark_dp_tier.py @@ -13,7 +13,7 @@ from sglang.srt.speculative.dspark_components.dspark_planner import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestLocalVerifyTierNumTokens(CustomTestCase): diff --git a/test/registered/spec/dspark/test_dspark_draft_path_default.py b/test/registered/spec/dspark/test_dspark_draft_path_default.py index b0da41feb..8fc3e58bd 100644 --- a/test/registered/spec/dspark/test_dspark_draft_path_default.py +++ b/test/registered/spec/dspark/test_dspark_draft_path_default.py @@ -13,7 +13,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") _BUNDLED_MODEL_PATH = "deepseek-ai/DeepSeek-V4-Flash-DSpark" _PLAIN_MODEL_PATH = "deepseek-ai/DeepSeek-V4-Flash" diff --git a/test/registered/spec/dspark/test_dspark_info_dumper.py b/test/registered/spec/dspark/test_dspark_info_dumper.py index abd328735..13b83dafc 100644 --- a/test/registered/spec/dspark/test_dspark_info_dumper.py +++ b/test/registered/spec/dspark/test_dspark_info_dumper.py @@ -22,7 +22,7 @@ from sglang.srt.utils.msgspec_utils import msgspec_to_builtins from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class FakeClock: diff --git a/test/registered/spec/dspark/test_dspark_scheduler.py b/test/registered/spec/dspark/test_dspark_scheduler.py index bc1a030a6..b84038578 100644 --- a/test/registered/spec/dspark/test_dspark_scheduler.py +++ b/test/registered/spec/dspark/test_dspark_scheduler.py @@ -22,7 +22,7 @@ from sglang.srt.speculative.ragged_verify import RaggedVerifyLayout from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _flat_table( diff --git a/test/registered/spec/dspark/test_dspark_sps_profiler.py b/test/registered/spec/dspark/test_dspark_sps_profiler.py index bee60c517..36299a8a0 100644 --- a/test/registered/spec/dspark/test_dspark_sps_profiler.py +++ b/test/registered/spec/dspark/test_dspark_sps_profiler.py @@ -15,7 +15,7 @@ from sglang.benchmark.dspark_sps_profiler import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def make_load_info() -> LoadInfo: diff --git a/test/registered/spec/dspark/test_dspark_sps_table.py b/test/registered/spec/dspark/test_dspark_sps_table.py index bdab10159..cade7bf19 100644 --- a/test/registered/spec/dspark/test_dspark_sps_table.py +++ b/test/registered/spec/dspark/test_dspark_sps_table.py @@ -13,7 +13,7 @@ from sglang.srt.speculative.dspark_components.dspark_sps import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_table() -> SpsCostTable: diff --git a/test/registered/spec/dspark/test_dspark_stacked_ctx_kv_parity.py b/test/registered/spec/dspark/test_dspark_stacked_ctx_kv_parity.py index c3891d027..cd0fb0968 100644 --- a/test/registered/spec/dspark/test_dspark_stacked_ctx_kv_parity.py +++ b/test/registered/spec/dspark/test_dspark_stacked_ctx_kv_parity.py @@ -19,7 +19,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") DEVICE = torch.device("cuda") HEAD_DIM = 64 diff --git a/test/registered/spec/dspark/test_dspark_sts.py b/test/registered/spec/dspark/test_dspark_sts.py index b7b890c65..1bb463f00 100644 --- a/test/registered/spec/dspark/test_dspark_sts.py +++ b/test/registered/spec/dspark/test_dspark_sts.py @@ -17,7 +17,7 @@ from sglang.srt.speculative.dspark_components.dspark_sts import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestApplySts(CustomTestCase): diff --git a/test/registered/spec/dspark/test_ragged_verify.py b/test/registered/spec/dspark/test_ragged_verify.py index 95a713b05..6690e986f 100644 --- a/test/registered/spec/dspark/test_ragged_verify.py +++ b/test/registered/spec/dspark/test_ragged_verify.py @@ -9,7 +9,7 @@ from sglang.srt.speculative.ragged_verify import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") _DEVICE = torch.device("cpu") _GRID = [8, 16, 24, 32, 64] diff --git a/test/registered/spec/eagle/test_adaptive_speculative.py b/test/registered/spec/eagle/test_adaptive_speculative.py index 1250369a0..279bed23e 100644 --- a/test/registered/spec/eagle/test_adaptive_speculative.py +++ b/test/registered/spec/eagle/test_adaptive_speculative.py @@ -18,7 +18,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=127, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=240, suite="stage-b-test-1-gpu-large-amd") HIGH_ACCEPT_PROMPT = ( diff --git a/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py b/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py index 3e608ccda..ffae28b0a 100644 --- a/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py +++ b/test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=351, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=358, stage="base-c", runner_config="4-gpu-b200") FULL_DEEPSEEK_V3_FP4_MODEL_PATH = "nvidia/DeepSeek-V3-0324-FP4" SERVER_LAUNCH_TIMEOUT = 1200 diff --git a/test/registered/spec/eagle/test_eagle_constrained_decoding.py b/test/registered/spec/eagle/test_eagle_constrained_decoding.py index 1541354c6..a2ee4d29a 100644 --- a/test/registered/spec/eagle/test_eagle_constrained_decoding.py +++ b/test/registered/spec/eagle/test_eagle_constrained_decoding.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=107, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=117, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=165, stage="stage-b", runner_config="1-gpu-large-amd") diff --git a/test/registered/spec/eagle/test_eagle_reject_sampling.py b/test/registered/spec/eagle/test_eagle_reject_sampling.py index feb82f333..10a7f3c51 100644 --- a/test/registered/spec/eagle/test_eagle_reject_sampling.py +++ b/test/registered/spec/eagle/test_eagle_reject_sampling.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=81, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=82, stage="base-b", runner_config="2-gpu-large") QWEN35_MODEL = "Qwen/Qwen3.5-9B" SERVER_LAUNCH_TIMEOUT = 600 diff --git a/test/registered/spec/eagle/test_spec_eagle.py b/test/registered/spec/eagle/test_spec_eagle.py index 3a4337215..88b7af17b 100644 --- a/test/registered/spec/eagle/test_spec_eagle.py +++ b/test/registered/spec/eagle/test_spec_eagle.py @@ -20,7 +20,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base -register_cuda_ci(est_time=403, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=421, stage="base-b", runner_config="1-gpu-small") _KITS = ( SpecCorrectnessKit, diff --git a/test/registered/spec/eagle/test_spec_eagle_fa3.py b/test/registered/spec/eagle/test_spec_eagle_fa3.py index 6196ff72e..1f6dcc302 100644 --- a/test/registered/spec/eagle/test_spec_eagle_fa3.py +++ b/test/registered/spec/eagle/test_spec_eagle_fa3.py @@ -17,7 +17,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base, EagleLlama2Base -register_cuda_ci(est_time=281, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=309, stage="base-b", runner_config="1-gpu-large") class TestEagle3Fa3(Eagle3Base, SpecAccuracyKit, SpecLogprobKit): diff --git a/test/registered/spec/eagle/test_spec_eagle_page.py b/test/registered/spec/eagle/test_spec_eagle_page.py index 182dd2585..d3b2661e5 100644 --- a/test/registered/spec/eagle/test_spec_eagle_page.py +++ b/test/registered/spec/eagle/test_spec_eagle_page.py @@ -16,7 +16,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base -register_cuda_ci(est_time=210, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=202, stage="base-b", runner_config="1-gpu-small") class TestEagle3Page64( diff --git a/test/registered/spec/eagle/test_spec_eagle_parity.py b/test/registered/spec/eagle/test_spec_eagle_parity.py index 8c114e693..5537342b2 100644 --- a/test/registered/spec/eagle/test_spec_eagle_parity.py +++ b/test/registered/spec/eagle/test_spec_eagle_parity.py @@ -12,7 +12,7 @@ from sglang.test.ci.ci_register import register_cuda_ci, register_xpu_ci from sglang.test.kits.spec_server_kits import SpecParityKit from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base -register_cuda_ci(est_time=126, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=122, stage="base-b", runner_config="1-gpu-large") register_xpu_ci(est_time=360, suite="nightly-xpu-1-gpu", nightly=True) _is_xpu = is_xpu() diff --git a/test/registered/spec/eagle/test_spec_eagle_stress.py b/test/registered/spec/eagle/test_spec_eagle_stress.py index a6b229cae..39698b5e0 100644 --- a/test/registered/spec/eagle/test_spec_eagle_stress.py +++ b/test/registered/spec/eagle/test_spec_eagle_stress.py @@ -17,7 +17,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base, EagleLlama2Base -register_cuda_ci(est_time=440, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=672, stage="extra-a", runner_config="1-gpu-large") class TestEagle3Perf(Eagle3Base, SpecPerfKit): diff --git a/test/registered/spec/eagle/test_spec_eagle_topk.py b/test/registered/spec/eagle/test_spec_eagle_topk.py index 0453bcf96..66121c211 100644 --- a/test/registered/spec/eagle/test_spec_eagle_topk.py +++ b/test/registered/spec/eagle/test_spec_eagle_topk.py @@ -20,7 +20,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base, EagleLlama2Base -register_cuda_ci(est_time=876, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=845, stage="base-b", runner_config="1-gpu-small") class TestEagle3Topk16( diff --git a/test/registered/spec/eagle/test_spec_eagle_topk_page.py b/test/registered/spec/eagle/test_spec_eagle_topk_page.py index 3a7fb679f..adac092d2 100644 --- a/test/registered/spec/eagle/test_spec_eagle_topk_page.py +++ b/test/registered/spec/eagle/test_spec_eagle_topk_page.py @@ -18,7 +18,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base -register_cuda_ci(est_time=296, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=298, stage="base-b", runner_config="1-gpu-small") class TestEagle3Page4Topk8(Eagle3Base, SpecAccuracyKit, SpecLogprobKit, SpecFeatureKit): diff --git a/test/registered/spec/eagle/test_spec_eagle_triton.py b/test/registered/spec/eagle/test_spec_eagle_triton.py index 1143fd1b8..03d058cce 100644 --- a/test/registered/spec/eagle/test_spec_eagle_triton.py +++ b/test/registered/spec/eagle/test_spec_eagle_triton.py @@ -18,7 +18,7 @@ from sglang.test.kits.spec_server_kits import ( ) from sglang.test.server_fixtures.spec_eagle_fixture import Eagle3Base -register_cuda_ci(est_time=191, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=188, stage="base-b", runner_config="1-gpu-small") class TestEagle3Triton( diff --git a/test/registered/spec/test_constrained_decoding_spec_reasoning.py b/test/registered/spec/test_constrained_decoding_spec_reasoning.py index b6a088eca..66dd1c203 100644 --- a/test/registered/spec/test_constrained_decoding_spec_reasoning.py +++ b/test/registered/spec/test_constrained_decoding_spec_reasoning.py @@ -13,7 +13,7 @@ from sglang.test.test_utils import ( ) # Constrained decoding with EAGLE3 speculative reasoning (tp=2) -register_cuda_ci(est_time=113, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=110, stage="base-b", runner_config="2-gpu-large") class ServerWithGrammar(CustomTestCase): diff --git a/test/registered/spec/test_frozen_kv_mtp.py b/test/registered/spec/test_frozen_kv_mtp.py index 96d23882d..ed6f0cda3 100644 --- a/test/registered/spec/test_frozen_kv_mtp.py +++ b/test/registered/spec/test_frozen_kv_mtp.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=120, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=123, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=450, suite="stage-b-test-1-gpu-large-amd") diff --git a/test/registered/spec/test_gemma4_dflash_31b_extra.py b/test/registered/spec/test_gemma4_dflash_31b_extra.py index 6b0d0d6ec..147224d1a 100644 --- a/test/registered/spec/test_gemma4_dflash_31b_extra.py +++ b/test/registered/spec/test_gemma4_dflash_31b_extra.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=92, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=90, stage="extra-a", runner_config="2-gpu-large") MODEL_NAME = "31B" TARGET_PATH = "google/gemma-4-31B-it" diff --git a/test/registered/spec/test_gemma4_mtp_31b_extra.py b/test/registered/spec/test_gemma4_mtp_31b_extra.py index ea8aecae7..684fabc01 100644 --- a/test/registered/spec/test_gemma4_mtp_31b_extra.py +++ b/test/registered/spec/test_gemma4_mtp_31b_extra.py @@ -16,7 +16,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=179, stage="extra-a", runner_config="2-gpu-large") +register_cuda_ci(est_time=178, stage="extra-a", runner_config="2-gpu-large") MODEL_NAME = "31B" TARGET_PATH = "google/gemma-4-31B-it" diff --git a/test/registered/spec/test_spec_mixed_chunk.py b/test/registered/spec/test_spec_mixed_chunk.py index 8cd1b0916..95dcfc10e 100644 --- a/test/registered/spec/test_spec_mixed_chunk.py +++ b/test/registered/spec/test_spec_mixed_chunk.py @@ -32,7 +32,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=196, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=200, stage="base-b", runner_config="1-gpu-large") class TestEagle3MixedChunk( diff --git a/test/registered/spec/test_spec_ngram.py b/test/registered/spec/test_spec_ngram.py index f388d0645..c67b05c79 100644 --- a/test/registered/spec/test_spec_ngram.py +++ b/test/registered/spec/test_spec_ngram.py @@ -10,7 +10,7 @@ from sglang.test.server_fixtures.ngram_fixture import NgramServerBase # Per-commit: Paged backend only. # - FA3 base test archived to test/manual/spec/test_spec_ngram_fa3.py # - Triton + Flashinfer moved to test_spec_ngram_extra.py -register_cuda_ci(est_time=82, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=76, stage="base-b", runner_config="1-gpu-large") class TestNgramSpeculativeDecodingPaged( diff --git a/test/registered/spec/test_spec_ngram_extra.py b/test/registered/spec/test_spec_ngram_extra.py index 8a5f7096e..d128e3141 100644 --- a/test/registered/spec/test_spec_ngram_extra.py +++ b/test/registered/spec/test_spec_ngram_extra.py @@ -8,7 +8,7 @@ from sglang.test.server_fixtures.ngram_fixture import NgramServerBase # Extra: Triton + Flashinfer NGRAM backends + non-overlap (sync V2) variant. # Sibling per-commit file (test_spec_ngram.py) keeps the Paged variant. -register_cuda_ci(est_time=197, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=198, stage="extra-a", runner_config="1-gpu-large") class TestNgramSpeculativeDecodingTriton(NgramServerBase, GSM8KMixin): diff --git a/test/registered/spec/test_spec_standalone_extra.py b/test/registered/spec/test_spec_standalone_extra.py index c43dbeb02..280f9a4a3 100644 --- a/test/registered/spec/test_spec_standalone_extra.py +++ b/test/registered/spec/test_spec_standalone_extra.py @@ -7,7 +7,7 @@ from sglang.test.test_utils import CustomTestCase # Non-V2 standalone speculative decoding tests (FA3, Triton, FlashInfer # backends). Sibling V2 classes stay per-commit in test_spec_standalone.py. -register_cuda_ci(est_time=225, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=224, stage="extra-a", runner_config="1-gpu-large") # AMD: fa3 / flashinfer attention backends are not built in the ROCm # sgl_kernel, so only the triton-backend class runs on ROCm (the fa3 and # flashinfer classes are skipped on ROCm below). diff --git a/test/registered/spec/utils/test_build_eagle_tree.py b/test/registered/spec/utils/test_build_eagle_tree.py index d2be6496b..3cbc4dd47 100644 --- a/test/registered/spec/utils/test_build_eagle_tree.py +++ b/test/registered/spec/utils/test_build_eagle_tree.py @@ -9,7 +9,7 @@ from sglang.srt.speculative.eagle_utils import ( from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=4, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/tokenizer/test_multi_tokenizer.py b/test/registered/tokenizer/test_multi_tokenizer.py index 0789360ce..9c452969e 100644 --- a/test/registered/tokenizer/test_multi_tokenizer.py +++ b/test/registered/tokenizer/test_multi_tokenizer.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import ( write_github_step_summary, ) -register_cuda_ci(est_time=220, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=221, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=355, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/tokenizer/test_skip_tokenizer_init.py b/test/registered/tokenizer/test_skip_tokenizer_init.py index 92893a208..3e5d6cfde 100644 --- a/test/registered/tokenizer/test_skip_tokenizer_init.py +++ b/test/registered/tokenizer/test_skip_tokenizer_init.py @@ -23,7 +23,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=117, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=102, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=117, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/batch_overlap/test_tbo_children_dummy_token_mask.py b/test/registered/unit/batch_overlap/test_tbo_children_dummy_token_mask.py index 9430a5faa..46b7312df 100644 --- a/test/registered/unit/batch_overlap/test_tbo_children_dummy_token_mask.py +++ b/test/registered/unit/batch_overlap/test_tbo_children_dummy_token_mask.py @@ -26,7 +26,7 @@ from sglang.srt.runtime_context import get_context, get_device, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _make_extend_batch(*, padded_num_tokens: int, global_num_token_non_padded_cpu: int): diff --git a/test/registered/unit/batch_overlap/test_tbo_cuda_graph_num_token_device.py b/test/registered/unit/batch_overlap/test_tbo_cuda_graph_num_token_device.py index fc3fc7530..e499bbd1f 100644 --- a/test/registered/unit/batch_overlap/test_tbo_cuda_graph_num_token_device.py +++ b/test/registered/unit/batch_overlap/test_tbo_cuda_graph_num_token_device.py @@ -29,7 +29,7 @@ from sglang.srt.runtime_context import get_context, get_device from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestTboCudaGraphNumTokenDevice(CustomTestCase): diff --git a/test/registered/unit/batch_overlap/test_tbo_filter_batch_marker.py b/test/registered/unit/batch_overlap/test_tbo_filter_batch_marker.py index cba5a44ef..749dfff87 100644 --- a/test/registered/unit/batch_overlap/test_tbo_filter_batch_marker.py +++ b/test/registered/unit/batch_overlap/test_tbo_filter_batch_marker.py @@ -15,7 +15,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_target_verify_batch(bs: int) -> ForwardBatch: diff --git a/test/registered/unit/beam_search/test_beam_search_core.py b/test/registered/unit/beam_search/test_beam_search_core.py index c22fce99f..dfa3d9e91 100644 --- a/test/registered/unit/beam_search/test_beam_search_core.py +++ b/test/registered/unit/beam_search/test_beam_search_core.py @@ -20,7 +20,7 @@ from sglang.srt.beam_search import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def T(data, dtype): diff --git a/test/registered/unit/beam_search/test_fork.py b/test/registered/unit/beam_search/test_fork.py index a199b6155..8bea3ff5c 100644 --- a/test/registered/unit/beam_search/test_fork.py +++ b/test/registered/unit/beam_search/test_fork.py @@ -18,7 +18,7 @@ from sglang.srt.managers.schedule_batch import ReqKvInfo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestRemapKvMapping(CustomTestCase): diff --git a/test/registered/unit/beam_search/test_output_decode.py b/test/registered/unit/beam_search/test_output_decode.py index 21a8f0e59..b78585253 100644 --- a/test/registered/unit/beam_search/test_output_decode.py +++ b/test/registered/unit/beam_search/test_output_decode.py @@ -19,7 +19,7 @@ from sglang.srt.managers.detokenizer_manager import DetokenizerManager from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") STOP_ID = 99 diff --git a/test/registered/unit/bench/test_benchmark_endpoint.py b/test/registered/unit/bench/test_benchmark_endpoint.py index 61e39899b..46db00acb 100644 --- a/test/registered/unit/bench/test_benchmark_endpoint.py +++ b/test/registered/unit/bench/test_benchmark_endpoint.py @@ -8,7 +8,7 @@ from sglang.benchmark.endpoint import launch_or_reuse_server from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _noop_launch_server(server_args): diff --git a/test/registered/unit/bench/test_mmmu_eval_utils.py b/test/registered/unit/bench/test_mmmu_eval_utils.py index bc72a8b55..2fd8a97b7 100644 --- a/test/registered/unit/bench/test_mmmu_eval_utils.py +++ b/test/registered/unit/bench/test_mmmu_eval_utils.py @@ -15,7 +15,7 @@ except ModuleNotFoundError: pass -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _load_mmmu_eval_utils(): diff --git a/test/registered/unit/checkpoint_engine/test_checkpoint_engine_worker.py b/test/registered/unit/checkpoint_engine/test_checkpoint_engine_worker.py index 50ece8d34..f86890a76 100644 --- a/test/registered/unit/checkpoint_engine/test_checkpoint_engine_worker.py +++ b/test/registered/unit/checkpoint_engine/test_checkpoint_engine_worker.py @@ -14,7 +14,7 @@ from sglang.test.ci.ci_register import register_cpu_ci # Unit tests may register CPU suites only (scripts/lint/check_registered_tests.py). # TestWorkerDeviceUuidOnXpu below still self-skips off XPU, so it stays runnable # by hand on an Intel GPU host. -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import importlib.util import unittest diff --git a/test/registered/unit/cli/test_serve_backends.py b/test/registered/unit/cli/test_serve_backends.py index f76cb089b..aeaaad73c 100644 --- a/test/registered/unit/cli/test_serve_backends.py +++ b/test/registered/unit/cli/test_serve_backends.py @@ -14,7 +14,7 @@ from sglang.cli.serve_backends import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") def _make_entry_point(name, factory, distribution=None): diff --git a/test/registered/unit/compilation/test_torch_compile_decoration.py b/test/registered/unit/compilation/test_torch_compile_decoration.py index 7d9446666..c7cded581 100644 --- a/test/registered/unit/compilation/test_torch_compile_decoration.py +++ b/test/registered/unit/compilation/test_torch_compile_decoration.py @@ -6,7 +6,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") from sglang.srt.compilation.compile import ( _infer_dynamic_arg_dims_from_annotations, diff --git a/test/registered/unit/configs/test_cohere2_moe_config.py b/test/registered/unit/configs/test_cohere2_moe_config.py index 086674e8a..4bf7dc2ae 100644 --- a/test/registered/unit/configs/test_cohere2_moe_config.py +++ b/test/registered/unit/configs/test_cohere2_moe_config.py @@ -12,7 +12,7 @@ import unittest from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestCohere2MoeConfig(CustomTestCase): diff --git a/test/registered/unit/configs/test_embedding_model_spec.py b/test/registered/unit/configs/test_embedding_model_spec.py index 23dff1878..bd8850c4b 100644 --- a/test/registered/unit/configs/test_embedding_model_spec.py +++ b/test/registered/unit/configs/test_embedding_model_spec.py @@ -14,7 +14,7 @@ from sglang.srt.configs.embedding_model_spec import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") class TestEmbeddingModelSpec(unittest.TestCase): diff --git a/test/registered/unit/configs/test_laguna_config.py b/test/registered/unit/configs/test_laguna_config.py index 3e39b5987..dc930274b 100644 --- a/test/registered/unit/configs/test_laguna_config.py +++ b/test/registered/unit/configs/test_laguna_config.py @@ -19,7 +19,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # (factor, attention_factor). S/XS ship attention_factor == the yarn default for # their factor; _NON_DEFAULT differs from both 1.0 and the default, so a naive diff --git a/test/registered/unit/configs/test_linear_attn_model_registry.py b/test/registered/unit/configs/test_linear_attn_model_registry.py index 82c662c66..6cb570b52 100644 --- a/test/registered/unit/configs/test_linear_attn_model_registry.py +++ b/test/registered/unit/configs/test_linear_attn_model_registry.py @@ -13,7 +13,7 @@ from sglang.srt.configs.linear_attn_model_registry import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") # Dummy config classes for testing diff --git a/test/registered/unit/configs/test_locate_anything_config.py b/test/registered/unit/configs/test_locate_anything_config.py index 97ea6f700..7cf33de64 100644 --- a/test/registered/unit/configs/test_locate_anything_config.py +++ b/test/registered/unit/configs/test_locate_anything_config.py @@ -9,7 +9,7 @@ from sglang.srt.configs.kimi_vl_moonvit import MoonViTConfig from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestLocateAnythingConfig(CustomTestCase): diff --git a/test/registered/unit/configs/test_minicpm_config.py b/test/registered/unit/configs/test_minicpm_config.py index e97f3c3b8..0dbbeb486 100644 --- a/test/registered/unit/configs/test_minicpm_config.py +++ b/test/registered/unit/configs/test_minicpm_config.py @@ -29,7 +29,7 @@ from sglang.srt.models.minicpm import ( from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def test_minicpm_lightning_config_defaults_are_complete(): diff --git a/test/registered/unit/configs/test_model_config.py b/test/registered/unit/configs/test_model_config.py index 73edb2c34..a92ccd58b 100644 --- a/test/registered/unit/configs/test_model_config.py +++ b/test/registered/unit/configs/test_model_config.py @@ -21,7 +21,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestHybridLayerIds(CustomTestCase): diff --git a/test/registered/unit/configs/test_model_config_parser_registry.py b/test/registered/unit/configs/test_model_config_parser_registry.py index c64781426..0821437d8 100644 --- a/test/registered/unit/configs/test_model_config_parser_registry.py +++ b/test/registered/unit/configs/test_model_config_parser_registry.py @@ -13,7 +13,7 @@ from sglang.srt.configs.model_config_parser_registry import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeParser(ModelConfigParserBase): diff --git a/test/registered/unit/configs/test_model_config_scaling.py b/test/registered/unit/configs/test_model_config_scaling.py index 6483890d2..29904cb7f 100644 --- a/test/registered/unit/configs/test_model_config_scaling.py +++ b/test/registered/unit/configs/test_model_config_scaling.py @@ -6,7 +6,7 @@ from sglang.srt.configs.model_config import ModelConfig, compute_mla_mscale_scal from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _mla_scaling(rope_scaling) -> tuple[float, float]: diff --git a/test/registered/unit/configs/test_model_config_shapes.py b/test/registered/unit/configs/test_model_config_shapes.py index 651dc87d7..3c2f67be6 100644 --- a/test/registered/unit/configs/test_model_config_shapes.py +++ b/test/registered/unit/configs/test_model_config_shapes.py @@ -10,7 +10,7 @@ from sglang.srt.configs.model_config import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_text_config(**overrides): diff --git a/test/registered/unit/configs/test_multimodal_piecewise_cuda_graph.py b/test/registered/unit/configs/test_multimodal_piecewise_cuda_graph.py index b76e82bb7..b55f158f9 100644 --- a/test/registered/unit/configs/test_multimodal_piecewise_cuda_graph.py +++ b/test/registered/unit/configs/test_multimodal_piecewise_cuda_graph.py @@ -30,7 +30,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestMultimodalPiecewiseCudaGraph(CustomTestCase): diff --git a/test/registered/unit/configs/test_nano_nemotron_vl_config.py b/test/registered/unit/configs/test_nano_nemotron_vl_config.py index a8612ccb2..ab2247a88 100644 --- a/test/registered/unit/configs/test_nano_nemotron_vl_config.py +++ b/test/registered/unit/configs/test_nano_nemotron_vl_config.py @@ -8,7 +8,7 @@ from sglang.srt.configs.nano_nemotron_vl import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestNemotronHOmniConfig(CustomTestCase): diff --git a/test/registered/unit/configs/test_zaya_config.py b/test/registered/unit/configs/test_zaya_config.py index 9642b889f..fa528077d 100644 --- a/test/registered/unit/configs/test_zaya_config.py +++ b/test/registered/unit/configs/test_zaya_config.py @@ -8,7 +8,7 @@ from sglang.srt.configs.zaya import ZayaConfig, register_zaya_config from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestZayaConfig(CustomTestCase): diff --git a/test/registered/unit/constrained/test_llguidance_batched_mask.py b/test/registered/unit/constrained/test_llguidance_batched_mask.py index 5737aa353..f257524cb 100644 --- a/test/registered/unit/constrained/test_llguidance_batched_mask.py +++ b/test/registered/unit/constrained/test_llguidance_batched_mask.py @@ -11,7 +11,7 @@ from sglang.srt.constrained.llguidance_backend import GuidanceBackend, GuidanceG from sglang.srt.runtime_context import get_resources from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") _REGEX = r"[0-9]{1,8}" diff --git a/test/registered/unit/constrained/test_mistral_common_xgrammar.py b/test/registered/unit/constrained/test_mistral_common_xgrammar.py index ca0a19690..026747d1a 100644 --- a/test/registered/unit/constrained/test_mistral_common_xgrammar.py +++ b/test/registered/unit/constrained/test_mistral_common_xgrammar.py @@ -7,7 +7,7 @@ from sglang.srt.utils.hf_transformers.mistral_utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") VOCAB_SIZE = 300 NUM_SPECIAL = 8 diff --git a/test/registered/unit/disaggregation/test_admission_abort_not_enqueued.py b/test/registered/unit/disaggregation/test_admission_abort_not_enqueued.py index e4ef48bf9..0040424b4 100644 --- a/test/registered/unit/disaggregation/test_admission_abort_not_enqueued.py +++ b/test/registered/unit/disaggregation/test_admission_abort_not_enqueued.py @@ -36,7 +36,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") ERROR_MSG = ( "Input length (1500 tokens) exceeds the maximum allowed length (1018 tokens)." diff --git a/test/registered/unit/disaggregation/test_dcp_pack.py b/test/registered/unit/disaggregation/test_dcp_pack.py index dc5190d37..91d58ce57 100644 --- a/test/registered/unit/disaggregation/test_dcp_pack.py +++ b/test/registered/unit/disaggregation/test_dcp_pack.py @@ -21,7 +21,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _plan(*, src, dst, page_size, dcp_size, dcp_rank, **kwargs): diff --git a/test/registered/unit/disaggregation/test_decode_hicache_tree_core.py b/test/registered/unit/disaggregation/test_decode_hicache_tree_core.py index adc255ed6..f05857caf 100644 --- a/test/registered/unit/disaggregation/test_decode_hicache_tree_core.py +++ b/test/registered/unit/disaggregation/test_decode_hicache_tree_core.py @@ -14,7 +14,7 @@ from sglang.srt.mem_cache.base_prefix_cache import CacheRequestHandle from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestDecodeHiCacheTreeCore(CustomTestCase): diff --git a/test/registered/unit/disaggregation/test_decode_queue_cleanup.py b/test/registered/unit/disaggregation/test_decode_queue_cleanup.py index ff0c001fd..f47c8ef7f 100644 --- a/test/registered/unit/disaggregation/test_decode_queue_cleanup.py +++ b/test/registered/unit/disaggregation/test_decode_queue_cleanup.py @@ -21,7 +21,7 @@ from sglang.test.separate_buffer_allocator_double import ( ) from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class FakeReceiver: diff --git a/test/registered/unit/disaggregation/test_decode_req_to_token_pool.py b/test/registered/unit/disaggregation/test_decode_req_to_token_pool.py index 654afe253..cbea32009 100644 --- a/test/registered/unit/disaggregation/test_decode_req_to_token_pool.py +++ b/test/registered/unit/disaggregation/test_decode_req_to_token_pool.py @@ -9,7 +9,7 @@ from sglang.srt.disaggregation.decode import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _init_decode_pool(pool): diff --git a/test/registered/unit/disaggregation/test_deferred_decode_kv_release.py b/test/registered/unit/disaggregation/test_deferred_decode_kv_release.py index 0a8936f21..c35d478c4 100644 --- a/test/registered/unit/disaggregation/test_deferred_decode_kv_release.py +++ b/test/registered/unit/disaggregation/test_deferred_decode_kv_release.py @@ -18,7 +18,7 @@ from sglang.srt.disaggregation.decode import DecodeTransferQueue from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_manager(): diff --git a/test/registered/unit/disaggregation/test_disaggregation_wire.py b/test/registered/unit/disaggregation/test_disaggregation_wire.py index 0a9bc35d4..02606b834 100644 --- a/test/registered/unit/disaggregation/test_disaggregation_wire.py +++ b/test/registered/unit/disaggregation/test_disaggregation_wire.py @@ -64,7 +64,7 @@ from sglang.srt.speculative.eagle_disaggregation import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestDisaggregationWire(unittest.TestCase): diff --git a/test/registered/unit/disaggregation/test_encode_receiver.py b/test/registered/unit/disaggregation/test_encode_receiver.py index 8e201e805..381a000c6 100644 --- a/test/registered/unit/disaggregation/test_encode_receiver.py +++ b/test/registered/unit/disaggregation/test_encode_receiver.py @@ -24,7 +24,7 @@ from sglang.srt.sampling.sampling_params import SamplingParams from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_registration_request(request_cls): diff --git a/test/registered/unit/disaggregation/test_encode_server.py b/test/registered/unit/disaggregation/test_encode_server.py index 6f0c093db..4a652817f 100644 --- a/test/registered/unit/disaggregation/test_encode_server.py +++ b/test/registered/unit/disaggregation/test_encode_server.py @@ -53,7 +53,7 @@ from sglang.srt.utils.common import safe_pickle_loads from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestEncoderDPErrorHandling(CustomTestCase): diff --git a/test/registered/unit/disaggregation/test_encoder_health.py b/test/registered/unit/disaggregation/test_encoder_health.py index c90dd89fe..c7bcf3d84 100644 --- a/test/registered/unit/disaggregation/test_encoder_health.py +++ b/test/registered/unit/disaggregation/test_encoder_health.py @@ -7,7 +7,7 @@ from sglang.srt.disaggregation.encoder import http_server from sglang.srt.managers.schedule_batch import Modality from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=13, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _FakeEncoder: diff --git a/test/registered/unit/disaggregation/test_encoder_scheduler.py b/test/registered/unit/disaggregation/test_encoder_scheduler.py index 9843cdf5d..61f539f2d 100644 --- a/test/registered/unit/disaggregation/test_encoder_scheduler.py +++ b/test/registered/unit/disaggregation/test_encoder_scheduler.py @@ -14,7 +14,7 @@ from sglang.srt.disaggregation.encoder.runtime import ( from sglang.srt.managers.schedule_batch import Modality from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _pending(modality: str = "image") -> PendingRequest: diff --git a/test/registered/unit/disaggregation/test_fake_kv_sender.py b/test/registered/unit/disaggregation/test_fake_kv_sender.py index f8949bb91..9035c6ba8 100644 --- a/test/registered/unit/disaggregation/test_fake_kv_sender.py +++ b/test/registered/unit/disaggregation/test_fake_kv_sender.py @@ -10,7 +10,7 @@ from sglang.srt.disaggregation.utils import DisaggregationMode from sglang.srt.environ import envs from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestFakeKVSender(unittest.TestCase): diff --git a/test/registered/unit/disaggregation/test_kimi_k3_encoder_mode.py b/test/registered/unit/disaggregation/test_kimi_k3_encoder_mode.py index beb3eaaa6..8ac8495f6 100644 --- a/test/registered/unit/disaggregation/test_kimi_k3_encoder_mode.py +++ b/test/registered/unit/disaggregation/test_kimi_k3_encoder_mode.py @@ -56,7 +56,7 @@ from sglang.srt.server_args import resolve_encoder_transfer_backend from sglang.srt.utils import ImageData from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=14, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def test_kimi_k3_encoder_transfer_backend_auto_avoids_tp_fanout(): diff --git a/test/registered/unit/disaggregation/test_kv_events.py b/test/registered/unit/disaggregation/test_kv_events.py index 077cda160..7aa9a93af 100644 --- a/test/registered/unit/disaggregation/test_kv_events.py +++ b/test/registered/unit/disaggregation/test_kv_events.py @@ -24,7 +24,7 @@ from sglang.srt.disaggregation.kv_events import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestResolveLoadPubRange(CustomTestCase): diff --git a/test/registered/unit/disaggregation/test_kv_transfer_replica_metric.py b/test/registered/unit/disaggregation/test_kv_transfer_replica_metric.py index 75baa3f52..6f9aa073c 100644 --- a/test/registered/unit/disaggregation/test_kv_transfer_replica_metric.py +++ b/test/registered/unit/disaggregation/test_kv_transfer_replica_metric.py @@ -17,7 +17,7 @@ from sglang.srt.disaggregation.common.conn import CommonKVManager, CommonKVSende from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") KV_ITEM_LENS_SUM = 100 STATE_ITEM_LENS_SUM = 7 diff --git a/test/registered/unit/disaggregation/test_minimax_sparse_disagg_state_kv_args.py b/test/registered/unit/disaggregation/test_minimax_sparse_disagg_state_kv_args.py index acb8c3830..cdedb17a9 100644 --- a/test/registered/unit/disaggregation/test_minimax_sparse_disagg_state_kv_args.py +++ b/test/registered/unit/disaggregation/test_minimax_sparse_disagg_state_kv_args.py @@ -7,7 +7,7 @@ from sglang.srt.disaggregation.utils import setup_state_kv_args from sglang.srt.mem_cache.memory_pool import MiniMaxSparseKVPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _make_k_only_pool(start_layer: int = 0) -> MiniMaxSparseKVPool: diff --git a/test/registered/unit/disaggregation/test_mooncake_custom_mem_pool_batch.py b/test/registered/unit/disaggregation/test_mooncake_custom_mem_pool_batch.py index e957a543d..98593baa5 100644 --- a/test/registered/unit/disaggregation/test_mooncake_custom_mem_pool_batch.py +++ b/test/registered/unit/disaggregation/test_mooncake_custom_mem_pool_batch.py @@ -7,7 +7,7 @@ from sglang.srt.disaggregation.mooncake.conn import MooncakeKVManager from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestMooncakeCustomMemPoolBatch(CustomTestCase): diff --git a/test/registered/unit/disaggregation/test_mooncake_transfer_batching.py b/test/registered/unit/disaggregation/test_mooncake_transfer_batching.py index d22af7399..b588dc89e 100644 --- a/test/registered/unit/disaggregation/test_mooncake_transfer_batching.py +++ b/test/registered/unit/disaggregation/test_mooncake_transfer_batching.py @@ -12,7 +12,7 @@ from sglang.srt.disaggregation.mooncake.conn import MooncakeKVManager from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestMooncakeTransferBatching(unittest.TestCase): diff --git a/test/registered/unit/disaggregation/test_nixl_backend_basic.py b/test/registered/unit/disaggregation/test_nixl_backend_basic.py index 2bf28ec9b..127206720 100644 --- a/test/registered/unit/disaggregation/test_nixl_backend_basic.py +++ b/test/registered/unit/disaggregation/test_nixl_backend_basic.py @@ -29,7 +29,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class NotificationFakeAgent: diff --git a/test/registered/unit/disaggregation/test_nixl_deferred_kv_release.py b/test/registered/unit/disaggregation/test_nixl_deferred_kv_release.py index 752787665..251a4b407 100644 --- a/test/registered/unit/disaggregation/test_nixl_deferred_kv_release.py +++ b/test/registered/unit/disaggregation/test_nixl_deferred_kv_release.py @@ -16,7 +16,7 @@ from sglang.srt.disaggregation.nixl.conn import NixlKVManager from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _prefill_mgr(cls=CommonKVManager, enabled=True): diff --git a/test/registered/unit/disaggregation/test_nixl_sender_failure_cleanup.py b/test/registered/unit/disaggregation/test_nixl_sender_failure_cleanup.py index c3078d5a3..fd8641faf 100644 --- a/test/registered/unit/disaggregation/test_nixl_sender_failure_cleanup.py +++ b/test/registered/unit/disaggregation/test_nixl_sender_failure_cleanup.py @@ -6,7 +6,7 @@ from sglang.srt.disaggregation.base.conn import KVPoll from sglang.srt.disaggregation.nixl.conn import NixlKVSender from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestNixlSenderFailureCleanup(unittest.TestCase): diff --git a/test/registered/unit/disaggregation/test_pd_role_switch.py b/test/registered/unit/disaggregation/test_pd_role_switch.py index f3fd17ea0..a7350f090 100644 --- a/test/registered/unit/disaggregation/test_pd_role_switch.py +++ b/test/registered/unit/disaggregation/test_pd_role_switch.py @@ -15,7 +15,7 @@ from sglang.srt.managers.scheduler import Scheduler # noqa: E402 from sglang.srt.server_args import ServerArgs # noqa: E402 from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") class TestPdRoleSwitchServerArg(unittest.TestCase): diff --git a/test/registered/unit/disaggregation/test_pp_hybrid_kv_transfer.py b/test/registered/unit/disaggregation/test_pp_hybrid_kv_transfer.py index 1fd5a9417..ecf2304cf 100644 --- a/test/registered/unit/disaggregation/test_pp_hybrid_kv_transfer.py +++ b/test/registered/unit/disaggregation/test_pp_hybrid_kv_transfer.py @@ -21,7 +21,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _full_attention_ids(*, num_layers: int, interval: int) -> list: diff --git a/test/registered/unit/disaggregation/test_pp_mla_kv_transfer.py b/test/registered/unit/disaggregation/test_pp_mla_kv_transfer.py index 0c6034705..7ffbdfe87 100644 --- a/test/registered/unit/disaggregation/test_pp_mla_kv_transfer.py +++ b/test/registered/unit/disaggregation/test_pp_mla_kv_transfer.py @@ -9,7 +9,7 @@ from sglang.srt.disaggregation.nixl.conn import NixlKVManager from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") NUM_LAYERS = 78 ITEM_LEN = 576 diff --git a/test/registered/unit/disaggregation/test_prefill_abort_result_cleanup.py b/test/registered/unit/disaggregation/test_prefill_abort_result_cleanup.py index 4286a29f5..c89d34025 100644 --- a/test/registered/unit/disaggregation/test_prefill_abort_result_cleanup.py +++ b/test/registered/unit/disaggregation/test_prefill_abort_result_cleanup.py @@ -18,7 +18,7 @@ from sglang.srt.mem_cache.base_prefix_cache import ( from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _Req: diff --git a/test/registered/unit/disaggregation/test_receiver_connection_pool.py b/test/registered/unit/disaggregation/test_receiver_connection_pool.py index 9cdbcf8a2..784e79a4f 100644 --- a/test/registered/unit/disaggregation/test_receiver_connection_pool.py +++ b/test/registered/unit/disaggregation/test_receiver_connection_pool.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import threading diff --git a/test/registered/unit/disaggregation/test_register_to_bootstrap.py b/test/registered/unit/disaggregation/test_register_to_bootstrap.py index 312040e8d..7027f164f 100644 --- a/test/registered/unit/disaggregation/test_register_to_bootstrap.py +++ b/test/registered/unit/disaggregation/test_register_to_bootstrap.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/disaggregation/test_specv2_kvcache_offloading.py b/test/registered/unit/disaggregation/test_specv2_kvcache_offloading.py index 89d094418..eeb783cb2 100644 --- a/test/registered/unit/disaggregation/test_specv2_kvcache_offloading.py +++ b/test/registered/unit/disaggregation/test_specv2_kvcache_offloading.py @@ -32,7 +32,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=18, suite="base-a-test-cpu") def _make_mock_req( diff --git a/test/registered/unit/disaggregation/test_staging_draft_kv_slots.py b/test/registered/unit/disaggregation/test_staging_draft_kv_slots.py index 8350b5d54..9a435ff46 100644 --- a/test/registered/unit/disaggregation/test_staging_draft_kv_slots.py +++ b/test/registered/unit/disaggregation/test_staging_draft_kv_slots.py @@ -17,7 +17,7 @@ from sglang.srt.mem_cache.memory_pool import HybridLinearKVPool, MHATokenToKVPoo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _Pool(MHATokenToKVPool): diff --git a/test/registered/unit/disaggregation/test_unified_memory_move_gate.py b/test/registered/unit/disaggregation/test_unified_memory_move_gate.py index e50cd4ff8..4a7d9d43c 100644 --- a/test/registered/unit/disaggregation/test_unified_memory_move_gate.py +++ b/test/registered/unit/disaggregation/test_unified_memory_move_gate.py @@ -25,7 +25,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeTransferQueue: diff --git a/test/registered/unit/distributed/test_cuda_wrapper.py b/test/registered/unit/distributed/test_cuda_wrapper.py index 9546e5d1e..52e4e8fd7 100644 --- a/test/registered/unit/distributed/test_cuda_wrapper.py +++ b/test/registered/unit/distributed/test_cuda_wrapper.py @@ -4,7 +4,7 @@ import pytest from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") from sglang.srt.distributed.device_communicators import cuda_wrapper diff --git a/test/registered/unit/distributed/test_custom_all_reduce_v2_capability.py b/test/registered/unit/distributed/test_custom_all_reduce_v2_capability.py index ea790dd02..579781465 100644 --- a/test/registered/unit/distributed/test_custom_all_reduce_v2_capability.py +++ b/test/registered/unit/distributed/test_custom_all_reduce_v2_capability.py @@ -5,7 +5,7 @@ import pytest from sglang.srt.distributed.device_communicators import custom_all_reduce_v2 from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") def _patch_group(monkeypatch, *, world_size, same_node): diff --git a/test/registered/unit/distributed/test_gated_launch.py b/test/registered/unit/distributed/test_gated_launch.py index 8e583cd30..b858e9e7f 100644 --- a/test/registered/unit/distributed/test_gated_launch.py +++ b/test/registered/unit/distributed/test_gated_launch.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=34, suite="base-a-test-cpu") +register_cpu_ci(est_time=32, suite="base-a-test-cpu") import multiprocessing import threading diff --git a/test/registered/unit/distributed/test_get_default_distributed_backend.py b/test/registered/unit/distributed/test_get_default_distributed_backend.py index 8681c5dc5..fa6bf9ba2 100644 --- a/test/registered/unit/distributed/test_get_default_distributed_backend.py +++ b/test/registered/unit/distributed/test_get_default_distributed_backend.py @@ -8,7 +8,7 @@ from sglang.srt.platforms.interface import SRTPlatform from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") # Worked example: an out-of-tree platform that overrides the torch backend. diff --git a/test/registered/unit/distributed/test_parallel_state.py b/test/registered/unit/distributed/test_parallel_state.py index edb86d654..27ead4445 100644 --- a/test/registered/unit/distributed/test_parallel_state.py +++ b/test/registered/unit/distributed/test_parallel_state.py @@ -46,7 +46,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import publish_build_topology -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # Import the actual parallel_state module parallel_state = pytest.importorskip("sglang.srt.distributed.parallel_state") diff --git a/test/registered/unit/distributed/test_pp_comm_overlap.py b/test/registered/unit/distributed/test_pp_comm_overlap.py index 2243ef754..7f8873b86 100644 --- a/test/registered/unit/distributed/test_pp_comm_overlap.py +++ b/test/registered/unit/distributed/test_pp_comm_overlap.py @@ -10,7 +10,7 @@ from sglang.srt.managers.scheduler_pp_mixin import SchedulerPPMixin from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class FakeStream: diff --git a/test/registered/unit/entrypoints/anthropic/test_serving.py b/test/registered/unit/entrypoints/anthropic/test_serving.py index 96a990bcc..811b53e0a 100644 --- a/test/registered/unit/entrypoints/anthropic/test_serving.py +++ b/test/registered/unit/entrypoints/anthropic/test_serving.py @@ -24,7 +24,7 @@ from sglang.srt.parser.template_detection import ( # noqa: E402 ) from sglang.test.ci.ci_register import register_cpu_ci # noqa: E402 -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _FakeOpenAIServingChat: diff --git a/test/registered/unit/entrypoints/openai/test_audio_chunking.py b/test/registered/unit/entrypoints/openai/test_audio_chunking.py index ff87e974e..35eb3e4d9 100644 --- a/test/registered/unit/entrypoints/openai/test_audio_chunking.py +++ b/test/registered/unit/entrypoints/openai/test_audio_chunking.py @@ -24,7 +24,7 @@ from sglang.srt.entrypoints.openai.audio_chunking import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") SR = 16000 diff --git a/test/registered/unit/entrypoints/openai/test_chat_prompt_round_trip.py b/test/registered/unit/entrypoints/openai/test_chat_prompt_round_trip.py index bb398dd37..90e838d05 100644 --- a/test/registered/unit/entrypoints/openai/test_chat_prompt_round_trip.py +++ b/test/registered/unit/entrypoints/openai/test_chat_prompt_round_trip.py @@ -12,7 +12,7 @@ from types import SimpleNamespace from sglang.srt.entrypoints.openai.serving_chat import OpenAIServingChat from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") probe = OpenAIServingChat._probe_prompt_text_round_trip engine_prompt = OpenAIServingChat._engine_prompt diff --git a/test/registered/unit/entrypoints/openai/test_exa_search.py b/test/registered/unit/entrypoints/openai/test_exa_search.py index 8b7cb06b9..4bb84da5b 100644 --- a/test/registered/unit/entrypoints/openai/test_exa_search.py +++ b/test/registered/unit/entrypoints/openai/test_exa_search.py @@ -16,7 +16,7 @@ from sglang.srt.entrypoints.search.exa_client import ( from sglang.srt.entrypoints.tool import HarmonyBrowserTool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class ExaClientTestCase(unittest.TestCase): diff --git a/test/registered/unit/entrypoints/openai/test_matched_stop.py b/test/registered/unit/entrypoints/openai/test_matched_stop.py index 9e3e950e0..a33f62635 100644 --- a/test/registered/unit/entrypoints/openai/test_matched_stop.py +++ b/test/registered/unit/entrypoints/openai/test_matched_stop.py @@ -3,7 +3,7 @@ import unittest from sglang.srt.sampling.sampling_params import MAX_LEN, get_max_seq_length from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") class TestRegexPatternMaxLength(unittest.TestCase): diff --git a/test/registered/unit/entrypoints/openai/test_protocol.py b/test/registered/unit/entrypoints/openai/test_protocol.py index c580e691f..4fe89e72f 100644 --- a/test/registered/unit/entrypoints/openai/test_protocol.py +++ b/test/registered/unit/entrypoints/openai/test_protocol.py @@ -36,7 +36,7 @@ from sglang.srt.entrypoints.openai.protocol import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") class TestModelCard(unittest.TestCase): diff --git a/test/registered/unit/entrypoints/openai/test_responses_custom_tools.py b/test/registered/unit/entrypoints/openai/test_responses_custom_tools.py index da8a3116d..7d15fb524 100644 --- a/test/registered/unit/entrypoints/openai/test_responses_custom_tools.py +++ b/test/registered/unit/entrypoints/openai/test_responses_custom_tools.py @@ -24,7 +24,7 @@ from sglang.srt.entrypoints.openai.serving_responses import OpenAIServingRespons from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") CUSTOM_TOOL = { "type": "custom", diff --git a/test/registered/unit/entrypoints/openai/test_responses_protocol.py b/test/registered/unit/entrypoints/openai/test_responses_protocol.py index f186f31bb..2941c0dfe 100644 --- a/test/registered/unit/entrypoints/openai/test_responses_protocol.py +++ b/test/registered/unit/entrypoints/openai/test_responses_protocol.py @@ -12,7 +12,7 @@ from sglang.srt.entrypoints.openai.protocol import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _in_progress_response(request: ResponsesRequest) -> ResponsesResponse: diff --git a/test/registered/unit/entrypoints/openai/test_serving_chat.py b/test/registered/unit/entrypoints/openai/test_serving_chat.py index 343f16354..6a7f43c4f 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_chat.py +++ b/test/registered/unit/entrypoints/openai/test_serving_chat.py @@ -53,7 +53,7 @@ from sglang.srt.server_args import ServerArgs from sglang.srt.utils import get_or_create_event_loop from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=13, suite="base-a-test-cpu") +register_cpu_ci(est_time=64, suite="base-a-test-cpu") # Every spec resolve_chat_encoding_spec can return; pinned by the guard below. _ALL_CHAT_ENCODING_SPECS = ("dsv41", "dsv4", "dsv32", "inkling", "kimi_k3") diff --git a/test/registered/unit/entrypoints/openai/test_serving_completions.py b/test/registered/unit/entrypoints/openai/test_serving_completions.py index 2ce597b1f..ce1effc74 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_completions.py +++ b/test/registered/unit/entrypoints/openai/test_serving_completions.py @@ -24,7 +24,7 @@ from sglang.srt.server_args import ServerArgs from sglang.srt.utils import get_or_create_event_loop from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _spec_result(index): diff --git a/test/registered/unit/entrypoints/openai/test_serving_embedding.py b/test/registered/unit/entrypoints/openai/test_serving_embedding.py index 90d2f9587..ccab9a057 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_embedding.py +++ b/test/registered/unit/entrypoints/openai/test_serving_embedding.py @@ -58,7 +58,7 @@ from sglang.srt.entrypoints.openai.serving_embedding import OpenAIServingEmbeddi from sglang.srt.managers.io_struct import EmbeddingReqInput from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/entrypoints/openai/test_serving_responses.py b/test/registered/unit/entrypoints/openai/test_serving_responses.py index 9b7e425bd..b9fbb9642 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_responses.py +++ b/test/registered/unit/entrypoints/openai/test_serving_responses.py @@ -42,7 +42,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class InputMessageConstructionTestCase(CustomTestCase): diff --git a/test/registered/unit/entrypoints/openai/test_serving_responses_stream.py b/test/registered/unit/entrypoints/openai/test_serving_responses_stream.py index c9d6974cc..c2081d803 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_responses_stream.py +++ b/test/registered/unit/entrypoints/openai/test_serving_responses_stream.py @@ -22,7 +22,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class NonHarmonyStreamTestCase(CustomTestCase): diff --git a/test/registered/unit/entrypoints/openai/test_serving_transcription.py b/test/registered/unit/entrypoints/openai/test_serving_transcription.py index 531a7a078..3eb8b06c0 100644 --- a/test/registered/unit/entrypoints/openai/test_serving_transcription.py +++ b/test/registered/unit/entrypoints/openai/test_serving_transcription.py @@ -38,7 +38,7 @@ from sglang.srt.utils import get_or_create_event_loop from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _chunk(text: str, finish: str = None) -> dict: diff --git a/test/registered/unit/entrypoints/openai/test_transcription_adapters.py b/test/registered/unit/entrypoints/openai/test_transcription_adapters.py index 571f49b9d..636771197 100644 --- a/test/registered/unit/entrypoints/openai/test_transcription_adapters.py +++ b/test/registered/unit/entrypoints/openai/test_transcription_adapters.py @@ -24,7 +24,7 @@ from sglang.srt.entrypoints.openai.transcription_adapters import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") # Per-second scaling rate every speech-LM adapter uses for max_new_tokens. diff --git a/test/registered/unit/entrypoints/openai/test_whisper_adapter.py b/test/registered/unit/entrypoints/openai/test_whisper_adapter.py index 4abcedffa..3b1824df6 100644 --- a/test/registered/unit/entrypoints/openai/test_whisper_adapter.py +++ b/test/registered/unit/entrypoints/openai/test_whisper_adapter.py @@ -21,7 +21,7 @@ from sglang.srt.entrypoints.openai.transcription_adapters.whisper import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestWhisperParseFusedOutput(CustomTestCase): diff --git a/test/registered/unit/entrypoints/test_grpc_bridge.py b/test/registered/unit/entrypoints/test_grpc_bridge.py index b48abe8b9..14adf00a9 100644 --- a/test/registered/unit/entrypoints/test_grpc_bridge.py +++ b/test/registered/unit/entrypoints/test_grpc_bridge.py @@ -8,7 +8,7 @@ from sglang.srt.managers.tokenizer_manager import ServerStatus, TokenizerManager from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _ChunkStatus(enum.Enum): diff --git a/test/registered/unit/entrypoints/test_http2_server_config.py b/test/registered/unit/entrypoints/test_http2_server_config.py index 07791f3c8..6d41b3acc 100644 --- a/test/registered/unit/entrypoints/test_http2_server_config.py +++ b/test/registered/unit/entrypoints/test_http2_server_config.py @@ -5,7 +5,7 @@ from unittest.mock import patch from sglang.srt.entrypoints.http_server import _run_granian_server from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") @unittest.skipUnless( diff --git a/test/registered/unit/entrypoints/test_http_server_warmup.py b/test/registered/unit/entrypoints/test_http_server_warmup.py index bfc3a8b48..dfc209867 100644 --- a/test/registered/unit/entrypoints/test_http_server_warmup.py +++ b/test/registered/unit/entrypoints/test_http_server_warmup.py @@ -9,7 +9,7 @@ from sglang.srt.entrypoints.http_server import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestDisaggregationServerWarmup(unittest.IsolatedAsyncioTestCase): diff --git a/test/registered/unit/entrypoints/test_ready.py b/test/registered/unit/entrypoints/test_ready.py index ebe960d63..e283445ad 100644 --- a/test/registered/unit/entrypoints/test_ready.py +++ b/test/registered/unit/entrypoints/test_ready.py @@ -7,7 +7,7 @@ from sglang.srt.managers.tokenizer_manager import ServerStatus, TokenizerManager from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestReadyEndpoint(CustomTestCase): diff --git a/test/registered/unit/entrypoints/test_rust_server_dp_ports.py b/test/registered/unit/entrypoints/test_rust_server_dp_ports.py index a834d7b08..b013e56ab 100644 --- a/test/registered/unit/entrypoints/test_rust_server_dp_ports.py +++ b/test/registered/unit/entrypoints/test_rust_server_dp_ports.py @@ -9,7 +9,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.srt.rust_server import server as rust_server from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") @pytest.mark.parametrize( diff --git a/test/registered/unit/entrypoints/test_server_info.py b/test/registered/unit/entrypoints/test_server_info.py index f159dec05..412a65961 100644 --- a/test/registered/unit/entrypoints/test_server_info.py +++ b/test/registered/unit/entrypoints/test_server_info.py @@ -37,7 +37,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=13, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _CustomModelLoader: diff --git a/test/registered/unit/entrypoints/test_server_warmup.py b/test/registered/unit/entrypoints/test_server_warmup.py index 824b88198..195a296d5 100644 --- a/test/registered/unit/entrypoints/test_server_warmup.py +++ b/test/registered/unit/entrypoints/test_server_warmup.py @@ -13,7 +13,7 @@ from sglang.srt.entrypoints.http_server import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestVlmWarmupImage(CustomTestCase): diff --git a/test/registered/unit/entrypoints/test_ssl_cert_refresher.py b/test/registered/unit/entrypoints/test_ssl_cert_refresher.py index 677384848..5b8f88370 100644 --- a/test/registered/unit/entrypoints/test_ssl_cert_refresher.py +++ b/test/registered/unit/entrypoints/test_ssl_cert_refresher.py @@ -8,7 +8,7 @@ from sglang.srt.entrypoints.ssl_utils import SSLCertRefresher from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=17, suite="base-a-test-cpu") +register_cpu_ci(est_time=14, suite="base-a-test-cpu") def _make_temp_pem(content: bytes) -> str: diff --git a/test/registered/unit/entrypoints/test_v1_loads_aggregate.py b/test/registered/unit/entrypoints/test_v1_loads_aggregate.py index ad3ee9247..c89a26287 100644 --- a/test/registered/unit/entrypoints/test_v1_loads_aggregate.py +++ b/test/registered/unit/entrypoints/test_v1_loads_aggregate.py @@ -31,7 +31,7 @@ from sglang.test.test_utils import CustomTestCase, maybe_stub_sgl_kernel maybe_stub_sgl_kernel() -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _temp_path() -> str: diff --git a/test/registered/unit/eplb/test_balanced_packing.py b/test/registered/unit/eplb/test_balanced_packing.py index 2304dc82c..a909814e5 100644 --- a/test/registered/unit/eplb/test_balanced_packing.py +++ b/test/registered/unit/eplb/test_balanced_packing.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/eplb/test_compute_logical_to_rank_dispatch_physical_map.py b/test/registered/unit/eplb/test_compute_logical_to_rank_dispatch_physical_map.py index 973268ff3..9c560a302 100644 --- a/test/registered/unit/eplb/test_compute_logical_to_rank_dispatch_physical_map.py +++ b/test/registered/unit/eplb/test_compute_logical_to_rank_dispatch_physical_map.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/eplb/test_dispatch_dtype_preservation.py b/test/registered/unit/eplb/test_dispatch_dtype_preservation.py index 80c822a4d..9b730df9e 100644 --- a/test/registered/unit/eplb/test_dispatch_dtype_preservation.py +++ b/test/registered/unit/eplb/test_dispatch_dtype_preservation.py @@ -9,7 +9,7 @@ a specific dtype (int32). from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/eplb/test_waterfill_eplb.py b/test/registered/unit/eplb/test_waterfill_eplb.py index 99503d43e..7277079a2 100644 --- a/test/registered/unit/eplb/test_waterfill_eplb.py +++ b/test/registered/unit/eplb/test_waterfill_eplb.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/function_call/test_deepseekv41_detector.py b/test/registered/unit/function_call/test_deepseekv41_detector.py index a7a960d95..505b37dc9 100644 --- a/test/registered/unit/function_call/test_deepseekv41_detector.py +++ b/test/registered/unit/function_call/test_deepseekv41_detector.py @@ -21,7 +21,7 @@ from sglang.srt.parser.reasoning_parser import ReasoningParser from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") CHUNK_SIZES = [1, 2, 3, 5, 7, 11, 23, 1000] DSML = "|DSML|" diff --git a/test/registered/unit/function_call/test_dots_detector.py b/test/registered/unit/function_call/test_dots_detector.py index ef40cd177..b37218861 100644 --- a/test/registered/unit/function_call/test_dots_detector.py +++ b/test/registered/unit/function_call/test_dots_detector.py @@ -7,7 +7,7 @@ from sglang.srt.function_call.function_call_parser import FunctionCallParser from sglang.srt.parser.reasoning_parser import Qwen3Detector, ReasoningParser from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") def _tool(name: str, properties: dict) -> Tool: diff --git a/test/registered/unit/function_call/test_function_call_parser.py b/test/registered/unit/function_call/test_function_call_parser.py index 359ae726d..cab399dbb 100644 --- a/test/registered/unit/function_call/test_function_call_parser.py +++ b/test/registered/unit/function_call/test_function_call_parser.py @@ -40,7 +40,7 @@ from sglang.srt.function_call.qwen3_coder_detector import Qwen3CoderDetector from sglang.srt.function_call.utils import get_schema_properties from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_cpu_ci(est_time=70, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/function_call/test_glm47_schema_types.py b/test/registered/unit/function_call/test_glm47_schema_types.py index 8e37fc28d..6a2390541 100644 --- a/test/registered/unit/function_call/test_glm47_schema_types.py +++ b/test/registered/unit/function_call/test_glm47_schema_types.py @@ -5,7 +5,7 @@ from sglang.srt.entrypoints.openai.protocol import Function, Tool from sglang.srt.function_call.glm47_moe_detector import Glm47MoeDetector from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") class TestGlm47SchemaTypes(unittest.TestCase): diff --git a/test/registered/unit/function_call/test_hunyuan_detector.py b/test/registered/unit/function_call/test_hunyuan_detector.py index adba60d4b..340ed4129 100644 --- a/test/registered/unit/function_call/test_hunyuan_detector.py +++ b/test/registered/unit/function_call/test_hunyuan_detector.py @@ -8,7 +8,7 @@ from sglang.srt.function_call.hunyuan_detector import HunyuanDetector from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_tools(): diff --git a/test/registered/unit/function_call/test_k2_v3_detector.py b/test/registered/unit/function_call/test_k2_v3_detector.py index 85d9f61cb..31855ad25 100644 --- a/test/registered/unit/function_call/test_k2_v3_detector.py +++ b/test/registered/unit/function_call/test_k2_v3_detector.py @@ -8,7 +8,7 @@ from sglang.srt.function_call.k2_v3_detector import K2V3Detector from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def make_weather_tool() -> Tool: diff --git a/test/registered/unit/function_call/test_kimik3_structural_tag.py b/test/registered/unit/function_call/test_kimik3_structural_tag.py index 9bef313ac..fac3d67f1 100644 --- a/test/registered/unit/function_call/test_kimik3_structural_tag.py +++ b/test/registered/unit/function_call/test_kimik3_structural_tag.py @@ -28,7 +28,7 @@ from sglang.srt.function_call.kimik3_structural_tag import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") _CLOSE_TOKEN = "<|close|>" _CLOSE_TOKEN_ID = 256 diff --git a/test/registered/unit/function_call/test_minimax_m3_detector.py b/test/registered/unit/function_call/test_minimax_m3_detector.py index 0530df560..1c71151a7 100644 --- a/test/registered/unit/function_call/test_minimax_m3_detector.py +++ b/test/registered/unit/function_call/test_minimax_m3_detector.py @@ -6,7 +6,7 @@ from sglang.srt.function_call.minimax_m3 import MINIMAX_NS_TOKEN, MinimaxM3Detec from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") NS = MINIMAX_NS_TOKEN diff --git a/test/registered/unit/function_call/test_muse_glimmer_format.py b/test/registered/unit/function_call/test_muse_glimmer_format.py index 682bbb7d0..53a31bba9 100644 --- a/test/registered/unit/function_call/test_muse_glimmer_format.py +++ b/test/registered/unit/function_call/test_muse_glimmer_format.py @@ -24,7 +24,7 @@ from sglang.srt.function_call.muse_glimmer_format import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") _CHANNEL_MARKERS = (MESSAGE, EOM, EOT, START) _HELD_BACK_MARKERS = (MESSAGE, EOM, EOT, START, FUNCTION_CALLS_OPEN, INVOKE_OPEN) diff --git a/test/registered/unit/function_call/test_spark25_detector.py b/test/registered/unit/function_call/test_spark25_detector.py index 32b75da26..5a8db63de 100644 --- a/test/registered/unit/function_call/test_spark25_detector.py +++ b/test/registered/unit/function_call/test_spark25_detector.py @@ -10,7 +10,7 @@ from sglang.srt.function_call.spark25_detector import Spark25Detector from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _xml(name: str, arguments: list[tuple[str, str]]) -> str: diff --git a/test/registered/unit/hardware_backend/mlx/test_fused_swiglu.py b/test/registered/unit/hardware_backend/mlx/test_fused_swiglu.py index 798f1c0ea..32eb475c9 100644 --- a/test/registered/unit/hardware_backend/mlx/test_fused_swiglu.py +++ b/test/registered/unit/hardware_backend/mlx/test_fused_swiglu.py @@ -25,7 +25,7 @@ import pytest from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") register_mlx_ci(est_time=45, suite="stage-a-unit-test-mlx") _IS_APPLE_SILICON = platform.system() == "Darwin" and platform.machine() == "arm64" diff --git a/test/registered/unit/hardware_backend/mlx/test_mlx_quantization_override.py b/test/registered/unit/hardware_backend/mlx/test_mlx_quantization_override.py index 473464a75..6f740d25b 100644 --- a/test/registered/unit/hardware_backend/mlx/test_mlx_quantization_override.py +++ b/test/registered/unit/hardware_backend/mlx/test_mlx_quantization_override.py @@ -11,7 +11,7 @@ import unittest from sglang.srt.layers.quantization.mlx import MlxQuantizationConfig from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") register_mlx_ci(est_time=1, suite="stage-a-unit-test-mlx") diff --git a/test/registered/unit/hardware_backend/mlx/test_mlx_remote_code_gate.py b/test/registered/unit/hardware_backend/mlx/test_mlx_remote_code_gate.py index ff65e651f..53d3f1f6d 100644 --- a/test/registered/unit/hardware_backend/mlx/test_mlx_remote_code_gate.py +++ b/test/registered/unit/hardware_backend/mlx/test_mlx_remote_code_gate.py @@ -19,7 +19,7 @@ from unittest.mock import patch from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_mlx_ci(est_time=5, suite="stage-a-unit-test-mlx") _HAS_MLX = ( diff --git a/test/registered/unit/kernels/test_fused_op_dispatch.py b/test/registered/unit/kernels/test_fused_op_dispatch.py index fd18fc951..4cd18e031 100644 --- a/test/registered/unit/kernels/test_fused_op_dispatch.py +++ b/test/registered/unit/kernels/test_fused_op_dispatch.py @@ -28,7 +28,7 @@ from sglang.kernels.spec import CapabilityRequirement as Cap from sglang.kernels.spec import KernelBackend, PlatformInfo from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") _CUDA = PlatformInfo(device_type="cuda", cuda_arch_major=9, cuda_arch_minor=0) _HIP = PlatformInfo(device_type="hip") diff --git a/test/registered/unit/kernels/test_jit_cache.py b/test/registered/unit/kernels/test_jit_cache.py index d70ca0386..2ea8227de 100644 --- a/test/registered/unit/kernels/test_jit_cache.py +++ b/test/registered/unit/kernels/test_jit_cache.py @@ -19,7 +19,7 @@ from sglang.kernels.jit.utils.compile.paths import KERNEL_PATH from sglang.kernels.jit.utils.compile.spec import BuildSpec from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") @pytest.fixture(autouse=True) diff --git a/test/registered/unit/layers/attention/linear/kernels/test_kda_nvidia.py b/test/registered/unit/layers/attention/linear/kernels/test_kda_nvidia.py index ffa952a58..d7d496ab6 100644 --- a/test/registered/unit/layers/attention/linear/kernels/test_kda_nvidia.py +++ b/test/registered/unit/layers/attention/linear/kernels/test_kda_nvidia.py @@ -13,7 +13,7 @@ from sglang.srt.layers.attention.linear.kernels.kda_nvidia import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _RejectTriton: diff --git a/test/registered/unit/layers/attention/linear/kernels/test_kda_ptx.py b/test/registered/unit/layers/attention/linear/kernels/test_kda_ptx.py index 5509c7ef7..d92d51e83 100644 --- a/test/registered/unit/layers/attention/linear/kernels/test_kda_ptx.py +++ b/test/registered/unit/layers/attention/linear/kernels/test_kda_ptx.py @@ -9,7 +9,7 @@ from sglang.srt.layers.attention.linear.kernels.kda_ptx import PtxKDAKernel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class _RejectTriton: diff --git a/test/registered/unit/layers/attention/test_aiter_fp8_asm_gqa.py b/test/registered/unit/layers/attention/test_aiter_fp8_asm_gqa.py index 381313bd2..da7dd07b6 100644 --- a/test/registered/unit/layers/attention/test_aiter_fp8_asm_gqa.py +++ b/test/registered/unit/layers/attention/test_aiter_fp8_asm_gqa.py @@ -5,7 +5,7 @@ import unittest from sglang.srt.layers.attention.aiter_backend import _aiter_fp8_asm_supports_gqa from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestAiterFp8AsmSupportsGqa(unittest.TestCase): diff --git a/test/registered/unit/layers/attention/test_dots_hybrid_backend.py b/test/registered/unit/layers/attention/test_dots_hybrid_backend.py index 45ed6fe8f..0c52431a0 100644 --- a/test/registered/unit/layers/attention/test_dots_hybrid_backend.py +++ b/test/registered/unit/layers/attention/test_dots_hybrid_backend.py @@ -22,7 +22,7 @@ from sglang.srt.layers.attention.swa_mla_fallback.ops import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _batch(*, bs: int, num_tokens: int, original_bs: int | None = None): diff --git a/test/registered/unit/layers/attention/test_dsa_mqa_logits_chunking.py b/test/registered/unit/layers/attention/test_dsa_mqa_logits_chunking.py index 4d9e0a703..d2eeba8dc 100644 --- a/test/registered/unit/layers/attention/test_dsa_mqa_logits_chunking.py +++ b/test/registered/unit/layers/attention/test_dsa_mqa_logits_chunking.py @@ -19,7 +19,7 @@ from sglang.srt.layers.attention.mqa_logits_utils import ( # noqa: E402 ) from sglang.test.ci.ci_register import register_cpu_ci # noqa: E402 -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") CEILING = MQA_LOGITS_MAX_BYTES_ROCM # More than any single logits tensor here needs, so it never decides a case. diff --git a/test/registered/unit/layers/attention/test_encoder_decoder_varlen_gather.py b/test/registered/unit/layers/attention/test_encoder_decoder_varlen_gather.py index 1c0647d34..fcd58b102 100644 --- a/test/registered/unit/layers/attention/test_encoder_decoder_varlen_gather.py +++ b/test/registered/unit/layers/attention/test_encoder_decoder_varlen_gather.py @@ -22,7 +22,7 @@ with patch.dict( from sglang.srt.layers.attention import xpu_backend from sglang.srt.layers.attention.xpu_backend import XPUAttentionBackend -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestEncoderDecoderForward(unittest.TestCase): diff --git a/test/registered/unit/layers/attention/test_flashattention_graph_metadata.py b/test/registered/unit/layers/attention/test_flashattention_graph_metadata.py index ea750ff19..299a81338 100644 --- a/test/registered/unit/layers/attention/test_flashattention_graph_metadata.py +++ b/test/registered/unit/layers/attention/test_flashattention_graph_metadata.py @@ -9,7 +9,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") class TestFlashAttentionGraphMetadata(CustomTestCase): diff --git a/test/registered/unit/layers/attention/test_gdn_flashinfer_alignment.py b/test/registered/unit/layers/attention/test_gdn_flashinfer_alignment.py index 1e55579fe..8113de0df 100644 --- a/test/registered/unit/layers/attention/test_gdn_flashinfer_alignment.py +++ b/test/registered/unit/layers/attention/test_gdn_flashinfer_alignment.py @@ -8,7 +8,7 @@ from sglang.srt.layers.attention.linear.kernels.gdn_flashinfer import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") def _view_with_pointer_mod( diff --git a/test/registered/unit/layers/attention/test_gdn_prefill_backend_policy.py b/test/registered/unit/layers/attention/test_gdn_prefill_backend_policy.py index 182ee17a8..ebfc7f479 100644 --- a/test/registered/unit/layers/attention/test_gdn_prefill_backend_policy.py +++ b/test/registered/unit/layers/attention/test_gdn_prefill_backend_policy.py @@ -25,7 +25,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _publish(testcase, **fields): diff --git a/test/registered/unit/layers/attention/test_index_topk_share.py b/test/registered/unit/layers/attention/test_index_topk_share.py index f92a2bb34..34d0c1f83 100644 --- a/test/registered/unit/layers/attention/test_index_topk_share.py +++ b/test/registered/unit/layers/attention/test_index_topk_share.py @@ -8,7 +8,7 @@ from sglang.srt.layers.attention.index_topk_share import IndexTopKShareState from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _batch( diff --git a/test/registered/unit/layers/attention/test_kda_helion_dispatcher.py b/test/registered/unit/layers/attention/test_kda_helion_dispatcher.py index e9f646423..82fc95b20 100644 --- a/test/registered/unit/layers/attention/test_kda_helion_dispatcher.py +++ b/test/registered/unit/layers/attention/test_kda_helion_dispatcher.py @@ -12,7 +12,7 @@ from sglang.srt.runtime_context import override_platform from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestHelionKDADispatcher(unittest.TestCase): diff --git a/test/registered/unit/layers/attention/test_kv_shard_hooks.py b/test/registered/unit/layers/attention/test_kv_shard_hooks.py index f1ba77775..2ea192798 100644 --- a/test/registered/unit/layers/attention/test_kv_shard_hooks.py +++ b/test/registered/unit/layers/attention/test_kv_shard_hooks.py @@ -26,7 +26,7 @@ from sglang.srt.mem_cache.page_interleave_pool import PageInterleaveKVPoolMixin from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _RecordingPool(PageInterleaveKVPoolMixin): diff --git a/test/registered/unit/layers/attention/test_kv_translate_ownership.py b/test/registered/unit/layers/attention/test_kv_translate_ownership.py index 45ef31149..d870924d0 100644 --- a/test/registered/unit/layers/attention/test_kv_translate_ownership.py +++ b/test/registered/unit/layers/attention/test_kv_translate_ownership.py @@ -37,7 +37,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") # The attention package is a namespace package (no __init__), so anchor the # scan on a concrete module inside it. diff --git a/test/registered/unit/layers/attention/test_linear_attn_config.py b/test/registered/unit/layers/attention/test_linear_attn_config.py index 57eb734de..3a95e3bdc 100644 --- a/test/registered/unit/layers/attention/test_linear_attn_config.py +++ b/test/registered/unit/layers/attention/test_linear_attn_config.py @@ -25,7 +25,7 @@ from sglang.srt.layers.attention.linear.utils import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _Runner: diff --git a/test/registered/unit/layers/attention/test_mamba_track_state_dtype.py b/test/registered/unit/layers/attention/test_mamba_track_state_dtype.py index 879fe1df1..b522f86ad 100644 --- a/test/registered/unit/layers/attention/test_mamba_track_state_dtype.py +++ b/test/registered/unit/layers/attention/test_mamba_track_state_dtype.py @@ -9,7 +9,7 @@ from sglang.srt.layers.attention.mamba.mamba2_metadata import ForwardMetadata from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # Above the fp16 midpoint 1 + 2^-11 (single-rounds up to 1 + 2^-10) but below # the bf16 midpoint 1 + 2^-8 (rounds to 1.0, which then stays 1.0 in fp16): diff --git a/test/registered/unit/layers/attention/test_mla_decode_geometry.py b/test/registered/unit/layers/attention/test_mla_decode_geometry.py index b76f95d6b..6d895e7d1 100644 --- a/test/registered/unit/layers/attention/test_mla_decode_geometry.py +++ b/test/registered/unit/layers/attention/test_mla_decode_geometry.py @@ -45,7 +45,7 @@ from sglang.srt.environ import envs from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") # gfx950 full-GPU. Passed in rather than read from the device so this stays a CPU test. CORE_COUNT = 256 diff --git a/test/registered/unit/layers/attention/test_triton_verify_metadata.py b/test/registered/unit/layers/attention/test_triton_verify_metadata.py index fc3a46b86..6a3e0aeeb 100644 --- a/test/registered/unit/layers/attention/test_triton_verify_metadata.py +++ b/test/registered/unit/layers/attention/test_triton_verify_metadata.py @@ -13,7 +13,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.srt.speculative.spec_info import SpecInput, SpecInputType from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _BonusTokenVerifyInput(SpecInput): diff --git a/test/registered/unit/layers/attention/test_verify_mask.py b/test/registered/unit/layers/attention/test_verify_mask.py index ac8a21b0f..356938f4d 100644 --- a/test/registered/unit/layers/attention/test_verify_mask.py +++ b/test/registered/unit/layers/attention/test_verify_mask.py @@ -15,7 +15,7 @@ from sglang.srt.speculative.eagle_utils import TreeMaskMode, default_tree_mask_m from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _MAX_BS = 4 _DRAFT = 3 diff --git a/test/registered/unit/layers/attention/test_vision_backend_selection.py b/test/registered/unit/layers/attention/test_vision_backend_selection.py index 3a91eaed8..f0e48989c 100644 --- a/test/registered/unit/layers/attention/test_vision_backend_selection.py +++ b/test/registered/unit/layers/attention/test_vision_backend_selection.py @@ -10,7 +10,7 @@ from einops import rearrange from sglang.srt.layers.attention import vision from sglang.test.ci.ci_register import register_cpu_ci, register_npu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") register_npu_ci(est_time=2, suite="base-b-test-1-npu-a3") register_npu_ci(est_time=2, suite="nightly-1-npu-a3", nightly=True) diff --git a/test/registered/unit/layers/attention/test_vision_max_seqlen.py b/test/registered/unit/layers/attention/test_vision_max_seqlen.py index 4b9449182..462b67cbc 100644 --- a/test/registered/unit/layers/attention/test_vision_max_seqlen.py +++ b/test/registered/unit/layers/attention/test_vision_max_seqlen.py @@ -9,7 +9,7 @@ from sglang.srt.models import kimi_k25 from sglang.srt.models.kimi_k25 import MoonViT3dEncoder, MoonViTEncoderLayer from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def test_vision_flash3_uses_precomputed_max_seqlen(monkeypatch): diff --git a/test/registered/unit/layers/attention/test_vision_seqlens.py b/test/registered/unit/layers/attention/test_vision_seqlens.py index 7187622d7..1cc7c6c35 100644 --- a/test/registered/unit/layers/attention/test_vision_seqlens.py +++ b/test/registered/unit/layers/attention/test_vision_seqlens.py @@ -4,7 +4,7 @@ import torch from sglang.srt.layers.attention.vision import SingletonCache, resolve_max_seqlen from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def test_resolve_max_seqlen_accepts_raw_tensor_without_attribute_cache(): diff --git a/test/registered/unit/layers/attention/test_vision_strided_qkv.py b/test/registered/unit/layers/attention/test_vision_strided_qkv.py index 666d8d6a6..c2b309f2d 100644 --- a/test/registered/unit/layers/attention/test_vision_strided_qkv.py +++ b/test/registered/unit/layers/attention/test_vision_strided_qkv.py @@ -18,7 +18,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import publish_build_topology -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") EMBED_DIM = 32 NUM_HEADS = 4 diff --git a/test/registered/unit/layers/moe/test_copy_weight_views_before_h2d.py b/test/registered/unit/layers/moe/test_copy_weight_views_before_h2d.py index 532c0778f..83c244262 100644 --- a/test/registered/unit/layers/moe/test_copy_weight_views_before_h2d.py +++ b/test/registered/unit/layers/moe/test_copy_weight_views_before_h2d.py @@ -5,7 +5,7 @@ from sglang.srt.layers.moe.fused_moe_triton.layer import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _assert_independent_copy(source: torch.Tensor, result: torch.Tensor) -> None: diff --git a/test/registered/unit/layers/moe/test_deepep_v2_buffer_lifecycle.py b/test/registered/unit/layers/moe/test_deepep_v2_buffer_lifecycle.py index b1ae19e53..33a181b7c 100644 --- a/test/registered/unit/layers/moe/test_deepep_v2_buffer_lifecycle.py +++ b/test/registered/unit/layers/moe/test_deepep_v2_buffer_lifecycle.py @@ -10,7 +10,7 @@ from sglang.srt.runtime_context import get_resources, reset_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class _FakeGroup: diff --git a/test/registered/unit/layers/moe/test_deepep_v2_masked_slab.py b/test/registered/unit/layers/moe/test_deepep_v2_masked_slab.py index 61ed8ac97..50f11b5ae 100644 --- a/test/registered/unit/layers/moe/test_deepep_v2_masked_slab.py +++ b/test/registered/unit/layers/moe/test_deepep_v2_masked_slab.py @@ -12,7 +12,7 @@ from sglang.kernels.ops.moe.ep_moe_kernels import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-large") DEVICE = "cuda" diff --git a/test/registered/unit/layers/moe/test_deepep_v2_wire_dtype.py b/test/registered/unit/layers/moe/test_deepep_v2_wire_dtype.py index 47a0636b2..df90d95ff 100644 --- a/test/registered/unit/layers/moe/test_deepep_v2_wire_dtype.py +++ b/test/registered/unit/layers/moe/test_deepep_v2_wire_dtype.py @@ -16,7 +16,7 @@ from sglang.srt.runtime_context import get_context, get_exec, reset_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") HIDDEN = 256 TOPK = 4 diff --git a/test/registered/unit/layers/moe/test_flashinfer_dispatcher.py b/test/registered/unit/layers/moe/test_flashinfer_dispatcher.py index e45b00b32..451245170 100644 --- a/test/registered/unit/layers/moe/test_flashinfer_dispatcher.py +++ b/test/registered/unit/layers/moe/test_flashinfer_dispatcher.py @@ -8,7 +8,7 @@ from sglang.srt.layers.moe.topk import StandardTopKOutput from sglang.srt.layers.moe.utils import FlashinferA2ADispatchType from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def test_empty_mxfp8_dispatch_uses_same_payload_dtype_as_nonempty_rank(): diff --git a/test/registered/unit/layers/moe/test_flashinfer_megamoe.py b/test/registered/unit/layers/moe/test_flashinfer_megamoe.py index cd73104ed..877fddb98 100644 --- a/test/registered/unit/layers/moe/test_flashinfer_megamoe.py +++ b/test/registered/unit/layers/moe/test_flashinfer_megamoe.py @@ -7,7 +7,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") def _load_megamoe_module(monkeypatch): diff --git a/test/registered/unit/layers/moe/test_fused_moe_common_utils.py b/test/registered/unit/layers/moe/test_fused_moe_common_utils.py index 4fe9962da..1d7c0e282 100644 --- a/test/registered/unit/layers/moe/test_fused_moe_common_utils.py +++ b/test/registered/unit/layers/moe/test_fused_moe_common_utils.py @@ -7,7 +7,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _load_common_utils(): diff --git a/test/registered/unit/layers/moe/test_fused_moe_native.py b/test/registered/unit/layers/moe/test_fused_moe_native.py index 90d74c235..8ccfc2f31 100644 --- a/test/registered/unit/layers/moe/test_fused_moe_native.py +++ b/test/registered/unit/layers/moe/test_fused_moe_native.py @@ -7,7 +7,7 @@ from sglang.srt.layers.moe.fused_moe_native import moe_forward_native from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestFusedMoeNative(CustomTestCase): diff --git a/test/registered/unit/layers/moe/test_fused_moe_triton_config.py b/test/registered/unit/layers/moe/test_fused_moe_triton_config.py index 7b35c4aac..2307ee5a2 100644 --- a/test/registered/unit/layers/moe/test_fused_moe_triton_config.py +++ b/test/registered/unit/layers/moe/test_fused_moe_triton_config.py @@ -4,7 +4,7 @@ from pathlib import Path from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") from sglang.srt.layers.moe.moe_runner.triton_utils import fused_moe_triton_config diff --git a/test/registered/unit/layers/moe/test_fused_shared_expert_scaling.py b/test/registered/unit/layers/moe/test_fused_shared_expert_scaling.py index 4f3945e52..233dbee81 100644 --- a/test/registered/unit/layers/moe/test_fused_shared_expert_scaling.py +++ b/test/registered/unit/layers/moe/test_fused_shared_expert_scaling.py @@ -15,7 +15,7 @@ These tests pin the fused shared expert's topk weight contract on three paths: from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/layers/moe/test_topk_correction_bias_cache.py b/test/registered/unit/layers/moe/test_topk_correction_bias_cache.py index e1d282cbc..465fe8309 100644 --- a/test/registered/unit/layers/moe/test_topk_correction_bias_cache.py +++ b/test/registered/unit/layers/moe/test_topk_correction_bias_cache.py @@ -10,8 +10,8 @@ from sglang.test.ci.ci_register import ( ) from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") -register_cuda_ci(est_time=10, stage="base-a", runner_config="1-gpu-small") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cuda_ci(est_time=9, stage="base-a", runner_config="1-gpu-small") register_amd_ci(est_time=5, stage="stage-a", runner_config="1-gpu-small-amd") diff --git a/test/registered/unit/layers/moe/test_w4afp8_deepep_dtype.py b/test/registered/unit/layers/moe/test_w4afp8_deepep_dtype.py index 4d28beb4c..fb74beaee 100644 --- a/test/registered/unit/layers/moe/test_w4afp8_deepep_dtype.py +++ b/test/registered/unit/layers/moe/test_w4afp8_deepep_dtype.py @@ -17,7 +17,7 @@ from sglang.srt.layers.quantization import w4afp8 from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestW4AFP8DeepEPDispatcherDtype(CustomTestCase): diff --git a/test/registered/unit/layers/moe/test_w4afp8_deepep_post_reorder.py b/test/registered/unit/layers/moe/test_w4afp8_deepep_post_reorder.py index 1a5414c91..d8c3e4256 100644 --- a/test/registered/unit/layers/moe/test_w4afp8_deepep_post_reorder.py +++ b/test/registered/unit/layers/moe/test_w4afp8_deepep_post_reorder.py @@ -10,7 +10,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") # The function under test is a GPU implementation, but this test replaces every # launched kernel and only verifies the host-side call contract. Stub the diff --git a/test/registered/unit/layers/moe/test_w4afp8_requant_geometry.py b/test/registered/unit/layers/moe/test_w4afp8_requant_geometry.py index 952ff9bef..c6c60f031 100644 --- a/test/registered/unit/layers/moe/test_w4afp8_requant_geometry.py +++ b/test/registered/unit/layers/moe/test_w4afp8_requant_geometry.py @@ -6,7 +6,7 @@ from sglang.kernels.ops.moe.ep_moe_kernels import requant_launch_geometry from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") DSV3_GROUPS = 7168 // 128 # 56 K3_GROUPS = 3584 // 128 # 28 diff --git a/test/registered/unit/layers/quantization/test_bf16_splitk_gemm.py b/test/registered/unit/layers/quantization/test_bf16_splitk_gemm.py index 5e663cc0d..637041ae0 100644 --- a/test/registered/unit/layers/quantization/test_bf16_splitk_gemm.py +++ b/test/registered/unit/layers/quantization/test_bf16_splitk_gemm.py @@ -8,7 +8,7 @@ from sglang.srt.layers.quantization.unquant import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") @pytest.mark.parametrize("m", [0, 33, 64]) diff --git a/test/registered/unit/layers/quantization/test_compressed_tensors_kv_cache.py b/test/registered/unit/layers/quantization/test_compressed_tensors_kv_cache.py index 54c6dbb89..c6dd3ad62 100644 --- a/test/registered/unit/layers/quantization/test_compressed_tensors_kv_cache.py +++ b/test/registered/unit/layers/quantization/test_compressed_tensors_kv_cache.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/layers/quantization/test_compressed_tensors_lm_head.py b/test/registered/unit/layers/quantization/test_compressed_tensors_lm_head.py index 78bd0dc6f..120770439 100644 --- a/test/registered/unit/layers/quantization/test_compressed_tensors_lm_head.py +++ b/test/registered/unit/layers/quantization/test_compressed_tensors_lm_head.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest from unittest.mock import patch diff --git a/test/registered/unit/layers/quantization/test_compressed_tensors_mixed_precision.py b/test/registered/unit/layers/quantization/test_compressed_tensors_mixed_precision.py index 8cc3d347a..de5ac9bf5 100644 --- a/test/registered/unit/layers/quantization/test_compressed_tensors_mixed_precision.py +++ b/test/registered/unit/layers/quantization/test_compressed_tensors_mixed_precision.py @@ -9,7 +9,7 @@ for every group. Both are config-parsing paths, so these tests run on CPU. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest from unittest import mock diff --git a/test/registered/unit/layers/quantization/test_compressed_tensors_wna16_moe_no_linear.py b/test/registered/unit/layers/quantization/test_compressed_tensors_wna16_moe_no_linear.py index ebd356fdf..64d4d58bb 100644 --- a/test/registered/unit/layers/quantization/test_compressed_tensors_wna16_moe_no_linear.py +++ b/test/registered/unit/layers/quantization/test_compressed_tensors_wna16_moe_no_linear.py @@ -16,7 +16,7 @@ from sglang.srt.runtime_context import override_platform from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _WNA16_MOE_SCHEMES = (CompressedTensorsWNA16MoE, CompressedTensorsWNA16TritonMoE) EXPERTS_LAYER = "model.layers.0.mlp.experts" diff --git a/test/registered/unit/layers/quantization/test_deepgemm_ue8m0_requant.py b/test/registered/unit/layers/quantization/test_deepgemm_ue8m0_requant.py index ddc039fcd..998553489 100644 --- a/test/registered/unit/layers/quantization/test_deepgemm_ue8m0_requant.py +++ b/test/registered/unit/layers/quantization/test_deepgemm_ue8m0_requant.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest from unittest.mock import call, patch diff --git a/test/registered/unit/layers/quantization/test_flashinfer_trtllm_fp8_fallback.py b/test/registered/unit/layers/quantization/test_flashinfer_trtllm_fp8_fallback.py index 2ad08d33f..40d5f92d1 100644 --- a/test/registered/unit/layers/quantization/test_flashinfer_trtllm_fp8_fallback.py +++ b/test/registered/unit/layers/quantization/test_flashinfer_trtllm_fp8_fallback.py @@ -20,7 +20,7 @@ backend selector and the two GEMM implementations so they run on CPU CI. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import functools import unittest diff --git a/test/registered/unit/layers/quantization/test_fp4_kv_cache_quant_method.py b/test/registered/unit/layers/quantization/test_fp4_kv_cache_quant_method.py index a70bf545f..b500d0625 100644 --- a/test/registered/unit/layers/quantization/test_fp4_kv_cache_quant_method.py +++ b/test/registered/unit/layers/quantization/test_fp4_kv_cache_quant_method.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=35, suite="base-a-test-cpu") +register_cpu_ci(est_time=31, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/layers/quantization/test_fp8_blockwise_linear_backends.py b/test/registered/unit/layers/quantization/test_fp8_blockwise_linear_backends.py index 1d7dc9850..a1393f4cf 100644 --- a/test/registered/unit/layers/quantization/test_fp8_blockwise_linear_backends.py +++ b/test/registered/unit/layers/quantization/test_fp8_blockwise_linear_backends.py @@ -27,8 +27,8 @@ from sglang.test.layer_ut_utils import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=15, stage="base-b", runner_config="4-gpu-b200") -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=114, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=54, stage="base-b", runner_config="1-gpu-small") register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") FP8_MAX = 448.0 diff --git a/test/registered/unit/layers/quantization/test_fp8_moe_runner_fallback.py b/test/registered/unit/layers/quantization/test_fp8_moe_runner_fallback.py index 4b3927e32..e0c76d430 100644 --- a/test/registered/unit/layers/quantization/test_fp8_moe_runner_fallback.py +++ b/test/registered/unit/layers/quantization/test_fp8_moe_runner_fallback.py @@ -3,7 +3,7 @@ flashinfer_cutlass or flashinfer_cutedsl, which have no fp8 MoE path.""" from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest from unittest.mock import patch diff --git a/test/registered/unit/layers/quantization/test_fp8_moe_runner_ownership.py b/test/registered/unit/layers/quantization/test_fp8_moe_runner_ownership.py index 55f679941..bc52b127f 100644 --- a/test/registered/unit/layers/quantization/test_fp8_moe_runner_ownership.py +++ b/test/registered/unit/layers/quantization/test_fp8_moe_runner_ownership.py @@ -24,7 +24,7 @@ from sglang.srt.runtime_context import get_flags from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") _ACTIVATION_PARAMS = ("gemm1_alpha", "gemm1_beta", "gemm1_clamp_limit") diff --git a/test/registered/unit/layers/quantization/test_fp8_moe_weight_gating.py b/test/registered/unit/layers/quantization/test_fp8_moe_weight_gating.py index 85f4bb1ce..c8fbdf171 100644 --- a/test/registered/unit/layers/quantization/test_fp8_moe_weight_gating.py +++ b/test/registered/unit/layers/quantization/test_fp8_moe_weight_gating.py @@ -9,7 +9,7 @@ follow the same shard count, or the two describe different tensors. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest from unittest.mock import MagicMock, patch diff --git a/test/registered/unit/layers/quantization/test_fp8_utils_mxfp4.py b/test/registered/unit/layers/quantization/test_fp8_utils_mxfp4.py index 21bd427e2..133941e12 100644 --- a/test/registered/unit/layers/quantization/test_fp8_utils_mxfp4.py +++ b/test/registered/unit/layers/quantization/test_fp8_utils_mxfp4.py @@ -11,7 +11,7 @@ from sglang.srt.layers.quantization.fp8_utils import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestFp8UtilsMxfp4(CustomTestCase): diff --git a/test/registered/unit/layers/quantization/test_humming_w4afp8_schemas.py b/test/registered/unit/layers/quantization/test_humming_w4afp8_schemas.py index 40cdc9747..b11559a5d 100644 --- a/test/registered/unit/layers/quantization/test_humming_w4afp8_schemas.py +++ b/test/registered/unit/layers/quantization/test_humming_w4afp8_schemas.py @@ -19,7 +19,7 @@ from sglang.srt.layers.quantization.humming import ( # noqa: E402 _W4AFp8CheckpointWeightSchema, ) -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestW4AFp8CheckpointSchema(CustomTestCase): diff --git a/test/registered/unit/layers/quantization/test_marlin_utils_fp8.py b/test/registered/unit/layers/quantization/test_marlin_utils_fp8.py index ae095060b..7649387bf 100644 --- a/test/registered/unit/layers/quantization/test_marlin_utils_fp8.py +++ b/test/registered/unit/layers/quantization/test_marlin_utils_fp8.py @@ -9,7 +9,7 @@ from sglang.srt.layers.quantization import marlin_utils_fp8 from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestFp8MarlinBias(CustomTestCase): diff --git a/test/registered/unit/layers/quantization/test_modelopt_nvfp4.py b/test/registered/unit/layers/quantization/test_modelopt_nvfp4.py index 8aeed7ae5..68a1878dc 100644 --- a/test/registered/unit/layers/quantization/test_modelopt_nvfp4.py +++ b/test/registered/unit/layers/quantization/test_modelopt_nvfp4.py @@ -14,7 +14,7 @@ from sglang.srt.model_loader.weight_utils import default_weight_loader from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestModelOptNvfp4(CustomTestCase): diff --git a/test/registered/unit/layers/quantization/test_modelopt_nvfp4_moe_dispatch.py b/test/registered/unit/layers/quantization/test_modelopt_nvfp4_moe_dispatch.py index e14477155..2ff18c77e 100644 --- a/test/registered/unit/layers/quantization/test_modelopt_nvfp4_moe_dispatch.py +++ b/test/registered/unit/layers/quantization/test_modelopt_nvfp4_moe_dispatch.py @@ -12,7 +12,7 @@ tensors, so the tests stay on CPU; the kernels are covered on-device. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest from contextlib import contextmanager diff --git a/test/registered/unit/layers/quantization/test_modelopt_nvfp4_moe_scales.py b/test/registered/unit/layers/quantization/test_modelopt_nvfp4_moe_scales.py index 4ebb9f5fe..5b694ede8 100644 --- a/test/registered/unit/layers/quantization/test_modelopt_nvfp4_moe_scales.py +++ b/test/registered/unit/layers/quantization/test_modelopt_nvfp4_moe_scales.py @@ -18,7 +18,7 @@ sizes, so a failure looks like one a real checkpoint would hit. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/layers/quantization/test_mxfp4_flashinfer_activation_prep.py b/test/registered/unit/layers/quantization/test_mxfp4_flashinfer_activation_prep.py index 37b2b1fc8..c749956d6 100644 --- a/test/registered/unit/layers/quantization/test_mxfp4_flashinfer_activation_prep.py +++ b/test/registered/unit/layers/quantization/test_mxfp4_flashinfer_activation_prep.py @@ -12,7 +12,7 @@ from sglang.srt.layers.quantization.mxfp4 import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") per_token_group_quant_module = importlib.import_module( "sglang.kernels.ops.quantization.per_token_group_quant" diff --git a/test/registered/unit/layers/quantization/test_mxfp4_sm100_trtllm_gen.py b/test/registered/unit/layers/quantization/test_mxfp4_sm100_trtllm_gen.py index 60e8f4e36..2731f5007 100644 --- a/test/registered/unit/layers/quantization/test_mxfp4_sm100_trtllm_gen.py +++ b/test/registered/unit/layers/quantization/test_mxfp4_sm100_trtllm_gen.py @@ -20,7 +20,7 @@ from flashinfer import trtllm_fp4_block_scale_moe from sglang.srt.utils import is_sm100_supported from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=120, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") if not is_sm100_supported(): pytest.skip( diff --git a/test/registered/unit/layers/quantization/test_mxfp4_sm120_cutlass.py b/test/registered/unit/layers/quantization/test_mxfp4_sm120_cutlass.py index e358e2411..f9772970e 100644 --- a/test/registered/unit/layers/quantization/test_mxfp4_sm120_cutlass.py +++ b/test/registered/unit/layers/quantization/test_mxfp4_sm120_cutlass.py @@ -14,7 +14,7 @@ import torch from sglang.srt.runtime_context import override_platform from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") @pytest.fixture diff --git a/test/registered/unit/layers/quantization/test_mxfp4_sm90_cutlass.py b/test/registered/unit/layers/quantization/test_mxfp4_sm90_cutlass.py index 62696f011..a58773137 100644 --- a/test/registered/unit/layers/quantization/test_mxfp4_sm90_cutlass.py +++ b/test/registered/unit/layers/quantization/test_mxfp4_sm90_cutlass.py @@ -20,7 +20,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-large") flashinfer_fused_moe = pytest.importorskip("flashinfer.fused_moe") diff --git a/test/registered/unit/layers/quantization/test_nvfp4_linear_backends.py b/test/registered/unit/layers/quantization/test_nvfp4_linear_backends.py index 484603e14..5523509c1 100644 --- a/test/registered/unit/layers/quantization/test_nvfp4_linear_backends.py +++ b/test/registered/unit/layers/quantization/test_nvfp4_linear_backends.py @@ -30,7 +30,7 @@ from sglang.test.quant_ref_utils import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=11, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=10, stage="base-b", runner_config="4-gpu-b200") # (M, N, K). The second shape hits the padding paths: N=160 is not a multiple # of 128 (TRTLLM shuffle pad) and K=336 is neither a multiple of 32 (CUTLASS diff --git a/test/registered/unit/layers/quantization/test_nvfp4_moe_backends.py b/test/registered/unit/layers/quantization/test_nvfp4_moe_backends.py index 8ba5f246b..77eb67afa 100644 --- a/test/registered/unit/layers/quantization/test_nvfp4_moe_backends.py +++ b/test/registered/unit/layers/quantization/test_nvfp4_moe_backends.py @@ -23,7 +23,7 @@ from sglang.test.quant_ref_utils import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=14, stage="base-b", runner_config="4-gpu-b200") +register_cuda_ci(est_time=13, stage="base-b", runner_config="4-gpu-b200") E, H, I, TOPK, M = 8, 1024, 1024, 2, 32 diff --git a/test/registered/unit/layers/quantization/test_quark_config.py b/test/registered/unit/layers/quantization/test_quark_config.py index 42981a123..1954a99db 100644 --- a/test/registered/unit/layers/quantization/test_quark_config.py +++ b/test/registered/unit/layers/quantization/test_quark_config.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import sys import types diff --git a/test/registered/unit/layers/quantization/test_quark_utils.py b/test/registered/unit/layers/quantization/test_quark_utils.py index b8dab0d4c..8aa42c0dd 100644 --- a/test/registered/unit/layers/quantization/test_quark_utils.py +++ b/test/registered/unit/layers/quantization/test_quark_utils.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/layers/quantization/test_unquant_apply_with_addend.py b/test/registered/unit/layers/quantization/test_unquant_apply_with_addend.py index 9651d663a..f3721e338 100644 --- a/test/registered/unit/layers/quantization/test_unquant_apply_with_addend.py +++ b/test/registered/unit/layers/quantization/test_unquant_apply_with_addend.py @@ -8,7 +8,7 @@ and leave the caller's buffer intact. from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") import unittest from contextlib import ExitStack diff --git a/test/registered/unit/layers/test_attn_residual.py b/test/registered/unit/layers/test_attn_residual.py index ec09cff93..594060b71 100644 --- a/test/registered/unit/layers/test_attn_residual.py +++ b/test/registered/unit/layers/test_attn_residual.py @@ -3,7 +3,7 @@ import unittest from sglang.srt.layers.attn_residual import _supports_attn_res_tma from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") class TestAttnResidual(unittest.TestCase): diff --git a/test/registered/unit/layers/test_bailing_mrope_shape.py b/test/registered/unit/layers/test_bailing_mrope_shape.py index 862dd5a7a..352045834 100644 --- a/test/registered/unit/layers/test_bailing_mrope_shape.py +++ b/test/registered/unit/layers/test_bailing_mrope_shape.py @@ -11,7 +11,7 @@ from sglang.srt.layers.rotary_embedding.bailing_mrope import BailingMRotaryEmbed from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _position_config(max_position_embeddings=131072): diff --git a/test/registered/unit/layers/test_conv_layer.py b/test/registered/unit/layers/test_conv_layer.py index 7b5114dd5..126595ae8 100644 --- a/test/registered/unit/layers/test_conv_layer.py +++ b/test/registered/unit/layers/test_conv_layer.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/layers/test_dsv41_candidate_blocks.py b/test/registered/unit/layers/test_dsv41_candidate_blocks.py index 79915cf5c..bbfe89c58 100644 --- a/test/registered/unit/layers/test_dsv41_candidate_blocks.py +++ b/test/registered/unit/layers/test_dsv41_candidate_blocks.py @@ -11,7 +11,7 @@ from sglang.srt.layers.attention.dsv4.candidate_indexer import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestPrefillCandidateBlocks(CustomTestCase): diff --git a/test/registered/unit/layers/test_dsv4_kv_splits_heuristic.py b/test/registered/unit/layers/test_dsv4_kv_splits_heuristic.py index 9f0d5dad5..79997eaf6 100644 --- a/test/registered/unit/layers/test_dsv4_kv_splits_heuristic.py +++ b/test/registered/unit/layers/test_dsv4_kv_splits_heuristic.py @@ -21,7 +21,7 @@ from sglang.kernels.ops.attention.dsv4.unified_kv_kernels.paged_decode import ( ) from sglang.test.ci.ci_register import register_cpu_ci # noqa: E402 -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") # MI355X. Passed explicitly so the tests are device-independent and run on CPU. NUM_CU = 256 diff --git a/test/registered/unit/layers/test_dsv4_nonpaged_indexer.py b/test/registered/unit/layers/test_dsv4_nonpaged_indexer.py index ad06b05e8..0bd7fdf5a 100644 --- a/test/registered/unit/layers/test_dsv4_nonpaged_indexer.py +++ b/test/registered/unit/layers/test_dsv4_nonpaged_indexer.py @@ -31,7 +31,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=17, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _INDEXER = "sglang.srt.layers.attention.dsv4.indexer" _METADATA = "sglang.srt.layers.attention.dsv4.metadata" diff --git a/test/registered/unit/layers/test_flashattention_paged_mha.py b/test/registered/unit/layers/test_flashattention_paged_mha.py index 7a1799be5..1d437bfcb 100644 --- a/test/registered/unit/layers/test_flashattention_paged_mha.py +++ b/test/registered/unit/layers/test_flashattention_paged_mha.py @@ -22,7 +22,7 @@ with patch.dict( FlashAttentionBackend, ) -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _backend(): diff --git a/test/registered/unit/layers/test_flashinfer_comm_fusion.py b/test/registered/unit/layers/test_flashinfer_comm_fusion.py index ac9189a09..a32b3b437 100644 --- a/test/registered/unit/layers/test_flashinfer_comm_fusion.py +++ b/test/registered/unit/layers/test_flashinfer_comm_fusion.py @@ -11,7 +11,7 @@ from sglang.test.test_utils import CustomTestCase # Collectives are mocked and world_size is a plain int, so the world_size=4 # cases need one real CUDA device. -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") class _FakeWorkspace: diff --git a/test/registered/unit/layers/test_fp8_bpreshuffle_scale.py b/test/registered/unit/layers/test_fp8_bpreshuffle_scale.py index c94e6a4ff..2602c1075 100644 --- a/test/registered/unit/layers/test_fp8_bpreshuffle_scale.py +++ b/test/registered/unit/layers/test_fp8_bpreshuffle_scale.py @@ -13,7 +13,7 @@ from sglang.srt.layers.quantization.fp8_utils import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _simulate_transpose_scale_emit(values: torch.Tensor) -> torch.Tensor: diff --git a/test/registered/unit/layers/test_gdn_mis_metadata.py b/test/registered/unit/layers/test_gdn_mis_metadata.py index 653de57b1..61c5366d1 100644 --- a/test/registered/unit/layers/test_gdn_mis_metadata.py +++ b/test/registered/unit/layers/test_gdn_mis_metadata.py @@ -7,7 +7,7 @@ from sglang.srt.layers.attention.linear.gdn_backend import build_gdn_mis_metadat from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestGDNMISMetadata(CustomTestCase): diff --git a/test/registered/unit/layers/test_kda_decode_mtp_slot_stride.py b/test/registered/unit/layers/test_kda_decode_mtp_slot_stride.py index 3e2899e9c..296954df6 100644 --- a/test/registered/unit/layers/test_kda_decode_mtp_slot_stride.py +++ b/test/registered/unit/layers/test_kda_decode_mtp_slot_stride.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=5, stage="base-b", runner_config="1-gpu-small") import importlib.util import unittest diff --git a/test/registered/unit/layers/test_kpool_planner_cpu_mirror.py b/test/registered/unit/layers/test_kpool_planner_cpu_mirror.py index 2cf449750..b3960c461 100644 --- a/test/registered/unit/layers/test_kpool_planner_cpu_mirror.py +++ b/test/registered/unit/layers/test_kpool_planner_cpu_mirror.py @@ -11,7 +11,7 @@ from sglang.srt.layers.attention.dsa import kpool_plan from sglang.srt.layers.attention.dsa.dsa_topk_backend import TopkTransformMethod from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") class _NoDeviceReadTensor(torch.Tensor): diff --git a/test/registered/unit/layers/test_kpool_stream_scheduling.py b/test/registered/unit/layers/test_kpool_stream_scheduling.py index f43c5e6a4..dedf0eaba 100644 --- a/test/registered/unit/layers/test_kpool_stream_scheduling.py +++ b/test/registered/unit/layers/test_kpool_stream_scheduling.py @@ -14,7 +14,7 @@ from sglang.srt.layers.attention.dsa.dsa_indexer_kpool import IndexerKPool from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _eager(method): diff --git a/test/registered/unit/layers/test_layer_communicator_fusion_gate.py b/test/registered/unit/layers/test_layer_communicator_fusion_gate.py index ab00930d8..4647c6d9c 100644 --- a/test/registered/unit/layers/test_layer_communicator_fusion_gate.py +++ b/test/registered/unit/layers/test_layer_communicator_fusion_gate.py @@ -17,7 +17,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _fake_communicator(mlp_mode=ScatterMode.TP_ATTN_FULL): diff --git a/test/registered/unit/layers/test_layernorm_sp.py b/test/registered/unit/layers/test_layernorm_sp.py index 3c49e6d72..8b9ebb9c5 100644 --- a/test/registered/unit/layers/test_layernorm_sp.py +++ b/test/registered/unit/layers/test_layernorm_sp.py @@ -21,7 +21,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _initialize(*, enable=True, arch="Qwen3ForCausalLM"): diff --git a/test/registered/unit/layers/test_logprob_chunk_stitching.py b/test/registered/unit/layers/test_logprob_chunk_stitching.py index 51e5cafd9..c863251fb 100644 --- a/test/registered/unit/layers/test_logprob_chunk_stitching.py +++ b/test/registered/unit/layers/test_logprob_chunk_stitching.py @@ -18,7 +18,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.logprob_test_utils import coverage_cases from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") VOCAB = 11 # Heterogeneous per-sequence parameters; uniform ones hide misalignment. diff --git a/test/registered/unit/layers/test_logprob_fast_input.py b/test/registered/unit/layers/test_logprob_fast_input.py index ce72b759b..77c989a09 100644 --- a/test/registered/unit/layers/test_logprob_fast_input.py +++ b/test/registered/unit/layers/test_logprob_fast_input.py @@ -20,7 +20,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.logprob_test_utils import coverage_cases from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") VOCAB = 11 # Heterogeneous per-sequence parameters; uniform ones hide misalignment. diff --git a/test/registered/unit/layers/test_mamba2_track_ssm_indices.py b/test/registered/unit/layers/test_mamba2_track_ssm_indices.py index 48828418f..d12a89e3d 100644 --- a/test/registered/unit/layers/test_mamba2_track_ssm_indices.py +++ b/test/registered/unit/layers/test_mamba2_track_ssm_indices.py @@ -11,7 +11,7 @@ import torch from sglang.srt.layers.attention.hybrid_linear_attn_backend import Mamba2AttnBackend from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") CHUNK = 128 diff --git a/test/registered/unit/layers/test_mamba_prefill_track_metadata.py b/test/registered/unit/layers/test_mamba_prefill_track_metadata.py index 397db2428..83a32f896 100644 --- a/test/registered/unit/layers/test_mamba_prefill_track_metadata.py +++ b/test/registered/unit/layers/test_mamba_prefill_track_metadata.py @@ -19,7 +19,7 @@ from sglang.srt.runtime_context import get_context from sglang.srt.speculative import spec_utils from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class NoHostRead(torch.Tensor): diff --git a/test/registered/unit/layers/test_mamba_state_scatter_triton.py b/test/registered/unit/layers/test_mamba_state_scatter_triton.py index 145f20fe7..f45c5457d 100644 --- a/test/registered/unit/layers/test_mamba_state_scatter_triton.py +++ b/test/registered/unit/layers/test_mamba_state_scatter_triton.py @@ -5,11 +5,11 @@ from sglang.test.ci.ci_register import ( register_xpu_ci, ) -register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=7, suite="stage-b-test-1-gpu-small-amd-mi35x") register_xpu_ci(est_time=20, suite="stage-b-test-1-gpu-xpu") # The dst layout-contract tests run on CPU (no kernel launch). -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/layers/test_minicpm_attention_adapter.py b/test/registered/unit/layers/test_minicpm_attention_adapter.py index e08568c0a..4fd49f1b0 100644 --- a/test/registered/unit/layers/test_minicpm_attention_adapter.py +++ b/test/registered/unit/layers/test_minicpm_attention_adapter.py @@ -24,7 +24,7 @@ with patch.dict( MiniCPMFlashInferAdapter, ) -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _metadata(rows=1): diff --git a/test/registered/unit/layers/test_minicpm_sparse_cache.py b/test/registered/unit/layers/test_minicpm_sparse_cache.py index 5369270a1..ea2af7cda 100644 --- a/test/registered/unit/layers/test_minicpm_sparse_cache.py +++ b/test/registered/unit/layers/test_minicpm_sparse_cache.py @@ -21,7 +21,7 @@ from sglang.srt.server_args import ServerArgs from sglang.srt.session.streaming_session import SessionSlot, StreamingSession from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class RecordingAllocator(BaseTokenToKVPoolAllocator): diff --git a/test/registered/unit/layers/test_minicpm_sparse_metadata.py b/test/registered/unit/layers/test_minicpm_sparse_metadata.py index d11dca84f..aed89c6bf 100644 --- a/test/registered/unit/layers/test_minicpm_sparse_metadata.py +++ b/test/registered/unit/layers/test_minicpm_sparse_metadata.py @@ -37,7 +37,7 @@ with patch.dict( ) from sglang.srt.runtime_context import get_context, get_schedule -register_cpu_ci(est_time=22, suite="base-a-test-cpu") +register_cpu_ci(est_time=19, suite="base-a-test-cpu") def _compression_layout(): diff --git a/test/registered/unit/layers/test_moriep_mxfp8_dispatch.py b/test/registered/unit/layers/test_moriep_mxfp8_dispatch.py index 60fcc2ffc..2ef38ae15 100644 --- a/test/registered/unit/layers/test_moriep_mxfp8_dispatch.py +++ b/test/registered/unit/layers/test_moriep_mxfp8_dispatch.py @@ -21,7 +21,7 @@ from sglang.srt.layers.moe.token_dispatcher.moriep import ( # noqa: E402 ) from sglang.test.ci.ci_register import register_cpu_ci # noqa: E402 -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") HIDDEN = 7168 # DeepSeek-V4 diff --git a/test/registered/unit/layers/test_mova.py b/test/registered/unit/layers/test_mova.py index 72d6b3584..b43436621 100644 --- a/test/registered/unit/layers/test_mova.py +++ b/test/registered/unit/layers/test_mova.py @@ -21,7 +21,7 @@ from sglang.srt.layers.mova import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=4, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") def test_router_bias_changes_selection_but_not_mixture_weights(): diff --git a/test/registered/unit/layers/test_pooler_score_and_pool.py b/test/registered/unit/layers/test_pooler_score_and_pool.py index 4b2ce14a4..6ff02af72 100644 --- a/test/registered/unit/layers/test_pooler_score_and_pool.py +++ b/test/registered/unit/layers/test_pooler_score_and_pool.py @@ -19,7 +19,7 @@ from sglang.srt.layers.pooler import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _make_forward_batch( diff --git a/test/registered/unit/layers/test_radix_attention.py b/test/registered/unit/layers/test_radix_attention.py index 450b83086..b58e04476 100644 --- a/test/registered/unit/layers/test_radix_attention.py +++ b/test/registered/unit/layers/test_radix_attention.py @@ -13,7 +13,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class _RecordingAttentionBackend: diff --git a/test/registered/unit/layers/test_radix_linear_attention.py b/test/registered/unit/layers/test_radix_linear_attention.py index a11230a8e..3d28934eb 100644 --- a/test/registered/unit/layers/test_radix_linear_attention.py +++ b/test/registered/unit/layers/test_radix_linear_attention.py @@ -9,7 +9,7 @@ import sglang.srt.layers.radix_linear_attention as radix_linear_attention from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class _FakeAttentionBackend: diff --git a/test/registered/unit/layers/test_yarn_cache_extension.py b/test/registered/unit/layers/test_yarn_cache_extension.py index 361c22f8d..e712bb72b 100644 --- a/test/registered/unit/layers/test_yarn_cache_extension.py +++ b/test/registered/unit/layers/test_yarn_cache_extension.py @@ -7,7 +7,7 @@ from torch.testing import assert_close from sglang.srt.layers.rotary_embedding import base, factory, rope_variant from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") @pytest.mark.parametrize("kind", ("yarn", "deepseek_yarn", "mrope")) diff --git a/test/registered/unit/lora/test_eviction_policy.py b/test/registered/unit/lora/test_eviction_policy.py index a70e87c1c..9ee09f454 100644 --- a/test/registered/unit/lora/test_eviction_policy.py +++ b/test/registered/unit/lora/test_eviction_policy.py @@ -20,7 +20,7 @@ from sglang.srt.lora.eviction_policy import get_eviction_policy from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestLoRAEvictionPolicy(CustomTestCase): diff --git a/test/registered/unit/lora/test_experimental_sgl_marlin_multi_prefill.py b/test/registered/unit/lora/test_experimental_sgl_marlin_multi_prefill.py index 25bb30675..a095f12bf 100644 --- a/test/registered/unit/lora/test_experimental_sgl_marlin_multi_prefill.py +++ b/test/registered/unit/lora/test_experimental_sgl_marlin_multi_prefill.py @@ -9,7 +9,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=12, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") _CUDA_BF16_AVAILABLE = bool( diff --git a/test/registered/unit/lora/test_experimental_sgl_marlin_policy.py b/test/registered/unit/lora/test_experimental_sgl_marlin_policy.py index ded06e7e3..9e2127978 100644 --- a/test/registered/unit/lora/test_experimental_sgl_marlin_policy.py +++ b/test/registered/unit/lora/test_experimental_sgl_marlin_policy.py @@ -11,7 +11,7 @@ from sglang.srt.lora.marlin_lora_temp.policy import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") # Both spellings of "this server serves adapters". The validator must apply the diff --git a/test/registered/unit/lora/test_experimental_sgl_marlin_runtime_unit.py b/test/registered/unit/lora/test_experimental_sgl_marlin_runtime_unit.py index 5cd7a3bd0..d957d44cd 100644 --- a/test/registered/unit/lora/test_experimental_sgl_marlin_runtime_unit.py +++ b/test/registered/unit/lora/test_experimental_sgl_marlin_runtime_unit.py @@ -19,7 +19,7 @@ from sglang.srt.lora.marlin_lora_temp import moe_runner from sglang.srt.lora.trtllm_lora_temp import environ as trtllm_lora_environ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") _SGLANG_ROOT = Path(sglang.__file__).resolve().parent diff --git a/test/registered/unit/lora/test_experimental_sgl_marlin_shared_outer_reduce.py b/test/registered/unit/lora/test_experimental_sgl_marlin_shared_outer_reduce.py index a39349fde..eb0ade3a9 100644 --- a/test/registered/unit/lora/test_experimental_sgl_marlin_shared_outer_reduce.py +++ b/test/registered/unit/lora/test_experimental_sgl_marlin_shared_outer_reduce.py @@ -9,7 +9,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=7, stage="base-b", runner_config="1-gpu-small") _CUDA_BF16_AVAILABLE = bool( diff --git a/test/registered/unit/lora/test_inkling_linearized_lora_unit.py b/test/registered/unit/lora/test_inkling_linearized_lora_unit.py index c69de1a16..bebaf159f 100644 --- a/test/registered/unit/lora/test_inkling_linearized_lora_unit.py +++ b/test/registered/unit/lora/test_inkling_linearized_lora_unit.py @@ -20,7 +20,7 @@ from sglang.srt.lora.lora_registry import LoRARef from sglang.test.ci.ci_register import register_cpu_ci # Pure layout / bookkeeping math: no CUDA, no distributed groups, no kernels. -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") _HIDDEN = 3 _ADAPTER_RANK = 2 diff --git a/test/registered/unit/lora/test_laguna_hidden_dim_unit.py b/test/registered/unit/lora/test_laguna_hidden_dim_unit.py index f00bee250..6bc9b277b 100644 --- a/test/registered/unit/lora/test_laguna_hidden_dim_unit.py +++ b/test/registered/unit/lora/test_laguna_hidden_dim_unit.py @@ -19,7 +19,7 @@ Usage: from sglang.test.ci.ci_register import register_cpu_ci # CPU-only unit test; no CUDA/distributed dependencies. -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/lora/test_lm_head_pruning.py b/test/registered/unit/lora/test_lm_head_pruning.py index e3a052f15..c3098d29a 100644 --- a/test/registered/unit/lora/test_lm_head_pruning.py +++ b/test/registered/unit/lora/test_lm_head_pruning.py @@ -25,7 +25,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestLMHeadPruning(CustomTestCase): diff --git a/test/registered/unit/lora/test_lora_manager_tied_lm_head.py b/test/registered/unit/lora/test_lora_manager_tied_lm_head.py index 0290bdfb9..3ae509875 100644 --- a/test/registered/unit/lora/test_lora_manager_tied_lm_head.py +++ b/test/registered/unit/lora/test_lora_manager_tied_lm_head.py @@ -27,7 +27,7 @@ from sglang.srt.lora.lora_manager import LoRAManager from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _TiedEmbedding(torch.nn.Module): diff --git a/test/registered/unit/lora/test_lora_moe_inplace_unit.py b/test/registered/unit/lora/test_lora_moe_inplace_unit.py index b8ce80a82..05ce2115c 100644 --- a/test/registered/unit/lora/test_lora_moe_inplace_unit.py +++ b/test/registered/unit/lora/test_lora_moe_inplace_unit.py @@ -24,7 +24,7 @@ Usage: from sglang.test.ci.ci_register import register_cpu_ci # CPU-only unit test; no CUDA/distributed dependencies. -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import types import unittest diff --git a/test/registered/unit/lora/test_lora_spec_verify_batch_info.py b/test/registered/unit/lora/test_lora_spec_verify_batch_info.py index d7984eeaa..c7f457492 100644 --- a/test/registered/unit/lora/test_lora_spec_verify_batch_info.py +++ b/test/registered/unit/lora/test_lora_spec_verify_batch_info.py @@ -24,7 +24,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") def _verify_batch(bs: int, draft_token_num: int) -> SimpleNamespace: diff --git a/test/registered/unit/lora/test_mem_pool_ep_unit.py b/test/registered/unit/lora/test_mem_pool_ep_unit.py index 4a3ad357e..355e97bc2 100644 --- a/test/registered/unit/lora/test_mem_pool_ep_unit.py +++ b/test/registered/unit/lora/test_mem_pool_ep_unit.py @@ -16,7 +16,7 @@ Usage: from sglang.test.ci.ci_register import register_cpu_ci # CPU-only unit test; no CUDA/distributed dependencies. -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") import ast import types diff --git a/test/registered/unit/managers/scheduler_components/test_dp_attn.py b/test/registered/unit/managers/scheduler_components/test_dp_attn.py index 5696248f6..8663e0b6c 100644 --- a/test/registered/unit/managers/scheduler_components/test_dp_attn.py +++ b/test/registered/unit/managers/scheduler_components/test_dp_attn.py @@ -12,7 +12,7 @@ from sglang.srt.managers.scheduler_components import dp_attn # noqa: E402 from sglang.srt.model_executor.forward_batch_info import ForwardMode # noqa: E402 from sglang.srt.speculative.spec_info import SpeculativeAlgorithm # noqa: E402 -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestDPAttnSchedulerMetadata(CustomTestCase): diff --git a/test/registered/unit/managers/scheduler_components/test_invariant_checker.py b/test/registered/unit/managers/scheduler_components/test_invariant_checker.py index 97eeb06f6..50256426a 100644 --- a/test/registered/unit/managers/scheduler_components/test_invariant_checker.py +++ b/test/registered/unit/managers/scheduler_components/test_invariant_checker.py @@ -14,7 +14,7 @@ from sglang.srt.managers.scheduler_components.invariant_checker import ( SchedulerInvariantChecker, ) -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestCheckTreeCacheGate(CustomTestCase): diff --git a/test/registered/unit/managers/scheduler_components/test_output_sender.py b/test/registered/unit/managers/scheduler_components/test_output_sender.py index 85110137c..2a1cc3725 100644 --- a/test/registered/unit/managers/scheduler_components/test_output_sender.py +++ b/test/registered/unit/managers/scheduler_components/test_output_sender.py @@ -13,7 +13,7 @@ from sglang.srt.managers.schedule_batch import Req from sglang.srt.managers.scheduler_components.output_sender import SenderWrapper from sglang.srt.sampling.sampling_params import SamplingParams -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_scheduler_req(http_worker_ipc: str) -> Req: diff --git a/test/registered/unit/managers/test_auxiliary_output.py b/test/registered/unit/managers/test_auxiliary_output.py index 4265ea61e..adab77ba5 100644 --- a/test/registered/unit/managers/test_auxiliary_output.py +++ b/test/registered/unit/managers/test_auxiliary_output.py @@ -30,7 +30,7 @@ from sglang.srt.speculative.spec_info import SpeculativeAlgorithm from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import published_topology -register_cpu_ci(est_time=14, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") @dataclass diff --git a/test/registered/unit/managers/test_bailing_modality_metadata.py b/test/registered/unit/managers/test_bailing_modality_metadata.py index 2a75cad74..5d3d81531 100644 --- a/test/registered/unit/managers/test_bailing_modality_metadata.py +++ b/test/registered/unit/managers/test_bailing_modality_metadata.py @@ -21,7 +21,7 @@ from sglang.srt.model_executor.forward_batch_info import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=24, suite="base-a-test-cpu") class TestBailingModalityMetadata(CustomTestCase): diff --git a/test/registered/unit/managers/test_batch_result_processor_hidden_states.py b/test/registered/unit/managers/test_batch_result_processor_hidden_states.py index 363515e10..5574fc77b 100644 --- a/test/registered/unit/managers/test_batch_result_processor_hidden_states.py +++ b/test/registered/unit/managers/test_batch_result_processor_hidden_states.py @@ -15,7 +15,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_processor(case, server_mode: str = "full") -> SchedulerBatchResultProcessor: diff --git a/test/registered/unit/managers/test_batch_result_processor_mamba_boundary.py b/test/registered/unit/managers/test_batch_result_processor_mamba_boundary.py index 97eb071fb..2a204664a 100644 --- a/test/registered/unit/managers/test_batch_result_processor_mamba_boundary.py +++ b/test/registered/unit/managers/test_batch_result_processor_mamba_boundary.py @@ -15,7 +15,7 @@ from sglang.srt.runtime_context import get_context from sglang.srt.sampling.sampling_params import SamplingParams from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # The decode checkpoint grid is lcm(mamba_cache_chunk_size, tree page, diff --git a/test/registered/unit/managers/test_batch_result_processor_spec_grammar.py b/test/registered/unit/managers/test_batch_result_processor_spec_grammar.py index 6fc1a88c4..c32c8626b 100644 --- a/test/registered/unit/managers/test_batch_result_processor_spec_grammar.py +++ b/test/registered/unit/managers/test_batch_result_processor_spec_grammar.py @@ -22,7 +22,7 @@ from sglang.srt.sampling.sampling_params import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeGrammar: diff --git a/test/registered/unit/managers/test_data_parallel_controller.py b/test/registered/unit/managers/test_data_parallel_controller.py index c17ad1f71..234be6dd5 100644 --- a/test/registered/unit/managers/test_data_parallel_controller.py +++ b/test/registered/unit/managers/test_data_parallel_controller.py @@ -30,7 +30,7 @@ from sglang.srt.managers.data_parallel_controller import ( ) from sglang.srt.managers.load_snapshot import LoadSnapshot -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _BASE_LOAD = msgspec.structs.replace( diff --git a/test/registered/unit/managers/test_detailed_annotations.py b/test/registered/unit/managers/test_detailed_annotations.py index 604af818b..51d8cb871 100644 --- a/test/registered/unit/managers/test_detailed_annotations.py +++ b/test/registered/unit/managers/test_detailed_annotations.py @@ -25,7 +25,7 @@ from sglang.srt.model_executor.step_span_utils import ( ) from sglang.srt.utils.profile_utils import build_step_span_name -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _CpuMirror: diff --git a/test/registered/unit/managers/test_disagg_idle_step_counters.py b/test/registered/unit/managers/test_disagg_idle_step_counters.py index 90a769d53..c5105d9ad 100644 --- a/test/registered/unit/managers/test_disagg_idle_step_counters.py +++ b/test/registered/unit/managers/test_disagg_idle_step_counters.py @@ -26,7 +26,7 @@ from sglang.test.test_utils import ( published_topology, ) -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") LAUNCH_TIMESTAMPS = (0.0, 0.125, 1.0, 1.125) # Prefill busy time is charged launch -> result, so the result clock matters too. diff --git a/test/registered/unit/managers/test_embed_overrides.py b/test/registered/unit/managers/test_embed_overrides.py index e00a1d1fc..163e2b6aa 100644 --- a/test/registered/unit/managers/test_embed_overrides.py +++ b/test/registered/unit/managers/test_embed_overrides.py @@ -26,7 +26,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") HIDDEN_DIM = 4 diff --git a/test/registered/unit/managers/test_fanout_communicator.py b/test/registered/unit/managers/test_fanout_communicator.py index d40687af6..fd6663c5e 100644 --- a/test/registered/unit/managers/test_fanout_communicator.py +++ b/test/registered/unit/managers/test_fanout_communicator.py @@ -7,7 +7,7 @@ from sglang.srt.managers.communicator import FanOutCommunicator from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestQueueingCall(CustomTestCase): diff --git a/test/registered/unit/managers/test_finish_length_speculative.py b/test/registered/unit/managers/test_finish_length_speculative.py index 5e1a174de..932450d87 100644 --- a/test/registered/unit/managers/test_finish_length_speculative.py +++ b/test/registered/unit/managers/test_finish_length_speculative.py @@ -25,7 +25,7 @@ from sglang.srt.managers.schedule_batch import ( ) from sglang.srt.sampling.sampling_params import SamplingParams -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") EOS_ID = 2 STOP_ID = 1 diff --git a/test/registered/unit/managers/test_flat_raw_top_logprobs.py b/test/registered/unit/managers/test_flat_raw_top_logprobs.py index f7e4e09e6..818c5d210 100644 --- a/test/registered/unit/managers/test_flat_raw_top_logprobs.py +++ b/test/registered/unit/managers/test_flat_raw_top_logprobs.py @@ -40,7 +40,7 @@ from sglang.srt.managers.tokenizer_manager import ( from sglang.srt.observability.req_time_stats import APIServerReqTimeStats from sglang.srt.sampling.sampling_params import SamplingParams -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # Synthetic per-position top-k rows (k=2). The leading None mirrors the first # prompt position, which has no top logprobs. diff --git a/test/registered/unit/managers/test_grammar_stop_speculative.py b/test/registered/unit/managers/test_grammar_stop_speculative.py index 0a60c2b8f..4a238815d 100644 --- a/test/registered/unit/managers/test_grammar_stop_speculative.py +++ b/test/registered/unit/managers/test_grammar_stop_speculative.py @@ -7,7 +7,7 @@ from sglang.srt.managers.schedule_batch import Req from sglang.srt.sampling.sampling_params import SamplingParams from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") EOS_TOKEN_ID = 2 STOP_TOKEN_ID = 17 diff --git a/test/registered/unit/managers/test_hidden_state_server_mode.py b/test/registered/unit/managers/test_hidden_state_server_mode.py index 5aa30c20a..dc8d15157 100644 --- a/test/registered/unit/managers/test_hidden_state_server_mode.py +++ b/test/registered/unit/managers/test_hidden_state_server_mode.py @@ -8,7 +8,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestHiddenStateServerMode(CustomTestCase): diff --git a/test/registered/unit/managers/test_hisparse_unit.py b/test/registered/unit/managers/test_hisparse_unit.py index 459c10005..7bee1c34f 100644 --- a/test/registered/unit/managers/test_hisparse_unit.py +++ b/test/registered/unit/managers/test_hisparse_unit.py @@ -31,7 +31,7 @@ from sglang.test.ci.ci_register import ( register_xpu_ci, ) -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") register_xpu_ci(est_time=60, suite="stage-b-test-1-gpu-xpu") diff --git a/test/registered/unit/managers/test_io_struct.py b/test/registered/unit/managers/test_io_struct.py index c35ba141a..96695aaeb 100644 --- a/test/registered/unit/managers/test_io_struct.py +++ b/test/registered/unit/managers/test_io_struct.py @@ -37,7 +37,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=8, suite="stage-b-test-1-gpu-small-amd") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/managers/test_kv_page_invariants.py b/test/registered/unit/managers/test_kv_page_invariants.py index 9ba86262b..9dd04d146 100644 --- a/test/registered/unit/managers/test_kv_page_invariants.py +++ b/test/registered/unit/managers/test_kv_page_invariants.py @@ -9,7 +9,7 @@ from sglang.srt.managers.schedule_batch import ReqKvInfo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _PAGE_SIZE = 256 diff --git a/test/registered/unit/managers/test_load_inquirer.py b/test/registered/unit/managers/test_load_inquirer.py index 7fdfdef61..619ae608f 100644 --- a/test/registered/unit/managers/test_load_inquirer.py +++ b/test/registered/unit/managers/test_load_inquirer.py @@ -12,7 +12,7 @@ from sglang.srt.managers.scheduler_components.load_inquirer import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestSchedulePolicyWaitingQueueMatching(unittest.TestCase): diff --git a/test/registered/unit/managers/test_load_snapshot_backends.py b/test/registered/unit/managers/test_load_snapshot_backends.py index e93bbfcb8..b455e9d7b 100644 --- a/test/registered/unit/managers/test_load_snapshot_backends.py +++ b/test/registered/unit/managers/test_load_snapshot_backends.py @@ -26,7 +26,7 @@ from sglang.test.test_utils import CustomTestCase, maybe_stub_sgl_kernel maybe_stub_sgl_kernel() -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _temp_path() -> str: diff --git a/test/registered/unit/managers/test_loadstat_wire.py b/test/registered/unit/managers/test_loadstat_wire.py index 02a55f664..2529850b3 100644 --- a/test/registered/unit/managers/test_loadstat_wire.py +++ b/test/registered/unit/managers/test_loadstat_wire.py @@ -30,7 +30,7 @@ from sglang.srt.managers.scheduler_components.load_publisher import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase, published_topology -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestLoadStatWire(CustomTestCase): diff --git a/test/registered/unit/managers/test_lora_update_result_merge.py b/test/registered/unit/managers/test_lora_update_result_merge.py index c91b24a6d..6a9ad43b0 100644 --- a/test/registered/unit/managers/test_lora_update_result_merge.py +++ b/test/registered/unit/managers/test_lora_update_result_merge.py @@ -21,7 +21,7 @@ from sglang.srt.managers.tokenizer_control_mixin import _merge_lora_update_resul from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _ok(adapters=None) -> LoRAUpdateOutput: diff --git a/test/registered/unit/managers/test_mamba_checkpoint_depth.py b/test/registered/unit/managers/test_mamba_checkpoint_depth.py index dd4e62c03..09560e9da 100644 --- a/test/registered/unit/managers/test_mamba_checkpoint_depth.py +++ b/test/registered/unit/managers/test_mamba_checkpoint_depth.py @@ -25,7 +25,7 @@ from sglang.srt.server_args import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") CHUNK = 64 diff --git a/test/registered/unit/managers/test_mm_hashes.py b/test/registered/unit/managers/test_mm_hashes.py index c35dca362..87601603b 100644 --- a/test/registered/unit/managers/test_mm_hashes.py +++ b/test/registered/unit/managers/test_mm_hashes.py @@ -25,7 +25,7 @@ from sglang.srt.managers.schedule_batch import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestMmHashesContract(CustomTestCase): diff --git a/test/registered/unit/managers/test_mm_process_config.py b/test/registered/unit/managers/test_mm_process_config.py index e9c8ea3d6..45bf0c125 100644 --- a/test/registered/unit/managers/test_mm_process_config.py +++ b/test/registered/unit/managers/test_mm_process_config.py @@ -14,7 +14,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestMmProcessConfigValidation(CustomTestCase): diff --git a/test/registered/unit/managers/test_mm_shm_error_consensus.py b/test/registered/unit/managers/test_mm_shm_error_consensus.py index a7d1e20f5..875717ad8 100644 --- a/test/registered/unit/managers/test_mm_shm_error_consensus.py +++ b/test/registered/unit/managers/test_mm_shm_error_consensus.py @@ -42,7 +42,7 @@ from sglang.srt.managers.scheduler_components.request_receiver import ( # noqa: ) from sglang.srt.sampling.sampling_params import SamplingParams # noqa: E402 -register_cpu_ci(est_time=33, suite="base-a-test-cpu") +register_cpu_ci(est_time=42, suite="base-a-test-cpu") class _CloneFailure: diff --git a/test/registered/unit/managers/test_mm_utils_split.py b/test/registered/unit/managers/test_mm_utils_split.py index 59bc87638..7a61ca9b7 100644 --- a/test/registered/unit/managers/test_mm_utils_split.py +++ b/test/registered/unit/managers/test_mm_utils_split.py @@ -21,7 +21,7 @@ from sglang.srt.managers.schedule_batch import Modality, MultimodalDataItem from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _bundled_item(grid_key=None, grid=None, feature_len=10, num_images=2): diff --git a/test/registered/unit/managers/test_multi_tokenizer_mixin.py b/test/registered/unit/managers/test_multi_tokenizer_mixin.py index 7468d1fc5..dbc9d6f70 100644 --- a/test/registered/unit/managers/test_multi_tokenizer_mixin.py +++ b/test/registered/unit/managers/test_multi_tokenizer_mixin.py @@ -13,7 +13,7 @@ from sglang.srt.managers.multi_tokenizer_mixin import ( get_tokenizer_worker_class, ) -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class CustomTokenizerWorker(TokenizerWorker): diff --git a/test/registered/unit/managers/test_multimodal_abort_cleanup.py b/test/registered/unit/managers/test_multimodal_abort_cleanup.py index 8ddc42b2a..45294a138 100644 --- a/test/registered/unit/managers/test_multimodal_abort_cleanup.py +++ b/test/registered/unit/managers/test_multimodal_abort_cleanup.py @@ -13,7 +13,7 @@ from sglang.srt.managers.schedule_batch import ( from sglang.srt.multimodal.transport.cuda_ipc import CudaIpcTensorTransportProxy from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _deferred_proxy(): diff --git a/test/registered/unit/managers/test_output_streamer_customized_info.py b/test/registered/unit/managers/test_output_streamer_customized_info.py index d6b438f2e..c1d574af9 100644 --- a/test/registered/unit/managers/test_output_streamer_customized_info.py +++ b/test/registered/unit/managers/test_output_streamer_customized_info.py @@ -16,7 +16,7 @@ from sglang.srt.utils.weight_versions import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import enter_scope, published_topology -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeReq: diff --git a/test/registered/unit/managers/test_output_streamer_logprobs.py b/test/registered/unit/managers/test_output_streamer_logprobs.py index 30b79283b..a696d61ae 100644 --- a/test/registered/unit/managers/test_output_streamer_logprobs.py +++ b/test/registered/unit/managers/test_output_streamer_logprobs.py @@ -8,7 +8,7 @@ from sglang.srt.managers.scheduler_components.output_streamer import ( from sglang.srt.speculative.spec_info import SpeculativeAlgorithm from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class _FakeReq: diff --git a/test/registered/unit/managers/test_pp_cp_rank_offsets.py b/test/registered/unit/managers/test_pp_cp_rank_offsets.py index 5db7cd72b..12128947b 100644 --- a/test/registered/unit/managers/test_pp_cp_rank_offsets.py +++ b/test/registered/unit/managers/test_pp_cp_rank_offsets.py @@ -23,7 +23,7 @@ from sglang.srt.managers.scheduler_pp_mixin import ( # noqa: E402 ) from sglang.srt.model_executor.forward_batch_info import ForwardMode # noqa: E402 -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _published_topology(): diff --git a/test/registered/unit/managers/test_prefill_adder.py b/test/registered/unit/managers/test_prefill_adder.py index 03b21a95a..9a688c333 100644 --- a/test/registered/unit/managers/test_prefill_adder.py +++ b/test/registered/unit/managers/test_prefill_adder.py @@ -30,7 +30,7 @@ from sglang.srt.utils.common import Range from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _RecordingDelayer: diff --git a/test/registered/unit/managers/test_prefill_delayer_high_watermark.py b/test/registered/unit/managers/test_prefill_delayer_high_watermark.py index 2631f4e5b..562c04318 100644 --- a/test/registered/unit/managers/test_prefill_delayer_high_watermark.py +++ b/test/registered/unit/managers/test_prefill_delayer_high_watermark.py @@ -9,7 +9,7 @@ from sglang.srt.managers.prefill_delayer import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestPrefillDelayerHighWatermark(CustomTestCase): diff --git a/test/registered/unit/managers/test_priority_scheduling_disaggregation.py b/test/registered/unit/managers/test_priority_scheduling_disaggregation.py index d8a3e4cbc..0b878523e 100644 --- a/test/registered/unit/managers/test_priority_scheduling_disaggregation.py +++ b/test/registered/unit/managers/test_priority_scheduling_disaggregation.py @@ -28,7 +28,7 @@ from sglang.test.separate_buffer_allocator_double import ( bind_separate_buffer_capacity, ) -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestDisaggregationPriorityQueueing(unittest.TestCase): diff --git a/test/registered/unit/managers/test_profile_merger_http_api.py b/test/registered/unit/managers/test_profile_merger_http_api.py index 1dd0836e2..8908bfafe 100644 --- a/test/registered/unit/managers/test_profile_merger_http_api.py +++ b/test/registered/unit/managers/test_profile_merger_http_api.py @@ -4,7 +4,7 @@ from sglang.srt.managers.io_struct import ProfileReq from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestProfileMergerHTTPAPI(CustomTestCase): diff --git a/test/registered/unit/managers/test_retraction_order.py b/test/registered/unit/managers/test_retraction_order.py index abd831838..b0997d7a0 100644 --- a/test/registered/unit/managers/test_retraction_order.py +++ b/test/registered/unit/managers/test_retraction_order.py @@ -7,7 +7,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _req(output_len: int, input_len: int = 8, priority=None): diff --git a/test/registered/unit/managers/test_sampling_mask_validation.py b/test/registered/unit/managers/test_sampling_mask_validation.py index a41dfe548..2964f3398 100644 --- a/test/registered/unit/managers/test_sampling_mask_validation.py +++ b/test/registered/unit/managers/test_sampling_mask_validation.py @@ -12,7 +12,7 @@ from sglang.srt.sampling.custom_logit_processor import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestSamplingMaskValidation(CustomTestCase): diff --git a/test/registered/unit/managers/test_schedule_batch_out_of_place.py b/test/registered/unit/managers/test_schedule_batch_out_of_place.py index 867ab1ee4..ea29362db 100644 --- a/test/registered/unit/managers/test_schedule_batch_out_of_place.py +++ b/test/registered/unit/managers/test_schedule_batch_out_of_place.py @@ -19,7 +19,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode # noqa: E4 from sglang.srt.speculative.spec_info import SpeculativeAlgorithm # noqa: E402 from sglang.srt.utils.common import Range # noqa: E402 -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") AUTO_FILL_EXCLUDED_FIELDS = ["reqs"] diff --git a/test/registered/unit/managers/test_schedule_batch_prepare_for_decode.py b/test/registered/unit/managers/test_schedule_batch_prepare_for_decode.py index ca47ad700..d5f40b674 100644 --- a/test/registered/unit/managers/test_schedule_batch_prepare_for_decode.py +++ b/test/registered/unit/managers/test_schedule_batch_prepare_for_decode.py @@ -12,7 +12,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.schedule_batch import ScheduleBatch # noqa: E402 -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_req(): diff --git a/test/registered/unit/managers/test_schedule_batch_req_pool_indices.py b/test/registered/unit/managers/test_schedule_batch_req_pool_indices.py index 3fc07caf2..72ec4b2cf 100644 --- a/test/registered/unit/managers/test_schedule_batch_req_pool_indices.py +++ b/test/registered/unit/managers/test_schedule_batch_req_pool_indices.py @@ -13,7 +13,7 @@ from sglang.srt.managers.hisparse_coordinator import HiSparseCoordinator # noqa from sglang.srt.managers.scheduler import Scheduler # noqa: E402 from sglang.srt.model_executor.forward_batch_info import CaptureHiddenMode # noqa: E402 -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _make_req(req_pool_idx, origin_input_ids, output_ids): diff --git a/test/registered/unit/managers/test_schedule_policy.py b/test/registered/unit/managers/test_schedule_policy.py index 45ce93734..ed3cee9d0 100644 --- a/test/registered/unit/managers/test_schedule_policy.py +++ b/test/registered/unit/managers/test_schedule_policy.py @@ -9,7 +9,7 @@ from sglang.srt.sampling.sampling_params import SamplingParams from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_req(rid, origin_input_text, origin_input_ids, sampling_params=None, **kwargs): diff --git a/test/registered/unit/managers/test_schedule_policy_dfs_weight.py b/test/registered/unit/managers/test_schedule_policy_dfs_weight.py index 683c5b7a1..4a766979e 100644 --- a/test/registered/unit/managers/test_schedule_policy_dfs_weight.py +++ b/test/registered/unit/managers/test_schedule_policy_dfs_weight.py @@ -8,7 +8,7 @@ from sglang.srt.mem_cache.base_prefix_cache import BasePrefixCache from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestSchedulePolicyDfsWeight(CustomTestCase): diff --git a/test/registered/unit/managers/test_scheduler_chunked_abort_race.py b/test/registered/unit/managers/test_scheduler_chunked_abort_race.py index b848b69d9..9485a157d 100644 --- a/test/registered/unit/managers/test_scheduler_chunked_abort_race.py +++ b/test/registered/unit/managers/test_scheduler_chunked_abort_race.py @@ -16,7 +16,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.scheduler import Scheduler # noqa: E402 -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeReq: diff --git a/test/registered/unit/managers/test_scheduler_chunked_req_gate.py b/test/registered/unit/managers/test_scheduler_chunked_req_gate.py index 94ac81dd5..820a87884 100644 --- a/test/registered/unit/managers/test_scheduler_chunked_req_gate.py +++ b/test/registered/unit/managers/test_scheduler_chunked_req_gate.py @@ -18,7 +18,7 @@ from sglang.srt.managers.scheduler import Scheduler from sglang.srt.mem_cache.chunk_cache import ChunkCache from sglang.srt.utils.common import Range -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_req( diff --git a/test/registered/unit/managers/test_scheduler_decision_batch_params.py b/test/registered/unit/managers/test_scheduler_decision_batch_params.py index 89218ce33..3c7b8e811 100644 --- a/test/registered/unit/managers/test_scheduler_decision_batch_params.py +++ b/test/registered/unit/managers/test_scheduler_decision_batch_params.py @@ -9,7 +9,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.scheduler import Scheduler -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestMtpPhaseBoundaryOverlap(unittest.TestCase): diff --git a/test/registered/unit/managers/test_scheduler_flush_cache.py b/test/registered/unit/managers/test_scheduler_flush_cache.py index a5030fcd4..4c5e2f2b7 100644 --- a/test/registered/unit/managers/test_scheduler_flush_cache.py +++ b/test/registered/unit/managers/test_scheduler_flush_cache.py @@ -12,7 +12,7 @@ from sglang.srt.managers.scheduler_components.flush_wrapper import ( SchedulerFlushWrapper, ) -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/managers/test_scheduler_hicache_attach.py b/test/registered/unit/managers/test_scheduler_hicache_attach.py index f5e567b1a..29f86078b 100644 --- a/test/registered/unit/managers/test_scheduler_hicache_attach.py +++ b/test/registered/unit/managers/test_scheduler_hicache_attach.py @@ -19,7 +19,7 @@ from sglang.srt.runtime_context import get_context, get_memory from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestSchedulerHiCacheAttach(CustomTestCase): diff --git a/test/registered/unit/managers/test_scheduler_hicache_events.py b/test/registered/unit/managers/test_scheduler_hicache_events.py index 8c81c0792..299dc015d 100644 --- a/test/registered/unit/managers/test_scheduler_hicache_events.py +++ b/test/registered/unit/managers/test_scheduler_hicache_events.py @@ -16,7 +16,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.schedule_batch import NextBatchPlan from sglang.srt.managers.scheduler import Scheduler -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestSchedulerHiCacheEvents(unittest.TestCase): diff --git a/test/registered/unit/managers/test_scheduler_init_req_max_new_tokens.py b/test/registered/unit/managers/test_scheduler_init_req_max_new_tokens.py index d651071e5..d105df6f9 100644 --- a/test/registered/unit/managers/test_scheduler_init_req_max_new_tokens.py +++ b/test/registered/unit/managers/test_scheduler_init_req_max_new_tokens.py @@ -11,7 +11,7 @@ from sglang.srt.mem_cache.unified_memory_pool import init_unified_swa_pools from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestSchedulerInitReqMaxNewTokens(unittest.TestCase): diff --git a/test/registered/unit/managers/test_scheduler_internal_state_env_vars.py b/test/registered/unit/managers/test_scheduler_internal_state_env_vars.py index d862e7650..915a87af0 100644 --- a/test/registered/unit/managers/test_scheduler_internal_state_env_vars.py +++ b/test/registered/unit/managers/test_scheduler_internal_state_env_vars.py @@ -13,7 +13,7 @@ from sglang.srt.managers.io_struct import GetInternalStateReq from sglang.srt.managers.scheduler import Scheduler from sglang.srt.runtime_context import get_context -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestSchedulerInternalStateEnvVars(unittest.TestCase): diff --git a/test/registered/unit/managers/test_scheduler_internal_state_world_size.py b/test/registered/unit/managers/test_scheduler_internal_state_world_size.py index d5b40fecf..c0fcfaccb 100644 --- a/test/registered/unit/managers/test_scheduler_internal_state_world_size.py +++ b/test/registered/unit/managers/test_scheduler_internal_state_world_size.py @@ -11,7 +11,7 @@ from sglang.srt.managers.scheduler import Scheduler from sglang.srt.runtime_context import get_context from sglang.srt.server_args import compute_world_size -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _shape( diff --git a/test/registered/unit/managers/test_scheduler_on_idle_load.py b/test/registered/unit/managers/test_scheduler_on_idle_load.py index 9cba96e57..df8271ca6 100644 --- a/test/registered/unit/managers/test_scheduler_on_idle_load.py +++ b/test/registered/unit/managers/test_scheduler_on_idle_load.py @@ -17,7 +17,7 @@ maybe_stub_sgl_kernel() from sglang.srt.disaggregation.utils import DisaggregationMode from sglang.srt.managers.scheduler import Scheduler -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestOnIdleStallPublish(CustomTestCase): diff --git a/test/registered/unit/managers/test_scheduler_pause_generation.py b/test/registered/unit/managers/test_scheduler_pause_generation.py index 716c59e57..b91c1cfb0 100644 --- a/test/registered/unit/managers/test_scheduler_pause_generation.py +++ b/test/registered/unit/managers/test_scheduler_pause_generation.py @@ -23,7 +23,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.srt.runtime_context import publish, reset_context from sglang.srt.sampling.sampling_params import SamplingParams -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/managers/test_scheduler_prefill_decode_interval.py b/test/registered/unit/managers/test_scheduler_prefill_decode_interval.py index d23891653..2fae7b421 100644 --- a/test/registered/unit/managers/test_scheduler_prefill_decode_interval.py +++ b/test/registered/unit/managers/test_scheduler_prefill_decode_interval.py @@ -10,7 +10,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.scheduler import Scheduler -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_scheduler(*, interval: int, require_mlp_sync: bool) -> Scheduler: diff --git a/test/registered/unit/managers/test_scheduler_recv_skipper.py b/test/registered/unit/managers/test_scheduler_recv_skipper.py index e912ffabe..d571bbfd0 100644 --- a/test/registered/unit/managers/test_scheduler_recv_skipper.py +++ b/test/registered/unit/managers/test_scheduler_recv_skipper.py @@ -12,7 +12,7 @@ from sglang.srt.managers.scheduler_components.recv_skipper import ( # noqa: E40 ) from sglang.srt.model_executor.forward_batch_info import ForwardMode # noqa: E402 -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _publish(case, interval, enable_dp_attention=False): diff --git a/test/registered/unit/managers/test_scheduler_sampling_mask_validation.py b/test/registered/unit/managers/test_scheduler_sampling_mask_validation.py index ebc47b313..8a0dc5628 100644 --- a/test/registered/unit/managers/test_scheduler_sampling_mask_validation.py +++ b/test/registered/unit/managers/test_scheduler_sampling_mask_validation.py @@ -13,7 +13,7 @@ maybe_stub_sgl_kernel() from sglang.srt.disaggregation.utils import DisaggregationMode from sglang.srt.managers.scheduler import Scheduler -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestSchedulerSamplingMaskValidation(CustomTestCase): diff --git a/test/registered/unit/managers/test_scheduler_timeouts.py b/test/registered/unit/managers/test_scheduler_timeouts.py index a6c152e32..64b79db9f 100644 --- a/test/registered/unit/managers/test_scheduler_timeouts.py +++ b/test/registered/unit/managers/test_scheduler_timeouts.py @@ -27,7 +27,7 @@ from sglang.srt.mem_cache.base_prefix_cache import ( CacheRequestOutcome, ) -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeReq: diff --git a/test/registered/unit/managers/test_scheduler_weight_version_tracking.py b/test/registered/unit/managers/test_scheduler_weight_version_tracking.py index a3d1c61da..c64597811 100644 --- a/test/registered/unit/managers/test_scheduler_weight_version_tracking.py +++ b/test/registered/unit/managers/test_scheduler_weight_version_tracking.py @@ -9,7 +9,7 @@ from sglang.srt.managers.scheduler_components.weight_updater import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _ServingStub: diff --git a/test/registered/unit/managers/test_stop_str_speculative.py b/test/registered/unit/managers/test_stop_str_speculative.py index b3c9a26ba..5f4d5481f 100644 --- a/test/registered/unit/managers/test_stop_str_speculative.py +++ b/test/registered/unit/managers/test_stop_str_speculative.py @@ -12,7 +12,7 @@ from sglang.srt.managers.schedule_batch import Req from sglang.srt.sampling.sampling_params import SamplingParams from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") # Token id -> decoded text; decode() concatenates. Distinct symbols so no # accidental cross-matches (10-39 are lowercase letters). diff --git a/test/registered/unit/managers/test_tokenizer_config_updates.py b/test/registered/unit/managers/test_tokenizer_config_updates.py index da73e9dce..9a6fa7979 100644 --- a/test/registered/unit/managers/test_tokenizer_config_updates.py +++ b/test/registered/unit/managers/test_tokenizer_config_updates.py @@ -20,7 +20,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _manager(case, **fields): diff --git a/test/registered/unit/managers/test_tokenizer_manager_rid_cleanup.py b/test/registered/unit/managers/test_tokenizer_manager_rid_cleanup.py index 2c09c2efc..bde15bdfa 100644 --- a/test/registered/unit/managers/test_tokenizer_manager_rid_cleanup.py +++ b/test/registered/unit/managers/test_tokenizer_manager_rid_cleanup.py @@ -38,7 +38,7 @@ from sglang.srt.observability.req_time_stats import ( # noqa: E402 ) from sglang.srt.runtime_context import get_context -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") _NOT_FINISHED = object() # Sentinel: request has not finished yet diff --git a/test/registered/unit/managers/test_trim_matched_stop.py b/test/registered/unit/managers/test_trim_matched_stop.py index 8c5fe6cf4..716008025 100644 --- a/test/registered/unit/managers/test_trim_matched_stop.py +++ b/test/registered/unit/managers/test_trim_matched_stop.py @@ -12,7 +12,7 @@ from types import SimpleNamespace from sglang.srt.managers.detokenizer_manager import DetokenizerManager from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") GPT_OSS_CALL_TOKEN = 200012 diff --git a/test/registered/unit/managers/test_vocab_boundary_finish.py b/test/registered/unit/managers/test_vocab_boundary_finish.py index 9c90459a8..bc6869825 100644 --- a/test/registered/unit/managers/test_vocab_boundary_finish.py +++ b/test/registered/unit/managers/test_vocab_boundary_finish.py @@ -9,7 +9,7 @@ maybe_stub_sgl_kernel() from sglang.srt.managers.schedule_batch import FINISH_MATCHED_STR, Req -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") VOCAB_SIZE = 1000 diff --git a/test/registered/unit/mem_cache/test_asymmetric_mha_pool.py b/test/registered/unit/mem_cache/test_asymmetric_mha_pool.py index 6fd07948c..2442b9532 100644 --- a/test/registered/unit/mem_cache/test_asymmetric_mha_pool.py +++ b/test/registered/unit/mem_cache/test_asymmetric_mha_pool.py @@ -21,7 +21,7 @@ from sglang.test.ci.ci_register import register_cuda_ci _HAS_CUDA = torch.cuda.is_available() -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") DTYPE = torch.bfloat16 HEAD_NUM = 2 diff --git a/test/registered/unit/mem_cache/test_asymmetric_mha_pool_host_unit.py b/test/registered/unit/mem_cache/test_asymmetric_mha_pool_host_unit.py index d6fb6de05..90cad94dc 100644 --- a/test/registered/unit/mem_cache/test_asymmetric_mha_pool_host_unit.py +++ b/test/registered/unit/mem_cache/test_asymmetric_mha_pool_host_unit.py @@ -14,7 +14,7 @@ from sglang.srt.mem_cache.pool_host.mha import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _make_host(layout: str) -> AsymmetricMHATokenToKVPoolHost: diff --git a/test/registered/unit/mem_cache/test_buffer_mode_sidecar.py b/test/registered/unit/mem_cache/test_buffer_mode_sidecar.py index a62f10c1e..5fdc38036 100644 --- a/test/registered/unit/mem_cache/test_buffer_mode_sidecar.py +++ b/test/registered/unit/mem_cache/test_buffer_mode_sidecar.py @@ -29,7 +29,7 @@ from sglang.srt.mem_cache.unified_cache.unified_tree_core_interface import ( from sglang.srt.mem_cache.unified_radix_cache import _OngoingPrefetch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestBufferModeSidecar(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_decode_radix_lock_ref.py b/test/registered/unit/mem_cache/test_decode_radix_lock_ref.py index 8f237b6f6..a2c8de64f 100644 --- a/test/registered/unit/mem_cache/test_decode_radix_lock_ref.py +++ b/test/registered/unit/mem_cache/test_decode_radix_lock_ref.py @@ -25,7 +25,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import enter_override -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest from array import array diff --git a/test/registered/unit/mem_cache/test_dllm_fdfo_kv_reuse.py b/test/registered/unit/mem_cache/test_dllm_fdfo_kv_reuse.py index 7af5cea53..2e8136751 100644 --- a/test/registered/unit/mem_cache/test_dllm_fdfo_kv_reuse.py +++ b/test/registered/unit/mem_cache/test_dllm_fdfo_kv_reuse.py @@ -13,7 +13,7 @@ from sglang.srt.mem_cache.memory_pool import ReqToTokenPool from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class _FakeAllocator: diff --git a/test/registered/unit/mem_cache/test_dsa_layer_shard_utils.py b/test/registered/unit/mem_cache/test_dsa_layer_shard_utils.py index 755ac7686..84e40f256 100644 --- a/test/registered/unit/mem_cache/test_dsa_layer_shard_utils.py +++ b/test/registered/unit/mem_cache/test_dsa_layer_shard_utils.py @@ -8,7 +8,7 @@ from sglang.srt.mem_cache.dsa_cache_layer_split import LayerSplitDSATokenToKVPoo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestDSALayerShardUtils(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_dsa_layer_split_broadcast.py b/test/registered/unit/mem_cache/test_dsa_layer_split_broadcast.py index 209b7cd49..0907efa28 100644 --- a/test/registered/unit/mem_cache/test_dsa_layer_split_broadcast.py +++ b/test/registered/unit/mem_cache/test_dsa_layer_split_broadcast.py @@ -22,7 +22,7 @@ import torch.multiprocessing as mp from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase, publish_build_topology -register_cuda_ci(est_time=28, stage="base-c", runner_config="4-gpu-b200") +register_cuda_ci(est_time=25, stage="base-c", runner_config="4-gpu-b200") LAYER_NUM = 4 PAGE_SIZE = 64 diff --git a/test/registered/unit/mem_cache/test_dsa_pool_host_unit.py b/test/registered/unit/mem_cache/test_dsa_pool_host_unit.py index cb8d5b0f0..ca49ac3f8 100644 --- a/test/registered/unit/mem_cache/test_dsa_pool_host_unit.py +++ b/test/registered/unit/mem_cache/test_dsa_pool_host_unit.py @@ -13,7 +13,7 @@ from sglang.srt.mem_cache.pool_host.mla import MLATokenToKVPoolHost from sglang.srt.utils import is_cuda, is_hip, is_npu, is_xpu from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=9, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/mem_cache/test_dsv4_c4_state_lifecycle.py b/test/registered/unit/mem_cache/test_dsv4_c4_state_lifecycle.py index c0b2b7a1a..3193b8733 100644 --- a/test/registered/unit/mem_cache/test_dsv4_c4_state_lifecycle.py +++ b/test/registered/unit/mem_cache/test_dsv4_c4_state_lifecycle.py @@ -14,7 +14,7 @@ from sglang.srt.mem_cache.memory_pool import ReqToTokenPool from sglang.srt.model_executor.pool_configurator import DSV4PoolConfigurator from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _request(req_pool_idx=None, *, reused=False): diff --git a/test/registered/unit/mem_cache/test_dsv4_compress_write_pad.py b/test/registered/unit/mem_cache/test_dsv4_compress_write_pad.py index 93c2c5c0a..272352cfe 100644 --- a/test/registered/unit/mem_cache/test_dsv4_compress_write_pad.py +++ b/test/registered/unit/mem_cache/test_dsv4_compress_write_pad.py @@ -7,7 +7,7 @@ from sglang.srt.mem_cache.deepseek_v4_memory_pool import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestCompressStateWritePad(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_dsv4_compressed_pools.py b/test/registered/unit/mem_cache/test_dsv4_compressed_pools.py index 06e677a28..e05bcf2c7 100644 --- a/test/registered/unit/mem_cache/test_dsv4_compressed_pools.py +++ b/test/registered/unit/mem_cache/test_dsv4_compressed_pools.py @@ -20,7 +20,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestDSV4CompressedPools(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_dsv4_hicache_l2.py b/test/registered/unit/mem_cache/test_dsv4_hicache_l2.py index b151a166a..1b45f611b 100644 --- a/test/registered/unit/mem_cache/test_dsv4_hicache_l2.py +++ b/test/registered/unit/mem_cache/test_dsv4_hicache_l2.py @@ -25,7 +25,7 @@ from sglang.srt.mem_cache.unified_cache.components import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestDSV4DecodeCapacity(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_dsv4_unified_fp8_pool.py b/test/registered/unit/mem_cache/test_dsv4_unified_fp8_pool.py index 7e72aa515..e27634cec 100644 --- a/test/registered/unit/mem_cache/test_dsv4_unified_fp8_pool.py +++ b/test/registered/unit/mem_cache/test_dsv4_unified_fp8_pool.py @@ -18,7 +18,7 @@ from sglang.srt.speculative.spec_info import SpeculativeAlgorithm from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # DeepSeek-V4-Pro geometry. NOPE_DIM = 448 diff --git a/test/registered/unit/mem_cache/test_embedding_cache_controller.py b/test/registered/unit/mem_cache/test_embedding_cache_controller.py index caf170c30..7cd9d1e3c 100644 --- a/test/registered/unit/mem_cache/test_embedding_cache_controller.py +++ b/test/registered/unit/mem_cache/test_embedding_cache_controller.py @@ -21,7 +21,7 @@ from sglang.srt.mem_cache.embedding_cache_controller import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _make_pool(num_pages=16, dim=4, page_size=2, modality="vision"): diff --git a/test/registered/unit/mem_cache/test_evict_policy.py b/test/registered/unit/mem_cache/test_evict_policy.py index 1d1fbe069..a54e4cd2e 100644 --- a/test/registered/unit/mem_cache/test_evict_policy.py +++ b/test/registered/unit/mem_cache/test_evict_policy.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel") import unittest diff --git a/test/registered/unit/mem_cache/test_flashkda_strided_state_access.py b/test/registered/unit/mem_cache/test_flashkda_strided_state_access.py index 8d576b4f5..444a55025 100644 --- a/test/registered/unit/mem_cache/test_flashkda_strided_state_access.py +++ b/test/registered/unit/mem_cache/test_flashkda_strided_state_access.py @@ -25,7 +25,7 @@ pattern (the code under test) executes. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") import sys import types diff --git a/test/registered/unit/mem_cache/test_free_kv_row_coalesce.py b/test/registered/unit/mem_cache/test_free_kv_row_coalesce.py index 74e9e2e0f..7403f5061 100644 --- a/test/registered/unit/mem_cache/test_free_kv_row_coalesce.py +++ b/test/registered/unit/mem_cache/test_free_kv_row_coalesce.py @@ -17,7 +17,7 @@ from sglang.srt.mem_cache.allocator.paged import PagedTokenToKVPoolAllocator from sglang.srt.mem_cache.base_prefix_cache import BasePrefixCache from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") # A 64-token page widened by dcp_size 8 is 512; scaled down 64x: page 8, and # a Mamba track boundary at 576 tokens lands at position 9. diff --git a/test/registered/unit/mem_cache/test_full_loc_fast_path.py b/test/registered/unit/mem_cache/test_full_loc_fast_path.py index 8c301633e..823b1d0f0 100644 --- a/test/registered/unit/mem_cache/test_full_loc_fast_path.py +++ b/test/registered/unit/mem_cache/test_full_loc_fast_path.py @@ -27,7 +27,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _loc_info(virtual_loc, swa_phys=None, full_phys=None): diff --git a/test/registered/unit/mem_cache/test_hicache_auto_size.py b/test/registered/unit/mem_cache/test_hicache_auto_size.py index f0ed470d5..e0b5bc901 100644 --- a/test/registered/unit/mem_cache/test_hicache_auto_size.py +++ b/test/registered/unit/mem_cache/test_hicache_auto_size.py @@ -16,7 +16,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestHiCacheAutoSize(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_hicache_copy_rounds.py b/test/registered/unit/mem_cache/test_hicache_copy_rounds.py index 4893ddc05..067f3672a 100644 --- a/test/registered/unit/mem_cache/test_hicache_copy_rounds.py +++ b/test/registered/unit/mem_cache/test_hicache_copy_rounds.py @@ -8,7 +8,7 @@ from unittest import mock from sglang.kernels.ops.kvcache import hicache from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") def _screen(element_size: int, unroll: int, *, is_hip: bool) -> bool: diff --git a/test/registered/unit/mem_cache/test_hicache_dcp_host_pool.py b/test/registered/unit/mem_cache/test_hicache_dcp_host_pool.py index af0d8db9e..24f3d18d0 100644 --- a/test/registered/unit/mem_cache/test_hicache_dcp_host_pool.py +++ b/test/registered/unit/mem_cache/test_hicache_dcp_host_pool.py @@ -21,7 +21,7 @@ from sglang.srt.mem_cache.pool_host.mla import MLATokenToKVPoolHost from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") DCP_SIZE = 8 PHYSICAL_PAGE = 64 diff --git a/test/registered/unit/mem_cache/test_hicache_file_lru_unit.py b/test/registered/unit/mem_cache/test_hicache_file_lru_unit.py index 930741125..e396ccdea 100644 --- a/test/registered/unit/mem_cache/test_hicache_file_lru_unit.py +++ b/test/registered/unit/mem_cache/test_hicache_file_lru_unit.py @@ -14,7 +14,7 @@ Run with: from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import os import shutil diff --git a/test/registered/unit/mem_cache/test_hicache_host_register.py b/test/registered/unit/mem_cache/test_hicache_host_register.py index e12f30cd1..d8d0fe32a 100644 --- a/test/registered/unit/mem_cache/test_hicache_host_register.py +++ b/test/registered/unit/mem_cache/test_hicache_host_register.py @@ -27,7 +27,7 @@ from sglang.srt.mem_cache.pool_host.mha import ( from sglang.srt.mem_cache.pool_host.mla import MLATokenToKVPoolHost from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class _FakeBuffer: diff --git a/test/registered/unit/mem_cache/test_hicache_nixl_cleaner.py b/test/registered/unit/mem_cache/test_hicache_nixl_cleaner.py index 90f6e17af..735d1517c 100644 --- a/test/registered/unit/mem_cache/test_hicache_nixl_cleaner.py +++ b/test/registered/unit/mem_cache/test_hicache_nixl_cleaner.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import os import shutil diff --git a/test/registered/unit/mem_cache/test_hicache_nixl_storage.py b/test/registered/unit/mem_cache/test_hicache_nixl_storage.py index 827525493..23cf2bad9 100644 --- a/test/registered/unit/mem_cache/test_hicache_nixl_storage.py +++ b/test/registered/unit/mem_cache/test_hicache_nixl_storage.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") import os import shutil diff --git a/test/registered/unit/mem_cache/test_hicache_staged_write_back_dispatch.py b/test/registered/unit/mem_cache/test_hicache_staged_write_back_dispatch.py index df1c6c74e..7b58978a6 100644 --- a/test/registered/unit/mem_cache/test_hicache_staged_write_back_dispatch.py +++ b/test/registered/unit/mem_cache/test_hicache_staged_write_back_dispatch.py @@ -34,7 +34,7 @@ from sglang.srt.mem_cache.pool_host.mla import MLATokenToKVPoolHost from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") MEMORY_POOL_HOST_MODULE = "sglang.srt.mem_cache.memory_pool_host" DSA_POOL_HOST_MODULE = "sglang.srt.mem_cache.pool_host.dsa" diff --git a/test/registered/unit/mem_cache/test_hiradix_cache_unit.py b/test/registered/unit/mem_cache/test_hiradix_cache_unit.py index b2ebea42a..7b14853f9 100644 --- a/test/registered/unit/mem_cache/test_hiradix_cache_unit.py +++ b/test/registered/unit/mem_cache/test_hiradix_cache_unit.py @@ -17,7 +17,7 @@ from sglang.srt.server_args import ServerArgs, set_global_server_args_for_schedu from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=15, stage="stage-b", runner_config="1-gpu-small-amd") PAGE_SIZE = 2 diff --git a/test/registered/unit/mem_cache/test_hiradix_pp_sync_drain.py b/test/registered/unit/mem_cache/test_hiradix_pp_sync_drain.py index 05bf95168..8b8520833 100644 --- a/test/registered/unit/mem_cache/test_hiradix_pp_sync_drain.py +++ b/test/registered/unit/mem_cache/test_hiradix_pp_sync_drain.py @@ -11,7 +11,7 @@ from sglang.srt.mem_cache.hiradix_cache import HiRadixCache from sglang.srt.mem_cache.unified_radix_cache import UnifiedRadixCache from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeWork: diff --git a/test/registered/unit/mem_cache/test_hisparse_allocator.py b/test/registered/unit/mem_cache/test_hisparse_allocator.py index 837adf53c..a5dd2d1db 100644 --- a/test/registered/unit/mem_cache/test_hisparse_allocator.py +++ b/test/registered/unit/mem_cache/test_hisparse_allocator.py @@ -15,7 +15,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestHiSparseDecodeRemap(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_hisparse_max_token_pool_size.py b/test/registered/unit/mem_cache/test_hisparse_max_token_pool_size.py index 17bd843be..b96591a01 100644 --- a/test/registered/unit/mem_cache/test_hisparse_max_token_pool_size.py +++ b/test/registered/unit/mem_cache/test_hisparse_max_token_pool_size.py @@ -23,7 +23,7 @@ from sglang.test.separate_buffer_allocator_double import ( ) from sglang.test.test_utils import CustomTestCase, enter_override -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_model_runner(**attrs): diff --git a/test/registered/unit/mem_cache/test_hisparse_slot_translation.py b/test/registered/unit/mem_cache/test_hisparse_slot_translation.py index b0833784d..f86913eba 100644 --- a/test/registered/unit/mem_cache/test_hisparse_slot_translation.py +++ b/test/registered/unit/mem_cache/test_hisparse_slot_translation.py @@ -10,7 +10,7 @@ from sglang.srt.mem_cache.hisparse_memory_pool import HiSparseDSATokenToKVPool from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, stage="base-a", runner_config="cpu") +register_cpu_ci(est_time=7, stage="base-a", runner_config="cpu") class TestHiSparseSlotTranslation(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_host_memory.py b/test/registered/unit/mem_cache/test_host_memory.py index 7e8a9034f..2cb391c3e 100644 --- a/test/registered/unit/mem_cache/test_host_memory.py +++ b/test/registered/unit/mem_cache/test_host_memory.py @@ -8,7 +8,7 @@ from unittest.mock import Mock, patch from sglang.srt.mem_cache import host_memory from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") class TestHostMemory(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_hybrid_pool_assembler.py b/test/registered/unit/mem_cache/test_hybrid_pool_assembler.py index 4181e6f27..b5ab6cbf9 100644 --- a/test/registered/unit/mem_cache/test_hybrid_pool_assembler.py +++ b/test/registered/unit/mem_cache/test_hybrid_pool_assembler.py @@ -21,7 +21,7 @@ from sglang.srt.mem_cache.memory_pool import HybridLinearKVPool from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestDeepSeekV4SWAPageLayout(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_inkling_sconv_strided_conv_state.py b/test/registered/unit/mem_cache/test_inkling_sconv_strided_conv_state.py index 30d4e9c7e..1f962af6e 100644 --- a/test/registered/unit/mem_cache/test_inkling_sconv_strided_conv_state.py +++ b/test/registered/unit/mem_cache/test_inkling_sconv_strided_conv_state.py @@ -53,7 +53,7 @@ import torch import sglang.kernels.jit as _jit_pkg from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") _KERNEL_DIR = Path(_jit_pkg.__file__).parent / "csrc" / "inkling" diff --git a/test/registered/unit/mem_cache/test_kv_index_translator.py b/test/registered/unit/mem_cache/test_kv_index_translator.py index 45768e04a..ffe02b102 100644 --- a/test/registered/unit/mem_cache/test_kv_index_translator.py +++ b/test/registered/unit/mem_cache/test_kv_index_translator.py @@ -21,7 +21,7 @@ from sglang.srt.runtime_context import publish, reset_context from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/mem_cache/test_layout_compat.py b/test/registered/unit/mem_cache/test_layout_compat.py index 19a5e836d..f11d33acb 100644 --- a/test/registered/unit/mem_cache/test_layout_compat.py +++ b/test/registered/unit/mem_cache/test_layout_compat.py @@ -21,7 +21,7 @@ envelope formula byte for byte. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/mem_cache/test_linker_pool_assembler.py b/test/registered/unit/mem_cache/test_linker_pool_assembler.py index de912c7a1..ee6c690a5 100644 --- a/test/registered/unit/mem_cache/test_linker_pool_assembler.py +++ b/test/registered/unit/mem_cache/test_linker_pool_assembler.py @@ -21,7 +21,7 @@ from sglang.srt.mem_cache.unified_cache.component_type import ComponentType from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestDevicePoolEntry(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_mamba_donated_alloc_ratio.py b/test/registered/unit/mem_cache/test_mamba_donated_alloc_ratio.py index b628d176b..4c5723970 100644 --- a/test/registered/unit/mem_cache/test_mamba_donated_alloc_ratio.py +++ b/test/registered/unit/mem_cache/test_mamba_donated_alloc_ratio.py @@ -26,7 +26,7 @@ from sglang.srt.mem_cache.unified_cache.unified_tree_core import UnifiedTreeCore from sglang.srt.mem_cache.unified_radix_cache import UnifiedTreeNode from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") N = 4 # concurrent distinct-prefix requests diff --git a/test/registered/unit/mem_cache/test_mamba_path_state_cap.py b/test/registered/unit/mem_cache/test_mamba_path_state_cap.py index c22b20034..2b40ee7c1 100644 --- a/test/registered/unit/mem_cache/test_mamba_path_state_cap.py +++ b/test/registered/unit/mem_cache/test_mamba_path_state_cap.py @@ -3,8 +3,8 @@ from sglang.srt.arg_groups.mamba_hook import handle_mamba_backend from sglang.test.ci.ci_register import register_cpu_ci, register_cuda_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") import argparse import unittest diff --git a/test/registered/unit/mem_cache/test_mamba_state_transfer_buffers.py b/test/registered/unit/mem_cache/test_mamba_state_transfer_buffers.py index 4b889a735..744ea4d3e 100644 --- a/test/registered/unit/mem_cache/test_mamba_state_transfer_buffers.py +++ b/test/registered/unit/mem_cache/test_mamba_state_transfer_buffers.py @@ -5,7 +5,7 @@ import torch from sglang.srt.mem_cache.memory_pool import MambaPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") NUM_LAYERS = 2 NUM_SLOTS = 3 diff --git a/test/registered/unit/mem_cache/test_mamba_unittest.py b/test/registered/unit/mem_cache/test_mamba_unittest.py index e2d0c21e1..a42f41c77 100755 --- a/test/registered/unit/mem_cache/test_mamba_unittest.py +++ b/test/registered/unit/mem_cache/test_mamba_unittest.py @@ -24,7 +24,7 @@ from sglang.test.ci.ci_register import ( register_xpu_ci, ) -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=9, suite="stage-b-test-1-gpu-small-amd") register_xpu_ci(est_time=20, suite="stage-b-test-1-gpu-xpu") diff --git a/test/registered/unit/mem_cache/test_mem_cache_utils.py b/test/registered/unit/mem_cache/test_mem_cache_utils.py index 0385a25dc..8670ddd9a 100644 --- a/test/registered/unit/mem_cache/test_mem_cache_utils.py +++ b/test/registered/unit/mem_cache/test_mem_cache_utils.py @@ -28,7 +28,7 @@ from sglang.srt.mem_cache.utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _legacy_get_hash_str(token_ids, prior_hash=None): diff --git a/test/registered/unit/mem_cache/test_mem_pool_host.py b/test/registered/unit/mem_cache/test_mem_pool_host.py index bcc54d0fb..990d473f7 100644 --- a/test/registered/unit/mem_cache/test_mem_pool_host.py +++ b/test/registered/unit/mem_cache/test_mem_pool_host.py @@ -19,7 +19,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestHostKVCache(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_minimax_sparse_pool_host_unit.py b/test/registered/unit/mem_cache/test_minimax_sparse_pool_host_unit.py index 94c98edc2..62768387e 100644 --- a/test/registered/unit/mem_cache/test_minimax_sparse_pool_host_unit.py +++ b/test/registered/unit/mem_cache/test_minimax_sparse_pool_host_unit.py @@ -21,7 +21,7 @@ from sglang.srt.mem_cache.pool_host.mha import ( from sglang.srt.utils import is_cuda, is_hip, is_npu, is_xpu from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=9, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/unit/mem_cache/test_minimax_sparse_pool_pd_unit.py b/test/registered/unit/mem_cache/test_minimax_sparse_pool_pd_unit.py index 96921199d..33501ec94 100644 --- a/test/registered/unit/mem_cache/test_minimax_sparse_pool_pd_unit.py +++ b/test/registered/unit/mem_cache/test_minimax_sparse_pool_pd_unit.py @@ -12,7 +12,7 @@ from sglang.srt.mem_cache.pool_host.mha import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _make_k_only_pool( diff --git a/test/registered/unit/mem_cache/test_mla_host_dedup_primitives.py b/test/registered/unit/mem_cache/test_mla_host_dedup_primitives.py index 57c6905d8..aeb710eef 100644 --- a/test/registered/unit/mem_cache/test_mla_host_dedup_primitives.py +++ b/test/registered/unit/mem_cache/test_mla_host_dedup_primitives.py @@ -14,7 +14,7 @@ from sglang.srt.mem_cache.pool_host.dsa import DSAIndexerPoolHost from sglang.srt.mem_cache.pool_host.mla import MLATokenToKVPoolHost from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _device_pool_stub(*, layer_num: int, **fields) -> SimpleNamespace: diff --git a/test/registered/unit/mem_cache/test_mmap_allocator.py b/test/registered/unit/mem_cache/test_mmap_allocator.py index 3090b1671..1201e7040 100644 --- a/test/registered/unit/mem_cache/test_mmap_allocator.py +++ b/test/registered/unit/mem_cache/test_mmap_allocator.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import sys diff --git a/test/registered/unit/mem_cache/test_mooncake_group_semantics.py b/test/registered/unit/mem_cache/test_mooncake_group_semantics.py index 0e814df53..ac17bb3aa 100644 --- a/test/registered/unit/mem_cache/test_mooncake_group_semantics.py +++ b/test/registered/unit/mem_cache/test_mooncake_group_semantics.py @@ -12,7 +12,7 @@ from sglang.srt.mem_cache.hicache_storage import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class ReplicateConfigWithGroupIds: diff --git a/test/registered/unit/mem_cache/test_mooncake_ssd_offload_path.py b/test/registered/unit/mem_cache/test_mooncake_ssd_offload_path.py index f7c19fdeb..a2fe73b9e 100644 --- a/test/registered/unit/mem_cache/test_mooncake_ssd_offload_path.py +++ b/test/registered/unit/mem_cache/test_mooncake_ssd_offload_path.py @@ -8,7 +8,7 @@ from sglang.srt.mem_cache.hicache_storage import HiCacheStorageConfig from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _fake_store_class(): diff --git a/test/registered/unit/mem_cache/test_mooncake_standalone_dummy_mamba.py b/test/registered/unit/mem_cache/test_mooncake_standalone_dummy_mamba.py index cc17328f3..ac321adfd 100644 --- a/test/registered/unit/mem_cache/test_mooncake_standalone_dummy_mamba.py +++ b/test/registered/unit/mem_cache/test_mooncake_standalone_dummy_mamba.py @@ -5,7 +5,7 @@ from unittest.mock import patch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _fake_mooncake_modules(fake_store_cls): diff --git a/test/registered/unit/mem_cache/test_mooncake_store_config.py b/test/registered/unit/mem_cache/test_mooncake_store_config.py index 6b724cf82..8f310803f 100644 --- a/test/registered/unit/mem_cache/test_mooncake_store_config.py +++ b/test/registered/unit/mem_cache/test_mooncake_store_config.py @@ -16,7 +16,7 @@ from sglang.srt.utils.common import temp_set_env from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestMooncakeStoreConfigLocalHostname(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_mooncake_tenant_config.py b/test/registered/unit/mem_cache/test_mooncake_tenant_config.py index c938a18de..52c634026 100644 --- a/test/registered/unit/mem_cache/test_mooncake_tenant_config.py +++ b/test/registered/unit/mem_cache/test_mooncake_tenant_config.py @@ -12,7 +12,7 @@ from sglang.srt.mem_cache.storage.mooncake_store.mooncake_store import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _fake_mooncake_modules(fake_store_cls): diff --git a/test/registered/unit/mem_cache/test_multi_ended_allocator.py b/test/registered/unit/mem_cache/test_multi_ended_allocator.py index 2418d9bea..78489eb0b 100644 --- a/test/registered/unit/mem_cache/test_multi_ended_allocator.py +++ b/test/registered/unit/mem_cache/test_multi_ended_allocator.py @@ -20,7 +20,7 @@ suite runs on CPU apart from the cases that skip themselves without CUDA. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") import contextlib import random diff --git a/test/registered/unit/mem_cache/test_mxfp8_mha_pool_host_unit.py b/test/registered/unit/mem_cache/test_mxfp8_mha_pool_host_unit.py index f216c4f56..6c99abc5a 100644 --- a/test/registered/unit/mem_cache/test_mxfp8_mha_pool_host_unit.py +++ b/test/registered/unit/mem_cache/test_mxfp8_mha_pool_host_unit.py @@ -16,7 +16,7 @@ from sglang.srt.mem_cache.pool_host.mha_mxfp8 import MHATokenToKVPoolMXFP8Host from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") MXFP8_MODULE = "sglang.srt.mem_cache.pool_host.mha_mxfp8" MHA_MODULE = "sglang.srt.mem_cache.pool_host.mha" diff --git a/test/registered/unit/mem_cache/test_mxfp8_scale_transfer_buffers.py b/test/registered/unit/mem_cache/test_mxfp8_scale_transfer_buffers.py index 5484c7ae4..d62bd9739 100644 --- a/test/registered/unit/mem_cache/test_mxfp8_scale_transfer_buffers.py +++ b/test/registered/unit/mem_cache/test_mxfp8_scale_transfer_buffers.py @@ -5,7 +5,7 @@ import torch from sglang.srt.mem_cache.memory_pool import MHATokenToKVPoolMXFP8 from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") LAYERS = 2 PAGE_SIZE = 128 diff --git a/test/registered/unit/mem_cache/test_npu_mamba_async_layout.py b/test/registered/unit/mem_cache/test_npu_mamba_async_layout.py index 01b05bd96..3256046aa 100644 --- a/test/registered/unit/mem_cache/test_npu_mamba_async_layout.py +++ b/test/registered/unit/mem_cache/test_npu_mamba_async_layout.py @@ -12,7 +12,7 @@ from sglang.srt.mem_cache.pool_host.mamba import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestNPUMambaAsyncConfig(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_page_interleave_shard.py b/test/registered/unit/mem_cache/test_page_interleave_shard.py index 8ddcd37d4..f7043807f 100644 --- a/test/registered/unit/mem_cache/test_page_interleave_shard.py +++ b/test/registered/unit/mem_cache/test_page_interleave_shard.py @@ -86,7 +86,7 @@ from sglang.srt.utils import ceil_div from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase, publish_build_topology -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") N = 4 # shard size PS = 16 # physical page size diff --git a/test/registered/unit/mem_cache/test_page_major_layout.py b/test/registered/unit/mem_cache/test_page_major_layout.py index 090c3592b..e78c23918 100644 --- a/test/registered/unit/mem_cache/test_page_major_layout.py +++ b/test/registered/unit/mem_cache/test_page_major_layout.py @@ -12,7 +12,7 @@ Runs on CPU — pure-torch advanced indexing, no Triton. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/mem_cache/test_paged_allocator_lazy_release.py b/test/registered/unit/mem_cache/test_paged_allocator_lazy_release.py index 908e3ecb6..475946eba 100644 --- a/test/registered/unit/mem_cache/test_paged_allocator_lazy_release.py +++ b/test/registered/unit/mem_cache/test_paged_allocator_lazy_release.py @@ -9,7 +9,7 @@ from sglang.srt.mem_cache.allocator.paged import PagedTokenToKVPoolAllocator from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") PAGE_SIZE = 2 NUM_PAGES = 16 diff --git a/test/registered/unit/mem_cache/test_paged_free_segment.py b/test/registered/unit/mem_cache/test_paged_free_segment.py index 30bdbac06..c096f4fd2 100644 --- a/test/registered/unit/mem_cache/test_paged_free_segment.py +++ b/test/registered/unit/mem_cache/test_paged_free_segment.py @@ -17,7 +17,7 @@ from sglang.srt.mem_cache.allocator.paged import PagedTokenToKVPoolAllocator from sglang.srt.mem_cache.common import _release_overallocated_kv_indices from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") PAGE_SIZE = 4 NUM_PAGES = 64 diff --git a/test/registered/unit/mem_cache/test_pd_envelope_transfer_layout.py b/test/registered/unit/mem_cache/test_pd_envelope_transfer_layout.py index 8ecfb9676..4a31377f0 100644 --- a/test/registered/unit/mem_cache/test_pd_envelope_transfer_layout.py +++ b/test/registered/unit/mem_cache/test_pd_envelope_transfer_layout.py @@ -28,7 +28,7 @@ from sglang.srt.mem_cache.layout.page_major import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestMLAEnvelopeTransferAddressing(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_pp_prefetch_ticket.py b/test/registered/unit/mem_cache/test_pp_prefetch_ticket.py index 6802af04e..d600a4b5a 100644 --- a/test/registered/unit/mem_cache/test_pp_prefetch_ticket.py +++ b/test/registered/unit/mem_cache/test_pp_prefetch_ticket.py @@ -26,7 +26,7 @@ from sglang.srt.mem_cache.unified_radix_cache import UnifiedRadixCache from sglang.srt.mem_cache.utils import get_storage_hash_str from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=15, suite="base-a-test-cpu") class TestPPPrefetchTicket(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_prefill_memory_budget.py b/test/registered/unit/mem_cache/test_prefill_memory_budget.py index 2a73dfffc..b4ba6bbc0 100644 --- a/test/registered/unit/mem_cache/test_prefill_memory_budget.py +++ b/test/registered/unit/mem_cache/test_prefill_memory_budget.py @@ -27,7 +27,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.srt.sampling.sampling_params import SamplingParams from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _shared_allocator(*, page_size=4, total_bytes=1024): diff --git a/test/registered/unit/mem_cache/test_pure_swa_chunk_cache.py b/test/registered/unit/mem_cache/test_pure_swa_chunk_cache.py index 6fd818a16..43036addc 100644 --- a/test/registered/unit/mem_cache/test_pure_swa_chunk_cache.py +++ b/test/registered/unit/mem_cache/test_pure_swa_chunk_cache.py @@ -9,7 +9,7 @@ from sglang.srt.mem_cache.chunk_cache import PureSWAChunkCache from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeAllocator: diff --git a/test/registered/unit/mem_cache/test_pure_swa_radix_cache.py b/test/registered/unit/mem_cache/test_pure_swa_radix_cache.py index 25d3911cf..d34d36fef 100644 --- a/test/registered/unit/mem_cache/test_pure_swa_radix_cache.py +++ b/test/registered/unit/mem_cache/test_pure_swa_radix_cache.py @@ -9,7 +9,7 @@ from sglang.srt.mem_cache.pure_swa_radix_cache import PureSWARadixCache from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeAllocator: diff --git a/test/registered/unit/mem_cache/test_qsa_kv_pool.py b/test/registered/unit/mem_cache/test_qsa_kv_pool.py index 94507a686..6eb55b333 100644 --- a/test/registered/unit/mem_cache/test_qsa_kv_pool.py +++ b/test/registered/unit/mem_cache/test_qsa_kv_pool.py @@ -9,7 +9,7 @@ from sglang.srt.mem_cache.memory_pool import HybridLinearKVPool from sglang.srt.mem_cache.qsa_kv_pool import QSATokenToKVPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def test_qsa_allocations_follow_parent_mooncake_scope(monkeypatch): diff --git a/test/registered/unit/mem_cache/test_quantized_kv_pool.py b/test/registered/unit/mem_cache/test_quantized_kv_pool.py index 51da4b896..572fe5c90 100644 --- a/test/registered/unit/mem_cache/test_quantized_kv_pool.py +++ b/test/registered/unit/mem_cache/test_quantized_kv_pool.py @@ -8,7 +8,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class _FakeQuantMethod: diff --git a/test/registered/unit/mem_cache/test_radix_cache_cpp_unit.py b/test/registered/unit/mem_cache/test_radix_cache_cpp_unit.py index 49fdf0b83..b4a5bf586 100644 --- a/test/registered/unit/mem_cache/test_radix_cache_cpp_unit.py +++ b/test/registered/unit/mem_cache/test_radix_cache_cpp_unit.py @@ -9,7 +9,7 @@ from unittest.mock import patch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestRadixCacheCppCacheSalt(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py b/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py index 1a28b67b6..af982a1a7 100644 --- a/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py +++ b/test/registered/unit/mem_cache/test_radix_cache_slru_accuracy.py @@ -14,7 +14,7 @@ from sglang.srt.mem_cache.memory_pool import MHATokenToKVPool, ReqToTokenPool from sglang.srt.mem_cache.radix_cache import RadixCache, RadixKey from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestSLRUAccuracy(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_radix_force_miss.py b/test/registered/unit/mem_cache/test_radix_force_miss.py index 38d670712..55e84080f 100644 --- a/test/registered/unit/mem_cache/test_radix_force_miss.py +++ b/test/registered/unit/mem_cache/test_radix_force_miss.py @@ -7,7 +7,7 @@ RadixCache. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest import unittest.mock diff --git a/test/registered/unit/mem_cache/test_registry.py b/test/registered/unit/mem_cache/test_registry.py index 47bb5671c..6bbfb3cb6 100644 --- a/test/registered/unit/mem_cache/test_registry.py +++ b/test/registered/unit/mem_cache/test_registry.py @@ -3,7 +3,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest from unittest.mock import MagicMock, patch diff --git a/test/registered/unit/mem_cache/test_replayssm_ring_accounting.py b/test/registered/unit/mem_cache/test_replayssm_ring_accounting.py index 6377f6c11..1d61f1d89 100644 --- a/test/registered/unit/mem_cache/test_replayssm_ring_accounting.py +++ b/test/registered/unit/mem_cache/test_replayssm_ring_accounting.py @@ -23,7 +23,7 @@ from sglang.srt.mem_cache.kv_cache_configurator import _pp_local_per_request_byt from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # temporal = (hv=4, v_dim=8, k_dim=8), num_k_heads_per_tp = 4, record_len = 8, # 2 layers. conv bf16 (2B), fp32 gate/beta (4B). Ring tensors (per slot, per diff --git a/test/registered/unit/mem_cache/test_retraction_mamba_backup.py b/test/registered/unit/mem_cache/test_retraction_mamba_backup.py index adc138b6d..0ba6522e6 100644 --- a/test/registered/unit/mem_cache/test_retraction_mamba_backup.py +++ b/test/registered/unit/mem_cache/test_retraction_mamba_backup.py @@ -6,7 +6,7 @@ from sglang.srt.managers.schedule_batch import Req, ReqKvInfo from sglang.srt.mem_cache.memory_pool import HybridReqToTokenPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") MAMBA_STATE = object() diff --git a/test/registered/unit/mem_cache/test_rust_tree_core.py b/test/registered/unit/mem_cache/test_rust_tree_core.py index ad46007d0..dfdbabef4 100644 --- a/test/registered/unit/mem_cache/test_rust_tree_core.py +++ b/test/registered/unit/mem_cache/test_rust_tree_core.py @@ -12,7 +12,7 @@ from unified_tree_core_inspection_interface import UnifiedTreeCoreInspectionInte from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=17, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") if shutil.which("cargo") is None: pytest.skip("the rust backend builds with cargo", allow_module_level=True) diff --git a/test/registered/unit/mem_cache/test_rust_tree_core_integration.py b/test/registered/unit/mem_cache/test_rust_tree_core_integration.py index 6e710ed37..30e037736 100644 --- a/test/registered/unit/mem_cache/test_rust_tree_core_integration.py +++ b/test/registered/unit/mem_cache/test_rust_tree_core_integration.py @@ -11,7 +11,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=17, suite="base-a-test-cpu") +register_cpu_ci(est_time=19, suite="base-a-test-cpu") if shutil.which("cargo") is None: pytest.skip("the rust backend builds with cargo", allow_module_level=True) diff --git a/test/registered/unit/mem_cache/test_rust_unified_radix_cache_bench.py b/test/registered/unit/mem_cache/test_rust_unified_radix_cache_bench.py index 9fbd2dae5..1d0ac3341 100644 --- a/test/registered/unit/mem_cache/test_rust_unified_radix_cache_bench.py +++ b/test/registered/unit/mem_cache/test_rust_unified_radix_cache_bench.py @@ -6,7 +6,7 @@ import test_unified_radix_cache_bench as shared_suite from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=25, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=22, stage="base-b", runner_config="1-gpu-small") class RustBackendSuite(unittest.TestSuite): diff --git a/test/registered/unit/mem_cache/test_rust_unified_radix_cache_unittest.py b/test/registered/unit/mem_cache/test_rust_unified_radix_cache_unittest.py index 06227b4f7..74d21c050 100644 --- a/test/registered/unit/mem_cache/test_rust_unified_radix_cache_unittest.py +++ b/test/registered/unit/mem_cache/test_rust_unified_radix_cache_unittest.py @@ -6,7 +6,7 @@ import test_unified_radix_cache_unittest as shared_suite from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=57, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-small") class RustBackendSuite(unittest.TestSuite): diff --git a/test/registered/unit/mem_cache/test_session_token_share_unit.py b/test/registered/unit/mem_cache/test_session_token_share_unit.py index cf12e063c..de433f7a7 100644 --- a/test/registered/unit/mem_cache/test_session_token_share_unit.py +++ b/test/registered/unit/mem_cache/test_session_token_share_unit.py @@ -10,7 +10,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest from array import array diff --git a/test/registered/unit/mem_cache/test_session_unified_radix_cache.py b/test/registered/unit/mem_cache/test_session_unified_radix_cache.py index e50475985..f4a80a7ee 100644 --- a/test/registered/unit/mem_cache/test_session_unified_radix_cache.py +++ b/test/registered/unit/mem_cache/test_session_unified_radix_cache.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest from array import array diff --git a/test/registered/unit/mem_cache/test_storage_prefetch_lifecycle.py b/test/registered/unit/mem_cache/test_storage_prefetch_lifecycle.py index 29331c03f..2ba05f812 100644 --- a/test/registered/unit/mem_cache/test_storage_prefetch_lifecycle.py +++ b/test/registered/unit/mem_cache/test_storage_prefetch_lifecycle.py @@ -32,7 +32,7 @@ from sglang.srt.mem_cache.unified_radix_cache import ( from sglang.srt.mem_cache.utils import get_hash_str from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=19, suite="base-a-test-cpu") _REQ = CacheRequestHandle("r", 0) diff --git a/test/registered/unit/mem_cache/test_streaming_session_unit.py b/test/registered/unit/mem_cache/test_streaming_session_unit.py index 166106dd3..0581daf78 100644 --- a/test/registered/unit/mem_cache/test_streaming_session_unit.py +++ b/test/registered/unit/mem_cache/test_streaming_session_unit.py @@ -8,7 +8,7 @@ from sglang.srt.mem_cache.base_prefix_cache import DecLockRefParams, MatchResult from sglang.srt.session.streaming_session import SessionSlot, StreamingSession from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeAllocator(BaseTokenToKVPoolAllocator): diff --git a/test/registered/unit/mem_cache/test_swa_alloc_extend_page_estimation.py b/test/registered/unit/mem_cache/test_swa_alloc_extend_page_estimation.py index 08c153e35..c912cea44 100644 --- a/test/registered/unit/mem_cache/test_swa_alloc_extend_page_estimation.py +++ b/test/registered/unit/mem_cache/test_swa_alloc_extend_page_estimation.py @@ -15,7 +15,7 @@ from sglang.srt.mem_cache.allocator.swa import SWATokenToKVPoolAllocator from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _make_self(*, page_size: int, full_available: int, swa_available: int): diff --git a/test/registered/unit/mem_cache/test_swa_cpu_copy_filter.py b/test/registered/unit/mem_cache/test_swa_cpu_copy_filter.py index 4b4a82bd7..0d5baf8a0 100644 --- a/test/registered/unit/mem_cache/test_swa_cpu_copy_filter.py +++ b/test/registered/unit/mem_cache/test_swa_cpu_copy_filter.py @@ -9,7 +9,7 @@ from sglang.srt.mem_cache.swa_memory_pool import SWAKVPool from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") ROWS = 4 diff --git a/test/registered/unit/mem_cache/test_swa_locked_full_recover_unified.py b/test/registered/unit/mem_cache/test_swa_locked_full_recover_unified.py index 2be88d351..51811cabb 100644 --- a/test/registered/unit/mem_cache/test_swa_locked_full_recover_unified.py +++ b/test/registered/unit/mem_cache/test_swa_locked_full_recover_unified.py @@ -41,7 +41,7 @@ from sglang.srt.mem_cache.unified_cache.components.swa import SWAComponent from sglang.srt.mem_cache.unified_memory_pool import MHASubPoolSpec, UnifiedKVPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") _DEV = "cpu" _SWA = ComponentType.SWA diff --git a/test/registered/unit/mem_cache/test_swa_pool_v_head_dim.py b/test/registered/unit/mem_cache/test_swa_pool_v_head_dim.py index d3fd443af..f4cd95572 100644 --- a/test/registered/unit/mem_cache/test_swa_pool_v_head_dim.py +++ b/test/registered/unit/mem_cache/test_swa_pool_v_head_dim.py @@ -27,7 +27,7 @@ import torch from sglang.srt.mem_cache.swa_memory_pool import SWAKVPool from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") _DEV = "cpu" _FULL_V_HEAD_DIM = 8 diff --git a/test/registered/unit/mem_cache/test_swa_ring_page_return.py b/test/registered/unit/mem_cache/test_swa_ring_page_return.py index 858a49d86..a7333364c 100644 --- a/test/registered/unit/mem_cache/test_swa_ring_page_return.py +++ b/test/registered/unit/mem_cache/test_swa_ring_page_return.py @@ -19,7 +19,7 @@ from sglang.srt.mem_cache.allocator.swa import SWATokenToKVPoolAllocator from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") PAGE_SIZE = 8 POOL_PAGES = 4 diff --git a/test/registered/unit/mem_cache/test_swa_unittest.py b/test/registered/unit/mem_cache/test_swa_unittest.py index cab272388..c5505a3f6 100644 --- a/test/registered/unit/mem_cache/test_swa_unittest.py +++ b/test/registered/unit/mem_cache/test_swa_unittest.py @@ -23,7 +23,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/mem_cache/test_tlru_eviction_policy.py b/test/registered/unit/mem_cache/test_tlru_eviction_policy.py index 0e56fdf24..1c7f70f10 100644 --- a/test/registered/unit/mem_cache/test_tlru_eviction_policy.py +++ b/test/registered/unit/mem_cache/test_tlru_eviction_policy.py @@ -24,7 +24,7 @@ except ImportError: # standalone run without an sglang install; CI parses the pass -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") _HERE = os.path.dirname(os.path.abspath(__file__)) _EVICT_POLICY = os.path.normpath( diff --git a/test/registered/unit/mem_cache/test_tree_core_registry.py b/test/registered/unit/mem_cache/test_tree_core_registry.py index 11c8b9d59..237b18f1d 100644 --- a/test/registered/unit/mem_cache/test_tree_core_registry.py +++ b/test/registered/unit/mem_cache/test_tree_core_registry.py @@ -24,7 +24,7 @@ from sglang.srt.mem_cache.unified_radix_cache import UnifiedRadixCache from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _cache_init_params(**kwargs) -> CacheInitParams: diff --git a/test/registered/unit/mem_cache/test_umbp_host_allocator.py b/test/registered/unit/mem_cache/test_umbp_host_allocator.py index 2c02f2957..b44a3f9ac 100644 --- a/test/registered/unit/mem_cache/test_umbp_host_allocator.py +++ b/test/registered/unit/mem_cache/test_umbp_host_allocator.py @@ -12,7 +12,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") # These tests stub out mori with a fake in-process module, so they need neither # a real mori install nor a GPU and run on NVIDIA / CPU CI. diff --git a/test/registered/unit/mem_cache/test_unified_byte_accounting.py b/test/registered/unit/mem_cache/test_unified_byte_accounting.py index ee7a7e74a..77e81dfca 100644 --- a/test/registered/unit/mem_cache/test_unified_byte_accounting.py +++ b/test/registered/unit/mem_cache/test_unified_byte_accounting.py @@ -36,7 +36,7 @@ from sglang.srt.runtime_context import publish, reset_context from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _swa_composite(): diff --git a/test/registered/unit/mem_cache/test_unified_byte_budget_sizing.py b/test/registered/unit/mem_cache/test_unified_byte_budget_sizing.py index d90ca5c45..6ab004009 100644 --- a/test/registered/unit/mem_cache/test_unified_byte_budget_sizing.py +++ b/test/registered/unit/mem_cache/test_unified_byte_budget_sizing.py @@ -40,7 +40,7 @@ from sglang.srt.mem_cache.unified_memory_pool import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") _DEV = "cpu" diff --git a/test/registered/unit/mem_cache/test_unified_cache_linker.py b/test/registered/unit/mem_cache/test_unified_cache_linker.py index fe6ba8ce9..41496ee9b 100644 --- a/test/registered/unit/mem_cache/test_unified_cache_linker.py +++ b/test/registered/unit/mem_cache/test_unified_cache_linker.py @@ -50,8 +50,8 @@ from sglang.srt.mem_cache.unified_cache.unified_cache_linker import ( from sglang.srt.mem_cache.unified_radix_cache import UnifiedRadixCache from sglang.test.ci.ci_register import register_cpu_ci, register_cuda_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") -register_cuda_ci(est_time=100, stage="base-b", runner_config="1-gpu-small") +register_cpu_ci(est_time=17, suite="base-a-test-cpu") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") class _FakeLinker(UnifiedCacheLinker): diff --git a/test/registered/unit/mem_cache/test_unified_capacity_memo.py b/test/registered/unit/mem_cache/test_unified_capacity_memo.py index d28939aea..559e34265 100644 --- a/test/registered/unit/mem_cache/test_unified_capacity_memo.py +++ b/test/registered/unit/mem_cache/test_unified_capacity_memo.py @@ -29,7 +29,7 @@ import unittest from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _build(lazy: bool): diff --git a/test/registered/unit/mem_cache/test_unified_free_no_host_sync.py b/test/registered/unit/mem_cache/test_unified_free_no_host_sync.py index 05063d710..f2b4cf82c 100644 --- a/test/registered/unit/mem_cache/test_unified_free_no_host_sync.py +++ b/test/registered/unit/mem_cache/test_unified_free_no_host_sync.py @@ -38,7 +38,7 @@ from sglang.srt.mem_cache.allocator import unified_sub_pool as mea from sglang.srt.mem_cache.allocator.base import BaseTokenToKVPoolAllocator from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") PAGE_SIZE = _PagedFixture.PAGE_SIZE diff --git a/test/registered/unit/mem_cache/test_unified_hicache_regressions.py b/test/registered/unit/mem_cache/test_unified_hicache_regressions.py index 4bd2da3a9..a5fd93819 100644 --- a/test/registered/unit/mem_cache/test_unified_hicache_regressions.py +++ b/test/registered/unit/mem_cache/test_unified_hicache_regressions.py @@ -18,7 +18,7 @@ from sglang.srt.mem_cache.unified_cache.component_type import ComponentType from sglang.srt.mem_cache.unified_cache.unified_tree_core import UnifiedTreeCore from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=15, stage="extra-a", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="extra-a", runner_config="1-gpu-small") class TestHiCacheIndexDomains(unittest.TestCase): diff --git a/test/registered/unit/mem_cache/test_unified_hicache_strided_state.py b/test/registered/unit/mem_cache/test_unified_hicache_strided_state.py index 476f65801..a4af5aac6 100644 --- a/test/registered/unit/mem_cache/test_unified_hicache_strided_state.py +++ b/test/registered/unit/mem_cache/test_unified_hicache_strided_state.py @@ -8,7 +8,7 @@ from sglang.srt.mem_cache.pool_host.mamba import MambaPoolHost from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestStridedStateDetection(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_unified_mamba_views.py b/test/registered/unit/mem_cache/test_unified_mamba_views.py index b9f1eef0a..ee52b4882 100644 --- a/test/registered/unit/mem_cache/test_unified_mamba_views.py +++ b/test/registered/unit/mem_cache/test_unified_mamba_views.py @@ -31,7 +31,7 @@ import torch from sglang.test.ci.ci_register import register_amd_ci, register_cpu_ci -register_cpu_ci(est_time=13, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") register_amd_ci(est_time=30, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/unit/mem_cache/test_unified_mha_views.py b/test/registered/unit/mem_cache/test_unified_mha_views.py index 1c400900d..3c10bdfac 100644 --- a/test/registered/unit/mem_cache/test_unified_mha_views.py +++ b/test/registered/unit/mem_cache/test_unified_mha_views.py @@ -23,7 +23,7 @@ Addressing law under test: from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/mem_cache/test_unified_mla_block_table.py b/test/registered/unit/mem_cache/test_unified_mla_block_table.py index a8204c7e3..6fe54601b 100644 --- a/test/registered/unit/mem_cache/test_unified_mla_block_table.py +++ b/test/registered/unit/mem_cache/test_unified_mla_block_table.py @@ -53,7 +53,7 @@ import torch from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=6, stage="base-b", runner_config="1-gpu-small") _HAS_CUDA = torch.cuda.is_available() _DEV = "cuda" diff --git a/test/registered/unit/mem_cache/test_unified_mla_gpu_parity.py b/test/registered/unit/mem_cache/test_unified_mla_gpu_parity.py index 9cb799690..a5f60955c 100644 --- a/test/registered/unit/mem_cache/test_unified_mla_gpu_parity.py +++ b/test/registered/unit/mem_cache/test_unified_mla_gpu_parity.py @@ -30,7 +30,7 @@ from sglang.srt.runtime_context import publish, reset_context from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") _HAS_CUDA = torch.cuda.is_available() _DEV = "cuda" diff --git a/test/registered/unit/mem_cache/test_unified_mla_views.py b/test/registered/unit/mem_cache/test_unified_mla_views.py index 0c0347327..00fc099ab 100644 --- a/test/registered/unit/mem_cache/test_unified_mla_views.py +++ b/test/registered/unit/mem_cache/test_unified_mla_views.py @@ -23,7 +23,7 @@ GPU parity of the read/write kernels (set_mla_kv_buffer TMA path etc.) lives in from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest from unittest import mock diff --git a/test/registered/unit/mem_cache/test_unified_npool_sweep.py b/test/registered/unit/mem_cache/test_unified_npool_sweep.py index 6af10bdd4..def6c8012 100644 --- a/test/registered/unit/mem_cache/test_unified_npool_sweep.py +++ b/test/registered/unit/mem_cache/test_unified_npool_sweep.py @@ -36,7 +36,7 @@ from sglang.test.ci.ci_register import register_cpu_ci # Hermetic convention of this directory's pool tests: plain unittest.TestCase, # only ci_register imported (no heavy sglang.test.test_utils chain). -register_cpu_ci(est_time=14, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") _DEV = "cpu" diff --git a/test/registered/unit/mem_cache/test_unified_radix_allocation_eviction.py b/test/registered/unit/mem_cache/test_unified_radix_allocation_eviction.py index 5b99273aa..6698bb161 100644 --- a/test/registered/unit/mem_cache/test_unified_radix_allocation_eviction.py +++ b/test/registered/unit/mem_cache/test_unified_radix_allocation_eviction.py @@ -18,7 +18,7 @@ from sglang.srt.mem_cache.unified_radix_cache import UnifiedRadixCache from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestUnifiedRadixAllocationEviction(CustomTestCase): diff --git a/test/registered/unit/mem_cache/test_unified_radix_cache_bench.py b/test/registered/unit/mem_cache/test_unified_radix_cache_bench.py index d02c06ee5..3e33abc5c 100644 --- a/test/registered/unit/mem_cache/test_unified_radix_cache_bench.py +++ b/test/registered/unit/mem_cache/test_unified_radix_cache_bench.py @@ -39,7 +39,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=29, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=26, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=25, suite="stage-b-test-1-gpu-small-amd") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/mem_cache/test_unified_radix_cache_unittest.py b/test/registered/unit/mem_cache/test_unified_radix_cache_unittest.py index 2ff2651ae..adf75bba5 100644 --- a/test/registered/unit/mem_cache/test_unified_radix_cache_unittest.py +++ b/test/registered/unit/mem_cache/test_unified_radix_cache_unittest.py @@ -108,7 +108,7 @@ from sglang.srt.utils import get_device from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=60, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=75, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=50, suite="stage-b-test-1-gpu-small-amd") # A dedicated test entry point overrides this without changing the process-wide diff --git a/test/registered/unit/mem_cache/test_unified_radix_hicache_dispatch.py b/test/registered/unit/mem_cache/test_unified_radix_hicache_dispatch.py index f13234817..6f5104c99 100644 --- a/test/registered/unit/mem_cache/test_unified_radix_hicache_dispatch.py +++ b/test/registered/unit/mem_cache/test_unified_radix_hicache_dispatch.py @@ -20,7 +20,7 @@ from sglang.srt.mem_cache.hybrid_cache.hybrid_pool_assembler import ( from sglang.srt.mem_cache.unified_cache.components import ComponentType from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _mock_kvcache(cls): diff --git a/test/registered/unit/memory/test_ptr_table.py b/test/registered/unit/memory/test_ptr_table.py index 0f5d09061..7c01c3632 100644 --- a/test/registered/unit/memory/test_ptr_table.py +++ b/test/registered/unit/memory/test_ptr_table.py @@ -7,7 +7,7 @@ real device memory lives in test/registered/xpu/test_ptr_table.py. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/model_executor/model_runner_components/test_attention_backend_setup.py b/test/registered/unit/model_executor/model_runner_components/test_attention_backend_setup.py index 426145ea3..77681e6ac 100644 --- a/test/registered/unit/model_executor/model_runner_components/test_attention_backend_setup.py +++ b/test/registered/unit/model_executor/model_runner_components/test_attention_backend_setup.py @@ -13,7 +13,7 @@ from sglang.srt.model_executor.model_runner_components.attention_backend_setup i ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _FakeBackend: diff --git a/test/registered/unit/model_executor/model_runner_components/test_cuda_graph_setup.py b/test/registered/unit/model_executor/model_runner_components/test_cuda_graph_setup.py index ac9aad7da..c5de320a5 100644 --- a/test/registered/unit/model_executor/model_runner_components/test_cuda_graph_setup.py +++ b/test/registered/unit/model_executor/model_runner_components/test_cuda_graph_setup.py @@ -12,7 +12,7 @@ from sglang.srt.model_executor.model_runner_components.cuda_graph_setup import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def test_standard_gqa_gate_uses_pipeline_local_layer_range(): diff --git a/test/registered/unit/model_executor/model_runner_components/test_layer_setup.py b/test/registered/unit/model_executor/model_runner_components/test_layer_setup.py index 94faa44d6..befd25b50 100644 --- a/test/registered/unit/model_executor/model_runner_components/test_layer_setup.py +++ b/test/registered/unit/model_executor/model_runner_components/test_layer_setup.py @@ -8,7 +8,7 @@ from sglang.srt.model_executor.model_runner_components.layer_setup import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestComputeAttentionAndMoeLayers(unittest.TestCase): diff --git a/test/registered/unit/model_executor/model_runner_components/test_ngram_embedding_manager.py b/test/registered/unit/model_executor/model_runner_components/test_ngram_embedding_manager.py index 477c67930..12067f965 100644 --- a/test/registered/unit/model_executor/model_runner_components/test_ngram_embedding_manager.py +++ b/test/registered/unit/model_executor/model_runner_components/test_ngram_embedding_manager.py @@ -15,7 +15,7 @@ from sglang.srt.model_executor.model_runner_components.ngram_embedding_manager i update_ngram_token_table_after_sampling, ) -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _make_ngram_info(batch_size: int, skip_token_table_update=None): diff --git a/test/registered/unit/model_executor/model_runner_components/test_spec_aux_hidden_state.py b/test/registered/unit/model_executor/model_runner_components/test_spec_aux_hidden_state.py index a48604188..049977f5c 100644 --- a/test/registered/unit/model_executor/model_runner_components/test_spec_aux_hidden_state.py +++ b/test/registered/unit/model_executor/model_runner_components/test_spec_aux_hidden_state.py @@ -8,7 +8,7 @@ from sglang.srt.model_executor.model_runner_components.spec_aux_hidden_state imp ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") @pytest.mark.parametrize( diff --git a/test/registered/unit/model_executor/model_runner_components/test_startup_weight_load.py b/test/registered/unit/model_executor/model_runner_components/test_startup_weight_load.py index 0c3ee44f7..c0f0dc207 100644 --- a/test/registered/unit/model_executor/model_runner_components/test_startup_weight_load.py +++ b/test/registered/unit/model_executor/model_runner_components/test_startup_weight_load.py @@ -32,7 +32,7 @@ from sglang.srt.model_loader.weight_utils import initialize_capture_safe_weights from sglang.srt.runtime_context import get_context, publish, reset_context from sglang.srt.server_args import ServerArgs -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _STARTUP_MODULE = ( diff --git a/test/registered/unit/model_executor/runner/test_decode_cuda_graph_runner.py b/test/registered/unit/model_executor/runner/test_decode_cuda_graph_runner.py index 03990cd68..7a455f2dc 100644 --- a/test/registered/unit/model_executor/runner/test_decode_cuda_graph_runner.py +++ b/test/registered/unit/model_executor/runner/test_decode_cuda_graph_runner.py @@ -36,7 +36,7 @@ from sglang.srt.utils import profile_utils as putils from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _CAPTURE_TRACE = "SGLANG_ENABLE_CUDA_GRAPH_CAPTURE_TRACE" _BATCH_CAPTURE = "SGLANG_GRAPH_BATCH_CAPTURE" diff --git a/test/registered/unit/model_executor/runner/test_decode_cuda_graph_shared_read_fence.py b/test/registered/unit/model_executor/runner/test_decode_cuda_graph_shared_read_fence.py index 337408a25..67b9542b3 100644 --- a/test/registered/unit/model_executor/runner/test_decode_cuda_graph_shared_read_fence.py +++ b/test/registered/unit/model_executor/runner/test_decode_cuda_graph_shared_read_fence.py @@ -13,7 +13,7 @@ from sglang.srt.model_executor.runner.decode_cuda_graph_runner import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") DECODE = ForwardMode.DECODE diff --git a/test/registered/unit/model_executor/runner/test_flashinfer_autotune_sync.py b/test/registered/unit/model_executor/runner/test_flashinfer_autotune_sync.py index 930450a83..282a9eddb 100644 --- a/test/registered/unit/model_executor/runner/test_flashinfer_autotune_sync.py +++ b/test/registered/unit/model_executor/runner/test_flashinfer_autotune_sync.py @@ -8,7 +8,7 @@ cover that gate and the digest it decides on. from sglang.test.ci.ci_register import register_cpu_ci, register_cuda_ci -register_cpu_ci(est_time=57, suite="base-a-test-cpu") +register_cpu_ci(est_time=50, suite="base-a-test-cpu") register_cuda_ci(est_time=25, stage="base-b-kernel-unit", runner_config="1-gpu-large") import json diff --git a/test/registered/unit/model_executor/runner/test_hidden_state_graph_recapture.py b/test/registered/unit/model_executor/runner/test_hidden_state_graph_recapture.py index 7581b8f7a..947a6a0a0 100644 --- a/test/registered/unit/model_executor/runner/test_hidden_state_graph_recapture.py +++ b/test/registered/unit/model_executor/runner/test_hidden_state_graph_recapture.py @@ -19,7 +19,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestHiddenStateGraphRecapture(CustomTestCase): diff --git a/test/registered/unit/model_executor/runner/test_prefill_cuda_graph_padding.py b/test/registered/unit/model_executor/runner/test_prefill_cuda_graph_padding.py index ed9ebdeda..78fb18364 100644 --- a/test/registered/unit/model_executor/runner/test_prefill_cuda_graph_padding.py +++ b/test/registered/unit/model_executor/runner/test_prefill_cuda_graph_padding.py @@ -21,7 +21,7 @@ from sglang.srt.model_executor.runner.shape_key import ShapeKey from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestPrefillCudaGraphPadding(CustomTestCase): diff --git a/test/registered/unit/model_executor/runner/test_prefill_shared_read_done.py b/test/registered/unit/model_executor/runner/test_prefill_shared_read_done.py index 0c96e270a..e8ae3231c 100644 --- a/test/registered/unit/model_executor/runner/test_prefill_shared_read_done.py +++ b/test/registered/unit/model_executor/runner/test_prefill_shared_read_done.py @@ -17,7 +17,7 @@ from sglang.srt.speculative.spec_registry import CustomSpecAlgo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _Event: diff --git a/test/registered/unit/model_executor/runner_backend/test_backend_resolution.py b/test/registered/unit/model_executor/runner_backend/test_backend_resolution.py index a78725a5e..ede6e36e5 100644 --- a/test/registered/unit/model_executor/runner_backend/test_backend_resolution.py +++ b/test/registered/unit/model_executor/runner_backend/test_backend_resolution.py @@ -11,7 +11,7 @@ from sglang.srt.platforms.interface import SRTPlatform from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _make_graph_runner(*, device="custom"): diff --git a/test/registered/unit/model_executor/runner_backend/test_full_cuda_graph_backend.py b/test/registered/unit/model_executor/runner_backend/test_full_cuda_graph_backend.py index f653c8d9b..e6082c6b3 100644 --- a/test/registered/unit/model_executor/runner_backend/test_full_cuda_graph_backend.py +++ b/test/registered/unit/model_executor/runner_backend/test_full_cuda_graph_backend.py @@ -33,7 +33,7 @@ from sglang.srt.model_executor.runner_backend.full_cuda_graph_backend import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # Sentinel: distinguishes "runner has no _profiler attribute" from # "_profiler is None" in the test fixtures. diff --git a/test/registered/unit/model_executor/runner_utils/test_graph_pool_borrow.py b/test/registered/unit/model_executor/runner_utils/test_graph_pool_borrow.py index 784c91b0b..64bc79aca 100644 --- a/test/registered/unit/model_executor/runner_utils/test_graph_pool_borrow.py +++ b/test/registered/unit/model_executor/runner_utils/test_graph_pool_borrow.py @@ -24,7 +24,7 @@ from sglang.srt.speculative.dflash_worker_v2 import DFlashWorkerV2 from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=20, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=14, stage="base-b", runner_config="1-gpu-small") class TestGraphPoolBorrow(CustomTestCase): diff --git a/test/registered/unit/model_executor/test_chunked_prefix_cache_gate.py b/test/registered/unit/model_executor/test_chunked_prefix_cache_gate.py index c689f3d92..07a4c211d 100644 --- a/test/registered/unit/model_executor/test_chunked_prefix_cache_gate.py +++ b/test/registered/unit/model_executor/test_chunked_prefix_cache_gate.py @@ -7,7 +7,7 @@ saw the flip, so an unsupported backend kept chunked prefix enabled. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/model_executor/test_compensated_mhc_update_guard.py b/test/registered/unit/model_executor/test_compensated_mhc_update_guard.py index 82e27cca4..884e47b19 100644 --- a/test/registered/unit/model_executor/test_compensated_mhc_update_guard.py +++ b/test/registered/unit/model_executor/test_compensated_mhc_update_guard.py @@ -14,7 +14,7 @@ from sglang.srt.model_executor.model_runner_components.weight_updater import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestCompensatedMhcUpdateGuard(CustomTestCase): diff --git a/test/registered/unit/model_executor/test_cuda_graph_buffer_registry.py b/test/registered/unit/model_executor/test_cuda_graph_buffer_registry.py index b7ef20aaa..f34a209df 100644 --- a/test/registered/unit/model_executor/test_cuda_graph_buffer_registry.py +++ b/test/registered/unit/model_executor/test_cuda_graph_buffer_registry.py @@ -29,7 +29,7 @@ from sglang.srt.model_executor.cuda_graph_buffer_registry import ( from sglang.srt.model_executor.input_buffers import ForwardInputBuffers from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") @dataclasses.dataclass diff --git a/test/registered/unit/model_executor/test_draft_runner_skips_lora.py b/test/registered/unit/model_executor/test_draft_runner_skips_lora.py index 6476aea61..270c4ce7d 100644 --- a/test/registered/unit/model_executor/test_draft_runner_skips_lora.py +++ b/test/registered/unit/model_executor/test_draft_runner_skips_lora.py @@ -18,7 +18,7 @@ from sglang.srt.speculative.spec_info import SpeculativeAlgorithm from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestDraftRunnerSkipsLoRA(CustomTestCase): diff --git a/test/registered/unit/model_executor/test_forward_metadata_plan_record.py b/test/registered/unit/model_executor/test_forward_metadata_plan_record.py index ed8692127..36cde7f65 100644 --- a/test/registered/unit/model_executor/test_forward_metadata_plan_record.py +++ b/test/registered/unit/model_executor/test_forward_metadata_plan_record.py @@ -21,7 +21,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardBatch, ForwardMo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _make_batch(bs: int = 2, num_tokens: int = 2) -> ForwardBatch: diff --git a/test/registered/unit/model_executor/test_hisparse_pool_configurator.py b/test/registered/unit/model_executor/test_hisparse_pool_configurator.py index 778907219..ee2d9e7ce 100644 --- a/test/registered/unit/model_executor/test_hisparse_pool_configurator.py +++ b/test/registered/unit/model_executor/test_hisparse_pool_configurator.py @@ -9,7 +9,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestHiSparsePoolConfigurator(CustomTestCase): diff --git a/test/registered/unit/model_executor/test_kv_canary_headroom.py b/test/registered/unit/model_executor/test_kv_canary_headroom.py index 132092ad4..2c04af892 100644 --- a/test/registered/unit/model_executor/test_kv_canary_headroom.py +++ b/test/registered/unit/model_executor/test_kv_canary_headroom.py @@ -15,7 +15,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, stage="base-a", runner_config="cpu") +register_cpu_ci(est_time=8, stage="base-a", runner_config="cpu") _GIB = 1 << 30 diff --git a/test/registered/unit/model_executor/test_mlp_sync_pad_unpad.py b/test/registered/unit/model_executor/test_mlp_sync_pad_unpad.py index a7c9565e1..efe265cb3 100644 --- a/test/registered/unit/model_executor/test_mlp_sync_pad_unpad.py +++ b/test/registered/unit/model_executor/test_mlp_sync_pad_unpad.py @@ -23,7 +23,7 @@ from sglang.srt.model_executor.runner.decode_cuda_graph_runner import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _mock_model_runner(seq_len_fill_value: int = 1) -> MagicMock: diff --git a/test/registered/unit/model_executor/test_model_runner_decode_rows.py b/test/registered/unit/model_executor/test_model_runner_decode_rows.py index fe0668ba8..de7db91be 100644 --- a/test/registered/unit/model_executor/test_model_runner_decode_rows.py +++ b/test/registered/unit/model_executor/test_model_runner_decode_rows.py @@ -6,7 +6,7 @@ from unittest.mock import patch from sglang.srt.model_executor.model_runner import ModelRunner from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeModelRunner: diff --git a/test/registered/unit/model_executor/test_pool_configurator.py b/test/registered/unit/model_executor/test_pool_configurator.py index 26fc85b22..2580f4465 100644 --- a/test/registered/unit/model_executor/test_pool_configurator.py +++ b/test/registered/unit/model_executor/test_pool_configurator.py @@ -20,7 +20,7 @@ from sglang.srt.runtime_context import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") @contextlib.contextmanager diff --git a/test/registered/unit/model_executor/test_prefill_cuda_graph_runner.py b/test/registered/unit/model_executor/test_prefill_cuda_graph_runner.py index 29805fb3f..818e32671 100644 --- a/test/registered/unit/model_executor/test_prefill_cuda_graph_runner.py +++ b/test/registered/unit/model_executor/test_prefill_cuda_graph_runner.py @@ -28,7 +28,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeAttentionBackend: diff --git a/test/registered/unit/model_executor/test_prefill_cuda_graph_runner_helpers.py b/test/registered/unit/model_executor/test_prefill_cuda_graph_runner_helpers.py index 3d4ef6b89..75192108a 100644 --- a/test/registered/unit/model_executor/test_prefill_cuda_graph_runner_helpers.py +++ b/test/registered/unit/model_executor/test_prefill_cuda_graph_runner_helpers.py @@ -24,7 +24,7 @@ from sglang.srt.model_loader.utils import resolve_language_model from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _LayerModel: diff --git a/test/registered/unit/model_executor/test_unified_out_cache_loc_rebind.py b/test/registered/unit/model_executor/test_unified_out_cache_loc_rebind.py index 4cc9b006e..135a80375 100644 --- a/test/registered/unit/model_executor/test_unified_out_cache_loc_rebind.py +++ b/test/registered/unit/model_executor/test_unified_out_cache_loc_rebind.py @@ -36,7 +36,7 @@ from sglang.srt.model_executor.forward_batch_info import ForwardBatch, ForwardMo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _DEV = "cpu" diff --git a/test/registered/unit/model_loader/test_default_model_loader.py b/test/registered/unit/model_loader/test_default_model_loader.py index da5b3676a..31c1b6375 100644 --- a/test/registered/unit/model_loader/test_default_model_loader.py +++ b/test/registered/unit/model_loader/test_default_model_loader.py @@ -10,7 +10,7 @@ from sglang.srt.model_loader.loader import DefaultModelLoader from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestDefaultModelLoader(CustomTestCase): diff --git a/test/registered/unit/model_loader/test_modelopt_export.py b/test/registered/unit/model_loader/test_modelopt_export.py index 25313f282..78cd9d795 100644 --- a/test/registered/unit/model_loader/test_modelopt_export.py +++ b/test/registered/unit/model_loader/test_modelopt_export.py @@ -19,7 +19,7 @@ from sglang.srt.configs.model_config import ModelConfig from sglang.srt.model_loader.loader import ModelOptModelLoader from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=9, suite="stage-b-test-1-gpu-small-amd") # Note: PYTHONPATH=python should be set when running tests diff --git a/test/registered/unit/model_loader/test_prefetch_checkpoints.py b/test/registered/unit/model_loader/test_prefetch_checkpoints.py index c2f4439d2..394438f48 100644 --- a/test/registered/unit/model_loader/test_prefetch_checkpoints.py +++ b/test/registered/unit/model_loader/test_prefetch_checkpoints.py @@ -29,7 +29,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class _InlineThread: diff --git a/test/registered/unit/model_loader/test_presharded_loader.py b/test/registered/unit/model_loader/test_presharded_loader.py index f10a44d0d..41fdc5282 100644 --- a/test/registered/unit/model_loader/test_presharded_loader.py +++ b/test/registered/unit/model_loader/test_presharded_loader.py @@ -18,7 +18,7 @@ from sglang.srt.model_loader.loader import PreshardedModelLoader from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestPreshardedHashTensor(unittest.TestCase): diff --git a/test/registered/unit/model_loader/test_remote_instance_loader.py b/test/registered/unit/model_loader/test_remote_instance_loader.py index 5962ccb99..08c7ecab1 100644 --- a/test/registered/unit/model_loader/test_remote_instance_loader.py +++ b/test/registered/unit/model_loader/test_remote_instance_loader.py @@ -10,7 +10,7 @@ from sglang.srt.model_loader.remote_instance_weight_loader_utils import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") EXTRA_CONFIG = {"enable_multithread_load": True, "num_threads": 64} diff --git a/test/registered/unit/model_loader/test_runai_model_streamer_loader.py b/test/registered/unit/model_loader/test_runai_model_streamer_loader.py index 655445217..f58effaa9 100644 --- a/test/registered/unit/model_loader/test_runai_model_streamer_loader.py +++ b/test/registered/unit/model_loader/test_runai_model_streamer_loader.py @@ -27,7 +27,7 @@ from sglang.srt.utils import runai_utils from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakeModel: diff --git a/test/registered/unit/model_loader/test_transformers_fallback.py b/test/registered/unit/model_loader/test_transformers_fallback.py index c18d20dd0..9e4a5af00 100644 --- a/test/registered/unit/model_loader/test_transformers_fallback.py +++ b/test/registered/unit/model_loader/test_transformers_fallback.py @@ -9,7 +9,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestTransformersFallbackWeightMapper(CustomTestCase): diff --git a/test/registered/unit/model_loader/test_weight_cache_protocol.py b/test/registered/unit/model_loader/test_weight_cache_protocol.py index f7e8d6b1c..545b5788b 100644 --- a/test/registered/unit/model_loader/test_weight_cache_protocol.py +++ b/test/registered/unit/model_loader/test_weight_cache_protocol.py @@ -50,7 +50,7 @@ from sglang.srt.weight_cache.transport import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _make_cache_config(**overrides) -> CacheConfig: diff --git a/test/registered/unit/model_loader/test_weight_utils.py b/test/registered/unit/model_loader/test_weight_utils.py index 9ebaa7203..438ea100f 100644 --- a/test/registered/unit/model_loader/test_weight_utils.py +++ b/test/registered/unit/model_loader/test_weight_utils.py @@ -15,7 +15,7 @@ from sglang.srt.utils import runai_utils from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") INDEX_NAME = "model.safetensors.index.json" diff --git a/test/registered/unit/models/test_bailing_vl_loader.py b/test/registered/unit/models/test_bailing_vl_loader.py index 8403c4273..90217fb49 100644 --- a/test/registered/unit/models/test_bailing_vl_loader.py +++ b/test/registered/unit/models/test_bailing_vl_loader.py @@ -16,7 +16,7 @@ from sglang.srt.models.bailing_mm_v3 import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _OneShotWeights: diff --git a/test/registered/unit/models/test_cosmos3.py b/test/registered/unit/models/test_cosmos3.py index de8b3b932..1552996d0 100644 --- a/test/registered/unit/models/test_cosmos3.py +++ b/test/registered/unit/models/test_cosmos3.py @@ -16,7 +16,7 @@ All of this is pure CPU logic (no server / engine launch). from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import os import tempfile diff --git a/test/registered/unit/models/test_cosmos3_edge.py b/test/registered/unit/models/test_cosmos3_edge.py index 539cf5a95..ae41e3b48 100644 --- a/test/registered/unit/models/test_cosmos3_edge.py +++ b/test/registered/unit/models/test_cosmos3_edge.py @@ -15,7 +15,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import asyncio import unittest diff --git a/test/registered/unit/models/test_deepseek_mla_dispatch.py b/test/registered/unit/models/test_deepseek_mla_dispatch.py index dbd144857..ef24631d7 100644 --- a/test/registered/unit/models/test_deepseek_mla_dispatch.py +++ b/test/registered/unit/models/test_deepseek_mla_dispatch.py @@ -24,7 +24,7 @@ from sglang.srt.models.deepseek_common.attention_forward_methods.forward_methods from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _fake_forward_batch(is_decode: bool): diff --git a/test/registered/unit/models/test_deepseek_nextn_mm_embed.py b/test/registered/unit/models/test_deepseek_nextn_mm_embed.py index dad4ab6dd..f7d6b8dca 100644 --- a/test/registered/unit/models/test_deepseek_nextn_mm_embed.py +++ b/test/registered/unit/models/test_deepseek_nextn_mm_embed.py @@ -15,7 +15,7 @@ from sglang.srt.managers.schedule_batch import MM_PAD_SHIFT_VALUE from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") VOCAB_SIZE = 154880 HIDDEN_SIZE = 64 # tiny for CPU test diff --git a/test/registered/unit/models/test_deepseek_pp_mtp_embedding.py b/test/registered/unit/models/test_deepseek_pp_mtp_embedding.py index cfb583670..884336172 100644 --- a/test/registered/unit/models/test_deepseek_pp_mtp_embedding.py +++ b/test/registered/unit/models/test_deepseek_pp_mtp_embedding.py @@ -10,7 +10,7 @@ from sglang.srt.models.deepseek_v2 import pp_stage_needs_embedding from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _pp_group(*, rank: int, size: int) -> SimpleNamespace: diff --git a/test/registered/unit/models/test_deepseek_v4_amd_fused_mhc.py b/test/registered/unit/models/test_deepseek_v4_amd_fused_mhc.py index 52378f5b6..48bb4fbcb 100644 --- a/test/registered/unit/models/test_deepseek_v4_amd_fused_mhc.py +++ b/test/registered/unit/models/test_deepseek_v4_amd_fused_mhc.py @@ -6,7 +6,7 @@ from sglang.srt.models.deepseek_common.amd import deepseek_v4_fused_mhc from sglang.srt.runtime_context import override_platform from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestAmdFusedMhcCrossLayerGating(unittest.TestCase): diff --git a/test/registered/unit/models/test_deepseek_v4_mxfp4_shared_expert_requant.py b/test/registered/unit/models/test_deepseek_v4_mxfp4_shared_expert_requant.py index 88ecb9e9a..f260dc09b 100644 --- a/test/registered/unit/models/test_deepseek_v4_mxfp4_shared_expert_requant.py +++ b/test/registered/unit/models/test_deepseek_v4_mxfp4_shared_expert_requant.py @@ -6,7 +6,7 @@ from sglang.srt.layers.quantization.fp8_utils import quantize_block_fp8_weight_t from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") _E2M1_LUT = torch.tensor([0.0, 0.5, 1.0, 1.5, 2.0, 3.0, 4.0, 6.0]) diff --git a/test/registered/unit/models/test_deepseek_v4_rope_policy.py b/test/registered/unit/models/test_deepseek_v4_rope_policy.py index bae5e90ec..15debdbf0 100644 --- a/test/registered/unit/models/test_deepseek_v4_rope_policy.py +++ b/test/registered/unit/models/test_deepseek_v4_rope_policy.py @@ -13,7 +13,7 @@ from sglang.srt.environ import envs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _ModuleStub(nn.Module): diff --git a/test/registered/unit/models/test_deepseek_v4_shared_expert_fusion.py b/test/registered/unit/models/test_deepseek_v4_shared_expert_fusion.py index fd47b414d..85d726ea7 100644 --- a/test/registered/unit/models/test_deepseek_v4_shared_expert_fusion.py +++ b/test/registered/unit/models/test_deepseek_v4_shared_expert_fusion.py @@ -16,7 +16,7 @@ from sglang.srt.runtime_context import get_context, get_exec, get_flags, get_par from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestDeepseekV4SharedExpertFusionPolicy(CustomTestCase): diff --git a/test/registered/unit/models/test_deepseek_v4_unified_fp8_q_pair.py b/test/registered/unit/models/test_deepseek_v4_unified_fp8_q_pair.py index 9f1bf5057..4ddf0503e 100644 --- a/test/registered/unit/models/test_deepseek_v4_unified_fp8_q_pair.py +++ b/test/registered/unit/models/test_deepseek_v4_unified_fp8_q_pair.py @@ -19,7 +19,7 @@ from sglang.srt.environ import envs from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # deliberately != head_dim below: the row width has to come off the pool, since # that is the stride the kernel reads Q with. Sharing head_dim's value would let diff --git a/test/registered/unit/models/test_draft_entry_hook_parity.py b/test/registered/unit/models/test_draft_entry_hook_parity.py index d1ebb4ce2..ec6ee4390 100644 --- a/test/registered/unit/models/test_draft_entry_hook_parity.py +++ b/test/registered/unit/models/test_draft_entry_hook_parity.py @@ -22,7 +22,7 @@ from sglang.srt.models.registry import ModelRegistry from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=14, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") # The hooks the loader resolves on the entry class where a draft/target # disagreement is a defect rather than a difference. Weight-name maps diff --git a/test/registered/unit/models/test_glm5_next_bfg_fusion.py b/test/registered/unit/models/test_glm5_next_bfg_fusion.py index d3b3411a5..c2f047ed3 100644 --- a/test/registered/unit/models/test_glm5_next_bfg_fusion.py +++ b/test/registered/unit/models/test_glm5_next_bfg_fusion.py @@ -10,7 +10,7 @@ from sglang.srt.models import glm5_next from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") PREFIX = "model.layers.0.self_attn" QKV = ("q_proj", "k_proj", "v_proj") diff --git a/test/registered/unit/models/test_glm5_next_dflash_capture.py b/test/registered/unit/models/test_glm5_next_dflash_capture.py index 4d896b4e9..adc7d957e 100644 --- a/test/registered/unit/models/test_glm5_next_dflash_capture.py +++ b/test/registered/unit/models/test_glm5_next_dflash_capture.py @@ -17,7 +17,7 @@ from sglang.srt.models.glm5_next import Glm5NextModel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestGlm5NextDflashCapture(CustomTestCase): diff --git a/test/registered/unit/models/test_glm5_next_modelopt.py b/test/registered/unit/models/test_glm5_next_modelopt.py index 459805680..2003daebb 100644 --- a/test/registered/unit/models/test_glm5_next_modelopt.py +++ b/test/registered/unit/models/test_glm5_next_modelopt.py @@ -9,7 +9,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") NVIDIA_EXCLUDE_MODULES = [ "model.language_model.embed_tokens", diff --git a/test/registered/unit/models/test_glm_moe_gate_fp32.py b/test/registered/unit/models/test_glm_moe_gate_fp32.py index f80c0a104..74defdc86 100644 --- a/test/registered/unit/models/test_glm_moe_gate_fp32.py +++ b/test/registered/unit/models/test_glm_moe_gate_fp32.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/models/test_glm_nextn_moe_ptpc.py b/test/registered/unit/models/test_glm_nextn_moe_ptpc.py index e047cbf50..de39aa678 100644 --- a/test/registered/unit/models/test_glm_nextn_moe_ptpc.py +++ b/test/registered/unit/models/test_glm_nextn_moe_ptpc.py @@ -24,7 +24,7 @@ from sglang.srt.models.glm4_moe import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") LAYER = 78 PREFIX = f"model.layers.{LAYER}" diff --git a/test/registered/unit/models/test_glmmoedsa_correction_bias_fp32.py b/test/registered/unit/models/test_glmmoedsa_correction_bias_fp32.py index bc958e48b..7c9cada29 100644 --- a/test/registered/unit/models/test_glmmoedsa_correction_bias_fp32.py +++ b/test/registered/unit/models/test_glmmoedsa_correction_bias_fp32.py @@ -20,7 +20,7 @@ from sglang.srt.models.deepseek_v2 import MoEGate from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") GLM_MAIN_ARCH = "GlmMoeDsaForCausalLM" GLM_NEXTN_ARCH = "GlmMoeDsaForCausalLMNextN" # draft head, rewritten in model_config.py diff --git a/test/registered/unit/models/test_gpt_oss_runai_ownership.py b/test/registered/unit/models/test_gpt_oss_runai_ownership.py index add513377..40af1dc13 100644 --- a/test/registered/unit/models/test_gpt_oss_runai_ownership.py +++ b/test/registered/unit/models/test_gpt_oss_runai_ownership.py @@ -18,7 +18,7 @@ from sglang.srt.models.gpt_oss import GptOssForCausalLM from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _streamed(value: float) -> torch.Tensor: diff --git a/test/registered/unit/models/test_granitemoe_split_expert_loading.py b/test/registered/unit/models/test_granitemoe_split_expert_loading.py index 730b40d4b..4d603de3c 100644 --- a/test/registered/unit/models/test_granitemoe_split_expert_loading.py +++ b/test/registered/unit/models/test_granitemoe_split_expert_loading.py @@ -11,7 +11,7 @@ silently dropped: the server started normally and then emitted garbage from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/models/test_hunyuan_v3_nextn_weight_loading.py b/test/registered/unit/models/test_hunyuan_v3_nextn_weight_loading.py index 8a5eb099c..7b737dcca 100644 --- a/test/registered/unit/models/test_hunyuan_v3_nextn_weight_loading.py +++ b/test/registered/unit/models/test_hunyuan_v3_nextn_weight_loading.py @@ -9,7 +9,7 @@ being remapped to a nonexistent decoder parameter and silently dropped. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/models/test_hunyuan_v4_nextn_weight_loading.py b/test/registered/unit/models/test_hunyuan_v4_nextn_weight_loading.py index da3a16c45..a093fbe9c 100644 --- a/test/registered/unit/models/test_hunyuan_v4_nextn_weight_loading.py +++ b/test/registered/unit/models/test_hunyuan_v4_nextn_weight_loading.py @@ -6,7 +6,7 @@ import torch from sglang.srt.models.hunyuan_v4_nextn import HYV4ForCausalLMNextN from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestHunyuanV4NextNWeightLoading(unittest.TestCase): diff --git a/test/registered/unit/models/test_interns1pro_processor.py b/test/registered/unit/models/test_interns1pro_processor.py index 36009bc9e..4b04128cd 100644 --- a/test/registered/unit/models/test_interns1pro_processor.py +++ b/test/registered/unit/models/test_interns1pro_processor.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") from types import SimpleNamespace from unittest.mock import Mock diff --git a/test/registered/unit/models/test_kimi_k25.py b/test/registered/unit/models/test_kimi_k25.py index 4d79380bf..2ee24e621 100644 --- a/test/registered/unit/models/test_kimi_k25.py +++ b/test/registered/unit/models/test_kimi_k25.py @@ -76,7 +76,7 @@ from sglang.srt.server_args import ServerArgs from sglang.srt.utils import ImageData from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=13, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _MoonViT3dTower: diff --git a/test/registered/unit/models/test_kimi_k3_bfa_overlap.py b/test/registered/unit/models/test_kimi_k3_bfa_overlap.py index ade7a3546..9dfdf358f 100644 --- a/test/registered/unit/models/test_kimi_k3_bfa_overlap.py +++ b/test/registered/unit/models/test_kimi_k3_bfa_overlap.py @@ -14,7 +14,7 @@ from sglang.srt.models.kimi_k3 import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=22, stage="base-b", runner_config="1-gpu-large") _H = 7168 _QKVG = 6144 # q,k,v,g slices per rank at TP8 diff --git a/test/registered/unit/models/test_kimi_k3_vision.py b/test/registered/unit/models/test_kimi_k3_vision.py index bf9e6ad08..72f9bdef8 100644 --- a/test/registered/unit/models/test_kimi_k3_vision.py +++ b/test/registered/unit/models/test_kimi_k3_vision.py @@ -24,7 +24,7 @@ from sglang.srt.multimodal.mm_utils import run_dp_sharded_mrope_vision_model from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") @pytest.mark.parametrize( diff --git a/test/registered/unit/models/test_kimi_vl.py b/test/registered/unit/models/test_kimi_vl.py index 1cd09aa7d..cd5b216c8 100644 --- a/test/registered/unit/models/test_kimi_vl.py +++ b/test/registered/unit/models/test_kimi_vl.py @@ -20,7 +20,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=13, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _VisionTower: diff --git a/test/registered/unit/models/test_kimi_vl_moonvit.py b/test/registered/unit/models/test_kimi_vl_moonvit.py index dffe24e4d..f99f8c8d1 100644 --- a/test/registered/unit/models/test_kimi_vl_moonvit.py +++ b/test/registered/unit/models/test_kimi_vl_moonvit.py @@ -3,7 +3,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") from sglang.srt.models import kimi_vl_moonvit from sglang.srt.models.kimi_vl_moonvit import Learnable2DInterpPosEmb diff --git a/test/registered/unit/models/test_llava.py b/test/registered/unit/models/test_llava.py index 6f981a3c2..e7e5e6427 100644 --- a/test/registered/unit/models/test_llava.py +++ b/test/registered/unit/models/test_llava.py @@ -8,7 +8,7 @@ from sglang.srt.multimodal.processors.llava import LlavaImageProcessor from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class PixtralVisionConfig: diff --git a/test/registered/unit/models/test_llava_processor_pool.py b/test/registered/unit/models/test_llava_processor_pool.py index 32623c4d1..9d10ce962 100644 --- a/test/registered/unit/models/test_llava_processor_pool.py +++ b/test/registered/unit/models/test_llava_processor_pool.py @@ -10,7 +10,7 @@ import pytest from sglang.srt.multimodal.processors.llava import LlavaImageProcessor from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=13, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _BrokenExecutor(concurrent.futures.Executor): diff --git a/test/registered/unit/models/test_locate_anything.py b/test/registered/unit/models/test_locate_anything.py index c870fd218..b95739d0e 100644 --- a/test/registered/unit/models/test_locate_anything.py +++ b/test/registered/unit/models/test_locate_anything.py @@ -19,7 +19,7 @@ from sglang.srt.models.locate_anything import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _small_config(): diff --git a/test/registered/unit/models/test_longcat_flash_router_hpc_gemm.py b/test/registered/unit/models/test_longcat_flash_router_hpc_gemm.py index 754263be1..3dd15696b 100644 --- a/test/registered/unit/models/test_longcat_flash_router_hpc_gemm.py +++ b/test/registered/unit/models/test_longcat_flash_router_hpc_gemm.py @@ -13,7 +13,7 @@ maybe_stub_sgl_kernel() from sglang.srt.models.longcat_flash import LongcatFlashRouter # noqa: E402 -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _longcat_config(hidden_size, n_routed_experts, *, router_bias=False): diff --git a/test/registered/unit/models/test_mellum.py b/test/registered/unit/models/test_mellum.py index 112c43f75..e2418339a 100644 --- a/test/registered/unit/models/test_mellum.py +++ b/test/registered/unit/models/test_mellum.py @@ -8,7 +8,7 @@ from sglang.srt.models.mellum import MellumForCausalLM from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestMellumForCausalLM(CustomTestCase): diff --git a/test/registered/unit/models/test_mistral3_vision_feature.py b/test/registered/unit/models/test_mistral3_vision_feature.py index c7df5d06b..0758017ff 100644 --- a/test/registered/unit/models/test_mistral3_vision_feature.py +++ b/test/registered/unit/models/test_mistral3_vision_feature.py @@ -15,7 +15,7 @@ from sglang.srt.models.llava import LlavaForConditionalGeneration from sglang.srt.models.mistral import Mistral3ForConditionalGeneration from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") NUM_LAYERS = 4 TOKENS = 3 diff --git a/test/registered/unit/models/test_moss_vl_processor.py b/test/registered/unit/models/test_moss_vl_processor.py index 04c14ff8d..a8c432dd8 100644 --- a/test/registered/unit/models/test_moss_vl_processor.py +++ b/test/registered/unit/models/test_moss_vl_processor.py @@ -10,7 +10,7 @@ import torch from sglang.srt.multimodal.processors.moss_vl import MossVLImageProcessor from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _vision_info(frame_count: int): diff --git a/test/registered/unit/models/test_nano_nemotron_vl.py b/test/registered/unit/models/test_nano_nemotron_vl.py index 5a31c3536..e40ce6278 100644 --- a/test/registered/unit/models/test_nano_nemotron_vl.py +++ b/test/registered/unit/models/test_nano_nemotron_vl.py @@ -13,7 +13,7 @@ from sglang.srt.models.nano_nemotron_vl import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") class TestNemotronHOmniModel(CustomTestCase): diff --git a/test/registered/unit/models/test_nemotron_h_mtp.py b/test/registered/unit/models/test_nemotron_h_mtp.py index d6de48d81..40c004a7f 100644 --- a/test/registered/unit/models/test_nemotron_h_mtp.py +++ b/test/registered/unit/models/test_nemotron_h_mtp.py @@ -18,7 +18,7 @@ from sglang.srt.models.nemotron_h_mtp import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _RecordingLayer(nn.Module): diff --git a/test/registered/unit/models/test_nemotron_h_shared_add.py b/test/registered/unit/models/test_nemotron_h_shared_add.py index 08d747bf4..af4fb189d 100644 --- a/test/registered/unit/models/test_nemotron_h_shared_add.py +++ b/test/registered/unit/models/test_nemotron_h_shared_add.py @@ -8,7 +8,7 @@ These cases pin the gate that decides when the substitution is safe. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/models/test_nemotron_h_weight_loading.py b/test/registered/unit/models/test_nemotron_h_weight_loading.py index 1943cd1fc..561d34fb7 100644 --- a/test/registered/unit/models/test_nemotron_h_weight_loading.py +++ b/test/registered/unit/models/test_nemotron_h_weight_loading.py @@ -10,7 +10,7 @@ from sglang.srt.models.nemotron_h_mtp import NemotronHForCausalLMMTP from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _FakePPGroup: diff --git a/test/registered/unit/models/test_paddleocr_vl_serving_defaults.py b/test/registered/unit/models/test_paddleocr_vl_serving_defaults.py index fa146e8bf..644b3686d 100644 --- a/test/registered/unit/models/test_paddleocr_vl_serving_defaults.py +++ b/test/registered/unit/models/test_paddleocr_vl_serving_defaults.py @@ -25,7 +25,7 @@ from sglang.srt.multimodal.processors.base_processor import BaseMultimodalProces from sglang.srt.multimodal.processors.paddleocr_vlm import PaddleOCRVLImageProcessor from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def test_processor_preprocesses_pages_concurrently(): diff --git a/test/registered/unit/models/test_paddleocr_vl_vision.py b/test/registered/unit/models/test_paddleocr_vl_vision.py index 91189293c..fcde6beb1 100644 --- a/test/registered/unit/models/test_paddleocr_vl_vision.py +++ b/test/registered/unit/models/test_paddleocr_vl_vision.py @@ -18,7 +18,7 @@ from sglang.srt.models.paddleocr_vl import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") # Mixes repeated grids (LFU cache hits), an odd aspect ratio, and t > 1. GRIDS = [(1, 4, 6), (1, 8, 10), (2, 2, 4), (1, 8, 10)] diff --git a/test/registered/unit/models/test_qwen3_5_modelopt_fp4.py b/test/registered/unit/models/test_qwen3_5_modelopt_fp4.py index d0e3f60ad..a1be6ceb5 100644 --- a/test/registered/unit/models/test_qwen3_5_modelopt_fp4.py +++ b/test/registered/unit/models/test_qwen3_5_modelopt_fp4.py @@ -21,7 +21,7 @@ from sglang.srt.models.qwen3_5 import QWEN3_5_KV_SCALE_MAPPER from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestModelOptFp4AttentionExclusion(CustomTestCase): diff --git a/test/registered/unit/models/test_qwen3_5_packed_weight_loader.py b/test/registered/unit/models/test_qwen3_5_packed_weight_loader.py index 57aa6457f..92116fbc8 100644 --- a/test/registered/unit/models/test_qwen3_5_packed_weight_loader.py +++ b/test/registered/unit/models/test_qwen3_5_packed_weight_loader.py @@ -10,7 +10,7 @@ Regression test for https://github.com/sgl-project/sglang/issues/23051 from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/models/test_qwen3_5_pipeline_parallel.py b/test/registered/unit/models/test_qwen3_5_pipeline_parallel.py index 402df38e7..3938414a2 100644 --- a/test/registered/unit/models/test_qwen3_5_pipeline_parallel.py +++ b/test/registered/unit/models/test_qwen3_5_pipeline_parallel.py @@ -9,7 +9,7 @@ from sglang.srt.models.qwen3_5_mtp import Qwen3_5ForCausalLMMTP from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestQwen3_5PipelineParallel(CustomTestCase): diff --git a/test/registered/unit/models/test_qwen3_embedding_registration.py b/test/registered/unit/models/test_qwen3_embedding_registration.py index 3f11f3c81..745330b78 100644 --- a/test/registered/unit/models/test_qwen3_embedding_registration.py +++ b/test/registered/unit/models/test_qwen3_embedding_registration.py @@ -8,7 +8,7 @@ and be served as an embedding model, NOT fall back to the Transformers backend. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=17, suite="base-a-test-cpu") +register_cpu_ci(est_time=14, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/models/test_qwen3_vl_feature_materialization.py b/test/registered/unit/models/test_qwen3_vl_feature_materialization.py index 34262c1ad..54f2b38d5 100644 --- a/test/registered/unit/models/test_qwen3_vl_feature_materialization.py +++ b/test/registered/unit/models/test_qwen3_vl_feature_materialization.py @@ -24,7 +24,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _RecordingVisual: diff --git a/test/registered/unit/models/test_qwen4_exp_ple_table.py b/test/registered/unit/models/test_qwen4_exp_ple_table.py index 81063c33f..b50440525 100644 --- a/test/registered/unit/models/test_qwen4_exp_ple_table.py +++ b/test/registered/unit/models/test_qwen4_exp_ple_table.py @@ -34,7 +34,7 @@ from sglang.srt.models.qwen4_exp_ple_table import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestPleFileTableAllocator(CustomTestCase): diff --git a/test/registered/unit/models/test_radio.py b/test/registered/unit/models/test_radio.py index 3ef21eccb..edc3bef58 100644 --- a/test/registered/unit/models/test_radio.py +++ b/test/registered/unit/models/test_radio.py @@ -10,7 +10,7 @@ from sglang.srt.models.radio import RadioModel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=3, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _RecordingWeight: diff --git a/test/registered/unit/models/test_rocm_hisparse_fused_kv.py b/test/registered/unit/models/test_rocm_hisparse_fused_kv.py index e5c49e652..5d5ae3249 100644 --- a/test/registered/unit/models/test_rocm_hisparse_fused_kv.py +++ b/test/registered/unit/models/test_rocm_hisparse_fused_kv.py @@ -12,7 +12,7 @@ from sglang.srt.models.deepseek_common.attention_forward_methods import forward_ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestRocmHiSparseFusedKV(CustomTestCase): diff --git a/test/registered/unit/models/test_shared_experts_fusion_gates.py b/test/registered/unit/models/test_shared_experts_fusion_gates.py index 96f6dbe4b..839427b6d 100644 --- a/test/registered/unit/models/test_shared_experts_fusion_gates.py +++ b/test/registered/unit/models/test_shared_experts_fusion_gates.py @@ -26,7 +26,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=13, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") def _quant(name: str): diff --git a/test/registered/unit/models/test_vit_pos_embed_interpolate.py b/test/registered/unit/models/test_vit_pos_embed_interpolate.py index cffad7815..780d4f111 100644 --- a/test/registered/unit/models/test_vit_pos_embed_interpolate.py +++ b/test/registered/unit/models/test_vit_pos_embed_interpolate.py @@ -23,7 +23,7 @@ import torch.nn as nn from sglang.test.ci.ci_register import register_amd_ci, register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_amd_ci(est_time=20, stage="stage-a", runner_config="1-gpu-small-amd") NUM_POS = 2304 # Qwen3-VL num_position_embeddings -> 48x48 grid diff --git a/test/registered/unit/models/test_xllm.py b/test/registered/unit/models/test_xllm.py index 90e9e563a..2086cc59c 100644 --- a/test/registered/unit/models/test_xllm.py +++ b/test/registered/unit/models/test_xllm.py @@ -35,7 +35,7 @@ from sglang.srt.runtime_context import get_context from sglang.srt.utils.hf_transformers.common import _CONFIG_REGISTRY from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=9, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _IdentityRotary: diff --git a/test/registered/unit/models/test_zaya_cca.py b/test/registered/unit/models/test_zaya_cca.py index c4d2c7498..9c9e6dd6b 100644 --- a/test/registered/unit/models/test_zaya_cca.py +++ b/test/registered/unit/models/test_zaya_cca.py @@ -34,7 +34,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.layer_ut_utils import init_single_process_dist from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _ensure_dist_initialized(cls) -> None: diff --git a/test/registered/unit/models/test_zaya_mod_tp.py b/test/registered/unit/models/test_zaya_mod_tp.py index d5d45d606..b7e136eca 100644 --- a/test/registered/unit/models/test_zaya_mod_tp.py +++ b/test/registered/unit/models/test_zaya_mod_tp.py @@ -25,7 +25,7 @@ from sglang.srt.models.zaya import mod_blend, mod_premask_experts from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _reference_blend( diff --git a/test/registered/unit/multimodal/rust/inkling/test_bindings.py b/test/registered/unit/multimodal/rust/inkling/test_bindings.py index 06893e5a2..3114c91cd 100644 --- a/test/registered/unit/multimodal/rust/inkling/test_bindings.py +++ b/test/registered/unit/multimodal/rust/inkling/test_bindings.py @@ -22,7 +22,7 @@ from sglang.test.test_utils import CustomTestCase sys.path.insert(0, str(Path(__file__).resolve().parents[1])) from _mm_rust_utils import image_bytes, load_core # noqa: E402 -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") CORE = load_core() PATCH_SIZE = 16 diff --git a/test/registered/unit/multimodal/rust/qwen/test_driver.py b/test/registered/unit/multimodal/rust/qwen/test_driver.py index efd03b2ed..ae0502e43 100644 --- a/test/registered/unit/multimodal/rust/qwen/test_driver.py +++ b/test/registered/unit/multimodal/rust/qwen/test_driver.py @@ -33,7 +33,7 @@ from _mm_rust_utils import ( # noqa: E402 spec_json, ) -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") QWEN_CORE = getattr(load_core(), "qwen_vl", None) SPEC = spec_json(PROCESSOR_CONFIGS["qwen2_5_vl"]) diff --git a/test/registered/unit/multimodal/rust/qwen/test_e2e_parity.py b/test/registered/unit/multimodal/rust/qwen/test_e2e_parity.py index c9531036a..4a43781ee 100644 --- a/test/registered/unit/multimodal/rust/qwen/test_e2e_parity.py +++ b/test/registered/unit/multimodal/rust/qwen/test_e2e_parity.py @@ -30,7 +30,7 @@ sys.path.insert(0, str(Path(__file__).resolve().parents[1])) from _fixtures import make_processor, snapshot # noqa: E402 from _mm_rust_utils import PROCESSOR_CONFIGS, image_bytes, load_core # noqa: E402 -register_cpu_ci(est_time=16, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") CORE = load_core() DRIVER = getattr(getattr(CORE, "qwen_vl", None), "process_mm", None) diff --git a/test/registered/unit/multimodal/rust/qwen/test_preprocess.py b/test/registered/unit/multimodal/rust/qwen/test_preprocess.py index f93222aff..ea7f60727 100644 --- a/test/registered/unit/multimodal/rust/qwen/test_preprocess.py +++ b/test/registered/unit/multimodal/rust/qwen/test_preprocess.py @@ -32,7 +32,7 @@ from _mm_rust_utils import ( # noqa: E402 spec_json, ) -register_cpu_ci(est_time=14, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") QWEN_CORE = getattr(load_core(), "qwen_vl", None) diff --git a/test/registered/unit/multimodal/rust/qwen/test_rust_mm_processor.py b/test/registered/unit/multimodal/rust/qwen/test_rust_mm_processor.py index b0e5afc71..f20fc8303 100644 --- a/test/registered/unit/multimodal/rust/qwen/test_rust_mm_processor.py +++ b/test/registered/unit/multimodal/rust/qwen/test_rust_mm_processor.py @@ -29,7 +29,7 @@ sys.path.insert(0, str(Path(__file__).resolve().parents[1])) from _fixtures import make_processor # noqa: E402 from _mm_rust_utils import PROCESSOR_CONFIGS, image_bytes, load_core # noqa: E402 -register_cpu_ci(est_time=16, suite="base-a-test-cpu") +register_cpu_ci(est_time=13, suite="base-a-test-cpu") CORE = load_core() DRIVER = getattr(getattr(CORE, "qwen_vl", None), "process_mm", None) diff --git a/test/registered/unit/multimodal/rust/qwen/test_token_layout_mrope.py b/test/registered/unit/multimodal/rust/qwen/test_token_layout_mrope.py index c3e0796e1..4dbd0c5fd 100644 --- a/test/registered/unit/multimodal/rust/qwen/test_token_layout_mrope.py +++ b/test/registered/unit/multimodal/rust/qwen/test_token_layout_mrope.py @@ -30,7 +30,7 @@ from _mm_rust_utils import ( # noqa: E402 spec_json, ) -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") QWEN_CORE = getattr(load_core(), "qwen_vl", None) diff --git a/test/registered/unit/multimodal/rust/shared/test_fetch.py b/test/registered/unit/multimodal/rust/shared/test_fetch.py index 996ff5304..eb74e83ab 100644 --- a/test/registered/unit/multimodal/rust/shared/test_fetch.py +++ b/test/registered/unit/multimodal/rust/shared/test_fetch.py @@ -20,7 +20,7 @@ from sglang.test.test_utils import CustomTestCase sys.path.insert(0, str(Path(__file__).resolve().parents[1])) from _mm_rust_utils import load_core # noqa: E402 -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") CORE = load_core() FETCH = CORE and CORE.common.fetch_bytes diff --git a/test/registered/unit/multimodal/rust/shared/test_image_decode.py b/test/registered/unit/multimodal/rust/shared/test_image_decode.py index fd174f860..b9bba9489 100644 --- a/test/registered/unit/multimodal/rust/shared/test_image_decode.py +++ b/test/registered/unit/multimodal/rust/shared/test_image_decode.py @@ -19,7 +19,7 @@ from sglang.test.test_utils import CustomTestCase sys.path.insert(0, str(Path(__file__).resolve().parents[1])) from _mm_rust_utils import load_core # noqa: E402 -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") CORE = load_core() DECODE = CORE and CORE.common.image_decode_rgb diff --git a/test/registered/unit/multimodal/rust/shared/test_partition_cores.py b/test/registered/unit/multimodal/rust/shared/test_partition_cores.py index eb33f1026..cd9b0fcd1 100644 --- a/test/registered/unit/multimodal/rust/shared/test_partition_cores.py +++ b/test/registered/unit/multimodal/rust/shared/test_partition_cores.py @@ -14,7 +14,7 @@ maybe_stub_sgl_kernel() from sglang.srt.rust_server.config import _partition_cores # noqa: E402 -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def partition(node_cores, **kwargs): diff --git a/test/registered/unit/multimodal/rust/shared/test_rust_server_extension.py b/test/registered/unit/multimodal/rust/shared/test_rust_server_extension.py index 42bb14029..3d6c1dcb8 100644 --- a/test/registered/unit/multimodal/rust/shared/test_rust_server_extension.py +++ b/test/registered/unit/multimodal/rust/shared/test_rust_server_extension.py @@ -12,7 +12,7 @@ maybe_stub_sgl_kernel() from sglang.srt.rust_server import server as server_module # noqa: E402 from sglang.srt.rust_server.server import RustServer # noqa: E402 -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestRustServerExtension(CustomTestCase): diff --git a/test/registered/unit/multimodal/rust/shared/test_wrap_encoded.py b/test/registered/unit/multimodal/rust/shared/test_wrap_encoded.py index a11821de4..c7417982e 100644 --- a/test/registered/unit/multimodal/rust/shared/test_wrap_encoded.py +++ b/test/registered/unit/multimodal/rust/shared/test_wrap_encoded.py @@ -20,7 +20,7 @@ from sglang.srt.rust_server.multimodal import ( # noqa: E402 RustMmSpec, ) -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestWrapEncoded(CustomTestCase): diff --git a/test/registered/unit/multimodal/test_audio_container_decode.py b/test/registered/unit/multimodal/test_audio_container_decode.py index 2c65e329e..8752db781 100644 --- a/test/registered/unit/multimodal/test_audio_container_decode.py +++ b/test/registered/unit/multimodal/test_audio_container_decode.py @@ -24,7 +24,7 @@ from sglang.srt.utils.common import load_audio from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _tone(*, sample_rate: int, channels: int = 1) -> np.ndarray: diff --git a/test/registered/unit/multimodal/test_bailing_mm_processor.py b/test/registered/unit/multimodal/test_bailing_mm_processor.py index 803d9dda6..d8cfaa233 100644 --- a/test/registered/unit/multimodal/test_bailing_mm_processor.py +++ b/test/registered/unit/multimodal/test_bailing_mm_processor.py @@ -10,7 +10,7 @@ from sglang.srt.multimodal.processors.bailing_mm import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestBailingMMProcessor(CustomTestCase): diff --git a/test/registered/unit/multimodal/test_base_processor_bad_input.py b/test/registered/unit/multimodal/test_base_processor_bad_input.py index c66a3f9b5..724c74b08 100644 --- a/test/registered/unit/multimodal/test_base_processor_bad_input.py +++ b/test/registered/unit/multimodal/test_base_processor_bad_input.py @@ -6,7 +6,7 @@ Media the client supplied but that cannot be fetched or decoded must raise from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import base64 import binascii diff --git a/test/registered/unit/multimodal/test_base_processor_image_decode.py b/test/registered/unit/multimodal/test_base_processor_image_decode.py index f6ca7a223..3f8d7f4f2 100644 --- a/test/registered/unit/multimodal/test_base_processor_image_decode.py +++ b/test/registered/unit/multimodal/test_base_processor_image_decode.py @@ -11,7 +11,7 @@ No server, no model loading — pure CPU. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import asyncio import concurrent.futures diff --git a/test/registered/unit/multimodal/test_cuda_ipc_pool_budget.py b/test/registered/unit/multimodal/test_cuda_ipc_pool_budget.py index ad98e9f93..38206b13d 100644 --- a/test/registered/unit/multimodal/test_cuda_ipc_pool_budget.py +++ b/test/registered/unit/multimodal/test_cuda_ipc_pool_budget.py @@ -7,7 +7,7 @@ from sglang.srt.multimodal.transport.cuda_ipc import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") class TestCudaIpcPoolBudget(unittest.TestCase): diff --git a/test/registered/unit/multimodal/test_cuda_ipc_transport.py b/test/registered/unit/multimodal/test_cuda_ipc_transport.py index e9a9ccebf..e921ac51d 100644 --- a/test/registered/unit/multimodal/test_cuda_ipc_transport.py +++ b/test/registered/unit/multimodal/test_cuda_ipc_transport.py @@ -28,7 +28,7 @@ from sglang.srt.multimodal.transport.cuda_ipc import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=37, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=46, stage="base-b", runner_config="1-gpu-large") def _produce_pooled_tensor(proxy_queue, consumer_done, result_queue): diff --git a/test/registered/unit/multimodal/test_cuda_vmm_transport.py b/test/registered/unit/multimodal/test_cuda_vmm_transport.py index 5923d4836..b54a7648e 100644 --- a/test/registered/unit/multimodal/test_cuda_vmm_transport.py +++ b/test/registered/unit/multimodal/test_cuda_vmm_transport.py @@ -23,7 +23,7 @@ from sglang.srt.utils.cuda_vmm_transport_utils import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=31, stage="base-c", runner_config="4-gpu-gb300") +register_cuda_ci(est_time=34, stage="base-c", runner_config="4-gpu-gb300") class _FabricUnavailableCudaVmmMemoryPool(CudaVmmMemoryPool): diff --git a/test/registered/unit/multimodal/test_deepseek_ocr_geometry.py b/test/registered/unit/multimodal/test_deepseek_ocr_geometry.py index 6dba0e043..7620a6fb9 100644 --- a/test/registered/unit/multimodal/test_deepseek_ocr_geometry.py +++ b/test/registered/unit/multimodal/test_deepseek_ocr_geometry.py @@ -25,7 +25,7 @@ from sglang.srt.multimodal.processors.deepseek_ocr import apply_ocr_geometry from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=60, suite="base-a-test-cpu") +register_cpu_ci(est_time=16, suite="base-a-test-cpu") def _hf_config(vision_model_name: str, projector_input_dim) -> SimpleNamespace: diff --git a/test/registered/unit/multimodal/test_dots_note_omni.py b/test/registered/unit/multimodal/test_dots_note_omni.py index 1fb58fb9f..1c4a54705 100644 --- a/test/registered/unit/multimodal/test_dots_note_omni.py +++ b/test/registered/unit/multimodal/test_dots_note_omni.py @@ -16,7 +16,7 @@ from sglang.srt.multimodal.processors.dots_note_omni import DotsNoteOmniProcesso from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _IM_TOKEN_ID = 100 _AUDIO_TOKEN_ID = 200 diff --git a/test/registered/unit/multimodal/test_evs.py b/test/registered/unit/multimodal/test_evs.py index 047901ff9..acbd79b48 100644 --- a/test/registered/unit/multimodal/test_evs.py +++ b/test/registered/unit/multimodal/test_evs.py @@ -7,7 +7,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import run_doctests -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def test_resolve_evs_config(): diff --git a/test/registered/unit/multimodal/test_feature_materialization.py b/test/registered/unit/multimodal/test_feature_materialization.py index 6fcc28012..e7772c062 100644 --- a/test/registered/unit/multimodal/test_feature_materialization.py +++ b/test/registered/unit/multimodal/test_feature_materialization.py @@ -8,7 +8,7 @@ from sglang.srt.multimodal.mm_utils import materialize_multimodal_features from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestFeatureMaterialization(CustomTestCase): diff --git a/test/registered/unit/multimodal/test_gpu_feature_transport.py b/test/registered/unit/multimodal/test_gpu_feature_transport.py index 670e68a04..8f0b65100 100644 --- a/test/registered/unit/multimodal/test_gpu_feature_transport.py +++ b/test/registered/unit/multimodal/test_gpu_feature_transport.py @@ -11,7 +11,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestCudaVmmFeatureTransport(unittest.TestCase): diff --git a/test/registered/unit/multimodal/test_kimi_k3_gpu_preprocess.py b/test/registered/unit/multimodal/test_kimi_k3_gpu_preprocess.py index f3988bd26..21cb729b4 100644 --- a/test/registered/unit/multimodal/test_kimi_k3_gpu_preprocess.py +++ b/test/registered/unit/multimodal/test_kimi_k3_gpu_preprocess.py @@ -11,7 +11,7 @@ from sglang.srt.multimodal.processors.kimi_k3 import _fill_transparent_bg from sglang.srt.multimodal.processors.kimi_k25 import _resize_bicubic_if_needed from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _natural_image(height: int, width: int) -> np.ndarray: diff --git a/test/registered/unit/multimodal/test_media_artifact_processor.py b/test/registered/unit/multimodal/test_media_artifact_processor.py index be4d8da6d..54fec0fce 100644 --- a/test/registered/unit/multimodal/test_media_artifact_processor.py +++ b/test/registered/unit/multimodal/test_media_artifact_processor.py @@ -17,7 +17,7 @@ from sglang.srt.multimodal.media_artifacts import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") @dataclass(frozen=True) diff --git a/test/registered/unit/multimodal/test_media_url_security.py b/test/registered/unit/multimodal/test_media_url_security.py index 1959bf6b8..4aaf578f6 100644 --- a/test/registered/unit/multimodal/test_media_url_security.py +++ b/test/registered/unit/multimodal/test_media_url_security.py @@ -16,7 +16,7 @@ from sglang.srt.utils.common import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") class _MediaHandler(http.server.BaseHTTPRequestHandler): diff --git a/test/registered/unit/multimodal/test_mrope_encoder_utils.py b/test/registered/unit/multimodal/test_mrope_encoder_utils.py index a493461f0..9fcb6cd64 100644 --- a/test/registered/unit/multimodal/test_mrope_encoder_utils.py +++ b/test/registered/unit/multimodal/test_mrope_encoder_utils.py @@ -13,7 +13,7 @@ from sglang.srt.runtime_context import get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _RecordingGather: diff --git a/test/registered/unit/multimodal/test_nano_nemotron_vl_processor.py b/test/registered/unit/multimodal/test_nano_nemotron_vl_processor.py index cee894743..9e974f810 100644 --- a/test/registered/unit/multimodal/test_nano_nemotron_vl_processor.py +++ b/test/registered/unit/multimodal/test_nano_nemotron_vl_processor.py @@ -9,7 +9,7 @@ from sglang.srt.multimodal.processors.nano_nemotron_vl import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestNanoNemotronVLProcessor(CustomTestCase): diff --git a/test/registered/unit/multimodal/test_pixtral_processor.py b/test/registered/unit/multimodal/test_pixtral_processor.py index 22b4d637e..1c33d6291 100644 --- a/test/registered/unit/multimodal/test_pixtral_processor.py +++ b/test/registered/unit/multimodal/test_pixtral_processor.py @@ -16,7 +16,7 @@ from sglang.srt.multimodal.processors.pixtral import PixtralProcessor from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class TestPixtralProcessor(CustomTestCase): diff --git a/test/registered/unit/multimodal/test_precomputed_embedding_validation.py b/test/registered/unit/multimodal/test_precomputed_embedding_validation.py index a10c7147e..4342fdcaa 100644 --- a/test/registered/unit/multimodal/test_precomputed_embedding_validation.py +++ b/test/registered/unit/multimodal/test_precomputed_embedding_validation.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/multimodal/test_preprocess_cache.py b/test/registered/unit/multimodal/test_preprocess_cache.py index 2e26fbb59..f59a15bcd 100644 --- a/test/registered/unit/multimodal/test_preprocess_cache.py +++ b/test/registered/unit/multimodal/test_preprocess_cache.py @@ -25,7 +25,7 @@ from sglang.srt.runtime_context import publish, reset_context from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestMediaIdentity(unittest.TestCase): diff --git a/test/registered/unit/multimodal/test_processor_async_call_sites.py b/test/registered/unit/multimodal/test_processor_async_call_sites.py index b1955fe72..d1a0a39dc 100644 --- a/test/registered/unit/multimodal/test_processor_async_call_sites.py +++ b/test/registered/unit/multimodal/test_processor_async_call_sites.py @@ -18,7 +18,7 @@ import pytest from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=13, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") _MULTIMODAL_ROOT = ( pathlib.Path(__file__).resolve().parents[4] diff --git a/test/registered/unit/multimodal/test_processor_clone_isolation.py b/test/registered/unit/multimodal/test_processor_clone_isolation.py index 0ab717dfa..0f857a604 100644 --- a/test/registered/unit/multimodal/test_processor_clone_isolation.py +++ b/test/registered/unit/multimodal/test_processor_clone_isolation.py @@ -19,7 +19,7 @@ from sglang.srt.multimodal.processors.sarashina2_vision import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _NarrowImageProcessor: diff --git a/test/registered/unit/multimodal/test_processor_device_selection.py b/test/registered/unit/multimodal/test_processor_device_selection.py index 7d4cb89c5..464e987fd 100644 --- a/test/registered/unit/multimodal/test_processor_device_selection.py +++ b/test/registered/unit/multimodal/test_processor_device_selection.py @@ -17,7 +17,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") BASE = "sglang.srt.multimodal.processors.base_processor" diff --git a/test/registered/unit/multimodal/test_tensor_transport_mode.py b/test/registered/unit/multimodal/test_tensor_transport_mode.py index 18d550e54..33f4451d5 100644 --- a/test/registered/unit/multimodal/test_tensor_transport_mode.py +++ b/test/registered/unit/multimodal/test_tensor_transport_mode.py @@ -7,7 +7,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestTensorTransportMode(CustomTestCase): diff --git a/test/registered/unit/multimodal/test_vit_cuda_graph_runner.py b/test/registered/unit/multimodal/test_vit_cuda_graph_runner.py index c1c59de38..cfaab9f9c 100644 --- a/test/registered/unit/multimodal/test_vit_cuda_graph_runner.py +++ b/test/registered/unit/multimodal/test_vit_cuda_graph_runner.py @@ -6,7 +6,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") from sglang.srt.multimodal.internvl_vit_cuda_graph_runner import ( InternViTCudaGraphRunner, diff --git a/test/registered/unit/multimodal/test_vit_npu_graph_runner.py b/test/registered/unit/multimodal/test_vit_npu_graph_runner.py index ebe2be344..e46bb5a59 100644 --- a/test/registered/unit/multimodal/test_vit_npu_graph_runner.py +++ b/test/registered/unit/multimodal/test_vit_npu_graph_runner.py @@ -8,7 +8,7 @@ import torch from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class _Block: diff --git a/test/registered/unit/npu/test_sparsity_driven_kv_offload_config.py b/test/registered/unit/npu/test_sparsity_driven_kv_offload_config.py index 8a136121f..a4b351a0f 100644 --- a/test/registered/unit/npu/test_sparsity_driven_kv_offload_config.py +++ b/test/registered/unit/npu/test_sparsity_driven_kv_offload_config.py @@ -10,7 +10,7 @@ from sglang.srt.hardware_backend.npu.sparsity_driven_kv_offload.config import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _make_glm51_model_config(): diff --git a/test/registered/unit/observability/test_forward_pass_metrics.py b/test/registered/unit/observability/test_forward_pass_metrics.py index 1f8b1e171..becfb5c6a 100644 --- a/test/registered/unit/observability/test_forward_pass_metrics.py +++ b/test/registered/unit/observability/test_forward_pass_metrics.py @@ -1,7 +1,7 @@ from sglang.srt.runtime_context import get_context, get_observability, get_parallel from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import math import types diff --git a/test/registered/unit/observability/test_func_timer.py b/test/registered/unit/observability/test_func_timer.py index 6f646928c..6ccd4d219 100644 --- a/test/registered/unit/observability/test_func_timer.py +++ b/test/registered/unit/observability/test_func_timer.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") register_cpu_ci(est_time=4, suite="stage-b-test-cpu-intel") import asyncio diff --git a/test/registered/unit/observability/test_label_transform.py b/test/registered/unit/observability/test_label_transform.py index aa4857e03..539cdf32e 100644 --- a/test/registered/unit/observability/test_label_transform.py +++ b/test/registered/unit/observability/test_label_transform.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") register_cpu_ci(est_time=4, suite="stage-b-test-cpu-intel") import unittest diff --git a/test/registered/unit/observability/test_metrics_utils.py b/test/registered/unit/observability/test_metrics_utils.py index 11ed06183..696f04655 100644 --- a/test/registered/unit/observability/test_metrics_utils.py +++ b/test/registered/unit/observability/test_metrics_utils.py @@ -6,7 +6,7 @@ from sglang.srt.observability.utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/observability/test_ray_wrappers.py b/test/registered/unit/observability/test_ray_wrappers.py index 094be4529..fbed2c83b 100644 --- a/test/registered/unit/observability/test_ray_wrappers.py +++ b/test/registered/unit/observability/test_ray_wrappers.py @@ -25,7 +25,7 @@ from sglang.test.observability.fake_ray import ( ) from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/observability/test_req_time_stats.py b/test/registered/unit/observability/test_req_time_stats.py index bfb5ddf4f..85d013960 100644 --- a/test/registered/unit/observability/test_req_time_stats.py +++ b/test/registered/unit/observability/test_req_time_stats.py @@ -24,7 +24,7 @@ from sglang.srt.observability.trace import SpanAttributes from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestSetstatePreservesUnsetTimeSentinels(CustomTestCase): diff --git a/test/registered/unit/observability/test_request_metrics_exporter.py b/test/registered/unit/observability/test_request_metrics_exporter.py index 32f407c90..2f0d76872 100644 --- a/test/registered/unit/observability/test_request_metrics_exporter.py +++ b/test/registered/unit/observability/test_request_metrics_exporter.py @@ -5,7 +5,7 @@ from typing import Any, Dict, List, Optional from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel") import asyncio diff --git a/test/registered/unit/observability/test_scheduler_stage_metrics.py b/test/registered/unit/observability/test_scheduler_stage_metrics.py index b115acb95..2baf6e507 100644 --- a/test/registered/unit/observability/test_scheduler_stage_metrics.py +++ b/test/registered/unit/observability/test_scheduler_stage_metrics.py @@ -15,7 +15,7 @@ from sglang.srt.observability.scheduler_stage_metrics import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestSchedulerStageMetricsRecorder(CustomTestCase): diff --git a/test/registered/unit/observability/test_startup_func_log_and_timer.py b/test/registered/unit/observability/test_startup_func_log_and_timer.py index e75497daf..229eb89c9 100644 --- a/test/registered/unit/observability/test_startup_func_log_and_timer.py +++ b/test/registered/unit/observability/test_startup_func_log_and_timer.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") register_cpu_ci(est_time=4, suite="stage-b-test-cpu-intel") import unittest diff --git a/test/registered/unit/observability/test_stat_loggers_di.py b/test/registered/unit/observability/test_stat_loggers_di.py index 9eb551fbc..3974e3a39 100644 --- a/test/registered/unit/observability/test_stat_loggers_di.py +++ b/test/registered/unit/observability/test_stat_loggers_di.py @@ -20,7 +20,7 @@ GPU-backed metrics tests. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest from types import SimpleNamespace diff --git a/test/registered/unit/observability/test_trace.py b/test/registered/unit/observability/test_trace.py index 3c4cfffa1..989f22f39 100644 --- a/test/registered/unit/observability/test_trace.py +++ b/test/registered/unit/observability/test_trace.py @@ -4,7 +4,7 @@ import os from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") import threading import unittest diff --git a/test/registered/unit/parser/test_code_completion_parser.py b/test/registered/unit/parser/test_code_completion_parser.py index 54262d123..c62db905b 100644 --- a/test/registered/unit/parser/test_code_completion_parser.py +++ b/test/registered/unit/parser/test_code_completion_parser.py @@ -18,7 +18,7 @@ from sglang.srt.parser.code_completion_parser import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/parser/test_conversation.py b/test/registered/unit/parser/test_conversation.py index 868bf4a86..2a65820e6 100644 --- a/test/registered/unit/parser/test_conversation.py +++ b/test/registered/unit/parser/test_conversation.py @@ -32,7 +32,7 @@ from sglang.srt.parser.conversation import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/parser/test_harmony_parser.py b/test/registered/unit/parser/test_harmony_parser.py index e1e966b9c..7172eeca9 100644 --- a/test/registered/unit/parser/test_harmony_parser.py +++ b/test/registered/unit/parser/test_harmony_parser.py @@ -12,7 +12,7 @@ from sglang.srt.parser.harmony_parser import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/parser/test_hunyuan_reasoning.py b/test/registered/unit/parser/test_hunyuan_reasoning.py index d550fcae5..dda509d9b 100644 --- a/test/registered/unit/parser/test_hunyuan_reasoning.py +++ b/test/registered/unit/parser/test_hunyuan_reasoning.py @@ -7,7 +7,7 @@ from sglang.srt.parser.hunyuan_reasoning import normalize_hunyuan_reasoning_effo from sglang.srt.parser.template_detection import ReasoningToggleConfig from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") @pytest.mark.parametrize( diff --git a/test/registered/unit/parser/test_inkling_renderer.py b/test/registered/unit/parser/test_inkling_renderer.py index 2fad76f0e..df23db3c2 100644 --- a/test/registered/unit/parser/test_inkling_renderer.py +++ b/test/registered/unit/parser/test_inkling_renderer.py @@ -19,7 +19,7 @@ from sglang.srt.parser.inkling_tokenizer import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") def _text(value: str) -> list[int]: diff --git a/test/registered/unit/parser/test_jinja_template_utils.py b/test/registered/unit/parser/test_jinja_template_utils.py index 53dc78a61..9179b792e 100644 --- a/test/registered/unit/parser/test_jinja_template_utils.py +++ b/test/registered/unit/parser/test_jinja_template_utils.py @@ -11,7 +11,7 @@ from sglang.srt.utils import VideoData from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/parser/test_k2_v3_reasoning_parser.py b/test/registered/unit/parser/test_k2_v3_reasoning_parser.py index 2169dbfdb..9d107e4a8 100644 --- a/test/registered/unit/parser/test_k2_v3_reasoning_parser.py +++ b/test/registered/unit/parser/test_k2_v3_reasoning_parser.py @@ -8,7 +8,7 @@ from sglang.srt.parser.reasoning_parser import K2V3Detector, ReasoningParser from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestK2V3ReasoningParser(CustomTestCase): diff --git a/test/registered/unit/parser/test_kimik3_reasoning_parser.py b/test/registered/unit/parser/test_kimik3_reasoning_parser.py index b9fda7165..26ff866de 100644 --- a/test/registered/unit/parser/test_kimik3_reasoning_parser.py +++ b/test/registered/unit/parser/test_kimik3_reasoning_parser.py @@ -14,7 +14,7 @@ from sglang.srt.function_call.kimik3_format import ( from sglang.srt.parser.reasoning_parser import KimiK3Detector, ReasoningParser from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _stream(detector: KimiK3Detector, chunks: list[str]) -> tuple[str, str]: diff --git a/test/registered/unit/parser/test_reasoning_content_without_parser.py b/test/registered/unit/parser/test_reasoning_content_without_parser.py index ebb982276..eba0f4305 100644 --- a/test/registered/unit/parser/test_reasoning_content_without_parser.py +++ b/test/registered/unit/parser/test_reasoning_content_without_parser.py @@ -4,7 +4,7 @@ from sglang.srt.parser.reasoning_parser import ReasoningParser from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") # Simulated model output that contains think tags (e.g. from DeepSeek-R1) diff --git a/test/registered/unit/parser/test_reasoning_parser.py b/test/registered/unit/parser/test_reasoning_parser.py index acf2152d7..7f1a268cd 100644 --- a/test/registered/unit/parser/test_reasoning_parser.py +++ b/test/registered/unit/parser/test_reasoning_parser.py @@ -24,7 +24,7 @@ from sglang.srt.parser.reasoning_parser_names import REASONING_PARSER_NAMES from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestBaseReasoningFormatDetector(CustomTestCase): diff --git a/test/registered/unit/platforms/test_platform_interface.py b/test/registered/unit/platforms/test_platform_interface.py index 1e36b9b43..f6bb8dea6 100644 --- a/test/registered/unit/platforms/test_platform_interface.py +++ b/test/registered/unit/platforms/test_platform_interface.py @@ -25,7 +25,7 @@ from sglang.srt.platforms.xpu import XpuSRTPlatform from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/plugins/test_hook_registry.py b/test/registered/unit/plugins/test_hook_registry.py index 41eb4fb3a..c4a0448bc 100644 --- a/test/registered/unit/plugins/test_hook_registry.py +++ b/test/registered/unit/plugins/test_hook_registry.py @@ -16,7 +16,7 @@ from sglang.srt.plugins.hook_registry import HookRegistry, HookType, plugin_hook from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # --------------------------------------------------------------------------- # Helpers: synthetic module creation diff --git a/test/registered/unit/plugins/test_load_plugins.py b/test/registered/unit/plugins/test_load_plugins.py index 3b84f8893..f9e01fa28 100644 --- a/test/registered/unit/plugins/test_load_plugins.py +++ b/test/registered/unit/plugins/test_load_plugins.py @@ -19,7 +19,7 @@ from sglang.srt.plugins import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _make_ep(name, dist_name=None, load_fn=None): diff --git a/test/registered/unit/sampling/test_ascend_sampler.py b/test/registered/unit/sampling/test_ascend_sampler.py index 70786258a..9b6d2be19 100644 --- a/test/registered/unit/sampling/test_ascend_sampler.py +++ b/test/registered/unit/sampling/test_ascend_sampler.py @@ -9,7 +9,7 @@ import torch from sglang.srt.layers import sampler as sampler_module from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=1, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") class TestAscendSamplerDispatch(unittest.TestCase): diff --git a/test/registered/unit/sampling/test_custom_logit_processor.py b/test/registered/unit/sampling/test_custom_logit_processor.py index dc3b1b42b..03e43bc09 100644 --- a/test/registered/unit/sampling/test_custom_logit_processor.py +++ b/test/registered/unit/sampling/test_custom_logit_processor.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") import json diff --git a/test/registered/unit/sampling/test_penaltylib.py b/test/registered/unit/sampling/test_penaltylib.py index 3638c62c9..a558e38dd 100644 --- a/test/registered/unit/sampling/test_penaltylib.py +++ b/test/registered/unit/sampling/test_penaltylib.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") import unittest diff --git a/test/registered/unit/sampling/test_sampling_batch_info.py b/test/registered/unit/sampling/test_sampling_batch_info.py index 016f6d234..33cc2a5c0 100644 --- a/test/registered/unit/sampling/test_sampling_batch_info.py +++ b/test/registered/unit/sampling/test_sampling_batch_info.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=24, suite="base-a-test-cpu") +register_cpu_ci(est_time=20, suite="base-a-test-cpu") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") import unittest diff --git a/test/registered/unit/sampling/test_sampling_metadata_staging.py b/test/registered/unit/sampling/test_sampling_metadata_staging.py index f469ae0c3..d542d00db 100644 --- a/test/registered/unit/sampling/test_sampling_metadata_staging.py +++ b/test/registered/unit/sampling/test_sampling_metadata_staging.py @@ -16,7 +16,7 @@ from sglang.srt.sampling.sampling_params import SamplingParams from sglang.test.ci.ci_register import register_cpu_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=15, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_cuda_ci(est_time=20, stage="base-b-kernel-unit", runner_config="1-gpu-large") VOCAB_SIZE = 32 diff --git a/test/registered/unit/sampling/test_sampling_params.py b/test/registered/unit/sampling/test_sampling_params.py index 7edb6f860..d23ef24ed 100644 --- a/test/registered/unit/sampling/test_sampling_params.py +++ b/test/registered/unit/sampling/test_sampling_params.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci, register_xpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") register_xpu_ci(est_time=10, suite="stage-a-test-1-gpu-xpu") diff --git a/test/registered/unit/scripted_runtime/test_background_http_poster.py b/test/registered/unit/scripted_runtime/test_background_http_poster.py index 344970e21..a73ff070c 100644 --- a/test/registered/unit/scripted_runtime/test_background_http_poster.py +++ b/test/registered/unit/scripted_runtime/test_background_http_poster.py @@ -11,7 +11,7 @@ from sglang.test.scripted_runtime import background_http_poster as bg_poster from sglang.test.scripted_runtime.background_http_poster import BackgroundHttpPoster from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class _FakeResponse: diff --git a/test/registered/unit/scripted_runtime/test_http_server.py b/test/registered/unit/scripted_runtime/test_http_server.py index e7a1a872f..66ab59168 100644 --- a/test/registered/unit/scripted_runtime/test_http_server.py +++ b/test/registered/unit/scripted_runtime/test_http_server.py @@ -16,7 +16,7 @@ from sglang.test.scripted_runtime.io_struct import ( ) from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _sample_script(ctx, *args): diff --git a/test/registered/unit/scripted_runtime/test_scheduler_hook.py b/test/registered/unit/scripted_runtime/test_scheduler_hook.py index d2d7856c1..928d0d7bf 100644 --- a/test/registered/unit/scripted_runtime/test_scheduler_hook.py +++ b/test/registered/unit/scripted_runtime/test_scheduler_hook.py @@ -7,7 +7,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.scripted_runtime import scheduler_hook from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") def _yielding_gen(): diff --git a/test/registered/unit/scripted_runtime/test_scripted_runtime_utils.py b/test/registered/unit/scripted_runtime/test_scripted_runtime_utils.py index 820c42543..d00125ba1 100644 --- a/test/registered/unit/scripted_runtime/test_scripted_runtime_utils.py +++ b/test/registered/unit/scripted_runtime/test_scripted_runtime_utils.py @@ -9,7 +9,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.scripted_runtime.utils import ensure_script_importable, resolve_fn from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestResolveFn(CustomTestCase): diff --git a/test/registered/unit/scripted_runtime/test_tokenizer_recv_proxy.py b/test/registered/unit/scripted_runtime/test_tokenizer_recv_proxy.py index 26446d1e4..fc8d17a2d 100644 --- a/test/registered/unit/scripted_runtime/test_tokenizer_recv_proxy.py +++ b/test/registered/unit/scripted_runtime/test_tokenizer_recv_proxy.py @@ -11,7 +11,7 @@ from sglang.test.scripted_runtime.tokenizer_recv_proxy import ( ) from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import unittest diff --git a/test/registered/unit/server_args/test_declared_fallbacks.py b/test/registered/unit/server_args/test_declared_fallbacks.py index f0601c095..074605c6f 100644 --- a/test/registered/unit/server_args/test_declared_fallbacks.py +++ b/test/registered/unit/server_args/test_declared_fallbacks.py @@ -40,7 +40,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=30, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _resolved(**kwargs) -> ServerArgs: diff --git a/test/registered/unit/server_args/test_model_config_cache.py b/test/registered/unit/server_args/test_model_config_cache.py index 0337e6885..1f2b01158 100644 --- a/test/registered/unit/server_args/test_model_config_cache.py +++ b/test/registered/unit/server_args/test_model_config_cache.py @@ -28,7 +28,7 @@ from sglang.srt.utils import runai_utils from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _MINI_CONFIG = { "architectures": ["LlamaForCausalLM"], diff --git a/test/registered/unit/server_args/test_model_source_paths.py b/test/registered/unit/server_args/test_model_source_paths.py index ef128727e..3144ebad8 100644 --- a/test/registered/unit/server_args/test_model_source_paths.py +++ b/test/registered/unit/server_args/test_model_source_paths.py @@ -24,7 +24,7 @@ the model-configuration cache notices. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import json import os diff --git a/test/registered/unit/server_args/test_page_major_backend_allowlist.py b/test/registered/unit/server_args/test_page_major_backend_allowlist.py index 5cb295b14..c1389e787 100644 --- a/test/registered/unit/server_args/test_page_major_backend_allowlist.py +++ b/test/registered/unit/server_args/test_page_major_backend_allowlist.py @@ -38,7 +38,7 @@ from sglang.srt.configs.model_config import AttentionArch from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _accepts( diff --git a/test/registered/unit/server_args/test_platform_prefill_cp_deprecation.py b/test/registered/unit/server_args/test_platform_prefill_cp_deprecation.py index bd3c23bfd..e44877582 100644 --- a/test/registered/unit/server_args/test_platform_prefill_cp_deprecation.py +++ b/test/registered/unit/server_args/test_platform_prefill_cp_deprecation.py @@ -11,7 +11,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestPlatformPrefillCPDeprecation(CustomTestCase): diff --git a/test/registered/unit/server_args/test_record_holds_the_raw_input.py b/test/registered/unit/server_args/test_record_holds_the_raw_input.py index f9b153511..a9acf77ed 100644 --- a/test/registered/unit/server_args/test_record_holds_the_raw_input.py +++ b/test/registered/unit/server_args/test_record_holds_the_raw_input.py @@ -21,7 +21,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") _MINI_CONFIG = { diff --git a/test/registered/unit/server_args/test_resolution_declarations.py b/test/registered/unit/server_args/test_resolution_declarations.py index 9fe1f63e1..8b9b63152 100644 --- a/test/registered/unit/server_args/test_resolution_declarations.py +++ b/test/registered/unit/server_args/test_resolution_declarations.py @@ -25,7 +25,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=26, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") _SRT = pathlib.Path(sglang.__file__).resolve().parent / "srt" diff --git a/test/registered/unit/server_args/test_resolution_hook_registry.py b/test/registered/unit/server_args/test_resolution_hook_registry.py index 670d106c2..5c0b2360c 100644 --- a/test/registered/unit/server_args/test_resolution_hook_registry.py +++ b/test/registered/unit/server_args/test_resolution_hook_registry.py @@ -4,7 +4,7 @@ end-to-end proof that an override reaches a real `resolve_once()`.""" from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import ast import glob diff --git a/test/registered/unit/server_args/test_resolution_is_reproducible.py b/test/registered/unit/server_args/test_resolution_is_reproducible.py index 4ed946b1c..5d355467d 100644 --- a/test/registered/unit/server_args/test_resolution_is_reproducible.py +++ b/test/registered/unit/server_args/test_resolution_is_reproducible.py @@ -51,13 +51,13 @@ from sglang.test.ci.ci_register import ( ) from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=104, suite="base-a-test-cpu") +register_cpu_ci(est_time=15, suite="base-a-test-cpu") # Also on a GPU runner: the resolution branches that matter most (backend # defaults, DeepSeek handlers, capability gates) go through `is_cuda()` / # `is_hip()` / device capability, which inspect the actual hardware -- passing # device="cuda" on a CPU box does not reach them, so a leak confined to a GPU # handler would never fail the CPU registration alone. -register_cuda_ci(est_time=78, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=16, stage="base-b", runner_config="1-gpu-small") # ROCm too: `is_hip()` gates its own set of backend and DeepSeek handlers, which # neither the CPU suite nor a CUDA runner reaches. register_amd_ci(est_time=10, suite="stage-b-test-1-gpu-small-amd") diff --git a/test/registered/unit/server_args/test_server_args.py b/test/registered/unit/server_args/test_server_args.py index fed3493e5..aaff0eb31 100644 --- a/test/registered/unit/server_args/test_server_args.py +++ b/test/registered/unit/server_args/test_server_args.py @@ -109,7 +109,7 @@ from sglang.test.test_utils import ( CustomTestCase, ) -register_cpu_ci(est_time=14, suite="base-a-test-cpu") +register_cpu_ci(est_time=11, suite="base-a-test-cpu") register_cpu_ci(est_time=11, suite="stage-b-test-cpu-intel") # Mock get_device() so all tests run on CPU-only CI runners diff --git a/test/registered/unit/server_args/test_unified_prefill_cuda_graph_gate.py b/test/registered/unit/server_args/test_unified_prefill_cuda_graph_gate.py index ac79697f0..51e8d79ef 100644 --- a/test/registered/unit/server_args/test_unified_prefill_cuda_graph_gate.py +++ b/test/registered/unit/server_args/test_unified_prefill_cuda_graph_gate.py @@ -44,7 +44,7 @@ from sglang.srt.model_executor.cuda_graph_config import Backend from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") def _run_handler(*, prefill_backend, attention_backends): diff --git a/test/registered/unit/spec/test_adaptive_spec_params.py b/test/registered/unit/spec/test_adaptive_spec_params.py index f9bcf80e8..83195c53b 100644 --- a/test/registered/unit/spec/test_adaptive_spec_params.py +++ b/test/registered/unit/spec/test_adaptive_spec_params.py @@ -10,7 +10,7 @@ from sglang.srt.speculative.adaptive_spec_params import ( from sglang.test.ci.ci_register import register_cpu_ci, register_xpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") register_xpu_ci(est_time=10, suite="stage-a-test-1-gpu-xpu") diff --git a/test/registered/unit/spec/test_decode_bookkeeping_ownership.py b/test/registered/unit/spec/test_decode_bookkeeping_ownership.py index cea26addd..ee839f8a7 100644 --- a/test/registered/unit/spec/test_decode_bookkeeping_ownership.py +++ b/test/registered/unit/spec/test_decode_bookkeeping_ownership.py @@ -20,7 +20,7 @@ from pathlib import Path from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=22, suite="base-a-test-cpu") +register_cpu_ci(est_time=21, suite="base-a-test-cpu") _REPO_ROOT = Path(__file__).resolve().parents[4] _SRT_DIR = _REPO_ROOT / "python" / "sglang" / "srt" diff --git a/test/registered/unit/spec/test_decoupled_spec_io.py b/test/registered/unit/spec/test_decoupled_spec_io.py index 388a76a4d..734da94c0 100644 --- a/test/registered/unit/spec/test_decoupled_spec_io.py +++ b/test/registered/unit/spec/test_decoupled_spec_io.py @@ -24,7 +24,7 @@ from sglang.srt.speculative.decoupled_spec_io import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _commit(rid, *, pre, tokens, src_verifier_rank=0, drafter_rank=0) -> VerifyCommit: diff --git a/test/registered/unit/spec/test_dflash_domino.py b/test/registered/unit/spec/test_dflash_domino.py index 4d95853ca..0ae1efc1c 100644 --- a/test/registered/unit/spec/test_dflash_domino.py +++ b/test/registered/unit/spec/test_dflash_domino.py @@ -10,7 +10,7 @@ from sglang.srt.speculative.domino_utils import validate_domino_runtime from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") def _domino_config(**overrides): diff --git a/test/registered/unit/spec/test_dflash_extra_buffer_lazy.py b/test/registered/unit/spec/test_dflash_extra_buffer_lazy.py index fa2a3dca7..2e435d572 100644 --- a/test/registered/unit/spec/test_dflash_extra_buffer_lazy.py +++ b/test/registered/unit/spec/test_dflash_extra_buffer_lazy.py @@ -13,7 +13,7 @@ from sglang.srt.arg_groups.mamba_hook import validate_mamba_extra_buffer from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") from sglang.srt.model_executor.forward_batch_info import ForwardMode from sglang.srt.runtime_context import override_platform diff --git a/test/registered/unit/spec/test_dflash_logits.py b/test/registered/unit/spec/test_dflash_logits.py index f635a7b7f..ac2e62060 100644 --- a/test/registered/unit/spec/test_dflash_logits.py +++ b/test/registered/unit/spec/test_dflash_logits.py @@ -12,7 +12,7 @@ from sglang.srt.models.dflash import ( from sglang.srt.speculative.dflash_utils import parse_dflash_draft_config from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=38, suite="base-a-test-cpu") +register_cpu_ci(est_time=36, suite="base-a-test-cpu") def test_dflash_unary_logit_transform(): diff --git a/test/registered/unit/spec/test_dflash_overlap_hostsync.py b/test/registered/unit/spec/test_dflash_overlap_hostsync.py index 809f3466a..b844be794 100644 --- a/test/registered/unit/spec/test_dflash_overlap_hostsync.py +++ b/test/registered/unit/spec/test_dflash_overlap_hostsync.py @@ -12,7 +12,7 @@ from sglang.srt.runtime_context import get_context from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=13, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=11, stage="base-b", runner_config="1-gpu-small") _HAS_CUDA = torch.cuda.is_available() diff --git a/test/registered/unit/spec/test_draft_construction_isolation.py b/test/registered/unit/spec/test_draft_construction_isolation.py index bf0aedd93..e1ab15f88 100644 --- a/test/registered/unit/spec/test_draft_construction_isolation.py +++ b/test/registered/unit/spec/test_draft_construction_isolation.py @@ -23,7 +23,7 @@ from sglang.srt.runtime_context import get_context, get_flags, get_model, publis from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _AlwaysDisables: diff --git a/test/registered/unit/spec/test_draft_per_runner_config.py b/test/registered/unit/spec/test_draft_per_runner_config.py index c18923617..cc3c26c08 100644 --- a/test/registered/unit/spec/test_draft_per_runner_config.py +++ b/test/registered/unit/spec/test_draft_per_runner_config.py @@ -26,7 +26,7 @@ from sglang.srt.runtime_context import get_context, get_model from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _StopConstruction(Exception): diff --git a/test/registered/unit/spec/test_eagle_draft_cuda_graph_runner.py b/test/registered/unit/spec/test_eagle_draft_cuda_graph_runner.py index 25dfe2adc..a1a2d6da2 100644 --- a/test/registered/unit/spec/test_eagle_draft_cuda_graph_runner.py +++ b/test/registered/unit/spec/test_eagle_draft_cuda_graph_runner.py @@ -27,7 +27,7 @@ from sglang.srt.speculative.eagle_draft_cuda_graph_runner import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") CAPTURE_BS = 4 SEQ_LEN_FILL_VALUE = 1 diff --git a/test/registered/unit/spec/test_eagle_gate_routing.py b/test/registered/unit/spec/test_eagle_gate_routing.py index 145206c77..3387ecda0 100644 --- a/test/registered/unit/spec/test_eagle_gate_routing.py +++ b/test/registered/unit/spec/test_eagle_gate_routing.py @@ -19,7 +19,7 @@ from sglang.srt.speculative.eagle_utils import _verify_uses_greedy from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _pre_patch_gate(is_all_greedy, is_cpu, is_hip, is_xpu): diff --git a/test/registered/unit/spec/test_eagle_worker_v2_topk1_fastpath.py b/test/registered/unit/spec/test_eagle_worker_v2_topk1_fastpath.py index 3f21212f1..bd7902dbb 100644 --- a/test/registered/unit/spec/test_eagle_worker_v2_topk1_fastpath.py +++ b/test/registered/unit/spec/test_eagle_worker_v2_topk1_fastpath.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import CustomTestCase register_amd_ci(est_time=20, stage="stage-b", runner_config="1-gpu-small-amd") -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") DEVICE = "cuda" if torch.cuda.is_available() else "cpu" diff --git a/test/registered/unit/spec/test_multimodal_draft_embeddings.py b/test/registered/unit/spec/test_multimodal_draft_embeddings.py index e51ea27d1..5059bc5a8 100644 --- a/test/registered/unit/spec/test_multimodal_draft_embeddings.py +++ b/test/registered/unit/spec/test_multimodal_draft_embeddings.py @@ -11,7 +11,7 @@ from sglang.srt.runtime_context import get_context from sglang.srt.speculative.spec_info import SpeculativeAlgorithm from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") class _MutatingLanguageModel: diff --git a/test/registered/unit/spec/test_ngram_corpus.py b/test/registered/unit/spec/test_ngram_corpus.py index 5c0c45a05..b8bb44220 100644 --- a/test/registered/unit/spec/test_ngram_corpus.py +++ b/test/registered/unit/spec/test_ngram_corpus.py @@ -13,7 +13,7 @@ from sglang.srt.speculative.cpp_ngram.ngram_corpus import NgramCorpus from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=20, suite="base-a-test-cpu") +register_cpu_ci(est_time=18, suite="base-a-test-cpu") def _make_corpus(match_type="BFS", **kwargs): diff --git a/test/registered/unit/spec/test_ngram_mamba_verify_update.py b/test/registered/unit/spec/test_ngram_mamba_verify_update.py index fe062eb25..fcafc7ad5 100644 --- a/test/registered/unit/spec/test_ngram_mamba_verify_update.py +++ b/test/registered/unit/spec/test_ngram_mamba_verify_update.py @@ -7,7 +7,7 @@ import sglang.srt from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=23, suite="base-a-test-cpu") +register_cpu_ci(est_time=22, suite="base-a-test-cpu") class TestNgramLastCorrectStepIndices(CustomTestCase): diff --git a/test/registered/unit/spec/test_oot_dflash_hooks.py b/test/registered/unit/spec/test_oot_dflash_hooks.py index 6e5bcc540..246d008de 100644 --- a/test/registered/unit/spec/test_oot_dflash_hooks.py +++ b/test/registered/unit/spec/test_oot_dflash_hooks.py @@ -11,7 +11,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") HOOK_MODULE = "sglang.srt.arg_groups.speculative_hook" diff --git a/test/registered/unit/spec/test_plugin_hook_signatures.py b/test/registered/unit/spec/test_plugin_hook_signatures.py index 65e0b4b84..5a4eae034 100644 --- a/test/registered/unit/spec/test_plugin_hook_signatures.py +++ b/test/registered/unit/spec/test_plugin_hook_signatures.py @@ -25,7 +25,7 @@ from sglang.srt.speculative.spec_registry import CustomSpecAlgo from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _dispatched_methods(): diff --git a/test/registered/unit/spec/test_spec_cpu_overlap_constraint.py b/test/registered/unit/spec/test_spec_cpu_overlap_constraint.py index 88cf080c8..ef19a1cbd 100644 --- a/test/registered/unit/spec/test_spec_cpu_overlap_constraint.py +++ b/test/registered/unit/spec/test_spec_cpu_overlap_constraint.py @@ -7,7 +7,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _make_spec_args(device: str, algorithm: str = "EAGLE", **overrides) -> ServerArgs: diff --git a/test/registered/unit/spec/test_spec_registry.py b/test/registered/unit/spec/test_spec_registry.py index 88d10973d..24844e694 100644 --- a/test/registered/unit/spec/test_spec_registry.py +++ b/test/registered/unit/spec/test_spec_registry.py @@ -16,7 +16,7 @@ from sglang.srt.speculative.spec_registry import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _RegistryIsolated(CustomTestCase): diff --git a/test/registered/unit/spec/test_spec_utils_traverse_tree.py b/test/registered/unit/spec/test_spec_utils_traverse_tree.py index 5061d0d43..f63d9078b 100644 --- a/test/registered/unit/spec/test_spec_utils_traverse_tree.py +++ b/test/registered/unit/spec/test_spec_utils_traverse_tree.py @@ -14,7 +14,7 @@ import torch from sglang.srt.speculative.spec_utils import GrammarTree, traverse_tree from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestTraverseTreePassesIntsToGrammar(unittest.TestCase): diff --git a/test/registered/unit/spec/test_suffix_attention_merge_dispatch.py b/test/registered/unit/spec/test_suffix_attention_merge_dispatch.py index 6631f9e34..893bca3a1 100644 --- a/test/registered/unit/spec/test_suffix_attention_merge_dispatch.py +++ b/test/registered/unit/spec/test_suffix_attention_merge_dispatch.py @@ -11,7 +11,7 @@ from sglang.kernels.ops.attention.suffix_attention_merge import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestSuffixAttentionMergeDispatch(CustomTestCase): diff --git a/test/registered/unit/spec/test_uno_tree_config.py b/test/registered/unit/spec/test_uno_tree_config.py index 76cf4c4b2..db266de63 100644 --- a/test/registered/unit/spec/test_uno_tree_config.py +++ b/test/registered/unit/spec/test_uno_tree_config.py @@ -8,7 +8,7 @@ from sglang.srt.arg_groups.speculative_hook import _handle_uno from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestUnoTreeConfig(CustomTestCase): diff --git a/test/registered/unit/state_capturer/test_routed_experts_scattered_a2a.py b/test/registered/unit/state_capturer/test_routed_experts_scattered_a2a.py index c8e3654df..f45dab437 100644 --- a/test/registered/unit/state_capturer/test_routed_experts_scattered_a2a.py +++ b/test/registered/unit/state_capturer/test_routed_experts_scattered_a2a.py @@ -11,7 +11,7 @@ from sglang.srt.state_capturer import routed_experts as re_mod from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestScatteredA2ABackendHelper(CustomTestCase): diff --git a/test/registered/unit/test_cache_hit_kit_metrics.py b/test/registered/unit/test_cache_hit_kit_metrics.py index d99509e04..1ebd7911b 100644 --- a/test/registered/unit/test_cache_hit_kit_metrics.py +++ b/test/registered/unit/test_cache_hit_kit_metrics.py @@ -12,7 +12,7 @@ from sglang.test.kits.cache_hit_kit import ( ) from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestCacheHitKitMetrics(CustomTestCase): diff --git a/test/registered/unit/test_checkpoint_quantization.py b/test/registered/unit/test_checkpoint_quantization.py index 5f6f1a473..40e1e2016 100644 --- a/test/registered/unit/test_checkpoint_quantization.py +++ b/test/registered/unit/test_checkpoint_quantization.py @@ -13,7 +13,7 @@ from sglang.srt.model_loader.checkpoint_quantization import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestResolveCheckpointQuantSpec(CustomTestCase): diff --git a/test/registered/unit/test_cuda_vmm_utils.py b/test/registered/unit/test_cuda_vmm_utils.py index 374432a71..c0d3a9be2 100644 --- a/test/registered/unit/test_cuda_vmm_utils.py +++ b/test/registered/unit/test_cuda_vmm_utils.py @@ -37,7 +37,7 @@ from sglang.srt.utils.cuda_vmm_utils import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.kernels.utils import multigpu_pytest_main -register_cuda_ci(est_time=15, stage="base-b", runner_config="2-gpu-large") +register_cuda_ci(est_time=14, stage="base-b", runner_config="2-gpu-large") _FABRIC = drv.CUmemAllocationHandleType.CU_MEM_HANDLE_TYPE_FABRIC _POSIX_FD = drv.CUmemAllocationHandleType.CU_MEM_HANDLE_TYPE_POSIX_FILE_DESCRIPTOR diff --git a/test/registered/unit/test_dsa_tilelang_fp8_validation.py b/test/registered/unit/test_dsa_tilelang_fp8_validation.py index 42ed533fc..6d9b93554 100644 --- a/test/registered/unit/test_dsa_tilelang_fp8_validation.py +++ b/test/registered/unit/test_dsa_tilelang_fp8_validation.py @@ -11,7 +11,7 @@ from sglang.srt.arg_groups.overrides import _check_tilelang_dsa_fp8_kv from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestDsaTilelangFp8Validation(CustomTestCase): diff --git a/test/registered/unit/test_environ.py b/test/registered/unit/test_environ.py index f75a37a9a..db633040a 100644 --- a/test/registered/unit/test_environ.py +++ b/test/registered/unit/test_environ.py @@ -11,7 +11,7 @@ from contextlib import ExitStack from sglang.srt.environ import _DEPRECATED_ENVS, _DeprecatedEnv, envs from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") class TestEnvField(unittest.TestCase): diff --git a/test/registered/unit/test_eval_accuracy_kit_sgl_eval.py b/test/registered/unit/test_eval_accuracy_kit_sgl_eval.py index 915466371..edb901bab 100644 --- a/test/registered/unit/test_eval_accuracy_kit_sgl_eval.py +++ b/test/registered/unit/test_eval_accuracy_kit_sgl_eval.py @@ -24,7 +24,7 @@ from sglang.test.kits import eval_accuracy_kit as kit from sglang.test.kits.eval_accuracy_kit import GPQAMixin, GSM8KMixin, MMMUProMixin from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") def _fake_get(url, *args, **kwargs): diff --git a/test/registered/unit/test_flashinfer_sparse_mla.py b/test/registered/unit/test_flashinfer_sparse_mla.py index 1b72d9440..1e827af54 100644 --- a/test/registered/unit/test_flashinfer_sparse_mla.py +++ b/test/registered/unit/test_flashinfer_sparse_mla.py @@ -11,7 +11,7 @@ from sglang.kernels.ops.attention.flash_mla_sm120 import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") class TestFlashInferSparseMLAAdapter(unittest.TestCase): diff --git a/test/registered/unit/test_fork_test_worker.py b/test/registered/unit/test_fork_test_worker.py index 39d39d969..110a252b4 100644 --- a/test/registered/unit/test_fork_test_worker.py +++ b/test/registered/unit/test_fork_test_worker.py @@ -11,7 +11,7 @@ from sglang.test.ci import fork_test_worker from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=13, suite="base-a-test-cpu") +register_cpu_ci(est_time=10, suite="base-a-test-cpu") @unittest.skipUnless(hasattr(os, "fork"), "fork requires a POSIX platform") diff --git a/test/registered/unit/test_global_config_read_ratchet.py b/test/registered/unit/test_global_config_read_ratchet.py index a623462bf..6e2ad08a3 100644 --- a/test/registered/unit/test_global_config_read_ratchet.py +++ b/test/registered/unit/test_global_config_read_ratchet.py @@ -27,7 +27,7 @@ caller decided which instance to hand over. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=16, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") import ast import unittest diff --git a/test/registered/unit/test_model_overrides.py b/test/registered/unit/test_model_overrides.py index 594096c16..cf9cbe479 100644 --- a/test/registered/unit/test_model_overrides.py +++ b/test/registered/unit/test_model_overrides.py @@ -3,7 +3,7 @@ gate, publish wiring, and the per-arch golden diffs for migrated families.""" from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") import dataclasses import json diff --git a/test/registered/unit/test_platform_context.py b/test/registered/unit/test_platform_context.py index 201c2a438..591a03d15 100644 --- a/test/registered/unit/test_platform_context.py +++ b/test/registered/unit/test_platform_context.py @@ -16,7 +16,7 @@ from sglang.srt.utils import common as _common from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestPlatformContext(CustomTestCase): diff --git a/test/registered/unit/test_pre_publish_readers.py b/test/registered/unit/test_pre_publish_readers.py index 4fb7c464d..a08c6ac2b 100644 --- a/test/registered/unit/test_pre_publish_readers.py +++ b/test/registered/unit/test_pre_publish_readers.py @@ -15,7 +15,7 @@ requiring a full server boot. from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") import logging import unittest diff --git a/test/registered/unit/test_precision_baseline_store.py b/test/registered/unit/test_precision_baseline_store.py index 61210e755..b4a4d440c 100644 --- a/test/registered/unit/test_precision_baseline_store.py +++ b/test/registered/unit/test_precision_baseline_store.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") import json import os diff --git a/test/registered/unit/test_quantization_post_load.py b/test/registered/unit/test_quantization_post_load.py index 11cf2e6bd..4dc200b7f 100644 --- a/test/registered/unit/test_quantization_post_load.py +++ b/test/registered/unit/test_quantization_post_load.py @@ -9,7 +9,7 @@ from sglang.srt.model_loader.loader import device_loading_context from sglang.srt.model_loader.post_load import stage_module_for_post_load from sglang.test.ci.ci_register import register_cuda_ci -register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=8, stage="base-b", runner_config="1-gpu-small") def _process_device() -> torch.device | None: diff --git a/test/registered/unit/test_ray_driver_reads_the_bags.py b/test/registered/unit/test_ray_driver_reads_the_bags.py index 3f3fb61ce..358159b1e 100644 --- a/test/registered/unit/test_ray_driver_reads_the_bags.py +++ b/test/registered/unit/test_ray_driver_reads_the_bags.py @@ -19,7 +19,7 @@ from sglang.srt.runtime_context import get_context, get_parallel from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # `sglang.srt.ray.engine` imports `ray` at module scope, and the CPU runner has # no ray wheel. diff --git a/test/registered/unit/test_rocm_pageable_h2d_staging.py b/test/registered/unit/test_rocm_pageable_h2d_staging.py index d8693df01..22cb565f7 100644 --- a/test/registered/unit/test_rocm_pageable_h2d_staging.py +++ b/test/registered/unit/test_rocm_pageable_h2d_staging.py @@ -13,7 +13,7 @@ from sglang.srt.arg_groups.platform_hook import handle_amd_specifics from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=5, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") VAR = "GPU_PINNED_MIN_XFER_SIZE" diff --git a/test/registered/unit/test_runai_utils.py b/test/registered/unit/test_runai_utils.py index 56c50b37e..f5a28129a 100644 --- a/test/registered/unit/test_runai_utils.py +++ b/test/registered/unit/test_runai_utils.py @@ -5,7 +5,7 @@ from sglang.srt.utils.runai_utils import ObjectStorageModel, is_runai_obj_uri from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") register_cpu_ci(est_time=6, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/test_runtime_context.py b/test/registered/unit/test_runtime_context.py index b7bd5faa9..e41dd8681 100644 --- a/test/registered/unit/test_runtime_context.py +++ b/test/registered/unit/test_runtime_context.py @@ -2,7 +2,7 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=33, suite="base-a-test-cpu") +register_cpu_ci(est_time=171, suite="base-a-test-cpu") import dataclasses import json diff --git a/test/registered/unit/test_runtime_context_config_bags.py b/test/registered/unit/test_runtime_context_config_bags.py index 27a9ed635..6b843246c 100644 --- a/test/registered/unit/test_runtime_context_config_bags.py +++ b/test/registered/unit/test_runtime_context_config_bags.py @@ -19,7 +19,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") @dataclasses.dataclass diff --git a/test/registered/unit/test_runtime_context_override.py b/test/registered/unit/test_runtime_context_override.py index 25185adf9..a9b13bd5b 100644 --- a/test/registered/unit/test_runtime_context_override.py +++ b/test/registered/unit/test_runtime_context_override.py @@ -15,7 +15,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestContextOverride(CustomTestCase): diff --git a/test/registered/unit/test_server_args_cli_metadata.py b/test/registered/unit/test_server_args_cli_metadata.py index 4ebf060d6..dd68d60fb 100644 --- a/test/registered/unit/test_server_args_cli_metadata.py +++ b/test/registered/unit/test_server_args_cli_metadata.py @@ -8,7 +8,7 @@ from sglang.srt.utils.common import human_readable_int from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestServerArgsMigratedCliMetadata(CustomTestCase): diff --git a/test/registered/unit/test_server_args_migration.py b/test/registered/unit/test_server_args_migration.py index 00808302c..43d4dc4fa 100644 --- a/test/registered/unit/test_server_args_migration.py +++ b/test/registered/unit/test_server_args_migration.py @@ -14,7 +14,7 @@ from sglang.srt.utils.common import configure_media_url_security from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestServerArgsAnnotatedCli(CustomTestCase): diff --git a/test/registered/unit/test_server_args_namespaces.py b/test/registered/unit/test_server_args_namespaces.py index 6767ec8ef..7dcbad563 100644 --- a/test/registered/unit/test_server_args_namespaces.py +++ b/test/registered/unit/test_server_args_namespaces.py @@ -21,7 +21,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=31, suite="base-a-test-cpu") +register_cpu_ci(est_time=35, suite="base-a-test-cpu") # Locked taxonomy (global_context/11-server-args-namespace-split.md). VALID_NAMESPACES = { diff --git a/test/registered/unit/test_split_attention_backend_decisions.py b/test/registered/unit/test_split_attention_backend_decisions.py index 5d73b2dad..c896517d8 100644 --- a/test/registered/unit/test_split_attention_backend_decisions.py +++ b/test/registered/unit/test_split_attention_backend_decisions.py @@ -27,7 +27,7 @@ from sglang.srt.server_args import ServerArgs from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") from sglang.srt.arg_groups.overrides import attention_backends_of, resolved_view diff --git a/test/registered/unit/tokenizer/test_mistral_empty_assistant.py b/test/registered/unit/tokenizer/test_mistral_empty_assistant.py index 287d24fc4..b49e7ba08 100644 --- a/test/registered/unit/tokenizer/test_mistral_empty_assistant.py +++ b/test/registered/unit/tokenizer/test_mistral_empty_assistant.py @@ -5,7 +5,7 @@ from sglang.srt.utils.hf_transformers.mistral_utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") def _user(text): diff --git a/test/registered/unit/tokenizer/test_tekken_tokenizer_routing.py b/test/registered/unit/tokenizer/test_tekken_tokenizer_routing.py index 8a96bfb54..f082b8b77 100644 --- a/test/registered/unit/tokenizer/test_tekken_tokenizer_routing.py +++ b/test/registered/unit/tokenizer/test_tekken_tokenizer_routing.py @@ -8,7 +8,7 @@ import unittest from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") from sglang.srt.utils.hf_transformers.mistral_utils import is_bare_tekken_checkpoint from sglang.srt.utils.hf_transformers.tokenizer import get_tokenizer diff --git a/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py b/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py index 115d6dd5c..774647612 100644 --- a/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py +++ b/test/registered/unit/tokenizer/test_tiktoken_tokenizer.py @@ -6,7 +6,7 @@ from unittest.mock import MagicMock, patch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") from sglang.srt.tokenizer.tiktoken_tokenizer import ( CONTROL_TOKEN_TEXTS, diff --git a/test/registered/unit/tools/test_slash_command_handler.py b/test/registered/unit/tools/test_slash_command_handler.py index 86d6713ea..d7a01e08c 100644 --- a/test/registered/unit/tools/test_slash_command_handler.py +++ b/test/registered/unit/tools/test_slash_command_handler.py @@ -13,7 +13,7 @@ from unittest.mock import patch from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=8, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") _REPO_ROOT = Path(__file__).resolve().parents[4] _HANDLER_PATH = _REPO_ROOT / "scripts/ci/utils/slash_command_handler.py" diff --git a/test/registered/unit/utils/test_common.py b/test/registered/unit/utils/test_common.py index 2b28b089d..610d6b175 100644 --- a/test/registered/unit/utils/test_common.py +++ b/test/registered/unit/utils/test_common.py @@ -14,7 +14,7 @@ from sglang.srt.utils.common import ( from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=5, stage="stage-b", runner_config="1-gpu-small-amd") diff --git a/test/registered/unit/utils/test_diffusion_torch_fallback.py b/test/registered/unit/utils/test_diffusion_torch_fallback.py index f4325b3fd..7cb256b46 100644 --- a/test/registered/unit/utils/test_diffusion_torch_fallback.py +++ b/test/registered/unit/utils/test_diffusion_torch_fallback.py @@ -13,7 +13,7 @@ from sglang.kernels.ops.diffusion.common.fallback_torch import ( ) from sglang.test.ci.ci_register import register_cpu_ci, register_mlx_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") register_cpu_ci(est_time=1, suite="stage-a-test-cpu-intel") register_cpu_ci(est_time=1, suite="base-b-test-cpu-arm64") register_mlx_ci(est_time=1, suite="stage-a-unit-test-mlx") diff --git a/test/registered/unit/utils/test_field_validators.py b/test/registered/unit/utils/test_field_validators.py index 619586c63..baa635cc4 100644 --- a/test/registered/unit/utils/test_field_validators.py +++ b/test/registered/unit/utils/test_field_validators.py @@ -7,7 +7,7 @@ from sglang.srt.utils.field_validators import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=11, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestValidateListI64_1d(CustomTestCase): diff --git a/test/registered/unit/utils/test_gauge_histogram.py b/test/registered/unit/utils/test_gauge_histogram.py index 438b34973..d0919cd94 100644 --- a/test/registered/unit/utils/test_gauge_histogram.py +++ b/test/registered/unit/utils/test_gauge_histogram.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") register_cpu_ci(est_time=4, suite="stage-b-test-cpu-intel") import unittest diff --git a/test/registered/unit/utils/test_hf_transformers.py b/test/registered/unit/utils/test_hf_transformers.py index 92cc43cc3..187fbff67 100644 --- a/test/registered/unit/utils/test_hf_transformers.py +++ b/test/registered/unit/utils/test_hf_transformers.py @@ -31,7 +31,7 @@ from sglang.srt.utils.hf_transformers.tokenizer import _fix_special_tokens_patte from sglang.srt.utils.hf_transformers_patches import normalize_rope_scaling_compat from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/utils/test_hf_transformers_fastokens.py b/test/registered/unit/utils/test_hf_transformers_fastokens.py index 07dedb047..7ff79fa1c 100644 --- a/test/registered/unit/utils/test_hf_transformers_fastokens.py +++ b/test/registered/unit/utils/test_hf_transformers_fastokens.py @@ -12,7 +12,7 @@ from sglang.test.test_utils import ( TOKENIZER_MODEL = DEFAULT_SMALL_MODEL_NAME_FOR_TEST_QWEN -register_cpu_ci(est_time=14, suite="base-a-test-cpu") +register_cpu_ci(est_time=12, suite="base-a-test-cpu") try: diff --git a/test/registered/unit/utils/test_hf_transformers_loading.py b/test/registered/unit/utils/test_hf_transformers_loading.py index d41e047c7..49f39e85c 100644 --- a/test/registered/unit/utils/test_hf_transformers_loading.py +++ b/test/registered/unit/utils/test_hf_transformers_loading.py @@ -30,7 +30,7 @@ from sglang.srt.utils.hf_transformers import ( from sglang.srt.utils.patch_tokenizer import unpatch_tokenizer from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") class TestHFTransformersLoading(unittest.TestCase): diff --git a/test/registered/unit/utils/test_http_server_auth.py b/test/registered/unit/utils/test_http_server_auth.py index fd3c8c329..74502c4cd 100644 --- a/test/registered/unit/utils/test_http_server_auth.py +++ b/test/registered/unit/utils/test_http_server_auth.py @@ -10,7 +10,7 @@ import unittest from sglang.srt.utils.auth import AuthLevel, decide_request_auth from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/utils/test_invariants.py b/test/registered/unit/utils/test_invariants.py index 623233d94..edb4b4e42 100644 --- a/test/registered/unit/utils/test_invariants.py +++ b/test/registered/unit/utils/test_invariants.py @@ -22,7 +22,7 @@ from sglang.srt.utils.invariants import ( from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") # "test." namespace so the coverage meta-test isolates these from real invariants. diff --git a/test/registered/unit/utils/test_json_response.py b/test/registered/unit/utils/test_json_response.py index 70aac292c..8bdcfe852 100644 --- a/test/registered/unit/utils/test_json_response.py +++ b/test/registered/unit/utils/test_json_response.py @@ -10,7 +10,7 @@ from sglang.srt.utils.json_response import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/utils/test_profile_merger.py b/test/registered/unit/utils/test_profile_merger.py index b8fcf87d0..7df24afe9 100644 --- a/test/registered/unit/utils/test_profile_merger.py +++ b/test/registered/unit/utils/test_profile_merger.py @@ -18,7 +18,7 @@ from sglang.srt.utils.profile_merger import ProfileMerger from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class TestProfileMerger(CustomTestCase): diff --git a/test/registered/unit/utils/test_safe_unpickler.py b/test/registered/unit/utils/test_safe_unpickler.py index 441c5c8b7..c078444fe 100644 --- a/test/registered/unit/utils/test_safe_unpickler.py +++ b/test/registered/unit/utils/test_safe_unpickler.py @@ -10,7 +10,7 @@ from sglang.srt.utils.common import MultiprocessingSerializer, safe_pickle_loads from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=2, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") class TestSafeUnpickler(CustomTestCase): diff --git a/test/registered/unit/utils/test_subprocess_watchdog.py b/test/registered/unit/utils/test_subprocess_watchdog.py index cabae0756..a893c1c75 100644 --- a/test/registered/unit/utils/test_subprocess_watchdog.py +++ b/test/registered/unit/utils/test_subprocess_watchdog.py @@ -24,7 +24,7 @@ from sglang.srt.utils.watchdog import SubprocessWatchdog from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase -register_cpu_ci(est_time=14, suite="base-a-test-cpu") +register_cpu_ci(est_time=9, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/unit/utils/test_weight_checker_comparator.py b/test/registered/unit/utils/test_weight_checker_comparator.py index 5eeb0dcaa..eff2f90e5 100644 --- a/test/registered/unit/utils/test_weight_checker_comparator.py +++ b/test/registered/unit/utils/test_weight_checker_comparator.py @@ -31,7 +31,7 @@ from sglang.srt.utils.weight_checker_comparator import ( from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=10, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=9, stage="base-b", runner_config="1-gpu-small") # --------------------------------------------------------------------------- diff --git a/test/registered/unit/utils/test_weight_versions.py b/test/registered/unit/utils/test_weight_versions.py index 7c2508b4b..7904763ad 100644 --- a/test/registered/unit/utils/test_weight_versions.py +++ b/test/registered/unit/utils/test_weight_versions.py @@ -21,7 +21,7 @@ from sglang.test.test_utils import ( published_topology, ) -register_cpu_ci(est_time=12, suite="base-a-test-cpu") +register_cpu_ci(est_time=8, suite="base-a-test-cpu") class _ReqStub: diff --git a/test/registered/utils/test_log_utils.py b/test/registered/utils/test_log_utils.py index fab48d150..8019627ea 100644 --- a/test/registered/utils/test_log_utils.py +++ b/test/registered/utils/test_log_utils.py @@ -10,7 +10,7 @@ from pathlib import Path from sglang.srt.utils.log_utils import create_log_targets, log_json from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") register_cpu_ci(est_time=4, suite="stage-b-test-cpu-intel") _LOG_PREFIX_RE = re.compile(r"^\[\d{4}-\d{2}-\d{2} \d{2}:\d{2}:\d{2}\] ") diff --git a/test/registered/utils/test_network_address.py b/test/registered/utils/test_network_address.py index d3ca555b0..cd7645911 100644 --- a/test/registered/utils/test_network_address.py +++ b/test/registered/utils/test_network_address.py @@ -6,7 +6,7 @@ from sglang.srt.server_args import PortArgs, ServerArgs from sglang.srt.utils.network import NetworkAddress, is_zmq_endpoint_ipv6 from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=6, suite="base-a-test-cpu") register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel") # Mock get_device() so ServerArgs tests run on CPU-only CI runners diff --git a/test/registered/utils/test_numa_utils.py b/test/registered/utils/test_numa_utils.py index ecc29d465..b94432627 100644 --- a/test/registered/utils/test_numa_utils.py +++ b/test/registered/utils/test_numa_utils.py @@ -22,7 +22,7 @@ from sglang.srt.utils.numa_utils import ( ) from sglang.test.ci.ci_register import register_cpu_ci, register_cuda_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") register_cuda_ci(est_time=7, stage="base-c", runner_config="4-gpu-gb300") register_cuda_ci(est_time=6, stage="base-c", runner_config="4-gpu-b200") diff --git a/test/registered/utils/test_phase_checker.py b/test/registered/utils/test_phase_checker.py index d7bf6a12d..dfee51471 100644 --- a/test/registered/utils/test_phase_checker.py +++ b/test/registered/utils/test_phase_checker.py @@ -19,7 +19,7 @@ from sglang.test.ci.ci_register import ( ) from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=17, stage="base-b", runner_config="1-gpu-small") +register_cuda_ci(est_time=15, stage="base-b", runner_config="1-gpu-small") register_amd_ci(est_time=120, stage="stage-b", runner_config="1-gpu-small-amd") # Nightly, not a blocking lane: one case spawns a subprocess that trips a device-side # assert, so a wedge costs the whole subprocess timeout below. diff --git a/test/registered/utils/test_socket_utils.py b/test/registered/utils/test_socket_utils.py index 6119b9a6d..7ba20ad18 100644 --- a/test/registered/utils/test_socket_utils.py +++ b/test/registered/utils/test_socket_utils.py @@ -15,7 +15,7 @@ from sglang.test.ci.ci_register import register_cpu_ci from sglang.test.test_utils import CustomTestCase from sglang.utils import normalize_base_url, release_port, reserve_port -register_cpu_ci(est_time=10, suite="base-a-test-cpu") +register_cpu_ci(est_time=7, suite="base-a-test-cpu") register_cpu_ci(est_time=8, suite="stage-b-test-cpu-intel") diff --git a/test/registered/utils/test_stale_shm_cleanup.py b/test/registered/utils/test_stale_shm_cleanup.py index ef8b60234..afc2e6c08 100644 --- a/test/registered/utils/test_stale_shm_cleanup.py +++ b/test/registered/utils/test_stale_shm_cleanup.py @@ -12,7 +12,7 @@ from sglang.srt.utils.stale_shm_cleanup import ( ) from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=6, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") def _spawn_dead_pid() -> int: diff --git a/test/registered/vlm/test_paddleocr_vl_server.py b/test/registered/vlm/test_paddleocr_vl_server.py index 8dcdb59c3..68410f511 100644 --- a/test/registered/vlm/test_paddleocr_vl_server.py +++ b/test/registered/vlm/test_paddleocr_vl_server.py @@ -18,7 +18,7 @@ from PIL import Image, ImageDraw, ImageFont from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.vlm_utils import TestOpenAIMLLMServerBase -register_cuda_ci(est_time=63, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=55, stage="base-b", runner_config="1-gpu-large") class TestPaddleOCRVLServer(TestOpenAIMLLMServerBase): diff --git a/test/registered/vlm/test_rust_native_mm_e2e.py b/test/registered/vlm/test_rust_native_mm_e2e.py index 32dea3420..2c8a26289 100644 --- a/test/registered/vlm/test_rust_native_mm_e2e.py +++ b/test/registered/vlm/test_rust_native_mm_e2e.py @@ -25,7 +25,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=43, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=40, stage="base-b", runner_config="1-gpu-large") IMAGE_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/man_ironing_on_back_of_suv.png" VISION_BLOCK = "<|vision_start|><|image_pad|><|vision_end|>" diff --git a/test/registered/vlm/test_rust_native_mm_mmmu.py b/test/registered/vlm/test_rust_native_mm_mmmu.py index 9d8ba7f0a..f12f1fbda 100644 --- a/test/registered/vlm/test_rust_native_mm_mmmu.py +++ b/test/registered/vlm/test_rust_native_mm_mmmu.py @@ -30,7 +30,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=126, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=134, stage="base-b", runner_config="1-gpu-large") MODEL = "Qwen/Qwen3.5-0.8B" VISION_BLOCK = "<|vision_start|><|image_pad|><|vision_end|>" diff --git a/test/registered/vlm/test_token_id_retokenize_e2e.py b/test/registered/vlm/test_token_id_retokenize_e2e.py index 419d09a7a..3178edbcb 100644 --- a/test/registered/vlm/test_token_id_retokenize_e2e.py +++ b/test/registered/vlm/test_token_id_retokenize_e2e.py @@ -38,7 +38,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=92, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=95, stage="base-b", runner_config="1-gpu-large") register_cpu_ci(est_time=123, suite="stage-b-test-cpu-intel") diff --git a/test/registered/vlm/test_unlimited_ocr_server.py b/test/registered/vlm/test_unlimited_ocr_server.py index 2cdc6afde..f4311589e 100644 --- a/test/registered/vlm/test_unlimited_ocr_server.py +++ b/test/registered/vlm/test_unlimited_ocr_server.py @@ -8,7 +8,7 @@ from PIL import Image, ImageDraw, ImageFont from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.vlm_utils import TestOpenAIMLLMServerBase -register_cuda_ci(est_time=63, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=55, stage="base-b", runner_config="1-gpu-large") class TestUnlimitedOCRServer(TestOpenAIMLLMServerBase): diff --git a/test/registered/vlm/test_video_utils.py b/test/registered/vlm/test_video_utils.py index 1ad3204f9..66d6e9582 100644 --- a/test/registered/vlm/test_video_utils.py +++ b/test/registered/vlm/test_video_utils.py @@ -5,7 +5,7 @@ import pytest from sglang.srt.utils import sample_video_frames from sglang.test.ci.ci_register import register_cpu_ci -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=5, suite="base-a-test-cpu") register_cpu_ci(est_time=5, suite="stage-b-test-cpu-intel") diff --git a/test/registered/vlm/test_vision_chunked_prefill.py b/test/registered/vlm/test_vision_chunked_prefill.py index f2a46090a..921b0514a 100644 --- a/test/registered/vlm/test_vision_chunked_prefill.py +++ b/test/registered/vlm/test_vision_chunked_prefill.py @@ -1,6 +1,6 @@ from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci -register_cuda_ci(est_time=146, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=157, stage="base-b", runner_config="1-gpu-large") register_amd_ci(est_time=270, suite="stage-b-test-1-gpu-small-amd") """ Usage: diff --git a/test/registered/vlm/test_vision_openai_server_a.py b/test/registered/vlm/test_vision_openai_server_a.py index 6910b7aed..2c9da91d1 100644 --- a/test/registered/vlm/test_vision_openai_server_a.py +++ b/test/registered/vlm/test_vision_openai_server_a.py @@ -29,7 +29,7 @@ from sglang.test.vlm_utils import ( terminate_and_kill_process_tree, ) -register_cuda_ci(est_time=578, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=606, stage="base-b", runner_config="1-gpu-large") # --- Qwen3-VL grounding regression (deepstack fusion) -------------------------- diff --git a/test/registered/vlm/test_vision_openai_server_extra.py b/test/registered/vlm/test_vision_openai_server_extra.py index 2e50ddbdc..4e19729e8 100644 --- a/test/registered/vlm/test_vision_openai_server_extra.py +++ b/test/registered/vlm/test_vision_openai_server_extra.py @@ -6,7 +6,7 @@ import unittest from sglang.test.ci.ci_register import register_cuda_ci from sglang.test.vlm_utils import OmniOpenAITestMixin -register_cuda_ci(est_time=159, stage="extra-a", runner_config="1-gpu-large") +register_cuda_ci(est_time=160, stage="extra-a", runner_config="1-gpu-large") class TestQwen3OmniServer(OmniOpenAITestMixin): diff --git a/test/registered/vlm/test_vlm_input_format.py b/test/registered/vlm/test_vlm_input_format.py index 6b5a94b6c..f274cf073 100644 --- a/test/registered/vlm/test_vlm_input_format.py +++ b/test/registered/vlm/test_vlm_input_format.py @@ -39,7 +39,7 @@ from sglang.srt.utils.common import is_cuda, is_xpu from sglang.srt.utils.hf_transformers_utils import _fix_added_tokens_encoding from sglang.test.test_utils import CustomTestCase -register_cuda_ci(est_time=232, stage="base-b", runner_config="1-gpu-large") +register_cuda_ci(est_time=266, stage="base-b", runner_config="1-gpu-large") IMAGE_MAN_IRONING_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/man_ironing_on_back_of_suv.png" IMAGE_SGL_LOGO_URL = "https://raw.githubusercontent.com/sgl-project/sgl-test-files/refs/heads/main/images/sgl_logo.png" diff --git a/test/registered/vlm/test_vlm_tp4.py b/test/registered/vlm/test_vlm_tp4.py index a2b8f5098..b8ca4964b 100644 --- a/test/registered/vlm/test_vlm_tp4.py +++ b/test/registered/vlm/test_vlm_tp4.py @@ -15,7 +15,7 @@ from sglang.test.test_utils import ( popen_launch_server, ) -register_cuda_ci(est_time=136, stage="base-c", runner_config="4-gpu-h100") +register_cuda_ci(est_time=140, stage="base-c", runner_config="4-gpu-h100") QWEN35_27B_MODEL = "Qwen/Qwen3.5-27B" MMMU_ACCURACY_THRESHOLD = 0.65 diff --git a/test/registered/xpu/test_numa_utils_xpu.py b/test/registered/xpu/test_numa_utils_xpu.py index 9d1378dd1..25b7931fb 100644 --- a/test/registered/xpu/test_numa_utils_xpu.py +++ b/test/registered/xpu/test_numa_utils_xpu.py @@ -23,7 +23,7 @@ from sglang.srt.utils.numa_utils import ( from sglang.test.ci.ci_register import register_cpu_ci, register_xpu_ci # CPU too: only TestXpuOrderMatchesRuntime needs hardware. -register_cpu_ci(est_time=7, suite="base-a-test-cpu") +register_cpu_ci(est_time=4, suite="base-a-test-cpu") register_xpu_ci(est_time=10, suite="stage-a-test-1-gpu-xpu")