From 81c88da1ab06635dacbff8fa0287599b661ba001 Mon Sep 17 00:00:00 2001 From: Mick Date: Wed, 12 Aug 2026 10:25:14 +0800 Subject: [PATCH] [diffusion] fix: nightly diffusion benchmark passes the retired --warmup flag (#34423) Co-authored-by: Claude Opus 5 --- .../utils/diffusion/comparison_configs.json | 22 +++++++++---------- scripts/ci/utils/diffusion/run_comparison.py | 6 ++--- 2 files changed, 14 insertions(+), 14 deletions(-) diff --git a/scripts/ci/utils/diffusion/comparison_configs.json b/scripts/ci/utils/diffusion/comparison_configs.json index 7694d3ac8..95d4a4f6e 100644 --- a/scripts/ci/utils/diffusion/comparison_configs.json +++ b/scripts/ci/utils/diffusion/comparison_configs.json @@ -13,7 +13,7 @@ "num_gpus": 2, "frameworks": { "sglang": { - "serve_args": "--warmup --dit-layerwise-offload false --tp-size 2", + "serve_args": "--warmup-mode server --dit-layerwise-offload false --tp-size 2", "extra_env": {} } } @@ -29,7 +29,7 @@ "num_gpus": 2, "frameworks": { "sglang": { - "serve_args": "--warmup --dit-layerwise-offload false --tp-size 2", + "serve_args": "--warmup-mode server --dit-layerwise-offload false --tp-size 2", "extra_env": {} } } @@ -45,7 +45,7 @@ "num_gpus": 2, "frameworks": { "sglang": { - "serve_args": "--warmup --tp-size 2", + "serve_args": "--warmup-mode server --tp-size 2", "extra_env": {} } } @@ -62,7 +62,7 @@ "num_gpus": 2, "frameworks": { "sglang": { - "serve_args": "--warmup --tp-size 2", + "serve_args": "--warmup-mode server --tp-size 2", "extra_env": {} } } @@ -78,7 +78,7 @@ "num_gpus": 2, "frameworks": { "sglang": { - "serve_args": "--warmup --tp-size 2", + "serve_args": "--warmup-mode server --tp-size 2", "extra_env": {} } } @@ -95,7 +95,7 @@ "num_gpus": 4, "frameworks": { "sglang": { - "serve_args": "--warmup --enable-cfg-parallel --ulysses-degree 2 --text-encoder-cpu-offload --pin-cpu-memory", + "serve_args": "--warmup-mode server --enable-cfg-parallel --ulysses-degree 2 --text-encoder-cpu-offload --pin-cpu-memory", "extra_env": {} } } @@ -113,7 +113,7 @@ "num_gpus": 1, "frameworks": { "sglang": { - "serve_args": "--warmup", + "serve_args": "--warmup-mode server", "extra_env": {} } } @@ -131,7 +131,7 @@ "num_gpus": 2, "frameworks": { "sglang": { - "serve_args": "--warmup --pipeline-class-name LTX2TwoStagePipeline --cfg-parallel-size 2", + "serve_args": "--warmup-mode server --pipeline-class-name LTX2TwoStagePipeline --cfg-parallel-size 2", "extra_env": {} } } @@ -147,7 +147,7 @@ "num_gpus": 2, "frameworks": { "sglang": { - "serve_args": "--warmup --tp-size 2 --attention-backend fa", + "serve_args": "--warmup-mode server --tp-size 2 --attention-backend fa", "extra_env": {} } } @@ -164,7 +164,7 @@ "num_gpus": 2, "frameworks": { "sglang": { - "serve_args": "--warmup --tp-size 2", + "serve_args": "--warmup-mode server --tp-size 2", "extra_env": {"SGLANG_DISABLE_COSMOS3_GUARDRAILS": "1"} } } @@ -182,7 +182,7 @@ "num_gpus": 4, "frameworks": { "sglang": { - "serve_args": "--warmup --enable-cfg-parallel --ulysses-degree 2 --text-encoder-cpu-offload --pin-cpu-memory", + "serve_args": "--warmup-mode server --enable-cfg-parallel --ulysses-degree 2 --text-encoder-cpu-offload --pin-cpu-memory", "extra_env": {} } } diff --git a/scripts/ci/utils/diffusion/run_comparison.py b/scripts/ci/utils/diffusion/run_comparison.py index c625bfde9..6bfe6dd0b 100644 --- a/scripts/ci/utils/diffusion/run_comparison.py +++ b/scripts/ci/utils/diffusion/run_comparison.py @@ -802,9 +802,9 @@ def run_single( wait_for_health(base_url, framework) # No client-side warmup: each framework relies on its own server-side - # warmup before traffic. sglang's serve_args pass --warmup, which `serve` - # resolves to server-based (synthetic) warmup that primes kernels at - # startup, before the health check passes. This goes through the internal + # warmup before traffic. sglang's serve_args pass --warmup-mode server, + # which primes kernels with a synthetic request at startup, before the + # health check passes. This goes through the internal # warmup path that bypasses sampling-param preset validation (e.g. # Ideogram-4's preset-locked num_inference_steps), so no per-case warmup # special-casing is needed here.