From 3f66873304626d1c3ea87d5b17673e6b6fd6e2ef Mon Sep 17 00:00:00 2001 From: zijiexia <37504505+zijiexia@users.noreply.github.com> Date: Thu, 18 Jun 2026 00:05:21 -0700 Subject: [PATCH] [Docs] DeepSeek-V4 cookbook: drop --disable-flashinfer-autotune from GB300 Flash low-latency (#28590) Co-authored-by: Claude Opus 4.8 (1M context) --- .../configs/deepseek-ai/deepseek-v4-benchmarks.jsx | 7 +++++++ docs_new/src/snippets/configs/deepseek-ai/deepseek-v4.jsx | 1 - 2 files changed, 7 insertions(+), 1 deletion(-) diff --git a/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4-benchmarks.jsx b/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4-benchmarks.jsx index b345ada0e..304edbabd 100644 --- a/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4-benchmarks.jsx +++ b/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4-benchmarks.jsx @@ -140,6 +140,13 @@ export const benchmarks = [ // ==================================================================== { match: { hw: "gb300", variant: "flash", quant: "fp4", strategy: "low-latency", nodes: "single" }, + sglang_version: "0.5.13.post1", + speed: [ + { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 1 }, + ttft_ms: 463, tpot_ms: 4.19, tokens_per_sec_per_gpu: 35 }, + { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 16 }, + ttft_ms: 436, tpot_ms: 8.93, tokens_per_sec_per_gpu: 336 }, + ], }, { match: { hw: "gb300", variant: "flash", quant: "fp4", strategy: "balanced", nodes: "single" }, diff --git a/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4.jsx b/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4.jsx index caebb215f..2450c213c 100644 --- a/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4.jsx +++ b/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4.jsx @@ -743,7 +743,6 @@ sgl-eval run aime25 \\ "--speculative-eagle-topk 1", "--speculative-num-draft-tokens 4", "--chunked-prefill-size 4096", - "--disable-flashinfer-autotune", "--swa-full-tokens-ratio 0.1", "--host {{HOST_IP}}", "--port {{PORT}}",