diff --git a/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4-benchmarks.jsx b/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4-benchmarks.jsx index b345ada0e..304edbabd 100644 --- a/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4-benchmarks.jsx +++ b/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4-benchmarks.jsx @@ -140,6 +140,13 @@ export const benchmarks = [ // ==================================================================== { match: { hw: "gb300", variant: "flash", quant: "fp4", strategy: "low-latency", nodes: "single" }, + sglang_version: "0.5.13.post1", + speed: [ + { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 1 }, + ttft_ms: 463, tpot_ms: 4.19, tokens_per_sec_per_gpu: 35 }, + { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 16 }, + ttft_ms: 436, tpot_ms: 8.93, tokens_per_sec_per_gpu: 336 }, + ], }, { match: { hw: "gb300", variant: "flash", quant: "fp4", strategy: "balanced", nodes: "single" }, diff --git a/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4.jsx b/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4.jsx index caebb215f..2450c213c 100644 --- a/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4.jsx +++ b/docs_new/src/snippets/configs/deepseek-ai/deepseek-v4.jsx @@ -743,7 +743,6 @@ sgl-eval run aime25 \\ "--speculative-eagle-topk 1", "--speculative-num-draft-tokens 4", "--chunked-prefill-size 4096", - "--disable-flashinfer-autotune", "--swa-full-tokens-ratio 0.1", "--host {{HOST_IP}}", "--port {{PORT}}",