From 561e54f8038e80cf528ada9b8fdf079b436bde92 Mon Sep 17 00:00:00 2001 From: Qiaolin Yu Date: Wed, 27 May 2026 16:04:04 -0700 Subject: [PATCH] Update kimi k25 launch command in cookbook (#26511) --- .../src/snippets/autoregressive/kimi-k25-deployment.jsx | 7 ++++++- 1 file changed, 6 insertions(+), 1 deletion(-) diff --git a/docs_new/src/snippets/autoregressive/kimi-k25-deployment.jsx b/docs_new/src/snippets/autoregressive/kimi-k25-deployment.jsx index 7376cb955..34ff68c03 100644 --- a/docs_new/src/snippets/autoregressive/kimi-k25-deployment.jsx +++ b/docs_new/src/snippets/autoregressive/kimi-k25-deployment.jsx @@ -195,7 +195,12 @@ export const KimiK25Deployment = () => { // Speculative decoding (EAGLE3) if (speculative === 'enabled') { - cmd += ' \\\n --speculative-algorithm EAGLE3 \\\n --speculative-num-steps 3 \\\n --speculative-eagle-topk 1 \\\n --speculative-num-draft-tokens 4 \\\n --speculative-draft-model-path lightseekorg/kimi-k2.5-eagle3'; + cmd += ' \\\n --speculative-algorithm EAGLE3 \\\n --speculative-num-steps 3 \\\n --speculative-eagle-topk 1 \\\n --speculative-num-draft-tokens 4 \\\n --speculative-draft-model-path lightseekorg/kimi-k2.5-eagle3-mla'; + } + + // Blackwell (B300): tokenspeed MLA attention backend + if (hardware === 'b300') { + cmd += ' \\\n --attention-backend tokenspeed_mla'; } // AMD: FP8 KV cache for memory efficiency