From 8d4a22c5af1fa41b30f51fe2d31f1302c6b84d18 Mon Sep 17 00:00:00 2001 From: Mohammad Miadh Angkad <176301910+mmangkad@users.noreply.github.com> Date: Thu, 18 Jun 2026 12:42:00 +0800 Subject: [PATCH] [Docs] Add fp8 kv cache for tokenspeed mla docs (#28201) --- .../src/snippets/autoregressive/kimi-k25-deployment.jsx | 8 +++++--- .../src/snippets/autoregressive/kimi-k26-deployment.jsx | 6 ++++-- .../snippets/autoregressive/kimi-k27-code-deployment.jsx | 6 ++++-- 3 files changed, 13 insertions(+), 7 deletions(-) diff --git a/docs_new/src/snippets/autoregressive/kimi-k25-deployment.jsx b/docs_new/src/snippets/autoregressive/kimi-k25-deployment.jsx index e847c3469..982fd443d 100644 --- a/docs_new/src/snippets/autoregressive/kimi-k25-deployment.jsx +++ b/docs_new/src/snippets/autoregressive/kimi-k25-deployment.jsx @@ -196,13 +196,15 @@ export const KimiK25Deployment = () => { cmd += ' \\\n --speculative-algorithm EAGLE3 \\\n --speculative-num-steps 3 \\\n --speculative-eagle-topk 1 \\\n --speculative-num-draft-tokens 4 \\\n --speculative-draft-model-path lightseekorg/kimi-k2.5-eagle3-mla'; } + const usesTokenspeedMla = hardware === 'b300' || hardware === 'gb300'; + // Blackwell (B300/GB300): tokenspeed MLA attention backend - if (hardware === 'b300' || hardware === 'gb300') { + if (usesTokenspeedMla) { cmd += ' \\\n --attention-backend tokenspeed_mla'; } - // AMD: FP8 KV cache for memory efficiency - if (isAMD) { + // FP8 KV cache for AMD memory efficiency and tokenspeed MLA compatibility + if (isAMD || usesTokenspeedMla) { cmd += ' \\\n --kv-cache-dtype fp8_e4m3'; } diff --git a/docs_new/src/snippets/autoregressive/kimi-k26-deployment.jsx b/docs_new/src/snippets/autoregressive/kimi-k26-deployment.jsx index 3dc2e820e..3e7b998bc 100644 --- a/docs_new/src/snippets/autoregressive/kimi-k26-deployment.jsx +++ b/docs_new/src/snippets/autoregressive/kimi-k26-deployment.jsx @@ -194,11 +194,13 @@ export const KimiK26Deployment = () => { cmd += ' \\\n --speculative-draft-model-path lightseekorg/kimi-k2.6-eagle3.1-mla'; } - if (hardware === 'b300' || hardware === 'gb300') { + const usesTokenspeedMla = hardware === 'b300' || hardware === 'gb300'; + + if (usesTokenspeedMla) { cmd += ' \\\n --attention-backend tokenspeed_mla'; } - if (isAMD) { + if (isAMD || usesTokenspeedMla) { cmd += ' \\\n --kv-cache-dtype fp8_e4m3'; } diff --git a/docs_new/src/snippets/autoregressive/kimi-k27-code-deployment.jsx b/docs_new/src/snippets/autoregressive/kimi-k27-code-deployment.jsx index e2f6c695f..e90c74e03 100644 --- a/docs_new/src/snippets/autoregressive/kimi-k27-code-deployment.jsx +++ b/docs_new/src/snippets/autoregressive/kimi-k27-code-deployment.jsx @@ -144,11 +144,13 @@ export const KimiK27CodeDeployment = () => { cmd += ' \\\n --tool-call-parser kimi_k2'; } - if (hardware === 'b300' || hardware === 'gb300') { + const usesTokenspeedMla = hardware === 'b300' || hardware === 'gb300'; + + if (usesTokenspeedMla) { cmd += ' \\\n --attention-backend tokenspeed_mla'; } - if (isAMD) { + if (isAMD || usesTokenspeedMla) { cmd += ' \\\n --kv-cache-dtype fp8_e4m3'; }