cookbook(deepseek-v4): add MORI disagg backend for AMD + bump MI355X image (#30651)

Co-authored-by: Zijie Xia <zijie.xia@radixark.ai>
Co-authored-by: Claude Fable 5 <noreply@anthropic.com>
Co-authored-by: zijiexia <37504505+zijiexia@users.noreply.github.com>
This commit is contained in:
ChangLiu0709
2026-07-15 07:33:05 +00:00
committed by GitHub
co-authored by Zijie Xia Claude Fable 5 zijiexia
parent 241937af87
commit fbcbe0a986
2 changed files with 52 additions and 29 deletions
+4
View File
@@ -684,6 +684,10 @@ export const Playground = ({ config }) => {
&& h.isHidden(fc.ibDevices, next.ibDevice, base)) {
next.ibDevice = "auto"; changed = true;
}
if (next.transferBackend !== "mooncake" && fc.transferBackends
&& h.isHidden(fc.transferBackends, next.transferBackend, base)) {
next.transferBackend = "mooncake"; changed = true;
}
return changed ? next : value;
},
@@ -161,7 +161,7 @@ sgl-eval run aime25 \\
// AMD daily-updated lmsysorg/sglang-rocm images. Bump the dated tag when you
// re-verify on a newer build.
mi300x: "lmsysorg/sglang-rocm:v0.5.13.post1-rocm720-mi30x-20260623",
mi355x: "lmsysorg/sglang-rocm:v0.5.13.post1-rocm720-mi35x-20260623",
mi355x: "lmsysorg/sglang-rocm:v0.5.14-rocm720-mi35x-20260708",
},
// Pre-selects the issue template's `model` dropdown on "Submit verified cell".
@@ -289,6 +289,9 @@ sgl-eval run aime25 \\
],
envWhen: { hw: ["gb200", "gb300"] } },
{ id: "nixl", label: "NiXL" },
// MORI-IO transport is AMD-only — hidden on every non-ROCm platform.
{ id: "mori", label: "MORI",
hide: { hw: ["h100", "h200", "b200", "b300", "gb200", "gb300", "rtx6000"] } },
],
// `auto` is a sentinel (emits no --disaggregation-ib-device flag).
ibDevices: [{ id: "auto", label: "Auto" }, "mlx5_0", "mlx5_7"],
@@ -1506,7 +1509,7 @@ sgl-eval run aime25 \\
"--attention-backend dsv4",
"--page-size 256",
"--mem-fraction-static 0.90",
"--swa-full-tokens-ratio 0.1",
"--swa-full-tokens-ratio 0.15",
"--disable-shared-experts-fusion",
"--kv-cache-dtype fp8_e4m3",
"--chunked-prefill-size 8192",
@@ -1523,7 +1526,10 @@ sgl-eval run aime25 \\
verified: true,
env: [
"SGLANG_USE_ROCM700A=0",
"SGLANG_SHARED_EXPERT_TP1=1",
"SGLANG_DP_SHARED_EXPERT_LOCAL=1",
"SGLANG_DP_USE_GATHERV=1",
"SGLANG_DP_USE_REDUCE_SCATTER=1",
"SGLANG_HACK_FLASHMLA_BACKEND=unified_kv_triton",
"AITER_BF16_FP8_MOE_BOUND=0",
],
@@ -1533,12 +1539,11 @@ sgl-eval run aime25 \\
"--tp 8",
"--dp 8",
"--enable-dp-attention",
"--enable-prefill-delayer",
"--prefill-delayer-max-delay-ms 5000",
"--enable-two-batch-overlap",
"--attention-backend dsv4",
"--page-size 256",
"--mem-fraction-static 0.90",
"--swa-full-tokens-ratio 0.1",
"--swa-full-tokens-ratio 0.15",
"--disable-shared-experts-fusion",
"--kv-cache-dtype fp8_e4m3",
"--chunked-prefill-size 65536",
@@ -1555,7 +1560,10 @@ sgl-eval run aime25 \\
verified: true,
env: [
"SGLANG_USE_ROCM700A=0",
"SGLANG_SHARED_EXPERT_TP1=1",
"SGLANG_DP_SHARED_EXPERT_LOCAL=1",
"SGLANG_DP_USE_GATHERV=1",
"SGLANG_DP_USE_REDUCE_SCATTER=1",
"SGLANG_HACK_FLASHMLA_BACKEND=unified_kv_triton",
"AITER_BF16_FP8_MOE_BOUND=0",
],
@@ -1565,12 +1573,11 @@ sgl-eval run aime25 \\
"--tp 8",
"--dp 8",
"--enable-dp-attention",
"--enable-prefill-delayer",
"--prefill-delayer-max-delay-ms 5000",
"--enable-two-batch-overlap",
"--attention-backend dsv4",
"--page-size 256",
"--mem-fraction-static 0.90",
"--swa-full-tokens-ratio 0.1",
"--swa-full-tokens-ratio 0.15",
"--disable-shared-experts-fusion",
"--kv-cache-dtype fp8_e4m3",
"--chunked-prefill-size 65536",
@@ -1599,7 +1606,7 @@ sgl-eval run aime25 \\
"--attention-backend dsv4",
"--page-size 256",
"--mem-fraction-static 0.90",
"--swa-full-tokens-ratio 0.1",
"--swa-full-tokens-ratio 0.15",
"--disable-shared-experts-fusion",
"--kv-cache-dtype fp8_e4m3",
"--chunked-prefill-size 8192",
@@ -1616,7 +1623,10 @@ sgl-eval run aime25 \\
verified: true,
env: [
"SGLANG_USE_ROCM700A=0",
"SGLANG_SHARED_EXPERT_TP1=1",
"SGLANG_DP_SHARED_EXPERT_LOCAL=1",
"SGLANG_DP_USE_GATHERV=1",
"SGLANG_DP_USE_REDUCE_SCATTER=1",
"SGLANG_HACK_FLASHMLA_BACKEND=unified_kv_triton",
"AITER_BF16_FP8_MOE_BOUND=0",
],
@@ -1626,12 +1636,11 @@ sgl-eval run aime25 \\
"--tp 8",
"--dp 8",
"--enable-dp-attention",
"--enable-prefill-delayer",
"--prefill-delayer-max-delay-ms 5000",
"--enable-two-batch-overlap",
"--attention-backend dsv4",
"--page-size 256",
"--mem-fraction-static 0.90",
"--swa-full-tokens-ratio 0.1",
"--swa-full-tokens-ratio 0.15",
"--disable-shared-experts-fusion",
"--kv-cache-dtype fp8_e4m3",
"--chunked-prefill-size 65536",
@@ -1648,7 +1657,10 @@ sgl-eval run aime25 \\
verified: true,
env: [
"SGLANG_USE_ROCM700A=0",
"SGLANG_SHARED_EXPERT_TP1=1",
"SGLANG_DP_SHARED_EXPERT_LOCAL=1",
"SGLANG_DP_USE_GATHERV=1",
"SGLANG_DP_USE_REDUCE_SCATTER=1",
"SGLANG_HACK_FLASHMLA_BACKEND=unified_kv_triton",
"AITER_BF16_FP8_MOE_BOUND=0",
],
@@ -1658,12 +1670,11 @@ sgl-eval run aime25 \\
"--tp 8",
"--dp 8",
"--enable-dp-attention",
"--enable-prefill-delayer",
"--prefill-delayer-max-delay-ms 5000",
"--enable-two-batch-overlap",
"--attention-backend dsv4",
"--page-size 256",
"--mem-fraction-static 0.90",
"--swa-full-tokens-ratio 0.1",
"--swa-full-tokens-ratio 0.15",
"--disable-shared-experts-fusion",
"--kv-cache-dtype fp8_e4m3",
"--chunked-prefill-size 65536",
@@ -1692,7 +1703,7 @@ sgl-eval run aime25 \\
"--attention-backend dsv4",
"--page-size 256",
"--mem-fraction-static 0.90",
"--swa-full-tokens-ratio 0.1",
"--swa-full-tokens-ratio 0.15",
"--disable-shared-experts-fusion",
"--kv-cache-dtype fp8_e4m3",
"--chunked-prefill-size 8192",
@@ -1709,7 +1720,10 @@ sgl-eval run aime25 \\
verified: true,
env: [
"SGLANG_USE_ROCM700A=0",
"SGLANG_SHARED_EXPERT_TP1=1",
"SGLANG_DP_SHARED_EXPERT_LOCAL=1",
"SGLANG_DP_USE_GATHERV=1",
"SGLANG_DP_USE_REDUCE_SCATTER=1",
"SGLANG_HACK_FLASHMLA_BACKEND=unified_kv_triton",
"AITER_BF16_FP8_MOE_BOUND=0",
],
@@ -1719,12 +1733,11 @@ sgl-eval run aime25 \\
"--tp 8",
"--dp 8",
"--enable-dp-attention",
"--enable-prefill-delayer",
"--prefill-delayer-max-delay-ms 5000",
"--enable-two-batch-overlap",
"--attention-backend dsv4",
"--page-size 256",
"--mem-fraction-static 0.90",
"--swa-full-tokens-ratio 0.1",
"--swa-full-tokens-ratio 0.15",
"--disable-shared-experts-fusion",
"--kv-cache-dtype fp8_e4m3",
"--chunked-prefill-size 65536",
@@ -1741,7 +1754,10 @@ sgl-eval run aime25 \\
verified: true,
env: [
"SGLANG_USE_ROCM700A=0",
"SGLANG_SHARED_EXPERT_TP1=1",
"SGLANG_DP_SHARED_EXPERT_LOCAL=1",
"SGLANG_DP_USE_GATHERV=1",
"SGLANG_DP_USE_REDUCE_SCATTER=1",
"SGLANG_HACK_FLASHMLA_BACKEND=unified_kv_triton",
"AITER_BF16_FP8_MOE_BOUND=0",
],
@@ -1751,12 +1767,11 @@ sgl-eval run aime25 \\
"--tp 8",
"--dp 8",
"--enable-dp-attention",
"--enable-prefill-delayer",
"--prefill-delayer-max-delay-ms 5000",
"--enable-two-batch-overlap",
"--attention-backend dsv4",
"--page-size 256",
"--mem-fraction-static 0.90",
"--swa-full-tokens-ratio 0.1",
"--swa-full-tokens-ratio 0.15",
"--disable-shared-experts-fusion",
"--kv-cache-dtype fp8_e4m3",
"--chunked-prefill-size 65536",
@@ -1785,7 +1800,7 @@ sgl-eval run aime25 \\
"--attention-backend dsv4",
"--page-size 256",
"--mem-fraction-static 0.90",
"--swa-full-tokens-ratio 0.1",
"--swa-full-tokens-ratio 0.15",
"--disable-shared-experts-fusion",
"--kv-cache-dtype fp8_e4m3",
"--chunked-prefill-size 8192",
@@ -1802,7 +1817,10 @@ sgl-eval run aime25 \\
verified: true,
env: [
"SGLANG_USE_ROCM700A=0",
"SGLANG_SHARED_EXPERT_TP1=1",
"SGLANG_DP_SHARED_EXPERT_LOCAL=1",
"SGLANG_DP_USE_GATHERV=1",
"SGLANG_DP_USE_REDUCE_SCATTER=1",
"SGLANG_HACK_FLASHMLA_BACKEND=unified_kv_triton",
"AITER_BF16_FP8_MOE_BOUND=0",
],
@@ -1812,12 +1830,11 @@ sgl-eval run aime25 \\
"--tp 8",
"--dp 8",
"--enable-dp-attention",
"--enable-prefill-delayer",
"--prefill-delayer-max-delay-ms 5000",
"--enable-two-batch-overlap",
"--attention-backend dsv4",
"--page-size 256",
"--mem-fraction-static 0.90",
"--swa-full-tokens-ratio 0.1",
"--swa-full-tokens-ratio 0.15",
"--disable-shared-experts-fusion",
"--kv-cache-dtype fp8_e4m3",
"--chunked-prefill-size 65536",
@@ -1834,7 +1851,10 @@ sgl-eval run aime25 \\
verified: true,
env: [
"SGLANG_USE_ROCM700A=0",
"SGLANG_SHARED_EXPERT_TP1=1",
"SGLANG_DP_SHARED_EXPERT_LOCAL=1",
"SGLANG_DP_USE_GATHERV=1",
"SGLANG_DP_USE_REDUCE_SCATTER=1",
"SGLANG_HACK_FLASHMLA_BACKEND=unified_kv_triton",
"AITER_BF16_FP8_MOE_BOUND=0",
],
@@ -1844,12 +1864,11 @@ sgl-eval run aime25 \\
"--tp 8",
"--dp 8",
"--enable-dp-attention",
"--enable-prefill-delayer",
"--prefill-delayer-max-delay-ms 5000",
"--enable-two-batch-overlap",
"--attention-backend dsv4",
"--page-size 256",
"--mem-fraction-static 0.90",
"--swa-full-tokens-ratio 0.1",
"--swa-full-tokens-ratio 0.15",
"--disable-shared-experts-fusion",
"--kv-cache-dtype fp8_e4m3",
"--chunked-prefill-size 65536",