From 971932d66117af03f5a4833d5fdf1ee42fba2c79 Mon Sep 17 00:00:00 2001 From: Yuhao Yang <47235274+yhyang201@users.noreply.github.com> Date: Fri, 7 Aug 2026 04:54:25 +0800 Subject: [PATCH] [Kimi-K3] Allow DSPARK verify on cutedsl_mla (fold_sq) (#33650) --- python/sglang/srt/arg_groups/overrides.py | 6 ++++-- 1 file changed, 4 insertions(+), 2 deletions(-) diff --git a/python/sglang/srt/arg_groups/overrides.py b/python/sglang/srt/arg_groups/overrides.py index f5af1ddbc..7ef959181 100644 --- a/python/sglang/srt/arg_groups/overrides.py +++ b/python/sglang/srt/arg_groups/overrides.py @@ -362,8 +362,10 @@ def _dspark_verify_on_decode_backend( if backend == "tokenspeed_mla": return kv_cache_dtype == "fp8_e4m3" and q_len <= 8 if backend == "cutedsl_mla": - # The cute-dsl kernel rejects q_len >= 5 with no fallback. - return q_len <= 4 + # cute-dsl monolithic MLA decode folds the verify tokens into the head + # dim (fold_sq), so it serves any DSPARK verify width. Needs flashinfer + # >= 0.6.15 (older builds reject q_len >= 5). + return True return False