[Fix] Fix several bugs on DSA models (#22430)
This commit is contained in:
@@ -2129,11 +2129,9 @@ class NativeSparseAttnBackend(
|
|||||||
# disable for MTP
|
# disable for MTP
|
||||||
self.nsa_kv_cache_store_fp8
|
self.nsa_kv_cache_store_fp8
|
||||||
and self.nsa_prefill_impl == "flashmla_sparse"
|
and self.nsa_prefill_impl == "flashmla_sparse"
|
||||||
|
and forward_mode == ForwardMode.EXTEND
|
||||||
):
|
):
|
||||||
topk_transform_method = TopkTransformMethod.RAGGED
|
topk_transform_method = TopkTransformMethod.RAGGED
|
||||||
|
|
||||||
if forward_mode is not None and (forward_mode.is_decode_or_idle()):
|
|
||||||
topk_transform_method = TopkTransformMethod.PAGED
|
|
||||||
else:
|
else:
|
||||||
topk_transform_method = TopkTransformMethod.PAGED
|
topk_transform_method = TopkTransformMethod.PAGED
|
||||||
return topk_transform_method
|
return topk_transform_method
|
||||||
|
|||||||
@@ -1491,8 +1491,10 @@ class ServerArgs:
|
|||||||
self.nsa_decode_backend = "tilelang"
|
self.nsa_decode_backend = "tilelang"
|
||||||
elif kv_cache_dtype == "fp8_e4m3":
|
elif kv_cache_dtype == "fp8_e4m3":
|
||||||
if major >= 10:
|
if major >= 10:
|
||||||
self.nsa_prefill_backend = "trtllm"
|
if not user_set_prefill:
|
||||||
self.nsa_decode_backend = "trtllm"
|
self.nsa_prefill_backend = "trtllm"
|
||||||
|
if not user_set_decode:
|
||||||
|
self.nsa_decode_backend = "trtllm"
|
||||||
else:
|
else:
|
||||||
# flashmla_auto dispatches to flashmla_sparse/flashmla_kv based on hardware and heuristics
|
# flashmla_auto dispatches to flashmla_sparse/flashmla_kv based on hardware and heuristics
|
||||||
if not user_set_prefill:
|
if not user_set_prefill:
|
||||||
|
|||||||
Reference in New Issue
Block a user