Fix dp run error with fp8-kv enable in high concurrency test (#15241)
Co-authored-by: wunhuang <wunhuang@amd.com>
This commit is contained in:
@@ -411,13 +411,7 @@ def handle_attention_trtllm_mla(attn, forward_batch):
|
|||||||
|
|
||||||
def handle_attention_aiter(attn, forward_batch):
|
def handle_attention_aiter(attn, forward_batch):
|
||||||
if forward_batch.forward_mode.is_extend_without_speculative():
|
if forward_batch.forward_mode.is_extend_without_speculative():
|
||||||
if is_dp_attention_enabled():
|
return AttnForwardMethod.MHA
|
||||||
if sum(forward_batch.extend_prefix_lens_cpu) == 0:
|
|
||||||
return AttnForwardMethod.MHA
|
|
||||||
else:
|
|
||||||
return AttnForwardMethod.MLA
|
|
||||||
else:
|
|
||||||
return AttnForwardMethod.MHA
|
|
||||||
else:
|
else:
|
||||||
return AttnForwardMethod.MLA
|
return AttnForwardMethod.MLA
|
||||||
|
|
||||||
|
|||||||
Reference in New Issue
Block a user