Fix TRTLLM MHA routing for draft extend (#24856)
This commit is contained in:
@@ -848,10 +848,7 @@ class TRTLLMHAAttnBackend(FlashInferAttnBackend):
|
|||||||
|
|
||||||
page_table = self._get_layer_page_table(layer, forward_batch)
|
page_table = self._get_layer_page_table(layer, forward_batch)
|
||||||
|
|
||||||
if (
|
if forward_batch.forward_mode.is_target_verify():
|
||||||
forward_batch.forward_mode.is_target_verify()
|
|
||||||
or forward_batch.forward_mode.is_draft_extend_v2()
|
|
||||||
):
|
|
||||||
o = flashinfer.decode.trtllm_batch_decode_with_kv_cache(
|
o = flashinfer.decode.trtllm_batch_decode_with_kv_cache(
|
||||||
query=q,
|
query=q,
|
||||||
kv_cache=kv_cache,
|
kv_cache=kv_cache,
|
||||||
|
|||||||
Reference in New Issue
Block a user