[Spec v2] Use decode kernel for TRT-LLM MHA draft extend (#28241)
This commit is contained in:
@@ -925,7 +925,10 @@ class TRTLLMHAAttnBackend(FlashInferAttnBackend):
|
|||||||
|
|
||||||
page_table = self._get_layer_page_table(layer, forward_batch)
|
page_table = self._get_layer_page_table(layer, forward_batch)
|
||||||
|
|
||||||
if forward_batch.forward_mode.is_target_verify():
|
if (
|
||||||
|
forward_batch.forward_mode.is_target_verify()
|
||||||
|
or forward_batch.forward_mode.is_draft_extend_v2()
|
||||||
|
):
|
||||||
o = flashinfer.decode.trtllm_batch_decode_with_kv_cache(
|
o = flashinfer.decode.trtllm_batch_decode_with_kv_cache(
|
||||||
query=q,
|
query=q,
|
||||||
kv_cache=kv_cache,
|
kv_cache=kv_cache,
|
||||||
|
|||||||
Reference in New Issue
Block a user