[Spec v2] Use decode kernel for TRT-LLM MHA draft extend (#28241)
This commit is contained in:
@@ -925,7 +925,10 @@ class TRTLLMHAAttnBackend(FlashInferAttnBackend):
|
||||
|
||||
page_table = self._get_layer_page_table(layer, forward_batch)
|
||||
|
||||
if forward_batch.forward_mode.is_target_verify():
|
||||
if (
|
||||
forward_batch.forward_mode.is_target_verify()
|
||||
or forward_batch.forward_mode.is_draft_extend_v2()
|
||||
):
|
||||
o = flashinfer.decode.trtllm_batch_decode_with_kv_cache(
|
||||
query=q,
|
||||
kv_cache=kv_cache,
|
||||
|
||||
Reference in New Issue
Block a user