From 33ed29a0ee237a0e8f8d8231748fdfbc85b9b9f6 Mon Sep 17 00:00:00 2001 From: YAMY <74099316+YAMY1234@users.noreply.github.com> Date: Mon, 31 Aug 2026 22:00:50 -0700 Subject: [PATCH] test: update hybrid attention runner fixtures (#37345) --- test/registered/attention/test_trtllm_mha_graph_metadata.py | 1 + test/registered/unit/layers/attention/test_verify_mask.py | 1 + .../model_runner_components/test_attention_backend_setup.py | 1 + test/registered/unit/spec/test_dflash_overlap_hostsync.py | 1 + 4 files changed, 4 insertions(+) diff --git a/test/registered/attention/test_trtllm_mha_graph_metadata.py b/test/registered/attention/test_trtllm_mha_graph_metadata.py index 6d46cbe17..facd9d180 100644 --- a/test/registered/attention/test_trtllm_mha_graph_metadata.py +++ b/test/registered/attention/test_trtllm_mha_graph_metadata.py @@ -162,6 +162,7 @@ def test_hybrid_wrappers_forward_in_graph_hook(): kv_cache_dtype=torch.bfloat16, token_to_kv_pool=None, req_to_token_pool=None, + kv_index_translator=None, server_args=SimpleNamespace(speculative_attention_mode="decode"), model_config=SimpleNamespace(context_len=2048), ), diff --git a/test/registered/unit/layers/attention/test_verify_mask.py b/test/registered/unit/layers/attention/test_verify_mask.py index bd8e13050..e829eea26 100644 --- a/test/registered/unit/layers/attention/test_verify_mask.py +++ b/test/registered/unit/layers/attention/test_verify_mask.py @@ -148,6 +148,7 @@ def _make_hybrid_backend(speculative_attention_mode, prefill_mask, decode_mask): kv_cache_dtype=None, token_to_kv_pool=object(), req_to_token_pool=object(), + kv_index_translator=None, server_args=SimpleNamespace( speculative_attention_mode=speculative_attention_mode ), diff --git a/test/registered/unit/model_executor/model_runner_components/test_attention_backend_setup.py b/test/registered/unit/model_executor/model_runner_components/test_attention_backend_setup.py index f7a197ae0..ec346140b 100644 --- a/test/registered/unit/model_executor/model_runner_components/test_attention_backend_setup.py +++ b/test/registered/unit/model_executor/model_runner_components/test_attention_backend_setup.py @@ -37,6 +37,7 @@ def test_split_full_attention_applies_model_wrapper_once(): kv_cache_dtype=None, token_to_kv_pool=object(), req_to_token_pool=object(), + kv_index_translator=None, init_new_workspace=None, ) wrapper_inputs = [] diff --git a/test/registered/unit/spec/test_dflash_overlap_hostsync.py b/test/registered/unit/spec/test_dflash_overlap_hostsync.py index 0b5cd9c4d..c9545234a 100644 --- a/test/registered/unit/spec/test_dflash_overlap_hostsync.py +++ b/test/registered/unit/spec/test_dflash_overlap_hostsync.py @@ -235,6 +235,7 @@ class TestHybridNeedsCpuSeqLens(CustomTestCase): kv_cache_dtype=torch.bfloat16, token_to_kv_pool=None, req_to_token_pool=None, + kv_index_translator=None, model_config=SimpleNamespace(context_len=2048), ) # The backend takes the mode from the published configuration, not from