From d21c31f6814d947fd4edc5cd3ed90ba510b16ffd Mon Sep 17 00:00:00 2001 From: fatSheep <50252876+00fish0@users.noreply.github.com> Date: Wed, 10 Jun 2026 11:06:50 +0800 Subject: [PATCH] fix: forward update_mamba_state_after_mtp_verify in HybridAttnBackend (#25883) --- .../sglang/srt/layers/attention/hybrid_attn_backend.py | 10 ++++++++++ 1 file changed, 10 insertions(+) diff --git a/python/sglang/srt/layers/attention/hybrid_attn_backend.py b/python/sglang/srt/layers/attention/hybrid_attn_backend.py index 92e354dbe..8b280260d 100644 --- a/python/sglang/srt/layers/attention/hybrid_attn_backend.py +++ b/python/sglang/srt/layers/attention/hybrid_attn_backend.py @@ -139,6 +139,16 @@ class HybridAttnBackend(AttentionBackend): backend = self._select_backend(forward_batch.forward_mode) return backend.get_indexer_metadata(layer_id, forward_batch) + def update_mamba_state_after_mtp_verify(self, *args, **kwargs): + # Forward to whichever sub-backend handled target_verify, since its inner + # linear_attn_backend.forward_metadata holds the mamba_cache_indices the + # method consumes. Mirrors _select_backend's target_verify branch. + if self.model_runner.server_args.speculative_attention_mode == "decode": + backend = self.decode_backend + else: + backend = self.prefill_backend + return backend.update_mamba_state_after_mtp_verify(*args, **kwargs) + def forward( self, q: torch.Tensor = None,