diff --git a/python/sglang/srt/layers/attention/hybrid_linear_attn_backend.py b/python/sglang/srt/layers/attention/hybrid_linear_attn_backend.py index 3c601d1d5..5e2f46ba5 100644 --- a/python/sglang/srt/layers/attention/hybrid_linear_attn_backend.py +++ b/python/sglang/srt/layers/attention/hybrid_linear_attn_backend.py @@ -841,6 +841,10 @@ class HybridLinearAttnBackend(AttentionBackend): for attn_backend in self.attn_backend_list: attn_backend.init_forward_metadata_in_graph(forward_batch) + def on_after_cuda_graph_warmup(self): + for attn_backend in self.attn_backend_list: + attn_backend.on_after_cuda_graph_warmup() + def init_forward_metadata(self, forward_batch: ForwardBatch): if forward_batch.forward_mode.is_draft_extend_v2(): # DRAFT_EXTEND_V2 runs only full-attn layers in the draft model; skip