From 32f1259c9179a5993ec4660e2772360ca48dcf02 Mon Sep 17 00:00:00 2001 From: fzyzcjy <5236035+fzyzcjy@users.noreply.github.com> Date: Tue, 19 May 2026 09:20:21 +0800 Subject: [PATCH] Confine max-prefix-len to where it is used and drop the leftover variable (#25719) --- python/sglang/srt/managers/schedule_batch.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/python/sglang/srt/managers/schedule_batch.py b/python/sglang/srt/managers/schedule_batch.py index ffd77cc4d..e32c77b05 100755 --- a/python/sglang/srt/managers/schedule_batch.py +++ b/python/sglang/srt/managers/schedule_batch.py @@ -1022,11 +1022,11 @@ class Req(ReqDllmMixin): max_prefix_len = min(max_prefix_len, self.logprob_start_len) max_prefix_len = max(max_prefix_len, 0) token_ids = self.fill_ids[:max_prefix_len] + del max_prefix_len # Disable prefix caching when embed overrides are present: same token IDs # with different override vectors must not share cached KV values. if self.positional_embed_overrides is not None: - max_prefix_len = 0 token_ids = [] if tree_cache is not None: