From d717e926c1e846de06cbe4712bf9c00e51079dfb Mon Sep 17 00:00:00 2001 From: jiayisunx Date: Thu, 25 Jun 2026 14:37:19 +0800 Subject: [PATCH] fix(runner): prevent eager token buffer under-allocation (#28894) --- python/sglang/srt/model_executor/runner/eager_runner.py | 6 +----- 1 file changed, 1 insertion(+), 5 deletions(-) diff --git a/python/sglang/srt/model_executor/runner/eager_runner.py b/python/sglang/srt/model_executor/runner/eager_runner.py index 8a61fe40f..c4b24e8dc 100644 --- a/python/sglang/srt/model_executor/runner/eager_runner.py +++ b/python/sglang/srt/model_executor/runner/eager_runner.py @@ -100,11 +100,7 @@ class EagerRunner(BaseRunner): max_bs = ceil_align(max_bs, self.attn_tp_size) max_bs = ceil_align(max_bs, get_cp_padding_align_size()) - prefill_ceiling = ( - sa.max_prefill_buffer_tokens() - if sa.chunked_prefill_size and sa.chunked_prefill_size > 0 - else mr.max_total_num_tokens - ) + prefill_ceiling = max(mr.max_total_num_tokens, sa.max_prefill_buffer_tokens()) max_num_token = max(prefill_ceiling, max_bs * num_tokens_per_bs) if require_mlp_sync(sa): max_num_token = ceil_align(max_num_token, self.attn_tp_size)