From 90eb894564ae1016c00775bc33d81024d42bd64e Mon Sep 17 00:00:00 2001 From: ZeyuanChen2000 <806126546@qq.com> Date: Sat, 30 May 2026 17:10:58 +0800 Subject: [PATCH] [NPU] fix model llava-onevision-qwen2-7b-ov torch compiles error in npu case (#26573) --- python/sglang/srt/sampling/penaltylib/repetition_penalty.py | 6 ++++-- 1 file changed, 4 insertions(+), 2 deletions(-) diff --git a/python/sglang/srt/sampling/penaltylib/repetition_penalty.py b/python/sglang/srt/sampling/penaltylib/repetition_penalty.py index fd03fb2b5..b9ad94f39 100644 --- a/python/sglang/srt/sampling/penaltylib/repetition_penalty.py +++ b/python/sglang/srt/sampling/penaltylib/repetition_penalty.py @@ -1,10 +1,12 @@ import torch from sglang.srt.sampling.penaltylib.orchestrator import _BatchedPenalizer -from sglang.srt.utils import get_compiler_backend +from sglang.srt.utils import get_compiler_backend, is_npu + +_is_npu = is_npu() -@torch.compile(dynamic=True, backend=get_compiler_backend()) +@torch.compile(dynamic=True, backend=get_compiler_backend(), disable=_is_npu) def apply_scaling_penalties(logits, scaling_penalties): logits[:] = torch.where( logits < 0,