From 125f75db720e399ac7966d0ac2d812c6a87b73a9 Mon Sep 17 00:00:00 2001 From: "Ethan (Yusheng) Su" Date: Thu, 30 Apr 2026 01:11:45 -0700 Subject: [PATCH] fix(lora): avoid CUDA graph-breaking scalar assignment in seg_indptr (#23738) --- python/sglang/srt/lora/backend/triton_backend.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/python/sglang/srt/lora/backend/triton_backend.py b/python/sglang/srt/lora/backend/triton_backend.py index c3b8838e9..4c4a8b618 100644 --- a/python/sglang/srt/lora/backend/triton_backend.py +++ b/python/sglang/srt/lora/backend/triton_backend.py @@ -203,7 +203,7 @@ class TritonLoRABackend(BaseLoRABackend): return sgemm.permutation[:bs] = perm sgemm.seg_lens[:] = seg_lens - sgemm.seg_indptr[0] = 0 + sgemm.seg_indptr[0:1].zero_() torch.cumsum(sgemm.seg_lens, dim=0, out=sgemm.seg_indptr[1:]) sgemm.max_len = bs sgemm.lora_ranks[:mlpb] = bi.lora_ranks[:mlpb]