fix(lora): avoid CUDA graph-breaking scalar assignment in seg_indptr (#23738)
This commit is contained in:
@@ -203,7 +203,7 @@ class TritonLoRABackend(BaseLoRABackend):
|
|||||||
return
|
return
|
||||||
sgemm.permutation[:bs] = perm
|
sgemm.permutation[:bs] = perm
|
||||||
sgemm.seg_lens[:] = seg_lens
|
sgemm.seg_lens[:] = seg_lens
|
||||||
sgemm.seg_indptr[0] = 0
|
sgemm.seg_indptr[0:1].zero_()
|
||||||
torch.cumsum(sgemm.seg_lens, dim=0, out=sgemm.seg_indptr[1:])
|
torch.cumsum(sgemm.seg_lens, dim=0, out=sgemm.seg_indptr[1:])
|
||||||
sgemm.max_len = bs
|
sgemm.max_len = bs
|
||||||
sgemm.lora_ranks[:mlpb] = bi.lora_ranks[:mlpb]
|
sgemm.lora_ranks[:mlpb] = bi.lora_ranks[:mlpb]
|
||||||
|
|||||||
Reference in New Issue
Block a user