From 78eef34356dd47bd575478d0b5b5b41a01f68475 Mon Sep 17 00:00:00 2001 From: silencejade <222910030+silencejade@users.noreply.github.com> Date: Sat, 29 Aug 2026 15:03:05 +0800 Subject: [PATCH] =?UTF-8?q?[NPU]=20[BugFix]=20Fix=20discontinuous=20input?= =?UTF-8?q?=20for=20FIA=20operator=20in=20GLM4.7=E2=80=91Flash=20(#36170)?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- .../sglang/srt/hardware_backend/npu/attention/ascend_backend.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/python/sglang/srt/hardware_backend/npu/attention/ascend_backend.py b/python/sglang/srt/hardware_backend/npu/attention/ascend_backend.py index ecbc8a3c2..88e6ce4f7 100644 --- a/python/sglang/srt/hardware_backend/npu/attention/ascend_backend.py +++ b/python/sglang/srt/hardware_backend/npu/attention/ascend_backend.py @@ -1815,7 +1815,7 @@ class AscendAttnBackend(AttentionBackend): torch.ops.npu.npu_fused_infer_attention_score( q[None, q_len_offset : q_len_offset + q_len], k[None, q_len_offset : q_len_offset + q_len], - v[None, q_len_offset : q_len_offset + q_len], + v[None, q_len_offset : q_len_offset + q_len].contiguous(), num_heads=layer.tp_q_head_num, num_key_value_heads=layer.tp_k_head_num, input_layout="BSND", # todo, TND not supports q_heads!=k_heads