From 92f28e9ba80b81bba9f82a4c0a69dccf81ff581c Mon Sep 17 00:00:00 2001 From: Todobe <43903496+Todobe@users.noreply.github.com> Date: Thu, 23 Apr 2026 01:06:58 +0800 Subject: [PATCH] [NPU]Fix GLM-4.7-Flash failed on NPU (#22509) --- python/sglang/srt/models/deepseek_v2.py | 2 +- python/sglang/srt/models/glm4_moe_lite.py | 4 +++- 2 files changed, 4 insertions(+), 2 deletions(-) diff --git a/python/sglang/srt/models/deepseek_v2.py b/python/sglang/srt/models/deepseek_v2.py index 8024ad25b..4d49cd03b 100644 --- a/python/sglang/srt/models/deepseek_v2.py +++ b/python/sglang/srt/models/deepseek_v2.py @@ -1753,7 +1753,7 @@ class DeepseekV2DecoderLayer(nn.Module): hidden_states, residual, forward_batch, - self._gfx95_quant_format, + getattr(self, "_gfx95_quant_format", ""), ) hidden_states = self.self_attn( diff --git a/python/sglang/srt/models/glm4_moe_lite.py b/python/sglang/srt/models/glm4_moe_lite.py index 5b08f1f45..80a035162 100644 --- a/python/sglang/srt/models/glm4_moe_lite.py +++ b/python/sglang/srt/models/glm4_moe_lite.py @@ -20,7 +20,6 @@ from typing import Iterable, Optional, Tuple import torch import torch.nn.functional as F -from sgl_kernel import dsv3_router_gemm from torch import nn from transformers import PretrainedConfig @@ -81,6 +80,9 @@ from sglang.srt.utils.hf_transformers_utils import get_rope_config _is_cuda = is_cuda() _device_sm = get_device_sm() +if _is_cuda: + from sgl_kernel import dsv3_router_gemm + logger = logging.getLogger(__name__)