diff --git a/python/sglang/srt/models/deepseek_v2.py b/python/sglang/srt/models/deepseek_v2.py index 8024ad25b..4d49cd03b 100644 --- a/python/sglang/srt/models/deepseek_v2.py +++ b/python/sglang/srt/models/deepseek_v2.py @@ -1753,7 +1753,7 @@ class DeepseekV2DecoderLayer(nn.Module): hidden_states, residual, forward_batch, - self._gfx95_quant_format, + getattr(self, "_gfx95_quant_format", ""), ) hidden_states = self.self_attn( diff --git a/python/sglang/srt/models/glm4_moe_lite.py b/python/sglang/srt/models/glm4_moe_lite.py index 5b08f1f45..80a035162 100644 --- a/python/sglang/srt/models/glm4_moe_lite.py +++ b/python/sglang/srt/models/glm4_moe_lite.py @@ -20,7 +20,6 @@ from typing import Iterable, Optional, Tuple import torch import torch.nn.functional as F -from sgl_kernel import dsv3_router_gemm from torch import nn from transformers import PretrainedConfig @@ -81,6 +80,9 @@ from sglang.srt.utils.hf_transformers_utils import get_rope_config _is_cuda = is_cuda() _device_sm = get_device_sm() +if _is_cuda: + from sgl_kernel import dsv3_router_gemm + logger = logging.getLogger(__name__)