diff --git a/python/sglang/srt/layers/attention/linear/kda_backend.py b/python/sglang/srt/layers/attention/linear/kda_backend.py index a5f9ba2ae..fb27462b0 100644 --- a/python/sglang/srt/layers/attention/linear/kda_backend.py +++ b/python/sglang/srt/layers/attention/linear/kda_backend.py @@ -3,9 +3,6 @@ from typing import Tuple, Union import torch from sglang.srt.layers.attention.hybrid_linear_attn_backend import MambaAttnBackendBase -from sglang.srt.layers.attention.linear.kernels.kda_cutedsl import ( - CuteDSLKDAKernel, -) from sglang.srt.layers.attention.linear.kernels.kda_triton import TritonKDAKernel from sglang.srt.layers.attention.linear.utils import ( LinearAttnKernelBackend, @@ -50,6 +47,10 @@ class KDAKernelDispatcher: elif decode_backend.is_cutedsl(): if not is_cuda(): raise ValueError("KDA CuTe DSL backend requires CUDA") + from sglang.srt.layers.attention.linear.kernels.kda_cutedsl import ( + CuteDSLKDAKernel, + ) + self.decode_kernel = CuteDSLKDAKernel() else: raise ValueError(