[Bugfix] Lazy-import CuteDSL KDA kernel to fix AMD/ROCm startup crash (#21428)
This commit is contained in:
@@ -3,9 +3,6 @@ from typing import Tuple, Union
|
|||||||
import torch
|
import torch
|
||||||
|
|
||||||
from sglang.srt.layers.attention.hybrid_linear_attn_backend import MambaAttnBackendBase
|
from sglang.srt.layers.attention.hybrid_linear_attn_backend import MambaAttnBackendBase
|
||||||
from sglang.srt.layers.attention.linear.kernels.kda_cutedsl import (
|
|
||||||
CuteDSLKDAKernel,
|
|
||||||
)
|
|
||||||
from sglang.srt.layers.attention.linear.kernels.kda_triton import TritonKDAKernel
|
from sglang.srt.layers.attention.linear.kernels.kda_triton import TritonKDAKernel
|
||||||
from sglang.srt.layers.attention.linear.utils import (
|
from sglang.srt.layers.attention.linear.utils import (
|
||||||
LinearAttnKernelBackend,
|
LinearAttnKernelBackend,
|
||||||
@@ -50,6 +47,10 @@ class KDAKernelDispatcher:
|
|||||||
elif decode_backend.is_cutedsl():
|
elif decode_backend.is_cutedsl():
|
||||||
if not is_cuda():
|
if not is_cuda():
|
||||||
raise ValueError("KDA CuTe DSL backend requires CUDA")
|
raise ValueError("KDA CuTe DSL backend requires CUDA")
|
||||||
|
from sglang.srt.layers.attention.linear.kernels.kda_cutedsl import (
|
||||||
|
CuteDSLKDAKernel,
|
||||||
|
)
|
||||||
|
|
||||||
self.decode_kernel = CuteDSLKDAKernel()
|
self.decode_kernel = CuteDSLKDAKernel()
|
||||||
else:
|
else:
|
||||||
raise ValueError(
|
raise ValueError(
|
||||||
|
|||||||
Reference in New Issue
Block a user