[Kernel] Reclassify kernel tests by ops group + move helpers out of the package (RFC #29630) (#32128)

Co-authored-by: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
Xiaoyu Zhang
2026-07-23 12:18:27 +08:00
committed by GitHub
co-authored by Claude Opus 4.8
parent a2935ce329
commit 2d1a7be8c4
205 changed files with 204 additions and 173 deletions
@@ -7,7 +7,10 @@ import pytest
import torch
import triton
from sglang.kernels.jit.tests.deepseek_v4.common import (
from sglang.kernels.ops.attention.dsv4 import compress_forward
from sglang.srt.utils import get_device
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.kernels.deepseek_v4.common import (
LegacyContext,
PagedContext,
make_legacy_context,
@@ -15,9 +18,6 @@ from sglang.kernels.jit.tests.deepseek_v4.common import (
make_state_pool,
to_seq_extend,
)
from sglang.kernels.ops.attention.dsv4 import compress_forward
from sglang.srt.utils import get_device
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
register_cuda_ci(est_time=30, stage="base-b-kernel-unit", runner_config="1-gpu-large")
register_amd_ci(est_time=30, suite="nightly-amd-kernel-1-gpu", nightly=True)
@@ -7,7 +7,10 @@ import pytest
import torch
import triton
from sglang.kernels.jit.tests.deepseek_v4.common import (
from sglang.kernels.ops.attention.dsv4 import compress_forward
from sglang.srt.utils import get_device
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.kernels.deepseek_v4.common import (
LegacyContext,
PagedContext,
make_legacy_context,
@@ -15,9 +18,6 @@ from sglang.kernels.jit.tests.deepseek_v4.common import (
make_state_pool,
to_seq_extend,
)
from sglang.kernels.ops.attention.dsv4 import compress_forward
from sglang.srt.utils import get_device
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
register_cuda_ci(est_time=30, stage="base-b-kernel-unit", runner_config="1-gpu-large")
register_amd_ci(est_time=30, suite="nightly-amd-kernel-1-gpu", nightly=True)
@@ -89,16 +89,16 @@ from typing import Callable, Iterable, Literal, Optional
import pytest
import torch
from sglang.kernels.jit.tests.deepseek_v4.common import (
make_legacy_context,
to_seq_extend,
)
from sglang.kernels.ops.attention.dsv4 import (
CompressorDecodePlan,
CompressorPrefillPlan,
compress_forward,
)
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.kernels.deepseek_v4.common import (
make_legacy_context,
to_seq_extend,
)
from sglang.utils import is_in_ci
register_cuda_ci(est_time=30, stage="base-b-kernel-unit", runner_config="1-gpu-large")
@@ -28,7 +28,6 @@ import torch
import torch.distributed as dist
import sglang.srt.distributed.parallel_state as ps
from sglang.kernels.jit.tests.utils import multigpu_pytest_main
from sglang.kernels.jit.utils import cache_once, get_ci_test_range
from sglang.kernels.ops.communication.all_reduce import (
AllReduceAlgo,
@@ -39,6 +38,7 @@ from sglang.srt.distributed.device_communicators.custom_all_reduce_v2 import (
CustomAllReduceV2,
)
from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.kernels.utils import multigpu_pytest_main
register_cuda_ci(
est_time=300,
@@ -26,13 +26,13 @@ import torch
import torch.distributed as dist
import sglang.srt.distributed.parallel_state as ps
from sglang.kernels.jit.tests.utils import multigpu_pytest_main
from sglang.kernels.jit.utils import cache_once, get_ci_test_range
from sglang.srt.distributed.device_communicators.triton_symm_mem_ag import (
all_gather_inner,
create_state,
)
from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.kernels.utils import multigpu_pytest_main
register_cuda_ci(est_time=240, stage="extra-b", runner_config="8-gpu-h200")
# Nightly is not redundant here: it sets SGLANG_JIT_KERNEL_RUN_FULL_TESTS=1 to expand get_ci_test_range sweeps.
@@ -14,7 +14,6 @@ import torch.distributed as dist
import triton
import sglang.srt.distributed.parallel_state as ps
from sglang.kernels.jit.tests.utils import multigpu_pytest_main
from sglang.kernels.jit.utils import cache_once
from sglang.kernels.ops.communication.all_reduce import (
fused_parallel_qknorm,
@@ -26,6 +25,7 @@ from sglang.srt.distributed.device_communicators.custom_all_reduce_v2 import (
CustomAllReduceV2,
)
from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.kernels.utils import multigpu_pytest_main
register_cuda_ci(
est_time=300,

Some files were not shown because too many files have changed in this diff Show More