[Kernel] Sweep missed dedicated kernels into kernels.ops (moe/quant siblings + dspark) (RFC #29630) (#32160)

Co-authored-by: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
Xiaoyu Zhang
2026-07-23 17:07:16 +08:00
committed by GitHub
co-authored by Claude Opus 4.8
parent f35411ee81
commit 62aa85d9aa
25 changed files with 68 additions and 68 deletions
+3 -3
View File
@@ -3361,7 +3361,7 @@ class MHATokenToKVPoolMXFP8(MHATokenToKVPool):
# payload and the interleaved UE8M0 scales.
if not self.mxfp8_sf_interleaved or cache_k.dtype == self.store_dtype:
raise ValueError("MXFP8 KV cache requires K and V scale tensors.")
from sglang.srt.layers.quantization.mxfp8_quant import quant_store_kv_mxfp8
from sglang.kernels.ops.quantization.mxfp8_quant import quant_store_kv_mxfp8
quant_store_kv_mxfp8(
cache_k,
@@ -3394,7 +3394,7 @@ class MHATokenToKVPoolMXFP8(MHATokenToKVPool):
"""Write per-token UE8M0 K/V scales — interleaved into the FA4
BlockScaledBasicChunk layout for page_size==128, flat otherwise."""
if self.mxfp8_sf_interleaved:
from sglang.srt.layers.quantization.mxfp8_interleave_sf import (
from sglang.kernels.ops.quantization.mxfp8_interleave_sf import (
store_sf_interleaved,
)
@@ -3436,7 +3436,7 @@ class MHATokenToKVPoolMXFP8(MHATokenToKVPool):
# scale rows must travel with their fp8 payload or dequant reads
# mismatched exponents.
if self.mxfp8_sf_interleaved:
from sglang.srt.layers.quantization.mxfp8_interleave_sf import (
from sglang.kernels.ops.quantization.mxfp8_interleave_sf import (
store_sf_interleaved,
)