diff --git a/python/sglang/kernels/ops/speculative/__init__.py b/python/sglang/kernels/ops/speculative/__init__.py index 2f48798ae..827fac9e8 100644 --- a/python/sglang/kernels/ops/speculative/__init__.py +++ b/python/sglang/kernels/ops/speculative/__init__.py @@ -15,7 +15,7 @@ _TRITON_KERNELS = [ ("eagle", "fill_bonus_tokens"), ("eagle", "fill_accept_out_cache_loc"), ("gather_spec_extras", "gather_spec_extras"), - ("multi_layer_eagle", "rotate_input_ids_triton"), + ("multi_layer_eagle", "rotate_input_ids"), ("spec_tree", "sgl_build_tree_kernel_efficient_triton"), ("spec_tree", "verify_tree_greedy_kernel_triton"), ("topk1", "draft_topk1_postprocess"), diff --git a/python/sglang/kernels/ops/speculative/multi_layer_eagle.py b/python/sglang/kernels/ops/speculative/multi_layer_eagle.py index ebdc10dc4..b87e6c132 100644 --- a/python/sglang/kernels/ops/speculative/multi_layer_eagle.py +++ b/python/sglang/kernels/ops/speculative/multi_layer_eagle.py @@ -76,7 +76,7 @@ def rotate_input_ids( batch_size = extend_seq_lens.shape[0] - # rotate_input_ids_triton skipped: batch_size=0 (empty extend_seq_lens). + # rotate_input_ids kernel skipped: batch_size=0 (empty extend_seq_lens). # This is expected when a DP rank has no requests. # TODO: @iforgetmyname Remove NPU-specific guard after triton-ascend fixes zero-sized grid kernel launch abort if batch_size == 0 and _is_npu: