[Spec] Remove dead kernel params; fix stale comment in trtllm_mla (#25010)
This commit is contained in:
@@ -52,7 +52,6 @@ def fused_recurrent_kda_fwd(
|
||||
inplace_final_state: bool = True,
|
||||
cu_seqlens: torch.LongTensor | None = None,
|
||||
# ssm_state_indices: torch.Tensor | None = None,
|
||||
num_accepted_tokens: torch.Tensor | None = None,
|
||||
use_qk_l2norm_in_kernel: bool = False,
|
||||
) -> tuple[torch.Tensor, torch.Tensor]:
|
||||
B, T, H, K, V = *k.shape, v.shape[-1]
|
||||
@@ -92,7 +91,6 @@ def fused_recurrent_kda_fwd(
|
||||
ht=final_state,
|
||||
cu_seqlens=cu_seqlens,
|
||||
# ssm_state_indices=ssm_state_indices,
|
||||
# num_accepted_tokens=num_accepted_tokens,
|
||||
scale=scale,
|
||||
# N=N,
|
||||
T=T,
|
||||
@@ -155,7 +153,6 @@ def fused_recurrent_kda(
|
||||
inplace_final_state=inplace_final_state,
|
||||
cu_seqlens=cu_seqlens,
|
||||
# ssm_state_indices=ssm_state_indices,
|
||||
num_accepted_tokens=None,
|
||||
use_qk_l2norm_in_kernel=use_qk_l2norm_in_kernel,
|
||||
)
|
||||
return o, final_state
|
||||
|
||||
@@ -18,8 +18,6 @@ def _fused_mamba_state_scatter_with_mask_kernel(
|
||||
# Raw index arrays (before index_select)
|
||||
dst_indices_raw_ptr, # [total_requests] - state_indices_tensor
|
||||
step_indices_raw_ptr, # [total_requests] - accepted_steps or mamba_steps_to_track
|
||||
# Total number of requests
|
||||
total_requests,
|
||||
elem_per_entry: tl.constexpr,
|
||||
src_layer_stride,
|
||||
src_req_stride,
|
||||
@@ -176,7 +174,6 @@ def fused_mamba_state_scatter_with_mask(
|
||||
dst,
|
||||
dst_indices_raw,
|
||||
step_indices_raw,
|
||||
total_requests,
|
||||
elem_per_entry,
|
||||
src_layer_stride,
|
||||
src_req_stride,
|
||||
|
||||
@@ -59,7 +59,7 @@ def pad_draft_extend_query_kernel(
|
||||
q_ptr, # Input query tensor [total_seq_len, num_heads, head_dim]
|
||||
padded_q_ptr, # Output padded query tensor [batch_size, max_seq_len, num_heads, head_dim]
|
||||
seq_lens_q_ptr, # Sequence lengths for each sequence [batch_size]
|
||||
cumsum_ptr, # Cumulative sum of accept lengths [batch_size + 1]
|
||||
cumsum_ptr, # Cumulative sum of sequence lengths [batch_size + 1]
|
||||
batch_size,
|
||||
max_seq_len,
|
||||
num_heads,
|
||||
@@ -78,7 +78,7 @@ def pad_draft_extend_query_kernel(
|
||||
if batch_id >= batch_size:
|
||||
return
|
||||
|
||||
# Load accept length for this batch
|
||||
# Load sequence length for this batch
|
||||
seq_len = tl.load(seq_lens_q_ptr + batch_id)
|
||||
|
||||
if seq_pos >= seq_len:
|
||||
|
||||
Reference in New Issue
Block a user