[AMD] remove redundancy H2D op in aiter attention backend (#19416)
Co-authored-by: root <root@mia1-p01-g28.mia.tensorwave.lan>
This commit is contained in:
@@ -1487,9 +1487,7 @@ class AiterAttnBackend(AttentionBackend):
|
|||||||
k = k.to(fp8_dtype)
|
k = k.to(fp8_dtype)
|
||||||
if v.dtype != fp8_dtype:
|
if v.dtype != fp8_dtype:
|
||||||
v = v.to(fp8_dtype)
|
v = v.to(fp8_dtype)
|
||||||
one_scale = torch.tensor(
|
one_scale = torch.ones((), dtype=torch.float32, device=q.device)
|
||||||
1.0, dtype=torch.float32, device=q.device
|
|
||||||
)
|
|
||||||
|
|
||||||
kv_indptr_asm = qo_indptr
|
kv_indptr_asm = qo_indptr
|
||||||
kv_indices_asm = self.forward_metadata.fp8_prefill_kv_indices
|
kv_indices_asm = self.forward_metadata.fp8_prefill_kv_indices
|
||||||
|
|||||||
Reference in New Issue
Block a user